Компания Moonshot AI 27 июля опубликовала в открытом доступе модель Kimi K3 с 2,8 трлн параметров в архитектуре MoE, 896 маршрутизируемыми экспертами, 16 активными на токен, нативным зрением и контекстным окном в 100 тыс. токенов, что делает её крупнейшей моделью с открытыми весами в мире. По сравнению с предыдущим поколением K2.5 масштаб параметров K3 увеличился примерно в три раза, а вычислительная эффективность благодаря технологиям Kimi Delta Attention, Attention Residuals и MoonEP выросла в 2,5 раза при ограниченных вычислительных ресурсах.
Технический отчёт раскрывает ряд архитектурных инноваций. Гибридная структура внимания KDA + Gated MLA сочетает линейное внимание для эффективной обработки длинных контекстов и закрытое многоголовое латентное внимание для высококачественного локального представления. Механизм маршрутизации Stable LatentMoE решает проблему коллапса экспертов, распространённую при крупномасштабном обучении MoE, за счёт стабилизации динамики градиентов маршрутизатора. Схема обучения визуального энкодера MoonViT-V2 обеспечивает нативное мультимодальное понимание без отдельных адаптеров между зрением и языком. Модель охватывает измерения универсальных рассуждений, агентных и кодирующих агентных способностей в обучении и оценке, демонстрируя широту компетенций K3 за пределами чисто языковых задач.
Помимо самой модели, были открыты три инфраструктурные технологии. MoonEP — это высокопроизводительная библиотека коммуникаций для экспертно-параллельного обучения MoE, решающая проблему узкого места all-to-all, которое обычно ограничивает эффективность масштабирования MoE. FlashKDA предоставляет высокопроизводительное вычислительное ядро для Kimi Delta Attention: тесты показывают ускорение Prefill в 1,72–2,22 раза по сравнению с базовым flash-linear-attention на GPU H20. AgentEnv — это агентная песочница, разработанная совместно с KVCache.ai, поддерживающая быстрое создание снимков, восстановление и форки для крупномасштабных сред обучения агентов. Вместе эти инфраструктурные релизы снижают порог для воспроизведения и развития обучения моделей класса K3.
Открытый релиз имеет значительные экосистемные последствия. K3 соответствует или превосходит закрытые передовые модели, такие как GPT-5.6 и Claude Fable 5, по отдельным бенчмаркам, особенно в генерации фронтенд-кода, при этом на 40% дешевле Claude и на 70% дешевле Fable по ценам API. Лицензия с открытыми весами позволяет локальное развертывание и разработку пользовательских приложений без зависимости от API. Однако масштаб в 2,8 трлн параметров означает, что даже локальное развертывание требует значительного оборудования: как минимум 10 GPU класса GB300 только для загрузки модели, так что стоимость инфраструктуры вывода, а не плата за API, становится основным фактором при развертывании.
Релиз вызвал экосистемные эффекты. Платформа Alibaba Cloud Qianwen AI объявила о доступности K3. Компания Huawei объявила об адаптации Ascend «нулевого дня» для K3, что стало первой открытой моделью с триллионным уровнем параметров, работающей на отечественном оборудовании. Сообщество открытого кода получило доступ к весам модели, для воспроизведения которых ранее потребовались бы инвестиции в сотни миллионов долларов. Moonshot AI заявила, что инициатива по открытию исходного кода направлена на развитие экосистемы моделей с открытыми весами, снижая барьеры для развертывания и разработки для более широкого сообщества ИИ. Однако сразу после релиза было объявлено о приостановке подписки новых пользователей K3 из-за ограничений вычислительных мощностей, что подчёркивает напряжённость между идеалами открытого кода и реальностью обслуживания модели с 2,8 трлн параметров в масштабе.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




