Кими К3 раскрыл множество секретов, но его важнейшая «инфра» трудно поддаётся копированию: инфраструктурный инжиниринг Муншот AI как реальный ров в экономике open-source моделей

Kimi K3 Ai инфраструктура Mfu экспертный параллелизм обучение инженерия pandaily.com

Изучите отчет Kimi K3: детали инфраструктуры MoonEP, KDA и AttnRes. Поймите, что инженерный опыт в MFU, экспертном параллелизме и общих экспертах — истинное преимущество, а не архитектура.

Технический отчет Kimi K3 раскрыл детали архитектуры модели и инфраструктуры, но самый ценный инженерный опыт невозможно скопировать из статьи. AI Infra — это операционная система между оборудованием и приложениями. Когда вендоры развертывают собственные модели, затраты оказываются в несколько раз ниже, чем при стороннем развертывании, что опирается на разрыв в опыте работы с инфраструктурой. Инженер OpenAI Вэн Цзяи отметил, что основное различие в обучении — это инфраструктура, и инженеры в основном исправляют ошибки инфраструктуры. По мере конвергенции архитектур и снижения барьеров воспроизведения с помощью дистилляции, инженерная работа с инфраструктурой дифференцирует стоимость обучения, эффективность развертывания и стабильность. Сто компаний, развертывающих Kimi K3, могут достичь ста различных показателей эффективности.

Ошибки инфраструктуры включают как традиционные ошибки, влияющие на корректность и стабильность, так и системные проблемы, не влияющие на математическую корректность, но вызывающие ожидание GPU, потери памяти, блокировку связи и снижение пропускной способности. Коэффициент использования FLOPs модели (MFU) измеряет эффективность обучения как отношение наблюдаемой пропускной способности к теоретическому максимуму. Публично проверяемые крупномасштабные случаи обучения показывают, что ByteDance MegaScale с MFU 55,2% является одним из самых высоких показателей. Крайний контрпример: xAI с примерно 550 000 GPU H100, согласно внутренним запискам, достиг лишь 11% MFU, что значительно ниже отраслевой нормы 35–45% и показателей конкурентов Meta* (43%) и Google (46%). Более высокая эффективность обучения напрямую ведет к сокращению циклов обучения, снижению затрат, увеличению числа экспериментов и большему масштабу данных или модели.

Проектирование распределенной системы Kimi K3 использует классические методы параллелизации, включая конвейерный параллелизм, экспертный параллелизм и шардирование ZeRO. Конвейерный параллелизм распределяет слои модели по GPU с обработкой микропакетов для уменьшения времени простоя конвейера. Тензорный параллелизм разделяет матрицы весов и операции между GPU, требуя высокой пропускной способности межсоединений GPU. Примечательная деталь: слои MoE используют общих экспертов, реплицированных по рангам EP, то есть каждый GPU содержит идентичных общих экспертов плюс разных маршрутизированных экспертов, что позволяет общим экспертам поглощать общие признаки в данных. Механизмы архитектуры KDA и AttnRes сочетаются с соответствующей конструкцией инфраструктуры, а MoonEP решает уникальные задачи экспертного параллелизма для архитектур MoE. Более крупные модели выявляют проблемы, невидимые в малых моделях, поскольку ранее незамеченные вычислительные процессы или объекты памяти становятся значительными относительно емкости GPU при масштабировании.

Открытие весов демократизирует доступ к моделям, но не компетентность в инфраструктуре. Разрывы в стоимости развертывания в несколько раз создают структурное преимущество для разработчика в экономике обучения и инференса. Отчет — это одновременно обмен знаниями и сигнал конкуренции: архитектуру можно изучить, но инженерный опыт в масштабе 2,8 триллиона невозможно передать через документацию. Возможности моделей все больше становятся товаром, а превосходство в инфраструктуре — устойчивым рвом.

Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: