Эксперты считают, что секрет успеха Kimi K3 — не в эксплуатации «Fable» от Anthropic

дистилляция ии китай Moonshot Nvidia обучение с подкреплением techcrunch.com

Эксперты сомневаются, что дистилляция объясняет мощь Kimi K3. Узнайте, почему обвинения США в краже технологий вызывают споры, и какую роль играют запрещенные чипы Nvidia и обучение с подкреплением.

«Крупномасштабная скрытая промышленная дистилляция, направленная на кражу запатентованных американских технологий и подрыв американских исследований, неприемлема», — написал Кратсиос на фоне сообщений об обсуждениях запрета китайских моделей с открытым весом, которые всколыхнули сектор ИИ. Moonshot не ответил на вопросы о своем процессе обучения, а Кратсиос не поделился дополнительными подробностями об источниках своих обвинений.

Твит Кратсиоса перекликался с комментариями министра финансов Скотта Бессента о том, что «мы находим водяные знаки наших американских больших языковых моделей на многих китайских моделях, и это неприемлемо». Неясно, из чего состоят эти водяные знаки, и Министерство финансов не ответило на запрос.

Однако эксперты скептически относятся к тому, что дистилляция — процесс опроса LLM для определения ее внутреннего устройства и копирования ее возможностей — является причиной продвинутых возможностей, которые демонстрирует Kimi K3.

«Я не думаю, что можно получить такую мощную модель так быстро сразу после Fable, занимаясь исключительно дистилляцией», — сказал TechCrunch Брейден Хэнкок, исследователь из Института Лауде и сооснователь Snorkel AI. «Честно говоря, просто нет времени, верно? Fable доступна публично только с 1 июля. Нельзя дистиллировать столько данных, обучить модель и выпустить ее за две недели».

«Я придерживаюсь мнения, что дистилляция со временем становится все менее эффективной, поскольку китайские модели приближаются к передовому рубежу, а режим обучения смещается в сторону [обучения с подкреплением]», — сказал Нейтан Ламберт, исследователь ИИ из Института искусственного интеллекта Аллена, в подкасте, выпущенном вчера. «Если бы это было так, каждый мог бы легко догнать GLM или K3, используя их данные для дистилляции. Но мы этого не наблюдаем и не увидим только за счет контролируемой донастройки».

Для выполнения дистилляции лаборатория должна систематически опрашивать целевую модель, чтобы генерировать данные, которые можно использовать для пост-обучения. Иногда это явно включает просьбу к модели сформулировать свою цепочку рассуждений, чтобы понять, как она решает задачи. В других случаях промпты и ответы модели используются для обучения новой модели в процессе, называемом контролируемой донастройкой, или SFT.

Именно этот процесс донастройки может привести к тому, что модель, якобы созданная третьей стороной, будет утверждать, что она — Claude. Донастройка — это то, где, по мнению Ламберта, «модель приобретает свои манеры».

Но Ламберт говорит, что преимущества SFT становятся менее важными по мере усложнения моделей. Для дистилляции возможностей, подобных Fable, вероятно, потребуются методы обучения с подкреплением. Во многих случаях это означает, что агент более крупной модели оценивает ответы меньшей модели и корректирует их на основе оценки.

Более продвинутые методы также требуют более значительной инфраструктуры. Крупные прогоны обучения с подкреплением могут потребовать десятков миллионов агентов. Использование API передовой лаборатории для этого «было бы безумно дорого и, вероятно, стало бы узким местом по времени, потому что эти модели довольно медленные и, честно говоря, могут даже не дать прироста производительности».

Вероятно, что предыдущие передовые модели могли внести вклад в Kimi; Anthropic публично обвинил Moonshot, DeepSeek и MiniMax в систематической дистилляции своих моделей в начале этого года. Anthropic заявил, что обнаружил миллионы обменов между своими моделями и пользователями, которых он идентифицировал в этих компаниях по IP-адресам и другим метаданным. Эти запросы «отличались от обычных шаблонов использования, отражая преднамеренное извлечение возможностей, а не легитимное использование». Anthropic не ответил на запросы TechCrunch о дистилляции Fable.

Однако дистилляция считается распространенной среди ИИ-компаний, не только в Китае. Илон Маск ранее в этом году показал, что его компания SpaceXAI дистиллировала модели OpenAI для разработки Grok, и что эта практика была распространена в отрасли. Грань между дистилляцией и разработкой синтетических наборов данных, например, может быть довольно размытой.

«В целом американцы недооценивают техническую экспертизу этих китайских команд», — сказал Хэнкок. «Один из основателей Moonshot был аспирантом CMU. Это легитимные исследователи и инженеры, выполняющие серьезную работу. …если американские модели остановятся, я думаю, прогресс Китая замедлится, но все равно продолжится. Они не просто едут на чужих плечах».

Также трудно отделить дистилляцию от второй части комментария Кратсиоса — о том, что Moonshot получил продвинутые чипы Nvidia, Grace Blackwell 300, а также получил доступ к серверам с GB300 в Таиланде. Эти чипы запрещены к экспорту в Китай, но существует черный рынок, по словам Сэма Бресника, научного сотрудника Центра безопасности и новых технологий Джорджтаунского университета. В мае основатель Supermicro, американского производителя серверов, был обвинен в контрабанде продвинутых чипов в Китай.

«Я сторонник законов “знай своего клиента” для дата-центров по всему миру», — сказал Бресник. «Если вы позволяете компании проводить огромные обучающие прогоны на вашем передовом оборудовании, должен существовать механизм отчетности о том, кто эта компания и чем она занимается».

Министерство торговли президента Джо Байдена предложило федеральные правила “знай своего клиента” для дата-центров в 2024 году, но, похоже, никакого дальнейшего прогресса при Дональде Трампе не было. Однако экспортеры, отправляющие продвинутые чипы за границу, должны гарантировать, что они используются только в одобренных целях.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: