Почему ByteDance Seed отказывается «дистиллировать» чужие модели

Bytedance Seed дистилляция Llm чжан имин ии pandaily.com

Чжан Имин пресек третью внутреннюю попытку дистиллировать передовые модели, включая открытые. Seed заявляет, что принимает временное отставание, а не сокращение разрыва за счет заимствованного интеллекта.

Чжан Имин, основатель ByteDance, месяц назад посетил общее собрание команды Seed и положил конец двухлетней внутренней дискуссии. ByteDance не будет использовать чужие модели для ускорения разработки собственных LLM, заявил он. Речь идет как о закрытых передовых моделях, так и об открытых.
Это правило действует с 2023 года. Ранняя команда Seed проводила эксперименты, используя выходные данные API GPT в качестве обучающего материала. После того как ByteDance в апреле 2023 года внедрила аудит вызовов GPT, команда установила жесткое правило: никакие данные, сгенерированные GPT, не должны попадать в обучающие наборы ByteDance. Это ограничение появилось еще до того, как за пределами Китая начались споры о дистилляции.
Первый внутренний конфликт возник в январе 2025 года после выхода DeepSeek-R1. Исследователи Seed задали очевидный вопрос: если другие лаборатории скрыто используют результаты передовых моделей для наверстывания, почему мы не можем? Некоторые предложили аккуратно применить дистиллированные данные, чтобы сократить отставание, не отказываясь от собственного обучения Seed. Руководство отвергло это предложение.
Год спустя, когда в лабораториях США началось массовое развертывание Nvidia Blackwell, дискуссия возобновилась. Китайские лаборатории не могут приобрести топовые карты B-серии. Seedance 2.0 обучался на кластере H20, производительность которого составляет примерно одну пятидесятую от B200. GPT-5.5 и Claude 4.8, особенно Claude Fable 5, совершили новые скачки в рассуждениях, программировании и науке, совпавшие с появлением Blackwell. Закрытые модели невозможно дистиллировать, но лучшие открытые — можно.
Переломным моментом, приведшим к общему собранию, стал Kimi K3. Открытая модель K3 от Moonshot достигла уровня, сопоставимого с передовыми закрытыми моделями. Для Seed, небольшой китайской лаборатории, пытающейся конкурировать на глобальном уровне, вопрос стал неизбежным: почему Seed, обладая более высокой концентрацией талантов и большими вычислительными мощностями, не создала модель аналогичного уровня? Дистилляция позволила бы Seed направить ограниченные ресурсы обучения в уже доказавшие свою эффективность направления.
Ответ Чжана был краток. Seed может смириться с временным отставанием, заявил он. Но нельзя закрывать этот разрыв за счет дистилляции конкурентов. Эта позиция соответствует политике 2023 года, однако ставки стали выше. Anthropic публично обвинила Tongyi Qianwen, Moonshot и MiniMax в массовом сборе выходных данных Claude. Независимо от обоснованности этих обвинений, геополитические, юридические и коммерческие риски резко возросли, и Seed продолжает придерживаться своей линии, даже ценой многолетнего отставания в бенчмарках.
Интересная ставка — это мета-ставка. Стратегия Seed исходит из того, что передовые лаборатории, уходящие вперед в сегодняшних тестах на рассуждение, не обязательно превзойдут Seed в создании того интеллекта, который она действительно стремится построить. Заимствование их данных сейчас, по мнению Seed, заблокирует ее в чужой архитектуре интеллекта, а не в собственной. Это ставка, которую Чжан готов делать, принимая реальные потери в позиционировании моделей, — ставка, которую другим китайским лабораториям, возможно, будет труднее принять.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: