Magic сравнялся по качеству с DeepSeek V4 Pro всего за $500 тыс., потратив в 50 раз меньше вычислительных мощностей

ии обучение модели стартап вычисления magic.dev techtimes.com

Стартап Magic опубликовал рецепт предварительного обучения 8 сентября 2026 года, который соответствует качеству базовой модели DeepSeek V4 Pro, используя в 50 раз меньше вычислительных операций при стоимости около 500 000 долларов США, ставя под сомнение предположение, что обучение ИИ передового качества требует девятизначных бюджетов на вычисления.

Magic сравнялся по качеству с DeepSeek V4 Pro всего за $500 тыс., потратив в 50 раз меньше вычислительных мощностей
Magic.dev

8 сентября 2026 года компания Magic, стартап в области ИИ из 43 человек, специализирующийся на автономном кодировании и автоматизации исследований в области ИИ, опубликовала рецепт обучения, который, по их утверждению, соответствует качеству базовой модели DeepSeek V4 Pro, используя примерно в 61 раз меньше операций с плавающей запятой и при стоимости вычислений около 500 000 долларов США на оборудовании Nvidia GB200. Это открытие, если оно будет независимо подтверждено, поставит под сомнение одно из самых распространенных предположений в машинном обучении: что достижение качества предварительного обучения на передовом уровне требует кластера чипов и бюджета, которые могут собрать только пять или шесть организаций в мире.

DeepSeek V4 Pro, выпущенная в апреле 2026 года как модель с открытыми весами, имеющая в общей сложности 1,6 триллиона параметров и примерно 49 миллиардов активных параметров за один проход вывода, сама по себе считалась необычайно эффективной по вычислениям для своего качества. Заявленные Magic затраты на вычисления для достижения того же уровня — примерно 1,58 × 10²³ FLOPs — составляют менее половины вычислительных ресурсов, использованных для обучения оригинальной GPT-3 в 2020 году.

«Предварительное обучение на передовом уровне считается игрой только для больших лабораторий», — написали представители Magic. «У нас пока нет 100 тысяч чипов, поэтому есть только один путь: алгоритмическая эффективность».

Что на самом деле измерила Magic — и почему эта метрика важна

Утверждение об эффективности основано на методе оценки, который менее знаком широкой аудитории, чем основанные на выборке эталонные тесты, доминирующие в большинстве новостных материалов об ИИ. Magic измеряла производительность с помощью показателя потерь бит на байт (bpb) на отложенных данных — метрики, которая является стандартом в академическом машинном обучении с 2020 года (Gao et al.) и использовалась в статье о законах масштабирования Chinchilla (Hoffmann et al. из DeepMind в 2022 году).

Преимущество bpb перед традиционными показателями эталонных тестов заключается в том, что он не зависит от конкретного токенизатора. Различные языковые модели используют разные словари — одна модель может представлять слово «pretraining» одним токеном, в то время как другая разбивает его на три. Стандартные оценки перплексии (потерь на токен) нельзя сравнивать между моделями с разными словарями, поскольку модель с большим словарем естественным образом будет генерировать меньше токенов на документ и будет казаться работающей иначе. Bits-per-byte обходит эту проблему, измеряя, сколько бит требуется модели для кодирования каждого байта текста, независимо от того, на сколько токенов был разделен этот байт. Две модели с совершенно разными токенизаторами могут быть сравнены по этой метрике без корректировки.

Для базовых моделей, которые еще не прошли обучение с подкреплением или контролируемое дообучение, потери bpb особенно важны. До обучения с подкреплением модели чрезвычайно чувствительны к формулировке запроса — эталонный тест на основе выборки может давать совершенно разные результаты в зависимости от того, была ли модель явно обучена отвечать в ожидаемом формате. BPB полностью обходит эту проблему, не требуя какого-либо конкретного формата вывода.

Наборы данных для отложенной оценки Magic охватывали четыре области: частные репозитории кода (включая собственный код компании и код, полученный от других стартапов), исследовательские работы по информатике, инженерии, математике и физике, частные задачи математического рассуждения и общий текст. Чтобы предотвратить загрязнение, команда удалила любой обучающий документ с совпадающим нормализованным окном в 96 символов или высоким показателем сходства Якарда по сравнению с ее наборами оценки. Она также построила наборы оценки, используя другой парсер, чем тот, который использовался во время предварительного обучения.

Для независимой проверки Magic сотрудничала с поставщиком услуг вывода Fireworks для перекрестной проверки базовых логарифмических вероятностей в третьем движке вывода. Команда также оценила все конкурирующие модели на GB200 и GB300 с использованием vLLM и SGLang, и сообщила о нескольких обнаруженных в процессе несоответствиях в бэкенде.

Десятки мелких улучшений, накопленных в масштабе

Прирост эффективности произошел не благодаря одному прорыву. Magic описывает их как результат десятков инкрементальных изменений, систематически проверенных в различных масштабах обучения — охватывающих архитектуру модели, дизайн оптимизатора, цель обучения и курирование данных.

Процесс проверки Magic каждого изменения методологически примечателен. Для каждой кандидатской модификации команда обучает три модели, охватывающие два порядка величины вычислительных ресурсов. Изменение сохраняется только в том случае, если его степенная зависимость от кривой масштабирования предсказывает, что оно принесет пользу модели в полном масштабе. Это напрямую решает одну из задокументированных проблем мелкомасштабных исследований ИИ: многие улучшения, которые проявляются в экспериментах уровня NanoGPT, не переносятся на крупномасштабные обучающие запуски, а некоторые архитектурные особенности, присутствующие в большинстве крупных моделей, на самом деле могут быть удалены без ущерба для крупномасштабной производительности.

Компания проводит то, что она называет «героическим» масштабированием каждые несколько месяцев — в текущем посте в блоге они обозначены как V3, V4 и V5 — и меньшим промежуточным масштабированием каждые несколько недель. Траектория эффективности, отслеживаемая в посте, показывает эффективность вычислений по сравнению с более ранней моделью V2 компании: V3 (начало 2026 г.) примерно в 11 раз, V4 (июль 2026 г.) в 24 раза, и V5 (сентябрь 2026 г.) в 50 раз, причем каждый последующий запуск сравнивается с эквивалентными конкурентами с открытыми весами.

Один побочный вывод из сравнения заслуживает отдельного внимания: Nvidia Nemotron 3 Ultra превзошла DeepSeek V4 Pro во всех оцененных областях на этапе базовой модели, на нескольких бэкендах вывода. Magic интерпретирует это как предположение, что более слабые результаты Nemotron на эталонных тестах после обучения могут отражать качество ее фазы обучения с подкреплением, а не какой-либо недостаток в ее базовом предварительном обучении — различие, которое обычно невидимо в стандартных оценках моделей.

Переносится ли лучшее предварительное обучение на реальную производительность?

Естественная обеспокоенность любым заявлением о качестве базовой модели заключается в том, сохраняется ли преимущество после обучения с подкреплением, которое превращает базовую модель во что-то, с чем пользователи могут реально взаимодействовать. Magic напрямую ответила на этот вопрос, проведя короткий эксперимент по обучению с подкреплением на математических задачах, используя бюджет цепочки рассуждений в 16 000 токенов, начиная с базовой модели без контролируемого дообучения или дистилляции.

Полученная модель, обозначенная как V5 e24, достигла 72% успешных прохождений на частной оценке соревновательной математики компании — сложнее, чем соревнование AIME. Для справки, сравнительная таблица Magic помещает DeepSeek V4 Pro на 65%, а Kimi K3 примерно на 75% по тому же типу оценки, хотя компания признает, что эти модели потребили на порядки больше вычислительных ресурсов для обучения с подкреплением. Claude Fable 5.1 указан на 98%, а GPT-6 Astra — на 100%.

Сравнение не является утверждением, что модель Magic с небольшим бюджетом для обучения с подкреплением превосходит полностью обученные производственные системы. Это утверждение о том, что качество базовой модели достаточно высокое, чтобы даже минимальные инвестиции в обучение с подкреплением быстро приблизились к тому, чего достигают полностью обученные модели из хорошо обеспеченных ресурсами лабораторий. Это демонстрация существенно иного.

Почему 500 000 долларов против 100 миллионов долларов имеют значение — и от чего зависит это утверждение

Сравнение затрат в статье — примерно 500 000 долларов США за прогон Magic «V5 e23» против того, что, по словам Magic, обошлось бы более чем в 100 миллионов долларов для достижения эквивалентного качества по рецепту обучения DeepSeek V4 Pro — основано на собственных прогнозах Magic по законам масштабирования. Компания подогнала кривую степенной зависимости в стиле Chinchilla к своей зависимости вычислительных ресурсов от качества и экстраполировала стоимость рецепта DeepSeek для достижения того же показателя BPB.

Масштабирование Magic в 10 раз по тому же рецепту (примерно до 4 миллионов долларов США) превзошло все общедоступные базовые модели с открытыми весами по оценкам перплексии, что является дополнительным свидетельством того, что подгонка закона масштабирования ведет себя ожидаемым образом в рамках их рецепта — но это остается внутренней подгонкой к внутренним данным.

Что остается неподтвержденным — и почему это важно

В посте в блоге Magic осторожно относится к тому, что она утверждает, а что нет. Никакие веса модели не были выпущены. Ни один внешний исследователь не применял эти рецепты обучения независимо. Методология оценки, хотя и технически хорошо обоснована, была разработана и выполнена полностью внутри компании, при этом Fireworks предоставила частичную перекрестную проверку только базовых логарифмических вероятностей.

Существует также более глубокий вопрос, который пост в блоге не полностью разрешает: являются ли приросты эффективности инвариантными к масштабу или зависимыми от масштаба.

Исследование MIT FutureTech (Gundlach et al., представленное на ICML 2026) показало, что большинство инноваций в области алгоритмической эффективности при предварительном обучении LLM зависят от масштаба — они дают большие преимущества по мере увеличения вычислительных ресурсов для обучения, а не меньшие. Исследование показало, что два сильно зависящих от масштаба нововведения — переход от LSTM к Transformer и перебалансировка от Kaplan к Chinchilla — составляют примерно 91% от общего прироста эффективности на уровне вычислительных ресурсов 2025 года, в то время как многие инкрементальные улучшения, которые, как предполагают люди, движут прогрессом, вносят менее 10% при малых масштабах.

Если приросты Magic следуют той же схеме — если они зависят от масштаба — то множитель 61× может быть наибольшим именно на передовых масштабах, где Magic в настоящее время работает, а не на меньших масштабах, где они были бы наиболее необходимы исследователям с ограниченными ресурсами. Это была бы иная и менее демократизирующая история, чем подразумевается в посте в блоге.

Magic напрямую не рассматривает это различие, а формулировка поста в блоге — «только один путь: алгоритмическая эффективность» — подразумевает, что преимущества доступны любому, кто готов провести исследовательскую работу, независимо от начального уровня вычислительных ресурсов. Является ли это правдой, зависит от экспериментальной работы, которая еще не была проведена, или, по крайней мере, еще не опубликована.

Масштабирование к агентам, длинному контексту и будущему выпуску модели

Magic представляет обновление предварительного обучения как второй из трех исследовательских столпов, на которых она строится: предварительное обучение, обучение с подкреплением на основе агентов и моделирование длинного контекста. Ранее компания уже добилась успехов в области длинного контекста: в августе 2024 года она анонсировала LTM-2-mini, модель с контекстным окном в 100 миллионов токенов — эквивалентное примерно 10 миллионам строк кода или 750 романам — чей алгоритм измерения последовательности был примерно в 1000 раз эффективнее стандартного механизма внимания в Llama 3.1 405B при той же длине контекста.

Следующим крупным исследовательским направлением, по словам Magic, будет обучение с подкреплением на длинных горизонтах: обучение агентов продолжать обучение после развертывания, работая в длинных контекстах. Компания также разрабатывает то, что она описывает как методы обучения согласованности с «надежными теоретическими свойствами» и планирует выпустить обновленную Политику готовности к ИИИ, охватывающую этапы развертывания и требования безопасности во время обучения с подкреплением.

Пост в блоге Magic завершается тем, что по сути является публичным объявлением о наборе персонала. Компания описывает себя как «вероятно, самую маленькую команду в мире, обучающую модели с триллионом параметров» и отмечает, что влияние на одного человека никогда не было выше.

Среди инвесторов компании — бывший генеральный директор Google Эрик Шмидт, Jane Street, Sequoia Capital, Atlassian и CapitalG, а также ранние инвесторы Нат Фридман, Дэниел Гросс и Элад Гил. Общий объем финансирования достиг 465 миллионов долларов США за три раунда, при этом раунд на 320 миллионов долларов оценил компанию примерно в 1,5 миллиарда долларов. Magic также имеет партнерство по вычислительным ресурсам с Google Cloud, ориентированное на десятки тысяч чипов GB200 — ресурс, который даже небольшой команде обеспечил бы значительно большее количество чипов, чем у большинства университетов и многих национальных инициатив в области ИИ.


Что на самом деле означает «качество предварительного обучения на передовом уровне» в данном контексте?

Это означает качество на этапе базовой модели — до обучения с подкреплением и контролируемого дообучения, которые превращают предварительно обученную модель в разговорного помощника или модель рассуждений. Утверждение Magic заключается конкретно в том, что ее базовая модель, оцененная по показателю потерь бит на байт на отложенных данных, соответствует тому, чего достигает базовая модель DeepSeek V4 Pro после потребления на порядки большего количества вычислительных ресурсов. Продемонстрировано ли это преимущество в полном конвейере обучения с подкреплением, публично не показано.

Означает ли использование в 61 раз меньшего количества FLOPs, что другие организации теперь могут обучать модели передового качества?

Потенциально, если рецепт обобщается. Но есть два оговорки. Во-первых, Magic не выпустила рецепт, веса модели или детали реализации, кроме того, что представлено в посте в блоге. Во-вторых, если приросты эффективности зависят от масштаба — приносят пользу в основном при больших вычислительных масштабах, как предполагает исследование ICML 2026 по алгоритмическому прогрессу для большинства таких приростов — то для воспроизведения результатов все равно потребуется значительный доступ к чипам. При стоимости 500 000 долларов США на оборудовании Nvidia GB200 прогон обучения находится в пределах досягаемости хорошо финансируемого стартапа, но не большинства академических лабораторий или индивидуальных исследователей.

Что потребуется для проверки утверждений Magic?

Независимое воспроизведение рецепта обучения при аналогичном бюджете на вычисления, с использованием той же методологии оценки, при этом внешняя организация проводит окончательную оценку, а не внутренняя команда Magic. Пока ничего этого нет. Magic заявляет, что с нетерпением ждет «выпуска продукта» — когда это произойдет, исследовательское сообщество сможет провести собственные оценки и определить, приведет ли преимущество bpb к различиям в реальных возможностях.

Является ли bits-per-byte надежным показателем интеллекта, который имеет значение в развернутых моделях?

Это надежная и технически обоснованная мера того, насколько хорошо языковая модель предсказывает текст — что и оптимизируется при предварительном обучении. Является ли лучшее значение bpb на базовом уровне последовательным предиктором лучшей производительности после обучения с подкреплением, является открытым вопросом в исследовательском сообществе, хотя собственный короткий эксперимент Magic с обучением с подкреплением (72% на оценке сложнее, чем AIME, при минимальном бюджете на обучение с подкреплением) предполагает, что преимущество не исчезает немедленно.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: