Китайский ИИ-гигант DeepSeek в четверг представил обновленную версию своей модели Flash, оптимизированной по стоимости и задержкам. Новая версия 4.1 включает архитектурные улучшения, более значительные, чем можно было ожидать от точечного релиза, поскольку изменения могут открыть двери для создания более крупных, умных и менее ресурсоемких моделей.
При 763 миллиардах параметров точечный релиз более чем в 2,5 раза превосходит по размеру модель, которую он заменяет. Фактически, модель крупнее, чем V3 и R1, которые принесли DeepSeek известность в начале 2025 года.
Несмотря на гигантское количество параметров, требования к памяти DeepSeek V4.1 Flash не так высоки, как можно было бы ожидать от модели такого размера. Разработчики DeepSeek внесли многочисленные архитектурные изменения, которые сделали LLM умнее, одновременно значительно сократив ресурсы, необходимые для ее обслуживания.
DeepSeek добился этого благодаря двум ключевым улучшениям. Во-первых, были внесены существенные изменения в обработку моделью кэшей ключ-значение (KV), используемых для отслеживания состояния модели между сессиями. Эти так называемые KV-кэши могут потреблять много памяти, особенно в приложениях с высокой пропускной способностью, таких как чат-боты.
Обновления различных механизмов внимания модели и внедрение нового причинно-следственного кодировщика-декодера (CED) позволили разработчикам улучшить производительность обработки запросов, сократив при этом потребление KV-кэша до 13–25 % от требований DeepSeek V4 Flash.
Другими словами, релиз V4.1 может поддерживать в четыре-восемь раз больше пользователей при том же объеме KV-кэша.
Технический отчет DeepSeek содержит гораздо более подробную информацию об архитектурных изменениях, но, возможно, самое интересное изменение — это внедрение другого типа весов модели.
Из 763 миллиардов параметров 196 миллиардов являются N-граммовыми параметрами, которые формируют то, что разработчики DeepSeek называют «модулем условной памяти». Идея состоит в том, что, отделяя память от вычислений, DeepSeek может сделать свои модели умнее, одновременно сокращая вычислительные ресурсы и ресурсы памяти, необходимые для их обслуживания.
Что такое N-грамма?
Основная идея модуля памяти DeepSeek V4.1 Flash во многом схожа с технологией Per-Layer Embedding (PLE), изначально разработанной командой Google Gemma. Цель PLE заключалась в том, чтобы сделать LLM достаточно умными для эффективной работы на устройствах с ограниченной пропускной способностью, памятью и вычислительными ресурсами, таких как смартфоны.
Реализация DeepSeek, впервые подробно описанная в январской исследовательской работе, заменяет встраивания PLE на N-граммы. На высоком уровне N-граммы — это просто группы токенов. Трехграммовая последовательность состоит из трех токенов подряд, двухграммовая — из двух и так далее.
Насколько бы сложным это ни звучало, на самом деле это работает немного похоже на ассоциацию слов или фраз.
Если бы вас спросили: «Найдите параметр прямоугольного треугольника, если известны только две стороны». Для тех, из вас, для кого геометрия не так далека в памяти, фразы «используйте теорему Пифагора» или «A2 + B2 = C2» или, возможно, «периметр будет суммой его сторон» могли бы сразу прийти на ум.
N-граммовые параметры, найденные в таких моделях, как DeepSeek V4.1 Flash, схожи по концепции. Веса являются источником неявных знаний или врожденной памяти. Вместо того чтобы просто вычислять, какая комбинация токенов имеет наивысшую вероятность ответа на вопрос, как это традиционно делали LLM, N-граммовые веса дополняют это, быстро извлекая релевантную информацию посредством дешевого поиска.
Это грубое упрощение того, что происходит внутри. На самом деле модель ищет не столько сам запрос, сколько серию хэшей. Это числа, представляющие «Найдите параметр», «прямоугольный треугольник» и так далее. Аналогично, содержимое таблицы поиска — это не необработанные ответы. Это другое математическое представление, называемое векторами, которое подается в конвейер вывода.
Однако конечный результат тот же: модель может предоставлять более умные и нюансированные ответы без штрафа за производительность, обычно связанного с дополнительными параметрами.
Почему N-граммы так дешевы
Связь между размером модели и интеллектом на данный момент хорошо установлена. Причина, по которой N-граммовые параметры DeepSeek так интересны, на самом деле связана с тем, как осуществляется доступ к данным.
Как правило, современные LLM являются авторегрессионными во время декодирования. Это означает, что для каждого токена, который генерирует чат-бот или агент, необходимо считать из памяти все активные веса модели, что делает пропускную способность ограничивающим фактором.
Как мы ранее обсуждали, архитектурные изменения, такие как рост моделей «смесь экспертов» или сверхнизкоточные блочные числа с плавающей запятой, помогли минимизировать этот узкий проход. Но N-граммовые веса, найденные в DeepSeek V4.1 Flash, работают немного иначе.
Они предлагают способ эффективного увеличения количества параметров, доступных модели во время вывода, без пропорционального увеличения нагрузки на память.
Эти N-граммовые веса по сути представляют собой огромные таблицы поиска (LUT). Это делает их быстрыми и дешевыми для запросов, поскольку, в отличие от остальных активных параметров модели, их не нужно считывать целиком из памяти каждый раз, когда генерируется токен. Это всего лишь несколько десятков поисков по таблице на токен.
Это имеет несколько последствий для доступа к памяти, но главное — N-граммовые веса не нужно помещать в память GPU для поддержания производительности. Их можно выгрузить в системную ОЗУ или, возможно, даже в достаточно быстрый массив хранения данных.
Что это означает на практике? Если посмотреть на DeepSeek V4.1 Flash, модели обычно требуется минимум 763 ГБ памяти GPU для хранения весов в формате FP8.
Однако, поскольку N-граммовые веса могут быть выгружены в более дешевую системную память, нам требуется около 567 ГБ памяти GPU.
Мы подчеркиваем минимум, потому что в производственной среде эти цифры будут значительно выше, поскольку нам также необходимо учитывать кэши ключ-значение, которые масштабируются в зависимости от длины контекста и одновременных пользователей.
Во время вывода эти N-граммовые веса дополняют восемь миллиардов активных параметров, которые DeepSeek использует для обработки запроса, теоретически увеличивая точность и качество вывода в процессе.
Важно отметить, что N-граммовые веса на самом деле не увеличивают количество активных параметров. Вместо этого они функционируют скорее как специфическая энциклопедия, которая почти мгновенно открывает нужные страницы по мере обработки моделью запросов.
Будущее открытых LLM
Хотя последняя модель DeepSeek может иметь один из самых больших пулов N-граммовых параметров на сегодняшний день, это не единственный разработчик моделей, делающий ставку на технологии для повышения эффективности развертывания более крупных моделей.
Как упоминалось ранее, Google уже использует аналогичный подход с помощью PLE для выгрузки менее чувствительных к пропускной способности весов в локальное хранилище. Пока это применялось только к очень маленьким моделям — по крайней мере, насколько нам известно (не то чтобы Google была особенно прозрачна в отношении своих проприетарных моделей).
Тем временем в конце прошлого месяца Alibaba представила свою последнюю экспериментальную модель под кодовым названием Qwen 3.8-Flash-Next. Как и DeepSeek V4.1 Flash, модель с 180 миллиардами параметров содержала большой пул из 51 миллиарда N-граммовых весов по тем же причинам. Фактически, реализация N-грамм в модели использует методы из того же исследования, опубликованного командой DeepSeek в январе.
По словам Alibaba, архитектурные основы Qwen 3.8-Flash-Next лягут в основу ее следующего поколения моделей Qwen 4, когда они появятся.
Это означает, нравится вам это или нет, но вы, вероятно, услышите об N-граммах еще не раз. ®
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Tobias Mann




