NVIDIA Nemotron 3.5 Lightning ускоряет «token generation» в 4 раза, но «agentic tasks» — лишь на 30%, ведь «orchestration» остаётся настоящим узким местом

Nvidia ии оркестрация агенты токены бенчмарк wccftech.com

NVIDIA выпустила Nemotron 3.5 Lightning — модель с открытым весом на 30 млрд параметров, чтобы ускорить агентные задачи. Узнайте, почему 4-кратный рост генерации токенов даёт лишь 30% прироста производительности и где на самом деле скрыто узкое место.

Гонка за моделями с открытым весом в США набирает обороты, даже несмотря на то, что Китай продолжает удерживать этот сегмент. Об этом свидетельствует выпуск NVIDIA модели ИИ Nemotron 3.5 Lightning, которая появилась всего через несколько часов после того, как в понедельник Meta* представила свою модель Muse Glimmer.

NVIDIA Nemotron 3.5 Lightning пытается решить проблему узкого места токенов, когда реальные ограничения находятся на уровне оркестрации

Как уже сообщалось, NVIDIA только что выпустила Nemotron 3.5 Lightning — модель с открытым весом и смесью экспертов (MoE), содержащую 30 миллиардов параметров (3 миллиарда активных параметров). Она предназначена для управления и координации постоянно работающих агентов, обрабатывающих непрерывный поток рутинных задач.

Для тех, кто не в курсе: оркестрация — это процесс координации нескольких специализированных ИИ-агентов для эффективной совместной работы над сложными многошаговыми задачами, с которыми один агент справиться не может. Оркестрация на уровне агентов включает несколько этапов: приём и декомпозицию задачи, выбор агента, обмен контекстом и состоянием (когда агент А завершает свой шаг, оркестратор передаёт результат и соответствующие данные агенту Б, чтобы прогресс не обнулялся), а также периодическую валидацию и коррекцию ошибок. Обратите внимание, что оркестрация на аппаратном уровне происходит внутри CPU, который обычно управляет потоком данных между памятью и вычислительными ядрами для минимизации задержек и максимизации пропускной способности.

Архитектурные элементы

NVIDIA Nemotron 3.5 Lightning имеет 4 ключевых архитектурных элемента:

  1. Гибрид Mamba-Transformer: сочетает глубокое понимание контекста Transformer с молниеносной, аппаратно-эффективной скоростью обработки Mamba (State Space Models). Transformer — это нейронные сети глубокого обучения, предназначенные для обработки входных последовательностей и понимания связей между их компонентами, в то время как State Space Models — это математические framework, используемые для моделирования и прогнозирования того, как сложные динамические системы изменяются во времени.
  2. Мультитокеновое предсказание (MTP): вместо предсказания текста слово за словом (по одному токену за раз), модель предсказывает несколько токенов одновременно, сокращая время генерации.
  3. Латентная смесь экспертов (MoE): система маршрутизации, которая динамически расширяет доступные сети «экспертов» во время инференса, повышая производительность без огромных вычислительных затрат. По сути, модель MoE имеет несколько нейронных сетей, каждая из которых превосходно выполняет определённую задачу. Оркестратор динамически выбирает нейронную сеть или «эксперта», наиболее подходящего для выполнения конкретной задачи.
  4. Спекулятивное декодирование: меньшая, более быстрая «черновая» модель сначала угадывает текст, а основная модель мгновенно его проверяет, радикально ускоряя пропускную способность. Это тот же подход, который использует Meta* Muse Glimmer для ускорения генерации токенов (ответа/вывода).

Почему NVIDIA Nemotron 3.5 Lightning даёт убывающую отдачу

NVIDIA Nemotron 3.5 Lightning набирает 24 балла по Индексу искусственного анализа интеллекта (Artificial Analysis Intelligence Index). Это составной бенчмарк, предназначенный для оценки и отслеживания общих возможностей LLM по мере их продвижения к искусственному общему интеллекту (AGI). Он измеряет способности модели в агентных, кодовых, научных рассуждениях и универсальных задачах. Этот результат значительно лучше, чем у её предшественницы — Nemotron 3 Nano.

Тем не менее, NVIDIA утверждает, что Nemotron 3.5 Lightning способен генерировать токены в 4 раза быстрее, чем «модели аналогичного размера», но это ускоряет выполнение самих агентных задач лишь на 30 процентов. Другими словами, модель увеличивает вывод токенов в четыре раза, но даёт убывающую отдачу по ускорению агентных задач. Это говорит о том, что реальное узкое место находится на уровне оркестрации и обвязки агентов — программного обеспечения, которое решает, что запускать, где запускать и в каком порядке.

Хотя Nemotron 3.5 Lightning, безусловно, сдвигает иглу с места с точки зрения инкрементальной полезности, ему не хватает того самого «вау-эффекта», необходимого для вознесения американских моделей с открытым весом на доминирующие позиции, что отчасти объясняет, почему NVIDIA уже начала нагнетать ажиотаж вокруг Nemotron 4 как своей следующей большой ставки.

Facebook*, Instagram* и WhatsApp* принадлежат компании Meta* Platforms Inc., деятельность которой признана экстремистской и запрещена на территории Российской Федерации.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: