Nvidia только что показала, что настоящий герой — не ИИ-модель, а её обвязка.

Nvidia ии-агенты обвязка Arc-Agi-3 Claude Opus 5 бенчмарк techcrunch.com

Исследование Nvidia: обвязка агента важнее модели. Настройка обвязки и надзирающий агент позволили Claude Opus 5 набрать 100% в ARC-AGI-3. Узнайте, как открытые обвязки снижают затраты и повышают точность ИИ-агентов.

Суть: просто используя специальную обвязку, оптимизированную для работы с памятью и включающую «надзирающий» компонент, похожий на босса, исследователи добились от Claude Opus 5 100% результата в интерактивном тесте на рассуждение ARC-AGI-3. (Этот бенчмарк особенно раздражает rival frontier lab OpenAI.) Без обвязки Opus 5 набрал 30%, что было лучшим результатом среди всех протестированных моделей.

Исследование Nvidia — ещё одно свидетельство того, что, хотя выбор модели и важен, выступая в роли мозга агента, он составляет меньшую часть агентной системы, чем многие пользователи ИИ осознают, особенно для долгосрочных задач. Обвязка превращает модель в агента: она управляет памятью, контекстом, обратной связью.

«Вообще говоря, мир воспринимает агента почти как API модели», — говорит TechCrunch Адель Эль Халлак, вице-президент по продуктам в подразделении ИИ Nvidia (на фото выше). Но агент на самом деле нечто большее. «Это модель. Это каркас вокруг модели, который мы называем обвязкой, то есть набор инструментов, которые она использует. Это среда выполнения и связанные с ней навыки и библиотеки, к которым мы предоставляем ей доступ».

Долгосрочные задачи — это те, которые требуют связывания множества решений воедино, иногда в течение нескольких дней, для получения завершённой работы. Это противоположно тому, когда ИИ просто выдаёт ответ на запрос. Понять, как заставить ИИ выполнять долгосрочные задачи, не отвлекаясь и не уходя в неведомые дали, — одна из святых граалей агентных исследований.

Например: Microsoft опубликовала в апреле исследование, в котором протестировала 19 LLM на долгосрочных задачах по редактированию документов и обнаружила, что все модели, включая передовые, заполняли документы ошибками. (Если бы люди выполняли такую работу, их бы немедленно уволили.)

Модели, самостоятельно связывающие решения, также были замечены в удалении файлов пользователей, целых баз данных или обращении к преступному поведению для достижения своих целей — от сговора до взлома.

Выбор исследователей Nvidia использовать этот интерактивный бенчмарк для своих тестов особенно значим, почти забавен. Это набор двумерных игр без инструкций. Модель должна сама понять, как играть и побеждать. Результат 100% означает, что модель может проходить игры так же хорошо, как люди.

OpenAI была настолько обескуражена провальными результатами своих моделей (менее 10%) в ARC-AGI-3, что провела собственное исследование в прошлом месяце. Как и Nvidia, OpenAI обнаружила, что просто изменив два параметра обвязки, её модели утроили свои результаты.

Но ни одна из моделей не приблизилась к 100%, как это сделали исследователи Nvidia. Они показали, что обвязке требуется компонент «надзиратель», который подталкивает агента в правильном направлении, если тот застрял.

«Более интересной частью было введение надзирающего агента в дополнение к основному агенту, выполняющему работу», — сказал Эль Халлак. Он «почти как CEO, который подталкивает агента, когда тот сбивается с курса или начинает исследовать путь, ведущий в тупик, или заново исследует путь, по которому уже прошёл».

Хотя концепция надзирающего агента не совсем нова, сегодня большинство пользователей агентов полагаются только на один уровень обвязки, например Claude Code, Codex, Hermes и т.д. Исследователи Nvidia создали собственную улучшенную обвязку под названием Agentic Variation Operators (AVO).

Обратите внимание: это не новый продукт Nvidia. Вместо этого Nvidia выпускает множество открытых фрагментов технологий для создания обвязок под брендом Nemo. Часть этих технологий коммерческая, большая часть доступна в открытом виде.

Тем не менее, результаты Nvidia добавляют доказательств тому, что выбор модели — далеко не единственный фактор в агентной производительности. В июле, например, Databricks опубликовала потрясающее исследование, показывающее, что обвязка, а не модель, кардинально влияет на затраты ИИ.

«Вы можете взять одну и ту же модель, но разные обвязки, и получить значительно более высокие затраты, если используете неправильную обвязку», — сказал TechCrunch генеральный директор Databricks Али Годси. «Поэтому вы думаете: о, это дорогая модель. Это дешёвая модель. Но постойте, какую обвязку вы используете? Она сама может удвоить ваши затраты».

Более широкая мысль Nvidia состоит в том, чтобы показать, что открытые обвязки, как и открытые модели, дают пользователям гораздо больше контроля, чем они осознают.

«Мы верим и демонстрируем на примере экосистемы, как открытые обвязки позволяют поворачивать гораздо больше ручек для повышения точности», — сказал Эль Халлак. «Это связано с тем, что OpenAI замедлила обучение своих моделей» из-за нарушений безопасности, создаваемых моделями.

«Мы верим, что наличие открытого стека агентов — где у вас есть контроль над обвязкой, инфраструктурой, средой выполнения — это то, что необходимо для продвижения экосистемы вперёд и безопасно», — добавил он.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: