NVIDIA создала AVO-агента для написания кода, который оптимизирует ядра CUDA GPU, и он только что набрал 100% в публичном тесте, не получив никаких предварительных инструкций

Nvidia Avo Arc-Agi-3 обвязка ии Claude Opus 5 автономный агент wccftech.com

NVIDIA доказала ценность обвязки ИИ: агент AVO на базе Claude Opus 5 решил все 183 головоломки ARC-AGI-3 с точностью 100% без инструкций. Узнайте, как обёртка превращает модель в автономного решателя задач и почему она эффективнее на 12%.

Компания NVIDIA только что продемонстрировала растущую важность хорошей обвязки вокруг модели ИИ, позволив своему программирующему агенту AVO взяться за публичный набор данных ARC-AGI-3. Агент успешно прошёл все 183 уровня 25 доступных игр, причём без каких-либо предварительных инструкций или целей.

AVO от NVIDIA — это обёртка вокруг модели Claude Opus 5 от Anthropic, но если Opus 5 набрал лишь 30 % на публичном наборе ARC-AGI-3, то AVO получил безупречные 100 %

Прежде чем продолжить, давайте разберёмся, что такое обвязка ИИ. В запутанном мире искусственного интеллекта обвязка — это обёртка, внешний слой программного обеспечения, который строится вокруг заданной модели ИИ. Представьте модель как мозг, а обвязку — как тело, доспехи и инструменты, превращающие универсальный текстовый предсказатель в решателя задач.

Эффективная обвязка выполняет следующие функции:

  1. Подключает модель ИИ к внешнему миру: обычная модель ИИ не может сама увидеть веб-страницу, запустить скрипт на Python или взаимодействовать с файлом, а обвязка может.
  2. Позволяет модели ИИ создать самокорректирующийся цикл, в котором сложная задача решается методом проб и ошибок. Здесь обвязка передаёт результат каждой попытки обратно в модель, чтобы она могла итерировать.
  3. Помогает управлять долговременной памятью: по мере увеличения окна контекста (входных данных) модели ИИ обычно начинают забывать ранние детали и информацию. Обвязка же действует как блокнот — сохраняет успешные фрагменты кода, отфильтровывает бесполезные ошибки и ведёт чистый журнал прогресса модели, чтобы она не теряла нить рассуждений.
  4. Структурирует промпты и ограничения, накладывая строгие правила на то, как модель должна мыслить.

Это подводит нас к сути сегодняшней темы. Программирующий агент AVO — это, по сути, обвязка вокруг модели Claude Opus 5 от Anthropic. Изначально NVIDIA создала AVO для оптимизации ядер GPU CUDA: агент работал автономно в течение 7 дней, исследовал более 500 направлений и создал ядра, которые превзошли FlashAttention-4 на целых 10,5 %.

Не меняя базовую архитектуру агента, NVIDIA затем заменила инструменты GPU-инжиниринга на интерфейс задач ARC-AGI-3. Агент успешно перенёс свою логику проверки кода и самокоррекции на совершенно постороннюю визуально-интерактивную головоломку, сумев решить 183 головоломки из публичного набора данных ARC-AGI-3 со 100-процентной точностью — и всё это без предварительных инструкций или целей. Учитывая, что Opus 5 набрал на том же задании лишь 30 %, AVO только что продемонстрировал феноменальную добавленную стоимость, которую эффективная обвязка может принести к общему столу.

По данным NVIDIA, AVO прошёл 183 уровня, использовав в общей сложности 6624 действия. Это на 12 % эффективнее по сравнению с другими ведущими агентными обвязками, такими как VISTA, которой потребовалось 7542 действия для прохождения публичного набора.

Обратите внимание: платформа оценки ARC-AGI-3 в настоящее время не позволяет запускать пользовательские внешние обвязки агентов против своего скрытого частного набора. Это означает, что мы не знаем, как AVO показал бы себя на этом более релевантном наборе данных.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: