VA-Bench от Даляньского технологического университета: лучшие мультимодальные модели справляются лишь с половиной задач роботов

ии робототехника большие языковые модели мультимодальность тестирование Va-Bench pandaily.com

Тестируйте мультимодальные модели на задачах робототехники с VA-Bench! Qwen3.8-max лидирует с 53,93%, но ни одна модель не завершает сложный сценарий. Оцените возможности ИИ в реальных действиях.

Исследовательская группа под руководством Даляньского технологического университета представила VA-Bench — эталонный тест, проверяющий, могут ли универсальные мультимодальные большие языковые модели превращать увиденное в успешные действия манипулятора робота. Среди 12 конфигураций моделей лучший результат показал Qwen3.8-max от Alibaba, выполнив в среднем 53,93% задач, что свидетельствует о том, что модели, способные «понимать» сцену, по-прежнему испытывают трудности с надежным действием на основе этого понимания.

VA-Bench, описанный в статье, опубликованной на arXiv (2609.19554), и в китайскоязычном материале Sina Tech, оценивает полный цикл: наблюдение, рассуждение, действие и исправление. Перед каждым тестом модель просматривает видео с успешной демонстрацией, но не получает координат объектов, траекторий экспертов или точных параметров действий. Во время теста она может самостоятельно переключать точки обзора камеры ценой шагов взаимодействия и должна выдавать конкретные команды: смещения в миллиметрах по каждой оси, углы поворота, а также команды на открытие или закрытие захвата. Фиксированный контроллер выполняет только то, что указывает модель.

Эталонный тест охватывает 14 типов задач манипуляции, 11 одноручных и три двуручных, каждая с 20 физически проверенными сценами в симуляции физики, что составляет 280 базовых сцен. Он также включает варианты с измененной геометрией и компоновкой, а также трек с пятью объектами для дальнего горизонта, и каждая модель тестировалась трижды.

Ведущие модели показали 100% результат в определении целей и от 99,6% до 100% в понимании требуемой манипуляции, однако общий успех выполнения задачи остался на уровне половины. Зарубежные эталонные модели Opus-5 и GPT-5.6-sol следовали за Qwen3.8-max с результатами 52,86% и 51,55% соответственно; авторы отмечают, что три лучшие модели находятся в пределах 2,38 пункта и не претендуют на надежный порядок. Их выполнение подзадач от 65,9% до 68,6% показывает, что многие сбои происходят после частичного прогресса. Все остальные условия показали результат 23,10% или ниже.

Выделяются два пробела. Qwen3.8-max обнаруживал ошибки в 73,6% случаев, но исправлял их в режиме реального времени только в 46,7%. Его коэффициент успеха составил 65,61% для одноручных задач, но всего 11,11% для двуручных, которые требуют назначения объектов каждой руке и координации их относительного положения.

Активное наблюдение оказалось важнее дополнительных камер. В сопоставимом сравнении Qwen3.8-max успешно справился с 57,50% из 280 сцен, когда выбирал собственные точки обзора, по сравнению с 27,86%, когда ему предоставлялись пять фиксированных видов, и все четыре модели в этом тесте показали снижение без активного наблюдения.

Изменение форм объектов, контейнеров или компоновки при сохранении той же задачи снизило успех одной эталонной модели более чем на 30 пунктов, с 80,00% до 47,86%, в то время как Qwen3.8-max снизился с 77,86% до 67,86%. В треке дальнего горизонта Qwen3.8-max разместил 61 из 100 объектов, но ни одна модель не завершила ни одного строгого эпизода.

Эталонный тест отличается от рейтинга embodied brain от SuperCLUE, опубликованного на этой неделе, который оценивает восприятие, рассуждение и планирование; VA-Bench измеряет, становятся ли эти суждения успешными физическими действиями.

СМОТРИТЕ ТАКЖЕ:Qwen3.8-Max от Alibaba и Nebula от ZTE делят первое место среди китайских компаний в рейтинге embodied brain от SuperCLUE · Alibaba выпускает официальную версию Qwen3.8-Max

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: