Alibaba открыла исходный код модели Qwen-Drive-1.0-4B для задач восприятия и планирования в беспилотном вождении

Qwen ии автономное вождение модели Open Source pandaily.com

Qwen выпустила Qwen-Drive-1.0-4B — модель обработки изображений и естественного языка для автономного вождения на базе Qwen3.5-4B с 3D-восприятием и планированием траектории. Варианты SFT и RL Planning Expert доступны на Hugging Face и GitHub.

Команда Alibaba Qwen представила Qwen-Drive-1.0-4B — модель обработки изображений и естественного языка для автономного вождения, сочетающую понимание сцены с планированием движения. Разработанная совместно с Университетом науки и техники Хуачжун, эта модель сохраняет неизменным предобученный мультимодальный каркас Qwen3.5-4B и добавляет модули для 3D-восприятия с высоты птичьего полета и генерации траектории движения без переписывания базовой архитектуры обработки изображений и естественного языка.

Веса, код для инференса и демонстрационные данные опубликованы на Hugging Face и GitHub под лицензией Apache 2.0. Общая модель обработки изображений и естественного языка продолжает отвечать на вопросы в свободной форме о дорожных сценах. Кроме того, внешний модуль восприятия BEV совместно выполняет 3D-детектирование объектов, предсказание семантической занятости и сегментацию карты BEV. Qwen описывает этот модуль как явный, проверяемый 3D-зонд общих представлений, а не отдельную специализированную сеть, которая заменяет VLM или скрывает промежуточную геометрию от разработчиков.

Планирование движения осуществляется «Экспертом по планированию», который использует признаки VLM и генерирует будущие траектории движения с помощью потокового сопоставления. В пакет входят два чекпоинта планировщика. Вариант planner-sft обучен методом имитации и поддерживает как прямое, так и основанное на рассуждениях планирование. Вариант planner-rl дополнительно оптимизирован по вознаграждению с использованием таких метрик, как NAVSIM PDMS и общие оценки Waymo Open Dataset, и рекомендуется для режима планирования на основе рассуждений. Единые аннотации траекторий позволяют команде обучать модель на нескольких общедоступных наборах данных для вождения, сохраняя при этом согласованность форматов для совместной оценки.

Рецепт поэтапного обучения смешивает данные для обучения вождению с общецелевыми данными для обработки изображений и естественного языка, чтобы модель приобретала компетенции в предметной области, ограничивая при этом катастрофическое забывание общих визуальных навыков. Представленные таблицы показывают, что система класса 4B конкурирует в оценках предсказания в разомкнутом контуре, псевдозамкнутом контуре и замкнутом контуре, демонстрируя сильные результаты в ответах на вопросы по визуальным данным для вождения по сравнению с более крупными общими VLM. Общие знания и пространственные тесты остаются в целом на уровне базовой модели Qwen3.5-4B, согласно проектной карте и материалам технического отчета.

Структура репозитория помещает VLM в корневую папку, а модули planner-sft, planner-rl и модули восприятия — в соседние папки для выборочной загрузки. Разработчики могут использовать VQA отдельно, подключать модуль восприятия или загружать планировщик для демонстрационных сцен без использования проприетарных флотов или частных логов. Qwen представляет проект как первый открытый шаг к созданию унифицированной основы обработки изображений и естественного языка для исследований в области автономного вождения, приглашая к воспроизведению, анализу и расширению, а не предлагая закрытый производственный стек. Будущие форки сообщества могут протестировать «Эксперта по планированию» в пользовательских конфигурациях датчиков, сохраняя при этом нетронутый каркас Qwen3.5-4B в качестве стабильной основы для следования инструкциям и диалогов о сценах.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: