BYD впервые раскрыла свою AI-команду: гибридная модель мира HyWorldVLA достигает SOTA на NAVSIM v1 с 90.59 PDMS, знаменуя выход BYD в сферу фундаментальных моделей автономного вождения

Byd Hyworldvla автономное вождение ии Navsim Hit pandaily.com

Познакомьтесь с HyWorldVLA от BYD AI: гибридная модель мира с пиксельно-латентным моделированием и архитектурой VLA, достигшая 90,59 PDMS на NAVSIM. В команде — разработчики из Харбинского политехнического института.

Команда BYD по искусственному интеллекту 29 июля опубликовала свою первую исследовательскую работу HyWorldVLA, раскрыв ранее неизвестную группу исследователей ИИ с глубокими корнями в робототехнике Харбинского политехнического института (HIT). В статье представлена гибридная модель мира, сочетающая моделирование мира на уровне пикселей и в скрытом пространстве с архитектурой «зрение-язык-действие» для автономного вождения. HyWorldVLA достигла 90,59 PDMS на публичном бенчмарке NAVSIM v1, превзойдя все предыдущие результаты уровня state-of-the-art. Бенчмарк оценивает качество реального вождения по таким критериям, как безопасность при столкновениях, соблюдение проходимой зоны, безопасная дистанция, достижение цели и комфорт движения. Это достижение знаменует собой значительный сдвиг для BYD, которая ранее воспринималась как компания, сосредоточенная на интеграции цепочек поставок и масштабах производства, а не на исследованиях ИИ на уровне кода.

Архитектура гибридной модели мира решает фундаментальный компромисс в моделях мира для автономного вождения. Модели на уровне пикселей предсказывают будущие видеокадры для детализации окружения, но страдают от высоких вычислительных затрат и чувствительности к визуальному шуму. Модели скрытого пространства работают в сжатых скрытых представлениях для эффективности, но рискуют потерять детали реального мира, критически важные для безопасных решений при вождении. HyWorldVLA сохраняет оба подхода, используя супервизию на уровне пикселей во время обучения как сторожа, который заставляет скрытое пространство сохранять достаточно информации для реконструкции кадров, при этом выполняя инференс в сжатом пространстве для эффективности. Абляционное исследование подтвердило, что удаление предсказания на уровне пикселей снижает PDMS с 90,59 до 87,50, а удаление обработки в скрытом пространстве снижает до 89,91, что подтверждает необходимость обоих компонентов.

Тренировочный пайплайн состоит из трех этапов. Сначала видео VAE сжимает непрерывные видеокадры в компактные скрытые признаки, используя текстовые описания в качестве семантического контекста. Затем изображения, действия, язык и скрытые признаки преобразуются в единые дискретные токены для авторегрессивного предсказания следующего токена, с двойной супервизией как по пиксельному, так и по скрытому предсказанию. Предсказание пиксельных токенов служит контролем качества, предотвращая коллапс скрытого представления. Наконец, модуль генерации действий объединяет скрытые признаки с исторической информацией для вывода траектории, который проверяется как через оценку кандидатных траекторий, так и через прямую генерацию непрерывной траектории.

Вес супервизии скрытых признаков оказался критическим: отсутствие ограничения при тонкой настройке дало 90,17, оптимальный вес 0,1 достиг 90,59, а чрезмерный вес снизил до 89,75. Это предполагает, что умеренное ограничение сохраняет предобученную семантику, не ограничивая способность модели обнаруживать релевантные для вождения представления. Статья также подтверждает, что команда BYD работает над долгосрочными фундаментальными моделями автономного вождения, а не только над системами, специфичными для производства. Публикация утверждает BYD как серьезного участника в области исследований ИИ для автономного вождения, потенциально привлекая ведущих специалистов по ИИ и сигнализируя о стратегическом намерении разрабатывать ключевые технологии автономного вождения внутри компании, а не полагаться полностью на поставщиков. Это ставит BYD в один ряд с NIO, XPeng и Li Auto в гонке за лидерство в ИИ для автономного вождения, но с уникальным преимуществом: крупнейшей производственной базой для развертывания полученных технологий в массовом масштабе.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: