XPeng представил крупнейшее на сегодняшний день обновление своей модели Vision-Language-Action второго поколения, и ключевое изменение обманчиво просто: теперь ИИ понимает время. На тематической презентации физического ИИ под названием «TIME» компания сообщила, что её базовая модель поднялась от статического 3D-пространственного понимания к динамическому 4D-пониманию пространства-времени, а новое программное обеспечение XOS 6.3.0 дебютирует глобально на G9L.
В основе этого скачка — три технологии. Infini-VLA, архитектура с длинным горизонтом, запоминает до 30 секунд дорожной сцены, связывая непрерывные события вождения в целостное временное понимание. Streaming Inference переводит модель с дискретных рассуждений на непрерывную параллельную обработку, сокращая сквозную задержку ответа в 3 раза. X-Foresight, предсказательная модель мира, предвосхищает поведение окружающих участников дорожного движения на срок до шести секунд вперёд, улучшая реакцию на внезапные перестроения и резкие торможения. Количество параметров на устройстве выросло в 3,5 раза, что более чем в 15 раз превышает показатели массовых VLA-моделей, а комплексная многомерная безопасность улучшилась в 20 раз.
Компания также представила Master Agent — не привязанный к конкретному автомобилю «мозг», построенный на её мультимодальной модели Omni, который объединяет VLA-восприятие с кокпитом VLM, автоматически разбирая намерения пользователя и координируя системы автономного вождения, шасси и салона. Новые голосовые функции, например запрос остановки голосом, фактически привносят в серийные автомобили возможности уровня L4, характерные для роботакси.
Обновление выходит на фоне того, как XPeng делает более широкую ставку на физический ИИ. Её робототехнический бизнес недавно закрыл первый частный раунд на сумму более 900 миллионов долларов при оценке свыше 6,3 миллиарда долларов — рекорд для одного раунда в китайском секторе воплощённого интеллекта — при поддержке IDG, Gaorong, Tencent и Alibaba.
Амбиция XPeng — единая модель физического мира, которая рассматривает вождение, роботов и интеллект салона как одну непрерывную задачу рассуждения с учётом времени, а не как отдельные точечные задачи. Кодируя время в модели, компания делает ставку на то, что следующий скачок в автономии будет меньше похож на восприятие и больше — на понимание мира по мере его разворачивания.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




