«Мир концептов» от Кайчэна Юя из Westlake University: первое выступление создателя модели

World Models Ai Autonomous Driving Awomo Yu Kaicheng Implicit Models pandaily.com

Познакомьтесь с неявной моделью мира Awomo: после раунда seed-plus-angel на 100 млн юаней основатель Юй Кайчэн представляет подход, превосходящий закон масштабирования, который он когда-то помог написать.

Когда Юй Кайчэн впервые заговорил о world models в 2023 году, он постоянно слышал в ответ, что эта область слишком далека, даже фантастична. Три года спустя, когда Фэй-Фэй Ли, Ян ЛеКун и поток новых участников привлекли миллиарды, world models стали главной нарративной темой физического ИИ. Юй, к тому времени уже чемпион мира на треке автономного вождения ECCV и номер один в бенчмарке Fail2Drive, сделал наименее интуитивное действие, доступное исследователю: он отверг саму технику, которая принесла ему эти титулы.

Путь Юя пролегает через академию DAMO Alibaba, куда он пришёл в качестве Alibaba Star после защиты докторской по AutoML. Его работа BEVFusion, объединяющая LiDAR и камеру в единое физическое пространство, стала одной из самых цитируемых статей в области мультисенсорного восприятия и хайлайтом NeurIPS 2022. После DAMO он перешёл в Университет Вестлейк в 2023 году, чтобы основать AutoLab и создавать генеративные world models для автономного вождения. Внедрение в сотрудничестве с ведущим китайским автопроизводителем разрушило прежнее допущение. Если модель уже может генерировать реалистичные данные, рассудил Юй, значит, она уже частично понимает мир. Продолжать рендерить пиксели — лишь дорогостоящий крюк.

В конце 2024 года команда перешла на неявный путь. Модель больше не рендерит пиксели; вместо этого она строит представления физических концепций в абстрактном математическом латентном пространстве, разлагает сцены на конечный набор компонуемых концепций и перекомбинирует их для обработки ситуаций, которые никогда не встречались полностью в обучающих данных. Юй относит этот подход к тому же неявному лагерю, что и JEPA ЛеКуна, но с иным ответом на вопрос «что живёт в латентном пространстве»: компонуемые физические концепции, обучаемые сквозным образом. Внутренние эксперименты 2025 года показали заметный прирост показателя успешности на сложных задачах по сравнению с базовыми методами имитационного обучения и обучения с подкреплением, при этом стоимость предсказания осталась ниже.

В январе 2026 года Юй выделил исследование из лаборатории в компанию Awomo, базирующуюся в Ханчжоу. Основателями были только Юй и главный научный сотрудник Тун; пять месяцев спустя к ним присоединилась группа, которую Юй описывает как «последовательно самоутверждающихся гениев». Awomo закрыла раунд финансирования seed и angel на сумму более 100 миллионов юаней при поддержке InnoFund, Dongfang Jiafu Fund, Zhengxuan Investment, Tianqi Capital, Westlake Innovation Fund и Jinma Investment.

Ставка Awomo заключается в том, что потолок закона масштабирования, который Юй когда-то помог построить, не распространяется на физический интеллект. Модель в стиле VLA, дообученная на большем количестве демонстраций, не сможет внезапно понять новую заводскую планировку. Модель, научившаяся разлагать сцену на концепции, может перекомбинировать их на лету: поймать падающую чашку, одновременно закрывая дверь, вместо того чтобы механически завершить одну подзадачу перед следующей. Первый релиз, Awomo-v0.1, уже был оценён на тестовом стенде RoboTwin 2.0.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: