Команда Института автоматизации Китайской академии наук (CASIA) предложила мировую модель PhiZero, которая разделяет задачу понимания физической динамики и задачу отрисовки кадров. Статья под названием «PhiZero: A World Model Built Around Physical Language» была опубликована на arXiv и на этой неделе начала распространяться в сообществе воплощённого ИИ.
Мировые модели, предсказывающие будущее видео покадрово, как правило, смешивают две совершенно разные задачи в одном пространстве предсказаний. Внешний вид сцены, её текстуры, освещение и фон делят ёмкость параметров с динамикой, перемещающей объекты во времени. Группа CASIA утверждает, что именно это смешение является причиной того, что мировые модели в пиксельной области часто создают визуально убедительные кадры, которые при последовательном просмотре отклоняются от физической правдоподобности.
PhiZero разделяет конвейер предсказаний на два этапа. Первый этап принимает текущее состояние мира и действие и выдаёт короткую последовательность дискретных токенов, которые авторы называют «физическим языком». Второй этап использует эти токены как сжатый план движения и только затем отрисовывает следующие кадры. Модуль токенизатора, построенный на основе Q-Former уровня переходов и конечного скалярного квантования (FSQ), генерирует дискретные токены. Диффузионный декодер повторно использует внешний вид первого кадра в качестве высокочастотного априорного условия, чтобы языковые токены могли тратить свою ёмкость на движение, а не на текстуру.
Сжатие является значительным. Для четырёхсекундного клипа из 33 кадров PhiZero использует 256 токенов физического языка из словаря объёмом примерно 25 000 записей. Для сравнения, VAE Wan2.2 требует 44 800 непрерывных визуальных токенов для того же клипа. Это примерно 175-кратное сокращение количества токенов, которые мировая модель должна потреблять и предсказывать. Качество реконструкции остаётся конкурентоспособным по сравнению с другими видеотокенизаторами с сильным сжатием.
Следствие носит структурный характер. Если мировые модели смогут рассуждать на основе коротких дискретных траекторий состояний, а не длинных непрерывных потоков пикселей, то робототехника, автономное вождение и агенты воплощённого ИИ получат представление, которое ближе к языку программирования, чем к видеокодеку. Вклад PhiZero заключается не столько в точном значении 175x, сколько в ставке на то, что физический язык, подобно естественному языку, может стать субстратом, на котором строятся мировые модели.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




