JD.com представила интерактивную аудиовизуальную модель JoyAI-EchoWM с открытым исходным кодом на конференции JDD

jd.com ии аудиовизуальные модели открытый исходный код графика технологии pandaily.com

JD.com открыла исходный код JoyAI-EchoWM и EchoWM-Flash на JDD, показав около 81,6–81,7 в WBench Navigation с унифицированным управлением камерой и нативной генерацией аудио-видео, а также анонсировав крупный GPU-кластер и логистический Superbrain 3.0.

JD.com представила JoyAI-EchoWM с открытым исходным кодом — интерактивную аудиовизуальную модель мира, анонсированную на глобальной технологической конференции JDDiscovery-2026, а также её более легкий потоковый вариант EchoWM-Flash. Модель, разработанная исследовательским подразделением JD.com в рамках семейства JoyAI-Echo, генерирует синхронизированное видео с фоновым звуком, музыкой и речью, реагируя в реальном времени на навигацию пользователя. Цель — создание интерактивных, управляемых и исследуемых медиа — миров, сохраняющих геометрию, объекты и звук при перемещении, поворотах и повторных посещениях, а не одноразовых кинематографических клипов.

Управление осуществляется через унифицированный интерфейс камеры-намерения. Дискретные команды с клавиатуры или контроллера преобразуются в непрерывные траектории с шестью степенями свободы, поэтому один и тот же поток намерений может управлять перемещением от первого лица или съемкой с преследованием от третьего лица без отдельных треков ролей или предустановленных параметров следования. В первом лице траектория — это движение наблюдателя; в третьем лице модель учится совместному движению объектов и кадрированию. Аудио генерируется совместно с видео: путь камеры обуславливает визуальную ветвь, а звук следует за событиями сцены, такими как шаги, столкновения, диалоги и музыка, без выделенного контроллера «действие-аудио». При многократном исследовании короткое отстающее аудиовизуальное окно становится контекстом для следующего сегмента, помогая сохранить композицию, внешний вид и звук — хотя команда отмечает, что явной постоянной трехмерной памяти по-прежнему нет, поэтому длительные сессии могут приводить к дрейфу.

В тесте WBench Navigation JoyAI-EchoWM показала средний результат около 81,6–81,7 по всем зафиксированным случаям, при этом согласованность и интерактивность оказались среди сильных подпунктов. EchoWM-Flash, четырехшаговая потоковая версия, показала результат около 81,0, сохраняя высокие показатели интерактивности. Дальнейшие проверки на SANA-WM-Bench и парные сравнительные исследования подчеркивают визуальное качество и следование камеры на коротких и длинных горизонтах. Обучение проводилось с использованием движка world-data, смешивающего игровые логи, записи человеческой игры, симуляцию с истинными позами из Unreal Engine и интернет-видео, затем последовало аудиовизуальное предварительное обучение, дообучение действий, совместное дообучение и авторегрессивное пост-обучение. Ссылки на код и статью общедоступны в репозитории jd-opensource JoyAI-Echo на GitHub.

Публичный релиз дополняет планы JD.com в области физического ИИ, представленные на том же мероприятии: создание отечественного кластера GPU примерно из 100 000 карт для обучения и инференса в реальном времени, сбор около 10 миллионов часов видео реальных сцен с воплощенным ИИ, а также JD Logistics Superbrain 3.0, который, по словам компании, сокращает время планирования сквозного пути посылок с минут до секунд. JoyAI-EchoWM позиционируется как китайская первичная открытая модель для интерактивных аудиовизуальных миров, а не как предложение для привлечения инвестиций.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: