Tencent Robotics X открывает исходный код трёх воплощённых фундаментальных моделей: главный научный сотрудник Чжан Чжэнъю объясняет трёхуровневую архитектуру «мозга», решающую проблему скорости реакции роботов

Tencent Waic 2026 Vlm Rxbrain Vla робототехника pandaily.com

Tencent открывает исходный код трех воплощенных моделей на WAIC 2026: VLM для понимания сцен, когнитивная модель RxBrain для планирования с визуальными состояниями и VLA для непрерывных действий на 500-1000 Гц. Узнайте, как частотное разделение решает проблему задержек в робототехнике.

Лаборатория робототехники Tencent Robotics X представила с открытым исходным кодом три воплощенные фундаментальные модели на WAIC 2026: Hy-Embodied-VLM-1.0 для понимания пространства и сцен, Hy-Embodied-RxBrain-1.0 для когнитивного планирования с визуальным воображением состояний и Hy-Embodied-VLA-0.5 для преобразования целей высокого уровня в непрерывные моторные команды. Главный научный сотрудник, доктор Чжан Чжэнью, представил архитектуру как решение фундаментальной проблемы, которую текущие подходы VLA решают неадекватно: различные типы роботизированного интеллекта должны работать на разных частотах, поскольку физический мир сам функционирует в нескольких временных масштабах.

Это понимание возникло из неудачного эксперимента по переносу возможностей робота в OpenClaw, который вызвал задержки в десятки секунд, неприемлемые для физических роботов, где даже 2-3 секунды когнитивной задержки уже проблематичны.

Трехуровневая архитектура решает эту проблему за счет разделения частот. Hy-Embodied-VLM обрабатывает пространственное понимание на низкой частоте, интерпретируя визуальные сцены и отношения объектов. Hy-Embodied-RxBrain представляет собой значительную инновацию в когнитивной архитектуре: он не только генерирует шаги задач на языке, но и представляет, как должен выглядеть физический мир после выполнения каждой подзадачи, используя визуальные представления состояний, а не текстовые описания. Это устраняет фундаментальное ограничение систем планирования, основанных только на языке, где текстовые описания не могут эффективно кодировать пространственные отношения и физические ограничения, которые зрение передает мгновенно. Hy-Embodied-VLA работает на самой высокой частоте, преобразуя цели высокого уровня в непрерывные низкоуровневые действия со скоростью, достаточной для взаимодействия в реальном времени.

Tencent сообщила, что Hy-Embodied-VLA проходит производственные испытания на заводе по производству бытовой химии, обслуживая сборочные линии с высоким разнообразием, малыми партиями и интенсивным использованием SKU, с временем цикла на одно изделие менее 6 секунд. Модель может адаптироваться к новым SKU всего за 8 часов сбора данных и тонкой настройки. Среда тестирования критически отличается от лабораторных демонстраций: объекты расположены случайным образом, освещение меняется, происходят производственные сбои, и робот должен достичь почти нулевого уровня отказов. Доктор Чжан подчеркнул, что демо-версия с оценкой 80-90 баллов без реального развертывания практически не имеет ценности, и заводские испытания представляют собой приверженность измеримой промышленной производительности, а не бенчмарк-показателям.

Когнитивная модель RxBrain решает вторую продвинутую проблему: узкое место языка в роботизированном мышлении. Предыдущие системы Tairos полагались на текст для межмозговой коммуникации, но описание пространственных отношений объектов словами многословно и неоднозначно. Включая визуальное воображение состояний в цикл планирования, RxBrain достигает более высокой пропускной способности передачи информации между восприятием и действием. Модель описывается как воплощенная модель познания мира, а не полная модель мира, поскольку область еще не пришла к единой архитектуре модели мира. Вместе три модели и платформа с открытым исходным кодом Tairos формируют полный стек воплощенного интеллекта Tencent, доступный для внедрения любым разработчиком или производителем, и сообщество робототехники теперь может строить на той же частотно-осознанной архитектуре, которую Tencent разработала через реальные сбои и итеративные улучшения.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: