Лаборатория робототехники Tencent Robotics X представила с открытым исходным кодом три воплощенные фундаментальные модели на WAIC 2026: Hy-Embodied-VLM-1.0 для понимания пространства и сцен, Hy-Embodied-RxBrain-1.0 для когнитивного планирования с визуальным воображением состояний и Hy-Embodied-VLA-0.5 для преобразования целей высокого уровня в непрерывные моторные команды. Главный научный сотрудник, доктор Чжан Чжэнью, представил архитектуру как решение фундаментальной проблемы, которую текущие подходы VLA решают неадекватно: различные типы роботизированного интеллекта должны работать на разных частотах, поскольку физический мир сам функционирует в нескольких временных масштабах.
Это понимание возникло из неудачного эксперимента по переносу возможностей робота в OpenClaw, который вызвал задержки в десятки секунд, неприемлемые для физических роботов, где даже 2-3 секунды когнитивной задержки уже проблематичны.
Трехуровневая архитектура решает эту проблему за счет разделения частот. Hy-Embodied-VLM обрабатывает пространственное понимание на низкой частоте, интерпретируя визуальные сцены и отношения объектов. Hy-Embodied-RxBrain представляет собой значительную инновацию в когнитивной архитектуре: он не только генерирует шаги задач на языке, но и представляет, как должен выглядеть физический мир после выполнения каждой подзадачи, используя визуальные представления состояний, а не текстовые описания. Это устраняет фундаментальное ограничение систем планирования, основанных только на языке, где текстовые описания не могут эффективно кодировать пространственные отношения и физические ограничения, которые зрение передает мгновенно. Hy-Embodied-VLA работает на самой высокой частоте, преобразуя цели высокого уровня в непрерывные низкоуровневые действия со скоростью, достаточной для взаимодействия в реальном времени.
Tencent сообщила, что Hy-Embodied-VLA проходит производственные испытания на заводе по производству бытовой химии, обслуживая сборочные линии с высоким разнообразием, малыми партиями и интенсивным использованием SKU, с временем цикла на одно изделие менее 6 секунд. Модель может адаптироваться к новым SKU всего за 8 часов сбора данных и тонкой настройки. Среда тестирования критически отличается от лабораторных демонстраций: объекты расположены случайным образом, освещение меняется, происходят производственные сбои, и робот должен достичь почти нулевого уровня отказов. Доктор Чжан подчеркнул, что демо-версия с оценкой 80-90 баллов без реального развертывания практически не имеет ценности, и заводские испытания представляют собой приверженность измеримой промышленной производительности, а не бенчмарк-показателям.
Когнитивная модель RxBrain решает вторую продвинутую проблему: узкое место языка в роботизированном мышлении. Предыдущие системы Tairos полагались на текст для межмозговой коммуникации, но описание пространственных отношений объектов словами многословно и неоднозначно. Включая визуальное воображение состояний в цикл планирования, RxBrain достигает более высокой пропускной способности передачи информации между восприятием и действием. Модель описывается как воплощенная модель познания мира, а не полная модель мира, поскольку область еще не пришла к единой архитектуре модели мира. Вместе три модели и платформа с открытым исходным кодом Tairos формируют полный стек воплощенного интеллекта Tencent, доступный для внедрения любым разработчиком или производителем, и сообщество робототехники теперь может строить на той же частотно-осознанной архитектуре, которую Tencent разработала через реальные сбои и итеративные улучшения.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




