TaichuAI представила ZDTaichu5.0-9B с открытым исходным кодом — мультимодальную базовую модель примерно с 9 миллиардами параметров, предназначенную для общего визуального понимания, пространственного мышления, использования агентами инструментов и исследований в области воплощенного ИИ. Модель сочетает языковую основу Qwen3.5-9B с визуальным энкодером C-RADIOv4-H, принимает текст, одиночные или множественные изображения и видео любого разрешения, а также поддерживает длину контекста до 128 тыс. токенов. TMTPost резюмировал релиз от 15 сентября как сосредоточенный на восприятии пространства в физическом мире, преобразованиях между видами и планировании воплощенных задач.
В общедоступной карточке модели TaichuAI сообщает о первом месте среди сравниваемых универсальных мультимодальных моделей (~10 млрд параметров) по широте охвата зрения, а также по пространственным, воплощенным задачам и задачам агентов. Среди выделенных показателей для пространственных и воплощенных задач: ViewSpatial 62.50, MMSI-Bench 47.20, MindCube-tiny 78.27, ERQA 48.00 и RoboSpatial 56.00. В задачах агентов и наборах инструкций согласно оценкам в карточке, TAU2-Bench достигает 87.70, Claw-Eval общий средний балл — 71.40, а IFEval — 93.70. Описывается, что энтропийное адаптивное рекуррентное обучение выделяет дополнительные шаги латентной доработки для более сложных токенов.
Охват возможностей включает OCR и понимание документов, визуальную математику, тонкие 2D-отношения, ассоциацию между несколькими видами, 3D-сцены и перспективу, отслеживание нескольких изображений и видео в рамках длинного контекстного окна, а также планирование многошагового использования инструментов — при этом выполнение команд остается ответственностью хост-приложения. Темы пространственного обучения в карточке включают относительные отношения, плотный подсчет и определение границ, движение камеры и порядок глубины, эгоцентричные и аллоцентричные виды, а также высокоуровневое планирование возможностей и действий для адаптации в стиле VLA.
Веса доступны на Hugging Face как TaichuAI/ZDTaichu5.0-9B под лицензией NVIDIA Open Model License, с сохранением уведомлений Apache-2.0 от Qwen3.5. Для обслуживания используется пользовательская ветка vLLM 0.26.0 и образ Docker от TaichuAI для конечных точек, совместимых с OpenAI, с рекомендуемыми пресетами сэмплирования для пространственной привязки по сравнению с общими задачами. Как и в случае с другими карточками моделей, разработанными поставщиками, внешние лаборатории должны рассматривать лидирующие позиции в бенчмарках как заявленные в рамках указанных запросов и судей, до получения результатов сторонних репликаций — но сочетание открытого мультимодального чекпоинта среднего размера, акцента на пространстве/агентах и готовой упаковки vLLM предоставляет исследователям конкретный артефакт для оценки.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




