Между Kimi K3 и DeepSeek V4: Почему встроенная мультимодальность задаёт будущее передовых китайских моделей

мультимодальность ии агенты кодинг Moonshot Ai Deepseek pandaily.com

Узнайте, почему Moonshot AI, Alibaba и ByteDance делают ставку на нативное мультимодальное обучение, а DeepSeek, Zhipu и Tencent остаются текстовыми. Разберитесь, как «зрение в цикле» меняет агентные задачи и рейтинги моделей.

За последний год навыки программирования и агентные возможности переписали рейтинги моделей. По мере того как агенты берут на себя всё более длинные цепочки задач, универсальные модели теперь догоняют нативные мультимодальные возможности. Отчёт 36Kr прослеживает расхождение: Moonshot AI Kimi K3, Alibaba Qwen3.8-Max и ByteDance Doubao-Seed-2.1 сделали ставку на нативное мультимодальное обучение. По другую сторону DeepSeek, Zhipu и Tencent Hunyuan остаются текстовыми в своих последних универсальных базах. Лян Вэньфэн заявил, что для хорошего обучения ИИ не нужна модель мира или даже мультимодальность, но признал, что мультимодальность в конечном счёте всё равно потребуется. Компании сходятся в долгосрочной ценности, но расходятся в сроках и затратах. В фазе быстрой итерации кодинга вопрос о том, стоит ли синхронно обучать зрение, а также какой объём ёмкости модели, данных и вычислений вкладывать, формирует технологический маршрут ведущих китайских моделей.

Аргумент в пользу нативной мультимодальности начинается с того, как долго теперь рассуждают агенты. Для длинных цепочек задач, если получать только обратную связь на уровне кода, ошибки могут накапливаться, и конечные результаты становятся очень плохими. Зрение — более точный сигнал обратной связи. Когда агенты генерируют веб-страницы, управляют программным обеспечением и проверяют результаты выполнения, зрение превращается из входных данных, которые пользователь передаёт модели, в обратную связь, которую модель использует для проверки собственной работы и корректировки действий. Kimi K3 после релиза заняла первое место в рейтинге Arena Frontend Code с 1679 баллами. Этот рейтинг оценивает не только то, выполняется ли код, но и то, корректно ли отображается страница. Браузерная платформа Puter вставила пять визуальных отклонений в тестовые страницы; Kimi K3 сравнила целевую страницу со скриншотом работающей страницы и выявила все пять без ложных срабатываний. Moonshot AI называет этот подход «зрение в цикле»: модель пишет код, просматривает страницу, а затем продолжает корректировку на основе визуальных результатов.

Аргумент в пользу внешних визуальных инструментов гласит, что системы могут вызывать OCR или независимую VLM через агентный фреймворк или MCP, преобразуя изображения в текст или координаты перед передачей текстовой модели. Но у такого модульного подхода есть граница. Если вызывать инструмент, всё равно остаются две модели: одна LLM, которая слепа, в паре с вспомогательной downstream-моделью, которая видит. Внутренние нативные мультимодальные модели имеют более широкий канал связи между визуальным входом и языковым стволом, а не сначала сжимают изображение в текст, а затем передают его другой модели. Это различие распространяется и на пост-тренировку. Если модель может сделать это сама, это лучший результат. В длинных цепочках задач, требующих многократного взгляда на экран, различие становится более выраженным. Без нативной мультимодальности у модели нет глаз, и обратная связь ограничена текстом. Многие выходные данные, ориентированные на пользователя, являются визуальными: веб-страницы, изображения, видео. Модели необходимо понимать эти результаты и давать себе обратную связь.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

В тренде:


Похожие новости: