В тот же день, когда генеральный директор NVIDIA Дженсен Хуанг опубликовал свой первый пост в X в поддержку моделей ИИ с открытым исходным кодом вместе с 25 подписантами из индустрии, подразделение Bailing компании Ant Group выпустило Ling-3.0-flash — модель выполнения с общим количеством параметров 124B, но всего 5,1B активированных параметров, которая достигает более высокой плотности интеллекта, чем собственный флагман с триллионом параметров. Модель заняла первое место в 15 из 34 оценочных измерений и второе в 19, сравнявшись с DeepSeek V4 Flash по среднему баллу 67,6, при этом превзойдя собственную триллионную модель Ring-2.6-1T почти на 8 баллов. Ling-3.0-flash достигает показателя плотности интеллекта 0,5 и коэффициента эффективности 13,2 — оба являются самыми высокими среди сопоставимых моделей, демонстрируя, что целенаправленный дизайн модели выполнения может превзойти масштабирование общего назначения для конкретных задач.
Модель представляет собой стратегическую ставку на парадигму модели выполнения, отличную от моделей рассуждения. Ling-3.0-flash ставит во главу угла скорость и эффективность для задач агентов в реальном времени, написания кода и вызова функций. В SWE-Bench Pro для исправления ошибок в репозиториях кода она набрала 56,6%, заняв первое место. В ArtifactsBench для генерации полных интерактивных компонентов за один проход она достигла 77,0%, опередив модель, занявшую второе место, более чем на 10 пунктов. В MiniAppBench, требующем полной генерации приложения по одной инструкции, она показала 25,3% при среднем показателе 17% среди 16 моделей. Точность вызова функций BFCL-v4 достигла 73,0%, сравнявшись с Claude-Sonnet-4.6 за первое место. Сквозная оценка агента GDPVal v2-AA составила 1107 баллов — самый высокий показатель среди протестированных моделей.
Модель изначально поддерживает контекстные окна размером 256K. MRCR_256K достиг 81,1%. Многошаговое следование инструкциям Multi-IF составило 87,7%, что соответствует второму месту. Долговременная память инструкций LIFEBench набрала 77,3%, заняв первое место. Способность агентского поиска WideSearch составила 73,6% (третье место), в то время как в режиме мультиагентного взаимодействия BrowseComp достиг 82,0%, почти сравнявшись с Claude-Sonnet-4.6 (82,1%). Полный набор агент-ориентированных оценок подтверждает, что Ling-3.0-flash оптимизирован для парадигмы автономного выполнения задач, где модели управляют инструментами, навигируют по интерфейсам и выполняют многошаговые цели, а не генерируют развернутые цепочки рассуждений.
Ant Bailing открыла исходный код модели, веса станут доступны после окончания бесплатного пробного периода API 3 августа. Выход модели одновременно с письмом в поддержку открытого исходного кода при поддержке NVIDIA сигнализирует о том, что китайские ИИ-компании продолжают поддерживать открытый исходный код, даже пока Кремниевая долина обсуждает его риски. Ling-3.0-flash позиционирует эффективность как отличительную переменную: вместо конкуренции по общему количеству параметров модель демонстрирует, что для задач выполнения агентов хорошо спроектированная компактная модель выполнения с целенаправленным обучением может превзойти модели в 8 раз больше. Это соответствует отраслевым тенденциям перехода к специализированным моделям, поскольку экономика развертывания вывода становится основным ограничением. Еженедельный рейтинг на OpenRouter поднялся с 9-го на 6-е место за пять дней, а объем 29 июля отставал от DeepSeek V4 Pro всего на 0,5%, что подтверждает рыночный спрос на эффективные модели выполнения.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pandaily




