Новости: мультимодальность
Alibaba представляет Qwen-Image-2.1: модель генерации и редактирования с 7 миллиардами параметров и поддержкой RGBA
Представляем Qwen-Image-2.1: модель генерации и редактирования изображений от Alibaba с 7 млрд параметров. Получите нативную RGBA-прозрачность, до 10 эталонных изображений и редактирование с сохранением идентичности. Используйте для стикеров, композитинга и рестайлинга. Лицензия — исследовательская, коммерческое использование — по запросу.

TaichuAI открывает исходный код пространственной мультимодальной модели ZDTaichu5.0-9B
TaichuAI выпустила ZDTaichu5.0-9B — открытую мультимодальную модель (~9 млрд параметров) с поддержкой ввода изображений/видео любого разрешения и заявленными показателями в пространственных задачах и задачах агентов: ViewSpatial 62.5, MMSI 47.2, MindCube-tiny 78.3, TAU2 87.7 и Claw-Eval 71.4.

DeepSeek запускает «Time-Boxed V4.1 Flash Beta» с нативной мультимодальной архитектурой
DeepSeek запустила краткую внутреннюю бета-версию V4.1 Flash с новой архитектурой и нативной мультимодальной поддержкой. API ID deepseek-v4.1-flash-expires-on-0910 имеет цену V4 Flash, ограничен 20 одновременными запросами и истекает около 10 сентября. Оцените новую архитектуру до истечения срока действия!

Ant Group представила мультимодальную модель Ling-3.0-flash-VL с функцией визуальной обратной связи
Ant Group и inclusionAI открыли исходный код Ling-3.0-flash-VL — мультимодальной модели MoE на 124 млрд параметров с 5,5 млрд активных. Веса BF16 и FP8 доступны с 9 сентября. Используйте цикл обратной связи по зрению для GUI, фронтенда и медицинских задач.

ДипСик Harness выпускает первое крупное обновление после бета-тестирования: 14 изменений приносят улучшения «multimodal» и «subagent»
Оцените первое крупное обновление DeepSeek Harness после беты: v0.1.0-rc.8 с 14 изменениями. Задействуйте мультимодальный ввод, саб-агенты, улучшенный терминал. Нативные запросы изображений и смешанный ввод позволяют агентам обрабатывать скриншоты. Инструментальное зрение через OCR и анализ пикселей даёт текстовым моделям способность «видеть».

«Локальный Opus? Alibaba Qwen открывает исходники Qwen3.8-27B — передовые результаты в кодинге и агентных задачах, работающие на 17 ГБ ОЗУ»
Команда Qwen из Alibaba открыла исходный код Qwen3.8-27B, которая за два дня возглавила мировой рейтинг Hugging Face и превысила миллион загрузок. Зарубежные разработчики прозвали её «домашним» Opus 4.6: модель с менее чем 30B параметров превосходит все выпущенные четыре месяца назад модели, включая Opus 4.6, сравнима с DeepSeek V4-Pro и GPT 5.6 Luna, а в квантифицированном виде работает на 17 ГБ RAM.

Между Kimi K3 и DeepSeek V4: Почему встроенная мультимодальность задаёт будущее передовых китайских моделей
Узнайте, почему Moonshot AI, Alibaba и ByteDance делают ставку на нативное мультимодальное обучение, а DeepSeek, Zhipu и Tencent остаются текстовыми. Разберитесь, как «зрение в цикле» меняет агентные задачи и рейтинги моделей.

“Alibaba” выпускает официальную версию Qwen3.8-Max: 2,4 триллиона параметров, контекстное окно на 1 миллион токенов, способность к долгосрочной работе агента, и открытый исходный код в течение недели
Alibaba выпустила Qwen3.8-Max с 2,4 трлн параметров и контекстом в 1 млн токенов. Модель значительно улучшила программирование и офисные задачи, войдя в мировой топ-уровень. Открытые веса обещаны через неделю. Узнайте о возможностях долгосрочного агента и мультимодальной обработке.

Самое просматриваемое:
- Вот как использовать новую кнопку “Плюс”…
- Bitcoin Depot оштрафован на $18,5 млн – сталкивается…
- WatchGuard бьёт тревогу: критическая уязвимость…
- Оверклокер обновил утилиту для разгона Hydra —…
- Как настроить ComfyUI для генерации изображений ИИ…
- Результаты еженедельного опроса: Samsung Galaxy Z…
- ECARX берет управление бизнесом Flyme OS в свои руки…
- Intel преодолела рубеж в миллион пластин,…
- США прикрыли платформу для хранения паролей, которой…
- Исследователи из MIT возродили 40-летнюю концепцию…

