Новости: мультимодальность
ByteDance Seedream 5.0 Pro: Возвращение мощнейшей нейросети для генерации изображений с точным редактированием и мультиязычностью
Команда ByteDance Seed выпускает Seedream 5.0 Pro с визуализацией сложной информации, точным редактированием, качеством реальной фотографии и нативной многоязычной генерацией в 17 тестовых сценариях.

Tencent HY переманивает исследователя OpenAI Тянь Юнлуна для работы над мультимодальным ИИ
Tencent HY нанимает научного сотрудника OpenAI Тянь Юнлуна в качестве нового руководителя команды мультимодальных моделей, подчиняющегося главному специалисту по ИИ Яо Шунью в рамках последней громкой кадровой перестановки в сфере ИИ.

Meta* запустила Muse Image — свою первую модель для генерации изображений от Superintelligence Labs
Новая модель Muse Image от Meta*, основанная на архитектуре Muse Spark, предлагает расширенные мультимодальные возможности для генерации и редактирования изображений, включая понимание сложных запросов и интеграцию с веб-контекстом.

Tencent Hunyuan переманила исследователя OpenAI Тянь Юнлуна для разработки мультимодального ИИ
Tencent Hunyuan нанимает исследователя OpenAI Тянь Юнлуна на должность нового руководителя команды мультимодальных моделей, подчиняющегося главному научному сотруднику Яо Шуньюй, в рамках последней громкой кадровой перестановки в сфере ИИ.

CVPR 2026 бьет рекорды: доля «Multimodal AI» выросла вдвое, а 4089 научных работ меняют вектор развития индустрии
Конференция CVPR 2026 открылась в Денвере с рекордными 16 092 заявками и 4 089 принятыми работами — скачок на 42% — поскольку исследования в области зрения, языка и мультимодального ИИ удвоили свою долю, что стало крупнейшим сдвигом в недавней истории конференции. Среди номинантов на награды работы от NVIDIA, CMU и UVA охватывают игровых агентов. — techtimes.com

Новая модель Gemma 4 12B от Google создана для работы на любом ноутбуке с 16 ГБ оперативной памяти
Новая модель Google Gemma 4 12B использует новую схему кодирования и предсказания токенов, чтобы превзойти ожидания, будучи достаточно эффективной для запуска на большинстве потребительских ноутбуков. — arstechnica.com

Stepfun открыла исходный код Step 3.7 Flash: оптимизированной LLM для эры агентов
Stepfun открывает исходный код Step 3.7 Flash — разреженной LLM на 196B параметров с архитектурой MoE, оптимизированной для рабочих процессов агентов, со скоростью 400 токенов/с и нативным вызовом инструментов. — pandaily.com

Google Gemini Omni Flash: будущее разговорного ИИ с голосовым редактированием видео
Google Gemini Omni Flash представляет голосовое управление редактированием видео на базе разговорного ИИ, мультимодальных инструментов и креативных рабочих процессов в реальном времени для современного создания контента. — techtimes.com

Самое просматриваемое:
- Вот как использовать новую кнопку “Плюс”…
- Bitcoin Depot оштрафован на $18,5 млн – сталкивается…
- WatchGuard бьёт тревогу: критическая уязвимость…
- Оверклокер обновил утилиту для разгона Hydra —…
- Как настроить ComfyUI для генерации изображений ИИ…
- Результаты еженедельного опроса: Samsung Galaxy Z…
- ECARX берет управление бизнесом Flyme OS в свои руки…
- Intel преодолела рубеж в миллион пластин,…
- США прикрыли платформу для хранения паролей, которой…
- Исследователи из MIT возродили 40-летнюю концепцию…

