Microsoft расширяет собственное ИИ-наступление с помощью новых моделей для изображений и голоса

Microsoft Mai-Image Mai-Voice ии генерация изображений текст-в-речь neowin.net

Microsoft анонсировала MAI-Image-2.5-Pro для корпоративных задач с высокой детализацией и точным рендерингом текста. Представлена MAI-Voice-2-Flash — вдвое быстрее и на 32% дешевле предшественницы. Модели уже внедрены в Bing, PowerPoint, OneDrive и Dynamics 365.

В октябре 2025 года Microsoft впервые анонсировала собственную модель генерации изображений MAI-Image-1, которая дебютировала на 9-м месте в рейтинге генерации текста в изображения Arena. В марте этого года Microsoft AI анонсировала MAI-Image-2 — модель второго поколения со значительными улучшениями. Она заняла 3-е место в рейтинге Arena, уступив лишь gemini-3.1-flash-image-preview от Google и gpt-image-1.5-high-fidelity от OpenAI.

В мае команда Microsoft AI представила MAI-Image-2.5 — новейшую модель преобразования текста в изображение, которая дебютировала на 3-м месте в рейтинге Arena. Сегодня Microsoft анонсировала MAI-Image-2.5-Pro — свою самую детализированную модель генерации изображений на сегодняшний день. Эта модель ориентирована на сценарии, требующие детальной генерации и редактирования изображений, создания ключевых визуалов и более точного отображения текста внутри изображений.

MAI-Image-2.5-Pro будет стоить $5 за миллион входных текстовых токенов, $8 за миллион входных токенов изображений и $106 за миллион выходных токенов изображений. Заинтересованные пользователи могут уже сейчас бесплатно протестировать новую модель в MAI Playground.

После анонса публичной предварительной версии в прошлом году модель генерации речи MAI-Voice-1 от Microsoft стала общедоступной в апреле этого года. На конференции Build Microsoft анонсировала MAI-Voice-2 и её flash-версию с поддержкой более 15 дополнительных языков и новыми голосовыми опциями.

Сегодня Microsoft объявила о публичной предварительной версии MAI-Voice-2-Flash — модели преобразования текста в речь, предназначенной для низколатентных голосовых приложений с высоким объёмом запросов, таких как агенты службы поддержки. По заявлению Microsoft, новая модель работает вдвое быстрее и на 32% дешевле MAI-Voice-2, сохраняя при этом естественную просодию и качество звука. Цена составляет $15 за миллион символов.

Сегодня Microsoft отметила, что уже использует несколько собственных моделей MAI в различных производственных сервисах. Bing Image Creator теперь полностью работает на модели MAI-Image-2.5, а PowerPoint также использует MAI-Image-2.5 для функций преобразования изображений. Microsoft сообщила, что переход на MAI-Image-2 позволил снизить затраты на GPU до 84% по сравнению с GPT-Image-2 от OpenAI.

В OneDrive модель MAI-Image-2.5 теперь обеспечивает функции редактирования изображений, увеличив показатель сохранения на 26%, снизив P95-латентность примерно на 25% и обеспечив в 2,5 раза большую эффективность при среднем уровне нагрузки.

Модель MAI-Voice-2-Flash уже используется в Dynamics 365 Contact Center, снижая затраты на GPU до 89%. Теперь она доступна в составе Azure Voice Live, позволяя разработчикам создавать низколатентные агенты преобразования речи в речь.

Наконец, MAI-Transcribe-1.5 теперь обеспечивает многоязычную транскрипцию в Dragon Copilot на 58 языках.

Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.

Похожие новости: