В октябре 2025 года Microsoft впервые анонсировала собственную модель генерации изображений MAI-Image-1, которая дебютировала на 9-м месте в рейтинге генерации текста в изображения Arena. В марте этого года Microsoft AI анонсировала MAI-Image-2 — модель второго поколения со значительными улучшениями. Она заняла 3-е место в рейтинге Arena, уступив лишь gemini-3.1-flash-image-preview от Google и gpt-image-1.5-high-fidelity от OpenAI.
В мае команда Microsoft AI представила MAI-Image-2.5 — новейшую модель преобразования текста в изображение, которая дебютировала на 3-м месте в рейтинге Arena. Сегодня Microsoft анонсировала MAI-Image-2.5-Pro — свою самую детализированную модель генерации изображений на сегодняшний день. Эта модель ориентирована на сценарии, требующие детальной генерации и редактирования изображений, создания ключевых визуалов и более точного отображения текста внутри изображений.
MAI-Image-2.5-Pro будет стоить $5 за миллион входных текстовых токенов, $8 за миллион входных токенов изображений и $106 за миллион выходных токенов изображений. Заинтересованные пользователи могут уже сейчас бесплатно протестировать новую модель в MAI Playground.
После анонса публичной предварительной версии в прошлом году модель генерации речи MAI-Voice-1 от Microsoft стала общедоступной в апреле этого года. На конференции Build Microsoft анонсировала MAI-Voice-2 и её flash-версию с поддержкой более 15 дополнительных языков и новыми голосовыми опциями.
Сегодня Microsoft объявила о публичной предварительной версии MAI-Voice-2-Flash — модели преобразования текста в речь, предназначенной для низколатентных голосовых приложений с высоким объёмом запросов, таких как агенты службы поддержки. По заявлению Microsoft, новая модель работает вдвое быстрее и на 32% дешевле MAI-Voice-2, сохраняя при этом естественную просодию и качество звука. Цена составляет $15 за миллион символов.
Сегодня Microsoft отметила, что уже использует несколько собственных моделей MAI в различных производственных сервисах. Bing Image Creator теперь полностью работает на модели MAI-Image-2.5, а PowerPoint также использует MAI-Image-2.5 для функций преобразования изображений. Microsoft сообщила, что переход на MAI-Image-2 позволил снизить затраты на GPU до 84% по сравнению с GPT-Image-2 от OpenAI.
В OneDrive модель MAI-Image-2.5 теперь обеспечивает функции редактирования изображений, увеличив показатель сохранения на 26%, снизив P95-латентность примерно на 25% и обеспечив в 2,5 раза большую эффективность при среднем уровне нагрузки.
Модель MAI-Voice-2-Flash уже используется в Dynamics 365 Contact Center, снижая затраты на GPU до 89%. Теперь она доступна в составе Azure Voice Live, позволяя разработчикам создавать низколатентные агенты преобразования речи в речь.
Наконец, MAI-Transcribe-1.5 теперь обеспечивает многоязычную транскрипцию в Dragon Copilot на 58 языках.
Всегда имейте в виду, что редакции могут придерживаться предвзятых взглядов в освещении новостей.
Автор – Pradeep Viswanathan




