Что это
Это модель синтеза речи (text-to-speech) от компании Microsoft, разработанная для генерации голосового контента. Она способна создавать выразительную монофоническую речь с частотой 24 кГц.
Что умеет
Основное преимущество MAI-Voice-2-Flash низкая задержка, что делает её идеальной для сценариев, требующих мгновенного голосового ответа. Модель поддерживает 15 языков, что расширяет её применимость в международных проектах.
Кому подходит
Подходит для разработчиков голосовых помощников, интерактивных агентов, систем колл-центров, а также для создания аудио-нарративов и повышения доступности контента.
Любая модель отвечает только тем, что ей дали в контекст. ENGRAM держит знания команды - встречи, документы, переписку - в единой ИИ-памяти и подаёт модели нужное со ссылкой на источник. Данные в России.
Характеристики
| Провайдер | Microsoft |
| Контекст | - |
| Вход | текст |
| Выход | speech |
| Цена входа | $15 / 1М |
| Цена выхода | беспл. |
| Вызов инструментов | нет |
| Режим рассуждения | нет |
| Появилась | Июль 2026 |
| ID для API | microsoft/mai-voice-2-flash |
Где запустить: провайдеры
Модель раздаётся через 1 провайдеров. Сравнение по контексту, ценам:
| Провайдер | Контекст | Вход $/1М | Выход $/1М |
|---|---|---|---|
| Azure | - | $15 | беспл. |
Цена входа по провайдерам, $/1М
Доступ из России
Прямого доступа из РФ обычно нет: нужен VPN, оплата - зарубежной картой или через посредника. Для доступа без VPN и данных в России выбирайте российские модели.