Что это
MAI-Voice-2 - это нейросетевая модель для синтеза речи, разработанная Microsoft на базе Azure AI Speech. Она преобразует текстовые запросы в естественное и выразительное звучание. Модель поддерживает более 10 языков и позволяет управлять эмоциональной окраской голоса.
Что умеет
Сильные стороны модели - высокое качество и естественность синтезируемой речи, а также поддержка экспрессивных стилей (например, радостный, грустный, взволнованный) через SSML. Она отлично подходит для создания голосового контента с нужной интонацией и эмоциональным окрасом, что выделяет её среди более простых TTS-решений.
Кому подходит
Модель подходит разработчикам для интеграции в приложения, создателям контента для озвучки материалов и всем, кому нужен качественный синтез речи с контролем над выразительностью.
Любая модель отвечает только тем, что ей дали в контекст. ENGRAM держит знания команды - встречи, документы, переписку - в единой ИИ-памяти и подаёт модели нужное со ссылкой на источник. Данные в России.
Характеристики
| Провайдер | Microsoft |
| Контекст | - |
| Вход | текст |
| Выход | speech |
| Цена входа | $22 / 1М |
| Цена выхода | беспл. |
| Вызов инструментов | нет |
| Режим рассуждения | нет |
| Появилась | Июнь 2026 |
| ID для API | microsoft/mai-voice-2 |
Где запустить: провайдеры
Модель раздаётся через 1 провайдеров. Сравнение по контексту, ценам:
| Провайдер | Контекст | Вход $/1М | Выход $/1М |
|---|---|---|---|
| Azure | - | $22 | беспл. |
Цена входа по провайдерам, $/1М
Доступ из России
Прямого доступа из РФ обычно нет: нужен VPN, оплата - зарубежной картой или через посредника. Для доступа без VPN и данных в России выбирайте российские модели.