Что это
GPT Audio - это мультимодальная модель от OpenAI, которая работает как с текстом, так и с аудио. Она представляет собой первую общедоступную аудиомодель компании с улучшенным декодером для более естественного звучания голосов. Модель способна обрабатывать аудиовход и генерировать текстовый или аудиовыход.
Что умеет
Модель выделяется способностью работать с аудиофайлами наравне с текстом, что открывает возможности для создания голосовых ассистентов, аудиотранскрипции и синтеза речи. Улучшенный декодер обеспечивает более натуральное звучание голосов и лучшую консистентность. Поддержка инструментов позволяет интегрировать модель в сложные рабочие процессы.
Кому подходит
Подходит разработчикам голосовых интерфейсов, создателям контента для синтеза речи, а также для задач транскрибирования аудио и создания аудиоассистентов.
Любая модель отвечает только тем, что ей дали в контекст. ENGRAM держит знания команды - встречи, документы, переписку - в единой ИИ-памяти и подаёт модели нужное со ссылкой на источник. Данные в России.
Характеристики
| Провайдер | OpenAI |
| Контекст | 128 000 токенов |
| Вход | текст, аудио |
| Выход | текст, аудио |
| Цена входа | $2.5 / 1М |
| Цена выхода | $10 / 1М |
| Макс. вывод | 16 384 токенов |
| Вызов инструментов | да |
| Режим рассуждения | нет |
| Появилась | Январь 2026 |
| ID для API | openai/gpt-audio |
Где запустить: провайдеры
Модель раздаётся через 1 провайдеров. Сравнение по контексту, ценам:
| Провайдер | Контекст | Вход $/1М | Выход $/1М |
|---|---|---|---|
| OpenAI | 128K | $2.5 | $10 |
Цена входа по провайдерам, $/1М
Доступ из России
Прямого доступа из РФ обычно нет: нужен VPN, оплата - зарубежной картой или через посредника. Для доступа без VPN и данных в России выбирайте российские модели.