Записи в текст3 мин чтения

ИИ аудио в текст: что реально делает нейросеть

В «ИИ аудио в текст» спрятаны две разные вещи: нейросеть, которая распознаёт речь, и языковая модель, которая пересказывает. Где считается каждая и чего ждать от точности.

КОРОТКИЙ ОТВЕТ

Слова «ИИ аудио в текст» описывают два разных механизма. Первый - нейросеть распознавания речи: она превращает звук в слова с временем. В ENGRAM это локальная модель, считает на вашем Маке, бесплатно, звук никуда не уходит. Второй - языковая модель, которая по готовому тексту пишет итог, выделяет решения и отвечает на вопросы. В ENGRAM это Pro, и работает она уже с текстом, а не со звуком. Путать их не стоит: точность текста определяет первая, а качество пересказа - вторая, и проверять надо обе.

Два ИИ под одним словом

Когда сервис пишет «ИИ переведёт аудио в текст», обычно имеется в виду первое. Когда обещает «ИИ сделает конспект», второе. Полезно знать, что вы покупаете.

Распознавание речиРазбор текста
Что на входеЗвукУже готовый текст
Что на выходеСлова, время, говорящиеИтог, решения, задачи, ответы на вопросы
Где считается в ENGRAMНа вашем компьютере, локальная модельНа сервере, только текст
Сколько стоитБесплатно, без лимита минутPro
Что проверятьИмена, числа, отрицанияНе приписан ли смысл, которого не было

Как работает распознавание и почему оно локальное

Модель распознавания загружается на компьютер один раз, при первом запуске. Дальше она слушает файл и выдаёт слова с временем; интернет для этого не нужен. Это не настройка «офлайн-режим», а устройство приложения: звуку просто некуда уходить.

Язык по умолчанию стоит «Определять сам», и так обычно точнее: если в русской речи попадаются английские названия, жёстко заданный русский заставляет модель подгонять их под похожие русские слова.

Говорящих модель разделяет по голосам. После первого разбора они подписаны как «Собеседник 1» и «Собеседник 2»; вы называете их один раз, и в следующих записях приложение узнаёт голоса само.

Настройки распознавания в ENGRAM: локальная модель, язык, хранение аудио
Настройки распознавания: локальная модель и язык. Звук с компьютера не уходит.

Что определяет точность, а что нет

  1. 01

    Звук важнее модели

    Микрофон в углу стола, кондиционер, двое говорят одновременно: текст поплывёт у любой модели. Запись созвона прямо приложением даёт чистый звук; телефон из кармана нет.

  2. 02

    Имена, числа, отрицания

    Модель передаёт речь, а не проверяет её на правду. Спорные места сверяются со звуком по тайм-коду: нажали на реплику, услышали.

  3. 03

    Термины и названия

    Одинаковую ошибку в фамилии проще исправить разом поиском с заменой, чем по одной.

  4. 04

    Слайды и надписи

    Речь распознаётся, текст в кадре нет. Если смысл лекции на слайдах, держите слайды рядом.

Расшифровка в ENGRAM: реплики по говорящим с тайм-кодами
Текст после разбора: реплики, время, говорящие. По времени возвращаетесь к спорному месту.

Что делает второй ИИ в Pro

Языковая модель получает готовый текст и пишет итог: о чём говорили, что решили, какие задачи назвали и с кем. У задачи четыре поля, и все из разговора: что, кто, к какому дню, где в записи прозвучало. Если срок не назван, задача остаётся без даты.

По накопленным записям можно задать вопрос и получить ответ со ссылкой на реплику, из которой он взят. Это черновик для человека, а не окончательный протокол.

Подготовленный пример
Распознавание · 04:24

Хорошо, отправлю оба варианта сметы в пятницу.

Разбор в Pro

Задача: отправить два варианта сметы. Срок: пятница. Источник: 04:24.

Чего разбор не сделал

Не придумал дату пятницы и время отправки: их не произнесли.

Пример собран вручную, чтобы показать границу между распознаванием и разбором. Не результат реального прогона.

Что стоит знать

Бесплатной пробной версии Pro нет, и это не уловка: распознавание, поиск и экспорт бесплатны сами по себе, а разбор текста это отдельная услуга. Что именно уходит на сервер в Pro и когда, описано на странице про данные.

Частые вопросы

Что такое ИИ в расшифровке аудио?
Под одним словом скрыты две разные вещи. Первая: нейросеть распознавания речи, которая превращает звук в текст. Вторая: языковая модель, которая потом пересказывает этот текст. Считаются они в разных местах и стоят по-разному.
Где считается каждая из них в ENGRAM?
Распознавание речи идёт на вашем Mac и бесплатно. Языковая модель работает на сервере и только в Pro, причём туда уходит уже готовый текст, а не звук.
Какая из них ошибается чаще?
Ошибаются обе, но по-разному. Распознавание путает имена, числа и термины, и это видно. Языковая модель может уверенно пересказать то, чего не было, и это не видно. Поэтому у неё обязательна ссылка на реплику-источник.
Можно ли обойтись без языковой модели?
Да. Текст, говорящие, поиск и экспорт работают без неё и бесплатно. Модель нужна, когда надо получить вывод, а не найти реплику.
Насколько точна нейросеть на русском?
На обычной речи при нормальном звуке уверенно. Чужих замеров мы не приводим, а свои имеет смысл делать на своей записи: точность сильно зависит от микрофона и от того, сколько людей говорят одновременно.
Учится ли модель на моих записях?
Нет. Распознавание работает локально готовой моделью, а в Pro на сервер уходит только текст выбранных материалов и только по вашей команде.

Попробуйте на своей записи.

Установите ENGRAM и получите текст бесплатно, без лимита минут.

СКАЧАТЬ ДЛЯ MAC ↗

Иллюстрации и примеры в материале подготовлены для объяснения. Они не являются историями клиентов или измерениями качества приложения.