время прочтения: 10 мин
17

Транскрибация аудио в текст: программы для бизнеса и что они реально умеют

команда pickTech
Советы для бизнеса

Расшифровка превращает запись разговора в документ, по которому можно искать.

Представим ситуацию. Позвонил клиент и попросил сделать скидку, которую ему обещали в прошлом разговоре. Запись этого общения лежит в архиве, менеджер помнит смутно. Руководитель отбирает звонки за неделю ради нужных 30 секунд и слушает все аудио подряд. К обеду фраза находится, но вопрос давно не актуален, и повторять поиск он не станет.

Запись разговора решает задачу хранения, но найти нужную информацию в аудио сложно. Приходится слушать, перематывать вслепую, никакого поиска по словам. Поэтому нужна расшифровка разговора, которую готовят программы для транскрибации звонков. Ее можно прочитать по диагонали, искать по фразам в тексте, показывать новичку на обучении.

Команда pickTech разобрала несколько решений, из которых можно выбрать продукт под свою задачу. Также составили список вопросов к вендору перед покупкой.

Транскрибация и речевая аналитика — разные функции

Частая ошибка ниши — объединять два разных класса продуктов в один.

Транскрибация аудио в текст — это перевод звука в письменный вид. На входе аудио или запись звонка, на выходе текстовая расшифровка. Технически работу выполняет распознавание речи: сервис слышит аудио и печатает словами. Система не оценивает разговор и не делает выводов.

Речевая аналитика начинается с готового текста и превращает расшифровку в показатели и отчеты для руководителя. Это отдельный продукт. Подробно класс таких решений разобран в нашем материале о речевой аналитике для отделов продаж и колл-центров.

Чем транскрибация отличается от речевой аналитики
Чем транскрибация отличается от речевой аналитики

Задачу «быстро находить нужное в звонках и показывать текст сотрудникам» закрывают программы для транскрибации. Чтобы «понимать происходящее в разговорах в целом», нужна аналитическая надстройка.

Стоимость программы: за минуту, за файл или за подписку

Цену в нише считают тремя способами.

Поминутная оплата. За каждую минуту обработанного аудио. Понятно на небольшом потоке. Чем больше разговоров, тем выше цена.

Пакет или подписка. Фиксированная сумма в месяц и лимит минут. Удобна на стабильном объеме: расход известен заранее. Но если в сезон лимит заканчивается, то оплата за минуту сверх пакета обычно дороже.

Бесплатный порог. Это демо-режим для знакомства с программой. Часть сервисов расшифровывает без оплаты несколько записей или десятки минут. Лимит установлен на длину аудио или на количество минут.

Цена минуты без привязки к объему ничего не говорит. Нужно посмотреть ваш отчет телефонии за прошлый месяц, найти суммарную длительность звонков и умножить на стоимость минуты. На потоке разница в цене минуты превращается в заметную строку бюджета, поэтому нужно сравнивать предложения именно на своих цифрах.

Форматы аудио на входе и выходе

От формы выдачи файла зависит, встроится ли сервис в работу или останется функцией в интерфейсе.

Вход. Готовые файлы — это аудио и видео, загруженные вручную. При автоматической записи из телефонии звонок сохраняется и уходит на обработку. При живом потоке аудио записывается по ходу разговора. Расширения у сервисов различаются, их нужно сверять на сайтах продуктов.

Выход. Текстовый формат разговора может быть в четырех видах, которые друг друга не заменяют.

  • Текст в интерфейсе. Расшифровка открывается рядом с записью: зашли в карточку разговора и прочитали. Подходит руководителю для разбора отдельных случаев вручную.
  • Файл на скачивание. Расшифровку скачивают, прикладывают к задаче, отправляют почтой, распечатывают.
  • Уведомление на свой адрес. Сервис отправляет текст на указанный адрес сразу по окончании разговора (механизм обычно называют webhook), без ручной выгрузки.
  • Программный доступ. Система компании забирает текст автоматически. Для сценариев в реальном времени другой формы нет, и поддерживают ее не все вендоры.

Разделение речи собеседников. Эту функцию нужно проверять в продукте до оплаты. Разбирать спорный звонок по сплошному полотну тяжело. Не видно, кто что сказал и кто кого перебил. Текст в формате диалога, с речью сотрудника, отделенной от речи клиента, легко читать и использовать.

Схема: как запись разговора превращается в текст и в каком виде отдается
Схема: как запись разговора превращается в текст и в каком виде отдается

Шесть вопросов себе и вендору перед покупкой

Перед тем, как покупать продукт, нужно получить ответы на несколько важных вопросов.

  • Сколько минут в месяц нужно расшифровывать. Фактическая длительность звонков за прошлый месяц определяет и модель оплаты, и порядок суммы.
  • В каком виде нужно получить текст. Посмотреть в интерфейсе, скачать или забрать программно — это разные потребности, под каждую из которых подходит свое решение.
  • Разделение по участникам разговора. Для разбора спорных ситуаций и обучения — обязательно, для монолога — нет.
  • Нужен ли поиск по архиву расшифровок. На десятках звонков достаточно отдельных файлов. На сотнях нужен поиск по словам.
  • Откуда берется запись. От источника зависит класс решения: телефония, встречи, вебинары, готовые файлы на диске.
  • Кто будет пользоваться. У разных сценариев свои требования: руководитель в браузере, служба качества в отчетах, разработчик через интеграцию.

Расшифровка в телефонии: когда звонки уже пишутся

Если разговоры компании идут через виртуальную АТС и записываются, отдельный сервис может не понадобиться. Транскрибацию звонков многие телефонии подключают дополнительной функцией. Запись уже лежит в системе, расшифровка автоматически появляется в интерфейсе прослушивания. Ниже мы описали два решения российского рынка, у каждого из которых разобрали возможности и границы.

«Телфин»

Один из достойных вариантов для компаний с установленной телефонией и записью разговоров.

Расшифровка звонков. Дополнительная функция к виртуальной АТС «Телфин.Офис», доступная на любом тарифе. Подключение бесплатное, минута — 64 копейки. Отдельный сервис покупать не нужно: функция добавляется к действующей телефонии.

Выдача текста. Разметка по говорящим: реплики менеджера и собеседника идут отдельными строками в виде переписки. Мест, где можно прочитать документ, несколько: личный кабинет АТС, софтфон WebRTC, «Телфин.Бот», CRM (в Битрикс24 к карточке звонка подтягивается краткая выжимка) и подключенный Yandex SpeechSense. Диалог удобно вынести на планерку: распечатать, вставить в слайды.

Дополнительно. Поиск по словам работает по всем расшифрованным звонкам в CRM, интерфейсе АТС и Yandex SpeechSense. Технически он опирается на «Яндекс.Облако» (Yandex Cloud AI Studio). Языковая модель GPT готовит в интерфейсе виртуальной АТС резюме разговора — короткую выжимку вместо полного диалога. Отдельно стоит Real-Time API. Распознанная речь уходит на указанный адрес по ходу разговора, например, голосовому роботу.

Ограничения. Функция телефонии работает со звонками, прошедшими через АТС. RTA отдает поток машине и не имеет интерфейса для чтения. Человек читает расшифровку в перечисленных выше местах. Оплата поминутная: счет растет с объемом разговоров. Часть сценариев поиска завязана на внешние сервисы Яндекса. Это нужно учитывать при ограничениях по подрядчикам и обработке данных.

Стоимость. У «Телфина» перевод звонков в текст — дополнительная функция виртуальной АТС на любом тарифном плане. Подключение 0 ₽, минута расшифровки — 64 копейки (по данным вендора, 08–09.09.2026). Актуальную цену стоит сверить на странице сервиса в день покупки.

Все условия подключения можно посмотреть на сайте «Телфина».

«Новофон»

Один из рабочих вариантов, но об ограничениях решения вендор заявляет прямо.

Транскрибация звонков. Работает в телефонии «Новофона» с тарифа «Старт», готовый текст доступен в личном кабинете.

Выдача текста. Расшифрованный разговор скачивается вручную из личного кабинета файлом .txt. Вторая форма — уведомление. В личном кабинете настраивается webhook, и текст распознанного разговора приходит на указанный адрес сразу по окончании звонка, без захода в интерфейс. Обе формы вендор подтвердил письменно в августе 2026 года.

Дополнительно. Поверх расшифровок работает речевая аналитика «Новофона» — отдельная услуга, 2,5 ₽ за минуту без абонентской платы и платы за подключение. Возможности соседнего класса продукта остаются за рамками материала.

Стоимость. Расшифровка — от 0,90 ₽ за минуту, функция указана уже в бесплатном тарифе «Старт» (тарифные страницы вендора, 21.09.2026).

Ограничения. Главное вендор назвал сам: по API распознавание не поддерживается. Выдачи текста в момент разговора и выборки по архиву запросом нет. Для отчетов, обучения и разбора хватает файла и webhook-уведомления. Для сценариев реального времени решение не подойдет.

Отдельные сервисы транскрибации: когда телефонии мало

Телефония закрывает только прошедшие через нее разговоры. Если расшифровывать надо встречи, интервью, вебинары или лежащие на диске записи, нужен отдельный сервис транскрибации. Это самостоятельный продукт, куда аудио загружается вручную или добавляется из интеграции. Эта функция — основная работа сервиса, тогда как в телефонии ее нужно подключать отдельно.

Отличаются такие сервисы тем же, чем и телефонии: моделью оплаты, набором форматов, разделением по говорящим и формой выгрузки. Добавляется критерий места, где обрабатывается запись. Для разговоров с персональными данными это важный вопрос.

Перед подключением любого такого сервиса нужно проверить:

  • работает ли вендор в России сегодня. Живой сайт с ценами в рублях этого не доказывает, компания могла уйти с рынка.
  • как рассчитывается оплата. За минуту, за файл или по подписке, и что происходит при превышении лимита.
  • форматы. Список расширений берем с официальной страницы сервиса, чужой обзор источником не считается.
  • есть ли разделение по говорящим. И в каком виде оно выдается.
  • как выгружается текст. Интерфейс, файл, уведомление, программный доступ.

Отдельный класс — облачные сервисы распознавания речи. Их пользователь — разработчик: сервис встраивают в систему компании, и она получает текст.

Yandex SpeechKit, по описанию Яндекса, распознает речь и в реальном времени, и из записанных аудио файлов. Умеет сразу обработать результат языковой моделью (сделать выжимку, извлечь факты) и отдает итог текстом или в JSON.

SaluteSpeech от Сбера предлагает преобразование аудио в текст с программным доступом. Общая граница заложена в природе класса: встраивать сервис в процессы придется силами разработчика.

Актуальный состав решений удобно смотреть в каталоге программ для транскрибации. Соседний раздел — программы для записи телефонных разговоров: расшифровке всегда предшествует запись, и если ее еще нет, начинать надо с нее.

Три сценария и подходящие к ним решения

Ниже разбираем три типовые задачи и сервисы, которые подходят для работы с ними.

Разобрать спорный звонок и обучить новичка. Нужны текст с разделением реплик и возможность его выгрузить, чтобы показать на планерке, приложить к обучающему материалу, распечатать. Поминутная оплата здесь обычно выгоднее подписки, так как расшифровываются только отдельные случаи. Вопрос вендору: как выглядит на выходе текст одного разговора, и можно ли сохранить его файлом.

Найти нужное в потоке разговоров. Отдельные документы эту задачу не решают. Искать по папке с сотней текстов не легче, чем слушать записи. Нужен поиск по словам поверх всего архива расшифровок. Вопросы вендору: работает ли поиск по всем звонкам сразу, и за какой период доступен архив.

Отдать текст роботу или своей системе. Здесь решает сам факт наличия программного доступа: в реальном времени или хотя бы сразу после разговора. Спрашивать об этом надо до оплаты, так как именно на этом пункте выбор чаще всего разворачивается. Вопрос вендору: в какой момент и в каком виде наша система получит текст.

Чего транскрибация не делает

Границы класса стоит знать заранее, чтобы не ждать от расшифровки лишнего.

На плохой записи текст не будет точным. Улица, громкая связь, несколько говорящих разом — в таких условиях расшифровку придется править руками. Проценты точности мы не приводим ни по одному решению: цифру без открытой методики замера проверить нельзя.

Расшифровка не передает интонацию и паузу: там, где важна подача, запись придется слушать.

Распознавание ошибается на именах, названиях компаний и терминах. Часть сервисов позволяет добавить свой словарь, но в узкой теме идеальной расшифровки ждать не стоит.

Текст сам по себе не делает выводы. Он не скажет, почему упала конверсия и кто из сотрудников работает хуже. За этим идут в речевую аналитику.

Кому расшифровка не подходит. Компаниям, где нет потока разговоров. Две-три записи в месяц дешевле разобрать вручную, чем настраивать и оплачивать сервис. Тем, кому нужны отчеты и оценки по разговорам, — это покупка другого сервиса. Задачам, где важна интонация. И две соседние ниши мы здесь не разбираем: медицинскую расшифровку и субтитры для видеопродакшена.

Как проверить функцию на своем потоке

По студийной демоверсии все возможности сервиса понять не получится. Нужно проверять на своих записях.

Отберите 10–15 реальных разговоров разных форматов: тихий кабинет, улица, громкая связь, быстрая речь, сложные фамилии. Прогоните их через два-три сервиса и посчитайте, сколько времени уходит на правку текста после каждого. Отдельно проверьте выгрузку в том виде, в каком она вам нужна: открыть в интерфейсе, скачать файлом, получить уведомление, забрать программно. И сложите месячный счет по фактической длительности разговоров. Если на правки в тексте уходит меньше времени, чем на прослушивание, программы для транскрибации себя окупают.

Материал актуализирован 21.09.2026.

Если вы нашли ошибку в тексте, пожалуйста, выделите фрагмент текста и нажмите ctrl + enter

Комментариев нет

Защита от автоматических сообщений
CAPTCHA
Введите слово на картинке