Транскрибация

Почему ваш текущий инструмент транскрибации не работает для русского языка

Otter, Fireflies, Notta — все хороши для английского. Но если вы транскрибируете русские звонки, вы теряете до 35% слов. Разбираемся, почему, и что с этим делать.

15 июля 2026 г.·12 мин чтения
← Все статьи

Вас когда-нибудь задолбало сидеть часами над расшифровкой звонка, который ваш «умный» инструмент преврат в кашу из непонятных слов? Пятьдесят минут записи — а результат выглядит так, будто кто-то набирал текст на клавиатуре с закрытыми глазами. Именно с этим сталкиваются русскоязычные менеджеры по продажам, которые до сих пор используют инструменты, созданные для английского языка.

Ваш текущий инструмент против реальности

Вот типичная ситуация. Вы — менеджер по продажам в российской компании. Каждый день вы проводите по пять-семь звонков с клиентами. После каждого звонка вам нужно: сохранить запись, расшифровать её, найти ключевые моменты — возражения клиента, его потребности, договорённости. Идеально — автоматически. Вы пробуете Otter.ai. Он отлично работает на английском. Коллега в штате Калифорния восторгается: «Он даже шутки правильно распознаёт!» А вы загружаете запись русского звонка и получаете... вот это: > «Привет, это Сергей из компании... [неразборчиво]... мы обсуждали... [неразборчиво]... стоимость... [неразборчиво]...» Двадцать процентов текста — неразборчиво. Ещё тридцать — с ошибками, которые меняют смысл фразы. Вместо «договор» — «догор». Вместо «поставка» — «по ставке». Вместо имени клиента — набор бессмысленных символов.

Почему это происходит: три корневые причины

1. Модели обучены на английском

Whisper от OpenAI — самая популярная open-source модель для распознавания речи. На английском он показывает WER (Word Error Rate) около 5-8%. На русском — 35.7%. Это не опечатка. Тридцать пять процентов ошибок. Каждое третье слово — неправильно. Почему? Потому что обучающие данные Whisper на русском языке составляют около 3% от общего корпуса. Модель буквально не «слышит» нюансы русской фонетики: твёрдые и мягкие согласные, ударения, которые меняют смысл слова, латинскую транслитерацию кириллицы.

2. Диаризация — отдельная проблема

Даже если инструмент как-то распознал слова, он должен понять: кто говорит. Это называется диаризация — разделение речи на спикеров. Для русского языка большинство коммерческих решений используют модели, обученные на английской речи. Результат — спикер «Менеджер» вдруг превращается в «Спикер 1», а потом в «Неизвестный», и вы не можете понять, где кончается ваш аргумент и начинается ответ клиента. Подробнее о том, как устроен этот процесс изнутри, читайте в нашем .

3. Кириллица как вторая мысль

Многие инструменты «держат» кириллицу, но не думают о ней в первую очередь. Интерфейс на английском, шаблоны промптов — на английском, даже подсказки по форматированию — на английском. Вы тратите время не на работу с результатом, а на борьбу с интерфейсом.

Путешествие менеджера: от отчаяния к решению

Знакомо? Вот путь, который проходит каждый русскоязычный специалист, столкнувшийся с этой проблемой. Этап 1: «Попробую бесплатное». Fireflies.ai. Загружаете запись. Ждёте. Получаете результат. Кириллица есть, но процент ошибок — космический. «Ну, это же бесплатное, что вы хотели». Этап 2: «Платное точно лучше». Otter.ai — платная подписка. Думаете: «За деньги точно будет нормально». Не будет. Точность та же, потому что модель одна и та же. Вы просто заплатили за тот же результат. Этап 3: «Российские решения». Яндекс SpeechKit. Наконец-то русская модель! Но: 0.65 рублей за минуту. Звонок на 30 минут — 19.50 рублей. Десять звонков в день — почти 200 рублей. В месяц — около 4000 рублей только на транскрибацию. И это при том, что качество хорошее, но не идеальное: WER около 12-15%. Этап 4: «Может, есть что-то лучше». Вы гуглите, ищете альтернативы. Натыкаетесь на TEOM с моделью GigaAM от Сбера. Читаете : WER 23.9% на 80-минутной записи. Это серьёзно — в полтора раза лучше, чем Whisper. И бесплатно.

Что делает TEOM иначе

GigaAM: модель, обученная на русском

GigaAM — это семейство моделей от Сбера, специально обученных на русской речи. Не адаптированных из английского, а именно созданных для русского языка. Это как разница между человеком, который выучил русский по учебнику, и носителем языка. На нашем бенчмарке на 80-минутной записи с двумя спикерами:
МодельWERСкорость
GigaAM (DSP выкл)23.9%16x realtime
Whisper TRT-LLM35.7%13x realtime
Parakeet TDT v330.6%23x realtime
На коротких записях (7 минут) разница ещё заметнее: GigaAM — 5.82% WER, Whisper — 12.11%.

Диаризация из коробки

TEOM использует pyannote для разделения спикеров. На русском языке это работает гораздо лучше, потому что модель GigaAM корректно распознаёт речь, а pyannote — правильно разделяет голоса. Результат: вы видите «Менеджер» и «Клиент», а не «Спикер 1» и «Спикер 2».

Нативная поддержка кириллицы

TEOM создан для русского языка. Интерфейс, подсказки, форматирование — всё на русском. Вы не тратите время на адаптацию к чужому интерфейсу.

Сравнение: честная таблица

КритерийOtter.aiFirefliesNottaЯндекс SpeechKitTEOM
WER (русский)~35%~33%~30%~12-15%23.9% (GigaAM)
ДиаризацияАнглийскаяАнглийскаяСредняяХорошаяХорошая (pyannote)
КириллицаЧерез адаптациюЧерез адаптациюНативнаяНативнаяНативная
Цена$10/мес$10/мес$15/мес~4000₽/месБесплатно (бета)
Хранение данныхСШАСШАЯпонияРоссияРоссия
APIДаДаДаДаДа

Что думают, чувствуют и делают ваши коллеги

Прежде чем вы начнёте менять инструмент, посмотрим, что происходит в голове у людей, которые уже столкнулись с этой проблемой. Что они думают: «Наверное, я что-то не так делаю. Может, настройки не те. Может, микрофон плохой. Может, просто так и должно быть — русский язык сложный». Они винят себя, а не инструмент. Они не знают, что Whisper на русском работает в два раза хуже, чем на английском. Что они чувствуют: Разочарование, усталость, злость. Они тратят время на то, что должно быть автоматическим. Они теряют информацию о клиентах. Они не могут найти нужный момент в записи — приходится слушать заново. Это как искать иголку в стоге сена, но стог — на русском языке, а иголка — на английском. Что они говорят: «Да я уже привык», «Ну, это нормально, я потом вручную правлю», «Русский язык — он такой, с ним сложно». Они адаптируются к плохому инструменту вместо того, чтобы искать лучший. Что они делают: Отказываются от автоматизации. Возвращаются к ручной расшифровке. Тратят вечера на то, чтобы дослушать запись и выписать ключевые моменты. Пропускают важные детали, потому что «лень ещё раз слушать». Это не лень. Это не плохие привычки. Это результат использования инструмента, который не подходит для вашей задачи.

Как повысить точность транскрибации: три вопроса

Если вы HR-специалист или аналитик, задайте себе три вопроса: HMW узнать, насколько точна ваша текущая транскрибация? Возьмите одну запись, расшифруйте вручную 5 минут. Сравните с результатом ASR. Посчитайте ошибки. Вы удивитесь, как много вы пропускаете. HMW сократить время обработки звонков без потери качества? Автоматическая транскрибация с хорошей диаризацией экономит 2-3 часа в день на каждого менеджера. Это не преувеличение — это математика. HMW обеспечить конфиденциальность данных клиентов? Если ваши записи хранятся на серверах в США или Европе, вы нарушаете 152-ФЗ. TEOM хранит данные в России.

Калькулятор: сколько вы теряете на плохом ASR

Сделаем простой расчёт. Представьте, что вы — менеджер по продажам, который занимается :
  • 5 звонков в день, по 20 минут
  • 22 рабочих дня в месяц
  • Время ручной корректировки транскрипта: 30 минут на звонок при WER 35%
  • Время ручной корректировки при WER 24%: 15 минут на звонок
Потери при WER 35%: 5 × 30 мин × 22 дня = 3300 минут = 55 часов в месяц. При ставке 2000₽/час = 110 000₽ в месяц только на ручной корректировке. Потери при WER 24%: 5 × 15 мин × 22 дня = 1650 минут = 27.5 часов. Экономия: 27.5 часов. При той же ставке — 55 000₽ в месяц. И это только время менеджера. Не считая потери информации, ошибок в CRM, невыполненных обещаний клиентам из-за некорректных транскриптов.

Что делать прямо сейчас

Шаг 1: Проверьте свой текущий инструмент

Возьмите одну запись русского звонка. Загрузите в текущий инструмент. Потом загрузите в TEOM. Сравните результаты. Это займёт 5 минут.

Шаг 2: Посчитайте реальную стоимость

Воспользуйтесь калькулятором выше. Узнайте, сколько времени и денег вы теряете каждый месяц.

Шаг 3: Попробуйте TEOM

TEOM доступен бесплатно в бета-версии. Никакой кредитной карты. Регистрация — 30 секунд. Загрузка записи — один клик.

Вывод

Ваш текущий инструмент транскрибации, скорее всего, создан для английского языка. Он «умеет» кириллицу, но не думает на русском. Результат — десятки потерянных часов и тысячи рублей в месяц на ручной корректировке. TEOM с GigaAM — это другая история. Модель, обученная на русской речи. Нативная кириллица. Диаризация, которая работает. И всё это бесплатно. Проверьте сами. Загрузите одну запись. Сравните с тем, что у вас сейчас. Вы увидите разницу на первых же предложениях.
TEOM — open-source платформа для транскрибации с поддержкой GigaAM. Создана для русского языка. Доступна бесплатно. Попробовать TEOM бесплатно →
asrрусский языктранскрибацияotterfirefliesgigaamwerдиаризация

Попробуйте TEOM бесплатно

Загрузите файл и получите результат за секунды.