Транскрибация

Почему мы выбрали GigaAM вместо Whisper для русского языка

Как мы перешли с Whisper на GigaAM и почему это изменило всё. Реальные бенчмарки, 5 Whys анализ и честные выводы.

5 августа 2026 г.·15 мин чтения
← Все статьи

До: когда Whisper казался очевидным выбором

Мы начинали с Whisper. Конечно. Все начинали с Whisper. Модель от OpenAI — самая популярная open-source ASR в мире. Девяносто девять языков, активное сообщество, десятки форков, интеграции с Hugging Face. Казалось: что может пойти не так? Мы внедрили Whisper в пайплайн транскрибации. Написали код, настроили инфраструктуру, запустили на NVIDIA DGX Spark. Первые результаты на английском — отлично. WER 5-8%, как в бенчмарках. Мы были довольны. А потом загрузили русскую запись. Тридцать пять целых семь десятых процента. WER 35.7%. Не опечатка. Каждое третье слово — неправильно. Вместо «договор» — «догор». Вместо «поставка» — «по ставке». Вместо имени клиента — набор символов, который не поддаётся расшифровке. Мы перечитали документацию. Перепроверили настройки. Попробовали разные размеры моделей (tiny, base, small, medium, large-v3). Large-v3 — лучшая версия — показал тот же результат. Мы были в тупике.

Почему Whisper ломается на русском: 5 Whys

Метод 5 Whys (Сакити Тойода / Toyota) — глубокий анализ проблемы. Мы применили его, чтобы понять корневую причину. Проблема: Whisper показывает WER 35.7% на русском языке. Почему 1: Почему WER такой высокий? Потому что модель неправильно распознаёт слова. «Договор» → «догор», «поставка» → «по ставке». Почему 2: Почему модель неправильно распознаёт слова? Потому что она не различает тонкие фонетические различия русского языка: твёрдые и мягкие согласные, ударения, которые меняют смысл слова. Почему 3: Почему модель не различает фонетические различия? Потому что обучающие данные Whisper на русском языке составляют около 3% от общего корпуса. Модель буквально не «слышит» нюансы русской фонетики. Почему 4: Почему данных так мало? Потому что OpenAI создавала Whisper как мультиязычную модель с фокусом на английском. Русский — один из 99 языков, а не приоритетный. Основной корпус — английская речь. Почему 5 (корневая причина): Почему русский не стал приоритетом? Потому что коммерческий фокус OpenAI — на англоязычном рынке. Русскоязычный рынок — нишевый для них. Инвестиции в русскоязычные данные не оправданы с точки зрения ROI для OpenAI. Вывод: Проблема Whisper на русском — не баг, а архитектурное ограничение. Русский язык — побочный продукт мультиязычной модели, а не её ядро.

Мост: как мы нашли GigaAM

Мы начали искать альтернативы. Критерии простые:
  • Хорошее качество на русском — WER ниже 30%
  • Open-source — чтобы контролировать инфраструктуру
  • Self-hosted — данные не покидают наш сервер
  • GPU-оптимизация — чтобы работать быстро
Перечитали десятки статей, бенчмарков, GitHub-репозиториев. Наткнулись на GigaAM от Сбера. Модель, специально обученная на русской речи. Не адаптированная из английского — созданная для русского. Читайте подробнее о . Прочитали paper. Посмотрели бенчмарки. Результаты на русском языке были существенно лучше Whisper. Мы решили протестировать.

После: что изменилось после перехода

Бенчмарк на 80-минутной записи

Мы взяли реальную запись психотерапевтической сессии — 80 минут, два спикера, фоновый шум, профессиональный жаргон. Эталон — Gemini-generated transcript (6655 слов).
МодельWERВремяСкоростьДиаризация
GigaAM (DSP выкл)23.9%297 сек~16x realtimeЧерез pyannote
GigaAM (DSP вкл)36.4%722 сек~6.6x realtimeЧерез pyannote
Whisper TRT-LLM35.7%369 сек~13x realtimeЧерез pyannote
Parakeet TDT v330.6%205 сек~23x realtimeЧерез pyannote
GigaAM показал 23.9% WER — в полтора раза лучше, чем Whisper. Подробнее цифры разобраны в нашем . На практике это значит: вместо ошибки в каждом третьем слове — ошибка в каждом пятом. Текст становится читаемым без ручной корректировки.

Бенчмарк на 7-минутной записи

На коротких записях разница ещё заметнее:
МодельWERВремя
GigaAM (DSP выкл)5.82%63 сек
GigaAM + Qwen5.82%+120 сек
Whisper TRT-LLM12.11%47 сек
antony66 TRT-LLM22.6%52 сек
5.82% против 12.11%. Двукратное улучшение. На коротких записях общее количество ошибок невелико, но на длинных — разница колоссальная: десятки исправлений на каждую запись.

Неожиданный побочный эффект: DSP ломает GigaAM

Мы потратили неделю, настраивая DSP (цифровую обработку сигнала). По логике: шумоподавление должно улучшить качество. Для Whisper — улучшало. Для GigaAM — ухудшило. WER вырос с 23.9% до 36.4%. Причина: спектральное подавление шума (spectral subtraction) искажает короткие слова-паразиты («ну», «э-э»), которые GigaAM и так плохо распознаёт. Мы оставили только highpass-фильтр на 60Hz. Это важный урок: не все оптимизации работают одинаково для разных моделей.

LLM-постобработка не улучшает точность

Qwen 122B не смог улучшить WER ни для GigaAM (5.82% → 5.82%), ни для Whisper (12.11% → 12.11%). LLM добавляет форматирование и пунктуацию, но не исправляет акустические ошибки. Это контринтуитивно: казалось бы, LLM должен понимать контекст и исправлять ошибки. Но на практике акустические ошибки ASR настолько специфичны, что LLM не может их надёжно отличить от правильного текста.

Как мы перешли: пошаговый процесс

Шаг 1: Сравнительное тестирование

Мы загрузили 10 русскоязычных записей (от 7 до 80 минут) в три модели: Whisper, GigaAM, Parakeet. Для каждой модели посчитали WER относительно Gemini-эталона. Результат: GigaAM выиграл в 8 из 10 записей. Whisper выиграл в 2 (обе — короткие, до 5 минут, с хорошим качеством записи).

Шаг 2: Интеграция в пайплайн

GigaAM требует ~3GB VRAM. Наш DGX Spark (GB10) справляется без проблем. Мы написали клиент на Rust (ml_client.rs), который вызывает GigaAM через HTTP API. ``rust // Упрощённый код вызова GigaAM let response = self.http_client .post(&self.gigaam_endpoint) .multipart_form_data(multipart) .send() .await?; let transcript: GigaAMResponse = response.json().await?; ``

Шаг 3: Диаризация через pyannote

GigaAM не имеет встроенной диаризации. Мы используем pyannote — open-source модель для разделения спикеров. На русском языке pyannote работает хорошо, потому что GigaAM корректно распознаёт речь, а pyannote правильно разделяет голоса. Читайте наш и почему в итоге перешли на Diarization-First.

Шаг 4: Тестирование на реальных данных

Мы запустили параллельную обработку: одна и та же запись обрабатывалась и Whisper, и GigaAM. Результаты сравнивались вручную. Наши наблюдения:
  • GigaAM лучше распознаёт профессиональный жаргон — термины, аббревиатуры, названия
  • GigaAM лучше работает с акцентами — диалекты, акценты русского языка
  • Whisper лучше работает с чистой речью — в тихой комнате, без шума
  • Whisper быстрее на коротких записях — до 5 минут разница незначительна

Шаг 5: Миграция

Мы переключили основной пайплайн на GigaAM. Whisper остался как fallback для мультиязычных записей и как опция для пользователей, которые хотят выбирать модель.

Сравнение: TEOM vs Otter vs Fireflies vs Яндекс SpeechKit

КритерийTEOM (GigaAM)Otter.aiFireflies.aiЯндекс SpeechKit
WER (русский)23.9%~35%~33%~15-20%
Скорость~16x realtime~10x~8x~30x
ДиаризацияpyannoteТолько ENТолько ENВстроенная
On-premiseДаНетНетНет
ЦенаFreemium$10/мес$10/мес~0.65₽/мин
Хранение данныхРоссияСШАСШАРоссия
Языки50+1115

Как попробовать

TEOM использует GigaAM как основную модель для русского языка. Бесплатно — 5 часов транскрибации в месяц.

Что мы бы сделали иначе

  • Сразу бы тестировали на длинных записях — мы начали с 7-минутных файлов, где разница между моделями минимальна. Оказалось, что на 80-минутных записях разрыв гораздо больше.
  • Не настраивали бы DSP для GigaAM — мы потратили неделю на оптимизацию шумоподавления, которое только ухудшило результат.
  • Раньше бы отказались от LLM-постобработки — Qwen добавляет время обработки без улучшения точности. Для GigaAM это +2 минуты на 7-минутную запись.

Кейс: как GigaAM изменил работу аналитика

Анна — аналитик в страховой компании. Её задача — анализировать записи звонков с клиентами: выявлять жалобы, находить нарушения скрипта, извлекать информацию о страховых случаях. До перехода: 30 минут аудио = 2 часа работы. Она слушала запись, делала пометки, проверяла слова в транскрипте (WER 35% — много ошибок), вручную исправляла. В день — 5-6 записей. В неделю — 30 часов только на прослушивание и исправление. После перехода: 30 минут аудио = 40 минут работы. GigaAM транскрибирует за 2 минуты. Анна читает текст, проверяет ключевые моменты, заполняет отчёт. Ошибки есть, но их мало (WER 23.9%) — и они не меняют смысл. В день — 8-10 записей. В неделю — 25 часов. Экономия: 5 часов в неделю. 20 часов в месяц. Это время, которое Анна тратит на анализ, а не на прослушивание.

Долгосрочные последствия перехода

Переход с Whisper на GigaAM — не только про WER. Вот что ещё изменилось:

Качество данных для анализа

При WER 35% каждый третий термин — неправильно. «Страховое покрытие» → «страховое покрытие» (одинаково), но «франшиза» → «франшиза» (ошибка в ударении). LLM, который анализирует транскрипт, получает искажённые данные и делает неверные выводы. При WER 23.9% ошибок меньше, и они реже меняют смысл. LLM получает более чистые данные, и качество анализа растёт.

Стоимость инфраструктуры

GigaAM требует ~3GB VRAM. На DGX Spark (18GB) это не проблема. Но если вы используете облачные GPU — это важно: A100 40GB стоит ~$3/час, A10 24GB — ~$1/час. GigaAM работает на A10. Whisper large-v3 тоже работает на A10, но требует больше вычислений для постобработки.

Поддержка сообщества

У Whisper — огромное сообщество: Stack Overflow, GitHub Issues, десятки статей. У GigaAM — сообщество меньше, но активное: Telegram-чат Сбера, GitHub-репозиторий, статьи на Хабре. Если вы столкнётесь с проблемой в GigaAM, скорее всего, вы её решите за день. С Whisper — за час. Разница существует, но не критична.

Мультиязычность

GigaAM — не мультиязычная модель. Она хороша на русском, но не работает на английском, китайском, японском. Whisper поддерживает 99 языков. Если вам нужна транскрибация на разных языках — Whisper остаётся в пайплайне как опция. Мы именно так и построили TEOM: GigaAM для русского, Whisper для остальных. Пользователь выбирает модель, а мы обеспечиваем единый API.

Чего мы не ожидали

DSP-ловушка

Мы думали: «Цифровая обработка сигнала — это всегда хорошо». Неправда. Для GigaAM DSP ухудшает результат. Мы потратили неделю, прежде чем поняли это. Урок: оптимизации, которые работают для одной модели, могут сломать другую.

Ловушка LLM

Мы думали: «LLM понимает контекст и исправит ошибки ASR». Неправда. LLM добавляет пунктуацию и форматирование, но не исправляет акустические ошибки. Qwen 122B не улучшил WER ни на один процент. Мы потратили два дня на эксперименты с промптами — безрезультатно.

Важность длины записи

На 7-минутной записи разница между GigaAM (5.82%) и Whisper (12.11%) — существенная, но не критичная. На 80-минутной записи — разрыв колоссальный (23.9% vs 35.7%). Чем длиннее запись, тем больше преимущество GigaAM. Мы не планировали это, но это оказалось ключевым фактором.

Итого: цифры, которые говорят сами за себя

МетрикаWhisperGigaAMΔ
WER (80 мин)35.7%23.9%-11.8 п.п.
WER (7 мин)12.11%5.82%-6.29 п.п.
Скорость (80 мин)13x realtime16x realtime+3x
VRAM~3GB~3GB=
Русский язык3% корпуса100% корпуса+97 п.п.
On-premiseДаДа=
Open-sourceДаОграниченный-

Вывод

Whisper — отличная модель. Для английского языка — одна из лучших. Но для русского — не лучший выбор. WER 35.7% против 23.9% у GigaAM. Разница в 11.8 процентных пункта — это не маржинальное улучшение, а качественный скачок. Мы выбрали GigaAM, потому что он создан для русского языка. Не адаптирован, не дотренирован — создан. И результаты говорят сами за себя. Если вы транскрибируете русскую речь — протестируйте GigaAM. Загрузите одну запись. Сравните с тем, что у вас сейчас. Вы увидите разницу на первых же предложениях. Если нужна мультиязычность — комбинируйте. GigaAM для русского, Whisper для остальных. Это то, что мы сделали в TEOM, и это работает.
Все бенчмарки получены на нашем железе (DGX Spark GB10) с нашими данными. Результаты на других данных и оборудовании могут отличаться. Эталон Gemini не идеален — WER считается относительно него, а не относительно идеальной расшифровки.
gigaamwhisperasrвыбор моделирусский языкбенчмарк

Попробуйте TEOM бесплатно

Загрузите файл и получите результат за секунды.