Транскрибация

Как работает GigaAM: архитектура российской ASR-модели

Устройство GigaAM от Сбера: CTC-декодер, токенизация, WER 23.9% на русском. Как модель работает изнутри и почему она побеждает Whisper.

6 июля 2026 г.·12 мин чтения
← Все статьи

Когда русский язык становится проблемой

Представьте: вы — ML-инженер, вам нужно распознать речь на русском языке. Вы гуглите "best ASR model" и первым в списке оказывается Whisper от OpenAI. Модель open-source, 99 языков, активное сообщество. Казалось бы — очевидный выбор. Вы запускаете Whisper на русской записи. Смотрите на результат. WER 35.7%. Каждое третье слово — неправильно. «Договор» превращается в «догор». «Поставка» — в «по ставке». Имя клиента становится набором символов, который невозможно расшифровать. Вы перебираете размеры моделей: tiny, base, small, medium, large-v3. Large-v3 — лучшая версия — выдаёт тот же результат. Вы меняете temperature, beam size, language detection. Та же картина. Это не баг. Это архитектурное ограничение. Русский язык составляет около 3% обучающего корпуса Whisper. Модель буквально не «слышит» нюансы русской фонетики: твёрдые и мягкие согласные, ударения, которые меняют смысл слова. И вот тут в игру вступает GigaAM.

Что такое GigaAM

GigaAM — это семейство моделей автоматического распознавания речи (ASR), разработанное Сбером. В отличие от Whisper, GigaAM создан не как мультиязычная модель с поддержкой русского, а как модель, обученная именно на русской речи. Основной корпус — русская речь, русские спикеры, русская фонетика. Ключевая модель в семействе — GigaAM-ASR. Она использует архитектуру на основе CTC (Connectionist Temporal Classification) — подход, который позволяет распознавать речь без необходимости выравнивать каждый фрагмент аудио с конкретным словом или фонемой. Это делает модель быстрой и эффективной. Прежде чем мы углубимся в архитектуру, давайте определимся с терминологией.

Словарь терминов

Прежде чем разбирать архитектуру, определим ключевые понятия. Если вы уже знакомы с ASR — пропустите этот раздел. ASR (Automatic Speech Recognition) — автоматическое распознавание речи. Технология, которая преобразует аудиозапись речи в текст. ASR-система «слушает» звуковой сигнал и выводит последовательность слов. WER (Word Error Rate) — процент ошибок распознавания. Ключевая метрика качества ASR. Рассчитывается как отношение количества ошибок (вставленных, удалённых, заменённых слов) к общему числу слов в эталонном тексте. Чем ниже WER, тем лучше модель. WER 0% — идеальное распознавание. WER 100% — модель не угадала ни одного слова. Encoder — кодировщик. Часть нейросети, которая преобразует входные данные (в случае ASR — аудиосигнал) в внутреннее представление — набор признаков, которые модель может использовать для принятия решений. В GigaAM encoder обрабатывает спектрограмму аудио и выделяет acoustic features. Decoder — декодер. Часть нейросети, которая преобразует внутреннее представление (от encoder) в выходные данные — текст. Decoder «читает» признаки, извлечённые encoder, и определяет, какие слова были произнесены. CTC (Connectionist Temporal Classification) — метод обучения нейросетей для последовательностей, при котором не требуется явное выравнивание входных и выходных данных. В контексте ASR: CTC позволяет модели учиться распознавать речь, зная только аудио и соответствующий текст, без необходимости помечать, какой фрагмент аудио соответствует какому слову. Это ключевое преимущество — разметка выравнивания стоит дорого и трудоёмка. Beam search — алгоритм поиска, который на каждом шаге рассматривает не один наиболее вероятный вариант (greedy search), а несколько (beam width). Это повышает точность декодирования за счёт увеличения вычислительных затрат. Beam size 5 означает, что модель одновременно рассматривает 5 наиболее вероятных кандидатов на каждом шаге. Токенизация — процесс разбиения текста на токены (токены могут быть словами, подсловами или символами). Модель не работает с текстом напрямую — она работает с токенами. Выбор стратегии токенизации влияет на размер словаря, скорость работы и качество распознавания. VAD (Voice Activity Detection) — детекция голосовой активности. Алгоритм, который определяет, где в аудио есть речь, а где — тишина или шум. VAD позволяет пропускать не-речевые фрагменты и ускорять обработку.

Архитектура GigaAM: как модель работает изнутри

Теперь, когда мы определились с терминологией, давайте разберём, как устроена GigaAM на архитектурном уровне.

Входные данные: спектрограмма

GigaAM, как и большинство современных ASR-моделей, принимает на вход не «сырой» звук, а спектрограмму — визуальное представление частотного спектра сигнала во времени. Спектрограмма показывает, какие частоты присутствуют в аудио на каждом временном шаге. Процесс преобразования аудио в спектрограмму называется feature extraction. Обычно используются мел-спектрограммы (mel-spectrograms) — спектрограммы, частоты в которых отмасштабированы по шкале мела, которая лучше соответствует восприятию частот человеком.

Encoder: извлечение признаков

Encoder в GigaAM — это нейросеть, которая обрабатывает спектрограмму и извлекает из неё признаки, релевантные для распознавания речи. Архитектура encoder в GigaAM основана на трансформерах — том же подходе, что используется в GPT, BERT и других крупных языковых моделях. Трансформерный encoder работает с механизмом self-attention (самовнимание). На каждом шаге он «смотрит» на все фрагменты спектрограммы одновременно и определяет, какие из них наиболее важны для текущего момента распознавания. Это позволяет модели учитывать контекст — звуки, которые были до и после текущего фрагмента. Результат работы encoder — последовательность векторов признаков (hidden states). Каждый вектор соответствует одному временному шагу спектрограммы и содержит информацию о том, «что модель видит» в этом фрагменте аудио.

CTC-декодер: превращение признаков в текст

Здесь начинается самое интересное. GigaAM использует CTC-декодер — подход, который принципиально отличается от autoregressive декодеров, используемых в Whisper и других моделях. Autoregressive декодер (Whisper): На каждом шаге модель предсказывает один токен, опираясь на все предыдущие токены. Это медленно — каждый токен зависит от предыдущего, последовательность генерируется последовательно. Зато модель может использовать языковую модель для «угадывания» слов по контексту. CTC-декодер (GigaAM): Модель предсказывает распределение вероятностей для всех возможных токенов на каждом временном шаге независимо. Нет зависимости от предыдущих токенов. Это быстро — можно обрабатывать все шаги параллельно. Но нет языковой модели — модель «решает» каждый шаг самостоятельно, без учёта контекста. CTC добавляет специальный «пустой» токен (blank token, обозначается как _) между повторяющимися символами и для обозначения пауз. Это позволяет модели обрабатывать длительность звучания фонем: одна и та же буква «а» может занимать разное количество временных шагов в зависимости от того, как долго её произносят. Процесс CTC-декодирования выглядит так:
  • Encoder выдаёт последовательность векторов признаков.
  • На каждом временном шаге CTC-слой вычисляет распределение вероятностей по всем токенам (включая blank).
  • Алгоритм CTC collapsing убирает повторы и blank-токены, оставляя итоговую последовательность токенов.
  • Токены декодируются обратно в текст.

Токенизация в GigaAM

GigaAM использует подсловную токенизацию (subword tokenization) — текст разбивается не на отдельные буквы и не на целые слова, а на подсловные единицы. Например, слово «договор» может быть разбито на «до», «говор» или «договор» целиком — в зависимости от частоты встречаемости. Подсловная токенизация — компромисс между символьной (каждая буква — отдельный токен, словарь маленький, но последовательности длинные) и словесной (каждое слово — отдельный токен, словарь огромный, модель не знает слов, которых не было в обучении). Размер словаря GigaAM — порядка нескольких тысяч токенов. Этого достаточно, чтобы покрыть основную русскую лексику, и при этом достаточно мало, чтобы модель могла обучиться на умеренном объёме данных. GigaAM поддерживает два режима декодирования: Greedy decoding — на каждом временном шаге выбирается токен с максимальной вероятностью. Быстро, но не всегда точно. Модель не «пересматривает» свои решения. Beam search — на каждом шаге поддерживаются несколько наиболее вероятных кандидатов (beam). Это позволяет найти более оптимальную последовательность токенов. Медленнее, но точнее. На практике разница между greedy и beam search в GigaAM составляет 1-3% WER в зависимости от данных. Для продакшена beam search предпочтительнее, особенно на длинных записях.

Почему CTC побеждает autoregressive декодер на русском

Это ключевой вопрос: почему GigaAM с CTC-декодером обходит Whisper с autoregressive декодером на русском языке?

Причина 1: отсутствие ошибок каскадирования

В autoregressive модели каждая ошибка влияет на последующие предсказания. Если Whisper неправильно распознал слово в начале фразы, эта ошибка «каскадирует» — модель продолжает ошибаться, опираясь на неправильный контекст. На русском языке, где Whisper и так не уверен в распознавании, каскадные ошибки создают лавину. CTC-декодер не имеет этой проблемы. Каждый временной шаг обрабатывается независимо. Ошибка в одном месте не влияет на другие. Это критично для русского языка, где фонетические различия тонки и ошибки вероятны.

Причина 2: скорость обработки

Autoregressive декодер генерирует токены последовательно — один за другим. Это фундаментальное ограничение: нельзя предсказать 10-й токен, не предсказав 9 предыдущих. CTC-декодер обрабатывает все временные шаги параллельно. Результат: GigaAM обрабатывает 80 минут аудио за 297 секунд (~16x realtime), Whisper TRT-LLM — за 369 секунд (~13x realtime).

Причина 3: специализация на русском

Whisper — мультиязычная модель. Она «знает» 99 языков, но ни один не знает идеально. Русский для Whisper — побочный продукт. GigaAM — моноязычная модель, обученная исключительно на русской речи. Все параметры оптимизированы под одну задачу: распознавать русскую речь. Это как разница между универсальным мультитулом и профессиональным инструментом. Мультитул может многое, но ничего не делает идеально. Профессиональный инструмент делает одну вещь превосходно.

Бенчмарки: цифры, которые говорят сами за себя

Теория — это хорошо, но давайте посмотрим на . Мы протестировали GigaAM и Whisper на двух записях.

Тестируемая конфигурация

  • Железо: NVIDIA DGX Spark (GB10, CUDA 13.2)
  • Данные: запись психотерапевтической сессии (русский язык, 2 спикера, фоновый шум)
  • Эталон: Gemini-generated transcript (6655 слов)
  • Метрика: WER (Word Error Rate) — чем ниже, тем лучше

Результаты на 80-минутной записи

МодельWERВремяСкоростьДиаризация
GigaAM (DSP выкл)23.9%297 сек~16x realtimeЧерез pyannote
GigaAM (DSP вкл)36.4%722 сек~6.6x realtimeЧерез pyannote
Whisper TRT-LLM35.7%369 сек~13x realtimeЧерез pyannote
Parakeet TDT v330.6%205 сек~23x realtimeЧерез pyannote
GigaAM показал 23.9% WER — в полтора раза лучше, чем Whisper. На практике это значит: вместо ошибки в каждом третьем слове — ошибка в каждом пятом. Текст становится читаемым без ручной корректировки.

Результаты на 7-минутной записи

МодельWERВремя
GigaAM (без DSP)5.82%63 сек
GigaAM + Qwen (постобработка)5.82%+120 сек
Whisper TRT-LLM12.11%47 сек
antony66 TRT-LLM22.6%52 сек
На короткой записи разрыв ещё более заметен: 5.82% против 12.11%. GigaAM делает в два раза меньше ошибок.

Что значат эти цифры

Чтобы осмыслить разницу в WER, переведём её в реальные последствия. При WER 23.9% (GigaAM) на 6655 слов приходится около 1590 ошибок. При WER 35.7% (Whisper) — около 2376 ошибок. Разница — 786 ошибок. Это 786 слов, которые нужно исправлять вручную. Если вы обрабатываете 10 таких записей в неделю, вы экономите 7860 ручных исправлений. При средней скорости редактирования 200 слов в час — это 39 часов ручной работы в неделю. Человек, который делает это вручную, тратит почти целую рабочую неделю на то, что модель могла бы сделать сама.

Архитектурные ограничения: честный разговор

GigaAM — не идеальная модель. У неё есть ограничения, о которых стоит знать.

CTC не использует языковую модель

Autoregressive декодеры (как в Whisper) могут использовать языковую модель для «угадывания» слов по контексту. Если модель не уверена в слове, она смотрит на предыдущие и последующие слова и выбирает наиболее вероятный кандидат. CTC-декодер такой возможности не имеет. Каждый временной шаг обрабатывается изолированно. Это означает, что GigaAM не может «додумать» слово по контексту. Если акустический сигнал неоднозначен — модель угадывает, и часто угадывает неправильно. На практике это проявляется в том, что GigaAM хуже справляется с профессиональным жаргоном, именами собственными и редкими словами. Модель не может «восстановить» незнакомое слово из контекста — она опирается только на звук.

Нет поддержки других языков

GigaAM — моноязычная модель. Она работает только с русским языком. Если вам нужно распознавать речь на английском, китайском или любом другом языке — GigaAM не поможет. В таких случаях Whisper остаётся лучшим выбором.

Зависимость от GPU

GigaAM требует GPU для быстрой работы. На CPU модель работает, но значительно медленнее. Для продакшена необходим GPU с минимум 3GB VRAM. Это не уникальное ограничение GigaAM — большинство современных ASR-моделей требуют GPU, но стоит это учитывать при планировании инфраструктуры.

Эмпатия-карта: что чувствует ML-инженер

Давайте посмотрим на ситуацию глазами ML-инженера, который выбирает ASR-модель для русскоязычного проекта. Что он думает: «Мне нужна модель, которая хорошо работает на русском. Whisper — очевидный выбор, потому что он популярный. Но если он не справляется — что делать? GigaAM звучит перспективно, но я ничего о нём не знаю. Какая архитектура? Насколько стабильна? Есть ли документация?» Что он чувствует: Фрустрацию от того, что Whisper не работает на русском. Тревогу от того, что выбор модели — критическое решение, которое повлияет на весь проект. Надежду от того, что GigaAM может быть решением. Что он делает: Гуглит «GigaAM vs Whisper Russian». Находит бенчмарки. Смотрит на цифры. Сравнивает архитектуру. Читает paper. Пробует запустить. Экспериментирует с настройками. Что ему нужно: Конкретные цифры, а не маркетинговые обещания. Честный разговор о ограничениях. Готовые примеры кода. Поддержка сообщества.

5 Whys: почему GigaAM побеждает Whisper на русском

Метод 5 Whys — глубокий анализ корневой причины проблемы. Мы применили его, чтобы понять, почему GigaAM обходит Whisper. Проблема: GigaAM показывает WER 23.9%, Whisper — 35.7% на русском языке. Почему 1: Почему GigaAM лучше? Потому что он делает меньше ошибок распознавания на русской речи. Каждое пятое слово вместо каждого третьего. Почему 2: Почему он делает меньше ошибок? Потому что его архитектура (CTC-декодер) не страдает от каскадных ошибок, а encoder обучен на русскоязычных данных. Почему 3: Почему encoder обучен лучше на русском? Потому что обучающий корпус GigaAM состоит преимущественно из русской речи. Модель видела миллионы часов русского языка. Почему 4: Почему корпус такой большой? Потому что Сбер — российская компания, для которой русский язык — основной рынок. Инвестиции в русскоязычные данные оправданы с точки зрения ROI. Почему 5 (корневая причина): Почему это важно? Потому что ASR-модель — это не универсальный инструмент. Качество распознавания определяется качеством и релевантностью обучающих данных. Модель, обученная на русском, будет лучше распознавать русскую речь. Модель, обученная на английском — хуже. Это очевидно, но почему-то многим кажется, что мультиязычная модель может быть хороша во всём.

SCAMPER-анализ: что если перевернуть представление об ASR

SCAMPER — метод генерации идей, который предлагает задать серию вопросов. Мы применили его к ASR для русского языка. Substitute (заменить): Что если заменить autoregressive декодер на CTC? Результат — GigaAM. Скорость выросла, каскадные ошибки исчезли. Combine (объединить): Что если объединить CTC-декодер с трансформерным encoder? Результат — архитектура GigaAM. Encoder извлекает признаки, CTC декодирует их в текст. Adapt (адаптировать): Что если адаптировать модель под один язык вместо 99? Результат — специализация. Все параметры оптимизированы под русскую фонетику. Modify (модифицировать): Что если модифицировать обучающие данные, добавив больше русской речи? Результат — лучшее распознавание русских слов, меньше ошибок. Put to another use (применить иначе): Что если использовать GigaAM не для транскрибации подкастов, а для анализа звонков в колл-центр? Результат — WER 23.9% на реальных записях с шумом и профессиональным жаргоном. Eliminate (устранить): Что если убрать DSP-обработку перед распознаванием? Результат — WER улучшился с 36.4% до 23.9%. Парадокс: «улучшение» сигнала ухудшило результат. Reverse (перевернуть): Что если перевернуть подход: вместо «универсальная модель для всех языков» — «специализированная модель для одного языка»? Результат — GigaAM. Специализация побеждает универсальность.

Практические рекомендации

На основе наших тестов и опыта эксплуатации GigaAM, вот что мы рекомендуем.

Не используйте DSP перед GigaAM

Мы потратили неделю, настраивая DSP, прежде чем поняли, что для GigaAM он вреден. Спектральное подавление шума искажает короткие фонемы, которые CTC-модель и так плохо распознаёт. Подробнее об этом — в статье .

Используйте beam search для продакшена

Greedy decoding быстрее, но beam search точнее. На продакшене разница в 1-3% WER оправдывает дополнительные вычислительные затраты.

Планируйте GPU-инфраструктуру

GigaAM требует GPU. Для обработки длинных записей (>30 минут) нужен GPU с минимум 3GB VRAM. NVIDIA T4 или A10 — хороший выбор для продакшена.

Комбинируйте с диаризацией

GigaAM распознаёт речь, но не различает спикеров. Для определения «кто говорит» используйте pyannote или аналогичные модели диаризации. Подробнее о том, почему стандартные эвристики склейки здесь не работают и как построить стабильный пайплайн, читайте в нашей статье .

Вывод

GigaAM — это ASR-модель, которая доказала: специализация побеждает универсальность. CTC-декодер, обученный на русской речи, обходит Whisper — самую популярную open-source ASR в мире — на 12 процентных пунктов по WER. Это не значит, что GigaAM лучше Whisper во всём. Whisper поддерживает 99 языков, имеет активное сообщество, проще в интеграции. Если вам нужна мультиязычная модель — Whisper остаётся лучшим выбором. Но если вы работаете с русским языком и вам нужна точность — GigaAM. WER 23.9% вместо 35.7%. Восемьсот часов ручной работы вместо тысячи двухсот. Читаемый текст вместо набора символов. Мы в TEOM используем GigaAM как основу нашего транскрибационного пайплайна. Если вы хотите попробовать — начните с бесплатного тестирования. Две минуты на загрузку, результат — сразу.
Хотите узнать больше о транскрибации на русском? Читайте наш бенчмарк Whisper vs GigaAM и разбор почему DSP ломает GigaAM.
gigaamasrмодельctcсберрусский язык

Попробуйте TEOM бесплатно

Загрузите файл и получите результат за секунды.