Проблема
Встреча идёт на двух языках. "Let's discuss the budget — вот здесь у нас цифры." Один ASR-модель на одной языковой модели не справляется — она видит переключение языка как ошибку распознавания.Как TEOM решает проблему
Подход 1: Автоопределение языка
GigaAM поддерживает автоопределение языка. Модель сама определяет, на каком языке говорит спикер в каждом сегменте. На практике это работает для чётких переключений ("Now let's move to the next topic — переходим к следующему пункту").Подход 2: Мультиязычная модель
Whisper large-v3 обучен на 99 языков. Справляется со смешением лучше, чем моноязычные модели. Но качество на русском хуже, чем у GigaAM (подробнее в ).Подход 3: Двухпроходная обработка
- Прогоняем через GigaAM (русский)
- Прогоняем через Whisper (мультиязычный)
- LLM объединяет результаты, выбирая лучший вариант для каждого сегмента (см. также )
Где bilingual transcription критична
- Международные совещания — русскоговорящая команда + иностранные партнёры
- Технические встречи — термины на английском, обсуждение на русском
- Интервью — журналист на русском, гость на английском
- Обучение — лекция на русском с англоязычными терминами
Ограничения
- Переключение серединой предложения — "Let me check the numbers — цифры там" — может не распознать
- Сленг + код-свитчинг — "Это было very interesting" — зависит от контекста
- Акцент — сильный акцент может сбить определение языка
Наши результаты
На 5 двуязычных встречах (30-60 минут):| Сценарий | Точность |
| Чередование по абзацам | 92% |
| Смешение в одном предложении | 78% |
| Термины на английском в русском тексте | 85% |
Как попробовать
Загрузите запись двуязычной встречи. TEOM автоматически определит языки и распознает каждый сегмент.Для идеальной точности на bilingual записях — включите диаризацию. Тогда будет видно, кто на каком языке говорит.
bilingualдвуязычностьтранскрибациярусско-английский