НовостиМакроОткрытые ASR-модели в 2026 году: сравнение по WER, языковому покрытию, задержке и лицензиям

Открытые ASR-модели в 2026 году: сравнение по WER, языковому покрытию, задержке и лицензиям

Автор: MarkTechPost·

Ключевые выводы

  • Ведущие открытые ASR-модели в Hugging Face Open ASR Leaderboard разделены менее чем одним пунктом word error rate, поэтому позиция в лидерборде становится инструментом предварительного отбора, а не решающим критерием выбора.
  • Прямое сравнение показателей лидерборда осложняется методологическими различиями, включая разные подмножества датасетов, дообучение под конкретный бенчмарк и private-track оценки, способные менять порядок рейтинга.
  • Условия лицензий — Apache 2.0, MIT и CC-BY-4.0 — часто определяют возможность deployment, поскольку требования атрибуции CC-BY-4.0 могут исключать модели для встроенных или white-labeled продуктов.
  • Различия в пропускной способности ведущих открытых ASR-моделей превышают порядок величины, делая стоимость аудиочаса более важным дифференциатором, чем точность, для крупномасштабных пакетных нагрузок.
  • Meta's Omnilingual ASR нативно охватывает более 1,600 языков и расширяется до более чем 5,400 через zero-shot learning, предоставляя ASR-возможности для более чем 500 языков, ранее не поддерживаемых ни одной системой.
Открытые ASR-модели в 2026 году: сравнение по WER, языковому покрытию, задержке и лицензиям

Открытое распознавание речи больше не доминируется Whisper так, как это было годом ранее. В марте 2026 года Cohere выпустила Transcribe — модель с 2B параметров под лицензией Apache 2.0, которая вышла на первое место Hugging Face Open ASR Leaderboard со средним word error rate, или WER, 5.42%. WER учитывает замены, удаления и вставки относительно эталонной расшифровки, поэтому полезен для сравнения точности распознавания, но не отражает задержку, атрибуцию говорящих, качество временных меток или форматирование. Через пять недель IBM выпустила Granite Speech 4.1 2B с результатом 5.33%. С тех пор ARK-ASR-3B и MOSS-Transcribe-preview-2B сообщили о еще более низких показателях.

Ведущие модели в этом лидерборде теперь разделены менее чем одним пунктом WER. Для команд, выбирающих модель автоматического распознавания речи, это меняет процесс принятия решения: позиция в лидерборде больше не является единственной и даже решающей переменной. Условия лицензии, языковая поддержка, возможность потоковой обработки и стоимость аудиочаса теперь имеют сопоставимый вес. В этом сравнении рассматривается поле открытых ASR-моделей по этим факторам.

Показатель лидерборда имеет важные ограничения

Среднее значение Open ASR Leaderboard не является единой фиксированной метрикой, а модели, показанные в таблице рядом друг с другом, не все оценивались строго одинаковым образом.

Оценка Cohere 5.42% — это среднее по восьми англоязычным тестовым наборам, включая TED-LIUM. Показатели по наборам данных: AMI 8.13, Earnings-22 10.86, GigaSpeech 9.34, LibriSpeech clean 1.25, LibriSpeech other 2.37, SPGISpeech 3.08, TED-LIUM 2.49 и VoxPopuli 5.87, что в среднем дает ровно 5.42.

Показатель ARK-ASR-3B 5.04% усреднен по семи наборам. TED-LIUM не включен. В карточке модели MOSS-Transcribe-preview-2B это прямо указано: TED-LIUM currently is not currently part of the leaderboard run and is therefore excluded.

Поскольку TED-LIUM — один из более простых наборов данных в этой группе, его исключение повышает среднее значение. Если пересчитать опубликованные Cohere показатели по отдельным наборам данных на тех же семи наборах, которые указывает ARK, результат Cohere составит 5.84, а не 5.42. Применение того же метода к Granite Speech 4.1 2B меняет показатель с 5.33 на 5.65. При сопоставлении на одинаковой основе преимущество ARK оказывается больше, чем предполагают заголовочные цифры, а не меньше. Более общий вывод состоит в том, что простое вычитание одного опубликованного показателя лидерборда из другого не обязательно дает содержательное сравнение.

Существенны еще две оговорки.

Во-первых, некоторые результаты открыто подогнаны под лидерборд. В карточке MOSS-Transcribe-preview-2B сказано, что модель дообучалась с помощью reinforcement learning на обучающих сплитах Open ASR Leaderboard. Такое раскрытие полезно, но оно также означает, что показатель отражает производительность на бенчмарке, а не только общую способность модели.

Во-вторых, данные private track могут изменить порядок в таблице. Appen предоставила скрытые оценочные наборы, охватывающие австралийский, канадский, индийский и американский акценты как в сценарных, так и в разговорных условиях. Когда эти private-наборы включаются, zoom/scribe_v1 перемещается с No. 4 на No. 1, а лидер публичного лидерборда опускается на одну позицию. Модели, настроенные на чистую прочитанную речь, могут непропорционально сильнее деградировать на спонтанной разговорной аудиозаписи.

Поэтому лидерборд полезен для формирования короткого списка. Его не следует считать полноценным механизмом выбора.

Модели, ориентированные на точность

Cohere Transcribe (2B, Apache 2.0, 14 languages) — модель из этой группы, которая уже вышла в production. За последний месяц ее скачали более 620,000 раз, а поддержка выполнения доступна в transformers, vLLM, mlx-audio для Apple Silicon, Rust-порте и WebGPU-сборке. Модель использует Conformer-энкодер с легковесным Transformer-декодером и обучалась с нуля. Cohere также провела оценку человеческих предпочтений, в которой обученные аннотаторы оценивали расшифровки по сохранению смысла, hallucination и именованным сущностям. Модель показала средний win rate 61%, включая 78% против IBM Granite 4.0 1B Speech и 64% против Whisper large-v3.

Ограничения модели существенны и четко указаны в карточке. Cohere Transcribe не предоставляет автоматическое определение языка, временные метки или diarization. Модель также склонна транскрибировать тишину, поэтому Cohere рекомендует ставить перед ней VAD или noise gate. Кроме того, репозиторий закрыт соглашением о предоставлении контактной информации, несмотря на лицензию Apache 2.0.

Granite Speech 4.1 2B (2B, Apache 2.0) сильнее, когда требуется более широкая функциональность, а не самый низкий показатель в лидерборде. Он поддерживает ASR на шести языках, двунаправленный перевод речи, biasing по спискам ключевых слов для имен и профессионального жаргона, пунктуацию и truecasing, включая написание немецких существительных с заглавной буквы. IBM обучила его на 174,000 часах данных и сообщает RTFx 231.29. RTFx — это мера пропускной способности: более высокие значения означают больше обработанного аудио на единицу реального времени, обычно при заданной аппаратной конфигурации и batching. IBM также выпускает две связанные модели: вариант -plus добавляет ASR с атрибуцией говорящих и временные метки на уровне слов, а вариант -nar рассматривается в разделе о пропускной способности.

Canary-Qwen-2.5B (2.5B, CC-BY-4.0, English) объединяет FastConformer-энкодер с декодером Qwen3-1.7B. Он работает в двух режимах: стандартная транскрипция и LLM-режим, в котором декодер резюмирует расшифровку и отвечает на вопросы по ней. Заявленный результат — 5.63% WER при RTFx 418. AMI был oversampled примерно до 15% обучающих данных, что смещает вывод в сторону дословных расшифровок с сохранением речевых сбоев. Такое поведение может быть полезным для юридической работы и менее желательным для заметок по встречам.

Qwen3-ASR-1.7B (Apache 2.0) охватывает 52 языка и диалекта, включая 30 языков плюс 22 китайских диалекта, и сообщает 5.76% WER. Он поставляется с полным inference toolkit и отдельной моделью forced alignment, предоставляющей временные метки на 11 языках. Для сценариев, связанных с мандаринским китайским или региональной китайской речью, это естественная отправная точка.

Модели, ориентированные на пропускную способность

Точность ведущих открытых ASR-моделей теперь различается примерно на один пункт WER. Пропускная способность различается более чем на порядок, поэтому именно она часто определяет операционные затраты. Это особенно важно для архивов, аналитики колл-центров и медиаконвейеров, где нагрузка измеряется тысячами или миллионами аудиоминут, а не живыми разговорами.

Parakeet TDT 0.6B v3 (0.6B, CC-BY-4.0) — лидер по пропускной способности среди многоязычных открытых моделей. Он достигает RTFx 3332.74 на 25 европейских языках, включает автоматическое определение языка и может обрабатывать до 24 минут за один проход на A100 80GB. Компромисс — 6.32% WER, примерно на один пункт выше, чем у Granite 4.1 2B, в обмен примерно на четырнадцатикратный объем аудио на GPU-секунду.

Granite Speech 4.1 2B-NAR — более заметный инженерный результат. Это неавторегрессионная модель: она редактирует CTC-гипотезу за один forward pass с помощью двунаправленной LLM. IBM сообщает RTFx около 1820 на одном H100 при batch size 128. Для достижения такой пропускной способности модель отказывается от японского языка, перевода речи и keyword biasing.

Qwen3-ASR-0.6B сохраняет все 52 языка и достигает 2000× throughput при concurrency 128.

Модели, ориентированные на стриминг

Batch WER — неудобная метрика для потоковых моделей, хотя лидерборд все равно оценивает их по ней. Voxtral Realtime указан с 7.68%, а Kyutai STT 2.6B — с 6.40%. Оба ниже Whisper по этой метрике, но эти числа мало говорят об их целевом применении.

Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 languages) объединяет языковую модель 3.4B с каузальным аудиоэнкодером 970M, обученным с нуля. Обе части используют sliding-window attention, что позволяет фактически неограниченный стриминг. Задержку транскрипции можно настраивать шагами по 80ms от 80ms до 1200ms, также есть отдельная опция 2400ms. Mistral рекомендует 480ms как оптимальную настройку и заявляет, что при ней модель соответствует ведущим офлайн-открытым моделям. Она работает на одном GPU 16GB и имела поддержку vLLM Realtime API с day-0.

Kyutai STT (CC-BY-4.0) доступна в двух вариантах: модель примерно на 1B параметров для English/French с задержкой 0.5s и встроенным семантическим детектором голосовой активности, а также English-only модель 2.6B с задержкой 2.5s. Для голосовых агентов семантический VAD может быть важнее задержки транскрипции, поскольку он предсказывает, когда говорящий действительно закончил, а именно это определяет воспринимаемую задержку очередности реплик. Один H100 может обслуживать 400 одновременных потоков в реальном времени.

Модели, ориентированные на покрытие

Meta’s Omnilingual ASR (Apache 2.0 для модели, CC-BY для корпуса) не конкурирует прежде всего по WER, и ее не следует оценивать так, будто это ее основная цель. Она нативно охватывает более 1,600 языков и расширяется до более чем 5,400 через zero-shot in-context learning. Система построена на wav2vec 2.0 encoder, масштабированном до 7B, и предварительно обучена примерно на 4.3M часах. Вариант 7B LLM-ASR достигает character error rate ниже 10% на 78% поддерживаемых языков, включая более 500 языков, которые ранее не обслуживались ни одной ASR-системой. Character error rate обычно используется там, где границы слов непоследовательны или где оценка языков с малым объемом ресурсов практичнее на уровне символов. Размеры энкодеров варьируются от 300M до 7B. Meta также выпустила Omnilingual ASR Corpus, охватывающий более 350 недостаточно представленных языков.

Whisper large-v3 (1.55B, MIT, 99 languages) был превзойден по точности примерно десятью открытыми моделями, но остается сильным вариантом по умолчанию для многих проектов. MIT — наименее обременительная лицензия в этой области. Его runtime-экосистема — whisper.cpp, faster-whisper и WhisperX — остается непревзойденной среди новых релизов. Для требований, сводящихся к широкому языковому покрытию, гибкой аппаратной поддержке и минимальным лицензионным ограничениям, Whisper large-v3 все еще является практичным ответом.

Модели, ориентированные на исследования

diffusion-gemma-asr-small от YC-стартапа Interfaze — один из самых архитектурно необычных релизов года. Он генерирует расшифровки через parallel diffusion denoising по полотну из 256 токенов за 8–16 шагов, поэтому стоимость декодирования не растет с длиной расшифровки. Было обучено всего около 42M параметров, что равно 0.16% весов, поверх замороженной 26B DiffusionGemma и замороженного whisper-small encoder. Модель достигает 6.6% WER на LibriSpeech test-clean примерно при 11–17× realtime. Она также показывает 15.7% на FLEURS English и 29.6% CER на FLEURS Mandarin, поэтому показатель LibriSpeech следует считать верхней планкой. Модель не представлена как готовая к deployment, но это важное исследование для практиков ASR.

MOSS-Transcribe-Diarize 0.9B (Apache 2.0, 50+ languages) решает проблему, которую многие сравнения ASR оставляют в стороне: она выводит метки говорящих, временные метки слов и расшифровку за одну генерацию, вместо того чтобы связывать ASR с отдельной системой diarization. Она поддерживает контекст 128k, примерно 90 минут аудио за один проход, RTF около 0.017 на RTX 4090 и hotword biasing.

Лицензионные различия могут решить судьбу deployment

Лицензирование часто является вопросом, который определяет, сможет ли модель фактически выйти в продукт. Поле делится достаточно четко.

Apache 2.0 распространяется на Cohere Transcribe, Granite Speech 4.1 во всех трех вариантах, Qwen3-ASR в обоих размерах, Voxtral Mini Realtime, Omnilingual ASR, ARK-ASR и MOSS-Transcribe. У этих моделей нет обязательства атрибуции, а коммерческое использование не ограничено. Однако репозиторий Cohere закрыт соглашением о предоставлении контактной информации, хотя сама лицензия — Apache 2.0.

MIT применяется к Whisper large-v3, что делает его самым разрешительным вариантом в этой области.

CC-BY-4.0 применяется к Canary-Qwen-2.5B, Parakeet TDT 0.6B v3 и Kyutai STT. Эти модели можно использовать коммерчески, но требуется атрибуция. Для встроенного продукта или white-labeled API это требование атрибуции является значимой compliance-обязанностью и часто становится причиной, по которой команды внедряют не самую точную из протестированных моделей.

Meta’s Omnilingual ASR разделена: модели имеют лицензию Apache 2.0, а корпус — CC-BY.

Практический порядок выбора

Процесс выбора модели не должен просто следовать порядку лидерборда.

Начните с лицензии. Если атрибуция неприемлема, CC-BY-4.0 исключает Parakeet, Canary-Qwen и Kyutai еще до начала бенчмаркинга.

Затем проверьте языковое покрытие. 14 языков Cohere, 6 языков Granite и English-only покрытие Canary — это фиксированные ограничения. У Cohere также нет автоматического определения языка, поэтому язык должен быть известен заранее.

После этого решите, требуется ли приложению потоковая или пакетная работа. Это архитектурное различие: tuning не превращает офлайн encoder-decoder модель в низколатентную потоковую систему.

Затем измерьте WER на реальном аудио, которое предстоит обрабатывать. Разброс публичного бенчмарка среди десяти лучших моделей меньше одного пункта, но разброс на акцентированной, шумной или доменно-специфической аудиозаписи будет в несколько раз больше и не обязательно расставит модели в том же порядке. Если downstream-системы зависят от diarization, временных меток, пунктуации или обработки hotword, эти выходы нужно тестировать напрямую, а не выводить из WER.

Наконец, рассчитайте стоимость аудиочаса на том оборудовании, которое действительно будет использоваться. Показатели RTFx обычно измеряются при больших batch size на датацентровом оборудовании и не переносятся напрямую на каждую конфигурацию deployment.

Главное изменение 2026 года не в том, что одна модель выиграла рынок ASR. Оно в том, что модель с открытыми весами на 2B параметров и разрешительной лицензией теперь способна превысить уровень производительности, за который закрытые API брали плату восемнадцать месяцев назад, а оставшийся выбор все больше напоминает закупочное решение, а не исследовательскую задачу.

Источники, указанные в оригинальной статье, включают блог и карточку модели Cohere Transcribe; IBM Granite Speech 4.1 2B и 4.1 2B-NAR; ARK-ASR-3B; MOSS-Transcribe-preview-2B и MOSS-Transcribe-Diarize; NVIDIA Canary-Qwen-2.5B и Parakeet TDT 0.6B v3; Qwen3-ASR; Voxtral Mini 4B Realtime 2602; Kyutai STT; Meta Omnilingual ASR и paper; Whisper large-v3; diffusion-gemma-asr; paper Open ASR Leaderboard; leaderboard dataset; и private-track announcement Appen.

Позиции в лидерборде обновляются в реальном времени и часто меняются. Все показатели были сверены с первичными источниками 23 July 2026.