ActualitésMacroModèles ASR ouverts en 2026 comparés selon le WER, la couverture linguistique, la latence et la licence

Modèles ASR ouverts en 2026 comparés selon le WER, la couverture linguistique, la latence et la licence

Auteur: MarkTechPost·

Points clés

  • Les principaux modèles ASR ouverts du Hugging Face Open ASR Leaderboard sont séparés par moins d’un point de taux d’erreur de mots, ce qui réduit le classement à un outil de présélection plutôt qu’à un critère de choix décisif.
  • La comparaison directe des scores de classement est compliquée par des incohérences méthodologiques, notamment des sous-ensembles de jeux de données différents, un affinage spécifique au benchmark et des évaluations en piste privée susceptibles de réordonner les rangs.
  • Les conditions de licence — Apache 2.0, MIT et CC-BY-4.0 — déterminent fréquemment la faisabilité du déploiement, les exigences d’attribution de CC-BY-4.0 pouvant exclure certains modèles des produits embarqués ou en marque blanche.
  • Les différences de débit entre les principaux modèles ASR ouverts dépassent un ordre de grandeur, ce qui fait du coût par heure audio un facteur plus déterminant que la précision pour les charges de travail par lots à grande échelle.
  • Omnilingual ASR de Meta couvre nativement plus de 1,600 langues et s’étend à plus de 5,400 via l’apprentissage zero-shot, apportant des capacités ASR à plus de 500 langues auparavant non prises en charge par aucun système.
Modèles ASR ouverts en 2026 comparés selon le WER, la couverture linguistique, la latence et la licence

La reconnaissance vocale ouverte n’est plus dominée par Whisper comme elle l’était un an plus tôt. En mars 2026, Cohere a publié Transcribe, un modèle Apache 2.0 de 2B paramètres qui a atteint la première place du Hugging Face Open ASR Leaderboard avec un taux moyen d’erreur de mots de 5.42%, ou WER. Le WER compte les substitutions, suppressions et insertions par rapport à une transcription de référence ; il est donc utile pour comparer la précision de reconnaissance, mais ne reflète pas la latence, l’attribution des locuteurs, la qualité des horodatages ni la mise en forme. Cinq semaines plus tard, IBM a publié Granite Speech 4.1 2B à 5.33%. Depuis, ARK-ASR-3B et MOSS-Transcribe-preview-2B ont annoncé des chiffres encore plus bas.

Les modèles en tête de ce classement sont désormais séparés par moins d’un point de WER. Pour les équipes qui choisissent un modèle de reconnaissance automatique de la parole, cela modifie le processus de décision : le rang au classement n’est plus la seule variable, ni même la variable décisive. Les conditions de licence, la prise en charge des langues, les capacités de streaming et le coût par heure audio ont désormais un poids comparable. Cette comparaison examine le champ des modèles ASR ouverts selon ces facteurs.

Le chiffre du classement comporte des limites importantes

La moyenne de l’Open ASR Leaderboard n’est pas une mesure unique et fixe, et les modèles affichés côte à côte dans le classement n’ont pas tous été évalués exactement de la même manière.

Le score de 5.42% de Cohere est une moyenne sur huit jeux de test en anglais, dont TED-LIUM. Les chiffres par jeu de données sont AMI 8.13, Earnings-22 10.86, GigaSpeech 9.34, LibriSpeech clean 1.25, LibriSpeech other 2.37, SPGISpeech 3.08, TED-LIUM 2.49 et VoxPopuli 5.87, ce qui donne exactement une moyenne de 5.42.

Le chiffre de 5.04% d’ARK-ASR-3B est une moyenne sur sept jeux. TED-LIUM n’est pas inclus. La fiche du modèle MOSS-Transcribe-preview-2B l’indique explicitement : TED-LIUM ne fait pas actuellement partie de l’exécution du classement et est donc exclu.

Comme TED-LIUM est l’un des jeux de données les plus faciles de la suite, son exclusion augmente la moyenne. Si les scores par jeu de données publiés par Cohere sont recalculés sur les sept mêmes jeux de données que ceux rapportés par ARK, le résultat de Cohere devient 5.84 au lieu de 5.42. En appliquant la même méthode à Granite Speech 4.1 2B, son chiffre passe de 5.33 à 5.65. À périmètre comparable, l’avance d’ARK est plus importante que ne le suggèrent les chiffres principaux, et non plus faible. Le point plus général est que soustraire un chiffre publié dans le classement à un autre ne produit pas nécessairement une comparaison significative.

Deux réserves supplémentaires sont également importantes.

Premièrement, certains scores sont explicitement ajustés au classement. La fiche de MOSS-Transcribe-preview-2B indique que le modèle a été affiné par apprentissage par renforcement sur les partitions d’entraînement de l’Open ASR Leaderboard. Cette transparence est utile, mais elle signifie aussi que le score mesure la performance sur le benchmark plutôt que la capacité générale seule.

Deuxièmement, les données en piste privée peuvent réordonner le classement. Appen a fourni des jeux d’évaluation tenus à l’écart couvrant des accents australiens, canadiens, indiens et américains, dans des conditions scénarisées et conversationnelles. Lorsque ces jeux privés sont activés, zoom/scribe_v1 passe de la 4e à la 1re place, tandis que le leader du classement public recule d’une position. Les modèles optimisés pour une parole lue et propre peuvent se dégrader de manière disproportionnée sur de l’audio conversationnel spontané.

Le classement est donc utile pour établir une présélection. Il ne doit pas être traité comme un mécanisme complet de sélection.

Modèles axés sur la précision

Cohere Transcribe (2B, Apache 2.0, 14 langues) est le modèle de ce groupe qui a déjà été mis en production. Il a été téléchargé plus de 620,000 fois au cours du mois écoulé et dispose d’une prise en charge d’exécution via transformers, vLLM, mlx-audio pour Apple Silicon, un port Rust et une version WebGPU. Le modèle utilise un encodeur Conformer avec un décodeur Transformer léger et a été entraîné à partir de zéro. Cohere a également mené une évaluation de préférence humaine dans laquelle des annotateurs formés ont noté les transcriptions selon la préservation du sens, les hallucinations et les entités nommées. Le modèle a enregistré un taux moyen de victoire de 61%, dont 78% face à IBM Granite 4.0 1B Speech et 64% face à Whisper large-v3.

Ses limites sont importantes et clairement indiquées dans la fiche du modèle. Cohere Transcribe ne fournit ni détection automatique de la langue, ni horodatages, ni diarisation. Le modèle a aussi tendance à transcrire le silence ; Cohere recommande donc de placer un VAD ou une porte de bruit en amont. En outre, le dépôt est soumis à un accord de fourniture de coordonnées, malgré la licence Apache 2.0.

Granite Speech 4.1 2B (2B, Apache 2.0) est plus solide lorsque le besoin porte sur des capacités plus larges plutôt que sur le plus bas chiffre du classement. Il prend en charge l’ASR dans six langues, la traduction vocale bidirectionnelle, le biaisage par liste de mots-clés pour les noms et le jargon, la ponctuation et la casse correcte, y compris la capitalisation des noms en allemand. IBM l’a entraîné sur 174,000 heures de données et annonce un RTFx de 231.29. Le RTFx est une mesure de débit : des valeurs plus élevées signifient davantage d’audio traité par unité de temps réel, généralement dans une configuration matérielle et de traitement par lots donnée. IBM fournit également deux modèles apparentés : la variante -plus ajoute l’ASR avec attribution des locuteurs et les horodatages au niveau des mots, tandis que la variante -nar est abordée dans la section sur le débit.

Canary-Qwen-2.5B (2.5B, CC-BY-4.0, anglais) combine un encodeur FastConformer avec un décodeur Qwen3-1.7B. Il fonctionne selon deux modes : transcription standard, et mode LLM dans lequel le décodeur résume la transcription et répond à des questions à son sujet. Il annonce 5.63% de WER à RTFx 418. AMI a été suréchantillonné à environ 15% des données d’entraînement, ce qui oriente la sortie vers des transcriptions verbatim qui conservent les disfluences. Ce comportement peut être utile pour le travail juridique et moins souhaitable pour les comptes rendus de réunion.

Qwen3-ASR-1.7B (Apache 2.0) couvre 52 langues et dialectes, soit 30 langues plus 22 dialectes chinois, et annonce 5.76% de WER. Il est livré avec une boîte à outils complète d’inférence et un modèle distinct d’alignement forcé qui fournit des horodatages dans 11 langues. Pour les cas d’usage impliquant le mandarin ou des parlers régionaux chinois, c’est un point de départ naturel.

Modèles axés sur le débit

La précision des principaux modèles ASR ouverts varie désormais d’environ un point de WER. Le débit varie de plus d’un ordre de grandeur, ce qui signifie qu’il détermine souvent le coût opérationnel. Cela compte surtout pour les archives, l’analytique de centres d’appels et les chaînes de traitement média, où la charge de travail se mesure en milliers ou millions de minutes audio plutôt qu’en conversations en direct.

Parakeet TDT 0.6B v3 (0.6B, CC-BY-4.0) est le leader du débit parmi les modèles ouverts multilingues. Il atteint RTFx 3332.74 sur 25 langues européennes, inclut l’identification automatique de la langue et peut traiter jusqu’à 24 minutes en une seule passe sur un A100 80GB. Le compromis est un WER de 6.32%, soit environ un point de plus que Granite 4.1 2B, en échange d’environ quatorze fois plus d’audio par seconde GPU.

Granite Speech 4.1 2B-NAR est le résultat d’ingénierie le plus notable. Il est non autorégressif : il corrige une hypothèse CTC en une seule passe avant à l’aide d’un LLM bidirectionnel. IBM annonce un RTFx d’environ 1820 sur un H100 avec une taille de lot de 128. Pour atteindre ce débit, il abandonne le japonais, la traduction vocale et le biaisage par mots-clés.

Qwen3-ASR-0.6B conserve les 52 langues et atteint un débit de 2000× avec une concurrence de 128.

Modèles axés sur le streaming

Le WER par lots est une mesure mal adaptée aux modèles de streaming, même si le classement les évalue tout de même. Voxtral Realtime est listé à 7.68% et Kyutai STT 2.6B à 6.40%. Les deux sont en dessous de Whisper selon cette métrique, mais ces chiffres en disent peu sur leur usage prévu.

Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 langues) combine un modèle de langage de 3.4B avec un encodeur audio causal de 970M entraîné à partir de zéro. Les deux parties utilisent une attention à fenêtre glissante, permettant un streaming effectivement non borné. Le délai de transcription peut être configuré par pas de 80ms, de 80ms à 1200ms, avec une option autonome supplémentaire de 2400ms. Mistral recommande 480ms comme réglage optimal et indique qu’à ce réglage le modèle égale les principaux modèles ouverts hors ligne. Il fonctionne sur un seul GPU 16GB et disposait dès le jour 0 d’une prise en charge de l’API vLLM Realtime.

Kyutai STT (CC-BY-4.0) est disponible sous deux formes : un modèle anglais/français d’environ 1B paramètres avec un délai de 0.5s et un détecteur sémantique intégré d’activité vocale, et un modèle uniquement anglais de 2.6B avec un délai de 2.5s. Pour les agents vocaux, le VAD sémantique peut compter davantage que le délai de transcription, car il prédit quand le locuteur a réellement terminé, ce qui détermine la latence perçue dans les tours de parole. Un H100 peut servir 400 flux simultanés en temps réel.

Modèles axés sur la couverture

Omnilingual ASR de Meta (Apache 2.0 pour le modèle, CC-BY pour le corpus) ne concurrence pas principalement sur le WER et ne doit pas être évalué comme si c’était le cas. Il couvre nativement plus de 1,600 langues et s’étend à plus de 5,400 par apprentissage en contexte zero-shot. Le système repose sur un encodeur wav2vec 2.0 porté à 7B et préentraîné sur environ 4.3M heures. La variante 7B LLM-ASR atteint un taux d’erreur de caractères inférieur à 10% sur 78% des langues prises en charge, dont plus de 500 langues qui n’avaient auparavant été couvertes par aucun système ASR. Le taux d’erreur de caractères est couramment utilisé lorsque les frontières de mots ne sont pas cohérentes ou lorsque l’évaluation de langues peu dotées est plus pratique au niveau des caractères. Les tailles d’encodeur vont de 300M à 7B. Meta a également publié l’Omnilingual ASR Corpus, couvrant plus de 350 langues sous-représentées.

Whisper large-v3 (1.55B, MIT, 99 langues) a été dépassé en précision par une dizaine de modèles ouverts, mais il reste un choix par défaut solide pour de nombreux projets. MIT est la licence la moins contraignante du domaine. Son écosystème d’exécution — whisper.cpp, faster-whisper et WhisperX — reste inégalé parmi les versions plus récentes. Pour des besoins correspondant à une large prise en charge linguistique, une compatibilité matérielle flexible et une friction minimale en matière de licence, Whisper large-v3 reste une réponse pratique.

Modèles axés sur la recherche

diffusion-gemma-asr-small de la startup YC Interfaze est l’une des publications les plus inhabituelles de l’année sur le plan architectural. Il génère des transcriptions par débruitage par diffusion parallèle sur un canevas de 256 jetons en 8 à 16 étapes, de sorte que le coût de décodage n’augmente pas avec la longueur de la transcription. Seuls environ 42M paramètres ont été entraînés, soit 0.16% des poids, au-dessus d’un DiffusionGemma 26B gelé et d’un encodeur whisper-small gelé. Il atteint 6.6% de WER sur LibriSpeech test-clean à environ 11 à 17× le temps réel. Il enregistre aussi 15.7% sur FLEURS anglais et 29.6% de CER sur FLEURS mandarin ; le chiffre LibriSpeech doit donc être considéré comme un plafond. Le modèle n’est pas présenté comme prêt pour le déploiement, mais il constitue une recherche importante pour les praticiens de l’ASR.

MOSS-Transcribe-Diarize 0.9B (Apache 2.0, 50+ langues) traite un problème que beaucoup de comparaisons ASR laissent de côté : il produit les étiquettes de locuteurs, les horodatages de mots et la transcription en une seule génération, au lieu d’enchaîner l’ASR avec un système de diarisation séparé. Il prend en charge un contexte de 128k, environ 90 minutes d’audio en une seule passe, un RTF d’environ 0.017 sur une RTX 4090 et le biaisage par mots-clés.

Les différences de licence peuvent décider du déploiement

La licence est souvent le facteur qui détermine si un modèle peut réellement être lancé. Le domaine se divise clairement.

Apache 2.0 couvre Cohere Transcribe, Granite Speech 4.1 dans ses trois variantes, Qwen3-ASR dans ses deux tailles, Voxtral Mini Realtime, Omnilingual ASR, ARK-ASR et MOSS-Transcribe. Ces modèles n’imposent aucune obligation d’attribution, et l’usage commercial est illimité. Le dépôt de Cohere est toutefois soumis à un accord de fourniture de coordonnées, même si la licence elle-même est Apache 2.0.

MIT s’applique à Whisper large-v3, ce qui en fait l’option la plus permissive du domaine.

CC-BY-4.0 s’applique à Canary-Qwen-2.5B, Parakeet TDT 0.6B v3 et Kyutai STT. Ces modèles peuvent être utilisés commercialement, mais l’attribution est obligatoire. Pour un produit embarqué ou une API en marque blanche, cette exigence d’attribution constitue une obligation de conformité significative et explique souvent pourquoi des équipes déploient un modèle autre que le plus précis qu’elles ont testé.

Omnilingual ASR de Meta est partagé : les modèles sont sous Apache 2.0, tandis que le corpus est sous CC-BY.

Un ordre de sélection pratique

Un processus de sélection de modèle ne doit pas simplement suivre l’ordre du classement.

Commencez par la licence. Si l’attribution n’est pas acceptable, CC-BY-4.0 élimine Parakeet, Canary-Qwen et Kyutai avant même le début des benchmarks.

Ensuite, vérifiez la couverture linguistique. Les 14 langues de Cohere, les 6 de Granite et la couverture uniquement anglaise de Canary sont des contraintes fixes. Cohere ne dispose pas non plus de détection automatique de la langue ; la langue doit donc être connue à l’avance.

Puis déterminez si l’application exige du streaming ou un traitement par lots. Il s’agit d’une distinction architecturale : l’optimisation ne transforme pas un modèle encodeur-décodeur hors ligne en système de streaming à faible latence.

Ensuite, mesurez le WER sur l’audio réel à traiter. L’écart du benchmark public entre les dix meilleurs modèles est inférieur à un point, mais l’écart sur de l’audio accentué, bruité ou propre à un domaine sera plusieurs fois plus important et ne classera pas nécessairement les modèles dans le même ordre. Si les systèmes en aval dépendent de la diarisation, des horodatages, de la ponctuation ou de la gestion de mots-clés, ces sorties doivent être testées directement plutôt que déduites du WER.

Enfin, calculez le coût par heure audio sur le matériel qui sera réellement utilisé. Les chiffres RTFx sont généralement mesurés avec de grandes tailles de lot sur du matériel de centre de données et ne se transfèrent pas directement à tous les contextes de déploiement.

L’évolution centrale de 2026 n’est pas qu’un seul modèle ait remporté le marché de l’ASR. C’est qu’un modèle à poids ouverts de 2B sous licence permissive peut désormais dépasser le niveau de performance que les API fermées facturaient dix-huit mois plus tôt, tandis que le choix restant ressemble de plus en plus à une décision d’achat plutôt qu’à une décision de recherche.

Les sources citées dans l’article original incluent le blog et la fiche de modèle de Cohere Transcribe ; IBM Granite Speech 4.1 2B et 4.1 2B-NAR ; ARK-ASR-3B ; MOSS-Transcribe-preview-2B et MOSS-Transcribe-Diarize ; NVIDIA Canary-Qwen-2.5B et Parakeet TDT 0.6B v3 ; Qwen3-ASR ; Voxtral Mini 4B Realtime 2602 ; Kyutai STT ; Meta Omnilingual ASR et son article ; Whisper large-v3 ; diffusion-gemma-asr ; l’article de l’Open ASR Leaderboard ; le jeu de données du classement ; et l’annonce de la piste privée d’Appen.

Les positions dans le classement sont dynamiques et changent fréquemment. Tous les chiffres ont été vérifiés auprès de sources primaires le 23 July 2026.