NieuwsMacroOpen ASR-modellen in 2026 vergeleken op WER, taaldekking, latency en licentie

Open ASR-modellen in 2026 vergeleken op WER, taaldekking, latency en licentie

Auteur: MarkTechPost·

Belangrijkste punten

  • Leidende open ASR-modellen op de Hugging Face Open ASR Leaderboard liggen minder dan één woordfoutpercentagepunt uit elkaar, waardoor de leaderboardpositie eerder een hulpmiddel voor shortlisting is dan een doorslaggevend selectiecriterium.
  • Rechtstreekse vergelijking van leaderboard-scores wordt bemoeilijkt door methodologische verschillen, waaronder andere subsets van datasets, benchmarkspecifieke fine-tuning en private-track-evaluaties die ranglijsten kunnen herschikken.
  • Licentievoorwaarden — uiteenlopend van Apache 2.0 en MIT tot CC-BY-4.0 — bepalen vaak of implementatie haalbaar is, waarbij attributie-eisen onder CC-BY-4.0 modellen kunnen uitsluiten voor ingebedde of white-labeled producten.
  • Doorvoerverschillen tussen leidende open ASR-modellen zijn groter dan een orde van grootte, waardoor kosten per audio-uur voor grootschalige batchwerklasten vaak belangrijker zijn dan nauwkeurigheid.
  • Meta’s Omnilingual ASR bestrijkt native meer dan 1,600 talen en breidt via zero-shot learning uit naar meer dan 5,400, waardoor ASR-capaciteit beschikbaar komt voor meer dan 500 talen die niet eerder door enig systeem werden ondersteund.
Open ASR-modellen in 2026 vergeleken op WER, taaldekking, latency en licentie

Open spraakherkenning wordt niet langer door Whisper gedomineerd zoals een jaar eerder. In maart 2026 bracht Cohere Transcribe uit, een Apache 2.0-model met 2B parameters dat bovenaan de Hugging Face Open ASR Leaderboard kwam met een gemiddeld woordfoutpercentage, of WER, van 5.42%. WER telt substituties, deleties en invoegingen ten opzichte van een referentietranscript, waardoor het nuttig is om herkenningsnauwkeurigheid te vergelijken, maar het zegt niets over latency, sprekerstoewijzing, kwaliteit van tijdstempels of opmaak. Vijf weken later bracht IBM Granite Speech 4.1 2B uit met 5.33%. Sindsdien hebben ARK-ASR-3B en MOSS-Transcribe-preview-2B nog lagere cijfers gemeld.

De leidende modellen op die leaderboard liggen inmiddels minder dan één WER-punt uit elkaar. Voor teams die een model voor automatische spraakherkenning kiezen, verandert dat het besluitvormingsproces: de positie op de leaderboard is niet langer de enige, of zelfs doorslaggevende, variabele. Licentievoorwaarden, taalondersteuning, streamingmogelijkheden en kosten per audio-uur wegen nu vergelijkbaar zwaar. Deze vergelijking bespreekt het open ASR-veld langs die factoren.

Het leaderboardcijfer kent belangrijke beperkingen

Het gemiddelde op de Open ASR Leaderboard is geen enkele vaste maatstaf, en modellen die naast elkaar op de lijst staan, zijn niet allemaal exact op dezelfde manier geëvalueerd.

Cohere’s score van 5.42% is een gemiddelde over acht Engelstalige testsets, waaronder TED-LIUM. De cijfers per dataset zijn AMI 8.13, Earnings-22 10.86, GigaSpeech 9.34, LibriSpeech clean 1.25, LibriSpeech other 2.37, SPGISpeech 3.08, TED-LIUM 2.49 en VoxPopuli 5.87, die samen exact uitkomen op 5.42.

Het cijfer van 5.04% voor ARK-ASR-3B is gemiddeld over zeven sets. TED-LIUM is niet inbegrepen. De modelkaart van MOSS-Transcribe-preview-2B vermeldt dit expliciet: TED-LIUM is momenteel geen onderdeel van de leaderboardrun en is daarom uitgesloten.

Omdat TED-LIUM een van de eenvoudiger datasets in de suite is, verhoogt uitsluiting ervan het gemiddelde. Als Cohere’s gepubliceerde scores per dataset opnieuw worden berekend over dezelfde zeven datasets die ARK rapporteert, komt Cohere uit op 5.84 in plaats van 5.42. Dezelfde methode toegepast op Granite Speech 4.1 2B verschuift het cijfer van 5.33 naar 5.65. Op een gelijkwaardige basis is de voorsprong van ARK groter dan de hoofdcijfers suggereren, niet kleiner. Het bredere punt is dat het aftrekken van het ene gepubliceerde leaderboardcijfer van het andere niet noodzakelijk een zinvolle vergelijking oplevert.

Twee aanvullende kanttekeningen zijn eveneens relevant.

Ten eerste zijn sommige scores openlijk op de leaderboard afgestemd. De kaart van MOSS-Transcribe-preview-2B zegt dat het model met reinforcement learning is verfijnd op de trainingssplits van de Open ASR Leaderboard. Die transparantie is nuttig, maar betekent ook dat de score benchmarkprestaties meet en niet uitsluitend algemene capaciteit.

Ten tweede kan private-track-data de ranglijst herschikken. Appen leverde achtergehouden evaluatiesets aan met Australische, Canadese, Indiase en Amerikaanse accenten, zowel in gescripte als conversationele omstandigheden. Wanneer die private sets worden ingeschakeld, stijgt zoom/scribe_v1 van nr. 4 naar nr. 1, terwijl de leider van de publieke leaderboard één positie zakt. Modellen die zijn afgestemd op schone voorgelezen spraak kunnen onevenredig sterk terugvallen op spontane conversationele audio.

De leaderboard is daarom nuttig om een shortlist op te stellen. Zij moet niet worden behandeld als een volledig selectiemechanisme.

Modellen gericht op nauwkeurigheid

Cohere Transcribe (2B, Apache 2.0, 14 talen) is het model in deze groep dat al daadwerkelijk in productie is gebracht. Het is de afgelopen maand meer dan 620,000 keer gedownload en heeft runtime-ondersteuning voor transformers, vLLM, mlx-audio voor Apple Silicon, een Rust-port en een WebGPU-build. Het model gebruikt een Conformer-encoder met een lichte Transformer-decoder en is vanaf nul getraind. Cohere voerde ook een menselijke voorkeursevaluatie uit, waarbij getrainde annotatoren transcripties beoordeelden op behoud van betekenis, hallucinatie en benoemde entiteiten. Het model behaalde een gemiddeld winstpercentage van 61%, waaronder 78% tegenover IBM Granite 4.0 1B Speech en 64% tegenover Whisper large-v3.

De beperkingen zijn aanzienlijk en worden duidelijk vermeld in de modelkaart. Cohere Transcribe biedt geen automatische taaldetectie, tijdstempels of diarization. Het model is ook geneigd om stilte te transcriberen, dus Cohere raadt aan er een VAD of noise gate voor te plaatsen. Daarnaast zit de repository achter een overeenkomst voor contactinformatie, ondanks de Apache 2.0-licentie.

Granite Speech 4.1 2B (2B, Apache 2.0) is sterker wanneer de eis bredere functionaliteit is in plaats van het laagste leaderboardcijfer. Het ondersteunt ASR in zes talen, bidirectionele spraakvertaling, keyword-list biasing voor namen en jargon, interpunctie en truecasing, inclusief hoofdlettergebruik voor Duitse zelfstandige naamwoorden. IBM trainde het op 174,000 uur data en rapporteert RTFx 231.29. RTFx is een doorvoermaat: hogere waarden betekenen dat meer audio per eenheid kloktijd wordt verwerkt, meestal onder een specifieke hardware- en batchconfiguratie. IBM levert ook twee verwante modellen: de -plus-variant voegt ASR met sprekerstoewijzing en tijdstempels op woordniveau toe, terwijl de -nar-variant in de sectie over doorvoer wordt besproken.

Canary-Qwen-2.5B (2.5B, CC-BY-4.0, Engels) combineert een FastConformer-encoder met een Qwen3-1.7B-decoder. Het draait in twee modi: standaardtranscriptie en een LLM-modus waarin de decoder samenvattingen maakt en vragen over het transcript beantwoordt. Het rapporteert 5.63% WER bij RTFx 418. AMI werd oversampled tot ongeveer 15% van de trainingsdata, wat de output richting woordelijke transcripties stuurt die aarzelingen en versprekingen behouden. Dat gedrag kan nuttig zijn voor juridisch werk en minder wenselijk voor vergadernotities.

Qwen3-ASR-1.7B (Apache 2.0) bestrijkt 52 talen en dialecten, bestaande uit 30 talen plus 22 Chinese dialecten, en rapporteert 5.76% WER. Het wordt geleverd met een volledige inferencetoolkit en een afzonderlijk forced-alignment-model dat tijdstempels in 11 talen levert. Voor use-cases met Mandarijn of regionale Chinese spraak is dit een logisch startpunt.

Modellen gericht op doorvoer

De nauwkeurigheid van de leidende open ASR-modellen verschilt inmiddels met ongeveer één WER-punt. De doorvoer verschilt met meer dan een orde van grootte, waardoor doorvoer vaak de operationele kosten bepaalt. Dit is vooral belangrijk voor archieven, callcenteranalyse en mediapijplijnen, waar de werklast wordt gemeten in duizenden of miljoenen audiominuten in plaats van livegesprekken.

Parakeet TDT 0.6B v3 (0.6B, CC-BY-4.0) is de doorvoerleider onder meertalige open modellen. Het bereikt RTFx 3332.74 over 25 Europese talen, bevat automatische taalidentificatie en kan tot 24 minuten in één pass verwerken op een A100 80GB. De afruil is 6.32% WER, ongeveer één punt hoger dan Granite 4.1 2B, in ruil voor circa veertien keer zoveel audio per GPU-seconde.

Granite Speech 4.1 2B-NAR is het opvallendere engineeringresultaat. Het is niet-autoregressief: het bewerkt een CTC-hypothese in één forward pass met behulp van een bidirectionele LLM. IBM rapporteert een RTFx van ongeveer 1820 op één H100 bij batchgrootte 128. Om die doorvoer te bereiken, levert het Japans, spraakvertaling en keyword biasing in.

Qwen3-ASR-0.6B behoudt alle 52 talen en bereikt 2000× doorvoer bij concurrency 128.

Modellen gericht op streaming

Batch-WER is een ongemakkelijke maatstaf voor streamingmodellen, hoewel de leaderboard ze toch beoordeelt. Voxtral Realtime staat vermeld op 7.68% en Kyutai STT 2.6B op 6.40%. Beide liggen op die maatstaf onder Whisper, maar de cijfers zeggen weinig over hun bedoelde gebruik.

Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 talen) combineert een 3.4B-taalmodel met een vanaf nul getrainde 970M causale audio-encoder. Beide onderdelen gebruiken sliding-window attention, waardoor feitelijk onbeperkte streaming mogelijk is. De transcriptievertraging kan worden ingesteld in stappen van 80ms van 80ms tot 1200ms, met een aanvullende zelfstandige optie van 2400ms. Mistral raadt 480ms aan als optimale instelling en zegt dat het model bij die instelling overeenkomt met leidende offline open modellen. Het draait op één 16GB-GPU en had vanaf dag 0 ondersteuning voor de vLLM Realtime API.

Kyutai STT (CC-BY-4.0) is beschikbaar in twee vormen: een Engelstalig/Franstalig model met ongeveer 1B parameters, een vertraging van 0.5s en een ingebouwde semantische voice activity detector, en een Engelstalig model van 2.6B met een vertraging van 2.5s. Voor spraakagents kan de semantische VAD belangrijker zijn dan de transcriptievertraging, omdat die voorspelt wanneer de spreker daadwerkelijk klaar is, wat bepalend is voor de waargenomen latency in beurtwisseling. Een H100 kan 400 gelijktijdige streams in realtime bedienen.

Modellen gericht op dekking

Meta’s Omnilingual ASR (Apache 2.0 voor het model, CC-BY voor het corpus) concurreert niet primair op WER en moet ook niet worden geëvalueerd alsof dat wel zo is. Het bestrijkt native meer dan 1,600 talen en breidt via zero-shot in-context learning uit naar meer dan 5,400. Het systeem is gebouwd op een wav2vec 2.0-encoder opgeschaald naar 7B en vooraf getraind op ongeveer 4.3M uur. De 7B LLM-ASR-variant behaalt een karakterfoutpercentage onder 10% op 78% van de ondersteunde talen, waaronder meer dan 500 talen die niet eerder door enig ASR-systeem werden bediend. Character error rate wordt vaak gebruikt wanneer woordgrenzen niet consistent zijn of wanneer evaluatie van low-resource-talen praktischer is op karakterniveau. Encodergroottes lopen van 300M tot 7B. Meta bracht ook de Omnilingual ASR Corpus uit, met dekking voor meer dan 350 onderbediende talen.

Whisper large-v3 (1.55B, MIT, 99 talen) is qua nauwkeurigheid door ongeveer tien open modellen ingehaald, maar blijft voor veel projecten een sterke standaardkeuze. MIT is de minst belastende licentie in het veld. Het runtime-ecosysteem — whisper.cpp, faster-whisper en WhisperX — blijft ongeëvenaard onder nieuwere releases. Voor eisen die neerkomen op brede taalondersteuning, flexibele hardwareondersteuning en minimale licentiefrictie, blijft Whisper large-v3 een praktische keuze.

Modellen gericht op onderzoek

diffusion-gemma-asr-small van YC-startup Interfaze is een van de architectonisch meest ongebruikelijke releases van het jaar. Het genereert transcripties via parallelle diffusion denoising over een canvas van 256 tokens in 8 tot 16 stappen, waardoor de decodeerkosten niet meegroeien met de lengte van het transcript. Slechts ongeveer 42M parameters werden getraind, gelijk aan 0.16% van de gewichten, bovenop een bevroren 26B DiffusionGemma en een bevroren whisper-small-encoder. Het bereikt 6.6% WER op LibriSpeech test-clean met ongeveer 11 tot 17× realtime. Het noteert ook 15.7% op FLEURS Engels en 29.6% CER op FLEURS Mandarijn, dus het LibriSpeech-cijfer moet als bovengrens worden beschouwd. Het model wordt niet gepresenteerd als klaar voor implementatie, maar het is belangrijk onderzoek voor ASR-practici.

MOSS-Transcribe-Diarize 0.9B (Apache 2.0, 50+ talen) pakt een probleem aan dat veel ASR-vergelijkingen buiten beschouwing laten: het geeft sprekerlabels, woordtijdstempels en het transcript in één generatie, in plaats van ASR te koppelen aan een afzonderlijk diarization-systeem. Het ondersteunt 128k context, ongeveer 90 minuten audio in één pass, een RTF van ongeveer 0.017 op een RTX 4090 en hotword biasing.

Licentieverschillen kunnen implementatie beslissen

Licenties zijn vaak de kwestie die bepaalt of een model daadwerkelijk kan worden uitgerold. Het veld valt duidelijk uiteen.

Apache 2.0 geldt voor Cohere Transcribe, Granite Speech 4.1 in alle drie varianten, Qwen3-ASR in beide groottes, Voxtral Mini Realtime, Omnilingual ASR, ARK-ASR en MOSS-Transcribe. Deze modellen hebben geen attributieverplichting en commercieel gebruik is onbeperkt. Cohere’s repository zit echter achter een overeenkomst voor contactinformatie, hoewel de licentie zelf Apache 2.0 is.

MIT geldt voor Whisper large-v3, waardoor dit de meest permissieve optie in het veld is.

CC-BY-4.0 geldt voor Canary-Qwen-2.5B, Parakeet TDT 0.6B v3 en Kyutai STT. Deze modellen mogen commercieel worden gebruikt, maar attributie is verplicht. Voor een ingebed product of white-labeled API is die attributie-eis een betekenisvolle complianceverplichting en vaak de reden dat teams een ander model implementeren dan het nauwkeurigste model dat ze hebben getest.

Meta’s Omnilingual ASR is opgesplitst: de modellen zijn Apache 2.0, terwijl het corpus CC-BY is.

Een praktische selectievolgorde

Een modelselectieproces moet niet simpelweg de volgorde van de leaderboard volgen.

Begin met de licentie. Als attributie niet acceptabel is, vallen Parakeet, Canary-Qwen en Kyutai onder CC-BY-4.0 al af voordat benchmarking begint.

Controleer daarna de taaldekking. Cohere’s 14 talen, Granite’s 6 en Canary’s alleen-Engelse dekking zijn vaste beperkingen. Cohere heeft daarnaast geen automatische taaldetectie, dus de taal moet vooraf bekend zijn.

Bepaal vervolgens of de toepassing streaming of batchverwerking vereist. Dat is een architectonisch onderscheid: tuning verandert een offline encoder-decoder-model niet in een streamingmodel met lage latency.

Meet daarna de WER op de daadwerkelijke audio die moet worden verwerkt. De spreiding op de publieke benchmark tussen de top tien modellen is minder dan één punt, maar de spreiding op audio met accenten, ruis of domeinspecifieke inhoud zal meerdere keren groter zijn en zal modellen niet noodzakelijk in dezelfde volgorde rangschikken. Als downstreamsystemen afhankelijk zijn van diarization, tijdstempels, interpunctie of hotword handling, moeten die outputs direct worden getest in plaats van afgeleid uit WER.

Bereken ten slotte de kosten per audio-uur op de hardware die daadwerkelijk zal worden gebruikt. RTFx-cijfers worden doorgaans gemeten met grote batchgroottes op datacenterhardware en zijn niet rechtstreeks overdraagbaar naar elke implementatieomgeving.

De centrale ontwikkeling in 2026 is niet dat één enkel model de ASR-markt heeft gewonnen. Het is dat een open-weight-model van 2B met een permissieve licentie nu het prestatieniveau kan overtreffen waarvoor gesloten API’s achttien maanden eerder nog kosten rekenden, terwijl de resterende keuze steeds meer lijkt op een inkoopbeslissing in plaats van een onderzoeksbeslissing.

Bronnen die in het oorspronkelijke artikel worden genoemd, zijn onder meer de Cohere Transcribe-blog en modelkaart; IBM Granite Speech 4.1 2B en 4.1 2B-NAR; ARK-ASR-3B; MOSS-Transcribe-preview-2B en MOSS-Transcribe-Diarize; NVIDIA Canary-Qwen-2.5B en Parakeet TDT 0.6B v3; Qwen3-ASR; Voxtral Mini 4B Realtime 2602; Kyutai STT; Meta Omnilingual ASR en paper; Whisper large-v3; diffusion-gemma-asr; de Open ASR Leaderboard-paper; de leaderboarddataset; en Appen’s private-track-aankondiging.

Leaderboardposities zijn live en veranderen regelmatig. Alle cijfers zijn geverifieerd aan de hand van primaire bronnen op 23 juli 2026.