NachrichtenMakroOffene ASR-Modelle 2026 im Vergleich nach WER, Sprachabdeckung, Latenz und Lizenz

Offene ASR-Modelle 2026 im Vergleich nach WER, Sprachabdeckung, Latenz und Lizenz

Autor: MarkTechPost·

Wichtige Erkenntnisse

  • Führende offene ASR-Modelle auf dem Hugging Face Open ASR Leaderboard liegen weniger als einen Word-Error-Rate-Punkt auseinander, wodurch die Leaderboard-Platzierung eher zu einem Instrument für die Vorauswahl als zu einem entscheidenden Auswahlkriterium wird.
  • Direkte Vergleiche von Leaderboard-Werten werden durch methodische Unterschiede erschwert, darunter unterschiedliche Datensatz-Teilmengen, benchmark-spezifisches Fine-Tuning und Private-Track-Evaluationen, die Rangfolgen verändern können.
  • Lizenzbedingungen — von Apache 2.0 über MIT bis CC-BY-4.0 — bestimmen häufig die Einsatzfähigkeit; Attributionspflichten unter CC-BY-4.0 können Modelle für eingebettete oder White-Label-Produkte ausschließen.
  • Die Durchsatzunterschiede zwischen führenden offenen ASR-Modellen betragen mehr als eine Größenordnung, wodurch die Kosten pro Audiostunde bei großen Batch-Workloads oft wichtiger werden als die Genauigkeit.
  • Metas Omnilingual ASR deckt mehr als 1,600 Sprachen nativ ab und erweitert die Abdeckung per Zero-Shot-Learning auf über 5,400, einschließlich ASR-Fähigkeiten für mehr als 500 Sprachen, die zuvor von keinem System unterstützt wurden.
Offene ASR-Modelle 2026 im Vergleich nach WER, Sprachabdeckung, Latenz und Lizenz

Offene Spracherkennung wird nicht mehr so stark von Whisper dominiert wie noch ein Jahr zuvor. Im März 2026 veröffentlichte Cohere Transcribe, ein Apache-2.0-Modell mit 2B Parametern, das mit einer durchschnittlichen Word Error Rate von 5.42%, kurz WER, die Spitze des Hugging Face Open ASR Leaderboard erreichte. WER zählt Substitutionen, Löschungen und Einfügungen gegenüber einer Referenztranskription und ist daher für den Vergleich der Erkennungsgenauigkeit nützlich, erfasst aber weder Latenz, Sprecherzuordnung, Zeitstempelqualität noch Formatierung. Fünf Wochen später veröffentlichte IBM Granite Speech 4.1 2B mit 5.33%. Seitdem haben ARK-ASR-3B und MOSS-Transcribe-preview-2B noch niedrigere Werte gemeldet.

Die führenden Modelle auf diesem Leaderboard liegen inzwischen weniger als einen WER-Punkt auseinander. Für Teams, die ein Modell für automatische Spracherkennung auswählen, verändert das den Entscheidungsprozess: Die Platzierung im Leaderboard ist nicht mehr die einzige und auch nicht unbedingt die ausschlaggebende Variable. Lizenzbedingungen, Sprachunterstützung, Streaming-Fähigkeit und Kosten pro Audiostunde haben nun vergleichbares Gewicht. Dieser Vergleich betrachtet das offene ASR-Feld anhand dieser Faktoren.

Die Leaderboard-Kennzahl hat wichtige Grenzen

Der Durchschnittswert des Open ASR Leaderboard ist kein einzelnes festes Maß, und die nebeneinander aufgeführten Modelle wurden nicht alle exakt auf dieselbe Weise bewertet.

Der Wert von 5.42% für Cohere ist ein Durchschnitt über acht englische Testsätze, darunter TED-LIUM. Die Werte je Datensatz lauten AMI 8.13, Earnings-22 10.86, GigaSpeech 9.34, LibriSpeech clean 1.25, LibriSpeech other 2.37, SPGISpeech 3.08, TED-LIUM 2.49 und VoxPopuli 5.87; daraus ergibt sich exakt ein Durchschnitt von 5.42.

Der Wert von 5.04% für ARK-ASR-3B wird über sieben Sätze gemittelt. TED-LIUM ist nicht enthalten. Die Modellkarte von MOSS-Transcribe-preview-2B stellt dies ausdrücklich fest: TED-LIUM ist derzeit nicht Teil des Leaderboard-Laufs und wird daher ausgeschlossen.

Da TED-LIUM zu den einfacheren Datensätzen der Suite gehört, erhöht sein Ausschluss den Durchschnitt. Werden Coheres veröffentlichte Werte je Datensatz über dieselben sieben Datensätze neu berechnet, die ARK meldet, kommt Cohere auf 5.84 statt 5.42. Wendet man dieselbe Methode auf Granite Speech 4.1 2B an, verschiebt sich der Wert von 5.33 auf 5.65. Auf vergleichbarer Basis ist ARKs Vorsprung also größer, als die Überschriftenzahlen nahelegen, nicht kleiner. Der allgemeinere Punkt ist, dass die Subtraktion einer veröffentlichten Leaderboard-Zahl von einer anderen nicht zwangsläufig einen aussagekräftigen Vergleich ergibt.

Zwei weitere Einschränkungen sind ebenfalls wesentlich.

Erstens sind einige Werte offen auf das Leaderboard zugeschnitten. Die Karte von MOSS-Transcribe-preview-2B besagt, dass das Modell mit Reinforcement Learning auf den Trainingssplits des Open ASR Leaderboard feinabgestimmt wurde. Diese Offenlegung ist hilfreich, bedeutet aber auch, dass der Wert die Benchmark-Leistung und nicht nur die allgemeine Fähigkeit misst.

Zweitens können Private-Track-Daten die Rangliste neu ordnen. Appen steuerte zurückgehaltene Evaluationssätze bei, die australische, kanadische, indische und amerikanische Akzente sowohl unter geskripteten als auch unter konversationellen Bedingungen abdecken. Wenn diese privaten Sätze aktiviert werden, rückt zoom/scribe_v1 von Platz 4 auf Platz 1, während der Spitzenreiter des öffentlichen Leaderboards um eine Position fällt. Modelle, die auf sauber vorgelesene Sprache optimiert sind, können bei spontaner Gesprächssprache überproportional nachlassen.

Das Leaderboard ist daher nützlich, um eine Auswahlliste zu erstellen. Es sollte nicht als vollständiger Auswahlmechanismus behandelt werden.

Auf Genauigkeit ausgerichtete Modelle

Cohere Transcribe (2B, Apache 2.0, 14 Sprachen) ist das Modell in dieser Gruppe, das bereits in Produktion gegangen ist. Es wurde im vergangenen Monat mehr als 620,000 Mal heruntergeladen und bietet Laufzeitunterstützung über transformers, vLLM, mlx-audio für Apple Silicon, einen Rust-Port und einen WebGPU-Build. Das Modell verwendet einen Conformer-Encoder mit einem schlanken Transformer-Decoder und wurde von Grund auf trainiert. Cohere führte außerdem eine Human-Preference-Evaluation durch, bei der geschulte Annotatoren Transkripte nach Bedeutungserhalt, Halluzinationen und benannten Entitäten bewerteten. Das Modell erzielte eine durchschnittliche Gewinnrate von 61%, darunter 78% gegenüber IBM Granite 4.0 1B Speech und 64% gegenüber Whisper large-v3.

Seine Einschränkungen sind erheblich und werden in der Modellkarte klar benannt. Cohere Transcribe bietet keine automatische Spracherkennung, keine Zeitstempel und keine Diarisierung. Das Modell neigt außerdem dazu, Stille zu transkribieren, weshalb Cohere empfiehlt, ihm einen VAD oder ein Noise Gate vorzuschalten. Zudem ist das Repository trotz der Apache-2.0-Lizenz hinter einer Vereinbarung zur Angabe von Kontaktinformationen gesperrt.

Granite Speech 4.1 2B (2B, Apache 2.0) ist stärker, wenn die Anforderung eher eine breitere Funktionalität als der niedrigste Leaderboard-Wert ist. Es unterstützt ASR in sechs Sprachen, bidirektionale Sprachübersetzung, Keyword-Listen-Biasing für Namen und Fachjargon, Interpunktion und Truecasing, einschließlich Großschreibung deutscher Substantive. IBM trainierte es auf 174,000 Stunden Daten und meldet RTFx 231.29. RTFx ist eine Durchsatzkennzahl: Höhere Werte bedeuten, dass pro Einheit tatsächlicher Laufzeit mehr Audio verarbeitet wird, üblicherweise unter einer angegebenen Hardware- und Batch-Konfiguration. IBM liefert außerdem zwei verwandte Modelle aus: Die Variante -plus ergänzt sprecherzugeordnete ASR und Zeitstempel auf Wortebene, während die Variante -nar im Abschnitt zum Durchsatz behandelt wird.

Canary-Qwen-2.5B (2.5B, CC-BY-4.0, Englisch) kombiniert einen FastConformer-Encoder mit einem Qwen3-1.7B-Decoder. Es läuft in zwei Modi: Standardtranskription und ein LLM-Modus, in dem der Decoder den Transkript zusammenfasst und Fragen dazu beantwortet. Gemeldet werden 5.63% WER bei RTFx 418. AMI wurde auf etwa 15% der Trainingsdaten überabgetastet, was die Ausgabe in Richtung wortgetreuer Transkripte verzerrt, die Unflüssigkeiten erhalten. Dieses Verhalten kann für juristische Arbeit nützlich sein und für Besprechungsnotizen weniger erwünscht.

Qwen3-ASR-1.7B (Apache 2.0) deckt 52 Sprachen und Dialekte ab, bestehend aus 30 Sprachen plus 22 chinesischen Dialekten, und meldet 5.76% WER. Es wird mit einem vollständigen Inferenz-Toolkit und einem separaten Forced-Alignment-Modell ausgeliefert, das Zeitstempel in 11 Sprachen bereitstellt. Für Anwendungsfälle mit Mandarin oder regionaler chinesischer Sprache ist es ein naheliegender Ausgangspunkt.

Auf Durchsatz ausgerichtete Modelle

Die Genauigkeit der führenden offenen ASR-Modelle unterscheidet sich inzwischen um etwa einen WER-Punkt. Der Durchsatz unterscheidet sich um mehr als eine Größenordnung, was bedeutet, dass der Durchsatz häufig die Betriebskosten bestimmt. Das ist vor allem für Archive, Call-Center-Analysen und Medienpipelines wichtig, bei denen die Arbeitslast in Tausenden oder Millionen Audiominuten statt in Live-Gesprächen gemessen wird.

Parakeet TDT 0.6B v3 (0.6B, CC-BY-4.0) ist der Durchsatzführer unter den mehrsprachigen offenen Modellen. Es erreicht RTFx 3332.74 über 25 europäische Sprachen hinweg, umfasst automatische Sprachidentifikation und kann auf einer A100 80GB bis zu 24 Minuten in einem einzigen Durchlauf verarbeiten. Der Kompromiss beträgt 6.32% WER, also rund einen Punkt mehr als Granite 4.1 2B, im Austausch für etwa vierzehnmal so viel Audio pro GPU-Sekunde.

Granite Speech 4.1 2B-NAR ist das bemerkenswertere technische Ergebnis. Es ist nicht-autoregressiv: Es bearbeitet eine CTC-Hypothese in einem einzigen Forward Pass mithilfe eines bidirektionalen LLM. IBM meldet einen RTFx von etwa 1820 auf einer H100 bei Batch-Größe 128. Um diesen Durchsatz zu erreichen, verzichtet es auf Japanisch, Sprachübersetzung und Keyword-Biasing.

Qwen3-ASR-0.6B behält alle 52 Sprachen bei und erreicht bei Parallelität 128 einen 2000×-Durchsatz.

Auf Streaming ausgerichtete Modelle

Batch-WER ist für Streaming-Modelle ein ungeeignetes Maß, auch wenn das Leaderboard sie dennoch bewertet. Voxtral Realtime wird mit 7.68% und Kyutai STT 2.6B mit 6.40% geführt. Beide liegen nach dieser Kennzahl unter Whisper, doch die Zahlen sagen wenig über ihren vorgesehenen Einsatz aus.

Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 Sprachen) kombiniert ein 3.4B-Sprachmodell mit einem von Grund auf trainierten kausalen Audio-Encoder mit 970M Parametern. Beide Teile verwenden Sliding-Window-Attention und ermöglichen damit praktisch unbegrenztes Streaming. Die Transkriptionsverzögerung kann in 80ms-Schritten von 80ms bis 1200ms konfiguriert werden, zusätzlich gibt es eine eigenständige Option mit 2400ms. Mistral empfiehlt 480ms als optimale Einstellung und sagt, dass das Modell bei dieser Einstellung führenden offenen Offline-Modellen entspricht. Es läuft auf einer einzelnen 16GB-GPU und bot ab Tag 0 Unterstützung für die vLLM Realtime API.

Kyutai STT (CC-BY-4.0) ist in zwei Formen verfügbar: ein englisch/französisches Modell mit rund 1B Parametern, 0.5s Verzögerung und integriertem semantischem Voice Activity Detector sowie ein rein englisches Modell mit 2.6B Parametern und 2.5s Verzögerung. Für Voice Agents kann der semantische VAD wichtiger sein als die Transkriptionsverzögerung, weil er vorhersagt, wann der Sprecher tatsächlich fertig ist; dies bestimmt die wahrgenommene Latenz beim Sprecherwechsel. Eine H100 kann 400 gleichzeitige Streams in Echtzeit bedienen.

Auf Abdeckung ausgerichtete Modelle

Metas Omnilingual ASR (Apache 2.0 für das Modell, CC-BY für den Korpus) konkurriert nicht primär über WER und sollte nicht so bewertet werden, als wäre dies der Fall. Es deckt mehr als 1,600 Sprachen nativ ab und erweitert die Abdeckung durch Zero-Shot-In-Context-Learning auf mehr als 5,400. Das System basiert auf einem wav2vec 2.0-Encoder, der auf 7B skaliert und auf etwa 4.3M Stunden vortrainiert wurde. Die 7B-Variante LLM-ASR erreicht eine Zeichenfehlerrate von unter 10% bei 78% der unterstützten Sprachen, darunter mehr als 500 Sprachen, die zuvor von keinem ASR-System bedient wurden. Die Zeichenfehlerrate wird häufig dort verwendet, wo Wortgrenzen nicht konsistent sind oder die Evaluation ressourcenarmer Sprachen auf Zeichenebene praktikabler ist. Die Encoder-Größen reichen von 300M bis 7B. Meta veröffentlichte außerdem den Omnilingual ASR Corpus, der mehr als 350 unterversorgte Sprachen abdeckt.

Whisper large-v3 (1.55B, MIT, 99 Sprachen) wurde bei der Genauigkeit von ungefähr zehn offenen Modellen übertroffen, bleibt aber für viele Projekte ein starker Standard. MIT ist die am wenigsten belastete Lizenz in diesem Feld. Sein Laufzeit-Ökosystem — whisper.cpp, faster-whisper und WhisperX — bleibt unter den neueren Veröffentlichungen unerreicht. Für Anforderungen, die im Kern breite Sprachunterstützung, flexible Hardwareunterstützung und minimale Lizenzierungsreibung bedeuten, ist Whisper large-v3 weiterhin eine praktikable Antwort.

Forschungsorientierte Modelle

diffusion-gemma-asr-small des YC-Start-ups Interfaze ist eine der architektonisch ungewöhnlichsten Veröffentlichungen des Jahres. Es erzeugt Transkripte durch paralleles Diffusions-Denoising über eine 256-Token-Leinwand in 8 bis 16 Schritten, sodass die Decoding-Kosten nicht mit der Länge des Transkripts wachsen. Trainiert wurden nur etwa 42M Parameter, also 0.16% der Gewichte, auf Basis eines eingefrorenen 26B DiffusionGemma und eines eingefrorenen whisper-small-Encoders. Es erreicht 6.6% WER auf LibriSpeech test-clean bei ungefähr 11 bis 17× Echtzeit. Außerdem erzielt es 15.7% auf FLEURS English und 29.6% CER auf FLEURS Mandarin, weshalb der LibriSpeech-Wert als Obergrenze betrachtet werden sollte. Das Modell wird nicht als einsatzbereit dargestellt, ist aber wichtige Forschung für ASR-Praktiker.

MOSS-Transcribe-Diarize 0.9B (Apache 2.0, 50+ Sprachen) adressiert ein Problem, das viele ASR-Vergleiche ausklammern: Es gibt Sprecherlabels, Wortzeitstempel und den Transkript in einer einzigen Generierung aus, statt ASR mit einem separaten Diarisierungssystem zu verketten. Es unterstützt 128k Kontext, etwa 90 Minuten Audio in einem Durchlauf, einen RTF von etwa 0.017 auf einer RTX 4090 und Hotword-Biasing.

Lizenzunterschiede können über den Einsatz entscheiden

Die Lizenzierung ist häufig der Punkt, der bestimmt, ob ein Modell tatsächlich ausgeliefert werden kann. Das Feld teilt sich klar auf.

Apache 2.0 gilt für Cohere Transcribe, Granite Speech 4.1 in allen drei Varianten, Qwen3-ASR in beiden Größen, Voxtral Mini Realtime, Omnilingual ASR, ARK-ASR und MOSS-Transcribe. Diese Modelle haben keine Attributionspflicht, und die kommerzielle Nutzung ist uneingeschränkt. Coheres Repository ist allerdings trotz der Apache-2.0-Lizenz hinter einer Vereinbarung zur Angabe von Kontaktinformationen gesperrt.

MIT gilt für Whisper large-v3 und macht es zur permissivsten Option in diesem Feld.

CC-BY-4.0 gilt für Canary-Qwen-2.5B, Parakeet TDT 0.6B v3 und Kyutai STT. Diese Modelle können kommerziell genutzt werden, erfordern jedoch Namensnennung. Für ein eingebettetes Produkt oder eine White-Label-API ist diese Attributionspflicht eine relevante Compliance-Anforderung und häufig der Grund, warum Teams ein anderes Modell einsetzen als das genaueste, das sie getestet haben.

Metas Omnilingual ASR ist aufgeteilt: Die Modelle stehen unter Apache 2.0, während der Korpus unter CC-BY steht.

Eine praktische Reihenfolge für die Auswahl

Ein Modellauswahlprozess sollte nicht einfach der Reihenfolge des Leaderboards folgen.

Beginnen Sie mit der Lizenz. Wenn Attribution nicht akzeptabel ist, schließt CC-BY-4.0 Parakeet, Canary-Qwen und Kyutai aus, bevor das Benchmarking überhaupt beginnt.

Prüfen Sie als Nächstes die Sprachabdeckung. Coheres 14 Sprachen, Granites 6 Sprachen und die reine Englischabdeckung von Canary sind feste Grenzen. Cohere verfügt außerdem nicht über automatische Spracherkennung, daher muss die Sprache im Voraus bekannt sein.

Entscheiden Sie dann, ob die Anwendung Streaming- oder Batch-Betrieb benötigt. Das ist eine architektonische Unterscheidung: Tuning verwandelt ein Offline-Encoder-Decoder-Modell nicht in ein Streaming-System mit niedriger Latenz.

Messen Sie danach die WER auf dem tatsächlich zu verarbeitenden Audio. Die Streuung im öffentlichen Benchmark unter den zehn besten Modellen liegt unter einem Punkt, doch die Streuung bei akzentbehaftetem, verrauschtem oder domänenspezifischem Audio wird um ein Vielfaches größer sein und die Modelle nicht zwangsläufig in derselben Reihenfolge einstufen. Wenn nachgelagerte Systeme von Diarisierung, Zeitstempeln, Interpunktion oder Hotword-Verarbeitung abhängen, müssen diese Ausgaben direkt getestet werden, statt aus der WER abgeleitet zu werden.

Berechnen Sie schließlich die Kosten pro Audiostunde auf der Hardware, die tatsächlich verwendet wird. RTFx-Werte werden in der Regel mit großen Batch-Größen auf Rechenzentrumshardware gemessen und lassen sich nicht direkt auf jede Bereitstellungsumgebung übertragen.

Die zentrale Entwicklung im Jahr 2026 ist nicht, dass ein einzelnes Modell den ASR-Markt gewonnen hätte. Sie besteht darin, dass ein Open-Weight-Modell mit 2B Parametern und permissiver Lizenz inzwischen das Leistungsniveau übertreffen kann, für das geschlossene APIs noch achtzehn Monate zuvor Gebühren verlangten, während die verbleibende Entscheidung zunehmend einer Beschaffungsentscheidung statt einer Forschungsentscheidung ähnelt.

Zu den im Originalartikel genannten Quellen gehören der Cohere-Transcribe-Blog und die Modellkarte; IBM Granite Speech 4.1 2B und 4.1 2B-NAR; ARK-ASR-3B; MOSS-Transcribe-preview-2B und MOSS-Transcribe-Diarize; NVIDIA Canary-Qwen-2.5B und Parakeet TDT 0.6B v3; Qwen3-ASR; Voxtral Mini 4B Realtime 2602; Kyutai STT; Meta Omnilingual ASR und das Paper; Whisper large-v3; diffusion-gemma-asr; das Paper zum Open ASR Leaderboard; der Leaderboard-Datensatz; sowie Appens Private-Track-Ankündigung.

Leaderboard-Positionen sind live und ändern sich häufig. Alle Angaben wurden am 23 July 2026 anhand von Primärquellen überprüft.