Otwarte modele ASR w 2026 roku: porównanie według WER, pokrycia językowego, opóźnień i licencji
Najważniejsze informacje
- •Czołowe otwarte modele ASR w Hugging Face Open ASR Leaderboard dzieli mniej niż jeden punkt wskaźnika błędu słów, przez co ranking staje się narzędziem do tworzenia krótkiej listy, a nie rozstrzygającym kryterium wyboru.
- •Bezpośrednie porównywanie wyników rankingowych utrudniają niespójności metodologiczne, w tym różne podzbiory danych, dostrajanie pod benchmark oraz ewaluacje w torze prywatnym, które mogą zmienić kolejność modeli.
- •Warunki licencyjne — obejmujące Apache 2.0, MIT i CC-BY-4.0 — często przesądzają o wykonalności wdrożenia, a wymagania atrybucji w CC-BY-4.0 mogą eliminować modele z produktów wbudowanych lub API pod marką własną.
- •Różnice przepustowości między wiodącymi otwartymi modelami ASR przekraczają rząd wielkości, przez co koszt za godzinę audio bywa ważniejszym wyróżnikiem niż dokładność w dużych obciążeniach batchowych.
- •Meta Omnilingual ASR obsługuje natywnie ponad 1,600 języków i rozszerza zasięg do ponad 5,400 dzięki uczeniu zero-shot, zapewniając możliwości ASR dla ponad 500 języków wcześniej nieobsługiwanych przez żaden system.

Otwarte rozpoznawanie mowy nie jest już zdominowane przez Whisper w takim stopniu jak rok wcześniej. W marcu 2026 roku Cohere udostępniło Transcribe, model Apache 2.0 o 2B parametrów, który znalazł się na szczycie Hugging Face Open ASR Leaderboard ze średnim wskaźnikiem błędu słów, czyli WER, na poziomie 5.42%. WER zlicza podstawienia, usunięcia i wstawienia względem transkrypcji referencyjnej, dlatego jest przydatny do porównywania dokładności rozpoznawania, ale nie obejmuje opóźnień, przypisywania mówców, jakości znaczników czasu ani formatowania. Pięć tygodni później IBM wydał Granite Speech 4.1 2B z wynikiem 5.33%. Od tego czasu ARK-ASR-3B i MOSS-Transcribe-preview-2B zgłosiły jeszcze niższe wartości.
Czołowe modele w tym rankingu dzieli obecnie mniej niż jeden punkt WER. Dla zespołów wybierających model automatycznego rozpoznawania mowy zmienia to proces decyzyjny: pozycja w rankingu nie jest już jedyną ani nawet rozstrzygającą zmienną. Warunki licencji, obsługa języków, możliwość pracy strumieniowej i koszt za godzinę audio mają dziś porównywalne znaczenie. To porównanie omawia otwarty ekosystem ASR właśnie przez pryzmat tych czynników.
Wynik z rankingu ma istotne ograniczenia
Średnia w Open ASR Leaderboard nie jest jedną stałą miarą, a modele pokazane obok siebie w rankingu nie zawsze były oceniane dokładnie w ten sam sposób.
Wynik Cohere 5.42% jest średnią z ośmiu angielskich zestawów testowych, w tym TED-LIUM. Wyniki dla poszczególnych zbiorów to AMI 8.13, Earnings-22 10.86, GigaSpeech 9.34, LibriSpeech clean 1.25, LibriSpeech other 2.37, SPGISpeech 3.08, TED-LIUM 2.49 oraz VoxPopuli 5.87, co daje średnią dokładnie 5.42.
Wynik ARK-ASR-3B na poziomie 5.04% jest średnią z siedmiu zestawów. TED-LIUM nie został uwzględniony. Karta modelu MOSS-Transcribe-preview-2B stwierdza to wprost: TED-LIUM nie jest obecnie częścią przebiegu rankingowego i dlatego został wykluczony.
Ponieważ TED-LIUM należy do łatwiejszych zbiorów w pakiecie, jego wyłączenie podnosi średnią. Jeśli opublikowane przez Cohere wyniki dla poszczególnych zbiorów przeliczyć na tych samych siedmiu zestawach, które raportuje ARK, wynik Cohere wynosi 5.84 zamiast 5.42. Zastosowanie tej samej metody do Granite Speech 4.1 2B przesuwa jego wynik z 5.33 do 5.65. W porównaniu równorzędnym przewaga ARK jest większa, niż sugerują nagłówkowe liczby, a nie mniejsza. Szerszy wniosek jest taki, że odjęcie jednej opublikowanej wartości rankingowej od drugiej nie musi dawać sensownego porównania.
Istotne są także dwa dodatkowe zastrzeżenia.
Po pierwsze, część wyników jest jawnie dopasowana do rankingu. Karta MOSS-Transcribe-preview-2B informuje, że model został dostrojony metodą uczenia ze wzmocnieniem na podziałach treningowych Open ASR Leaderboard. To użyteczne ujawnienie, ale oznacza również, że wynik mierzy wydajność na benchmarku, a nie wyłącznie ogólne możliwości.
Po drugie, dane z toru prywatnego mogą zmienić kolejność rankingu. Appen dostarczyło odłożone zestawy ewaluacyjne obejmujące akcenty australijskie, kanadyjskie, indyjskie i amerykańskie, zarówno w warunkach skryptowanych, jak i konwersacyjnych. Po włączeniu tych prywatnych zestawów zoom/scribe_v1 przesuwa się z miejsca No. 4 na No. 1, a lider publicznego rankingu spada o jedną pozycję. Modele dostrojone do czystej, czytanej mowy mogą tracić nieproporcjonalnie dużo na spontanicznym audio konwersacyjnym.
Ranking jest więc przydatny do zbudowania krótkiej listy kandydatów. Nie powinien być traktowany jako kompletny mechanizm wyboru.
Modele nastawione na dokładność
Cohere Transcribe (2B, Apache 2.0, 14 języków) to model z tej grupy, który trafił już do produkcji. W ciągu ostatniego miesiąca pobrano go ponad 620,000 razy, a środowiska uruchomieniowe obejmują transformers, vLLM, mlx-audio dla Apple Silicon, port w Rust oraz wersję WebGPU. Model wykorzystuje enkoder Conformer z lekkim dekoderem Transformer i został wytrenowany od zera. Cohere przeprowadziło również ewaluację preferencji ludzkich, w której przeszkoleni anotatorzy oceniali transkrypcje pod kątem zachowania znaczenia, halucynacji i jednostek nazwanych. Model uzyskał średni wskaźnik zwycięstw 61%, w tym 78% względem IBM Granite 4.0 1B Speech i 64% względem Whisper large-v3.
Jego ograniczenia są znaczące i jasno opisane w karcie modelu. Cohere Transcribe nie zapewnia automatycznego wykrywania języka, znaczników czasu ani diarization. Model chętnie transkrybuje również ciszę, dlatego Cohere zaleca umieszczenie przed nim VAD lub bramki szumów. Ponadto repozytorium jest dostępne dopiero po zaakceptowaniu umowy dotyczącej podania danych kontaktowych, mimo że sama licencja to Apache 2.0.
Granite Speech 4.1 2B (2B, Apache 2.0) jest mocniejszym wyborem wtedy, gdy wymagane są szersze możliwości, a nie najniższy wynik rankingowy. Obsługuje ASR w sześciu językach, dwukierunkowe tłumaczenie mowy, wzmacnianie list słów kluczowych dla nazw i żargonu, interpunkcję oraz truecasing, w tym kapitalizację niemieckich rzeczowników. IBM wytrenował go na 174,000 godzin danych i raportuje RTFx 231.29. RTFx to miara przepustowości: wyższe wartości oznaczają więcej przetworzonego audio na jednostkę czasu rzeczywistego, zwykle przy określonej konfiguracji sprzętu i batchingu. IBM oferuje także dwa modele pokrewne: wariant -plus dodaje ASR z przypisaniem mówcy i znaczniki czasu na poziomie słów, a wariant -nar omówiono w sekcji dotyczącej przepustowości.
Canary-Qwen-2.5B (2.5B, CC-BY-4.0, angielski) łączy enkoder FastConformer z dekoderem Qwen3-1.7B. Działa w dwóch trybach: standardowej transkrypcji oraz trybie LLM, w którym dekoder streszcza transkrypt i odpowiada na pytania dotyczące jego treści. Raportuje 5.63% WER przy RTFx 418. Zbiór AMI został nadpróbkowany do około 15% danych treningowych, co przesuwa wyniki w stronę transkrypcji dosłownych, zachowujących niepłynności wypowiedzi. Takie zachowanie może być użyteczne w pracy prawniczej, a mniej pożądane w notatkach ze spotkań.
Qwen3-ASR-1.7B (Apache 2.0) obejmuje 52 języki i dialekty, w tym 30 języków oraz 22 dialekty chińskie, i raportuje 5.76% WER. Dostarczany jest z kompletnym zestawem narzędzi inferencyjnych oraz osobnym modelem wymuszonego wyrównania, który zapewnia znaczniki czasu w 11 językach. Dla zastosowań związanych z mandaryńskim lub regionalną mową chińską jest naturalnym punktem wyjścia.
Modele nastawione na przepustowość
Dokładność czołowych otwartych modeli ASR różni się obecnie o około jeden punkt WER. Przepustowość różni się o ponad rząd wielkości, co oznacza, że często to ona decyduje o kosztach operacyjnych. Ma to największe znaczenie dla archiwów, analityki call center i potoków medialnych, gdzie obciążenie mierzy się tysiącami lub milionami minut audio, a nie rozmowami na żywo.
Parakeet TDT 0.6B v3 (0.6B, CC-BY-4.0) jest liderem przepustowości wśród wielojęzycznych otwartych modeli. Osiąga RTFx 3332.74 w 25 językach europejskich, zawiera automatyczne rozpoznawanie języka i może przetworzyć do 24 minut w jednym przebiegu na A100 80GB. Kompromisem jest 6.32% WER, czyli około jeden punkt więcej niż Granite 4.1 2B, w zamian za około czternaście razy więcej audio na sekundę pracy GPU.
Granite Speech 4.1 2B-NAR jest bardziej interesującym osiągnięciem inżynieryjnym. Jest nieautoregresyjny: edytuje hipotezę CTC w jednym przebiegu w przód z użyciem dwukierunkowego LLM. IBM raportuje RTFx około 1820 na jednym H100 przy batch size 128. Aby osiągnąć taką przepustowość, model rezygnuje z języka japońskiego, tłumaczenia mowy i wzmacniania słów kluczowych.
Qwen3-ASR-0.6B zachowuje wszystkie 52 języki i osiąga przepustowość 2000× przy concurrency 128.
Modele nastawione na strumieniowanie
Batchowy WER jest niewygodną miarą dla modeli strumieniowych, choć ranking i tak je ocenia. Voxtral Realtime widnieje z wynikiem 7.68%, a Kyutai STT 2.6B z 6.40%. Oba są według tej metryki poniżej Whisper, ale liczby te niewiele mówią o ich docelowym zastosowaniu.
Voxtral Mini 4B Realtime 2602 (Apache 2.0, 13 języków) łączy model językowy 3.4B z przyczynowym enkoderem audio 970M wytrenowanym od zera. Obie części wykorzystują uwagę z przesuwanym oknem, co pozwala na praktycznie nieograniczone strumieniowanie. Opóźnienie transkrypcji można konfigurować w krokach co 80ms od 80ms do 1200ms, z dodatkową samodzielną opcją 2400ms. Mistral rekomenduje 480ms jako ustawienie optymalne i twierdzi, że przy tej wartości model dorównuje wiodącym otwartym modelom offline. Działa na pojedynczym GPU 16GB i miał wsparcie vLLM Realtime API od day-0.
Kyutai STT (CC-BY-4.0) jest dostępny w dwóch formach: model angielsko-francuski o około 1B parametrów z opóźnieniem 0.5s i wbudowanym semantycznym detektorem aktywności głosowej oraz angielski model 2.6B z opóźnieniem 2.5s. W przypadku agentów głosowych semantyczny VAD może mieć większe znaczenie niż samo opóźnienie transkrypcji, ponieważ przewiduje, kiedy mówca faktycznie skończył, a to decyduje o postrzeganej latencji przejmowania tury. Jeden H100 może obsłużyć 400 równoczesnych strumieni w czasie rzeczywistym.
Modele nastawione na pokrycie językowe
Meta Omnilingual ASR (Apache 2.0 dla modelu, CC-BY dla korpusu) nie konkuruje przede wszystkim na WER i nie powinien być oceniany tak, jakby to robił. Obejmuje natywnie ponad 1,600 języków i rozszerza zasięg do ponad 5,400 dzięki zero-shot in-context learning. System opiera się na enkoderze wav2vec 2.0 skalowanym do 7B i wstępnie trenowanym na około 4.3M godzin. Wariant 7B LLM-ASR osiąga wskaźnik błędu znaków poniżej 10% w 78% obsługiwanych języków, w tym w ponad 500 językach, których wcześniej nie obsługiwał żaden system ASR. Wskaźnik błędu znaków jest często używany tam, gdzie granice słów nie są spójne albo gdzie ewaluacja języków niskozasobowych jest praktyczniejsza na poziomie znaków. Rozmiary enkoderów mieszczą się w zakresie od 300M do 7B. Meta udostępniła także Omnilingual ASR Corpus obejmujący ponad 350 niedostatecznie obsługiwanych języków.
Whisper large-v3 (1.55B, MIT, 99 języków) został wyprzedzony pod względem dokładności przez około dziesięć otwartych modeli, ale nadal pozostaje mocnym wyborem domyślnym dla wielu projektów. MIT jest najmniej obciążającą licencją w tej kategorii. Jego ekosystem uruchomieniowy — whisper.cpp, faster-whisper i WhisperX — pozostaje bez odpowiednika wśród nowszych wydań. Dla wymagań sprowadzających się do szerokiej obsługi językowej, elastycznego wsparcia sprzętowego i minimalnych tarć licencyjnych Whisper large-v3 nadal jest praktyczną odpowiedzią.
Modele nastawione na badania
diffusion-gemma-asr-small od startupu YC Interfaze to jedno z najbardziej nietypowych architektonicznie wydań roku. Generuje transkrypcje przez równoległe odszumianie dyfuzyjne na płótnie 256 tokenów w 8 do 16 krokach, więc koszt dekodowania nie rośnie wraz z długością transkryptu. Wytrenowano jedynie około 42M parametrów, czyli 0.16% wag, na bazie zamrożonego 26B DiffusionGemma i zamrożonego enkodera whisper-small. Model osiąga 6.6% WER na LibriSpeech test-clean przy około 11 do 17× czasu rzeczywistego. Notuje także 15.7% na FLEURS English i 29.6% CER na FLEURS Mandarin, więc wynik LibriSpeech należy traktować jako górny pułap. Model nie jest przedstawiany jako gotowy do wdrożenia, ale stanowi ważne badanie dla praktyków ASR.
MOSS-Transcribe-Diarize 0.9B (Apache 2.0, 50+ języków) rozwiązuje problem, który wiele porównań ASR pomija: generuje etykiety mówców, znaczniki czasu słów i transkrypt w jednym przebiegu, zamiast łączyć ASR z osobnym systemem diarization. Obsługuje kontekst 128k, około 90 minut audio w jednym przebiegu, RTF około 0.017 na RTX 4090 oraz wzmacnianie hotwordów.
Różnice licencyjne mogą przesądzić o wdrożeniu
Licencjonowanie często jest kwestią, która decyduje, czy model może faktycznie trafić do produktu. Ekosystem dzieli się wyraźnie.
Apache 2.0 obejmuje Cohere Transcribe, Granite Speech 4.1 we wszystkich trzech wariantach, Qwen3-ASR w obu rozmiarach, Voxtral Mini Realtime, Omnilingual ASR, ARK-ASR i MOSS-Transcribe. Modele te nie wymagają atrybucji, a użycie komercyjne jest nieograniczone. Repozytorium Cohere jest jednak dostępne dopiero po podaniu danych kontaktowych, mimo że sama licencja to Apache 2.0.
MIT dotyczy Whisper large-v3, czyniąc go najbardziej liberalną opcją w całej kategorii.
CC-BY-4.0 dotyczy Canary-Qwen-2.5B, Parakeet TDT 0.6B v3 i Kyutai STT. Modele te mogą być używane komercyjnie, ale wymagają atrybucji. W przypadku produktu wbudowanego lub API pod marką własną wymóg atrybucji jest istotnym obowiązkiem zgodności i często stanowi powód, dla którego zespoły wdrażają model inny niż najdokładniejszy spośród testowanych.
Meta Omnilingual ASR ma podział: modele są na Apache 2.0, a korpus na CC-BY.
Praktyczna kolejność wyboru
Proces wyboru modelu nie powinien po prostu podążać za kolejnością w rankingu.
Najpierw należy zacząć od licencji. Jeśli atrybucja jest nieakceptowalna, CC-BY-4.0 eliminuje Parakeet, Canary-Qwen i Kyutai jeszcze przed rozpoczęciem benchmarków.
Następnie trzeba sprawdzić pokrycie językowe. 14 języków Cohere, 6 języków Granite i angielskojęzyczny zakres Canary są stałymi ograniczeniami. Cohere nie ma także automatycznego wykrywania języka, więc język musi być znany z góry.
Potem należy zdecydować, czy aplikacja wymaga pracy strumieniowej czy batchowej. To rozróżnienie architektoniczne: dostrajanie nie zmieni offline'owego modelu enkoder-dekoder w niskolatencyjny system strumieniowy.
Następnie trzeba zmierzyć WER na rzeczywistym audio, które ma być przetwarzane. Różnica w publicznym benchmarku między dziesięcioma najlepszymi modelami wynosi mniej niż jeden punkt, ale rozrzut na audio z akcentem, zaszumionym lub specyficznym domenowo będzie kilka razy większy i niekoniecznie uporządkuje modele w tej samej kolejności. Jeśli systemy downstream zależą od diarization, znaczników czasu, interpunkcji lub obsługi hotwordów, te wyjścia należy testować bezpośrednio, a nie wnioskować o nich z WER.
Na końcu trzeba obliczyć koszt za godzinę audio na sprzęcie, który faktycznie będzie używany. Wartości RTFx są zwykle mierzone przy dużych batchach na sprzęcie centrów danych i nie przenoszą się bezpośrednio na każde środowisko wdrożeniowe.
Centralnym wydarzeniem 2026 roku nie jest to, że jeden model wygrał rynek ASR. Chodzi o to, że model z otwartymi wagami o 2B parametrów i liberalnej licencji może dziś przekraczać poziom wydajności, za który zamknięte API pobierały opłaty osiemnaście miesięcy wcześniej, a pozostały wybór coraz bardziej przypomina decyzję zakupową niż badawczą.
Źródła cytowane w oryginalnym artykule obejmują blog i kartę modelu Cohere Transcribe; IBM Granite Speech 4.1 2B i 4.1 2B-NAR; ARK-ASR-3B; MOSS-Transcribe-preview-2B i MOSS-Transcribe-Diarize; NVIDIA Canary-Qwen-2.5B i Parakeet TDT 0.6B v3; Qwen3-ASR; Voxtral Mini 4B Realtime 2602; Kyutai STT; Meta Omnilingual ASR i publikację; Whisper large-v3; diffusion-gemma-asr; publikację Open ASR Leaderboard; zbiór danych rankingowych; oraz ogłoszenie Appen dotyczące toru prywatnego.
Pozycje w rankingu są aktualizowane na bieżąco i często się zmieniają. Wszystkie dane liczbowe zweryfikowano względem źródeł pierwotnych 23 July 2026.