新聞宏觀經濟2026 年開放 ASR 模型比較:WER、語言覆蓋、延遲與授權

2026 年開放 ASR 模型比較:WER、語言覆蓋、延遲與授權

作者: MarkTechPost·

重點速覽

  • Hugging Face Open ASR Leaderboard 上的領先開放 ASR 模型相差不到一個詞錯誤率百分點,使排行榜名次更適合作為候選清單工具,而非決定性選型標準。
  • 不同資料集子集、針對基準測試的微調,以及可能改變排名的私有軌評估,使排行榜分數的直接比較變得複雜。
  • Apache 2.0、MIT 與 CC-BY-4.0 等授權條款經常決定部署可行性,其中 CC-BY-4.0 的署名要求可能使模型不適用於嵌入式或白標產品。
  • 領先開放 ASR 模型之間的吞吐量差異超過一個數量級,讓每音訊小時成本在大規模批次工作負載中比準確率更具區分度。
  • Meta 的 Omnilingual ASR 原生覆蓋超過 1,600 種語言,並透過零樣本學習擴展至超過 5,400 種語言,為超過 500 種先前未被任何系統服務的語言提供 ASR 能力。
2026 年開放 ASR 模型比較:WER、語言覆蓋、延遲與授權

開放語音辨識已不再像一年前那樣由 Whisper 主導。2026 年 3 月,Cohere 發布 Transcribe,這是一個 2B 參數、Apache 2.0 授權的模型,在 Hugging Face Open ASR Leaderboard 上以 5.42% 的平均詞錯誤率(WER)登頂。WER 會根據參考轉錄稿計算替換、刪除與插入,因此適合用來比較辨識準確率,但無法反映延遲、說話者歸屬、時間戳品質或格式。五週後,IBM 發布 Granite Speech 4.1 2B,成績為 5.33%。此後,ARK-ASR-3B 與 MOSS-Transcribe-preview-2B 又回報了更低的數字。

該排行榜上的領先模型如今相差不到一個 WER 百分點。對於正在選擇自動語音辨識模型的團隊而言,這改變了決策流程:排行榜名次不再是唯一、甚至也不是決定性的變數。授權條款、語言支援、串流能力與每音訊小時成本,如今都具有相近的重要性。本文將依照這些因素比較開放 ASR 領域。

排行榜數字有重要限制

Open ASR Leaderboard 的平均值並不是單一固定指標,榜上並列顯示的模型也並非全都以完全相同的方式評估。

Cohere 的 5.42% 分數是八個英文測試集的平均值,其中包括 TED-LIUM。各資料集分數為 AMI 8.13、Earnings-22 10.86、GigaSpeech 9.34、LibriSpeech clean 1.25、LibriSpeech other 2.37、SPGISpeech 3.08、TED-LIUM 2.49 與 VoxPopuli 5.87,平均值正好是 5.42。

ARK-ASR-3B 的 5.04% 數字則是七個測試集的平均值,未包含 TED-LIUM。MOSS-Transcribe-preview-2B 的模型卡明確說明:TED-LIUM 目前不是排行榜執行的一部分,因此被排除。

由於 TED-LIUM 是該套件中較容易的資料集之一,排除它會提高平均值。若把 Cohere 已發布的各資料集分數,依照 ARK 回報的相同七個資料集重新計算,Cohere 的結果會變成 5.84,而不是 5.42。對 Granite Speech 4.1 2B 採用同樣方法,其數字也會從 5.33 變為 5.65。在同基準比較下,ARK 的領先幅度比標題數字暗示的更大,而不是更小。更廣泛的重點是,直接拿一個已發布排行榜數字減去另一個數字,不一定能得到有意義的比較。

另外兩點注意事項也很重要。

第一,有些分數明確屬於針對排行榜調校。MOSS-Transcribe-preview-2B 卡片表示,該模型使用 Open ASR Leaderboard 的訓練切分資料,以強化學習進行微調。這項揭露有其價值,但也意味著該分數衡量的是基準測試表現,而不只是一般能力。

第二,私有軌資料可能改變排行榜排序。Appen 提供了保留的評估集,涵蓋澳洲、加拿大、印度與美國口音,並同時包含照稿朗讀與對話條件。啟用這些私有測試集後,zoom/scribe_v1 從第 4 名升至第 1 名,而公開排行榜的領先模型下降一個名次。針對乾淨朗讀語音調校的模型,在自發對話音訊上的退化可能特別明顯。

因此,排行榜適合用來建立候選清單,但不應被視為完整的選型機制。

注重準確率的模型

Cohere Transcribe(2B、Apache 2.0、14 種語言)是這一組中已實際投入生產的模型。它在過去一個月下載量超過 620,000 次,並在 transformers、vLLM、Apple Silicon 的 mlx-audio、Rust 移植版與 WebGPU 建置上具備執行階段支援。該模型採用 Conformer 編碼器與輕量 Transformer 解碼器,並從零開始訓練。Cohere 也進行了人類偏好評估,由受訓標註員根據語義保留、幻覺與命名實體為轉錄結果評分。該模型平均勝率為 61%,其中相較 IBM Granite 4.0 1B Speech 為 78%,相較 Whisper large-v3 為 64%。

它的限制相當明確,也清楚寫在模型卡中。Cohere Transcribe 不提供自動語言偵測、時間戳或說話者分離。該模型也容易轉錄靜音,因此 Cohere 建議在前端加入 VAD 或噪音閘。此外,儘管授權為 Apache 2.0,該儲存庫仍受聯絡資訊協議限制。

Granite Speech 4.1 2B(2B、Apache 2.0)在需求是更廣泛能力、而非最低排行榜數字時更具優勢。它支援六種語言的 ASR、雙向語音翻譯、針對姓名與行話的關鍵字清單偏置、標點與大小寫還原,包括德語名詞大寫。IBM 以 174,000 小時資料訓練該模型,並回報 RTFx 231.29。RTFx 是吞吐量指標:數值越高,代表每單位實際時間可處理更多音訊,通常是在特定硬體與批次設定下測得。IBM 也推出兩個相關模型:-plus 變體加入說話者歸屬 ASR 與詞級時間戳,-nar 變體則在吞吐量段落中討論。

Canary-Qwen-2.5B(2.5B、CC-BY-4.0、英文)結合 FastConformer 編碼器與 Qwen3-1.7B 解碼器。它可在兩種模式下運行:標準轉錄,以及由解碼器摘要並回答轉錄稿相關問題的 LLM 模式。其回報成績為 5.63% WER、RTFx 418。AMI 在訓練資料中被過度取樣至約 15%,使輸出偏向保留語病的逐字稿。這種行為對法律工作可能有用,但對會議紀錄則較不理想。

Qwen3-ASR-1.7B(Apache 2.0)涵蓋 52 種語言與方言,包括 30 種語言加上 22 種中文方言,回報 WER 為 5.76%。它附帶完整推論工具包,以及一個獨立的強制對齊模型,可為 11 種語言提供時間戳。對於涉及普通話或中文區域語音的使用案例,它是自然的起點。

注重吞吐量的模型

領先開放 ASR 模型之間的準確率如今大約只差一個 WER 百分點。吞吐量差異則超過一個數量級,這意味著吞吐量往往決定營運成本。對於檔案庫、客服中心分析與媒體流程尤其如此,因為這些工作負載通常以數千或數百萬分鐘音訊計算,而不是即時對話。

Parakeet TDT 0.6B v3(0.6B、CC-BY-4.0)是多語開放模型中的吞吐量領先者。它在 25 種歐洲語言上達到 RTFx 3332.74,包含自動語言識別,並可在 A100 80GB 上單次處理最多 24 分鐘音訊。代價是 6.32% WER,約比 Granite 4.1 2B 高一個百分點,換來的是每 GPU 秒約 14 倍的音訊處理量。

Granite Speech 4.1 2B-NAR 是更值得注意的工程成果。它是非自回歸模型:使用雙向 LLM,在單次前向傳播中編輯 CTC 假設。IBM 回報其在單張 H100、批次大小 128 下的 RTFx 約為 1820。為達到這一吞吐量,它放棄了日語、語音翻譯與關鍵字偏置。

Qwen3-ASR-0.6B 保留全部 52 種語言,並在並行度 128 下達到 2000× 吞吐量。

注重串流的模型

批次 WER 對串流模型而言並不是理想衡量方式,儘管排行榜仍然為它們打分。Voxtral Realtime 列為 7.68%,Kyutai STT 2.6B 為 6.40%。兩者在該指標上都低於 Whisper,但這些數字對其預期用途說明有限。

Voxtral Mini 4B Realtime 2602(Apache 2.0、13 種語言)結合一個 3.4B 語言模型與一個從零開始訓練的 970M 因果音訊編碼器。兩個部分都使用滑動視窗注意力,使串流在實務上不受長度限制。轉錄延遲可按 80ms 步進設定,範圍從 80ms 到 1200ms,另有獨立的 2400ms 選項。Mistral 建議 480ms 為最佳設定,並表示在該設定下,模型可匹配領先的離線開放模型。它可在單張 16GB GPU 上運行,並在發布首日即支援 vLLM Realtime API。

Kyutai STT(CC-BY-4.0)有兩種形式:一個約 1B 參數的英語/法語模型,延遲 0.5s,內建語義語音活動偵測器;以及一個 2.6B、僅支援英文的模型,延遲 2.5s。對語音代理而言,語義 VAD 可能比轉錄延遲更重要,因為它預測說話者何時真正說完,而這正是影響感知輪替延遲的因素。一張 H100 可即時服務 400 條並行串流。

注重覆蓋範圍的模型

Meta 的 Omnilingual ASR(模型為 Apache 2.0,語料庫為 CC-BY)並不是主要以 WER 競爭,也不應被當作這類模型評估。它原生支援超過 1,600 種語言,並透過零樣本情境學習擴展至超過 5,400 種語言。該系統建立在擴展至 7B 的 wav2vec 2.0 編碼器上,並以約 4.3M 小時資料預訓練。7B LLM-ASR 變體在 78% 支援語言上達到低於 10% 的字元錯誤率,其中包括超過 500 種先前未被任何 ASR 系統服務的語言。字元錯誤率通常用於詞邊界不一致,或低資源語言評估在字元層級更可行的情境。編碼器規模從 300M 到 7B 不等。Meta 也發布了 Omnilingual ASR Corpus,涵蓋超過 350 種服務不足的語言。

Whisper large-v3(1.55B、MIT、99 種語言)在準確率上已被約十個開放模型超越,但對許多專案而言仍是強大的預設選項。MIT 是該領域限制最少的授權。其執行階段生態系——whisper.cpp、faster-whisper 與 WhisperX——在較新的發布中仍沒有對手。若需求可概括為廣泛語言支援、彈性硬體支援與最低授權摩擦,Whisper large-v3 仍是務實答案。

注重研究的模型

YC 新創 Interfaze 的 diffusion-gemma-asr-small 是今年架構上最不尋常的發布之一。它透過在 256-token 畫布上進行 8 到 16 步的平行擴散去噪來生成轉錄稿,因此解碼成本不會隨轉錄長度增加。該模型只訓練了約 42M 參數,相當於權重的 0.16%,其基礎是凍結的 26B DiffusionGemma 與凍結的 whisper-small 編碼器。它在 LibriSpeech test-clean 上達到 6.6% WER,速度約為即時的 11 到 17×。它在 FLEURS English 上也記錄 15.7%,在 FLEURS Mandarin 上記錄 29.6% CER,因此 LibriSpeech 數字應被視為上限。該模型並未被呈現為可部署狀態,但對 ASR 從業者而言是重要研究。

MOSS-Transcribe-Diarize 0.9B(Apache 2.0、50+ 種語言)處理了許多 ASR 比較忽略的問題:它在一次生成中輸出說話者標籤、詞級時間戳與轉錄稿,而不是把 ASR 串接到獨立的說話者分離系統。它支援 128k 上下文、單次約 90 分鐘音訊、在 RTX 4090 上約 0.017 的 RTF,以及熱詞偏置。

授權差異可能決定能否部署

授權往往是決定模型是否能實際出貨的因素。該領域可清楚區分。

Apache 2.0 涵蓋 Cohere Transcribe、Granite Speech 4.1 的全部三個變體、兩種尺寸的 Qwen3-ASR、Voxtral Mini Realtime、Omnilingual ASR、ARK-ASR 與 MOSS-Transcribe。這些模型沒有署名義務,商業用途不受限制。不過,Cohere 的儲存庫雖然授權本身是 Apache 2.0,仍受聯絡資訊協議限制。

MIT 適用於 Whisper large-v3,使其成為該領域最寬鬆的選項。

CC-BY-4.0 適用於 Canary-Qwen-2.5B、Parakeet TDT 0.6B v3 與 Kyutai STT。這些模型可商業使用,但需要署名。對嵌入式產品或白標 API 而言,署名要求是一項有意義的合規義務,也常是團隊部署的模型並非測試中最準確模型的原因。

Meta 的 Omnilingual ASR 採用分離方式:模型為 Apache 2.0,語料庫為 CC-BY。

實務選型順序

模型選型流程不應只是依照排行榜順序。

先從授權開始。如果署名不可接受,CC-BY-4.0 會在基準測試開始前就排除 Parakeet、Canary-Qwen 與 Kyutai。

接著檢查語言覆蓋。Cohere 的 14 種語言、Granite 的 6 種語言,以及 Canary 僅支援英文,都是固定限制。Cohere 也缺乏自動語言偵測,因此必須事先知道語言。

然後決定應用需要串流還是批次處理。這是架構差異:調校無法把離線編碼器—解碼器模型變成低延遲串流系統。

之後,在實際要處理的音訊上測量 WER。公開基準中前十名模型的差距不到一個百分點,但在有口音、嘈雜或特定領域的音訊上,差距會大數倍,而且不一定以相同順序排列模型。若下游系統依賴說話者分離、時間戳、標點或熱詞處理,這些輸出必須直接測試,而不能從 WER 推斷。

最後,在實際使用的硬體上計算每音訊小時成本。RTFx 數字通常是在資料中心硬體與大批次設定下測得,無法直接轉移到所有部署環境。

2026 年的核心發展並不是某個單一模型贏得 ASR 市場,而是採用寬鬆授權的 2B 開放權重模型,如今已能超越封閉 API 在 18 個月前收費提供的效能水準,而剩下的選擇越來越像採購決策,而非研究決策。

原文引用來源包括 Cohere Transcribe 部落格與模型卡;IBM Granite Speech 4.1 2B 與 4.1 2B-NAR;ARK-ASR-3B;MOSS-Transcribe-preview-2B 與 MOSS-Transcribe-Diarize;NVIDIA Canary-Qwen-2.5B 與 Parakeet TDT 0.6B v3;Qwen3-ASR;Voxtral Mini 4B Realtime 2602;Kyutai STT;Meta Omnilingual ASR 與論文;Whisper large-v3;diffusion-gemma-asr;Open ASR Leaderboard 論文;排行榜資料集;以及 Appen 的私有軌公告。

排行榜位置是即時的,且經常變動。所有數字均已於 2026 年 7 月 23 日依主要來源查證。