新闻宏观经济2026 年开放 ASR 模型对比:WER、语言覆盖、延迟与许可证

2026 年开放 ASR 模型对比:WER、语言覆盖、延迟与许可证

作者: MarkTechPost·

要点速览

  • Hugging Face Open ASR Leaderboard 上领先开放 ASR 模型之间的词错误率差距不到 1 个百分点,使排行榜名次更适合作为候选筛选工具,而非决定性选型标准。
  • 排行榜分数的直接比较受到方法学不一致的影响,包括不同数据集子集、面向基准的专门微调,以及可能改变排名的私有赛道评估。
  • Apache 2.0、MIT 和 CC-BY-4.0 等许可证条款经常决定部署可行性,其中 CC-BY-4.0 的署名要求可能使模型不适合嵌入式或白标产品。
  • 领先开放 ASR 模型之间的吞吐量差异超过一个数量级,因此对大规模批处理工作负载而言,每音频小时成本往往比准确率更关键。
  • Meta 的 Omnilingual ASR 原生覆盖超过 1,600 种语言,并通过零样本学习扩展至 5,400 多种语言,为 500 多种此前未被任何系统支持的语言提供 ASR 能力。
2026 年开放 ASR 模型对比:WER、语言覆盖、延迟与许可证

开放语音识别已不再像一年前那样由 Whisper 主导。2026 年 3 月,Cohere 发布了 Transcribe,这是一款 2B 参数、采用 Apache 2.0 许可证的模型,以 5.42% 的平均词错误率(WER)登上 Hugging Face Open ASR Leaderboard 首位。WER 会根据参考转录文本统计替换、删除和插入错误,因此可用于比较识别准确率,但无法反映延迟、说话人归属、时间戳质量或格式表现。五周后,IBM 发布了 Granite Speech 4.1 2B,WER 为 5.33%。此后,ARK-ASR-3B 和 MOSS-Transcribe-preview-2B 又报告了更低的数字。

该排行榜上的领先模型如今相差不到 1 个 WER 点。对于正在选择自动语音识别模型的团队而言,这改变了决策流程:排行榜名次不再是唯一变量,甚至不再是决定性变量。许可证条款、语言支持、流式处理能力以及每音频小时成本如今具有相近的重要性。本文围绕这些因素对开放 ASR 领域进行比较。

排行榜数字存在重要限制

Open ASR Leaderboard 的平均值并不是一个固定不变的单一指标,榜单上并列展示的模型也并非都以完全相同的方式进行了评估。

Cohere 的 5.42% 分数是 8 个英语测试集的平均值,其中包括 TED-LIUM。各数据集分数分别为 AMI 8.13、Earnings-22 10.86、GigaSpeech 9.34、LibriSpeech clean 1.25、LibriSpeech other 2.37、SPGISpeech 3.08、TED-LIUM 2.49 和 VoxPopuli 5.87,平均值正好为 5.42。

ARK-ASR-3B 的 5.04% 数字则是 7 个测试集的平均值,不包括 TED-LIUM。MOSS-Transcribe-preview-2B 的模型卡明确说明:TED-LIUM 目前不是排行榜运行的一部分,因此被排除在外。

由于 TED-LIUM 是该评测套件中较容易的数据集之一,排除它会抬高平均值。如果将 Cohere 已发布的各数据集分数按 ARK 报告的同一组 7 个数据集重新计算,Cohere 的结果将从 5.42 变为 5.84。对 Granite Speech 4.1 2B 采用同样方法,其数字会从 5.33 变为 5.65。在同口径比较下,ARK 的领先幅度比标题数字显示的更大,而不是更小。更广泛的重点在于,简单用一个已发布排行榜数字减去另一个数字,并不一定能得到有意义的比较结果。

还有两个额外注意事项同样重要。

首先,部分分数明确针对排行榜进行了拟合。MOSS-Transcribe-preview-2B 的模型卡表示,该模型使用 Open ASR Leaderboard 训练划分进行了强化学习微调。这一披露本身有价值,但也意味着该分数衡量的是基准表现,而不只是通用能力。

其次,私有赛道数据可能改变排行榜顺序。Appen 提供了保留评估集,覆盖澳大利亚、加拿大、印度和美国口音,并包含脚本朗读和对话场景。当启用这些私有集合时,zoom/scribe_v1 会从第 4 位升至第 1 位,而公开排行榜的领先模型下降一位。针对清晰朗读语音调优的模型,在自发对话音频上的退化可能明显更大。

因此,排行榜适合用于建立候选名单,但不应被视为完整的选型机制。

侧重准确率的模型

Cohere Transcribe(2B、Apache 2.0、14 种语言)是这一组中已经实际进入生产的模型。过去一个月,其下载量超过 620,000 次,并在 transformers、vLLM、面向 Apple Silicon 的 mlx-audio、Rust 移植版以及 WebGPU 构建中获得运行时支持。该模型使用 Conformer 编码器和轻量级 Transformer 解码器,并从零开始训练。Cohere 还进行了人工偏好评估,由受训标注员从语义保留、幻觉和命名实体等方面对转录结果打分。该模型的平均胜率为 61%,其中相较 IBM Granite 4.0 1B Speech 为 78%,相较 Whisper large-v3 为 64%。

其限制也相当重要,并且在模型卡中有明确说明。Cohere Transcribe 不提供自动语言检测、时间戳或说话人分离。该模型还倾向于转录静音,因此 Cohere 建议在其前端加入 VAD 或噪声门。此外,尽管许可证为 Apache 2.0,该仓库仍需通过联系信息协议才能访问。

Granite Speech 4.1 2B(2B、Apache 2.0)在需求更偏向综合能力而非最低排行榜数字时更具优势。它支持 6 种语言的 ASR、双向语音翻译、面向姓名和术语的关键词列表偏置、标点与大小写恢复,并包括德语名词大写。IBM 使用 174,000 小时数据对其训练,并报告 RTFx 为 231.29。RTFx 是吞吐量指标:数值越高,表示在单位实际时间内处理的音频越多,通常是在特定硬件和批处理设置下测得。IBM 还发布了两个相关模型:-plus 变体增加了带说话人归属的 ASR 和词级时间戳,而 -nar 变体将在吞吐量部分讨论。

Canary-Qwen-2.5B(2.5B、CC-BY-4.0、英语)结合了 FastConformer 编码器和 Qwen3-1.7B 解码器。它有两种运行模式:标准转录,以及由解码器对转录文本进行摘要并回答相关问题的 LLM 模式。其报告结果为 5.63% WER、RTFx 418。AMI 在训练数据中被过采样至约 15%,这会使输出偏向保留停顿、重复等不流畅现象的逐字转录。这种行为对法律工作可能有用,但对会议纪要则可能不太理想。

Qwen3-ASR-1.7B(Apache 2.0)覆盖 52 种语言和方言,包括 30 种语言及 22 种中文方言,并报告 5.76% WER。它附带完整推理工具包,以及一个独立的强制对齐模型,可为 11 种语言提供时间戳。对于涉及普通话或中国地区方言语音的用例,它是自然的起点。

侧重吞吐量的模型

领先开放 ASR 模型之间的准确率如今大约只相差 1 个 WER 点。吞吐量差异则超过一个数量级,这意味着吞吐量往往决定运营成本。这对档案处理、呼叫中心分析和媒体流水线尤其重要,因为这些工作负载通常以成千上万甚至数百万分钟音频计量,而不是以实时对话计量。

Parakeet TDT 0.6B v3(0.6B、CC-BY-4.0)是多语言开放模型中的吞吐量领先者。它在 25 种欧洲语言上达到 RTFx 3332.74,包含自动语言识别,并可在 A100 80GB 上单次处理最长 24 分钟音频。代价是 6.32% WER,比 Granite 4.1 2B 大约高 1 个点,但换来约 14 倍的每 GPU 秒音频处理量。

Granite Speech 4.1 2B-NAR 是更值得关注的工程成果。它是非自回归模型:使用双向 LLM 在一次前向传递中编辑 CTC 假设。IBM 报告称,在一块 H100、批大小 128 条件下,其 RTFx 约为 1820。为达到这一吞吐量,它放弃了日语、语音翻译和关键词偏置。

Qwen3-ASR-0.6B 保留全部 52 种语言,并在并发 128 时达到 2000× 吞吐量。

侧重流式处理的模型

批处理 WER 并不适合作为流式模型的衡量指标,尽管排行榜仍会对其打分。Voxtral Realtime 的榜单数值为 7.68%,Kyutai STT 2.6B 为 6.40%。两者在该指标上都低于 Whisper,但这些数字很难说明其预期用途中的表现。

Voxtral Mini 4B Realtime 2602(Apache 2.0、13 种语言)将一个 3.4B 语言模型与一个从零训练的 970M 因果音频编码器结合在一起。两部分都使用滑动窗口注意力,从而支持实际上无界的流式处理。转录延迟可按 80ms 步长在 80ms 到 1200ms 之间配置,另有独立的 2400ms 选项。Mistral 建议将 480ms 作为最佳设置,并表示在该设置下,该模型可匹配领先离线开放模型。它可在单块 16GB GPU 上运行,并在发布首日即获得 vLLM Realtime API 支持。

Kyutai STT(CC-BY-4.0)有两种形式:一个约 1B 参数的英语/法语模型,延迟为 0.5s,并内置语义语音活动检测器;以及一个 2.6B 的纯英语模型,延迟为 2.5s。对于语音智能体,语义 VAD 可能比转录延迟更重要,因为它预测说话人何时真正说完,而这决定了用户感知到的轮流对话延迟。一块 H100 可实时服务 400 路并发流。

侧重覆盖范围的模型

Meta 的 Omnilingual ASR(模型为 Apache 2.0,语料库为 CC-BY)并不主要参与 WER 竞争,也不应按这种方式评估。它原生覆盖超过 1,600 种语言,并通过零样本上下文学习扩展至超过 5,400 种语言。该系统基于扩展至 7B 的 wav2vec 2.0 编码器,并使用约 4.3M 小时数据进行预训练。7B LLM-ASR 变体在 78% 的受支持语言上实现低于 10% 的字符错误率,其中包括 500 多种此前从未被任何 ASR 系统支持的语言。在词边界不一致或低资源语言评估更适合按字符进行时,字符错误率是常用指标。编码器规模从 300M 到 7B 不等。Meta 还发布了 Omnilingual ASR Corpus,覆盖 350 多种服务不足的语言。

Whisper large-v3(1.55B、MIT、99 种语言)在准确率上已被大约 10 个开放模型超过,但它仍是许多项目的强默认选择。MIT 是该领域限制最少的许可证。其运行时生态系统——whisper.cpp、faster-whisper 和 WhisperX——在较新发布的模型中仍无可比拟。对于可概括为广泛语言支持、灵活硬件支持和最低许可摩擦的需求,Whisper large-v3 仍是一个现实可行的答案。

侧重研究的模型

YC 初创公司 Interfaze 的 diffusion-gemma-asr-small 是今年架构上最不寻常的发布之一。它通过在 256-token 画布上进行 8 到 16 步并行扩散去噪来生成转录文本,因此解码成本不会随转录长度增长。仅训练了约 42M 参数,相当于权重的 0.16%,其基础是冻结的 26B DiffusionGemma 和冻结的 whisper-small 编码器。它在 LibriSpeech test-clean 上达到 6.6% WER,速度约为实时的 11 到 17×。它在 FLEURS English 上还记录 15.7%,在 FLEURS Mandarin 上记录 29.6% CER,因此 LibriSpeech 数字应被视为上限。该模型并未被定位为可部署版本,但对 ASR 从业者而言是重要研究。

MOSS-Transcribe-Diarize 0.9B(Apache 2.0、50+ 种语言)解决了许多 ASR 对比忽略的问题:它在一次生成中输出说话人标签、词级时间戳和转录文本,而不是将 ASR 与单独的说话人分离系统串联起来。它支持 128k 上下文,单次可处理约 90 分钟音频,在 RTX 4090 上 RTF 约为 0.017,并支持热词偏置。

许可证差异可能决定能否部署

许可证往往是决定模型是否真正能够上线的问题。该领域的划分相当清晰。

Apache 2.0 覆盖 Cohere Transcribe、Granite Speech 4.1 的全部三个变体、Qwen3-ASR 的两个规模、Voxtral Mini Realtime、Omnilingual ASR、ARK-ASR 和 MOSS-Transcribe。这些模型没有署名义务,商业使用不受限制。不过,Cohere 的仓库虽然许可证本身是 Apache 2.0,却仍需通过联系信息协议才能访问。

MIT 适用于 Whisper large-v3,使其成为该领域最宽松的选项。

CC-BY-4.0 适用于 Canary-Qwen-2.5B、Parakeet TDT 0.6B v3 和 Kyutai STT。这些模型可以商业使用,但需要署名。对于嵌入式产品或白标 API,这一署名要求是有实际意义的合规义务,也常常是团队最终部署并非其测试中最准确模型的原因。

Meta 的 Omnilingual ASR 采用拆分方式:模型为 Apache 2.0,语料库为 CC-BY。

实用的选择顺序

模型选择流程不应只是照搬排行榜顺序。

首先从许可证开始。如果署名不可接受,那么 CC-BY-4.0 会在基准测试开始前就排除 Parakeet、Canary-Qwen 和 Kyutai。

接下来检查语言覆盖。Cohere 的 14 种语言、Granite 的 6 种语言以及 Canary 仅支持英语,都是固定约束,而不是弹性限制。Cohere 还缺少自动语言检测,因此必须预先知道语言。

然后确定应用需要流式处理还是批处理。这是架构层面的区别:调优无法把离线编码器-解码器模型变成低延迟流式系统。

之后,在实际要处理的音频上测量 WER。公开基准中前 10 名模型之间的差距不到 1 个点,但在带口音、有噪声或特定领域音频上的差距会大出数倍,并且不一定按相同顺序排列模型。如果下游系统依赖说话人分离、时间戳、标点或热词处理,也需要直接测试这些输出,而不能从 WER 推断。

最后,在实际将使用的硬件上计算每音频小时成本。RTFx 数字通常是在数据中心硬件的大批量设置下测得,并不能直接迁移到所有部署环境。

2026 年的核心变化并不是某一个模型赢得了 ASR 市场,而是采用宽松许可证的 2B 开放权重模型如今已能超过闭源 API 在 18 个月前收费提供的性能水平,而剩下的选择越来越像采购决策,而不是研究决策。

原文引用的来源包括 Cohere Transcribe 博客和模型卡;IBM Granite Speech 4.1 2B 和 4.1 2B-NAR;ARK-ASR-3B;MOSS-Transcribe-preview-2B 和 MOSS-Transcribe-Diarize;NVIDIA Canary-Qwen-2.5B 和 Parakeet TDT 0.6B v3;Qwen3-ASR;Voxtral Mini 4B Realtime 2602;Kyutai STT;Meta Omnilingual ASR 及论文;Whisper large-v3;diffusion-gemma-asr;Open ASR Leaderboard 论文;排行榜数据集;以及 Appen 的私有赛道公告。

排行榜位置是实时的,并且经常变化。所有数字均已于 2026 年 7 月 23 日根据主要来源核验。