Aioga
AI资讯 / 技巧观点
返回 AI资讯

2026年最佳开源语音识别模型对比:WER、语言、延迟与许可证

MarkTechPost(RSS)Aioga 编辑团队2026-07-23T09:26:40.000Z热度 60

开源语音识别领域已不再是Whisper一家独大。Cohere Transcribe(2B,Apache 2.0)以5.42%平均词错误率登顶Hugging Face开源ASR排...

技巧观点MarkTechPost(RSS)

今日 AI 情报摘要

开源语音识别领域已不再是Whisper一家独大。

Cohere Transcribe(2B,Apache 2.0)以5.42%平均词错误率登顶Hugging Face开源ASR排行榜,但IBM Granite Speech 4.1 2B(5.33%)和ARK-ASR-3B(5.04%)紧随其后,榜首差距不足1个WER点。

中文正文 · AI 翻译

开放语音识别在过去十二个月中的某个时间,停止了仅由 Whisper 主导的状态。2026 年 3 月,Cohere 发布了 Transcribe:https://cohere.com/blog/transcribe,这是一款 2B 参数的 Apache 2.0 模型,以 5.42% 的平均词错误率登上了 Hugging Face 开放 ASR 排行榜的榜首:https://huggingface.co/spaces/hf-audio/open_asr_leaderboard。五周后,IBM 推出了 Granite Speech 4.1 2B:https://huggingface.co/ibm-granite/granite-speech-4.1-2b,平均词错误率为 5.33%。从那时起,ARK-ASR-3B:https://huggingface.co/AutoArk-AI/ARK-ASR-3B 和 MOSS-Transcribe-preview-2B:https://huggingface.co/OpenMOSS-Team/MOSS-Transcribe-preview-2B 的数值更低。

现在该排行榜的榜首相差不到一个词错误率点。这对任何选择模型的人都有一个具体影响:排名不再是决定性因素。许可证、语言覆盖范围、流式支持和每小时音频成本才是。这篇综述将对四个方面进行比较。

开放 ASR 排行榜的平均值并不是一个固定数值,目前并列列出的模型并非都以相同方式评分。

Cohere 的 5.42% 是八个英语测试集的平均值,包括 TED-LIUM。这是正确的:AMI 8.13,Earnings-22 10.86,GigaSpeech 9.34,LibriSpeech clean 1.25,LibriSpeech other 2.37,SPGISpeech 3.08,TED-LIUM 2.49,VoxPopuli 5.87,平均值恰好为 5.42。

ARK-ASR-3B 的 5.04% 是七个测试集的平均值。TED-LIUM 未包含在内。MOSS-Transcribe-preview-2B 的说明卡明确指出:TED-LIUM 当前未被纳入排行榜运行,因此被排除在外。

TED-LIUM 是测试套件中较容易的一个集,因此去掉它会提高平均值。用 ARK 报告的同样七个测试集重新计算 Cohere 发布的每个数据集的成绩,Cohere 的平均值为 5.84,而不是 5.42。对 Granite Speech 4.1 2B 进行同样操作,它从 5.33 上升到 5.65。在同类比较基础上,ARK 的领先幅度比标题数字显示的更大,而不是更小——但关键是,你不能用一个公布数字减去另一个就得到有意义的结果。

还有两个进一步注意事项应列在同一页上:

一些分数明显是为了排行榜而调整的:MOSS-Transcribe-preview-2B 的模型卡说明该模型在 Open ASR 排行榜的训练数据上通过强化学习进行了微调。这个信息是公开的,比大多数模型都透明,但这意味着分数衡量的是基准测试而不是实际能力。

私有轨道数据会重新排列排行榜:Appen 提供了保留的评估集:https://www.appen.com/blog/hugging-face-open-llm-leaderboard,涵盖澳大利亚、加拿大、印度和美国口音的脚本文本和对话场景。当这些私有数据集被启用时,zoom/scribe_v1 从第 4 名升至第 1 名,而公共排行榜的领先模型下降一位。针对干净朗读语音微调的模型在自发性对话音频上的表现降幅较大。

使用排行榜来构建候选名单,不要用它来决定赢家。

Cohere Transcribe:https://huggingface.co/CohereLabs/cohere-transcribe-03-2026 (2B,Apache 2.0,14 种语言) 是实际投入生产的模型。过去一个月内下载量超过 620,000 次,并且在 transformers、vLLM、mlx-audio (Apple Silicon)、Rust 移植版本以及 WebGPU 构建方面均有运行支持。它是一个 Conformer 编码器,配有轻量级 Transformer 解码器,从零开始训练。Cohere 还进行了人工偏好评估,由受过培训的标注者根据意义保留、幻觉现象和命名实体对转录结果打分:平均胜率 61%,对 IBM Granite 4.0 1B Speech 胜率 78%,对 Whisper large-v3 胜率 64%。

模型卡中对局限性的描述异常诚实,应在使用前阅读。模型不具备自动语言检测、时间戳和说话人分离功能,并且倾向于转录静音,因此 Cohere 建议在前置加一个 VAD 或噪声门。尽管采用 Apache 2.0 许可,代码仓库仍需提供联系信息才能访问。

花岗岩语音 4.1 2B:https://huggingface.co/ibm-granite/granite-speech-4.1-2b (2B, Apache 2.0) 是更好的选择,如果你需要能力而不仅仅是较低的参数量。支持六种语言的自动语音识别(ASR)以及双向语音翻译,支持名称和术语的关键词列表偏置,标点符号和大小写恢复,包括德语名词大写。训练数据量为 174,000 小时。RTFx 231.29。IBM 还提供两个兄弟版本:-plus 增加了说话人归属的 ASR 和词级时间戳,而 -nar 在下面讨论。

Canary-Qwen-2.5B:https://huggingface.co/nvidia/canary-qwen-2.5b (2.5B, CC-BY-4.0, 英语) 结合了 FastConformer 编码器和 Qwen3-1.7B 解码器,并可运行两种模式——纯转录模式,或者 LLM 模式,在此模式下解码器对转录内容进行总结并回答问题。WER 为 5.63%,RTFx 418。注意 AMI 数据被过采样约占训练数据的 15%,这会使输出偏向保留口误的逐字转录。这对于法律工作是一种功能,但对于会议记录来说是一种困扰。

Qwen3-ASR-1.7B:https://huggingface.co/Qwen/Qwen3-ASR-1.7B (Apache 2.0) 覆盖 52 种语言和方言——30 种语言加上 22 种中文方言——WER 为 5.76%。它提供完整的推理工具包,并提供一个单独的强制对齐模型,用于 11 种语言的时间戳。对于涉及普通话或中国地方语音的任何任务,这显然是起点。

当前顶级模型的准确率差约一 WER 点。吞吐量差异超过一个数量级,这意味着通常是吞吐量决定了发票金额。

Parakeet TDT 0.6B v3:https://huggingface.co/nvidia/parakeet-tdt-0.6b-v3 (0.6B, CC-BY-4.0) 是多语言开源模型中吞吐量的领先者,RTFx 为 3332.74,覆盖 25 种欧洲语言并支持自动语言识别,在单次处理时可在 A100 80GB 上处理长达 24 分钟的音频。其 WER 为 6.32%——比 Granite 4.1 2B 高约一百分点,但每个 GPU-秒可处理的音频量大约是其十四倍。

花岗岩语音 4.1 2B-NAR:https://huggingface.co/ibm-granite/granite-speech-4.1-2b-nar 是更有趣的工程成果。它是非自回归的:使用双向 LLM 在一次前向传播中编辑 CTC 假设,在单个 H100 上批量大小 128 时 RTFx 约为 1820。为了达到这一点,它舍弃了日语、语音翻译和关键词偏置功能。

Qwen3-ASR-0.6B:https://huggingface.co/Qwen/Qwen3-ASR-0.6B 保留所有52种语言,并在并发128时达到2000×吞吐量。

批量 WER 似乎是对流式模型来说不合适的测试,但排行榜仍然对它们进行评分。Voxtral Realtime 的 WER 为 7.68%,Kyutai STT 2.6B 为 6.40%——两者都低于 Whisper——且这些数字对其预期用途没有任何实际参考价值。

Voxtral Mini 4B Realtime 2602:https://huggingface.co/mistralai/Voxtral-Mini-4B-Realtime-2602(Apache 2.0,13 种语言)是一个 3.4B 的语言模型,配有一个从零开始训练的 970M 因果音频编码器,对两半采用滑动窗口注意力,实现有效的无限流式处理。转录延迟可以以 80ms 为步长从 80ms 配置到 1200ms,并提供单独的 2400ms 选项;Mistral 推荐 480ms 作为最佳设置,并报告在该设置下与领先的离线开放模型相匹配。它可在单个 16GB GPU 上运行,并在第0天就支持 vLLM Realtime API:https://developers.redhat.com/articles/2026/02/06/run-voxtral-mini-4b-realtime-vllm-red-hat-ai。

Kyutai STT:https://huggingface.co/kyutai/stt-1b-en_fr(CC-BY-4.0)提供两种版本:一个约1B 参数的英语/法语模型,延迟0.5秒,内置语义语音活动检测器;另一个为 2.6B 英语专用模型,延迟 2.5 秒。对于语音代理来说,语义 VAD 比转录延迟更重要——它预测说话者何时真正说完,这决定了感知的轮次切换延迟。H100 可实时服务 400 个并发流。

Meta 的 Omnilingual ASR:https://ai.meta.com/research/publications/omnilingual-asr-open-source-multilingual-speech-recognition-for-1600-languages/(Apache 2.0,语料 CC-BY)并不是在 WER 上竞争,不应按此进行评估。它原生支持 1600+ 种语言,并通过零样本上下文学习扩展至 5400+ 种语言,基于扩展到 7B 的 wav2vec 2.0 编码器,并在约 430 万小时数据上预训练。7B LLM-ASR 版本在 78% 的支持语言上字符错误率低于 10%,包括 500+ 在任何 ASR 系统中未曾服务过的语言。编码器规模从 300M 到 7B 不等。Meta 还发布了覆盖 350+ 个服务不足语言的 Omnilingual ASR 语料库。

Whisper large-v3:https://huggingface.co/openai/whisper-large-v3 (1.55B,MIT,支持99种语言)在准确性上已被大约十个开放模型超越,但它仍然是大类项目的默认正确选择。MIT 是该领域最不受限制的许可证。运行时生态系统——whisper.cpp、faster-whisper、WhisperX——在新发布的模型中没有可比的替代。如果你的需求是“某种语言、某种硬件、不想找许可证律师”,它仍然是答案。

diffusion-gemma-asr-small:https://github.com/InterfazeAI/diffusion-gemma-asr 来自 YC 初创公司 Interfaze,是今年架构上最具创意的发布。它通过在 256 令牌画布上进行 8 到 16 步的并行扩散去噪来生成文本,因此解码成本不会随着文本长度增加而增长。仅训练了约 4200 万个参数——占权重的 0.16%——是在冻结的 26B DiffusionGemma 和冻结的 whisper-small 编码器之上训练的。在 LibriSpeech test-clean 上达到约实时 11 到 17 倍速度时 WER 为 6.6%。在 FLEURS 英语上达到 15.7%,在 FLEURS 中文上 CER 为 29.6%,所以应将 LibriSpeech 的数据视为上限。没人应该部署它,但所有从事 ASR 的人都应阅读它。

MOSS-Transcribe-Diarize 0.9B:https://huggingface.co/OpenMOSS-Team/MOSS-Transcribe-Diarize (Apache 2.0,支持50+种语言)解决了大多数综述忽略的问题:它在一次生成中输出说话者标签、词语时间戳和文本,而不是将 ASR 与独立的说话人分离堆栈链式连接。128k 上下文,一次可处理约 90 分钟音频,RTX 4090 上 RTF 约为 0.017,并支持热词偏置。

这是实际阻碍发布的部分,领域内意见分歧明显:

Apache 2.0:Cohere Transcribe,Granite Speech 4.1(所有三种变体),Qwen3-ASR(两种尺寸),Voxtral Mini Realtime,Omnilingual ASR,ARK-ASR,MOSS-Transcribe。无需署名义务,商业用途无限制。注意 Cohere 的仓库虽然许可证是 Apache 2.0,但需要通过联系方式认证。

MIT:Whisper large-v3。该领域最宽松的选择。

CC-BY-4.0:Canary-Qwen-2.5B, Parakeet TDT 0.6B v3, Kyutai STT。可商业使用,但需要署名。对于嵌入式产品或白标 API,这是一个真正的合规义务,也是团队最终发布并非他们测试过的最准确模型的最常见原因。

Meta 的 Omnilingual ASR 将两者分开:模型使用 Apache 2.0,语料库使用 CC-BY 许可。

按这个顺序运行,而不仅仅是按照排行榜顺序:

2026 年的有用总结不是某个单一模型获胜,而是一个许可宽松的 20 亿参数开放权重模型现在击败了闭源 API 十八个月前的收费水平,而剩下的决策更多是采购问题而非研究问题。

排行榜位置实时更新,变动频繁。所有数据已于 2026 年 7 月 23 日核对主要来源。

2026年最佳开源语音识别模型对比:WER、语言、延迟与许可证

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为具有远见的企业家和工程师,Asif 致力于利用人工智能的潜力为社会公益服务。他最近的努力是推出人工智能媒体平台 Marktechpost,该平台因其对机器学习和深度学习新闻的深入报道而脱颖而出,报道内容既技术可靠,又易于广大受众理解。该平台每月浏览量超过 200 万,显示出其广受观众欢迎的程度。

Designing High-Performance GPU Kernels with TileLang: Tensor-Core GEMM, Fused Softmax, FlashAttention, and Autotuning

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:开源语音识别领域已不再是Whisper一家独大。 Aioga 将其归入「技巧观点」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-23T09:26:40.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

开源语音识别领域已不再是Whisper一家独大。Cohere Transcribe(2B,Apache 2.0)以5.42%平均词错误率登顶Hugging Face开源ASR排...

MarkTechPost(RSS)2026-07-23T09:26:40.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。