Aioga
AI资讯 / 行业动态
返回 AI资讯

Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集

Hugging Face:Blog(RSS)Aioga 编辑团队2026-08-28T00:00:00.000Z热度 66

Voice Arena 与 Hugging Face 合作,为 Open ASR 排行榜引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,覆盖印地语...

产品更新Hugging Face:Blog(RSS)

今日 AI 情报摘要

Voice Arena 与 Hugging Face 合作,为 Open ASR 排行榜引入 Monsoon en-IN 和 Monsoon hi-IN

两个评测集,覆盖印地语与印度英语,其中印地语是该排行榜多语言板块首个非欧洲语言。 数据集含公开与私有分割,共 4,888 位说话人,并记录 12 项说话人属性,旨在暴露按地区、年龄、性别等维度分布不均的语音识别误差。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtdgo8nh04rurobxlzwr101x

中文正文 · AI 翻译

合集设计:#design-of-the-collection 数据集构成:#dataset-composition 说话人覆盖:#speaker-coverage 元数据字段:#metadata-fields 收集与质量控制:#collection-and-quality-control 区域差异:#regional-variation 印地语正字法差异:#orthographic-variation-in-hindi 获取评估:#getting-evaluated 接下来是什么:#what-comes-next Voice Arena 与 Hugging Face 合作推出印地语和印度英语的开放式语音识别评估

Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集
Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集
Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集
Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集
Open ASR 排行榜新增首个全球南方语言:印地语与印度英语评测集

基准决定了什么会被开发。一个在开放 ASR 排行榜(https://huggingface.co/spaces/hf-audio/open_asr_leaderboard)上得分高的模型会被采用和迭代,而排行榜未衡量的能力往往不会得到提升。最近在排行榜上的许多工作都集中在使评估指标更可信:

所有这些使得一个指标(WER)更难被操控,但它仍然是一个数字。一长串研究显示,ASR 错误率在使用它的人群中分布并不均匀。《自动语音识别中的种族差异》(https://www.pnas.org/doi/10.1073/pnas.1915768117)发现商业系统对黑人说话人的表现大约是对白人的两倍差,而《量化自动语音识别中的偏差》(https://huggingface.co/papers/2103.15122)则发现按性别、年龄和口音还有其他差异。这些在排行榜上都看不到,并不是排行榜在隐藏它。这些测试集记录了说了什么,但几乎没有关于说话人是谁的信息。

为了解决这一空白,我们在开放 ASR 排行榜引入了两个评估集:Monsoon en-IN(https://huggingface.co/datasets/VoiceArena/MonsoonASR-Open-ASR-leaderboard-en-IN)和 Monsoon hi-IN(https://huggingface.co/datasets/VoiceArena/MonsoonASR-Open-ASR-leaderboard-hi-IN)。印地语由超过五亿人使用,是多语言选项卡上的第一种印度语,目前多语言选项卡仅覆盖欧洲语言。每个数据集都作为公开分割发布,可用于自我评分,同时保留私有分割以限制基准特定的优化。这四个分割在说话人上不重叠,共包括 4,888 个说话人,每位说话人记录 12 个属性。

一个测试集只能揭示它变化的失败模式。大多数基准测试都是基于现成可用的音频构建的。Monsoon 测试集是沿九个轴构建的:地理位置、年龄、性别、词汇、设备、声学环境、语音类型、语速,以及同一音频存在多个有效转录的情况。每一项都是平均词错误率(WER)可能正确,但对特定人群可能错误的因素。

:https://storage.googleapis.com/research_team_data/blog_figures/nine-axes-gray.png

数据收集方法是由此而来的。

四个分集,两个语言,通过一个处理流程收集。

数据来源于未经脚本的双声道自发对话,剪辑从单声道中分割,以确保每个剪辑只有一个说话者。除了表中报告的字段外,每个剪辑还记录职业、教育、婚姻状况、收入等级、手机品牌、当前城市和在当前地区的居住年数。

来自公共印度英语分集的五个剪辑及其携带的元数据:

29岁女性,西特里普拉,特里普拉邦。学生,三星 SM-G781B。

32岁女性,萨特纳,中央邦。失业,三星 SM-E146B。

22岁男性,罗塔斯,比哈尔邦。学生,摩托罗拉 moto g54 5G。

27岁女性,瓦兰格尔,特伦甘纳邦。失业,vivo V2247。

57岁男性,印度本地直辖区。私企员工,小米 M2006C3LI。

英语集合使用标准字符串引用,排行榜的规范化器可以合并大部分拼写变体。印地语有更多的拼写变体,且没有任何规范化器可以解决,因为这些变体不是两种约定之间的固定映射。因此,印地语集合提供一个格点:对于转录的每个片段,列出被接受为正确的拼写列表。

Monsoon 的小时数上规模小,按说话者数量上规模大。这就是设计理念,也是其大部分价值所在。

说话者集中度和上述字段之外的多样性。

随之而来的是三个属性,每一个都是关于方差的声明,而非数量。

没有任何一个声音主导评分:前十名贡献者占总语音时长的比例在2.8%至6.8%之间,而超过一半的说话者只出现一次。Monsoon 上的结果是数百个不同声音的平均,而不是少数说话者的长时间录音。通常具有相当时长的测试集通常以相反的方式构建。

没有任何地区或设备主导评分:印度英语公共数据集涵盖了来自30个邦和联邦属地的428个本地区;而印地语数据集作为印地语带地区的语言,分布更加集中,但仍覆盖202到295个区。录音来自315到582种不同设备型号,在任何子集里没有单一型号占比超过2.1%。在标准化硬件上收集的语料会过拟合某一麦克风响应,而该语料不会。

这里的印度英语并非单一口音:这是全国各地讲的英语,而不是某一区的英语。六个区域都有代表:在公共数据集中,南部说话者贡献了35%的片段,东部贡献18%,中部贡献18%,北部贡献16%,西部贡献11%。由此分布产生的口音差异记录在元数据中,而不是被假定。

Monsoon 每个片段提供18列,其中12列为元数据,而大多数公共自动语音识别测试集只包含一个标识符、一个转录和一个时长。人口统计字段完整或接近完整;贡献者已同意使用这些数据。

两种语言的地理分布形状不同,而这种形状具有信息性。印地语数据集集中在印地语带,北方邦约占说话者总数的40%,这正是按人口抽样的印地语语料应有的样子。印度英语数据集则更加均衡:没有任何一个邦超过13%,八个最大邦之外的说话者占三分之一。公共和私有数据集在两者上匹配情况相近。

印度州界是按语言划定的,因此区和州带有真实的重音信号,这也是为什么这些字段被释放而非被总结。这类分析已在印度ASR的大规模报告中被报告:区级错误率约为4%至44%,代表性不足的地区远远落后于印地语带和大都市区,并按音频质量、发言速度、发言时长、性别、年龄和设备进行细分。这些测试基于封闭基准进行。Monsoon在公开排行榜测试集上实现了同样的分析。

:https://storage.googleapis.com/research_team_data/blog_figures/flowchart%201.png

广泛的地理覆盖需要跨数百个学区招募,而非由较少发言者进行更长时间的会议,而这种规模的分布式招聘引入了较小群体不会遇到的失败模式:贡献者钻空子任务、作为直播语音提交的音频播放,以及不专注的注释。每种情况都通过明确的检查来解决。

招募与录音:贡献者通过Voice Arena社区招募,这是一个全球数字平台,其影响力延伸至语音语料库很少覆盖的农村和半城市地区。随后,配对通过点对点接口(双频道)录制两人对话,内容涵盖日常指定话题。贡献者使用自己的手机和连接。其中许多设备是低端设备,带宽不稳定,因此这种状况存在于发布的音频中,而非被过滤掉。潜在贡献者在获得录音访问前完成语言能力筛查,获得报酬,并提供了关于培训和分发使用的知情同意。每个说话者的时长上限,根据语言的人口规模和使用者地理分布校准,防止少数高产贡献者主导某一语言或地区;这些集中超过一半的使用者只贡献一个片段。

引导:大规模引导自发语音本身具有难度,因为贡献者往往在没有结构性指导的情况下产生简短且零散的回应。因此,每次对话都以开放式叙事提示为起点,并逐步呈现后续问题,涵盖旅行、医疗、农业、教育和数字服务等领域,引导交流向详细描述发展而不进行台本化。候选主题由大型语言模型生成,然后由母语语言学家进行审查和本地化。

质量控制:每个录音在转录前都经过一系列门控检查。使用基于人工标注数据训练的语言识别模型,对所说语言与分配语言进行验证,覆盖30多种语言。使用专用分类器确认说话者的性别是否与自报标签一致,该分类器作为自报的辅助验证,而非替代。另有模型区分真实自发对话与预录或播放的音频。信噪比估计会删除可理解性受损的录音,同时有意保留自然环境背景噪声,以保持真实场景语音的声学真实感。通过这些检查的录音会通过语音活动检测进行分段,当出现连续两秒的静默或在15秒的软上限处并在下一次检测到静默时结束。每个通道独立分段,因此每个片段为单说话者、单通道。分段之后通过DNSMOS P.808检查。

下面是一个示例,运行在公开的印度英语数据分集上,以展示元数据可能进行的评估类型。这并不是数据集合的发现目的;它是一个说明,一旦每个片段都带有说话者信息,哪些问题可以得到解答。

排行榜上的八个模型在该数据集上的词错误率(WER)在4.81到4.99之间。最好到最差之间只有0.18个百分点,相当于五小时即可解决的范围。在语料库排名上,它们是同一型号。

按地区对说话者进行分组会讲述不同的故事。每位说话者的母语地区被汇总到其区域委员会,即印度内政部对各邦的分组,形成五个样本充分的区域。openai/whisper-large-v3-turbo:https://huggingface.co/openai/whisper-large-v3-turbo 在各区域之间的变化为0.46分。mistralai/Voxtral-Mini-3B-2507:https://huggingface.co/mistralai/Voxtral-Mini-3B-2507,在语料库上落后它十四百分点,变化为1.68,中部区域为4.38,而东部为6.06。排行榜上难以区分的两个系统,其准确率对说话者来源地的依赖程度几乎相差四倍。

:https://storage.googleapis.com/research_team_data/csv_files/corpus_wer_versus_zone_range_coloured_by_zone.png

哪个区域最难也不是固定的。ibm-granite/granite-speech-3.3-2b:https://huggingface.co/ibm-granite/granite-speech-3.3-2b 在北区表现最差,microsoft/VibeVoice-ASR-HF:https://huggingface.co/microsoft/VibeVoice-ASR-HF 在南区最差,mistralai/Voxtral-Mini-3B-2507:https://huggingface.co/mistralai/Voxtral-Mini-3B-2507 在东区最差。如果某个单独的区域只是更难转录,每个模型对区域的排名都会相同。但事实并非如此,这说明问题出在模型本身,而不是音频。

地区是记录的十二个属性之一,上述区域是428个地区的粗略汇总。相同的划分也适用于年龄、教育、职业和终端设备,发布的文件包含重现所需的一切内容。这些信息在仅记录所说内容的测试集中是不可用的。

英语正字法变异是有界的。英式与美式拼写、标点、字母大小写、数字与单词:标准化工具可以将大部分映射为单一形式,排行榜上的方法正是如此。印地语不具备相同的界限。日常语言中大量混合代码,来源于英语的词没有固定的天城文拼写,复合形式根据偏好可连写或分写。同一句话可能有十种或更多有效书写形式,没有固定映射可以将它们统一,因为不存在可映射的规范形式。

:https://storage.googleapis.com/research_team_data/blog_figures/flowchart%202.png

使用单一参考进行评分时,WER 会奖励生成了标注者碰巧选择的拼写的系统。两个在音频识别上同样出色的系统,仅在正字法上就可能相差几个百分点。

因此,印地语数据集提供了一个 lattice(词格):对于转录的每个片段,列出被接受为正确的书写形式集合。构建它是人工工作。候选变体来源于同一音频的多个 ASR 转录,之后通过语言模型扩展,然后由母语语言学家决定哪些对该语句有效,并修剪掉其余形式,因此只允许与所说内容一致的形式。

:https://storage.googleapis.com/research_team_data/blog_figures/flowchart%203a.png

因此,对于印地语,我们报告正字法信息的词错误率(Orthographically-Informed Word Error Rate, OIWER):https://huggingface.co/papers/2603.00941,由 AI4Bharat 提出,而不是 WER。将假设与每个片段中被接受的集合进行对齐,因此任何被允许的形式都计为正确,只有真正的识别错误才会被计入。

为了量化其影响,对相同的假设进行了两次评分。将每个 lattice 的每个片段扁平化为其第一个变体,可得到传统基准提供的单个字符串参考;任何被接受的变体都同样有效,而不同的选择会导致不同的参考。对扁平化参考进行评分时,每个系统的错误率都会上升,而且上升幅度不均匀。因此排名会发生变化。下图显示了两对系统在两个参考之间顺序逆转的情况:在单一参考下,系统在一定程度上因复制标注者的正字法而获得奖励,而 lattice 评分只考虑识别。

:https://storage.googleapis.com/research_team_data/csv_files/hindi_oiwer_flips.png

我们还将我们的实现开源了,voi-oiwer:https://pypi.org/project/voi-oiwer,因此这些数据集上的每个结果都可以直接复现。

对于私有划分,将你的模型提交到 Open ASR Leaderboard,Hugging Face 团队将进行评估。与之前一样,将模型添加到排行榜的流程在 Open ASR Leaderboard GitHub 上进行:https://github.com/huggingface/open_asr_leaderboard

印度英语加入了主排行榜:https://huggingface.co/spaces/hf-audio/open_asr_leaderboard,以 Voice Arena Monsoon 的身份出现,在默认列设置中,而不是作为可选切换,因此它会对每个模型的总体平均 WER 做出贡献。私有分割会将聚合的私有(会话型)列与 Appen 和 DataoceanAI 的数据一起提供:https://huggingface.co/blog/open-asr-leaderboard-private-data。公共和私有的印地语出现在多语言标签页:https://huggingface.co/spaces/hf-audio/open_asr_leaderboard,在该标签页中,只有当模型支持所选的每种语言时才会被排名,使该列具有可比性。或者,从“语言数据集细分”下拉菜单中选择“印地语”。

印地语是一个典型的普遍性问题案例。任何一种有多种书写方式的语言,且其使用者未被基准测试抽样,都会存在这里描述的两类失败。现有的数据集并不能解决这些问题。它们所做的是提供一种观察这些问题的方法:在排行榜上的测试集,领域内的人员已经在关注,包含足够多关于每位说话者和每个参考的数据,使得两个系统之间的差异可以追溯到说话的人及其书写方式,而不是消失在一个数字中。

这四个数据集是 Monsoon 的一部分,Voice Arena 针对全球南方的更广泛数据集计划的一部分。

通过 WER 和速度探索并比较语音识别模型

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Voice Arena 与 Hugging Face 合作,为 Open ASR 排行榜引入 Monsoon en-IN 和 Monsoon hi-IN Aioga 将其归入「产品更新」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: huggingface.co

来源: Hugging Face:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-28T00:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Voice Arena 与 Hugging Face 合作,为 Open ASR 排行榜引入 Monsoon en-IN 和 Monsoon hi-IN 两个评测集,覆盖印地语...

Hugging Face:Blog(RSS)2026-08-28T00:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。