Aioga
AI资讯 / 行业动态
返回 AI资讯

Meta Superintelligence Labs 发布 Muse Voice Transcribe:一个实时模型同时完成流式 ASR、说话人分离和端点检测

MarkTechPost(RSS)Aioga 编辑团队2026-09-02T05:37:12.000Z热度 58

Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcribe,将流式 ASR、20+ 说话人的说话人分离和端点检...

行业动态MarkTechPost(RSS)

今日 AI 情报摘要

Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcribe,将流式 ASR、20+ 说话人的说话人分离和端点检测合并为一个自回归模型,无需后处理。

中文正文 · AI 翻译

大多数生产语音堆栈是由三个系统拼接在一起的。一个模型进行转录,第二个模型区分说话者,检测器判断用户何时停止说话。每一次交接都会增加延迟并产生新的故障模式。

Muse Voice Transcribe:https://research.meta.ai/blog/introducing-muse-voice-transcribe,Meta Superintelligence Labs 本周宣布,将这三项工作合并为一个自回归模型。 Meta 称其为首个实时音频感知模型。它可以一次性执行流式 ASR、20 多个说话者的说话者分类和终结点,无需进行后处理。

它可以部署吗?可以,但仅限于托管API。它已经在Meta模型API上上线:https://developer.meta.com/ai/models/muse-voice-transcribe,型号为muse-voice-transcribe-1.0,价格为每1000分钟音频3美元(每小时0.18美元),并且已经为Mac上的Meta AI和Muse Code提供语音输入功能:https://developer.meta.com/ai/products/muse-code。模型权重尚未公开,因此没有自托管的途径。

Muse Voice Transcribe是Muse Spark系列中的一个自回归多模态模型。音频以12.5 Hz的频率以80ms的块到达。每个音频块被转换为一个软令牌。

每处理完一个音频块,模型会做出一个二元选择。它要么预测一个令牌并继续监听,要么输出一个文本令牌。当模型预测时,该令牌会被输入中的下一个实际音频块替换。当流结束时,会插入一个令牌,模型会在不请求更多音频的情况下刷新所有剩余文本。

听和写共享一个解码器循环,因此没有单独的对齐阶段出现漂移。

因为模型控制何时监听,它也控制每个单词后面有多少音频上下文。Meta称这一间隔为“延迟”。更长的延迟意味着转录更准确,但延迟更高。

Meta没有固定这种权衡,而是通过训练来调节。强化学习将词错误率奖励和延迟奖励相乘,生成一种策略,使每个单词的延迟根据难度而变化。Meta报告称,这使得模型在最终转录所需时间上,在速度与准确率的权衡上处于帕累托前沿,超过了由Soniox、Cartesia和ElevenLabs系统形成的先前前沿。

Meta 没有为说话人归属添加第二个模型,而是在同一流中添加了特殊标记。

对于分说话人标注,一个标记表示潜在的说话人切换,标签标识说话人。轮次标记在一旦可能发生切换时触发,而说话人标签延迟到该段落结束。一个说话人的音频可以被分割成多个片段,但都对应同一个标签。

对于端点检测,标记表示语音的开始,标记表示用户结束的点。两个任务与流式 ASR 联合训练,使用在 ASR 奖励基础上添加的额外奖励。

该模型在 70 多种语言上训练,其中 25 种在发布时经过广泛验证并推荐使用。代码切换是原生支持的,包括句子内和句子间,对于混合语言的双语说话人尤为重要。准确度可以通过语言、关键词和上下文偏置进一步提高。

长上下文处理是一个实际区分点。Meta 表示模型原生支持超过一小时的音频输入和 20 多个说话人,无需额外后处理步骤。

截至 2026 年 9 月 1 日,Meta 报告在流式语音转文本的人工分析和公开分说话人基准中获得第一名。

在人工分析 AA-WER 流式测评中:https://x.com/ArtificialAnlys/status/2094849283120128135,Muse Voice Transcribe 在语音结束 0.16 秒后最终抄本 WER 为 3.1%。使用语义端点的 Cartesia Ink-2 为 3.4%,延迟 0.43 秒。ElevenLabs Scribe v2 Realtime 为 3.6%,延迟 0.14 秒。使用外部端点的 Cartesia Ink-2 速度最快,仅需 0.07 秒,但准确度最低,为 4.0%。在首次部分抄本中,Muse Voice Transcribe 在 0.13 秒时记录 WER 为 3.6%。

在分说话人方面,Meta 报告在 AMI-IHM、AMI-SDM 和 VoxConverse 中的平均分说话人错误率为 17.5%。同一图表中的其他五个系统范围为 21.1% 至 28.6%。

价格是另一个维度。每 1,000 分钟 3.00 美元,比 Cartesia Ink-2 的 4.00 美元低,还不到 ElevenLabs Scribe v2 Realtime 和 Deepgram Flux 的 6.50 美元的一半。

需要与我们合作推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等?请联系我们:https://forms.gle/wbash1wF6efRj8G58

Meta Superintelligence Labs 发布 Muse Voice Transcribe:一个实时模型同时完成流式 ASR、说话人分离和端点检测

米哈尔·萨特(Michal Sutter)是一名数据科学专业人士,拥有帕多瓦大学的数据科学硕士学位。凭借在统计分析、机器学习和数据工程方面的扎实基础,米哈尔擅长将复杂的数据集转化为可操作的洞察。

Researchers from Princeton, Ant Group and Stanford Introduce AQuA
Keenable AI Open-Sources NEEDLE: A Live Search Benchmark That Rebuilds Its Query Set Every Hour

情报判断

Aioga 编辑摘要

Meta Superintelligence Labs 发布 Muse Voice Transcribe,将流式自动语音识别、面向20多个说话人的说话人分离与端点检测合并到一个自回归模型中,并称无需后处理。

背景分析

该模型以80毫秒音频块接收输入,在同一解码循环中决定继续监听或输出文本。材料称其目前以托管API形式提供,型号为muse-voice-transcribe-1.0,未发布模型权重。

Aioga 观点

Aioga 判断:Muse Voice Transcribe 的核心变化在于把语音转写、说话人区分和结束判断放进同一实时处理流程,减少多系统衔接这一产品架构特征值得关注;但材料未提供独立验证结果。

影响与后续

可能影响:统一模型可能减少传统语音栈中的组件交接,但不代表部署复杂度、转写错误或延迟问题已经消失。使用方需要评估托管API依赖、成本、数据处理要求及准确率与实时性的取舍。 后续观察:应关注Meta是否公布更完整的评测方法、不同场景下的错误与延迟表现,以及模型权重或更多部署方式是否开放;同时核实其报告的性能比较能否被独立复现。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-02T05:37:12.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Meta Superintelligence Labs 发布首个实时音频感知模型 Muse Voice Transcribe,将流式 ASR、20+ 说话人的说话人分离和端点检...

MarkTechPost(RSS)2026-09-02T05:37:12.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。