Meta 推出首个实时音频感知模型 Muse Voice Transcribe,整合流式语音识别、说话人分离与端点检测,可通过 Meta Model API 调用,定价每 1000 分钟音频 3 美元。
Meta 发布实时音频感知模型 Muse Voice Transcribe,支持 20 余人分轨转写 这条更新来自 ithome.com,发布时间为 2026-09-02,Aioga 保留原文入口以便核验。
摘要:Meta 推出首个实时音频感知模型 Muse Voice Transcribe,整合流式语音识别、说话人分离与端点检测,可通过 Meta Model API 调用,定价每 1000 分钟音频 3 美元。
背景:IT之家援引9to5Mac称,Muse Voice Transcribe支持20余名说话者的录音分离,支持超过1小时音频,训练覆盖70余种语言,其中25种语言在发布时完成验证,定价为每1000分钟3美元。
Aioga 观察:Aioga判断:该模型把实时转写、多人发言区分和输入边界判断组合在一起,显示出连续音频处理的整合方向。材料未提供实际延迟、准确率或各语言表现数据,自适应延迟机制的效果仍需验证。
影响与后续:可能影响:开发者需要结合调用价格、已验证语言范围、录音人数和术语场景评估适配性。支持持续输出和多人分离不代表所有音频都能稳定识别,实际效果仍可能受语音清晰度与上下文影响。 后续观察:应关注Meta Model API的实际开放范围,以及不同语言、多人录音、自然语言切换和专业术语场景中的识别表现,并核验自适应延迟对实时性与准确度的影响。
IT之家:https://www.ithome.com/ 9 月 2 日消息,科技媒体 9to5Mac 昨日(9 月 1 日)发布博文,报道称 Meta 公司推出 Muse Voice Transcribe, 这是其首个实时音频感知模型。
开发者可通过 Meta Model API 调用该能力,定价为每 1000 分钟音频 3 美元 (现汇率约合 20.2 元人民币) ,等同每小时 0.18 美元 (现汇率约合 1.2 元人民币) 。
该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。
IT之家注:“流式”就是边说边转写,模型不必等整段音频说完才出结果,而是会一小段一小段持续输出文字,所以延迟更低,适合实时听写、会议记录、通话字幕。
Muse Voice Transcribe 可在包含 20 余名说话者的录音中分离不同发言者,还能识别说话是否结束,从而自动确定一段输入的边界。
模型训练覆盖 70 余种语言,其中 25 种语言在发布时完成验证。该模型支持长度超过 1 小时的音频,也支持句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置,提高特定语言、术语或场景下的识别效果。
在技术方面,Meta 为兼顾实时响应和识别准确度,引入名为自适应延迟(adaptive delay)的动态决策机制。系统不会为所有词语采用固定的速度与准确度取舍,而是针对每个词判断需要额外接收多少音频后再输出识别结果。
对于较容易识别的语音,系统可更快提交转写结果。对于发音不清、术语较多或语境复杂的词语,系统会调用更多前后文音频信息。这种机制旨在兼顾。
Meta 称,截至 2026 年 9 月 1 日,Muse Voice Transcribe 位列 Artificial Analysis 流式语音转文本排行榜第 1 名。