IT之家:https://www.ithome.com/ 9 月 2 日消息,科技媒体 9to5Mac 昨日(9 月 1 日)发布博文,报道称 Meta 公司推出 Muse Voice Transcribe, 这是其首个实时音频感知模型。

开发者可通过 Meta Model API 调用该能力,定价为每 1000 分钟音频 3 美元 (现汇率约合 20.2 元人民币) ,等同每小时 0.18 美元 (现汇率约合 1.2 元人民币) 。

Meta, 20'den fazla kişi için parça transkripsiyonunu destekleyen gerçek zamanlı ses algısı modeli Muse Voice Transcribe'ı piyasaya sürdü

该模型在同一流程中整合流式自动语音识别、说话人分离与端点检测,用户说话时,系统可同步输出文字,无需等待完整录音结束后再单独处理。

IT之家注:“流式”就是边说边转写,模型不必等整段音频说完才出结果,而是会一小段一小段持续输出文字,所以延迟更低,适合实时听写、会议记录、通话字幕。

Muse Voice Transcribe 可在包含 20 余名说话者的录音中分离不同发言者,还能识别说话是否结束,从而自动确定一段输入的边界。

模型训练覆盖 70 余种语言,其中 25 种语言在发布时完成验证。该模型支持长度超过 1 小时的音频,也支持句内或句间的自然语言切换。开发者还可通过语言、关键词和上下文偏置,提高特定语言、术语或场景下的识别效果。

在技术方面,Meta 为兼顾实时响应和识别准确度,引入名为自适应延迟(adaptive delay)的动态决策机制。系统不会为所有词语采用固定的速度与准确度取舍,而是针对每个词判断需要额外接收多少音频后再输出识别结果。

对于较容易识别的语音,系统可更快提交转写结果。对于发音不清、术语较多或语境复杂的词语,系统会调用更多前后文音频信息。这种机制旨在兼顾。

Meta 称,截至 2026 年 9 月 1 日,Muse Voice Transcribe 位列 Artificial Analysis 流式语音转文本排行榜第 1 名。

Meta, 20'den fazla kişi için parça transkripsiyonunu destekleyen gerçek zamanlı ses algısı modeli Muse Voice Transcribe'ı piyasaya sürdü
Meta, 20'den fazla kişi için parça transkripsiyonunu destekleyen gerçek zamanlı ses algısı modeli Muse Voice Transcribe'ı piyasaya sürdü
Meta, 20'den fazla kişi için parça transkripsiyonunu destekleyen gerçek zamanlı ses algısı modeli Muse Voice Transcribe'ı piyasaya sürdü
Meta, 20'den fazla kişi için parça transkripsiyonunu destekleyen gerçek zamanlı ses algısı modeli Muse Voice Transcribe'ı piyasaya sürdü