Aioga
AI资讯 / 行业动态
返回 AI资讯

NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

MarkTechPost(RSS)Aioga 编辑团队2026-08-09T23:58:34.000Z热度 72

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首...

行业动态MarkTechPost(RSS)

今日 AI 情报摘要

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。

该模型为首个支持对话中工具调用的开源全双工模型,通过独立输出通道及预置"保持"话术避免 API 执行期间冷场。 权重与容器已公开,但仅限研究用途,需单张 80 GB 显存 GPU,目前无托管 API。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u

中文正文 · AI 翻译

NVIDIA 发布了 NemotronLabs VoiceChat 11B:https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B,这是一个开源的 11B 端到端语音到语音模型,用于实时全双工对话。它不再是将 ASR、LLM 和 TTS 链接在一起,而是在一个统一网络中执行流式语音理解和语音生成。这消除了级联堆栈所需的多模型协调和 API 交接,并降低了端到端延迟:在 Full-Duplex-Bench 1.0 上测量的平滑轮换延迟为 448 毫秒:https://arxiv.org/abs/2503.04721。模型在说话时可以监听,因此用户可以在对话中途插入而代理会让位,接管率在 480 毫秒时为 1.00。它还是第一个在对话保持流畅的同时支持调用工具的开源全双工模型,使用单独的输出通道传递脚本,并配备操作员定义的“占位”语句填补 API 运行期间的空隙。

部分可用——今天可用于试点部署,但不适用于生产环境。权重和容器均公开,且许可宽松。但 NVIDIA 团队表示,该检查点“仅适用于研究目的”,并且仓库记录了实际的失败模式:音频上下文上限为两分钟,多轮对话后可能退化为不可恢复的乱码,轮次结束后自言自语失控,以及用户转录中可能丢词。

该模型是 Mamba/Transformer 混合体,由三个现有 NVIDIA 组件和一个新输出路径组装而成:

输出包括代理音频、代理文本以及正在生成的用户转录。训练使用了大约 550k 小时的真实与合成语料音频,基于 SALM-Duplex:https://arxiv.org/abs/2505.15670 和 Audio Flamingo 3:https://arxiv.org/abs/2507.08128。

工具调用通过侧通道以块形式发出;你的代码返回结果也以块呈现。值得注意的是占位消息:每个工具由操作员定义一条线路,模型生成触发调用的文本时,代理立即说出该线路,以便 API 运行时对话不会陷入沉默。

约束明确。NVIDIA 建议每个会话最多使用五个工具,模型无法可靠地同时调用多个工具,并且用户无法在工具执行过程中打断代理。系统提示和工具响应必须为仅 ASCII 且适合 TTS 的内容。

在 Full-Duplex-Bench 1.0:https://arxiv.org/abs/2503.04721:平滑轮流说话 TOR 0.82 在 448 毫秒,用户打断 TOR 1.00 在 480 毫秒,暂停处理 TOR 为 0.153(合成数据)和 0.255(Candor),值越低越好。

在 AU Harness:https://github.com/ServiceNow/AU-Harness BFCL-v3 语音工具调用:58.5% 简单,62.5% 多个,42.5% 并行,27.5% 并行-多个,89.6% 无关,56.1% 平均。在 Full-Duplex-Bench v3:https://arxiv.org/abs/2604.04847:82.5% 工具选择,44.2% 参数准确率,33% pass@1。

NVIDIA 报告称该模型在 VoiceBench:https://arxiv.org/abs/2410.17196 的开源全双工模型中排名第 #2,在 Full-Duplex-Bench 1.0 的开源模型中也排名第 #2。

需要与我们合作推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等吗?请联系我们:https://forms.gle/wbash1wF6efRj8G58

NVIDIA 发布 NemotronLabs VoiceChat 11B:开源全双工语音模型,支持约 450 毫秒轮换与实时工具调用

Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力造福社会。他最近的努力是推出一个人工智能媒体平台 Marktechpost,该平台以其对机器学习和深度学习新闻的深入报道而脱颖而出,这些报道既技术可靠,又易于广泛受众理解。该平台每月浏览量超过 200 万次,显示了其在受众中的受欢迎程度。

webAI Releases TwIL-LM: A 1.7B and 3B Formal-Logic Model Family for Autoformalization on Local Hardware
Meta AI Releases Muse Glimmer: A 30B Open-Weights Agentic Model That Runs on One Consumer GPU
ByteDance Seed Introduces SeedRealtime
Top LLM Observability and Evaluation Platforms in 2026

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。 Aioga 将其归入「行业动态」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-09T23:58:34.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B,在统一网络中完成流式语音理解与生成,实测轮换延迟 448 毫秒。该模型为首...

MarkTechPost(RSS)2026-08-09T23:58:34.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。