{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-08-11T11:14:02.523Z","headline":"NVIDIA 发布 NemotronLabs VoiceChat 11B：开源全双工语音模型，支持约 450 毫秒轮换与实时工具调用","description":"NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B，在统一网络中完成流式语音理解与生成，实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型，通过独立输出通道及预置\"保持\"话术避免 API 执行期间冷场。权重与容器已公开，但仅限研究用途，需单张 80 GB 显存 GPU，目前无托管 API。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","url":"https://www.aioga.com/news/cmsmhbu4w0338ronxh92vej2u/","mainEntityOfPage":"https://www.aioga.com/news/cmsmhbu4w0338ronxh92vej2u/","datePublished":"2026-08-09T23:58:34.000Z","dateModified":"2026-08-09T23:58:34.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling","https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u"],"canonicalUrl":"https://www.aioga.com/news/cmsmhbu4w0338ronxh92vej2u/","directAnswer":{"@type":"Answer","text":"Aioga 编辑摘要：NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B，在统一网络中完成流式语音理解与生成，实测轮换延迟 448 毫秒。 Aioga 将其归入「行业动态」方向，重点关注它对真实使用和行业竞争的影响。","url":"https://www.aioga.com/news/cmsmhbu4w0338ronxh92vej2u/","dateCreated":"2026-08-09T23:58:34.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"marktechpost.com source article","url":"https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling","datePublished":"2026-08-09T23:58:34.000Z","provider":{"@type":"Organization","name":"marktechpost.com","url":"https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","datePublished":"2026-08-09T23:58:34.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u"}}],"aggregationSource":"MarkTechPost（RSS）","originalPublisher":{"name":"marktechpost.com","url":"https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling"},"geoDeepAnswer":null,"article":{"id":"cmsmhbu4w0338ronxh92vej2u","slug":"cmsmhbu4w0338ronxh92vej2u","url":"https://www.aioga.com/news/cmsmhbu4w0338ronxh92vej2u/","title":"NVIDIA 发布 NemotronLabs VoiceChat 11B：开源全双工语音模型，支持约 450 毫秒轮换与实时工具调用","title_en":"","summary":"NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B，在统一网络中完成流式语音理解与生成，实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型，通过独立输出通道及预置\"保持\"话术避免 API 执行期间冷场。权重与容器已公开，但仅限研究用途，需单张 80 GB 显存 GPU，目前无托管 API。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","source":"MarkTechPost（RSS）","sourceUrl":"https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling","aiHotUrl":"https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","publishedAt":"2026-08-09T23:58:34.000Z","category":"行业动态","score":72,"selected":true,"articleBody":["NVIDIA has released NemotronLabs VoiceChat 11B：https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B, an open 11B end-to-end speech-to-speech model for real-time, full-duplex conversation. Instead of chaining ASR, an LLM, and TTS, it performs streaming speech understanding and speech generation in one unified network. That removes the multi-model orchestration and API handoffs a cascaded stack requires, and cuts end-to-end latency: measured smooth turn-taking latency is 448 ms on Full-Duplex-Bench 1.0：https://arxiv.org/abs/2503.04721. The model listens while it speaks, so a user can barge in mid-turn and the agent yields, with a take-over rate of 1.00 at 480 ms. It is also first open full-duplex model to support tool calling while conversation keeps flowing, using a separate output channel for scripts along with operator-defined “on-hold” lines that fill the gap while an API runs.","PARTIAL — deployable today for pilots, not for production. Weights and container are both public, and the license is permissive. But NVIDIA team states the checkpoint is ‘ready for research purposes only,’ and the repo documents real failure modes: a two-minute audio context ceiling, degradation into non-recoverable gibberish after several turns, runaway self-talk after a turn ends, and dropped words in user transcription.","The model is a hybrid Mamba/Transformer, assembled from three existing NVIDIA components along with one new output path:","Outputs include agent audio, agent text, and a running user transcription. Training used roughly 550k hours of audio across real and synthetic corpora, building on SALM-Duplex：https://arxiv.org/abs/2505.15670 and Audio Flamingo 3：https://arxiv.org/abs/2507.08128.","Tool calls are emitted on the side channel as a block; your code returns results in a block. The notable piece is the on-hold message : per tool, an operator defines a line the agent speaks the moment the model generates the text triggering the call, so the conversation does not fall silent while an API runs.","Constraints are explicit. NVIDIA recommends a maximum of five tools per session, the model cannot reliably call multiple tools simultaneously, and the user cannot interrupt the agent during tool execution. System prompts and tool responses must be ASCII-only and TTS-friendly.","On Full-Duplex-Bench 1.0：https://arxiv.org/abs/2503.04721: smooth turn-taking TOR 0.82 at 448 ms, user-interruption TOR 1.00 at 480 ms, and pause-handling TOR of 0.153 (synthetic) and 0.255 (Candor), where lower is better.","On AU Harness：https://github.com/ServiceNow/AU-Harness BFCL-v3 spoken tool calling: 58.5% simple, 62.5% multiple, 42.5% parallel, 27.5% parallel-multiple, 89.6% irrelevance, 56.1% average . On Full-Duplex-Bench v3：https://arxiv.org/abs/2604.04847: 82.5% tool selection, 44.2% argument accuracy, 33% pass@1.","NVIDIA reports the model ranks #2 among open full-duplex models on VoiceBench：https://arxiv.org/abs/2410.17196 and #2 among open models on Full-Duplex-Bench 1.0.","Need to partner with us for promoting your GitHub Repo OR Hugging Face Page OR Product Release OR Webinar etc.? Connect with us ：https://forms.gle/wbash1wF6efRj8G58","Asif Razzaq is the CEO of Marktechpost Media Inc.. As a visionary entrepreneur and engineer, Asif is committed to harnessing the potential of Artificial Intelligence for social good. His most recent endeavor is the launch of an Artificial Intelligence Media Platform, Marktechpost, which stands out for its in-depth coverage of machine learning and deep learning news that is both technically sound and easily understandable by a wide audience. The platform boasts of over 2 million monthly views, illustrating its popularity among audiences."],"articleImages":[{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2019/06/Screen-Shot-2021-09-14-at-9.02.24-AM-300x300.png","alt":"","afterParagraph":9,"url":"/media/articles/cmsmhbu4w0338ronxh92vej2u/787a6d54564e8e19.webp"},{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2026/08/blog61912-6-100x70.png","alt":"ByteDance Seed Introduces SeedRealtime","afterParagraph":10,"url":"/media/articles/cmsmhbu4w0338ronxh92vej2u/b3cae156694b5e86.webp"},{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2026/08/blog61912-4-100x70.png","alt":"Top LLM Observability and Evaluation Platforms in 2026","afterParagraph":10,"url":"/media/articles/cmsmhbu4w0338ronxh92vej2u/e2b8a442e6bcbcf7.webp"},{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2026/08/blog61912-3-100x70.png","alt":"IMDb Sentiment Analysis with DistilBERT LoRA, TF-IDF Baselines, Calibration, Interpretability, Robustness Testing, and Semi-Supervised Learning","afterParagraph":10,"url":"/media/articles/cmsmhbu4w0338ronxh92vej2u/24fbc864dc8ac57e.webp"},{"sourceUrl":"https://www.marktechpost.com/wp-content/uploads/2026/08/blog61912-1-100x70.png","alt":"Pokee AI Releases Pokee-Isaac 28B: A 10M-Token Context Agentic Model Built to Run Inside the Customer Boundary","afterParagraph":10,"url":"/media/articles/cmsmhbu4w0338ronxh92vej2u/87debf3f7b3049ed.webp"}],"mediaStatus":"ok","articleBodyZh":["NVIDIA 发布了 NemotronLabs VoiceChat 11B：https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B，这是一个开源的 11B 端到端语音到语音模型，用于实时全双工对话。它不再是将 ASR、LLM 和 TTS 链接在一起，而是在一个统一网络中执行流式语音理解和语音生成。这消除了级联堆栈所需的多模型协调和 API 交接，并降低了端到端延迟：在 Full-Duplex-Bench 1.0 上测量的平滑轮换延迟为 448 毫秒：https://arxiv.org/abs/2503.04721。模型在说话时可以监听，因此用户可以在对话中途插入而代理会让位，接管率在 480 毫秒时为 1.00。它还是第一个支持在对话过程中调用工具的开源全双工模型，使用单独的输出通道输出脚本，并配有操作员定义的“占线”台词，在 API 运行时填补空白。","部分功能 — 今天可用于试点部署，但不适合生产。权重和容器都是公开的，许可证是宽松的。但 NVIDIA 团队表示检查点‘仅供研究用途’，仓库也记录了真实的失败模式：两分钟音频上下文上限，多轮后降级为不可恢复的乱码，轮次结束后自言自语失控，以及用户转录中的漏词。","该模型是 Mamba/Transformer 的混合体，由三个现有的 NVIDIA 组件和一个新的输出路径组装而成：","输出包括代理音频、代理文本以及正在运行的用户转录。训练使用了大约 55 万小时的真实和合成语料库音频，基于 SALM-Duplex：https://arxiv.org/abs/2505.15670 和 Audio Flamingo 3：https://arxiv.org/abs/2507.08128。","工具调用在侧通道以块形式输出；你的代码在块中返回结果。显著特点是占线消息：操作员为每个工具定义一条台词，当模型生成触发调用的文本时代理立刻说出这条台词，从而在 API 运行期间对话不会沉默。","约束是明确的。NVIDIA 建议每会话最多使用五个工具，模型无法可靠地同时调用多个工具，用户在工具执行期间无法打断代理。系统提示和工具回应必须为 ASCII，并且适合 TTS。","在 Full-Duplex-Bench 1.0：https://arxiv.org/abs/2503.04721：平滑轮流说话 TOR 为 0.82（448 毫秒），用户打断 TOR 为 1.00（480 毫秒），以及暂停处理 TOR 为 0.153（合成数据）和 0.255（Candor），数值越低越好。","在 AU Harness：https://github.com/ServiceNow/AU-Harness BFCL-v3 语音工具调用结果：58.5% 简单调用，62.5% 多次调用，42.5% 并行调用，27.5% 并行多次调用，89.6% 无关调用，平均 56.1%。在 Full-Duplex-Bench v3：https://arxiv.org/abs/2604.04847：82.5% 工具选择准确率，44.2% 参数准确率，33% pass@1。","NVIDIA 报告称该模型在 VoiceBench：https://arxiv.org/abs/2410.17196 的开放式全双工模型中排名第 2，在 Full-Duplex-Bench 1.0 的开放模型中排名第 2。","需要与我们合作以推广您的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会等吗？请联系我们：https://forms.gle/wbash1wF6efRj8G58","Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师，Asif 致力于利用人工智能的潜力为社会公益服务。他最近的项目是推出人工智能媒体平台 Marktechpost，该平台以对机器学习和深度学习新闻的深入报道而著称，既具有技术性，又易于广大读者理解。该平台每月浏览量超过 200 万次，显示出其在观众中的受欢迎程度。"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"Aioga 编辑摘要：NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B，在统一网络中完成流式语音理解与生成，实测轮换延迟 448 毫秒。 Aioga 将其归入「行业动态」方向，重点关注它对真实使用和行业竞争的影响。","background":"背景分析：模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断，单项指标领先不等于已经形成稳定采用。","viewpoint":"Aioga 判断：这条动态更适合作为行业观察信号，当前信息足以建立线索，但不足以推导长期结论。","implications":"影响分析：对相关团队而言，短期应先核对来源、可用范围和实际成本，再判断是否值得接入或跟进。","nextStep":"后续观察：继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。","evidenceRefs":["title","summary","articleBody"],"confidence":"medium","status":"published","aiGenerated":false,"autoApproved":true,"generatedBy":"rule-safe-fallback","generatedAt":"2026-08-11T11:23:41.960Z","sourceHash":"abec0fbaeafa67d3","validation":{"passed":true,"mode":"rule-safe-fallback","checks":["schema","length","source-attribution","no-html"]}},"tags":["行业动态","MarkTechPost（RSS）"],"translations":{"zh-CN":{"title":"NVIDIA 发布 NemotronLabs VoiceChat 11B：开源全双工语音模型，支持约 450 毫秒轮换与实时工具调用","summary":"NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B，在统一网络中完成流式语音理解与生成，实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型，通过独立输出通道及预置\"保持\"话术避免 API 执行期间冷场。权重与容器已公开，但仅限研究用途，需单张 80 GB 显存 GPU，目前无托管 API。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"marktechpost.com","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA 发布 NemotronLabs VoiceChat 11B：开源全双工语音模型，支持约 450 毫秒轮换与实时工具调用 - Aioga AI资讯","description":"NVIDIA 发布开源端到端全双工语音对话模型 NemotronLabs VoiceChat 11B，在统一网络中完成流式语音理解与生成，实测轮换延迟 448 毫秒。该模型为首个支持对话中工具调用的开源全双工模型，通过独立输出通道及预置\"保持\"话术避免 API 执行期间冷场。权重与容器已公开，但仅限研究用途，需单张 80 GB 显存 GPU，目前无托管 AP...","url":"https://www.aioga.com/news/cmsmhbu4w0338ronxh92vej2u/","articleBody":["NVIDIA 发布了 NemotronLabs VoiceChat 11B：https://huggingface.co/nvidia/NVIDIA-NemotronLabs-VoiceChat-11B，这是一个开源的 11B 端到端语音到语音模型，用于实时全双工对话。它不再是将 ASR、LLM 和 TTS 链接在一起，而是在一个统一网络中执行流式语音理解和语音生成。这消除了级联堆栈所需的多模型协调和 API 交接，并降低了端到端延迟：在 Full-Duplex-Bench 1.0 上测量的平滑轮换延迟为 448 毫秒：https://arxiv.org/abs/2503.04721。模型在说话时可以监听，因此用户可以在对话中途插入而代理会让位，接管率在 480 毫秒时为 1.00。它还是第一个支持在对话过程中调用工具的开源全双工模型，使用单独的输出通道输出脚本，并配有操作员定义的“占线”台词，在 API 运行时填补空白。","部分功能 — 今天可用于试点部署，但不适合生产。权重和容器都是公开的，许可证是宽松的。但 NVIDIA 团队表示检查点‘仅供研究用途’，仓库也记录了真实的失败模式：两分钟音频上下文上限，多轮后降级为不可恢复的乱码，轮次结束后自言自语失控，以及用户转录中的漏词。","该模型是 Mamba/Transformer 的混合体，由三个现有的 NVIDIA 组件和一个新的输出路径组装而成：","输出包括代理音频、代理文本以及正在运行的用户转录。训练使用了大约 55 万小时的真实和合成语料库音频，基于 SALM-Duplex：https://arxiv.org/abs/2505.15670 和 Audio Flamingo 3：https://arxiv.org/abs/2507.08128。","工具调用在侧通道以块形式输出；你的代码在块中返回结果。显著特点是占线消息：操作员为每个工具定义一条台词，当模型生成触发调用的文本时代理立刻说出这条台词，从而在 API 运行期间对话不会沉默。","约束是明确的。NVIDIA 建议每会话最多使用五个工具，模型无法可靠地同时调用多个工具，用户在工具执行期间无法打断代理。系统提示和工具回应必须为 ASCII，并且适合 TTS。","在 Full-Duplex-Bench 1.0：https://arxiv.org/abs/2503.04721：平滑轮流说话 TOR 为 0.82（448 毫秒），用户打断 TOR 为 1.00（480 毫秒），以及暂停处理 TOR 为 0.153（合成数据）和 0.255（Candor），数值越低越好。","在 AU Harness：https://github.com/ServiceNow/AU-Harness BFCL-v3 语音工具调用结果：58.5% 简单调用，62.5% 多次调用，42.5% 并行调用，27.5% 并行多次调用，89.6% 无关调用，平均 56.1%。在 Full-Duplex-Bench v3：https://arxiv.org/abs/2604.04847：82.5% 工具选择准确率，44.2% 参数准确率，33% pass@1。","NVIDIA 报告称该模型在 VoiceBench：https://arxiv.org/abs/2410.17196 的开放式全双工模型中排名第 2，在 Full-Duplex-Bench 1.0 的开放模型中排名第 2。","需要与我们合作以推广您的 GitHub 仓库、Hugging Face 页面、产品发布或网络研讨会等吗？请联系我们：https://forms.gle/wbash1wF6efRj8G58","Asif Razzaq 是 Marktechpost Media Inc. 的首席执行官。作为一位有远见的企业家和工程师，Asif 致力于利用人工智能的潜力为社会公益服务。他最近的项目是推出人工智能媒体平台 Marktechpost，该平台以对机器学习和深度学习新闻的深入报道而著称，既具有技术性，又易于广大读者理解。该平台每月浏览量超过 200 万次，显示出其在观众中的受欢迎程度。"]},"en":{"title":"NVIDIA has released NemotronLabs VoiceChat 11B: an open-source full-duplex voice model supporting about 450 millisecond rotations and real-time tool calls","summary":"NVIDIA released the open-source end-to-end full-duplex voice dialogue model NemotronLabs VoiceChat 11B, which achieves streaming speech understanding and generation over a unified network, with a measured rotation latency of 448 milliseconds. This model is the first open-source full-duplex model to support tool calls in conversations, using independent output channels and preset \"hold\" scripts to avoid awkward moments during API execution. Weights and containers are publicly available but only for research purposes, requiring a single 80 GB VRAM GPU; currently no managed API. 🔗 Read the original article via AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"Industry","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA has released NemotronLabs VoiceChat 11B: an open-source full-duplex voice model supporting about 450 millisecond rotations and real-time tool calls - Aioga AI News","description":"NVIDIA released the open-source end-to-end full-duplex voice dialogue model NemotronLabs VoiceChat 11B, which achieves streaming speech understanding and generation over a unified...","url":"https://www.aioga.com/en/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:48:28.777Z"},"ja":{"title":"NVIDIAはNemotronLabs VoiceChat 11Bをリリースしました。これは約450ミリ秒の回転とリアルタイムツール呼び出しをサポートするオープンソースの全二重音声モデルです","summary":"NVIDIAはオープンソースのエンドツーエンド全二重音声ダイアログモデルNemotronLabs VoiceChat 11Bをリリースし、統一ネットワーク上で音声理解と生成をストリーミングし、回転遅延は448ミリ秒と測定されています。 このモデルは、独立した出力チャネルとプリセットの「ホールド」スクリプトを用いて、API実行中の不自然な瞬間を避けるために、会話中のツール呼び出しをサポートする初のオープンソース全二重モデルです。 ウェイトやコンテナは一般公開されていますが、研究目的のみで、1台の80GBのVRAM GPUが必要です。現在マネージドAPIはありません。 🔗 原文記事はAIHOTより読むことができます。 https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"業界動向","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIAはNemotronLabs VoiceChat 11Bをリリースしました。これは約450ミリ秒の回転とリアルタイムツール呼び出しをサポートするオープンソースの全二重音声モデルです - Aioga AIニュース","description":"NVIDIAはオープンソースのエンドツーエンド全二重音声ダイアログモデルNemotronLabs VoiceChat 11Bをリリースし、統一ネットワーク上で音声理解と生成をストリーミングし、回転遅延は448ミリ秒と測定されています。 このモデルは、独立した出力チャネルとプリセットの「ホールド」スクリプトを用いて、API実行中の不自然な瞬間を避けるために、会...","url":"https://www.aioga.com/ja/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:48:30.892Z"},"ko":{"title":"NVIDIA는 NemotronLabs VoiceChat 11B를 출시했습니다: 약 450밀리초 회전과 실시간 툴 호출을 지원하는 오픈 소스 풀 듀플렉스 음성 모델입니다","summary":"NVIDIA는 통합 네트워크를 통해 스트리밍 음성 이해 및 생성을 구현하는 오픈 소스 종단 2중 음성 대화 모델인 NemotronLabs VoiceChat 11B를 출시했으며, 측정된 회전 지연 시간은 448밀리초입니다. 이 모델은 대화 중 도구 호출을 지원하는 최초의 오픈 소스 전이중 모델로, API 실행 중 어색한 순간을 피하기 위해 독립적인 출력 채널과 미리 설정된 \"홀드\" 스크립트를 사용합니다. 가중치와 컨테이너는 연구 목적으로만 공개되어 있으며, 단일 80GB VRAM GPU가 필요합니다; 현재 관리형 API는 없습니다. 🔗 원문 기사는 AIHOT를 통해 읽을 수 있습니다. https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"업계 동향","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA는 NemotronLabs VoiceChat 11B를 출시했습니다: 약 450밀리초 회전과 실시간 툴 호출을 지원하는 오픈 소스 풀 듀플렉스 음성 모델입니다 - Aioga AI 뉴스","description":"NVIDIA는 통합 네트워크를 통해 스트리밍 음성 이해 및 생성을 구현하는 오픈 소스 종단 2중 음성 대화 모델인 NemotronLabs VoiceChat 11B를 출시했으며, 측정된 회전 지연 시간은 448밀리초입니다. 이 모델은 대화 중 도구 호출을 지원하는 최초의 오픈 소스 전이중 모델로, API 실행 중 어색한 순...","url":"https://www.aioga.com/ko/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:48:47.416Z"},"es":{"title":"NVIDIA ha lanzado NemotronLabs VoiceChat 11B: un modelo de voz full-dúplex de código abierto que soporta rotaciones de unos 450 milisegundos y llamadas a herramientas en tiempo real","summary":"NVIDIA lanzó el modelo de diálogo de voz de extremo a extremo full-dúplex NemotronLabs VoiceChat 11B, de código abierto, que permite la comprensión y generación de voz en streaming a través de una red unificada, con una latencia de rotación medida de 448 milisegundos. Este modelo es el primer modelo full-dúplex de código abierto que soporta llamadas a herramientas en conversaciones, utilizando canales de salida independientes y scripts preestablecidos de \"hold\" para evitar momentos incómodos durante la ejecución de la API. Los pesos y contenedores están disponibles públicamente pero solo para fines de investigación, requiriendo una única GPU de 80 GB de VRAM; actualmente no hay API gestionada. 🔗 Lee el artículo original a través de AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"Industria","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA ha lanzado NemotronLabs VoiceChat 11B: un modelo de voz full-dúplex de código abierto que soporta rotaciones de unos 450 milisegundos y llamadas a herramientas en tiempo real - Aioga Noticias de IA","description":"NVIDIA lanzó el modelo de diálogo de voz de extremo a extremo full-dúplex NemotronLabs VoiceChat 11B, de código abierto, que permite la comprensión y generación de voz en streaming...","url":"https://www.aioga.com/es/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:48:45.354Z"},"fr":{"title":"NVIDIA a publié NemotronLabs VoiceChat 11B : un modèle vocal open source full-duplex prenant en charge des rotations d’environ 450 millisecondes et des appels d’outils en temps réel","summary":"NVIDIA a lancé le modèle open source de dialogues vocaux full-duplex full-duplex NemotronLabs VoiceChat 11B, qui permet de diffuser la compréhension et la génération de voix en streaming sur un réseau unifié, avec une latence de rotation mesurée de 448 millisecondes. Ce modèle est le premier modèle full-duplex open source à prendre en charge les appels d’outils dans les conversations, utilisant des canaux de sortie indépendants et des scripts « hold » prédéfinis pour éviter les moments gênants lors de l’exécution de l’API. Les poids et conteneurs sont accessibles publiquement mais uniquement à des fins de recherche, nécessitant une seule carte graphique VRAM de 80 Go ; actuellement aucune API gérée. 🔗 Lisez l’article original via AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"Industrie","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA a publié NemotronLabs VoiceChat 11B : un modèle vocal open source full-duplex prenant en charge des rotations d’environ 450 millisecondes et des appels d’outils en temps réel - Aioga Actualités IA","description":"NVIDIA a lancé le modèle open source de dialogues vocaux full-duplex full-duplex NemotronLabs VoiceChat 11B, qui permet de diffuser la compréhension et la génération de voix en str...","url":"https://www.aioga.com/fr/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:49:04.622Z"},"de":{"title":"NVIDIA hat NemotronLabs VoiceChat 11B veröffentlicht: ein Open-Source-Vollduplex-Sprachmodell, das etwa 450 Millisekunden-Rotationen und Echtzeit-Tool-Calls unterstützt","summary":"NVIDIA veröffentlichte das Open-Source-End-to-End-Vollduplex-Sprachdialogmodell NemotronLabs VoiceChat 11B, das das Streaming von Sprachverständnis und -erzeugung über ein einheitliches Netzwerk mit einer gemessenen Rotationslatenz von 448 Millisekunden erreicht. Dieses Modell ist das erste Open-Source-Full-Duplex-Modell, das Werkzeugaufrufe in Konversationen unterstützt, indem unabhängige Ausgabekanäle und voreingestellte \"Hold\"-Skripte verwendet werden, um unangenehme Momente während der API-Ausführung zu vermeiden. Gewichte und Container sind öffentlich verfügbar, aber nur zu Forschungszwecken und erfordern eine einzige 80-GB-VRAM-GPU; derzeit keine verwaltete API. 🔗 Lesen Sie den Originalartikel über AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA hat NemotronLabs VoiceChat 11B veröffentlicht: ein Open-Source-Vollduplex-Sprachmodell, das etwa 450 Millisekunden-Rotationen und Echtzeit-Tool-Calls unterstützt - Aioga KI-News","description":"NVIDIA veröffentlichte das Open-Source-End-to-End-Vollduplex-Sprachdialogmodell NemotronLabs VoiceChat 11B, das das Streaming von Sprachverständnis und -erzeugung über ein einheitl...","url":"https://www.aioga.com/de/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:49:02.704Z"},"pt-BR":{"title":"A NVIDIA lançou o NemotronLabs VoiceChat 11B: um modelo de voz full-duplex de código aberto que suporta rotações de cerca de 450 milissegundos e chamadas de ferramentas em tempo real","summary":"A NVIDIA lançou o modelo open-source de diálogo de voz full-duplex full-duplex NemotronLabs VoiceChat 11B, que alcança compreensão e geração de fala em streaming em uma rede unificada, com uma latência de rotação medida de 448 milissegundos. Este modelo é o primeiro modelo full-duplex de código aberto a suportar chamadas de ferramentas em conversas, usando canais de saída independentes e scripts pré-definidos de \"hold\" para evitar momentos constrangedores durante a execução da API. Pesos e contêineres estão disponíveis publicamente, mas apenas para fins de pesquisa, exigindo uma única GPU de VRAM de 80 GB; atualmente não há API gerenciada. 🔗 Leia o artigo original via AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"A NVIDIA lançou o NemotronLabs VoiceChat 11B: um modelo de voz full-duplex de código aberto que suporta rotações de cerca de 450 milissegundos e chamadas de ferramentas em tempo real - Aioga Notícias de IA","description":"A NVIDIA lançou o modelo open-source de diálogo de voz full-duplex full-duplex NemotronLabs VoiceChat 11B, que alcança compreensão e geração de fala em streaming em uma rede unific...","url":"https://www.aioga.com/pt-BR/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:49:21.780Z"},"ru":{"title":"NVIDIA выпустила NemotronLabs VoiceChat 11B: открытую модель голоса с полнодуплексным исходным кодом, поддерживающую около 450 миллисекундных вращений и вызовы инструментов в реальном времени","summary":"NVIDIA выпустила открытую сквозную модель голосового диалога с полным дуплексом NemotronLabs VoiceChat 11B, которая обеспечивает потоковое понимание и генерацию речи по единой сети с измеренной задержкой вращения 448 миллисекунд. Эта модель — первая открытая модель с полным дуплексом, поддерживающая вызовы инструментов в разговорах, используя независимые выходные каналы и заранее установленные скрипты «удержания», чтобы избежать неудобных моментов при выполнении API. Веса и контейнеры доступны публично, но только для исследовательских целей, требуя одной видеокарты VRAM на 80 ГБ; в настоящее время управляемый API нет. 🔗 Прочитайте оригинальную статью на сайте AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA выпустила NemotronLabs VoiceChat 11B: открытую модель голоса с полнодуплексным исходным кодом, поддерживающую около 450 миллисекундных вращений и вызовы инструментов в реальном времени - Aioga Новости ИИ","description":"NVIDIA выпустила открытую сквозную модель голосового диалога с полным дуплексом NemotronLabs VoiceChat 11B, которая обеспечивает потоковое понимание и генерацию речи по единой сети...","url":"https://www.aioga.com/ru/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:49:22.005Z"},"ar":{"title":"أصدرت NVIDIA نموذج NemotronLabs VoiceChat 11B: نموذج صوتي مفتوح المصدر يدعم دورانات مدتها حوالي 450 مللي ثانية واستدعاءات أدوات في الوقت الحقيقي","summary":"أصدرت NVIDIA نموذج الحوار الصوتي المزدوج الكامل مفتوح المصدر NemotronLabs VoiceChat 11B، والذي يحقق فهم وتوليد الكلام المتدفقين عبر شبكة موحدة، مع زمن استجابة مقياس يبلغ 448 مللي ثانية. يعد هذا النموذج أول نموذج مفتوح المصدر يدعم استدعاءات الأدوات في المحادثات، باستخدام قنوات إخراج مستقلة وسكريبتات \"احتفاظ\" محددة مسبقا لتجنب اللحظات الصعبة أثناء تنفيذ واجهة برمجة التطبيقات. الأوزان والحاويات متاحة للجمهور ولكن لأغراض البحث فقط، حيث تتطلب وحدة معالجة رسومات واحدة بسعة 80 جيجابايت في ذاكرة فيرام واحدة؛ حاليا لا توجد واجهة برمجة تطبيقات مدارة. 🔗 اقرأ المقال الأصلي عبر AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"أصدرت NVIDIA نموذج NemotronLabs VoiceChat 11B: نموذج صوتي مفتوح المصدر يدعم دورانات مدتها حوالي 450 مللي ثانية واستدعاءات أدوات في الوقت الحقيقي - Aioga أخبار الذكاء الاصطناعي","description":"أصدرت NVIDIA نموذج الحوار الصوتي المزدوج الكامل مفتوح المصدر NemotronLabs VoiceChat 11B، والذي يحقق فهم وتوليد الكلام المتدفقين عبر شبكة موحدة، مع زمن استجابة مقياس يبلغ 448 مللي ث...","url":"https://www.aioga.com/ar/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:49:38.487Z"},"hi":{"title":"NVIDIA ने NemotronLabs VoiceChat 11B जारी किया है: एक ओपन-सोर्स फुल-डुप्लेक्स वॉयस मॉडल जो लगभग 450 मिलीसेकंड रोटेशन और रीयल-टाइम टूल कॉल का समर्थन करता है","summary":"NVIDIA ने ओपन-सोर्स एंड-टू-एंड फुल-डुप्लेक्स वॉयस डायलॉग मॉडल NemotronLabs VoiceChat 11B जारी किया, जो 448 मिलीसेकंड की मापी गई रोटेशन विलंबता के साथ एक एकीकृत नेटवर्क पर स्ट्रीमिंग स्पीच अंडरस्टैंडिंग और जनरेशन प्राप्त करता है। यह मॉडल पहला ओपन-सोर्स फुल-डुप्लेक्स मॉडल है जो बातचीत में टूल कॉल का समर्थन करता है, स्वतंत्र आउटपुट चैनलों का उपयोग करता है और एपीआई निष्पादन के दौरान अजीब क्षणों से बचने के लिए प्रीसेट \"होल्ड\" स्क्रिप्ट का उपयोग करता है। वज़न और कंटेनर सार्वजनिक रूप से उपलब्ध हैं, लेकिन केवल अनुसंधान उद्देश्यों के लिए, एक 80 जीबी वीआरएएम जीपीयू की आवश्यकता होती है; वर्तमान में कोई प्रबंधित एपीआई नहीं है। 🔗 AIHOT के माध्यम से मूल लेख पढ़ें · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA ने NemotronLabs VoiceChat 11B जारी किया है: एक ओपन-सोर्स फुल-डुप्लेक्स वॉयस मॉडल जो लगभग 450 मिलीसेकंड रोटेशन और रीयल-टाइम टूल कॉल का समर्थन करता है - Aioga AI समाचार","description":"NVIDIA ने ओपन-सोर्स एंड-टू-एंड फुल-डुप्लेक्स वॉयस डायलॉग मॉडल NemotronLabs VoiceChat 11B जारी किया, जो 448 मिलीसेकंड की मापी गई रोटेशन विलंबता के साथ एक एकीकृत नेटवर्क पर स्ट्रीमिं...","url":"https://www.aioga.com/hi/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:49:38.373Z"},"it":{"title":"NVIDIA ha rilasciato NemotronLabs VoiceChat 11B: un modello vocale open-source full-duplex che supporta rotazioni di circa 450 millisecondi e chiamate agli strumenti in tempo reale","summary":"NVIDIA ha rilasciato il modello open-source end-to-end full-duplex di dialoghi vocali NemotronLabs VoiceChat 11B, che garantisce la comprensione e la generazione di voce in streaming su una rete unificata, con una latenza di rotazione misurata di 448 millisecondi. Questo modello è il primo modello open-source full-duplex a supportare chiamate di strumenti nelle conversazioni, utilizzando canali di output indipendenti e script preimpostati di \"hold\" per evitare momenti imbarazzanti durante l'esecuzione dell'API. Pesi e contenitori sono disponibili pubblicamente ma solo per scopi di ricerca, richiedendo una singola GPU VRAM da 80 GB; attualmente nessuna API gestita. 🔗 Leggi l'articolo originale su AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA ha rilasciato NemotronLabs VoiceChat 11B: un modello vocale open-source full-duplex che supporta rotazioni di circa 450 millisecondi e chiamate agli strumenti in tempo reale - Aioga Notizie IA","description":"NVIDIA ha rilasciato il modello open-source end-to-end full-duplex di dialoghi vocali NemotronLabs VoiceChat 11B, che garantisce la comprensione e la generazione di voce in streami...","url":"https://www.aioga.com/it/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:49:55.907Z"},"nl":{"title":"NVIDIA heeft NemotronLabs VoiceChat 11B uitgebracht: een open-source full-duplex spraakmodel dat ongeveer 450 milliseconden rotaties en realtime toolcalls ondersteunt","summary":"NVIDIA bracht het open-source end-to-end full-duplex spraakdialoogmodel NemotronLabs VoiceChat 11B uit, dat streaming spraakbegrip en -generatie via een geïntegreerd netwerk bereikt, met een gemeten rotatielatentie van 448 milliseconden. Dit model is het eerste open-source full-duplex model dat tool-aanroepen in gesprekken ondersteunt, waarbij onafhankelijke uitvoerkanalen en vooraf ingestelde \"hold\"-scripts worden gebruikt om ongemakkelijke momenten tijdens API-uitvoering te voorkomen. Gewichten en containers zijn openbaar beschikbaar, maar alleen voor onderzoeksdoeleinden, waarvoor een enkele 80 GB VRAM GPU VEREIST IS; momenteel geen beheerde API. 🔗 Lees het originele artikel via AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA heeft NemotronLabs VoiceChat 11B uitgebracht: een open-source full-duplex spraakmodel dat ongeveer 450 milliseconden rotaties en realtime toolcalls ondersteunt - Aioga AI-nieuws","description":"NVIDIA bracht het open-source end-to-end full-duplex spraakdialoogmodel NemotronLabs VoiceChat 11B uit, dat streaming spraakbegrip en -generatie via een geïntegreerd netwerk bereik...","url":"https://www.aioga.com/nl/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:49:53.883Z"},"tr":{"title":"NVIDIA, yaklaşık 450 milisaniyelik dönüşler ve gerçek zamanlı araç çağrılarını destekleyen açık kaynaklı, tam çift çiftli ses modeli olan NemotronLabs VoiceChat 11B'yi piyasaya sürdü","summary":"NVIDIA, açık kaynaklı uçtan uca tam dupleks sesli diyalog modeli NemotronLabs VoiceChat 11B'yi piyasaya sürdü; bu model, birleşik ağ üzerinden konuşma akışını anlama ve üretme ile 448 milisaniye ölçülü dönme gecikmesi sağlıyor. Bu model, API yürütme sırasında garip anları önlemek için bağımsız çıkış kanalları ve önceden ayarlanmış \"tutma\" betikleri kullanarak konuşmalarda araç çağrılarını destekleyen ilk açık kaynaklı tam çift çiftli modeldir. Ağırlıklar ve konteynerler kamuya açık ancak sadece araştırma amaçlı ve tek bir 80 GB VRAM GPU gerektirir; şu anda yönetilen bir API yoktur. 🔗 Orijinal makaleyi AIHOT üzerinden okuyun · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA, yaklaşık 450 milisaniyelik dönüşler ve gerçek zamanlı araç çağrılarını destekleyen açık kaynaklı, tam çift çiftli ses modeli olan NemotronLabs VoiceChat 11B'yi piyasaya sürdü - Aioga AI Haberleri","description":"NVIDIA, açık kaynaklı uçtan uca tam dupleks sesli diyalog modeli NemotronLabs VoiceChat 11B'yi piyasaya sürdü; bu model, birleşik ağ üzerinden konuşma akışını anlama ve üretme ile...","url":"https://www.aioga.com/tr/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:50:13.064Z"},"vi":{"title":"NVIDIA đã phát hành NemotronLabs VoiceChat 11B: một mô hình thoại full-duplex mã nguồn mở hỗ trợ khoảng 450 mili giây xoay và gọi công cụ theo thời gian thực","summary":"NVIDIA đã phát hành mô hình đối thoại giọng nói full-duplex mã nguồn mở NemotronLabs VoiceChat 11B, đạt được khả năng hiểu và tạo giọng nói trực tuyến qua một mạng thống nhất, với độ trễ xoay đo được là 448 mili giây. Mô hình này là mô hình full-duplex mã nguồn mở đầu tiên hỗ trợ gọi công cụ trong hội thoại, sử dụng các kênh đầu ra độc lập và các script \"giữ\" được cài đặt sẵn để tránh những khoảnh khắc khó xử trong quá trình thực thi API. Trọng lượng và container được công khai nhưng chỉ phục vụ mục đích nghiên cứu, yêu cầu một GPU VRAM 80 GB DUY NHẤT; hiện tại chưa có API được quản lý. 🔗 Đọc bài viết gốc qua AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA đã phát hành NemotronLabs VoiceChat 11B: một mô hình thoại full-duplex mã nguồn mở hỗ trợ khoảng 450 mili giây xoay và gọi công cụ theo thời gian thực - Tin tức AI Aioga","description":"NVIDIA đã phát hành mô hình đối thoại giọng nói full-duplex mã nguồn mở NemotronLabs VoiceChat 11B, đạt được khả năng hiểu và tạo giọng nói trực tuyến qua một mạng thống nhất, với...","url":"https://www.aioga.com/vi/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:50:13.208Z"},"id":{"title":"NVIDIA telah merilis NemotronLabs VoiceChat 11B: model suara full-duplex open-source yang mendukung rotasi sekitar 450 milidetik dan panggilan alat secara real-time","summary":"NVIDIA merilis model dialog suara full-duplex end-to-end open-source NemotronLabs VoiceChat 11B, yang mencapai pemahaman dan pembuatan suara streaming melalui jaringan terpadu, dengan latensi rotasi terukur sebesar 448 milidetik. Model ini adalah model full-duplex open-source pertama yang mendukung panggilan alat dalam percakapan, menggunakan saluran output independen dan skrip \"hold\" yang sudah diatur untuk menghindari momen canggung selama eksekusi API. Bobot dan kontainer tersedia untuk publik tetapi hanya untuk tujuan penelitian, memerlukan satu GPU VRAM 80 GB; saat ini belum ada API yang dikelola. 🔗 Baca artikel asli melalui AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA telah merilis NemotronLabs VoiceChat 11B: model suara full-duplex open-source yang mendukung rotasi sekitar 450 milidetik dan panggilan alat secara real-time - Berita AI Aioga","description":"NVIDIA merilis model dialog suara full-duplex end-to-end open-source NemotronLabs VoiceChat 11B, yang mencapai pemahaman dan pembuatan suara streaming melalui jaringan terpadu, den...","url":"https://www.aioga.com/id/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:50:29.453Z"},"th":{"title":"NVIDIA ได้เปิดตัว NemotronLabs VoiceChat 11B: โมเดลเสียงแบบโอเพ่นซอร์สแบบฟูลดูเพล็กซ์ที่รองรับการหมุนประมาณ 450 มิลลิวินาทีและการเรียกเครื่องมือแบบเรียลไทม์","summary":"NVIDIA ได้เปิดตัวโมเดลบทสนทนาเสียงแบบโอเพ่นซอร์สแบบครบวงจร NemotronLabs VoiceChat 11B ซึ่งสามารถถ่ายทอดความเข้าใจและสร้างเสียงพูดผ่านเครือข่ายเดียวกัน ด้วยความหน่วงในการหมุนที่วัดได้ 448 มิลลิวินาที โมเดลนี้เป็นโมเดลโอเพ่นซอร์สแบบฟูลดูเพล็กซ์ตัวแรกที่รองรับการเรียกใช้เครื่องมือในการสนทนา โดยใช้ช่องทางเอาต์พุตอิสระและสคริปต์ \"hold\" ที่ตั้งไว้ล่วงหน้าเพื่อหลีกเลี่ยงช่วงเวลาที่ไม่สะดวกระหว่างการทํางาน API น้ําหนักและคอนเทนเนอร์เปิดให้สาธารณะใช้ได้แต่เพื่อการวิจัยเท่านั้น โดยต้องใช้ GPU VRAM ขนาด 80 GB ตัวเดียว;ปัจจุบันยังไม่มี API ที่จัดการได้ 🔗 อ่านบทความต้นฉบับผ่าน AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA ได้เปิดตัว NemotronLabs VoiceChat 11B: โมเดลเสียงแบบโอเพ่นซอร์สแบบฟูลดูเพล็กซ์ที่รองรับการหมุนประมาณ 450 มิลลิวินาทีและการเรียกเครื่องมือแบบเรียลไทม์ - ข่าว AI Aioga","description":"NVIDIA ได้เปิดตัวโมเดลบทสนทนาเสียงแบบโอเพ่นซอร์สแบบครบวงจร NemotronLabs VoiceChat 11B ซึ่งสามารถถ่ายทอดความเข้าใจและสร้างเสียงพูดผ่านเครือข่ายเดียวกัน ด้วยความหน่วงในการหมุนที่วัดไ...","url":"https://www.aioga.com/th/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:50:29.117Z"},"pl":{"title":"NVIDIA wypuściła NemotronLabs VoiceChat 11B: open-source, pełnodupleksowy model głosowy obsługujący obrót około 450 milisekund i wywołania narzędzi w czasie rzeczywistym","summary":"NVIDIA wypuściła open-source, end-to-end model dialogowy NemotronLabs VoiceChat 11B, który umożliwia zrozumienie i generowanie mowy w trybie streamingowym w sieci zunifikowanej, z mierzoną latencją obrotu wynoszącą 448 milisekund. Model ten jest pierwszym open-source modelem full-duplex, który obsługuje wywołania narzędzi w rozmowach, wykorzystując niezależne kanały wyjściowe i gotowe skrypty \"hold\", aby uniknąć niewygodnych momentów podczas wykonywania API. Wagi i kontenery są publicznie dostępne, ale tylko do celów badawczych, wymagając pojedynczej karty GPU 80 GB VRAM; obecnie nie ma zarządzanego API. 🔗 Przeczytaj oryginalny artykuł za pośrednictwem AIHOT · https://aihot.virxact.com/items/cmsmhbu4w0338ronxh92vej2u","category":"行业动态","source":"MarkTechPost（RSS）","aggregationSource":"MarkTechPost（RSS）","pageTitle":"NVIDIA wypuściła NemotronLabs VoiceChat 11B: open-source, pełnodupleksowy model głosowy obsługujący obrót około 450 milisekund i wywołania narzędzi w czasie rzeczywistym - Aioga Wiadomości AI","description":"NVIDIA wypuściła open-source, end-to-end model dialogowy NemotronLabs VoiceChat 11B, który umożliwia zrozumienie i generowanie mowy w trybie streamingowym w sieci zunifikowanej, z...","url":"https://www.aioga.com/pl/news/cmsmhbu4w0338ronxh92vej2u/","contentTranslated":true,"sourceHash":"36cfdc8221549589","translatedAt":"2026-08-10T09:50:46.752Z"}}}}