Aioga
AI资讯 / 行业动态
返回 AI资讯

NVIDIA Nemotron 3 Diarization 上线 Baseten,单个 checkpoint 支持四档延迟配置

Baseten 工程博客(网页)Aioga 编辑团队2026-09-23T15:14:39.000Z热度 58

Baseten 推出 NVIDIA Nemotron 3 Diarization 说话人分离模型的托管服务,提供批处理、流式和实时说话人标注转录三种预设。

行业动态Baseten 工程博客(网页)

今日 AI 情报摘要

Baseten 推出 NVIDIA Nemotron 3 Diarization 说话人分离模型的托管服务,提供批处理、流式和实时说话人标注转录三种预设。

中文正文 · AI 翻译

NVIDIA Nemotron 3 说话人分解可以回答谁在什么时候说话,比实时延迟300毫秒到1秒,同时支持任何语音识别(ASR)。

Nemotron 3 diarization

使用 Baseten 模型库中的 NVIDIA Nemotron 3 说话人分解:https://www.baseten.co/library/nemotron-3-diarization/,提供预录音和流式分解以及实时分解转录的预设。这是一个开源的端到端说话人分解模型,可替代通常的分段加嵌入管道及其调优,采用单次处理即可标记最多八位说话人,间隔可配置,低至每 320 毫秒。

我们在 RTX PRO 6000 上对其进行了优化,该显卡可以维持超过 500 条同时进行的小时级分解流(添加转录后为 190 条)。每个说话人的活动信息可用于指导语音活动检测(VAD)、端点检测和语音代理的轮换控制。

说话人分解将音频流按不同说话人的讲话时间进行分段,输出每个不同声音的时间点,并为每个片段分配一致的说话人标签。结合转录,分解可以将转录的文字归因于对话中的具体说话人。

NVIDIA Nemotron 3 说话人分解模型拥有约 1 亿参数的基于 Transformer 的架构,构建在 NVIDIA Streaming Sortformer 之上:https://developer.nvidia.com/blog/identify-speakers-in-meetings-calls-and-voice-apps-in-real-time-with-nvidia-streaming-sortformer/。它将 16 kHz 音频转为 10 毫秒帧,并输出一个 T×8 的说话人活动概率矩阵。

有两条状态信息用于跨音频块维持对话:到达顺序说话人缓存(speaker_0 是第一个听到的声音,并保持不变)以及最近帧的 FIFO(“先进先出”),无需嵌入或聚类即可处理无限长度音频。

虽然以往的说话人分解模型需要对多个参数进行广泛配置,或者完全不支持多种延迟配置,但同一个 Nemotron 3 说话人分解检查点就可以在 0.32 秒到 30.4 秒之间的四种算法延迟下处理每个请求,这取决于模型在承认标签前能看到多少未来音频。为了满足从实时语音代理交互到离线媒体处理的多样化应用需求,Nemotron 3 说话人分解在单一统一检查点内支持灵活的算法延迟设置。

Figure 1 — Latency profiles of a single checkpoint.

图1展示了这些延迟配置文件如何直接映射到块大小和右上下文前瞻窗口。从超低配置转向标准低配置,缓冲区延迟略有增加,但质量持续提升。这种可预测性使开发者能够动态配置每个请求的缓冲区大小,而无需重新部署底层模型实例。

我们报告了包含重叠且无颈圈的 diarization 错误率(DER)。Nemotron 3 Diarization 在延迟下降的情况下保持了准确性。从 30 秒离线档案切换到 0.32 秒超低档案,DER 仅比预录提升 1-2 点,且音质在四个扬声器之后依然保持。在 AISHELL-4 的“低”档案中,我们观察到 DER 为 9.8%,而 Streaming Sortformer v2.1 为 27.2%,相比该模型前代有显著提升。

为了评估不同声学环境和说话人数下的标准尿道准确率,我们在基准数据集中测量了DER,但未使用时间项圈。

Figure 2 — Diarization error rate by dataset and latency profile.

基准测试结果显示,在多个语言的基准数据集(如NOTSOFAR、AMI、CALLHOME和AISHELL)中稳定性稳定,即使在超低配置下,在所有数据集上都优于Meta Muse Voice Transcribe,仅在AMI上输给pyannote community-1。即使在超低延迟配置下,错误率也保持在离线基线的紧密范围内,证实了在实时约束下说话者归属的稳健性。Baseten上的流式对话在测试延迟曲线中仍接近预录质量。

说话者归属的时间段只是使用Nemotron 3日晷化的一种方式。模型的核心是以10毫秒为单位追踪每个说话者的语音活动。这些原始数据可以被语音应用用来支持三个关键功能:

语音活动检测:通过合并所有音频通道的数据,它直接检测音频流中的语音,而非依赖音量水平。

特定发言者回合结束检测:它追踪特定发言者在限定时间内停止说话的时间。这帮助AI语音代理区分主要用户的句子结束和房间内其他人的背景杂谈。

轮流发言与打断:声音出现的顺序可以识别主要发言者。如果第二个声音开始说话,模型会检测到打断;如果两人同时说话,它会标记为重叠语音,在超低延迟设置下,大约300毫秒内响应。

为了简化在不同音频基础设施设计上的部署,Baseten 通过三种专用的服务预设来提供模型。图3提供了这些预设的架构概述以及它们的目标工作负载和吞吐量特性。

Figure 3 — Three presets on Baseten.

这些模块化的预设允许语音应用在无状态批量请求、用于实时发言者跟踪的持久 WebSocket 流,或联合端到端转录管道之间进行选择,直接匹配后端基础设施要求。

每个延迟级别都作为独立的即用实例运行,因此您可以轻松根据每次请求选择速度而无需重新部署。实时转录选项将发言者跟踪器与 NVIDIA 的 6 亿参数英语语音识别模型 NVIDIA Parakeet V2 ASR:https://huggingface.co/nvidia/parakeet-tdt-0.6b-v2 配对,该模型也属于 Nemotron 语音家族。通过使用发言者活动来指导同一音频流的转录,它能够准确捕捉对话双方的内容,即使有人交叉说话。

将语音识别与说话人分离结合通常需要管理单独的模型管道并在事后对齐转录文本。我们的实时系统直接在主前向传递中将 ASR 模型以发言者活动特征为条件。通过将每个发言者的活动向量直接输入 Parakeet V2 的初始编码层,管道可以在一次传递中转录重叠的音频通道,消除了重复的特征提取步骤,并保持单词与发言者之间的时间对齐。

负载来自集群内的 k6,在每次运行中对空闲副本进行单流控制;每个服务器帧都被存档。

为了建立生产基础设施的可靠容量限制,我们在持续负载测试下基准测试了每块 GPU 的总并发流容量。图5展示了单个 NVIDIA RTX PRO 6000 在不同并发流数量下的延迟性能。

Figure 4 — Concurrent hour-long real-time streams per RTX PRO 6000.

压力测试结果显示延迟在最大硬件饱和点时仍呈平稳扩展。通过严格管理硬件资源在可预测的GPU利用边界内,系统延迟在接近单流基线值时保持稳定,直到达到硬容量限制。

使用相同的文件和硬件,Baseten 优化的服务预设比我们测试中使用的 NVIDIA 参考设置提供了约 1.35 倍更高的批处理吞吐量。在 HTTP 连接上,单个 GPU 每分钟可持续处理 200 个六分钟的音频文件,同时保持稳定的响应时间。

对于实时转录,流式和批量设置提供几乎相同的准确性,能够直接从语音识别模型成功重建带有说话者标签的转录文本。

Nemotron 3 分辨可在 Hugging Face 获取:https://huggingface.co/nvidia/Nemotron-3-Diarization,以及在 Baseten 模型库中获取:https://www.baseten.co/library/nemotron-3-diarization/,提供批量、流式和实时分辨转录预设。只需几次点击即可部署,按请求选择延迟配置,并与您已经运行的 ASR 配对——或者联系我们的工程师:https://www.baseten.co/talk-to-us/?model=nemotron-3-td-nemotron-asr 了解我们如何优化您的语音工作负载。

保持对模型性能、推理基础设施等的最新了解。

专用推理:/products/dedicated-inference/

Model Labs:/products/baseten-for-model-labs/

模型运行时:/platform/model-performance/

基础设施:/平台/云原生基础设施/

多云:/products/multi-cloud-capacity-management/

自宿主:/deployments/baseten-self-hosted/

混合:/deployments/baseten-hybrid/

前置部署工程师:/平台/嵌入式工程/

转录:/solutions/transcription/

图像生成:/解决方案/图像生成/

文本转语音:/solutions/text-to-speech/

大型语言模型:/solutions/llms/

复合人工智能:/solutions/compound-ai/

文档:https://docs.baseten.co/

储蓄计算器:/resources/calculator/

信任中心:https://trust.baseten.co

条款和条件:/terms-and-conditions/

服务等级协议:/service-level-agreement/

SOC 2 Type II Certified

DeepSeek V4.1 闪存:/library/deepseek-v41-flash/

GLM-5.3-Flash:/library/glm-53-flash/

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:Baseten 推出 NVIDIA Nemotron 3 Diarization 说话人分离模型的托管服务,提供批处理、流式和实时说话人标注转录三种预设。 Aioga 将其归入「行业动态」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:公司与行业类动态需要放在竞争格局、商业化路径、资本信号和监管环境中观察,单条公告不能代表最终结果。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文件、合作落地、收入或用户信号、竞品动作和监管后续。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: baseten.co

来源: Baseten 工程博客(网页)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-09-23T15:14:39.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Baseten 推出 NVIDIA Nemotron 3 Diarization 说话人分离模型的托管服务,提供批处理、流式和实时说话人标注转录三种预设。

Baseten 工程博客(网页)2026-09-23T15:14:39.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。