{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-09-28T06:03:00.468Z","headline":"NVIDIA Nemotron 3 Diarization 上线 Baseten，单个 checkpoint 支持四档延迟配置","description":"Baseten 推出 NVIDIA Nemotron 3 Diarization 说话人分离模型的托管服务，提供批处理、流式和实时说话人标注转录三种预设。","url":"https://www.aioga.com/news/cmue9sp3l0skgrogh2jez67og/","mainEntityOfPage":"https://www.aioga.com/news/cmue9sp3l0skgrogh2jez67og/","datePublished":"2026-09-23T15:14:39.000Z","dateModified":"2026-09-23T15:14:39.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://www.baseten.co/blog/nvidia-nemotron-3-diarization","https://aihot.news/items/cmue9sp3l0skgrogh2jez67og"],"canonicalUrl":"https://www.aioga.com/news/cmue9sp3l0skgrogh2jez67og/","directAnswer":{"@type":"Answer","text":"Aioga 编辑摘要：Baseten 推出 NVIDIA Nemotron 3 Diarization 说话人分离模型的托管服务，提供批处理、流式和实时说话人标注转录三种预设。 Aioga 将其归入「行业动态」方向，重点关注它对真实使用和行业竞争的影响。","url":"https://www.aioga.com/news/cmue9sp3l0skgrogh2jez67og/","dateCreated":"2026-09-23T15:14:39.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"Baseten 工程博客（网页） source article","url":"https://www.baseten.co/blog/nvidia-nemotron-3-diarization","datePublished":"2026-09-23T15:14:39.000Z","provider":{"@type":"Organization","name":"Baseten 工程博客（网页）","url":"https://www.baseten.co/blog/nvidia-nemotron-3-diarization"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.news/items/cmue9sp3l0skgrogh2jez67og","datePublished":"2026-09-23T15:14:39.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.news/items/cmue9sp3l0skgrogh2jez67og"}}],"aggregationSource":"Baseten 工程博客（网页）","originalPublisher":{"name":"Baseten 工程博客（网页）","url":"https://www.baseten.co/blog/nvidia-nemotron-3-diarization"},"geoDeepAnswer":null,"article":{"id":"cmue9sp3l0skgrogh2jez67og","slug":"cmue9sp3l0skgrogh2jez67og","url":"https://www.aioga.com/news/cmue9sp3l0skgrogh2jez67og/","title":"NVIDIA Nemotron 3 Diarization 上线 Baseten，单个 checkpoint 支持四档延迟配置","title_en":"","summary":"Baseten 推出 NVIDIA Nemotron 3 Diarization 说话人分离模型的托管服务，提供批处理、流式和实时说话人标注转录三种预设。","source":"Baseten 工程博客（网页）","sourceUrl":"https://www.baseten.co/blog/nvidia-nemotron-3-diarization","aiHotUrl":"https://aihot.news/items/cmue9sp3l0skgrogh2jez67og","publishedAt":"2026-09-23T15:14:39.000Z","category":"行业动态","score":58,"selected":false,"articleBody":["NVIDIA Nemotron 3 Diarization answers who spoke when, 300ms–1s behind live, alongside any ASR.","Use NVIDIA Nemotron 3 Diarization from Baseten’s Model Library：https://www.baseten.co/library/nemotron-3-diarization/, with presets for prerecorded and streaming diarization, and real-time diarized transcription. This is an open, end-to-end diarization model that replaces the usual segmentation-plus-embedding pipeline and its tuning with a single pass, labeling up to eight speakers at a configurable interval as low as every 320ms.","We optimized it on an RTX PRO 6000, which can sustain over 500 concurrent hour-long diarization streams (190 with transcription added). The same per-speaker activity can be used to inform VAD, endpointing, and turn-taking for voice agents.","Speaker diarization segments an audio stream by when each distinct speaker is talking, outputs timings for each distinct voice, and assigns every span a consistent speaker label. In conjunction with transcription, diarization can attribute transcribed words to who said them in a conversation.","The NVIDIA Nemotron 3 Diarization model has a ~100M-parameter transformer-based architecture built on top of NVIDIA Streaming Sortformer：https://developer.nvidia.com/blog/identify-speakers-in-meetings-calls-and-voice-apps-in-real-time-with-nvidia-streaming-sortformer/. It turns 16 kHz audio into 10ms frames and emits a T×8 matrix of speaker-activity probabilities.","Two pieces of state carry a conversation across chunks: an arrival-order speaker cache (speaker_0 is the first voice heard, and stays that way) and a FIFO (“First In, First Out”) of recent frames, with no embeddings or clustering required for an unbounded audio length.","While prior diarization models require extensive configuration of several different parameters or lack support for multiple latency profiles entirely, the same Nemotron 3 Diarization checkpoint can serve each request at four algorithmic latencies between 0.32 and 30.4 seconds, referring to how much future audio the model sees before it commits a label. To accommodate diverse application requirements ranging from real-time agent interactions to offline media processing, Nemotron 3 Diarization supports flexible algorithmic latency settings within a single unified checkpoint.","Figure 1 illustrates how these latency profiles map directly to chunk sizes and right-context lookahead windows. Moving from the ultra-low profile to the standard low profile trades a modest increase in buffer delay for continuous quality gains. This predictability enables developers to configure buffer sizes dynamically per request without redeploying underlying model instances.","We report diarization error rate (DER) with overlap included and no collar. Nemotron 3 Diarization holds its accuracy as latency drops. Moving from the 30-second offline profile to the 0.32-second ultra-low profile increases DER by only 1-2 points compared to prerecorded, with quality sustained beyond four speakers. On AISHELL-4 at the “low” profile, we observed a DER of 9.8% against 27.2% for Streaming Sortformer v2.1, a significant improvement compared to this model’s predecessor.","To evaluate standard diarization accuracy across varied acoustic environments and speaker counts, we measured DER across benchmark datasets without applying a time collar.","The benchmarking results highlight consistent stability across multiple benchmark datasets in multiple languages, such as NOTSOFAR, AMI, CALLHOME, and AISHELL, outperforming Meta Muse Voice Transcribe on all datasets at even the ultra-low configuration and losing to pyannote community-1 only on AMI. Even under ultra-low latency configurations, the error rate remains within a tight margin of offline baselines, confirming robust speaker attribution under real-time constraints. Streaming diarization on Baseten remains close to prerecorded quality across the tested latency profiles.","Speaker-attributed time segments are only one way to use Nemotron 3 Diarization. At its core, the model tracks speech activity per speaker in 10ms increments. This raw data can be used by voice applications to support three key capabilities:","Voice activity detection : By combining data across all audio channels, it detects speech directly from the audio stream rather than relying on volume levels.","Speaker-specific end-of-turn detection : It tracks when a specific speaker stops talking for a set duration. This helps an AI voice agent distinguish between the primary user finishing a sentence and background chatter from someone else in the room.","Turn-taking and interruptions : The order in which voices appear identifies the primary speaker. If a second voice starts speaking, the model detects an interruption; if both speak at once, it flags overlapping speech, responding in roughly 300ms on ultra-low latency settings.","To streamline deployment across different audio infrastructure designs, Baseten exposes the model through three specialized serving presets. Figure 3 provides an architectural overview of these presets along with their target workloads and throughput characteristics.","These modular presets allow voice applications to choose between stateless batch requests, persistent WebSocket streams for live speaker tracking, or joint end-to-end transcription pipelines, matching backend infrastructure requirements directly.","Each latency level runs as its own ready-to-use instance, so you can easily choose your speed per request without redeploying. The real-time transcription option pairs the speaker tracker with NVIDIA's 600M English speech recognition model, NVIDIA Parakeet V2 ASR：https://huggingface.co/nvidia/parakeet-tdt-0.6b-v2, which is also in the Nemotron speech family. By using speaker activity to guide transcription on the same audio stream, it accurately captures both sides of a conversation, even when people talk over each other.","Combining speech recognition with diarization typically requires managing separate model pipelines and aligning transcripts post-hoc. Our real-time system directly conditions the ASR model on speaker activity features within the primary forward pass. By feeding per-speaker activity vectors directly into the initial encoder layers of Parakeet V2, the pipeline transcribes overlapped audio channels in a single pass, eliminating duplicate feature extraction steps and preserving temporal alignment between words and speakers.","Load came from k6 inside the cluster with a one-stream control on an idle replica in every run; every server frame is archived.","To establish reliable capacity limits for production infrastructure, we benchmarked total concurrent streaming capacity per GPU under continuous load tests. Figure 5 illustrates latency performance across varying concurrent stream counts on a single NVIDIA RTX PRO 6000.","The stress test results demonstrate flat latency scaling up to maximum hardware saturation points. By managing hardware resources strictly within predictable GPU utilization boundaries, system latency remains stable near single-stream baseline values until hard capacity limits are reached.","Using identical files and hardware, Baseten’s optimized serving preset delivered ~1.35x higher batch processing throughput than the NVIDIA reference setup used in our testing. Over an HTTP connection, a single GPU can continuously process 200 six-minute audio files every minute while maintaining steady response times.","For live transcription, the streaming and batch setups deliver virtually identical accuracy, successfully reconstructing speaker-tagged transcripts straight from the speech recognition model.","Nemotron 3 Diarization is available on Hugging Face：https://huggingface.co/nvidia/Nemotron-3-Diarization and in the Baseten Model Library：https://www.baseten.co/library/nemotron-3-diarization/ as batch, streaming, and real-time diarized transcription presets. Deploy one in a couple of clicks, pick a latency profile per request, and pair it with the ASR you already run — or talk to our engineers：https://www.baseten.co/talk-to-us/?model=nemotron-3-td-nemotron-asr about how we can optimize your voice workload.","Stay up to date on model performance, inference infrastructure, and more.","Dedicated Inference：/products/dedicated-inference/","Model Labs：/products/baseten-for-model-labs/","Model Runtimes：/platform/model-performance/","Infrastructure：/platform/cloud-native-infrastructure/","Multi-cloud：/products/multi-cloud-capacity-management/","Self-hosted：/deployments/baseten-self-hosted/","Hybrid：/deployments/baseten-hybrid/","Forward deployed engineers：/platform/embedded-engineering/","Transcription：/solutions/transcription/","Image Generation：/solutions/image-generation/","Text-to-speech：/solutions/text-to-speech/","Large language models：/solutions/llms/","Compound AI：/solutions/compound-ai/","Documentation：https://docs.baseten.co/","Savings calculator：/resources/calculator/","Trust Center：https://trust.baseten.co","Terms and Conditions：/terms-and-conditions/","Service Level Agreement：/service-level-agreement/","DeepSeek V4.1 Flash：/library/deepseek-v41-flash/","GLM-5.3-Flash：/library/glm-53-flash/"],"articleImages":[{"sourceUrl":"https://www.baseten.co/_next/image/?url=https%3A%2F%2Fwww.datocms-assets.com%2F104802%2F1790018010-nemotron-3-diarization-blog.png%3Fauto%3Dformat%26fit%3Dcrop%26h%3D630%26w%3D1200&w=3840&q=100","alt":"Nemotron 3 diarization","afterParagraph":0,"url":"/media/articles/cmue9sp3l0skgrogh2jez67og/4ad204de910a5c9c.avif"},{"sourceUrl":"https://www.baseten.co/_next/image/?url=https%3A%2F%2Fwww.datocms-assets.com%2F104802%2F1790115516-checkpoint_diagram.png%3Fauto%3Dformat%26w%3D1200&w=3840&q=75","alt":"Figure 1 — Latency profiles of a single checkpoint.","afterParagraph":6,"url":"/media/articles/cmue9sp3l0skgrogh2jez67og/94227c39ba1bc1ec.avif"},{"sourceUrl":"https://www.baseten.co/_next/image/?url=https%3A%2F%2Fwww.datocms-assets.com%2F104802%2F1790115618-error-rate_diagram.png%3Fauto%3Dformat%26w%3D1200&w=3840&q=75","alt":"Figure 2 — Diarization error rate by dataset and latency profile.","afterParagraph":9,"url":"/media/articles/cmue9sp3l0skgrogh2jez67og/b1ff1d6a3240247e.avif"},{"sourceUrl":"https://www.baseten.co/_next/image/?url=https%3A%2F%2Fwww.datocms-assets.com%2F104802%2F1790115680-three-ways_diagram.png%3Fauto%3Dformat%26w%3D1200&w=3840&q=75","alt":"Figure 3 — Three presets on Baseten.","afterParagraph":15,"url":"/media/articles/cmue9sp3l0skgrogh2jez67og/c66889b3bc5b5bea.avif"},{"sourceUrl":"https://www.baseten.co/_next/image/?url=https%3A%2F%2Fwww.datocms-assets.com%2F104802%2F1790115749-concurrent-streams_diagram.png%3Fauto%3Dformat%26w%3D1200&w=3840&q=75","alt":"Figure 4 — Concurrent hour-long real-time streams per RTX PRO 6000.","afterParagraph":20,"url":"/media/articles/cmue9sp3l0skgrogh2jez67og/276b6754dcbcad37.avif"},{"sourceUrl":"https://www.baseten.co/_next/image/?url=%2F_next%2Fstatic%2Fmedia%2Fsoc2-type2.660a008c.png&w=640&q=75","alt":"SOC 2 Type II Certified","afterParagraph":43,"url":"/media/articles/cmue9sp3l0skgrogh2jez67og/fb6c79c61bd4463a.avif"}],"mediaStatus":"ok","articleBodyZh":["NVIDIA Nemotron 3 说话人分解可以回答谁在什么时候说话，比实时延迟300毫秒到1秒，同时支持任何语音识别（ASR）。","使用 Baseten 模型库中的 NVIDIA Nemotron 3 说话人分解：https://www.baseten.co/library/nemotron-3-diarization/，提供预录音和流式分解以及实时分解转录的预设。这是一个开源的端到端说话人分解模型，可替代通常的分段加嵌入管道及其调优，采用单次处理即可标记最多八位说话人，间隔可配置，低至每 320 毫秒。","我们在 RTX PRO 6000 上对其进行了优化，该显卡可以维持超过 500 条同时进行的小时级分解流（添加转录后为 190 条）。每个说话人的活动信息可用于指导语音活动检测（VAD）、端点检测和语音代理的轮换控制。","说话人分解将音频流按不同说话人的讲话时间进行分段，输出每个不同声音的时间点，并为每个片段分配一致的说话人标签。结合转录，分解可以将转录的文字归因于对话中的具体说话人。","NVIDIA Nemotron 3 说话人分解模型拥有约 1 亿参数的基于 Transformer 的架构，构建在 NVIDIA Streaming Sortformer 之上：https://developer.nvidia.com/blog/identify-speakers-in-meetings-calls-and-voice-apps-in-real-time-with-nvidia-streaming-sortformer/。它将 16 kHz 音频转为 10 毫秒帧，并输出一个 T×8 的说话人活动概率矩阵。","有两条状态信息用于跨音频块维持对话：到达顺序说话人缓存（speaker_0 是第一个听到的声音，并保持不变）以及最近帧的 FIFO（“先进先出”），无需嵌入或聚类即可处理无限长度音频。","虽然以往的说话人分解模型需要对多个参数进行广泛配置，或者完全不支持多种延迟配置，但同一个 Nemotron 3 说话人分解检查点就可以在 0.32 秒到 30.4 秒之间的四种算法延迟下处理每个请求，这取决于模型在承认标签前能看到多少未来音频。为了满足从实时语音代理交互到离线媒体处理的多样化应用需求，Nemotron 3 说话人分解在单一统一检查点内支持灵活的算法延迟设置。","图1展示了这些延迟配置文件如何直接映射到块大小和右上下文前瞻窗口。从超低配置转向标准低配置，缓冲区延迟略有增加，但质量持续提升。这种可预测性使开发者能够动态配置每个请求的缓冲区大小，而无需重新部署底层模型实例。","我们报告了包含重叠且无颈圈的 diarization 错误率（DER）。Nemotron 3 Diarization 在延迟下降的情况下保持了准确性。从 30 秒离线档案切换到 0.32 秒超低档案，DER 仅比预录提升 1-2 点，且音质在四个扬声器之后依然保持。在 AISHELL-4 的“低”档案中，我们观察到 DER 为 9.8%，而 Streaming Sortformer v2.1 为 27.2%，相比该模型前代有显著提升。","为了评估不同声学环境和说话人数下的标准尿道准确率，我们在基准数据集中测量了DER，但未使用时间项圈。","基准测试结果显示，在多个语言的基准数据集（如NOTSOFAR、AMI、CALLHOME和AISHELL）中稳定性稳定，即使在超低配置下，在所有数据集上都优于Meta Muse Voice Transcribe，仅在AMI上输给pyannote community-1。即使在超低延迟配置下，错误率也保持在离线基线的紧密范围内，证实了在实时约束下说话者归属的稳健性。Baseten上的流式对话在测试延迟曲线中仍接近预录质量。","说话者归属的时间段只是使用Nemotron 3日晷化的一种方式。模型的核心是以10毫秒为单位追踪每个说话者的语音活动。这些原始数据可以被语音应用用来支持三个关键功能：","语音活动检测：通过合并所有音频通道的数据，它直接检测音频流中的语音，而非依赖音量水平。","特定发言者回合结束检测：它追踪特定发言者在限定时间内停止说话的时间。这帮助AI语音代理区分主要用户的句子结束和房间内其他人的背景杂谈。","轮流发言与打断：声音出现的顺序可以识别主要发言者。如果第二个声音开始说话，模型会检测到打断；如果两人同时说话，它会标记为重叠语音，在超低延迟设置下，大约300毫秒内响应。","为了简化在不同音频基础设施设计上的部署，Baseten 通过三种专用的服务预设来提供模型。图3提供了这些预设的架构概述以及它们的目标工作负载和吞吐量特性。","这些模块化的预设允许语音应用在无状态批量请求、用于实时发言者跟踪的持久 WebSocket 流，或联合端到端转录管道之间进行选择，直接匹配后端基础设施要求。","每个延迟级别都作为独立的即用实例运行，因此您可以轻松根据每次请求选择速度而无需重新部署。实时转录选项将发言者跟踪器与 NVIDIA 的 6 亿参数英语语音识别模型 NVIDIA Parakeet V2 ASR：https://huggingface.co/nvidia/parakeet-tdt-0.6b-v2 配对，该模型也属于 Nemotron 语音家族。通过使用发言者活动来指导同一音频流的转录，它能够准确捕捉对话双方的内容，即使有人交叉说话。","将语音识别与说话人分离结合通常需要管理单独的模型管道并在事后对齐转录文本。我们的实时系统直接在主前向传递中将 ASR 模型以发言者活动特征为条件。通过将每个发言者的活动向量直接输入 Parakeet V2 的初始编码层，管道可以在一次传递中转录重叠的音频通道，消除了重复的特征提取步骤，并保持单词与发言者之间的时间对齐。","负载来自集群内的 k6，在每次运行中对空闲副本进行单流控制；每个服务器帧都被存档。","为了建立生产基础设施的可靠容量限制，我们在持续负载测试下基准测试了每块 GPU 的总并发流容量。图5展示了单个 NVIDIA RTX PRO 6000 在不同并发流数量下的延迟性能。","压力测试结果显示延迟在最大硬件饱和点时仍呈平稳扩展。通过严格管理硬件资源在可预测的GPU利用边界内，系统延迟在接近单流基线值时保持稳定，直到达到硬容量限制。","使用相同的文件和硬件，Baseten 优化的服务预设比我们测试中使用的 NVIDIA 参考设置提供了约 1.35 倍更高的批处理吞吐量。在 HTTP 连接上，单个 GPU 每分钟可持续处理 200 个六分钟的音频文件，同时保持稳定的响应时间。","对于实时转录，流式和批量设置提供几乎相同的准确性，能够直接从语音识别模型成功重建带有说话者标签的转录文本。","Nemotron 3 分辨可在 Hugging Face 获取：https://huggingface.co/nvidia/Nemotron-3-Diarization，以及在 Baseten 模型库中获取：https://www.baseten.co/library/nemotron-3-diarization/，提供批量、流式和实时分辨转录预设。只需几次点击即可部署，按请求选择延迟配置，并与您已经运行的 ASR 配对——或者联系我们的工程师：https://www.baseten.co/talk-to-us/?model=nemotron-3-td-nemotron-asr 了解我们如何优化您的语音工作负载。","保持对模型性能、推理基础设施等的最新了解。","专用推理：/products/dedicated-inference/","Model Labs：/products/baseten-for-model-labs/","模型运行时：/platform/model-performance/","基础设施：/平台/云原生基础设施/","多云：/products/multi-cloud-capacity-management/","自宿主：/deployments/baseten-self-hosted/","混合：/deployments/baseten-hybrid/","前置部署工程师：/平台/嵌入式工程/","转录：/solutions/transcription/","图像生成：/解决方案/图像生成/","文本转语音：/solutions/text-to-speech/","大型语言模型：/solutions/llms/","复合人工智能：/solutions/compound-ai/","文档：https://docs.baseten.co/","储蓄计算器：/resources/calculator/","信任中心：https://trust.baseten.co","条款和条件：/terms-and-conditions/","服务等级协议：/service-level-agreement/","DeepSeek V4.1 闪存：/library/deepseek-v41-flash/","GLM-5.3-Flash：/library/glm-53-flash/"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"Aioga 编辑摘要：Baseten 推出 NVIDIA Nemotron 3 Diarization 说话人分离模型的托管服务，提供批处理、流式和实时说话人标注转录三种预设。 Aioga 将其归入「行业动态」方向，重点关注它对真实使用和行业竞争的影响。","background":"背景分析：公司与行业类动态需要放在竞争格局、商业化路径、资本信号和监管环境中观察，单条公告不能代表最终结果。","viewpoint":"Aioga 判断：这条动态更适合作为行业观察信号，当前信息足以建立线索，但不足以推导长期结论。","implications":"影响分析：对相关团队而言，短期应先核对来源、可用范围和实际成本，再判断是否值得接入或跟进。","nextStep":"后续观察：继续观察官方文件、合作落地、收入或用户信号、竞品动作和监管后续。","evidenceRefs":["title","summary","articleBody"],"confidence":"medium","status":"published","aiGenerated":false,"autoApproved":true,"generatedBy":"rule-safe-fallback","generatedAt":"2026-09-28T06:19:15.375Z","sourceHash":"87dc31727521deb1","validation":{"passed":true,"mode":"rule-safe-fallback","checks":["schema","length","source-attribution","no-html"]}},"tags":["行业动态","Baseten 工程博客（网页）"],"translations":{"zh-CN":{"title":"NVIDIA Nemotron 3 Diarization 上线 Baseten，单个 checkpoint 支持四档延迟配置","summary":"Baseten 推出 NVIDIA Nemotron 3 Diarization 说话人分离模型的托管服务，提供批处理、流式和实时说话人标注转录三种预设。","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization 上线 Baseten，单个 checkpoint 支持四档延迟配置 - Aioga AI资讯","description":"Baseten 推出 NVIDIA Nemotron 3 Diarization 说话人分离模型的托管服务，提供批处理、流式和实时说话人标注转录三种预设。","url":"https://www.aioga.com/news/cmue9sp3l0skgrogh2jez67og/","articleBody":["NVIDIA Nemotron 3 说话人分解可以回答谁在什么时候说话，比实时延迟300毫秒到1秒，同时支持任何语音识别（ASR）。","使用 Baseten 模型库中的 NVIDIA Nemotron 3 说话人分解：https://www.baseten.co/library/nemotron-3-diarization/，提供预录音和流式分解以及实时分解转录的预设。这是一个开源的端到端说话人分解模型，可替代通常的分段加嵌入管道及其调优，采用单次处理即可标记最多八位说话人，间隔可配置，低至每 320 毫秒。","我们在 RTX PRO 6000 上对其进行了优化，该显卡可以维持超过 500 条同时进行的小时级分解流（添加转录后为 190 条）。每个说话人的活动信息可用于指导语音活动检测（VAD）、端点检测和语音代理的轮换控制。","说话人分解将音频流按不同说话人的讲话时间进行分段，输出每个不同声音的时间点，并为每个片段分配一致的说话人标签。结合转录，分解可以将转录的文字归因于对话中的具体说话人。","NVIDIA Nemotron 3 说话人分解模型拥有约 1 亿参数的基于 Transformer 的架构，构建在 NVIDIA Streaming Sortformer 之上：https://developer.nvidia.com/blog/identify-speakers-in-meetings-calls-and-voice-apps-in-real-time-with-nvidia-streaming-sortformer/。它将 16 kHz 音频转为 10 毫秒帧，并输出一个 T×8 的说话人活动概率矩阵。","有两条状态信息用于跨音频块维持对话：到达顺序说话人缓存（speaker_0 是第一个听到的声音，并保持不变）以及最近帧的 FIFO（“先进先出”），无需嵌入或聚类即可处理无限长度音频。","虽然以往的说话人分解模型需要对多个参数进行广泛配置，或者完全不支持多种延迟配置，但同一个 Nemotron 3 说话人分解检查点就可以在 0.32 秒到 30.4 秒之间的四种算法延迟下处理每个请求，这取决于模型在承认标签前能看到多少未来音频。为了满足从实时语音代理交互到离线媒体处理的多样化应用需求，Nemotron 3 说话人分解在单一统一检查点内支持灵活的算法延迟设置。","图1展示了这些延迟配置文件如何直接映射到块大小和右上下文前瞻窗口。从超低配置转向标准低配置，缓冲区延迟略有增加，但质量持续提升。这种可预测性使开发者能够动态配置每个请求的缓冲区大小，而无需重新部署底层模型实例。","我们报告了包含重叠且无颈圈的 diarization 错误率（DER）。Nemotron 3 Diarization 在延迟下降的情况下保持了准确性。从 30 秒离线档案切换到 0.32 秒超低档案，DER 仅比预录提升 1-2 点，且音质在四个扬声器之后依然保持。在 AISHELL-4 的“低”档案中，我们观察到 DER 为 9.8%，而 Streaming Sortformer v2.1 为 27.2%，相比该模型前代有显著提升。","为了评估不同声学环境和说话人数下的标准尿道准确率，我们在基准数据集中测量了DER，但未使用时间项圈。","基准测试结果显示，在多个语言的基准数据集（如NOTSOFAR、AMI、CALLHOME和AISHELL）中稳定性稳定，即使在超低配置下，在所有数据集上都优于Meta Muse Voice Transcribe，仅在AMI上输给pyannote community-1。即使在超低延迟配置下，错误率也保持在离线基线的紧密范围内，证实了在实时约束下说话者归属的稳健性。Baseten上的流式对话在测试延迟曲线中仍接近预录质量。","说话者归属的时间段只是使用Nemotron 3日晷化的一种方式。模型的核心是以10毫秒为单位追踪每个说话者的语音活动。这些原始数据可以被语音应用用来支持三个关键功能：","语音活动检测：通过合并所有音频通道的数据，它直接检测音频流中的语音，而非依赖音量水平。","特定发言者回合结束检测：它追踪特定发言者在限定时间内停止说话的时间。这帮助AI语音代理区分主要用户的句子结束和房间内其他人的背景杂谈。","轮流发言与打断：声音出现的顺序可以识别主要发言者。如果第二个声音开始说话，模型会检测到打断；如果两人同时说话，它会标记为重叠语音，在超低延迟设置下，大约300毫秒内响应。","为了简化在不同音频基础设施设计上的部署，Baseten 通过三种专用的服务预设来提供模型。图3提供了这些预设的架构概述以及它们的目标工作负载和吞吐量特性。","这些模块化的预设允许语音应用在无状态批量请求、用于实时发言者跟踪的持久 WebSocket 流，或联合端到端转录管道之间进行选择，直接匹配后端基础设施要求。","每个延迟级别都作为独立的即用实例运行，因此您可以轻松根据每次请求选择速度而无需重新部署。实时转录选项将发言者跟踪器与 NVIDIA 的 6 亿参数英语语音识别模型 NVIDIA Parakeet V2 ASR：https://huggingface.co/nvidia/parakeet-tdt-0.6b-v2 配对，该模型也属于 Nemotron 语音家族。通过使用发言者活动来指导同一音频流的转录，它能够准确捕捉对话双方的内容，即使有人交叉说话。","将语音识别与说话人分离结合通常需要管理单独的模型管道并在事后对齐转录文本。我们的实时系统直接在主前向传递中将 ASR 模型以发言者活动特征为条件。通过将每个发言者的活动向量直接输入 Parakeet V2 的初始编码层，管道可以在一次传递中转录重叠的音频通道，消除了重复的特征提取步骤，并保持单词与发言者之间的时间对齐。","负载来自集群内的 k6，在每次运行中对空闲副本进行单流控制；每个服务器帧都被存档。","为了建立生产基础设施的可靠容量限制，我们在持续负载测试下基准测试了每块 GPU 的总并发流容量。图5展示了单个 NVIDIA RTX PRO 6000 在不同并发流数量下的延迟性能。","压力测试结果显示延迟在最大硬件饱和点时仍呈平稳扩展。通过严格管理硬件资源在可预测的GPU利用边界内，系统延迟在接近单流基线值时保持稳定，直到达到硬容量限制。","使用相同的文件和硬件，Baseten 优化的服务预设比我们测试中使用的 NVIDIA 参考设置提供了约 1.35 倍更高的批处理吞吐量。在 HTTP 连接上，单个 GPU 每分钟可持续处理 200 个六分钟的音频文件，同时保持稳定的响应时间。","对于实时转录，流式和批量设置提供几乎相同的准确性，能够直接从语音识别模型成功重建带有说话者标签的转录文本。","Nemotron 3 分辨可在 Hugging Face 获取：https://huggingface.co/nvidia/Nemotron-3-Diarization，以及在 Baseten 模型库中获取：https://www.baseten.co/library/nemotron-3-diarization/，提供批量、流式和实时分辨转录预设。只需几次点击即可部署，按请求选择延迟配置，并与您已经运行的 ASR 配对——或者联系我们的工程师：https://www.baseten.co/talk-to-us/?model=nemotron-3-td-nemotron-asr 了解我们如何优化您的语音工作负载。","保持对模型性能、推理基础设施等的最新了解。","专用推理：/products/dedicated-inference/","Model Labs：/products/baseten-for-model-labs/","模型运行时：/platform/model-performance/","基础设施：/平台/云原生基础设施/","多云：/products/multi-cloud-capacity-management/","自宿主：/deployments/baseten-self-hosted/","混合：/deployments/baseten-hybrid/","前置部署工程师：/平台/嵌入式工程/","转录：/solutions/transcription/","图像生成：/解决方案/图像生成/","文本转语音：/solutions/text-to-speech/","大型语言模型：/solutions/llms/","复合人工智能：/solutions/compound-ai/","文档：https://docs.baseten.co/","储蓄计算器：/resources/calculator/","信任中心：https://trust.baseten.co","条款和条件：/terms-and-conditions/","服务等级协议：/service-level-agreement/","DeepSeek V4.1 闪存：/library/deepseek-v41-flash/","GLM-5.3-Flash：/library/glm-53-flash/"]},"en":{"title":"NVIDIA Nemotron 3 Diarization launched on Baseten, single checkpoint supports four levels of latency configuration","summary":"Baseten launched a hosted service for the NVIDIA Nemotron 3 Diarization speaker separation model, offering three presets: batch, streaming, and real-time speaker-labeled transcription.","category":"Industry","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization launched on Baseten, single checkpoint supports four levels of latency configuration - Aioga AI News","description":"Baseten launched a hosted service for the NVIDIA Nemotron 3 Diarization speaker separation model, offering three presets: batch, streaming, and real-time speaker-labeled transcript...","url":"https://www.aioga.com/en/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:10:24.177Z"},"ja":{"title":"NVIDIA Nemotron 3 Diarization が Baseten に登場、単一のチェックポイントで四段階の遅延設定をサポート","summary":"BasetenはNVIDIA Nemotron 3 Diarizationの話者分離モデルのホスティングサービスを開始し、バッチ処理、ストリーミング、リアルタイム話者ラベル付き転写の3つのプリセットを提供します。","category":"業界動向","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization が Baseten に登場、単一のチェックポイントで四段階の遅延設定をサポート - Aioga AIニュース","description":"BasetenはNVIDIA Nemotron 3 Diarizationの話者分離モデルのホスティングサービスを開始し、バッチ処理、ストリーミング、リアルタイム話者ラベル付き転写の3つのプリセットを提供します。","url":"https://www.aioga.com/ja/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:10:37.116Z"},"ko":{"title":"NVIDIA Nemotron 3 Diarization Baseten에 출시, 단일 체크포인트로 네 가지 지연 설정 지원","summary":"Baseten은 NVIDIA Nemotron 3 화자 분리 모델의 호스팅 서비스를 출시했으며, 배치 처리, 스트리밍 및 실시간 화자 라벨링 전사 세 가지 프리셋을 제공합니다.","category":"업계 동향","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization Baseten에 출시, 단일 체크포인트로 네 가지 지연 설정 지원 - Aioga AI 뉴스","description":"Baseten은 NVIDIA Nemotron 3 화자 분리 모델의 호스팅 서비스를 출시했으며, 배치 처리, 스트리밍 및 실시간 화자 라벨링 전사 세 가지 프리셋을 제공합니다.","url":"https://www.aioga.com/ko/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:11:22.468Z"},"es":{"title":"NVIDIA Nemotron 3 Diarization se lanza en Baseten, un solo punto de control admite cuatro configuraciones de retraso","summary":"Baseten lanzó el servicio gestionado del modelo de separación de hablantes NVIDIA Nemotron 3 Diarization, ofreciendo tres configuraciones preestablecidas: procesamiento por lotes, transmisión y transcripción con etiquetado de hablantes en tiempo real.","category":"Industria","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization se lanza en Baseten, un solo punto de control admite cuatro configuraciones de retraso - Aioga Noticias de IA","description":"Baseten lanzó el servicio gestionado del modelo de separación de hablantes NVIDIA Nemotron 3 Diarization, ofreciendo tres configuraciones preestablecidas: procesamiento por lotes,...","url":"https://www.aioga.com/es/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:11:18.814Z"},"fr":{"title":"NVIDIA Nemotron 3 Diarization est lancé sur Baseten, un seul point de contrôle prend en charge quatre configurations de latence","summary":"Baseten a lancé un service hébergé du modèle de séparation de locuteurs NVIDIA Nemotron 3 Diarization, offrant trois préréglages : transcription avec annotation des locuteurs par lot, en flux et en temps réel.","category":"Industrie","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization est lancé sur Baseten, un seul point de contrôle prend en charge quatre configurations de latence - Aioga Actualités IA","description":"Baseten a lancé un service hébergé du modèle de séparation de locuteurs NVIDIA Nemotron 3 Diarization, offrant trois préréglages : transcription avec annotation des locuteurs par l...","url":"https://www.aioga.com/fr/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:12:05.869Z"},"de":{"title":"NVIDIA Nemotron 3 Diarization ist auf Baseten verfügbar, ein einzelner Checkpoint unterstützt vier Stufen der Latenzkonfiguration","summary":"Baseten hat den gehosteten Dienst für das NVIDIA Nemotron 3 Diarization Sprechertrennungsmodell eingeführt, der drei Voreinstellungen bietet: Batch-, Streaming- und Echtzeit-Sprecherkennungs-Transkription.","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization ist auf Baseten verfügbar, ein einzelner Checkpoint unterstützt vier Stufen der Latenzkonfiguration - Aioga KI-News","description":"Baseten hat den gehosteten Dienst für das NVIDIA Nemotron 3 Diarization Sprechertrennungsmodell eingeführt, der drei Voreinstellungen bietet: Batch-, Streaming- und Echtzeit-Sprech...","url":"https://www.aioga.com/de/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:12:11.959Z"},"pt-BR":{"title":"NVIDIA Nemotron 3 Diarization lançado no Baseten, um único checkpoint suporta quatro configurações de latência","summary":"Baseten lançou o serviço hospedado do modelo de separação de alto-falantes NVIDIA Nemotron 3 Diarization, oferecendo três predefinições: transcrição por lotes, streaming e anotação de alto-falantes em tempo real.","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization lançado no Baseten, um único checkpoint suporta quatro configurações de latência - Aioga Notícias de IA","description":"Baseten lançou o serviço hospedado do modelo de separação de alto-falantes NVIDIA Nemotron 3 Diarization, oferecendo três predefinições: transcrição por lotes, streaming e anotação...","url":"https://www.aioga.com/pt-BR/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:12:58.570Z"},"ru":{"title":"NVIDIA Nemotron 3 Diarization запущен на Baseten, один checkpoint поддерживает четыре уровня конфигурации задержки","summary":"Baseten запустила управляемый сервис модели разделения говорящих NVIDIA Nemotron 3 Diarization, предлагающий три предустановки: пакетная обработка, потоковая обработка и транскрипция с пометкой говорящих в реальном времени.","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization запущен на Baseten, один checkpoint поддерживает четыре уровня конфигурации задержки - Aioga Новости ИИ","description":"Baseten запустила управляемый сервис модели разделения говорящих NVIDIA Nemotron 3 Diarization, предлагающий три предустановки: пакетная обработка, потоковая обработка и транскрипц...","url":"https://www.aioga.com/ru/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:12:55.015Z"},"ar":{"title":"تم إطلاق NVIDIA Nemotron 3 Diarization على Baseten، ويدعم كل نقطة تحقق أربعة إعدادات تأخير","summary":"أطلقت Baseten خدمة استضافة نموذج فصل المتحدثين NVIDIA Nemotron 3 Diarization، وتقدم ثلاث إعدادات مسبقة: المعالجة الدفعية، والبث، والتحويل النصي مع وسم المتحدث في الوقت الفعلي.","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"تم إطلاق NVIDIA Nemotron 3 Diarization على Baseten، ويدعم كل نقطة تحقق أربعة إعدادات تأخير - Aioga أخبار الذكاء الاصطناعي","description":"أطلقت Baseten خدمة استضافة نموذج فصل المتحدثين NVIDIA Nemotron 3 Diarization، وتقدم ثلاث إعدادات مسبقة: المعالجة الدفعية، والبث، والتحويل النصي مع وسم المتحدث في الوقت الفعلي.","url":"https://www.aioga.com/ar/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:13:40.594Z"},"hi":{"title":"NVIDIA Nemotron 3 Diarization Baseten पर上线, एकल checkpoint चार स्तर की विलंबता कॉन्फ़िगरेशन का समर्थन करता है","summary":"Baseten ने NVIDIA Nemotron 3 Diarization स्पीकर सेपरेशन मॉडल की होस्टेड सेवा लॉन्च की, जो बैच प्रोसेसिंग, स्ट्रीमिंग और रियल-टाइम स्पीकर एनोटेशन ट्रांसक्रिप्शन के तीन प्रीसेट प्रदान करती है।","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization Baseten पर上线, एकल checkpoint चार स्तर की विलंबता कॉन्फ़िगरेशन का समर्थन करता है - Aioga AI समाचार","description":"Baseten ने NVIDIA Nemotron 3 Diarization स्पीकर सेपरेशन मॉडल की होस्टेड सेवा लॉन्च की, जो बैच प्रोसेसिंग, स्ट्रीमिंग और रियल-टाइम स्पीकर एनोटेशन ट्रांसक्रिप्शन के तीन प्रीसेट प्रदा...","url":"https://www.aioga.com/hi/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:13:44.797Z"},"it":{"title":"NVIDIA Nemotron 3 Diarization disponibile su Baseten, singolo checkpoint supporta quattro livelli di configurazione della latenza","summary":"Baseten ha lanciato il servizio gestito del modello di separazione dei parlanti NVIDIA Nemotron 3 Diarization, offrendo tre preset: trascrizione con annotazione dei parlanti in batch, in streaming e in tempo reale.","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization disponibile su Baseten, singolo checkpoint supporta quattro livelli di configurazione della latenza - Aioga Notizie IA","description":"Baseten ha lanciato il servizio gestito del modello di separazione dei parlanti NVIDIA Nemotron 3 Diarization, offrendo tre preset: trascrizione con annotazione dei parlanti in bat...","url":"https://www.aioga.com/it/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:14:27.505Z"},"nl":{"title":"NVIDIA Nemotron 3 Diarization gelanceerd op Baseten, enkele checkpoint ondersteunt vier niveaus van vertraging configuratie","summary":"Baseten lanceert de beheerde service voor het NVIDIA Nemotron 3 Diarization sprekersscheidingsmodel, met drie vooraf ingestelde opties: batchverwerking, streaming en realtime sprekergeannoteerde transcriptie.","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization gelanceerd op Baseten, enkele checkpoint ondersteunt vier niveaus van vertraging configuratie - Aioga AI-nieuws","description":"Baseten lanceert de beheerde service voor het NVIDIA Nemotron 3 Diarization sprekersscheidingsmodel, met drie vooraf ingestelde opties: batchverwerking, streaming en realtime sprek...","url":"https://www.aioga.com/nl/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:14:25.328Z"},"tr":{"title":"NVIDIA Nemotron 3 Diarization Baseten'de kullanıma sunuldu, tek bir kontrol noktası dört seviye gecikme yapılandırmasını destekliyor","summary":"Baseten, NVIDIA Nemotron 3 Konuşmacı Ayrıştırma Modeli için yönetilen bir hizmet başlattı; toplu işleme, akış ve gerçek zamanlı konuşmacı etiketli transkripsiyon olmak üzere üç ön ayar sunuyor.","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization Baseten'de kullanıma sunuldu, tek bir kontrol noktası dört seviye gecikme yapılandırmasını destekliyor - Aioga AI Haberleri","description":"Baseten, NVIDIA Nemotron 3 Konuşmacı Ayrıştırma Modeli için yönetilen bir hizmet başlattı; toplu işleme, akış ve gerçek zamanlı konuşmacı etiketli transkripsiyon olmak üzere üç ön...","url":"https://www.aioga.com/tr/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:15:11.143Z"},"vi":{"title":"NVIDIA Nemotron 3 Diarization đã được đưa lên Baseten, mỗi checkpoint hỗ trợ bốn mức cấu hình độ trễ","summary":"Baseten ra mắt dịch vụ được quản lý cho mô hình phân tách người nói NVIDIA Nemotron 3 Diarization, cung cấp ba thiết lập sẵn bao gồm xử lý theo lô, phát trực tuyến và phiên âm đánh dấu người nói theo thời gian thực.","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization đã được đưa lên Baseten, mỗi checkpoint hỗ trợ bốn mức cấu hình độ trễ - Tin tức AI Aioga","description":"Baseten ra mắt dịch vụ được quản lý cho mô hình phân tách người nói NVIDIA Nemotron 3 Diarization, cung cấp ba thiết lập sẵn bao gồm xử lý theo lô, phát trực tuyến và phiên âm đánh...","url":"https://www.aioga.com/vi/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:15:09.100Z"},"id":{"title":"NVIDIA Nemotron 3 Diarization diluncurkan di Baseten, satu checkpoint mendukung empat tingkat konfigurasi latensi","summary":"Baseten meluncurkan layanan hosting model pemisahan pembicara NVIDIA Nemotron 3 Diarization, menawarkan tiga preset: batch, streaming, dan transkripsi penandaan pembicara real-time.","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization diluncurkan di Baseten, satu checkpoint mendukung empat tingkat konfigurasi latensi - Berita AI Aioga","description":"Baseten meluncurkan layanan hosting model pemisahan pembicara NVIDIA Nemotron 3 Diarization, menawarkan tiga preset: batch, streaming, dan transkripsi penandaan pembicara real-time...","url":"https://www.aioga.com/id/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:15:51.805Z"},"th":{"title":"NVIDIA Nemotron 3 การแยกเสียงสนทนา เปิดให้ใช้งานบน Baseten, จุดตรวจสอบเดียวรองรับการตั้งค่าความหน่วงสี่ระดับ","summary":"Baseten เปิดตัวบริการโฮสต์สำหรับโมเดลแยกผู้พูด NVIDIA Nemotron 3 Diarization โดยมีการตั้งค่าล่วงหน้าสำหรับการประมวลผลแบบเป็นชุด แบบสตรีม และการถอดเสียงพร้อมระบุผู้พูดแบบเรียลไทม์","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 การแยกเสียงสนทนา เปิดให้ใช้งานบน Baseten, จุดตรวจสอบเดียวรองรับการตั้งค่าความหน่วงสี่ระดับ - ข่าว AI Aioga","description":"Baseten เปิดตัวบริการโฮสต์สำหรับโมเดลแยกผู้พูด NVIDIA Nemotron 3 Diarization โดยมีการตั้งค่าล่วงหน้าสำหรับการประมวลผลแบบเป็นชุด แบบสตรีม และการถอดเสียงพร้อมระบุผู้พูดแบบเรียลไทม์","url":"https://www.aioga.com/th/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:15:59.767Z"},"pl":{"title":"NVIDIA Nemotron 3 Diarization uruchomiono na Baseten, pojedynczy punkt kontrolny obsługuje cztery poziomy konfiguracji opóźnień","summary":"Baseten wprowadza zarządzaną usługę modelu rozdzielania mówców NVIDIA Nemotron 3 Diarization, oferując trzy ustawienia wstępne: przetwarzanie wsadowe, strumieniowe i transkrypcję z oznaczaniem mówców w czasie rzeczywistym.","category":"行业动态","source":"Baseten 工程博客（网页）","aggregationSource":"Baseten 工程博客（网页）","pageTitle":"NVIDIA Nemotron 3 Diarization uruchomiono na Baseten, pojedynczy punkt kontrolny obsługuje cztery poziomy konfiguracji opóźnień - Aioga Wiadomości AI","description":"Baseten wprowadza zarządzaną usługę modelu rozdzielania mówców NVIDIA Nemotron 3 Diarization, oferując trzy ustawienia wstępne: przetwarzanie wsadowe, strumieniowe i transkrypcję z...","url":"https://www.aioga.com/pl/news/cmue9sp3l0skgrogh2jez67og/","contentTranslated":true,"sourceHash":"eb439c512a22c4eb","translatedAt":"2026-09-23T16:16:44.951Z"}},"evidenceTier":"verified-news","reviewStatus":"automated-ingest","indexable":true,"editorialCover":""}}