Aioga
AI资讯 / 行业动态
返回 AI资讯

Gemini 3.5 Transcribe 发布:更精准的实时语音转写模型

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-08-27T23:01:35.558Z热度 73

Google 推出 Gemini 3.5 Transcribe,其最精准的语音转文本模型,支持实时流式与预录音频处理,可通过 Live API 和 Interactions A...

技巧观点Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Google 推出 Gemini 3.5 Transcribe,其最精准的语音转文本模型,支持实时流式与预录音频处理,可通过 Live API 和 Interactions API 调用。

🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtc5i81401mlroosz6bsplf6

中文正文 · AI 翻译

今天,我们推出了 Gemini 3.5 Transcribe,这是我们迄今为止最精确的语音转文字模型,专为智能语音互动而设计。与在背景噪音、复杂术语和语音不流畅清理方面表现不佳的传统语音识别模型不同,Gemini 3.5 Transcribe 可以将原始音频直接转换为准确、精炼且格式化的文本。

在我们的产品中,例如 Gemini 应用程序和 Android 平台,我们已经看到消费者从这个转录模型中受益,体验到新的语音功能,例如 Android 上的 Rambler:https://blog.google/products-and-platforms/platforms/android/gemini-intelligence/ 以及 macOS 上的 Gemini 应用程序。现在,开发者可以在 Google AI Studio 的 Gemini API(https://aistudio.google.com/live?model=gemini-3.5-transcribe-live)和 Gemini 企业代理平台(https://console.cloud.google.com/agent-platform/studio/multimodal-live?model=gemini-3.5-transcribe-live-preview)中使用 Gemini 3.5 Transcribe 构建类似功能。

我们构建 3.5 Transcribe 以无缝融入开发者工作流程,无论您是在构建语音代理、实时字幕工具还是通话后分析管道。该模型可通过两个独立的 API 使用:

Gemini 3.5 Transcribe 旨在捕捉您自然的说话风格,更好地理解您的意图并识别自定义词汇,从而让您可以通过语音执行任务。

Gemini 3.5 Transcribe 处理实时语言切换和无缝流式转录。

观看 Gemini 3.5 Transcribe 使用智能转录功能清理语音不流畅的表现。

3.5 Transcribe 提供多说话人标注和逐词时间戳的转录。

Gemini 3.5 Transcribe 的性能相比我们之前的转录模型 Chirp 3 有重大进步,提供了新的功能、改进的词错误率和显著更低的延迟。根据 Artificial Analysis 的测量,例如最终转录时间提高了 70%。在 FLEURS 基准测试中,涵盖一系列主要语言和地区,该模型提供了精确的多语言性能,相比 Chirp 3 有所提高,在流式模式下实现 5.50% 的词错误率,在非流式使用场景下实现 5.04% 的词错误率。

除了Google AI Studio和Gemini企业代理平台中的Gemini API外,3.5 转录比标准的语音转文字功能更进一步,让在Google生态中工作感觉更加自然和直观。通过将上下文感知理解直接引入Gboard、Antigravity、Gemini应用和Chrome等日常界面,它可以轻松捕捉细微差别、意图和内联编辑。

Gemini 3.5 转录让您只用语音就可以在macOS上的Gemini应用中分析文件、生成图像和进行搜索。

看看Gemini 3.5 转录如何在Android上的Rambler自动删除填充词并清理语音。

Gemini 3.5 转录利用Google Antigravity的屏幕上下文来确保准确的转录。

通过利用Gemini Live API,开发者平台如Agora:https://docs.agora.io/en/ai/models/asr/gemini, Fishjam:https://docs.fishjam.io/tutorials/gemini-live-integration, LangChain:https://docs.langchain.com/langsmith/trace-gemini-live, LiveKit:https://docs.livekit.io/agents/models/stt/gemini/, Pipecat:https://docs.pipecat.ai/api-reference/server/services/stt/google, Vercel:https://vercel.com/docs/ai-gateway/modalities/speech-to-text, 以及Vision Agents:https://visionagents.ai/integrations/stt/gemini 能够轻松帮助开发者构建和部署高性能的语音驱动界面。这些平台在后台管理复杂的实时媒体流基础设施,使开发者能够专注于设计用户体验。

像vivo、Intellitek Health和Lingopal等公司也对3.5 转录分享了积极的反馈,强调了其令人印象深刻的延迟、准确性和广泛的语言支持。

检查您的收件箱以确认您的订阅。

情报判断

Aioga 编辑摘要

Google 推出 Gemini 3.5 Transcribe,定位为其目前最精准的语音转文本模型,支持实时流式与预录音频处理,并可通过 Live API 和 Interactions API 调用。

背景分析

该模型面向智能语音交互,官方称其可处理背景噪声、专业术语和口语不流畅,并输出整理后的格式化文本。材料还提到多说话人归属、逐词时间戳及实时语言切换能力。

Aioga 观点

Aioga 判断,Gemini 3.5 Transcribe 的重点不只是识别语音,而是将转写与意图理解、词汇适配及语音代理工作流结合。其价值仍需结合具体场景和实际调用表现评估。

影响与后续

官方材料称,该模型较 Chirp 3 改善了词错误率和延迟;Artificial Analysis 测得最终转写时间提升 70%,FLEURS 基准流式 WER 为 5.50%、非流式为 5.04%。这些数据可能增强其在实时字幕、语音代理和通话分析中的吸引力。 开发者可关注 Live API 与 Interactions API 的实际可用范围,并在目标语言、噪声环境、专业词汇、多说话人和实时延迟等维度进行独立测试,再判断是否适合接入现有语音产品或分析流程。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: blog.google

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-27T23:01:35.558Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Google 推出 Gemini 3.5 Transcribe,其最精准的语音转文本模型,支持实时流式与预录音频处理,可通过 Live API 和 Interactions A...

Hacker News 热门(buzzing.cc 中文翻译)2026-08-27T23:01:35.558Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。