Aioga
AI资讯 / 行业动态
返回 AI资讯

Gemini 3.5 Transcribe 发布:面向实时语音交互的高精度语音转文本模型

Google DeepMind:Blog(RSS)Aioga 编辑团队2026-08-26T17:01:00.000Z热度 72

Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型,支持流式与非流式两种 API。据 Artificial Analysis 评测...

行业动态Google DeepMind:Blog(RSS)

今日 AI 情报摘要

Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型,支持流式与非流式两种 API。

据 Artificial Analysis 评测,其流式与非流式平均词错率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词汇及最多三人说话人识别。

中文正文 · AI 翻译

今天,我们推出了 Gemini 3.5 Transcribe,这是我们迄今为止最精确的语音转文字模型,专为智能语音互动而设计。与在背景噪音、复杂术语和语音不流畅清理方面表现不佳的传统语音识别模型不同,Gemini 3.5 Transcribe 可以将原始音频直接转换为准确、精炼且格式化的文本。

在我们的产品中,例如 Gemini 应用程序和 Android 平台,我们已经看到消费者从这个转录模型中受益,体验到新的语音功能,例如 Android 上的 Rambler:https://blog.google/products-and-platforms/platforms/android/gemini-intelligence/ 以及 macOS 上的 Gemini 应用程序。现在,开发者可以在 Google AI Studio 的 Gemini API(https://aistudio.google.com/live?model=gemini-3.5-transcribe-live)和 Gemini 企业代理平台(https://console.cloud.google.com/agent-platform/studio/multimodal-live?model=gemini-3.5-transcribe-live-preview)中使用 Gemini 3.5 Transcribe 构建类似功能。

我们构建 3.5 Transcribe 以无缝融入开发者工作流程,无论您是在构建语音代理、实时字幕工具还是通话后分析管道。该模型可通过两个独立的 API 使用:

Gemini 3.5 Transcribe 旨在捕捉您的自然说话风格,更好地理解您的意图并识别自定义词汇,从而使您能够通过语音执行任务。

Gemini 3.5 Transcribe 支持实时语言切换和无缝流式转录。

观看 Gemini 3.5 Transcribe 利用智能转录功能清理语音不流畅的表现。

3.5 Transcribe 提供多说话人标注和逐词时间戳的转录。

Gemini 3.5 Transcribe 的性能相比我们之前的转录模型 Chirp 3 有重大进步,提供了新的功能、改进的词错误率和显著更低的延迟。例如,根据 Artificial Analysis 的测量,最终转录时间提高了 70%。在 FLEURS 基准测试中,涵盖多种主要语言和地区,该模型提供了精确的多语言性能,相比 Chirp 3 有所提高,在流式模式下实现 5.50% 的词错误率(WER),非流式使用场景下实现 5.04% 的词错误率(WER)。

除了Google AI Studio和Gemini企业代理平台中的Gemini API外,3.5 转录比标准的语音转文字功能更进一步,让在Google生态中工作感觉更加自然和直观。通过将上下文感知理解直接引入Gboard、Antigravity、Gemini应用和Chrome等日常界面,它可以轻松捕捉细微差别、意图和内联编辑。

Gemini 3.5 转录让您只用语音就可以在macOS上的Gemini应用中分析文件、生成图像和进行搜索。

看看Gemini 3.5 转录如何在Android上的Rambler中自动删除填充词并清理语音。

Gemini 3.5 转录利用Google Antigravity上的屏幕上下文来确保转录的准确性。

通过利用 Gemini Live API,开发者平台如 Agora:https://docs.agora.io/en/ai/models/asr/gemini、Fishjam:https://docs.fishjam.io/tutorials/gemini-live-integration、LangChain:https://docs.langchain.com/langsmith/trace-gemini-live、LiveKit:https://docs.livekit.io/agents/models/stt/gemini/、Pipecat:https://docs.pipecat.ai/api-reference/server/services/stt/google、Vercel:https://vercel.com/docs/ai-gateway/modalities/speech-to-text 以及 Vision Agents:https://visionagents.ai/integrations/stt/gemini,使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在后台管理复杂的实时媒体流基础设施,使开发者可以完全专注于打造用户体验。

Vivo、Intellitek Health和Lingopal等公司也分享了对3.5 转录的积极反馈,强调其令人印象深刻的延迟、准确性及广泛的语言支持。

检查您的收件箱以确认订阅。

情报判断

Aioga 编辑摘要

Google DeepMind 发布 Gemini 3.5 Transcribe,面向实时语音交互,提供流式与非流式 API。材料称其支持超过 85 种语言、自定义词汇及最多三人说话人识别。

背景分析

该模型可将原始音频转为整理后的文本,并支持语音停顿清理、语言切换、说话人归属和逐词时间戳。开发者可通过 Gemini API 或 Gemini Enterprise Agent Platform 使用。

Aioga 观点

Aioga 判断,Gemini 3.5 Transcribe 的重点不只是语音识别准确率,还包括自然表达处理、实时流式转写和开发流程接入,可能扩大语音代理与字幕工具的应用空间。

影响与后续

材料显示,该模型可用于语音代理、实时字幕和通话后分析。其评测结果因测试来源和场景不同而存在差异,后续比较时应区分 Artificial Analysis 与 FLEURS 基准。 值得关注 Google 是否进一步披露两种 API 的具体性能、成本与可用范围,以及开发者在复杂噪声、专业术语和多人对话场景中的实际使用反馈。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: deepmind.google

来源: Google DeepMind:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-26T17:01:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型,支持流式与非流式两种 API。据 Artificial Analysis 评测...

Google DeepMind:Blog(RSS)2026-08-26T17:01:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。