Aioga
AI资讯 / 行业动态
返回 AI资讯

Gemini 3.5 Transcribe 完整指南:告别 ASR 转录难题

Google AI:DEV 作者专属(RSS)Aioga 编辑团队2026-08-28T13:34:29.000Z热度 74

Google 推出专用于语音转文字的 Gemini 3.5 Transcribe 模型,主打快速、准确且低成本的转录,原生支持说话人分离和词级毫秒时间戳。该模型支持 85+ 种...

技巧观点Google AI:DEV 作者专属(RSS)

今日 AI 情报摘要

Google 推出专用于语音转文字的 Gemini 3.5 Transcribe 模型,主打快速、准确且低成本的转录,原生支持说话人分离和词级毫秒时间戳。

该模型支持 85+ 种语言自动识别与代码切换,可通过 custom_vocabulary 传入最多 1,000 个领域术语避免专有名词拼写错误,并提供 Smart Transcription 与 Verbatim 两种模式。 🔗 阅读原文 via AIHOT · https://aihot.virxact.com/items/cmtd00dbh09tkroq5v7kcw183

中文正文 · AI 翻译

你可能已经用过 Gemini 来分析数小时的视频、总结播客,或者回答录制会议中的问题(如果没有,你应该尝试,它非常有用!)。但是,当你只需要从音频中得到干净、超准确且结构化的文字记录时,启动一个庞大的推理模型并使用复杂的提示,往往感觉像是用大锤敲核桃。

输入Gemini 3.5 Transcribe(gemini-3.5-transcribe)。

这是 Google 专门的语音转文本模型,建立在 Gemini 的音频理解核心之上,专门优化用于快速、准确且具有成本效益的转录。无论你是想要带毫秒时间戳的精确法庭记者式文字记录,还是优化阅读的摘要,去掉所有尴尬的“嗯”“啊”,这个模型都能本地处理,无需复杂提示。

🚀 实操优先:如果你想直接运行代码,可以打开交互式 Gemini Transcribe Colab 笔记本:https://colab.research.google.com/github/google-gemini/cookbook/blob/main/quickstarts/Get_started_transcribe.ipynb! 它已经准备好运行,你可以直接体验模型的工作方式。更喜欢零编码的可视化界面吗?你也可以直接在 Google AI Studio 测试语音识别:https://aistudio.google.com/prompts/new_chat?model=gemini-3.5-transcribe。

本指南中你将找到以下内容:

在查看代码之前,让我们先理清思路。你可能会想:“我不能直接上传 MP3 到 Gemini 3.7 然后说‘转录这个’吗?”

可以,但 gemini-3.5-transcribe 与众不同的原因如下:

专业提示:如果你需要对音频文件中发生的事情提问(“Alice 的行动事项是什么?”),请使用像 Gemini 3.7 这样的多模态模型。如果你只需要文字记录、字幕或整理好的听写笔记,请使用 Gemini Transcribe!

Gemini 3.5 转录模型在现代 Google GenAI SDK(google-genai v2.0+)上运行,使用 Interactions API:https://ai.google.dev/gemini-api/docs/interactions-overview。

确保你拥有 Google AI Studio 的 API 密钥:https://aistudio.google.com/app/apikey,将其设置为 GEMINI_API_KEY,然后我们来看音频是如何传递给模型的:

观看下面的演示视频,了解基线转录的实际操作——轻松处理自然语音和双语代码切换:

在处理音频和视频时,你绝不希望在 API 请求中以内联原始音频字节的形式使用 base64——这会使负载大小增加 33%,容易触发网络超时,并且如果要重新运行查询,还需要重新上传相同的字节。

Files API:https://colab.research.google.com/github/google-gemini/cookbook/blob/main/quickstarts/File_API.ipynb 可以干净利落地解决这一问题:

如你在上面的视频中所见,Gemini Transcribe 开箱即用即可自动识别语言,并无缝处理代码切换(当有人在同一句话中混用多种语言时——比如在一句话中间从法语切换到英语,这种情况我经常遇到!)。

然而,如果你知道你的音频仅使用特定语言或地区方言,你可以在 transcription_config 中传递明确的 BCP-47 语言代码来引导识别:

注意:将 language_codes=[](或忽略它)可以启用对 85 种以上支持的语言和地区的全自动检测:https://ai.google.dev/gemini-api/docs/transcribe#supported-languages。查看音频转录文档:https://ai.google.dev/gemini-api/docs/transcribe 获取完整的语言代码列表。

每个开发者都经历过 ASR 模型篡改专有名词,将专业库与日常词典词混淆(将 "ScaNN" 识别为 "scan",或将 "Qdrant" 识别为 "quadrant"),或杜撰发音相似的词(将 "Sitsi" 识别为 "CitC",将 "Thiago" 识别为 "Tiago")。

借助 custom_vocabulary,你可以传入最多 1,000 个领域特定术语的列表,模型会偏向这些术语的识别:

观看下面的并排对比视频,看看模型在有无 custom_vocabulary 偏置下的表现:

注意,默认语音识别会回退到按发音猜测的字典(Vernat、Scan、Quadrant、Syllium、Thiago、Sitsi、Spacey)。相比之下,提供 custom_vocabulary 则可保证团队成员姓名、利基工具、内部基础设施和开源库的转录达到 100% 精确。

专业提示:不要只在自定义词汇中加入缩略词。加入团队成员的正式名称、内部服务代号、GitHub仓库账号、产品品牌名称以及细分行业术语。

这是我绝对最喜欢的 Gemini 3.5 转录功能。

默认情况下,语音转文字模型以逐字模式工作:它们记录所有内容,包括每一次紧张的结巴、清嗓子、假动作和口头抽动。

当你在转录演讲排练、采访或语音备忘录时,阅读原文文本令人痛苦:

如果你切换模式={“type”: “smart”},模型会进行智能读取优化:

看看那个排练音频的清理结果:

请观看下面的并排对比视频,了解在聆听时原始的不流率是如何被剥离的:

(如果视频无法加载,你可以直接收听 rehearsing.wav:https://storage.googleapis.com/generativeai-downloads/audio/rehearsing.wav。)

重要注意事项:由于智能转录通过语言建模来清理不流畅并构建输出,可能会稍微改写、省略或改写部分内容,使其听起来自然简洁。如果你正在进行逐字法庭记录、医疗转录或字幕同步,且每个音节都至关重要,建议坚持逐字模式!

还要注意,智能模式与字级时间戳和扬声器日记(需要{“type”: “verbatim”})不兼容。

需要知道在多人会议或播客中谁发言了吗?启用日记功能,diarization_mode=“发言人”:

要干净地提取每个扬声器回合,可以遍历步骤注释:

请观看下面的演示视频,两位同事在讨论巧克力面包和巧克力巧克力的争论。注意波形线随着轮流的声音动态变化(Tiago是青色,同事是橙色):

(直接音频链接:收听 pain_au_chocolat.wav:https://storage.googleapis.com/generativeai-downloads/audio/pain_au_chocolat.wav)

当你需要精确同步——例如,跳转到视频的特定点、构建互动式转录本或将文本与波形对齐——你可以请求单词级的毫秒级开始和结束偏移量。

配置时间戳_粒度=["word"](并可选择将其与 diarization_mode="speaker" 组合):

每个识别出的单词都会在内容标注中附带其精确的时间偏移(以及说话者轮次):

拥有每个单词的毫秒级偏移量可以开启巨大的功能:

💡 背景说明:这实际上就是我用来制作上面演示视频的方法!单词时间戳提供了精确的毫秒时序,用于对齐字幕卡片、高亮自定义词汇("oatmilk"),并在说话者变化时触发波形线从青色切换为橙色。

如果你想要完整的 Python 函数,将这些单词标注转换为标准 .srt 字幕文件,可以直接在交互式 Cookbook Colab 笔记本中找到:https://colab.research.google.com/github/google-gemini/cookbook/blob/main/quickstarts/Get_started_transcribe.ipynb。

这里有一个快速备忘单,帮助你为你的使用场景选择正确的设置:

上面我们讲的所有内容都是针对预先录制的音频文件(通过 Files API 的单工模式)。

Gemini 还支持使用 gemini-3.5-transcribe-live 和 Live API 通过 WebSockets 实时进行流式转录。它允许你直接从麦克风流式传输原始 16 位 PCM 块(每块 100ms),并即时接收临时部分假设(interim_input_transcription)以及最终文本。

然而,通过异步 Python 工作线程(asyncio)的实时 WebSockets 流式传输、处理音频切分以及管理用于安全客户端应用的短期 valet token 相当复杂,需要单独的教程。

如果你现在想直接深入实时流式代码:

Gemini 3.5 Transcribe 为你提供了两全其美的方案:当你需要时间戳和说话者区分时,它提供严格、毫秒级精确的逐字数据;当你希望得到易于阅读的清洁文本时,它提供智能的、去除语气词的模式。

你试过在自己的语音录音或会议中使用智能模式吗?在下面的评论中分享你的想法和特殊情况吧!🚀🚀🚀

pic

模板可以让你快速回答常见问题或存储片段以便重复使用。

你确定要隐藏这条评论吗?它将在你的帖子中变为隐藏状态,但仍可通过评论的永久链接查看:#。

对于进一步操作,你可以考虑屏蔽此人和/或举报滥用行为:/report-abuse

Google AI Studio 是开始使用 Gemini 构建的最快方式。准备好开始构建了吗?

DEV Community:/ — 一个用于讨论、跟进软件开发并管理软件职业空间

基于 Forem:https://www.forem.com — 开源软件:https://dev.to/t/opensource 支撑着 DEV:https://dev.to 和其他包容性社区。

用爱和 Ruby on Rails 制作:https://dev.to/t/rails。DEV 社区 © 2016 - 2026。

我们是一个程序员分享、保持最新信息和发展职业的平台。

Gemini 3.5 Transcribe 完整指南:告别 ASR 转录难题
Gemini 3.5 Transcribe 完整指南:告别 ASR 转录难题

情报判断

Aioga 编辑摘要

Google推出专用于语音转文字的Gemini 3.5 Transcribe,定位是快速、准确且具成本效益的音频转录。材料称其原生支持说话人分离、词级毫秒时间戳、85种以上语言自动识别与代码切换,并提供Smart Transcription和Verbatim模式。

背景分析

原文将该模型与通用多模态模型区分:若任务是询问音频内容,可使用多模态模型;若需求是生成转录稿、字幕或清理后的口述笔记,则Gemini 3.5 Transcribe更为直接。文章还介绍了Colab和Google AI Studio两种体验方式。

Aioga 观点

Aioga判断,这款产品的核心卖点不是泛化的音频理解,而是把转录流程做成专用能力。custom_vocabulary最多可传入1,000个领域术语,可能有助于减少专有名词拼写错误,但实际效果仍需结合具体音频验证。

影响与后续

对于会议记录、字幕制作、口述整理及需要时间戳的逐字稿场景,材料显示该模型提供了更明确的功能组合。值得关注的是,Smart Transcription与Verbatim分别面向阅读优化和保留原始表达,使用者需要按交付目标选择模式。 建议先依据任务类型选择模型:需要音频内容问答时考虑多模态模型,需要转录文本时测试Gemini 3.5 Transcribe。随后用包含行业术语、多人对话和中英文切换的样本,在两种转录模式下比较结果,再决定是否配置custom_vocabulary。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: dev.to

来源: Google AI:DEV 作者专属(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-08-28T13:34:29.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Google 推出专用于语音转文字的 Gemini 3.5 Transcribe 模型,主打快速、准确且低成本的转录,原生支持说话人分离和词级毫秒时间戳。该模型支持 85+ 种...

Google AI:DEV 作者专属(RSS)2026-08-28T13:34:29.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。