{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-08-26T22:21:03.219Z","headline":"Gemini 3.5 Transcribe 发布：面向实时语音交互的高精度语音转文本模型","description":"Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型，支持流式与非流式两种 API。据 Artificial Analysis 评测，其流式与非流式平均词错率分别为 4.0% 和 2.6%，支持超 85 种语言、自定义词汇及最多三人说话人识别。","url":"https://www.aioga.com/news/cmtacq8vz0aedroj24bcix9go/","mainEntityOfPage":"https://www.aioga.com/news/cmtacq8vz0aedroj24bcix9go/","datePublished":"2026-08-26T17:01:00.000Z","dateModified":"2026-08-26T17:01:00.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://deepmind.google/blog/intelligent-transcription-with-gemini-3-5-transcribe","https://aihot.virxact.com/items/cmtacq8vz0aedroj24bcix9go"],"canonicalUrl":"https://www.aioga.com/news/cmtacq8vz0aedroj24bcix9go/","directAnswer":{"@type":"Answer","text":"Google DeepMind 发布 Gemini 3.5 Transcribe，面向实时语音交互，提供流式与非流式 API。材料称其支持超过 85 种语言、自定义词汇及最多三人说话人识别。","url":"https://www.aioga.com/news/cmtacq8vz0aedroj24bcix9go/","dateCreated":"2026-08-26T17:01:00.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"Google DeepMind source article","url":"https://deepmind.google/blog/intelligent-transcription-with-gemini-3-5-transcribe","datePublished":"2026-08-26T17:01:00.000Z","provider":{"@type":"Organization","name":"Google DeepMind","url":"https://deepmind.google/blog/intelligent-transcription-with-gemini-3-5-transcribe"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmtacq8vz0aedroj24bcix9go","datePublished":"2026-08-26T17:01:00.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmtacq8vz0aedroj24bcix9go"}}],"aggregationSource":"Google DeepMind：Blog（RSS）","originalPublisher":{"name":"Google DeepMind","url":"https://deepmind.google/blog/intelligent-transcription-with-gemini-3-5-transcribe"},"geoDeepAnswer":null,"article":{"id":"cmtacq8vz0aedroj24bcix9go","slug":"cmtacq8vz0aedroj24bcix9go","url":"https://www.aioga.com/news/cmtacq8vz0aedroj24bcix9go/","title":"Gemini 3.5 Transcribe 发布：面向实时语音交互的高精度语音转文本模型","title_en":"","summary":"Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型，支持流式与非流式两种 API。据 Artificial Analysis 评测，其流式与非流式平均词错率分别为 4.0% 和 2.6%，支持超 85 种语言、自定义词汇及最多三人说话人识别。","source":"Google DeepMind：Blog（RSS）","sourceUrl":"https://deepmind.google/blog/intelligent-transcription-with-gemini-3-5-transcribe","aiHotUrl":"https://aihot.virxact.com/items/cmtacq8vz0aedroj24bcix9go","publishedAt":"2026-08-26T17:01:00.000Z","category":"行业动态","score":72,"selected":true,"articleBody":["Today, we’re introducing Gemini 3.5 Transcribe, our most precise speech-to-text model yet, designed for intelligent voice interactions. Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text.","Across our products like the Gemini app and on Android, we’ve seen consumers already benefiting from this transcription model with new voice capabilities like Rambler on Android：https://blog.google/products-and-platforms/platforms/android/gemini-intelligence/ and in the Gemini app on macOS. Now, developers can build similar capabilities with Gemini 3.5 Transcribe in the Gemini API in Google AI Studio：https://aistudio.google.com/live?model=gemini-3.5-transcribe-live and Gemini Enterprise Agent Platform：https://console.cloud.google.com/agent-platform/studio/multimodal-live?model=gemini-3.5-transcribe-live-preview.","We've built 3.5 Transcribe to plug seamlessly into your developer workflows, whether you’re building voice agents, real-time captioning tools, or post-call analytics pipelines. The model is available across two separate APIs:","Gemini 3.5 Transcribe is designed to capture your natural speaking style to better understand your intent and recognize custom vocabulary, so you can execute tasks with your voice.","Gemini 3.5 Transcribe handles live language switches and seamless streaming transcription","Watch Gemini 3.5 Transcribe clean up speech disfluencies with smart transcription capabilities.","3.5 Transcribe delivers transcription with multi-speaker attribution and word-level timestamps.","Gemini 3.5 Transcribe’s performance represents a major advancement from our previous transcription model, Chirp 3, offering new capabilities, improved word error rates, and significantly better latency. As measured by Artificial Analysis, time to final transcription, for example, improves by 70%. On the FLEURS benchmark across a set of top languages and locales, the model delivers precise multilingual performance, improving over Chirp 3, and achieving a 5.50% WER in streaming mode and 5.04% WER in non-streaming use-cases.","In addition to the Gemini API in the Google AI Studio and Gemini Enterprise Agent Platform, 3.5 Transcribe goes further than standard speech-to-text to make working across Google feel more natural and intuitive. By bringing context-aware understanding directly into everyday surfaces like Gboard, Antigravity, the Gemini app, and Chrome, it captures nuances, intent, and inline edits with ease.","Gemini 3.5 Transcribe lets you analyze files, generate images, and search in the Gemini app on macOS using just your voice.","See how Gemini 3.5 Transcribe uses Rambler on Android to automatically remove filler words and clean up speech.","Gemini 3.5 Transcribe leverages screen context on Google Antigravity to ensure accurate transcription accuracy.","By leveraging the Gemini Live API, developer platforms such as Agora：https://docs.agora.io/en/ai/models/asr/gemini, Fishjam：https://docs.fishjam.io/tutorials/gemini-live-integration, LangChain：https://docs.langchain.com/langsmith/trace-gemini-live, LiveKit：https://docs.livekit.io/agents/models/stt/gemini/, Pipecat：https://docs.pipecat.ai/api-reference/server/services/stt/google, Vercel：https://vercel.com/docs/ai-gateway/modalities/speech-to-text, and Vision Agents：https://visionagents.ai/integrations/stt/gemini enable developers to build and deploy high-performance voice-driven interfaces with ease. These platforms manage complex real-time media streaming infrastructure behind the scenes, allowing developers to focus entirely on crafting the user experience.","Companies like Vivo, Intellitek Health, and Lingopal have also shared positive feedback on 3.5 Transcribe, highlighting its impressive latency, accuracy, and expansive language support.","Check your inbox to confirm your subscription."],"articleImages":[],"mediaStatus":"none","articleBodyZh":["今天，我们推出了 Gemini 3.5 Transcribe，这是我们迄今为止最精确的语音转文字模型，专为智能语音互动而设计。与在背景噪音、复杂术语和语音不流畅清理方面表现不佳的传统语音识别模型不同，Gemini 3.5 Transcribe 可以将原始音频直接转换为准确、精炼且格式化的文本。","在我们的产品中，例如 Gemini 应用程序和 Android 平台，我们已经看到消费者从这个转录模型中受益，体验到新的语音功能，例如 Android 上的 Rambler：https://blog.google/products-and-platforms/platforms/android/gemini-intelligence/ 以及 macOS 上的 Gemini 应用程序。现在，开发者可以在 Google AI Studio 的 Gemini API（https://aistudio.google.com/live?model=gemini-3.5-transcribe-live）和 Gemini 企业代理平台（https://console.cloud.google.com/agent-platform/studio/multimodal-live?model=gemini-3.5-transcribe-live-preview）中使用 Gemini 3.5 Transcribe 构建类似功能。","我们构建 3.5 Transcribe 以无缝融入开发者工作流程，无论您是在构建语音代理、实时字幕工具还是通话后分析管道。该模型可通过两个独立的 API 使用：","Gemini 3.5 Transcribe 旨在捕捉您的自然说话风格，更好地理解您的意图并识别自定义词汇，从而使您能够通过语音执行任务。","Gemini 3.5 Transcribe 支持实时语言切换和无缝流式转录。","观看 Gemini 3.5 Transcribe 利用智能转录功能清理语音不流畅的表现。","3.5 Transcribe 提供多说话人标注和逐词时间戳的转录。","Gemini 3.5 Transcribe 的性能相比我们之前的转录模型 Chirp 3 有重大进步，提供了新的功能、改进的词错误率和显著更低的延迟。例如，根据 Artificial Analysis 的测量，最终转录时间提高了 70%。在 FLEURS 基准测试中，涵盖多种主要语言和地区，该模型提供了精确的多语言性能，相比 Chirp 3 有所提高，在流式模式下实现 5.50% 的词错误率(WER)，非流式使用场景下实现 5.04% 的词错误率(WER)。","除了Google AI Studio和Gemini企业代理平台中的Gemini API外，3.5 转录比标准的语音转文字功能更进一步，让在Google生态中工作感觉更加自然和直观。通过将上下文感知理解直接引入Gboard、Antigravity、Gemini应用和Chrome等日常界面，它可以轻松捕捉细微差别、意图和内联编辑。","Gemini 3.5 转录让您只用语音就可以在macOS上的Gemini应用中分析文件、生成图像和进行搜索。","看看Gemini 3.5 转录如何在Android上的Rambler中自动删除填充词并清理语音。","Gemini 3.5 转录利用Google Antigravity上的屏幕上下文来确保转录的准确性。","通过利用 Gemini Live API，开发者平台如 Agora：https://docs.agora.io/en/ai/models/asr/gemini、Fishjam：https://docs.fishjam.io/tutorials/gemini-live-integration、LangChain：https://docs.langchain.com/langsmith/trace-gemini-live、LiveKit：https://docs.livekit.io/agents/models/stt/gemini/、Pipecat：https://docs.pipecat.ai/api-reference/server/services/stt/google、Vercel：https://vercel.com/docs/ai-gateway/modalities/speech-to-text 以及 Vision Agents：https://visionagents.ai/integrations/stt/gemini，使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在后台管理复杂的实时媒体流基础设施，使开发者可以完全专注于打造用户体验。","Vivo、Intellitek Health和Lingopal等公司也分享了对3.5 转录的积极反馈，强调其令人印象深刻的延迟、准确性及广泛的语言支持。","检查您的收件箱以确认订阅。"],"translationStatus":"translated","bodyOrigin":"source-page","editorial":{"summary":"Google DeepMind 发布 Gemini 3.5 Transcribe，面向实时语音交互，提供流式与非流式 API。材料称其支持超过 85 种语言、自定义词汇及最多三人说话人识别。","background":"该模型可将原始音频转为整理后的文本，并支持语音停顿清理、语言切换、说话人归属和逐词时间戳。开发者可通过 Gemini API 或 Gemini Enterprise Agent Platform 使用。","viewpoint":"Aioga 判断，Gemini 3.5 Transcribe 的重点不只是语音识别准确率，还包括自然表达处理、实时流式转写和开发流程接入，可能扩大语音代理与字幕工具的应用空间。","implications":"材料显示，该模型可用于语音代理、实时字幕和通话后分析。其评测结果因测试来源和场景不同而存在差异，后续比较时应区分 Artificial Analysis 与 FLEURS 基准。","nextStep":"值得关注 Google 是否进一步披露两种 API 的具体性能、成本与可用范围，以及开发者在复杂噪声、专业术语和多人对话场景中的实际使用反馈。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-08-26T18:20:43.767Z","sourceHash":"5dfcae8f4174cfa2","review":{"approved":true,"groundedness":96,"clarity":92,"duplicationRisk":18,"blockingIssues":[],"notes":["“语音停顿清理”可更准确地表述为“口语不流畅现象清理”或“语气词、重复及停顿等口语冗余清理”，以贴近原文中的 disfluency cleanup。","“可能扩大语音代理与字幕工具的应用空间”属于明确标注的判断性表述，未冒充既成事实。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["行业动态","Google DeepMind：Blog（RSS）"],"translations":{"zh-CN":{"title":"Gemini 3.5 Transcribe 发布：面向实时语音交互的高精度语音转文本模型","summary":"Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型，支持流式与非流式两种 API。据 Artificial Analysis 评测，其流式与非流式平均词错率分别为 4.0% 和 2.6%，支持超 85 种语言、自定义词汇及最多三人说话人识别。","category":"行业动态","source":"Google DeepMind","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe 发布：面向实时语音交互的高精度语音转文本模型 - Aioga AI资讯","description":"Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型，支持流式与非流式两种 API。据 Artificial Analysis 评测，其流式与非流式平均词错率分别为 4.0% 和 2.6%，支持超 85 种语言、自定义词汇及最多三人说话人识别。","url":"https://www.aioga.com/news/cmtacq8vz0aedroj24bcix9go/","articleBody":["今天，我们推出了 Gemini 3.5 Transcribe，这是我们迄今为止最精确的语音转文字模型，专为智能语音互动而设计。与在背景噪音、复杂术语和语音不流畅清理方面表现不佳的传统语音识别模型不同，Gemini 3.5 Transcribe 可以将原始音频直接转换为准确、精炼且格式化的文本。","在我们的产品中，例如 Gemini 应用程序和 Android 平台，我们已经看到消费者从这个转录模型中受益，体验到新的语音功能，例如 Android 上的 Rambler：https://blog.google/products-and-platforms/platforms/android/gemini-intelligence/ 以及 macOS 上的 Gemini 应用程序。现在，开发者可以在 Google AI Studio 的 Gemini API（https://aistudio.google.com/live?model=gemini-3.5-transcribe-live）和 Gemini 企业代理平台（https://console.cloud.google.com/agent-platform/studio/multimodal-live?model=gemini-3.5-transcribe-live-preview）中使用 Gemini 3.5 Transcribe 构建类似功能。","我们构建 3.5 Transcribe 以无缝融入开发者工作流程，无论您是在构建语音代理、实时字幕工具还是通话后分析管道。该模型可通过两个独立的 API 使用：","Gemini 3.5 Transcribe 旨在捕捉您的自然说话风格，更好地理解您的意图并识别自定义词汇，从而使您能够通过语音执行任务。","Gemini 3.5 Transcribe 支持实时语言切换和无缝流式转录。","观看 Gemini 3.5 Transcribe 利用智能转录功能清理语音不流畅的表现。","3.5 Transcribe 提供多说话人标注和逐词时间戳的转录。","Gemini 3.5 Transcribe 的性能相比我们之前的转录模型 Chirp 3 有重大进步，提供了新的功能、改进的词错误率和显著更低的延迟。例如，根据 Artificial Analysis 的测量，最终转录时间提高了 70%。在 FLEURS 基准测试中，涵盖多种主要语言和地区，该模型提供了精确的多语言性能，相比 Chirp 3 有所提高，在流式模式下实现 5.50% 的词错误率(WER)，非流式使用场景下实现 5.04% 的词错误率(WER)。","除了Google AI Studio和Gemini企业代理平台中的Gemini API外，3.5 转录比标准的语音转文字功能更进一步，让在Google生态中工作感觉更加自然和直观。通过将上下文感知理解直接引入Gboard、Antigravity、Gemini应用和Chrome等日常界面，它可以轻松捕捉细微差别、意图和内联编辑。","Gemini 3.5 转录让您只用语音就可以在macOS上的Gemini应用中分析文件、生成图像和进行搜索。","看看Gemini 3.5 转录如何在Android上的Rambler中自动删除填充词并清理语音。","Gemini 3.5 转录利用Google Antigravity上的屏幕上下文来确保转录的准确性。","通过利用 Gemini Live API，开发者平台如 Agora：https://docs.agora.io/en/ai/models/asr/gemini、Fishjam：https://docs.fishjam.io/tutorials/gemini-live-integration、LangChain：https://docs.langchain.com/langsmith/trace-gemini-live、LiveKit：https://docs.livekit.io/agents/models/stt/gemini/、Pipecat：https://docs.pipecat.ai/api-reference/server/services/stt/google、Vercel：https://vercel.com/docs/ai-gateway/modalities/speech-to-text 以及 Vision Agents：https://visionagents.ai/integrations/stt/gemini，使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在后台管理复杂的实时媒体流基础设施，使开发者可以完全专注于打造用户体验。","Vivo、Intellitek Health和Lingopal等公司也分享了对3.5 转录的积极反馈，强调其令人印象深刻的延迟、准确性及广泛的语言支持。","检查您的收件箱以确认订阅。"]},"en":{"title":"Gemini 3.5 Transcribe Release: A High-Accuracy Speech-to-Text Model for Real-Time Voice Interaction","summary":"Google DeepMind has launched the Gemini 3.5 Transcribe speech-to-text model, supporting both streaming and non-streaming APIs. According to Artificial Analysis evaluation, its average word error rates for streaming and non-streaming are 4.0% and 2.6% respectively, supporting over 85 languages, custom vocabulary, and speaker recognition for up to three people.","category":"Industry","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe Release: A High-Accuracy Speech-to-Text Model for Real-Time Voice Interaction - Aioga AI News","description":"Google DeepMind has launched the Gemini 3.5 Transcribe speech-to-text model, supporting both streaming and non-streaming APIs. According to Artificial Analysis evaluation, its aver...","url":"https://www.aioga.com/en/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:02:22.439Z"},"ja":{"title":"Gemini 3.5 Transcribe 発表：リアルタイム音声対話向けの高精度音声からテキストへの変換モデル","summary":"Google DeepMind は Gemini 3.5 Transcribe 音声からテキストへの変換モデルを発表し、ストリーミングと非ストリーミングの 2 種類の API をサポートします。Artificial Analysis の評価によると、ストリーミングと非ストリーミングの平均単語誤り率はそれぞれ 4.0% と 2.6% であり、85 以上の言語、カスタム語彙、最大 3 人の話者認識をサポートします。","category":"業界動向","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe 発表：リアルタイム音声対話向けの高精度音声からテキストへの変換モデル - Aioga AIニュース","description":"Google DeepMind は Gemini 3.5 Transcribe 音声からテキストへの変換モデルを発表し、ストリーミングと非ストリーミングの 2 種類の API をサポートします。Artificial Analysis の評価によると、ストリーミングと非ストリーミングの平均単語誤り率はそれぞれ 4.0% と 2.6% であり、85 以上の言語、...","url":"https://www.aioga.com/ja/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:02:33.481Z"},"ko":{"title":"Gemini 3.5 Transcribe 출시: 실시간 음성 상호작용을 위한 고정밀 음성-텍스트 변환 모델","summary":"Google DeepMind가 Gemini 3.5 Transcribe 음성-텍스트 변환 모델을 출시했으며, 스트리밍 및 비스트리밍 두 가지 API를 지원합니다. Artificial Analysis 평가에 따르면, 스트리밍 및 비스트리밍의 평균 단어 오류율은 각각 4.0%와 2.6%로, 85개 이상의 언어, 사용자 정의 어휘 및 최대 세 명의 화자 인식을 지원합니다.","category":"업계 동향","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe 출시: 실시간 음성 상호작용을 위한 고정밀 음성-텍스트 변환 모델 - Aioga AI 뉴스","description":"Google DeepMind가 Gemini 3.5 Transcribe 음성-텍스트 변환 모델을 출시했으며, 스트리밍 및 비스트리밍 두 가지 API를 지원합니다. Artificial Analysis 평가에 따르면, 스트리밍 및 비스트리밍의 평균 단어 오류율은 각각 4.0%와 2.6%로, 85개 이상의 언어, 사용자 정의 어...","url":"https://www.aioga.com/ko/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:03:29.319Z"},"es":{"title":"Gemini 3.5 Transcribe Lanzamiento: Modelo de transcripción de voz a texto de alta precisión para la interacción de voz en tiempo real","summary":"Google DeepMind lanzó el modelo de transcripción de voz a texto Gemini 3.5 Transcribe, que admite dos tipos de API: en flujo y fuera de flujo. Según la evaluación de Artificial Analysis, sus tasas promedio de error de palabras en flujo y fuera de flujo son del 4,0% y 2,6%, respectivamente, y admite más de 85 idiomas, vocabulario personalizado y el reconocimiento de hasta tres hablantes.","category":"Industria","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe Lanzamiento: Modelo de transcripción de voz a texto de alta precisión para la interacción de voz en tiempo real - Aioga Noticias de IA","description":"Google DeepMind lanzó el modelo de transcripción de voz a texto Gemini 3.5 Transcribe, que admite dos tipos de API: en flujo y fuera de flujo. Según la evaluación de Artificial Ana...","url":"https://www.aioga.com/es/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:03:22.108Z"},"fr":{"title":"Gemini 3.5 Transcribe publié : modèle de reconnaissance vocale haute précision pour les interactions vocales en temps réel","summary":"Google DeepMind a lancé le modèle de transcription vocale Gemini 3.5, prenant en charge deux types d'API : en flux et hors flux. Selon l'évaluation d'Artificial Analysis, le taux moyen d'erreurs de mots pour les versions en flux et hors flux est respectivement de 4,0 % et 2,6 %, et il prend en charge plus de 85 langues, des vocabulaires personnalisés ainsi que la reconnaissance jusqu'à trois locuteurs.","category":"Industrie","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe publié : modèle de reconnaissance vocale haute précision pour les interactions vocales en temps réel - Aioga Actualités IA","description":"Google DeepMind a lancé le modèle de transcription vocale Gemini 3.5, prenant en charge deux types d'API : en flux et hors flux. Selon l'évaluation d'Artificial Analysis, le taux m...","url":"https://www.aioga.com/fr/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:04:22.724Z"},"de":{"title":"Gemini 3.5 Transcribe Veröffentlichung: Hochpräzises Sprach-zu-Text-Modell für Echtzeit-Sprachinteraktion","summary":"Google DeepMind hat das Gemini 3.5 Transcribe Sprach-zu-Text-Modell eingeführt, das sowohl Streaming- als auch Nicht-Streaming-APIs unterstützt. Laut der Bewertung von Artificial Analysis liegen die durchschnittlichen Wortfehlerraten für Streaming und Nicht-Streaming bei 4,0 % bzw. 2,6 %. Es unterstützt mehr als 85 Sprachen, benutzerdefinierte Vokabulare und die Erkennung von bis zu drei Sprechern.","category":"行业动态","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe Veröffentlichung: Hochpräzises Sprach-zu-Text-Modell für Echtzeit-Sprachinteraktion - Aioga KI-News","description":"Google DeepMind hat das Gemini 3.5 Transcribe Sprach-zu-Text-Modell eingeführt, das sowohl Streaming- als auch Nicht-Streaming-APIs unterstützt. Laut der Bewertung von Artificial A...","url":"https://www.aioga.com/de/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:04:20.771Z"},"pt-BR":{"title":"Lançamento do Gemini 3.5 Transcribe: modelo de transcrição de voz para texto de alta precisão voltado para interação de voz em tempo real","summary":"Google DeepMind lançou o modelo de transcrição de voz para texto Gemini 3.5 Transcribe, que suporta APIs em streaming e não streaming. Segundo avaliação da Artificial Analysis, a taxa média de erro de palavras em streaming e não streaming é de 4,0% e 2,6%, respectivamente, suportando mais de 85 idiomas, vocabulário personalizado e reconhecimento de até três falantes.","category":"行业动态","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Lançamento do Gemini 3.5 Transcribe: modelo de transcrição de voz para texto de alta precisão voltado para interação de voz em tempo real - Aioga Notícias de IA","description":"Google DeepMind lançou o modelo de transcrição de voz para texto Gemini 3.5 Transcribe, que suporta APIs em streaming e não streaming. Segundo avaliação da Artificial Analysis, a t...","url":"https://www.aioga.com/pt-BR/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:05:13.784Z"},"ru":{"title":"Gemini 3.5 Transcribe Выпуск: высокоточная модель преобразования речи в текст для взаимодействия с голосом в реальном времени","summary":"Google DeepMind выпустила модель преобразования речи в текст Gemini 3.5 Transcribe, поддерживающую два типа API: потоковый и непотоковый. Согласно оценке Artificial Analysis, средний уровень ошибок в словах составляет 4,0% для потокового и 2,6% для непотокового режимов, поддерживаются более 85 языков, пользовательская лексика и распознавание до трех говорящих.","category":"行业动态","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe Выпуск: высокоточная модель преобразования речи в текст для взаимодействия с голосом в реальном времени - Aioga Новости ИИ","description":"Google DeepMind выпустила модель преобразования речи в текст Gemini 3.5 Transcribe, поддерживающую два типа API: потоковый и непотоковый. Согласно оценке Artificial Analysis, средн...","url":"https://www.aioga.com/ru/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:05:12.410Z"},"ar":{"title":"إصدار Gemini 3.5 Transcribe: نموذج تحويل الكلام إلى نص عالي الدقة مخصص للتفاعل الصوتي في الوقت الفعلي","summary":"أطلقت Google DeepMind نموذج تحويل الصوت إلى نص Gemini 3.5 Transcribe، ويدعم واجهتي برمجة التطبيقات المتدفقة وغير المتدفقة. وفقًا لتقييم Artificial Analysis، فإن متوسط معدل خطأ الكلمات للواجهتين المتدفقة وغير المتدفقة هو 4.0٪ و2.6٪ على التوالي، ويدعم أكثر من 85 لغة، والمفردات المخصصة، والتعرف على ما يصل إلى ثلاثة متحدثين.","category":"行业动态","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"إصدار Gemini 3.5 Transcribe: نموذج تحويل الكلام إلى نص عالي الدقة مخصص للتفاعل الصوتي في الوقت الفعلي - Aioga أخبار الذكاء الاصطناعي","description":"أطلقت Google DeepMind نموذج تحويل الصوت إلى نص Gemini 3.5 Transcribe، ويدعم واجهتي برمجة التطبيقات المتدفقة وغير المتدفقة. وفقًا لتقييم Artificial Analysis، فإن متوسط معدل خطأ الكل...","url":"https://www.aioga.com/ar/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:06:12.821Z"},"hi":{"title":"Gemini 3.5 Transcribe जारी किया गया: रियल-टाइम वॉइस इंटरैक्शन के लिए उच्च-सटीकता वॉइस-टू-टेक्स्ट मॉडल","summary":"Google DeepMind ने Gemini 3.5 Transcribe वॉइस-टू-टेक्स्ट मॉडल लॉन्च किया, जो स्ट्रीमिंग और नॉन-स्ट्रीमिंग दो प्रकार के API को सपोर्ट करता है। Artificial Analysis के मूल्यांकन के अनुसार, इसकी स्ट्रीमिंग और नॉन-स्ट्रीमिंग की औसत शब्द त्रुटि दर क्रमशः 4.0% और 2.6% है, यह 85 से अधिक भाषाओं, कस्टम शब्दावली और अधिकतम तीन स्पीकर्स की पहचान को सपोर्ट करता है।","category":"行业动态","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe जारी किया गया: रियल-टाइम वॉइस इंटरैक्शन के लिए उच्च-सटीकता वॉइस-टू-टेक्स्ट मॉडल - Aioga AI समाचार","description":"Google DeepMind ने Gemini 3.5 Transcribe वॉइस-टू-टेक्स्ट मॉडल लॉन्च किया, जो स्ट्रीमिंग और नॉन-स्ट्रीमिंग दो प्रकार के API को सपोर्ट करता है। Artificial Analysis के मूल्यांकन के अन...","url":"https://www.aioga.com/hi/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:06:15.769Z"},"it":{"title":"Gemini 3.5 Transcribe Rilascio: Modello di trascrizione vocale ad alta precisione per interazioni vocali in tempo reale","summary":"Google DeepMind ha lanciato il modello di trascrizione vocale in testo Gemini 3.5, che supporta due tipi di API: in streaming e non in streaming. Secondo la valutazione di Artificial Analysis, il tasso medio di errore delle parole è rispettivamente del 4,0% e del 2,6% per lo streaming e non in streaming, supporta oltre 85 lingue, vocabolario personalizzato e il riconoscimento di fino a tre parlanti.","category":"行业动态","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe Rilascio: Modello di trascrizione vocale ad alta precisione per interazioni vocali in tempo reale - Aioga Notizie IA","description":"Google DeepMind ha lanciato il modello di trascrizione vocale in testo Gemini 3.5, che supporta due tipi di API: in streaming e non in streaming. Secondo la valutazione di Artifici...","url":"https://www.aioga.com/it/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:07:07.315Z"},"nl":{"title":"Gemini 3.5 Transcribe uitgebracht: een hoogprecisiemodel voor spraak-naar-tekst gericht op realtime spraakinteractie","summary":"Google DeepMind heeft het Gemini 3.5 Transcribe spraak-naar-tekstmodel gelanceerd, dat zowel streaming- als niet-streaming-API's ondersteunt. Volgens een beoordeling door Artificial Analysis zijn de gemiddelde woordfoutpercentages voor streaming en niet-streaming respectievelijk 4,0% en 2,6%, en het ondersteunt meer dan 85 talen, aangepaste woordenlijsten en sprekersidentificatie voor maximaal drie personen.","category":"行业动态","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe uitgebracht: een hoogprecisiemodel voor spraak-naar-tekst gericht op realtime spraakinteractie - Aioga AI-nieuws","description":"Google DeepMind heeft het Gemini 3.5 Transcribe spraak-naar-tekstmodel gelanceerd, dat zowel streaming- als niet-streaming-API's ondersteunt. Volgens een beoordeling door Artificia...","url":"https://www.aioga.com/nl/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:07:06.505Z"},"tr":{"title":"Gemini 3.5 Transcribe Yayınlandı: Gerçek Zamanlı Sesli Etkileşim için Yüksek Hassasiyetli Konuşmadan Metne Dönüşüm Modeli","summary":"Google DeepMind, akışlı ve akışsız olmak üzere iki API'yi destekleyen Gemini 3.5 Transcribe sesli metin dönüştürme modelini tanıttı. Artificial Analysis’in değerlendirmesine göre, akışlı ve akışsız ortalama kelime hata oranları sırasıyla %4,0 ve %2,6 olup, 85'ten fazla dili, özelleştirilebilir kelimeleri ve en fazla üç konuşmacıyı tanımayı destekliyor.","category":"行业动态","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe Yayınlandı: Gerçek Zamanlı Sesli Etkileşim için Yüksek Hassasiyetli Konuşmadan Metne Dönüşüm Modeli - Aioga AI Haberleri","description":"Google DeepMind, akışlı ve akışsız olmak üzere iki API'yi destekleyen Gemini 3.5 Transcribe sesli metin dönüştürme modelini tanıttı. Artificial Analysis’in değerlendirmesine göre,...","url":"https://www.aioga.com/tr/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:08:04.702Z"},"vi":{"title":"Gemini 3.5 Transcribe ra mắt: Mô hình chuyển giọng nói thành văn bản độ chính xác cao dành cho tương tác giọng nói thời gian thực","summary":"Google DeepMind ra mắt mô hình chuyển giọng nói thành văn bản Gemini 3.5 Transcribe, hỗ trợ cả hai API dạng luồng và không luồng. Theo đánh giá của Artificial Analysis, tỷ lệ lỗi từ trung bình của dạng luồng và không luồng lần lượt là 4,0% và 2,6%, hỗ trợ hơn 85 ngôn ngữ, danh mục từ tùy chỉnh và nhận diện tối đa ba người nói.","category":"行业动态","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe ra mắt: Mô hình chuyển giọng nói thành văn bản độ chính xác cao dành cho tương tác giọng nói thời gian thực - Tin tức AI Aioga","description":"Google DeepMind ra mắt mô hình chuyển giọng nói thành văn bản Gemini 3.5 Transcribe, hỗ trợ cả hai API dạng luồng và không luồng. Theo đánh giá của Artificial Analysis, tỷ lệ lỗi t...","url":"https://www.aioga.com/vi/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:08:02.092Z"},"id":{"title":"Gemini 3.5 Transcribe Dirilis: Model Pengenalan Suara ke Teks Presisi Tinggi untuk Interaksi Suara Real-time","summary":"Google DeepMind meluncurkan model transkripsi suara ke teks Gemini 3.5, mendukung dua jenis API, yaitu streaming dan non-streaming. Menurut penilaian Artificial Analysis, rata-rata tingkat kesalahan kata untuk streaming dan non-streaming masing-masing adalah 4,0% dan 2,6%, mendukung lebih dari 85 bahasa, kosakata yang dapat disesuaikan, dan pengenalan hingga tiga pembicara.","category":"行业动态","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe Dirilis: Model Pengenalan Suara ke Teks Presisi Tinggi untuk Interaksi Suara Real-time - Berita AI Aioga","description":"Google DeepMind meluncurkan model transkripsi suara ke teks Gemini 3.5, mendukung dua jenis API, yaitu streaming dan non-streaming. Menurut penilaian Artificial Analysis, rata-rata...","url":"https://www.aioga.com/id/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:08:49.786Z"},"th":{"title":"Gemini 3.5 Transcribe เปิดตัว: โมเดลแปลงเสียงเป็นข้อความความแม่นยำสูงสำหรับการโต้ตอบด้วยเสียงแบบเรียลไทม์","summary":"Google DeepMind เปิดตัวโมเดลถอดเสียงเป็นข้อความ Gemini 3.5 Transcribe รองรับ API ทั้งแบบสตรีมและไม่สตรีม ตามการประเมินของ Artificial Analysis อัตราความผิดพลาดของคำเฉลี่ยสำหรับสตรีมและไม่สตรีมอยู่ที่ 4.0% และ 2.6% ตามลำดับ รองรับมากกว่า 85 ภาษา, คำศัพท์ที่กำหนดเอง และการระบุผู้พูดสูงสุดสามคน","category":"行业动态","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe เปิดตัว: โมเดลแปลงเสียงเป็นข้อความความแม่นยำสูงสำหรับการโต้ตอบด้วยเสียงแบบเรียลไทม์ - ข่าว AI Aioga","description":"Google DeepMind เปิดตัวโมเดลถอดเสียงเป็นข้อความ Gemini 3.5 Transcribe รองรับ API ทั้งแบบสตรีมและไม่สตรีม ตามการประเมินของ Artificial Analysis อัตราความผิดพลาดของคำเฉลี่ยสำหรับสตรีม...","url":"https://www.aioga.com/th/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:09:07.946Z"},"pl":{"title":"Gemini 3.5 Transcribe wydanie: wysok dokładny model rozpoznawania mowy do interakcji głosowej w czasie rzeczywistym","summary":"Google DeepMind wprowadza model transkrypcji mowy na tekst Gemini 3.5, obsługujący dwa rodzaje API: strumieniowe i niestumieniowe. Według oceny Artificial Analysis, średni wskaźnik błędów słów wynosi odpowiednio 4,0% i 2,6% dla wersji strumieniowej i niestumieniowej, a model obsługuje ponad 85 języków, słownictwo niestandardowe oraz rozpoznawanie mówców do trzech osób.","category":"行业动态","source":"Google DeepMind：Blog（RSS）","aggregationSource":"Google DeepMind：Blog（RSS）","pageTitle":"Gemini 3.5 Transcribe wydanie: wysok dokładny model rozpoznawania mowy do interakcji głosowej w czasie rzeczywistym - Aioga Wiadomości AI","description":"Google DeepMind wprowadza model transkrypcji mowy na tekst Gemini 3.5, obsługujący dwa rodzaje API: strumieniowe i niestumieniowe. Według oceny Artificial Analysis, średni wskaźnik...","url":"https://www.aioga.com/pl/news/cmtacq8vz0aedroj24bcix9go/","contentTranslated":true,"sourceHash":"5db3f9d2af634e46","translatedAt":"2026-08-26T18:10:16.651Z"}},"evidenceTier":"verified-news","reviewStatus":"editorial-selected","indexable":true,"editorialCover":"/page-visuals/topic-timeline.png"}}