구글 AI는 70+ 언어를 지원하며 거의 실시간 음성-음성 변환을 지원하는 Gemini 3.5 라이브 번역을 출시했습니다. 이 모델은 원시 오디오 스트림을 직접 처리하여 스피커의
억양, 리듬, 음정을 보존합니다. 동남아시아의 슈퍼앱 Grab은 운전자와 승객 간의 언어 간 소통을 탐구하고 있으며, 사용자는 매달 1,000만 건 이상의 음성 통화를 시작하고 있습니다. 개발자들은 Gemini Live API를 통해 LiveKit, Fishjam, Pipecat, Vision 에이전트를 통합하여 애플리케이션을 구축할 수 있습니다. LiveKit은 가상 회의실에서 다국어 실시간 이해를 가능하게 했으며; Software Mansion은 MoQ 프로토콜을 통해 스트리밍 병목 현상을 뚫었습니다; VisionAgents AI는 동적 다국어 전환 기능을 시연했습니다. 개발자들은 Google AI Studio에서 Cookbook 샘플 코드를 체험하고 접근할 수 있습니다.
Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言、近实时延迟的语音到语音翻译。
该模型直接处理原始音频流,保留说话者语调、节奏和音高。
东南亚超级应用 Grab 正探索将其用于司机与乘客间的跨语言沟通,其用户每月发起超 1000 万次语音通话。
开发者可通过 Gemini Live API 集成 LiveKit、Fishjam、Pipecat 或 Vision Agents 构建应用。
LiveKit 已实现虚拟会议室多语言即时理解;
Software Mansion 结合 MoQ 协议突破流媒体瓶颈;
VisionAgents AI 展示了动态多语言切换能力。
开发者可在 Google AI Studio 试用并获取 Cookbook 示例代码。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.