Google AI ha rilasciato Gemini 3.5 Live Translate, che supporta 70+ lingue con una traduzione vocale
a latenza quasi in tempo reale. Questo modello elabora direttamente il flusso audio grezzo, preservando l'intonazione, il ritmo e l'intonazione dell'altoparlante. La super app del Sud-est asiatico Grab sta esplorando la comunicazione interlinguistica tra conducenti e passeggeri, con utenti che iniziano oltre 10 milioni di chiamate vocali ogni mese. Gli sviluppatori possono costruire applicazioni integrando LiveKit, Fishjam, Pipecat o Vision Agents tramite l'API Gemini Live. LiveKit ha reso possibile la comprensione in tempo reale multilingue nelle sale riunioni virtuali; Software Mansion supera i colli di bottiglia dello streaming tramite il protocollo MoQ; VisionAgents AI ha dimostrato capacità dinamiche di commutazione multilingue. Gli sviluppatori possono provare e accedere al codice di esempio di Cookbook in Google AI Studio.
Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言、近实时延迟的语音到语音翻译。
该模型直接处理原始音频流,保留说话者语调、节奏和音高。
东南亚超级应用 Grab 正探索将其用于司机与乘客间的跨语言沟通,其用户每月发起超 1000 万次语音通话。
开发者可通过 Gemini Live API 集成 LiveKit、Fishjam、Pipecat 或 Vision Agents 构建应用。
LiveKit 已实现虚拟会议室多语言即时理解;
Software Mansion 结合 MoQ 协议突破流媒体瓶颈;
VisionAgents AI 展示了动态多语言切换能力。
开发者可在 Google AI Studio 试用并获取 Cookbook 示例代码。