Google AI lanzó Gemini 3.5 Live Translate, que soporta 70+ idiomas con traducción de voz a voz casi
en tiempo real. Este modelo procesa directamente la secuencia de audio en bruto, preservando la entonación, el ritmo y la afinación del altavoz. La superapp del sudeste asiático Grab está explorando la comunicación interlingüística entre conductores y pasajeros, con usuarios que inician más de 10 millones de llamadas de voz cada mes. Los desarrolladores pueden crear aplicaciones integrando LiveKit, Fishjam, Pipecat o Vision Agents a través de la API Gemini Live. LiveKit ha permitido la comprensión multilingüe en tiempo real en salas de reuniones virtuales; Software Mansion rompe cuellos de botella en streaming mediante el protocolo MoQ; VisionAgents AI demostró capacidades dinámicas de conmutación multilingüe. Los desarrolladores pueden probar y acceder al código de ejemplo de Cookbook en Google AI Studio.
Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言、近实时延迟的语音到语音翻译。
该模型直接处理原始音频流,保留说话者语调、节奏和音高。
东南亚超级应用 Grab 正探索将其用于司机与乘客间的跨语言沟通,其用户每月发起超 1000 万次语音通话。
开发者可通过 Gemini Live API 集成 LiveKit、Fishjam、Pipecat 或 Vision Agents 构建应用。
LiveKit 已实现虚拟会议室多语言即时理解;
Software Mansion 结合 MoQ 协议突破流媒体瓶颈;
VisionAgents AI 展示了动态多语言切换能力。
开发者可在 Google AI Studio 试用并获取 Cookbook 示例代码。
La fuente proporciona título, resumen, atribución y enlace original. Aioga no republica el artículo completo.