Google AI wypuściło Gemini 3.5 Live Translate, obsługujące 70+ języków z niemal rzeczywistym
opóźnieniem tłumaczenia mowy na mowę. Model ten bezpośrednio przetwarza surowy strumień dźwięku, zachowując intonację, rytm i wysokość dźwięku głośnika. Superaplikacja Grab z Azji Południowo-Wschodniej bada komunikację międzyjęzykową między kierowcami a pasażerami, a użytkownicy inicjują ponad 10 milionów połączeń głosowych każdego miesiąca. Deweloperzy mogą tworzyć aplikacje, integrując LiveKit, Fishjam, Pipecat lub Vision Agents za pośrednictwem API Gemini Live. LiveKit umożliwił wielojęzyczne zrozumienie w czasie rzeczywistym w wirtualnych salach konferencyjnych; Software Mansion przełamuje wąskie gardła strumieniowe dzięki protokołowi MoQ; VisionAgents AI zaprezentowało dynamiczne możliwości przełączania się na wiele języków. Deweloperzy mogą wypróbować i uzyskać dostęp do przykładowego kodu Cookbook w Google AI Studio.
Google AI 发布 Gemini 3.5 Live Translate,支持 70+ 语言、近实时延迟的语音到语音翻译。
该模型直接处理原始音频流,保留说话者语调、节奏和音高。
东南亚超级应用 Grab 正探索将其用于司机与乘客间的跨语言沟通,其用户每月发起超 1000 万次语音通话。
开发者可通过 Gemini Live API 集成 LiveKit、Fishjam、Pipecat 或 Vision Agents 构建应用。
LiveKit 已实现虚拟会议室多语言即时理解;
Software Mansion 结合 MoQ 协议突破流媒体瓶颈;
VisionAgents AI 展示了动态多语言切换能力。
开发者可在 Google AI Studio 试用并获取 Cookbook 示例代码。