{"@context":"https://schema.org","@type":"NewsArticle","generatedAt":"2026-08-07T02:00:35.291Z","headline":"字节 Seed 发布 SeedRealtime 音视频全双工大模型，走向全模态自然交互","description":"字节 Seed 发布 SeedRealtime，用统一架构原生融合音频、视频与文本，实现\"边看、边听、边说\"的实时交互。相比级联模型，其音视频对话节奏问题减少一半，并已在豆包 App 全量上线，率先实现音视频全双工技术的规模化落地。","url":"https://www.aioga.com/news/cmsfkn6cf03ciroch6tfynepy/","mainEntityOfPage":"https://www.aioga.com/news/cmsfkn6cf03ciroch6tfynepy/","datePublished":"2026-08-04T16:00:00.000Z","dateModified":"2026-08-04T16:00:00.000Z","inLanguage":"zh-CN","publisher":{"@type":"NewsMediaOrganization","name":"Aioga","url":"https://www.aioga.com"},"citation":["https://seed.bytedance.com/zh/blog/seedrealtime-%E9%9F%B3%E8%A7%86%E9%A2%91%E5%85%A8%E5%8F%8C%E5%B7%A5%E5%A4%A7%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83-%E8%B5%B0%E5%90%91%E5%85%A8%E6%A8%A1%E6%80%81%E8%87%AA%E7%84%B6%E4%BA%A4%E4%BA%92","https://aihot.virxact.com/items/cmsfkn6cf03ciroch6tfynepy"],"canonicalUrl":"https://www.aioga.com/news/cmsfkn6cf03ciroch6tfynepy/","directAnswer":{"@type":"Answer","text":"字节 Seed 发布 SeedRealtime，以统一架构原生融合音频、视频与文本，可在连续多模态信息流中实现“边看、边听、边说”的实时交互。目前，该模型已在豆包 App 全量上线。","url":"https://www.aioga.com/news/cmsfkn6cf03ciroch6tfynepy/","dateCreated":"2026-08-04T16:00:00.000Z","author":{"@type":"Organization","@id":"https://www.aioga.com/authors/aioga-editorial/#editorial-team","name":"Aioga Editorial Team","url":"https://www.aioga.com/authors/aioga-editorial/"}},"evidence":[{"@type":"CreativeWork","name":"字节 Seed：Research Feed（网页内嵌数据） source article","url":"https://seed.bytedance.com/zh/blog/seedrealtime-%E9%9F%B3%E8%A7%86%E9%A2%91%E5%85%A8%E5%8F%8C%E5%B7%A5%E5%A4%A7%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83-%E8%B5%B0%E5%90%91%E5%85%A8%E6%A8%A1%E6%80%81%E8%87%AA%E7%84%B6%E4%BA%A4%E4%BA%92","datePublished":"2026-08-04T16:00:00.000Z","provider":{"@type":"Organization","name":"字节 Seed：Research Feed（网页内嵌数据）","url":"https://seed.bytedance.com/zh/blog/seedrealtime-%E9%9F%B3%E8%A7%86%E9%A2%91%E5%85%A8%E5%8F%8C%E5%B7%A5%E5%A4%A7%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83-%E8%B5%B0%E5%90%91%E5%85%A8%E6%A8%A1%E6%80%81%E8%87%AA%E7%84%B6%E4%BA%A4%E4%BA%92"}},{"@type":"CreativeWork","name":"AIHot archive record","url":"https://aihot.virxact.com/items/cmsfkn6cf03ciroch6tfynepy","datePublished":"2026-08-04T16:00:00.000Z","provider":{"@type":"Organization","name":"AIHot","url":"https://aihot.virxact.com/items/cmsfkn6cf03ciroch6tfynepy"}}],"aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","originalPublisher":{"name":"字节 Seed：Research Feed（网页内嵌数据）","url":"https://seed.bytedance.com/zh/blog/seedrealtime-%E9%9F%B3%E8%A7%86%E9%A2%91%E5%85%A8%E5%8F%8C%E5%B7%A5%E5%A4%A7%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83-%E8%B5%B0%E5%90%91%E5%85%A8%E6%A8%A1%E6%80%81%E8%87%AA%E7%84%B6%E4%BA%A4%E4%BA%92"},"geoDeepAnswer":null,"article":{"id":"cmsfkn6cf03ciroch6tfynepy","slug":"cmsfkn6cf03ciroch6tfynepy","url":"https://www.aioga.com/news/cmsfkn6cf03ciroch6tfynepy/","title":"字节 Seed 发布 SeedRealtime 音视频全双工大模型，走向全模态自然交互","title_en":"SeedRealtime 音视频全双工大模型发布：走向全模态自然交互","summary":"字节 Seed 发布 SeedRealtime，用统一架构原生融合音频、视频与文本，实现\"边看、边听、边说\"的实时交互。相比级联模型，其音视频对话节奏问题减少一半，并已在豆包 App 全量上线，率先实现音视频全双工技术的规模化落地。","source":"字节 Seed：Research Feed（网页内嵌数据）","sourceUrl":"https://seed.bytedance.com/zh/blog/seedrealtime-%E9%9F%B3%E8%A7%86%E9%A2%91%E5%85%A8%E5%8F%8C%E5%B7%A5%E5%A4%A7%E6%A8%A1%E5%9E%8B%E5%8F%91%E5%B8%83-%E8%B5%B0%E5%90%91%E5%85%A8%E6%A8%A1%E6%80%81%E8%87%AA%E7%84%B6%E4%BA%A4%E4%BA%92","aiHotUrl":"https://aihot.virxact.com/items/cmsfkn6cf03ciroch6tfynepy","publishedAt":"2026-08-04T16:00:00.000Z","category":"模型更新","score":78,"selected":true,"articleBody":["作为走向全模态交互的关键一步，SeedRealtime 用统一架构原生融合音频、视频与文本，能在连续的多模态信息流上实时交互，带来“边看、边听、边说”的全新体验。它实现了以下三项核心突破：","音视频联合理解： 原生支持声音、画面与时序信息的深度融合。模型既能结合场景消解同音词歧义，也能准确理解视觉中的时序指代，让所见、所闻与所说融为一体。","主动的交互能力： 具备持续的环境感知与主动表达能力。模型能在察觉画面状态变化时（如关键目标出现）主动提醒，并能调用工具融入表达，让交互从被动响应升级为主动协作。","流畅的交互节奏： 能够实时感知用户的对话状态与交流节奏，在适当时机自然接话、停顿与回应；同时具备较强的抗干扰能力，能分辨旁人闲聊与背景噪声，不因干扰误触发，保持沟通的流畅连贯。","端到端人工评测结果显示，相比级联模型，SeedRealtime 的音视频对话节奏问题减少了一半——模型对说话时机的把握更加自然，“话未说完被抢断、话音已落却回应迟缓、或是被背景杂音与闲聊误触发”等卡壳现象显著减少；同时，单次对话能够顺畅、完整交流的概率也有明显提升。","目前，SeedRealtime 已在豆包 App 全量上线，在业界率先实现了音视频全双工技术的规模化落地，欢迎大家体验。","https://seed.bytedance.com/seedrealtime ：https://seed.bytedance.com/seedrealtime","将豆包 App 更新至最新版本，在对话框内选择“打电话”，进入视频通话界面体验即可。","音视频实时交互此前长期卡在两种形态之间：级联系统依赖 ASR、VLM、TTS 等多个模块串联，延迟层层叠加，信息逐级损耗；端到端模型虽更流畅，但不少方案仍依赖外置 VAD 判断轮次，本质上仍接近一问一答的半双工交互。","SeedRealtime 的核心突破，在于将声音、画面、时序与表达统一到同一个端到端模型中。它不是先听完、再看完、最后作答，而是 在连续音视频流上，让感知、理解、决策与表达同步进行，使“听到的”和“看到的”能够共同参与每一次实时判断。","难点首先在于对话节奏。 语音天然带有停顿，可以借此判断何时接话；视频却始终在线、持续变化。模型既要不断理解画面中正在发生什么，又不能因为背景噪声干扰而频繁介入，而是要持续判断该关注哪个对象、该听谁说话，以及此刻是否应该回应。","更深层的挑战在于音视频的联合建模与时序对齐。 用户说“这个怎么弄”时，模型需要结合当前画面、手势、视线与历史动作，判断“这个”具体指向什么；遇到同音词或模糊语音时，也要借助视觉场景完成消歧。只有将声音、画面与时序信息统一建模，模型才能真正把所见、所闻与所说对应起来。当看、听、说被纳入同一套实时决策体系，模型便不再只是等待用户提问，而能持续理解场景变化，在合适的时机主动开口。","接下来，我们通过 7 个具体案例，来看看 SeedRealtime 在真实场景中的表现。","SeedRealtime 能在多人、嘈杂、开放的真实环境中，把画面、声音和时序对齐理解。","四位好友聚餐，人多话杂。用户逐一介绍在场的人，SeedRealtime 就能根据外形特征把名字和人对上 —— 认出浅色头发的七七、戴眼镜的 Julia，还主动和乐乐打招呼；在之后的交谈中，始终把每个人的声音和身份对应起来。","随后大家你一言我一语聊起旅行：有人想去海边拍照、逛海洋馆，有人怕热怕累，还有人对海鲜过敏。 SeedRealtime 能分辨每句话出自谁，并根据大家的交流，给出一份兼顾每个人需求的旅行方案。认人、辨声、听懂各自的需求，这些都在同一场对话里由一个模型实时完成。","在川菜馆，外籍食客面对中文菜单一筹莫展。SeedRealtime 直接从画面中认出菜品、用英语推荐，还能顺着文化背景解释“为什么‘鱼香肉丝’里没有鱼”、“皮蛋是怎么做的”。","服务员上菜时顺道说“很下饭”，它能结合画面中的菜，理解这句话并翻译给客人听。视觉信息无需先转成文字再理解，而是与语音在同一模型里对齐，做到眼前有什么，就能答什么。","模型会根据实时画面的持续变化，自主判断是否需要主动介入，而不必每次都等用户先开口。","在河北博物院逛展，用户交代一句“看到错金银铜虎噬鹿屏座就提醒我”，SeedRealtime 便在镜头不断移动的过程中留意画面，扫过那件展品时出声提醒。","随后，它结合画面细节，讲解错金银四龙四凤铜方案座、长信宫灯等镇馆之宝，以及铸造、错金银、焊接等多种工艺。将任务保存在上下文中、目标出现即提醒，正是持续视觉感知与主动介入能力的体现。","操作一台复杂咖啡机的过程中，模型能够基于视觉状态的变化实现实时纠错与反馈。","当观察到用户把整粒咖啡豆直接倒进萃取手柄时，模型快速指出：“豆子不能直接倒进去，得先磨成细粉”；萃取结束后，它基于对杯中油脂成色与液量的视觉解析，主动给出“下次萃取时间缩短 2-3 秒”的调整建议。无需用户逐步提问，模型便能基于实际场景进行点评。","研读 ResNet 论文时，模型结合网络结构图讲清跳接如何缓解梯度消失；当用户说“帮我盯着，翻到训练参数那部分提醒我”，它便在快速翻页的过程中持续观看画面，准确认出 “3.4 Implementation” 段落并主动叫停，随即报出学习率、动量、权重衰减等关键训练配置。在连续画面流中识别目标并主动叫停，展现了实际交互中的主动协作能力。","轮次判断不再交给外部 VAD 规则，而由 SeedRealtime 基于多模态信息持续决策：该接话时不迟疑，该沉默时不打断，在复杂环境中也能保持更自然的交流节奏。","大兴机场人流密集、环境嘈杂。同伴闲聊时随口提到“老李的航班”，模型并未被这句无关对话触发回复；当用户正式问起，即便航班信息已从画面移出，它仍能结合此前看到的大屏信息，回答实时到达时间，并联网提供行李转盘位置。","随后二人边走边聊往事，它持续观看眼前画面，扫到网约车指示牌时便自然接话，给出上车点的路线指引。嘈杂环境不再是必须过滤的干扰，闲谈里的关键信息也能被恰当留存、在需要时取用。","妈妈在一旁忙着别的事，让 SeedRealtime 陪女儿学习动物英文。背景里爸爸正在接电话、人声不断，模型却没有被这段无关对话带偏，始终跟着女孩手指的方向实时纠音、举例造句。模型该出声时不迟疑，受干扰时不跑偏。","SeedRealtime 的推出，标志着音视频交互迈出了关键一步。通过统一架构原生融合音频、视频与文本，模型得以在连续的多模态流中持续理解场景、判断节奏并作出回应。由此，“边看、边听、边说”真正成为日常可用的交互体验。","然而，现实环境中的音视频交流复杂而连续：背景嘈杂，人声会重叠，画面会变化，用户也会随时停顿、补充或打断。面对这些真实场景中的挑战，未来我们将在以下几个方面继续突破：","更低的延迟与更自然的节奏： 持续压缩“听到—理解—回应”的端到端时延，让打断、抢话、附和与停顿等真实对话中的微妙节奏被自然还原，不只是更快，而是更恰到好处。","更主动的感知与决策： 基于对画面与声音的持续理解，主动判断何时提醒、何时补充、何时递上用户正需要的信息，让模型不仅能“该说话时说话”，也能“该出手时出手”。","更稳健的多人复杂场景： 在嘈杂环境、多人同框与多方对话中，稳定识别“谁在说话、在看什么、该回应谁”，将能力带入更多真实生活与工作场景。","从“能对话”到“能行动”： 打通工具调用与现实世界的连接，让模型不仅能交流与观察，更能协助用户完成查询、预订与任务办理，把实时多模态理解转化为具体行动。","我们希望，AI 交互不再局限于清晰轮次中的问答，而是能在连续变化的真实场景中理解上下文、敏锐把握时机，并在合适的时候提供帮助。"],"articleImages":[{"sourceUrl":"https://lf-flow-web-cdn.doubao.com/obj/flow-doubao/deploy/flow/ai_official_website/88329/static/image/new_qr_code.949b4782.png","alt":"","afterParagraph":34,"url":"/media/articles/cmsfkn6cf03ciroch6tfynepy/e2fb89fa4e00ac07.png"}],"mediaStatus":"ok","articleBodyZh":[],"translationStatus":"","bodyOrigin":"source-page","editorial":{"summary":"字节 Seed 发布 SeedRealtime，以统一架构原生融合音频、视频与文本，可在连续多模态信息流中实现“边看、边听、边说”的实时交互。目前，该模型已在豆包 App 全量上线。","background":"公开材料称，SeedRealtime 聚焦音视频联合理解、主动交互和流畅交互节奏。端到端人工评测显示，相比级联模型，其音视频对话节奏问题减少一半，单次对话顺畅完整交流的概率也有明显提升。","viewpoint":"Aioga 判断，SeedRealtime 的关键意义在于将音频、视频、文本理解与实时表达纳入统一架构，并把环境感知、主动提醒和工具调用融入交互过程，体现了从被动问答向持续多模态协作演进的产品方向。","implications":"值得关注的是，全双工交互可能使模型更自然地处理接话、停顿、背景噪声和画面状态变化。其在豆包 App 全量上线，也可能为观察该技术在真实使用环境中的交互稳定性与体验表现提供基础。","nextStep":"建议后续重点跟踪 Seed 是否披露更完整的评测方法、样本范围及分项结果，并持续观察豆包 App 中视频通话场景的功能变化。当前可将豆包 App 更新至最新版本，通过对话框内“打电话”进入视频通话体验。","evidenceRefs":["title","summary","articleBody","source"],"status":"published","aiGenerated":true,"autoApproved":true,"generatedBy":"aioga-editorial:gpt-5.6-sol","reviewedBy":"aioga-editorial-review:gpt-5.6-sol","generatedAt":"2026-08-05T04:30:05.788Z","sourceHash":"0c9cdc75f9c1980d","review":{"approved":true,"groundedness":94,"clarity":92,"duplicationRisk":12,"blockingIssues":[],"notes":["“从被动问答向持续多模态协作演进的产品方向”属于 Aioga 的观点判断，已明确标注为 viewpoint，未冒充来源事实。","“可能使模型更自然地处理……”属于带有明确不确定性的合理推论，未构成无来源事实断言。","可补充具体原文链接或将 evidenceRefs 映射到更细的段落位置，以增强可追溯性；这不影响当前审核结论。"]},"validation":{"passed":true,"mode":"ai-auto","revisions":0,"checks":["schema","length","source-attribution","low-source-overlap","no-html","independent-ai-review"]}},"tags":["模型更新","字节 Seed：Research Feed（网页内嵌数据）"],"translations":{"zh-CN":{"title":"字节 Seed 发布 SeedRealtime 音视频全双工大模型，走向全模态自然交互","summary":"字节 Seed 发布 SeedRealtime，用统一架构原生融合音频、视频与文本，实现\"边看、边听、边说\"的实时交互。相比级联模型，其音视频对话节奏问题减少一半，并已在豆包 App 全量上线，率先实现音视频全双工技术的规模化落地。","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"字节 Seed 发布 SeedRealtime 音视频全双工大模型，走向全模态自然交互 - Aioga AI资讯","description":"字节 Seed 发布 SeedRealtime，用统一架构原生融合音频、视频与文本，实现\"边看、边听、边说\"的实时交互。相比级联模型，其音视频对话节奏问题减少一半，并已在豆包 App 全量上线，率先实现音视频全双工技术的规模化落地。","url":"https://www.aioga.com/news/cmsfkn6cf03ciroch6tfynepy/"},"en":{"title":"ByteSeed releases the SeedRealtime audio and video full-duplex large model, moving towards fully-modal natural interaction","summary":"Byte Seed released SeedRealtime, which natively integrates audio, video, and text under a unified architecture, achieving real-time interaction of 'watching, listening, and speaking' simultaneously. Compared to cascade models, it reduces the rhythm problems of audio-video dialogue by half, and has been fully launched on the Doubao App, taking the lead in achieving large-scale implementation of full-duplex audio-video technology.","category":"Models","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteSeed releases the SeedRealtime audio and video full-duplex large model, moving towards fully-modal natural interaction - Aioga AI News","description":"Byte Seed released SeedRealtime, which natively integrates audio, video, and text under a unified architecture, achieving real-time interaction of 'watching, listening, and speakin...","url":"https://www.aioga.com/en/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:22:09.941Z"},"ja":{"title":"バイトシード、SeedRealtime 音声・映像全二重大規模モデルを発表、全モーダル自然対話へ","summary":"字節SeedはSeedRealtimeをリリースし、統一アーキテクチャで音声、映像、テキストをネイティブに統合し、「見ながら、聞きながら、話す」というリアルタイムインタラクションを実現しました。カスケードモデルと比べて、音声・映像の対話リズムの問題は半分に減少しており、すでに豆包アプリで全量展開され、音声・映像のフルデュプレックス技術の大規模な実装を先行して実現しています。","category":"モデル更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"バイトシード、SeedRealtime 音声・映像全二重大規模モデルを発表、全モーダル自然対話へ - Aioga AIニュース","description":"字節SeedはSeedRealtimeをリリースし、統一アーキテクチャで音声、映像、テキストをネイティブに統合し、「見ながら、聞きながら、話す」というリアルタイムインタラクションを実現しました。カスケードモデルと比べて、音声・映像の対話リズムの問題は半分に減少しており、すでに豆包アプリで全量展開され、音声・映像のフルデュプレックス技術の大規模な実装を先行して...","url":"https://www.aioga.com/ja/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:22:29.790Z"},"ko":{"title":"바이트 시드, SeedRealtime 오디오·비디오 전이중 대형 모델 발표, 전 모달 자연 상호작용으로 나아가다","summary":"바이트 시드(Byte Seed)는 SeedRealtime를 출시하여, 통합 아키텍처를 통해 오디오, 비디오, 텍스트를 원생적으로 결합하고 '보면서, 들으면서, 말하면서' 실시간 상호작용을 실현합니다. 계단식 모델과 비교하여 오디오 및 비디오 대화의 템포 문제를 절반으로 줄였으며, 이미 두바오(Doubao) 앱에 전체 적용되어 오디오 및 비디오 전이중 기술의 대규모 실현을 선도하고 있습니다.","category":"모델 업데이트","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"바이트 시드, SeedRealtime 오디오·비디오 전이중 대형 모델 발표, 전 모달 자연 상호작용으로 나아가다 - Aioga AI 뉴스","description":"바이트 시드(Byte Seed)는 SeedRealtime를 출시하여, 통합 아키텍처를 통해 오디오, 비디오, 텍스트를 원생적으로 결합하고 '보면서, 들으면서, 말하면서' 실시간 상호작용을 실현합니다. 계단식 모델과 비교하여 오디오 및 비디오 대화의 템포 문제를 절반으로 줄였으며, 이미 두바오(Doubao) 앱에 전체 적용...","url":"https://www.aioga.com/ko/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:23:24.112Z"},"es":{"title":"Byte Seed lanza SeedRealtime, un modelo de gran tamaño de audio y video de doble vía, avanzando hacia la interacción natural multimodal","summary":"Byte Seed lanzó SeedRealtime, que integra de manera nativa audio, video y texto bajo una arquitectura unificada, logrando una interacción en tiempo real de \"ver, escuchar y hablar\". En comparación con los modelos en cascada, reduce a la mitad los problemas de ritmo en los diálogos de audio y video, y ya se ha implementado plenamente en la app Doubao, logrando la primera implementación a escala de la tecnología de doble flujo de audio y video.","category":"Modelos","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"Byte Seed lanza SeedRealtime, un modelo de gran tamaño de audio y video de doble vía, avanzando hacia la interacción natural multimodal - Aioga Noticias de IA","description":"Byte Seed lanzó SeedRealtime, que integra de manera nativa audio, video y texto bajo una arquitectura unificada, logrando una interacción en tiempo real de \"ver, escuchar y hablar\"...","url":"https://www.aioga.com/es/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:23:18.913Z"},"fr":{"title":"Byte Seed a publié le grand modèle audio-vidéo full-duplex SeedRealtime, visant une interaction naturelle entièrement multimodale","summary":"Byte Seed a publié SeedRealtime, intégrant nativement audio, vidéo et texte dans une architecture unifiée, permettant une interaction en temps réel de type « regarder, écouter et parler en même temps ». Par rapport aux modèles en cascade, il réduit de moitié le problème de rythme des conversations audio-vidéo, et a déjà été déployé intégralement sur l'application Doubao, étant le premier à réaliser la mise à l'échelle de la technologie full-duplex audio-vidéo.","category":"Modèles","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"Byte Seed a publié le grand modèle audio-vidéo full-duplex SeedRealtime, visant une interaction naturelle entièrement multimodale - Aioga Actualités IA","description":"Byte Seed a publié SeedRealtime, intégrant nativement audio, vidéo et texte dans une architecture unifiée, permettant une interaction en temps réel de type « regarder, écouter et p...","url":"https://www.aioga.com/fr/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:24:11.185Z"},"de":{"title":"ByteSeed veröffentlicht das SeedRealtime Audio- und Videomodell in Voll-Duplex, auf dem Weg zu multimodaler natürlicher Interaktion","summary":"Byte Seed hat SeedRealtime veröffentlicht, das Audio, Video und Text nativer durch eine einheitliche Architektur integriert und eine Echtzeitinteraktion nach dem Prinzip \"gleichzeitig schauen, hören und sprechen\" ermöglicht. Im Vergleich zu kaskadierten Modellen wird das Timing-Problem bei Audio-Video-Gesprächen halbiert, und es wurde bereits vollständig in der Doubao-App eingeführt, wodurch die flächendeckende Anwendung der Voll-Duplex-Technologie für Audio und Video vorangetrieben wird.","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"ByteSeed veröffentlicht das SeedRealtime Audio- und Videomodell in Voll-Duplex, auf dem Weg zu multimodaler natürlicher Interaktion - Aioga KI-News","description":"Byte Seed hat SeedRealtime veröffentlicht, das Audio, Video und Text nativer durch eine einheitliche Architektur integriert und eine Echtzeitinteraktion nach dem Prinzip \"gleichzei...","url":"https://www.aioga.com/de/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:24:08.825Z"},"pt-BR":{"title":"Byte Seed lança o modelo de grande escala SeedRealtime de áudio e vídeo full-duplex, rumo à interação natural multimodal","summary":"A Byte Seed lançou o SeedRealtime, que integra nativamente áudio, vídeo e texto em uma arquitetura unificada, permitindo a interação em tempo real de \"assistir, ouvir e falar\". Em comparação com modelos em cascata, ele reduz pela metade os problemas de ritmo em diálogos de áudio e vídeo, e já foi totalmente implementado no aplicativo Doubao, alcançando pioneiramente a implementação em larga escala da tecnologia de duplexação total de áudio e vídeo.","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"Byte Seed lança o modelo de grande escala SeedRealtime de áudio e vídeo full-duplex, rumo à interação natural multimodal - Aioga Notícias de IA","description":"A Byte Seed lançou o SeedRealtime, que integra nativamente áudio, vídeo e texto em uma arquitetura unificada, permitindo a interação em tempo real de \"assistir, ouvir e falar\". Em...","url":"https://www.aioga.com/pt-BR/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:24:55.492Z"},"ru":{"title":"Byte Seed выпустила SeedRealtime — полно-дуплексную модель для аудио и видео, движущуюся к полностью модальному естественному взаимодействию","summary":"Byte Seed выпустила SeedRealtime, который с помощью единой архитектуры нативно объединяет аудио, видео и текст, реализуя «смотреть, слушать и говорить» в реальном времени. По сравнению с каскадными моделями, проблемы с ритмом аудио- и видеодиалога сократились вдвое, и уже полностью внедрены в приложении Doubao, став первыми, кто масштабно реализовал технологию полнодуплексного аудио- и видеосвязи.","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"Byte Seed выпустила SeedRealtime — полно-дуплексную модель для аудио и видео, движущуюся к полностью модальному естественному взаимодействию - Aioga Новости ИИ","description":"Byte Seed выпустила SeedRealtime, который с помощью единой архитектуры нативно объединяет аудио, видео и текст, реализуя «смотреть, слушать и говорить» в реальном времени. По сравн...","url":"https://www.aioga.com/ru/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:25:00.167Z"},"ar":{"title":"شركة بايت دنس Seed تطلق نموذجًا كبيرًا للصوت والفيديو ثنائي الاتجاه في الوقت الحقيقي SeedRealtime، متجهة نحو التفاعل الطبيعي متعدد النماذج","summary":"أطلقت شركة Byte Seed منتج SeedRealtime، الذي يدمج الصوت والفيديو والنصوص بشكل أصيل من خلال هيكل موحد، لتحقيق التفاعل في الوقت الحقيقي \"مشاهدة واستماع وتحدث\". بالمقارنة مع النماذج المتتابعة، تم تقليل مشاكل إيقاع الحوار بين الصوت والفيديو إلى النصف، وقد تم إطلاقه بالكامل في تطبيق Doubao، محققًا الريادة في تطبيق تقنية الصوت والفيديو الثنائي الاتجاه على نطاق واسع.","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"شركة بايت دنس Seed تطلق نموذجًا كبيرًا للصوت والفيديو ثنائي الاتجاه في الوقت الحقيقي SeedRealtime، متجهة نحو التفاعل الطبيعي متعدد النماذج - Aioga أخبار الذكاء الاصطناعي","description":"أطلقت شركة Byte Seed منتج SeedRealtime، الذي يدمج الصوت والفيديو والنصوص بشكل أصيل من خلال هيكل موحد، لتحقيق التفاعل في الوقت الحقيقي \"مشاهدة واستماع وتحدث\". بالمقارنة مع النماذج ا...","url":"https://www.aioga.com/ar/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:25:50.577Z"},"hi":{"title":"बाइट सीड ने सीडरीअलटाइम ऑडियो-वीडियो फुल-डुप्लेक्स बड़े मॉडल को जारी किया, सभी मोड्स में प्राकृतिक इंटरैक्शन की ओर बढ़ रहा है","summary":"बाइट सीड ने SeedRealtime लॉन्च किया, जो एक एकीकृत आर्किटेक्चर में ऑडियो, वीडियो और टेक्स्ट को मूल रूप से एकीकृत करता है, और \"देखते समय, सुनते समय, बोलते समय\" की रीयल-टाइम इंटरैक्शन को संभव बनाता है। सीक्वेंसियल मॉडल की तुलना में, इसके ऑडियो-वीडियो संवाद की लय की समस्या आधी हो गई है, और यह पहले ही डूबाओ ऐप में पूरी तरह से लागू हो चुका है, ऑडियो-वीडियो फुल डुप्लेक्स तकनीक की बड़े पैमाने पर उपलब्धता को सबसे पहले हासिल किया है।","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"बाइट सीड ने सीडरीअलटाइम ऑडियो-वीडियो फुल-डुप्लेक्स बड़े मॉडल को जारी किया, सभी मोड्स में प्राकृतिक इंटरैक्शन की ओर बढ़ रहा है - Aioga AI समाचार","description":"बाइट सीड ने SeedRealtime लॉन्च किया, जो एक एकीकृत आर्किटेक्चर में ऑडियो, वीडियो और टेक्स्ट को मूल रूप से एकीकृत करता है, और \"देखते समय, सुनते समय, बोलते समय\" की रीयल-टाइम इंटरैक्शन...","url":"https://www.aioga.com/hi/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:25:52.502Z"},"it":{"title":"Byte Seed ha rilasciato il modello di grande formato audio-video full-duplex SeedRealtime, orientandosi verso l'interazione naturale multimodale","summary":"Byte Seed ha lanciato SeedRealtime, che integra nativamente audio, video e testo attraverso un'architettura unificata, realizzando un'interazione in tempo reale di 'guardare, ascoltare e parlare'. Rispetto ai modelli a cascata, riduce della metà i problemi di ritmo nelle conversazioni audio-video ed è già stato completamente implementato nell'app Doubao, realizzando per la prima volta la messa a terra su larga scala della tecnologia a doppio flusso audio-video.","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"Byte Seed ha rilasciato il modello di grande formato audio-video full-duplex SeedRealtime, orientandosi verso l'interazione naturale multimodale - Aioga Notizie IA","description":"Byte Seed ha lanciato SeedRealtime, che integra nativamente audio, video e testo attraverso un'architettura unificata, realizzando un'interazione in tempo reale di 'guardare, ascol...","url":"https://www.aioga.com/it/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:26:41.825Z"},"nl":{"title":"Byte Seed brengt SeedRealtime-audio- en videomodel met volledige duplexgrootte uit en streeft naar multimodale natuurlijke interactie","summary":"Byte Seed heeft SeedRealtime uitgebracht, dat audio, video en tekst native integreert met een uniforme architectuur, waardoor realtime interactie van 'kijken, luisteren en spreken' mogelijk wordt. In vergelijking met ketenmodellen is het ritmeprobleem van audio-videogesprekken gehalveerd, en het is volledig uitgerold in de Doubao-app, waarmee het als eerste op schaal volledige duplextechnologie voor audio en video realiseert.","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"Byte Seed brengt SeedRealtime-audio- en videomodel met volledige duplexgrootte uit en streeft naar multimodale natuurlijke interactie - Aioga AI-nieuws","description":"Byte Seed heeft SeedRealtime uitgebracht, dat audio, video en tekst native integreert met een uniforme architectuur, waardoor realtime interactie van 'kijken, luisteren en spreken'...","url":"https://www.aioga.com/nl/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:26:33.874Z"},"tr":{"title":"Byte Seed, SeedRealtime ses ve video tam çift yönlü büyük modeli yayınladı, tam modlu doğal etkileşime doğru ilerliyor","summary":"Byte Seed, SeedRealtime'i yayınladı ve birleştirilmiş bir mimari ile ses, video ve metni doğal olarak entegre ederek \"izlerken, dinlerken ve konuşurken\" gerçek zamanlı etkileşim sağlıyor. Zincirleme modellere kıyasla, ses ve video diyaloğu ritmi sorununu yarıya indiriyor ve Doubao uygulamasında tamamen kullanıma sunuldu, ses ve video tam çift yönlü teknolojisinin ölçekli uygulanmasını ilk gerçekleştiren oldu.","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"Byte Seed, SeedRealtime ses ve video tam çift yönlü büyük modeli yayınladı, tam modlu doğal etkileşime doğru ilerliyor - Aioga AI Haberleri","description":"Byte Seed, SeedRealtime'i yayınladı ve birleştirilmiş bir mimari ile ses, video ve metni doğal olarak entegre ederek \"izlerken, dinlerken ve konuşurken\" gerçek zamanlı etkileşim sa...","url":"https://www.aioga.com/tr/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:27:31.229Z"},"vi":{"title":"Byte Seed phát hành mô hình lớn âm thanh và video hai chiều SeedRealtime, tiến tới tương tác tự nhiên đa mô thức","summary":"Byte Seed đã ra mắt SeedRealtime, sử dụng kiến trúc thống nhất tích hợp gốc âm thanh, video và văn bản, thực hiện tương tác thời gian thực \"vừa xem, vừa nghe, vừa nói\". So với mô hình xếp tầng, vấn đề nhịp điệu hội thoại âm thanh và video đã giảm một nửa, và đã được triển khai đầy đủ trên ứng dụng Doubao, tiên phong thực hiện thương mại hóa quy mô công nghệ âm thanh và video song công.","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"Byte Seed phát hành mô hình lớn âm thanh và video hai chiều SeedRealtime, tiến tới tương tác tự nhiên đa mô thức - Tin tức AI Aioga","description":"Byte Seed đã ra mắt SeedRealtime, sử dụng kiến trúc thống nhất tích hợp gốc âm thanh, video và văn bản, thực hiện tương tác thời gian thực \"vừa xem, vừa nghe, vừa nói\". So với mô h...","url":"https://www.aioga.com/vi/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:27:24.146Z"},"id":{"title":"Byte Seed merilis model besar audio dan video full-duplex SeedRealtime, menuju interaksi alami multimodal","summary":"Byte Seed merilis SeedRealtime, menggunakan arsitektur terpadu yang secara native menggabungkan audio, video, dan teks, memungkinkan interaksi real-time \"sambil menonton, sambil mendengar, sambil berbicara\". Dibandingkan dengan model bertingkat, masalah ritme percakapan audio-video berkurang setengah, dan telah diluncurkan sepenuhnya di aplikasi Doubao, menjadi yang pertama mencapai penerapan skala besar teknologi duplex penuh audio-video.","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"Byte Seed merilis model besar audio dan video full-duplex SeedRealtime, menuju interaksi alami multimodal - Berita AI Aioga","description":"Byte Seed merilis SeedRealtime, menggunakan arsitektur terpadu yang secara native menggabungkan audio, video, dan teks, memungkinkan interaksi real-time \"sambil menonton, sambil me...","url":"https://www.aioga.com/id/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:28:14.401Z"},"th":{"title":"Byte Seed เปิดตัวโมเดลขนาดใหญ่ SeedRealtime สำหรับวิดีโอและเสียงแบบสองทาง เตรียมเข้าสู่การโต้ตอบตามสภาพแวดล้อมแบบหลายสื่อ","summary":"Byte Seed เปิดตัว SeedRealtime ด้วยสถาปัตยกรรมนำร่องแบบบูรณาการที่รวมเสียง วิดีโอ และข้อความเข้าด้วยกัน ทำให้สามารถโต้ตอบแบบเรียลไทม์ด้วยการ 'ดู ฟัง และพูดไปพร้อมกัน' เมื่อเทียบกับโมเดลแบบต่อเนื่อง ปัญหาเรื่องจังหวะการสนทนาทางเสียงและวิดีโอถูกลดลงครึ่งหนึ่ง และขณะนี้ได้เปิดให้บริการเต็มรูปแบบในแอป Doubao พร้อมเป็นผู้นำในการนำเทคโนโลยีสื่อสารเสียงและวิดีโอแบบสองทางไปใช้ในระดับขนาดใหญ่","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"Byte Seed เปิดตัวโมเดลขนาดใหญ่ SeedRealtime สำหรับวิดีโอและเสียงแบบสองทาง เตรียมเข้าสู่การโต้ตอบตามสภาพแวดล้อมแบบหลายสื่อ - ข่าว AI Aioga","description":"Byte Seed เปิดตัว SeedRealtime ด้วยสถาปัตยกรรมนำร่องแบบบูรณาการที่รวมเสียง วิดีโอ และข้อความเข้าด้วยกัน ทำให้สามารถโต้ตอบแบบเรียลไทม์ด้วยการ 'ดู ฟัง และพูดไปพร้อมกัน' เมื่อเทียบกับ...","url":"https://www.aioga.com/th/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:28:25.422Z"},"pl":{"title":"Byte Seed wprowadza na rynek SeedRealtime pełnodupleksowy model audio-wideo, zmierzając w kierunku w pełni modalnej naturalnej interakcji","summary":"Byte Seed wprowadza SeedRealtime, który w ramach ujednoliconej architektury natywnie integruje dźwięk, wideo i tekst, umożliwiając \"oglądanie, słuchanie i mówienie\" w czasie rzeczywistym. W porównaniu do modeli kaskadowych, zmniejsza o połowę problemy z rytmem konwersacji audio-wideo i został w pełni wdrożony w aplikacji Doubao, jako pierwszy osiągając skalowalne wdrożenie technologii pełnego dupleksu audio-wideo.","category":"模型更新","source":"字节 Seed：Research Feed（网页内嵌数据）","aggregationSource":"字节 Seed：Research Feed（网页内嵌数据）","pageTitle":"Byte Seed wprowadza na rynek SeedRealtime pełnodupleksowy model audio-wideo, zmierzając w kierunku w pełni modalnej naturalnej interakcji - Aioga Wiadomości AI","description":"Byte Seed wprowadza SeedRealtime, który w ramach ujednoliconej architektury natywnie integruje dźwięk, wideo i tekst, umożliwiając \"oglądanie, słuchanie i mówienie\" w czasie rzeczy...","url":"https://www.aioga.com/pl/news/cmsfkn6cf03ciroch6tfynepy/","contentTranslated":true,"sourceHash":"954dc9428e06f644","translatedAt":"2026-08-05T04:29:18.425Z"}}}}