通义实验室发布 Wan-Streamer v0.2,这是一款将"听、看、说、演"统一进单个 Transformer 的端到端全模态模型。
其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
Tongyi लैब ने Wan-Streamer v0.2 जारी किया, यह एक एंड-टू-एंड ऑल-मॉडल मॉडल है जो "सुनना, देखना, बोलना, प्रदर्शन करना" को एक ही Transformer में एकीकृत करता है...
Tongyi लैब ने Wan-Streamer v0.2 जारी किया, यह एक एंड-टू-एंड ऑल-मॉडल मॉडल है जो "सुनना, देखना, बोलना,
प्रदर्शन करना" को एक ही Transformer में एकीकृत करता है। इसका एंड-टू-एंड प्रतिक्रिया विलंब केवल 550ms है, आउटपुट रिज़ॉल्यूशन v0.1 के 192×336 से बढ़कर 640×368 @ 25FPS हो गया है, और Thinker-Performer डुअल-पाथ आर्किटेक्चर का उपयोग करके चित्र गुणवत्ता बढ़ाते हुए बेहद कम विलंब बनाए रखा गया है।
通义实验室发布 Wan-Streamer v0.2,这是一款将"听、看、说、演"统一进单个 Transformer 的端到端全模态模型。
其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
通义实验室发布端到端全模态模型 Wan-Streamer v0.2,将“听、看、说、演”统一进单个 Transformer,端到端响应延迟为 550ms。
公开材料显示,v0.2 的输出分辨率由 v0.1 的 192×336 提升至 640×368,并以 25FPS 输出,形成了版本间的明确参数对比。
Aioga 判断,此次更新的核心看点是同时推进输出画质与响应速度,并通过 Thinker-Performer 双通路架构维持较低延迟。
值得关注的是,将多种交互能力统一到单个 Transformer,可能为实时全模态交互提供新的技术路径,但材料未说明实际应用效果。 后续值得关注公开材料是否补充测试环境、延迟口径、画质评测方法及实际场景表现,以便判断这些指标在不同条件下的稳定性。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: mp.weixin.qq.com
स्रोत: 公众号:通义实验室(千问)
原文链接: मूल स्रोत खोलें
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-17T07:14:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。