通义实验室发布 Wan-Streamer v0.2,这是一款将"听、看、说、演"统一进单个 Transformer 的端到端全模态模型。
其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
Tongyi Lab has released Wan-Streamer v0.2, an end-to-end full-modal model that integrates "listening, watching, speaking, and performing" into a single Tra...
Tongyi Lab has released Wan-Streamer v0.2, an end-to-end full-modal model that integrates
"listening, watching, speaking, and performing" into a single Transformer. Its end-to-end response latency is only 550ms, output resolution has been increased from 192×336 in v0.1 to 640×368 @ 25FPS, and it uses a Thinker-Performer dual-channel architecture to improve image quality while maintaining ultra-low latency.
通义实验室发布 Wan-Streamer v0.2,这是一款将"听、看、说、演"统一进单个 Transformer 的端到端全模态模型。
其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
通义实验室发布端到端全模态模型 Wan-Streamer v0.2,将“听、看、说、演”统一进单个 Transformer,端到端响应延迟为 550ms。
公开材料显示,v0.2 的输出分辨率由 v0.1 的 192×336 提升至 640×368,并以 25FPS 输出,形成了版本间的明确参数对比。
Aioga 判断,此次更新的核心看点是同时推进输出画质与响应速度,并通过 Thinker-Performer 双通路架构维持较低延迟。
值得关注的是,将多种交互能力统一到单个 Transformer,可能为实时全模态交互提供新的技术路径,但材料未说明实际应用效果。 后续值得关注公开材料是否补充测试环境、延迟口径、画质评测方法及实际场景表现,以便判断这些指标在不同条件下的稳定性。
The readable text on this page was extracted from the public source and organized with attribution, publication time and the original link. Copyright remains with the original author and publisher.
Ingestion channel: Summary aggregation · Source domain: mp.weixin.qq.com
Source: 公众号:通义实验室(千问)
Original link: Open original source
Aioga archive: Open intelligence page
Content record: summary-fallback · Updated: 2026-07-17T07:14:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga aggregates global AI updates and preserves source information for verification and citation.