通义实验室发布 Wan-Streamer v0.2,这是一款将"听、看、说、演"统一进单个 Transformer 的端到端全模态模型。
其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
Tongyi Lab brengt Wan-Streamer v0.2 uit, een end-to-end multimodaal model dat 'luisteren, kijken, spreken en uitvoeren' samenbrengt in één enkele Transform...
Tongyi Lab brengt Wan-Streamer v0.2 uit, een end-to-end multimodaal model dat 'luisteren, kijken,
spreken en uitvoeren' samenbrengt in één enkele Transformer. De end-to-end reactievertraging is slechts 550ms, de uitvoerresolutie is verhoogd van 192×336 in v0.1 naar 640×368 @ 25FPS, en met een Thinker-Performer dubbele pad-architectuur wordt de beeldkwaliteit verbeterd terwijl een zeer lage vertraging behouden blijft.
通义实验室发布 Wan-Streamer v0.2,这是一款将"听、看、说、演"统一进单个 Transformer 的端到端全模态模型。
其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
通义实验室发布端到端全模态模型 Wan-Streamer v0.2,将“听、看、说、演”统一进单个 Transformer,端到端响应延迟为 550ms。
公开材料显示,v0.2 的输出分辨率由 v0.1 的 192×336 提升至 640×368,并以 25FPS 输出,形成了版本间的明确参数对比。
Aioga 判断,此次更新的核心看点是同时推进输出画质与响应速度,并通过 Thinker-Performer 双通路架构维持较低延迟。
值得关注的是,将多种交互能力统一到单个 Transformer,可能为实时全模态交互提供新的技术路径,但材料未说明实际应用效果。 后续值得关注公开材料是否补充测试环境、延迟口径、画质评测方法及实际场景表现,以便判断这些指标在不同条件下的稳定性。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: mp.weixin.qq.com
Bron: 公众号:通义实验室(千问)
原文链接: Open oorspronkelijke bron
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-17T07:14:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。