通义实验室发布 Wan-Streamer v0.2,这是一款将"听、看、说、演"统一进单个 Transformer 的端到端全模态模型。
其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
أصدرت مختبر تونغيي Wan-Streamer v0.2، وهو نموذج متعدد الوسائط من طرف إلى طرف يجمع بين "الاستماع، والمشاهدة، والتحدث، والأداء" في محول واحد. وقت الاستجابة م...
أصدرت مختبر تونغيي Wan-Streamer v0.2، وهو نموذج متعدد الوسائط من طرف إلى طرف يجمع بين "الاستماع،
والمشاهدة، والتحدث، والأداء" في محول واحد. وقت الاستجابة من طرف إلى طرف يبلغ 550 مللي ثانية فقط، ودقة الإخراج ارتفعت من 192×336 في v0.1 إلى 640×368 @ 25FPS، ويستخدم هيكلية Thinker-Performer ثنائية المسار لتحسين جودة الصورة مع الحفاظ على تأخير منخفض للغاية.
通义实验室发布 Wan-Streamer v0.2,这是一款将"听、看、说、演"统一进单个 Transformer 的端到端全模态模型。
其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
通义实验室发布端到端全模态模型 Wan-Streamer v0.2,将“听、看、说、演”统一进单个 Transformer,端到端响应延迟为 550ms。
公开材料显示,v0.2 的输出分辨率由 v0.1 的 192×336 提升至 640×368,并以 25FPS 输出,形成了版本间的明确参数对比。
Aioga 判断,此次更新的核心看点是同时推进输出画质与响应速度,并通过 Thinker-Performer 双通路架构维持较低延迟。
值得关注的是,将多种交互能力统一到单个 Transformer,可能为实时全模态交互提供新的技术路径,但材料未说明实际应用效果。 后续值得关注公开材料是否补充测试环境、延迟口径、画质评测方法及实际场景表现,以便判断这些指标在不同条件下的稳定性。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: mp.weixin.qq.com
المصدر: 公众号:通义实验室(千问)
原文链接: فتح المصدر الأصلي
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-17T07:14:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。