通义实验室发布 Wan-Streamer v0.2,这是一款将"听、看、说、演"统一进单个 Transformer 的端到端全模态模型。
其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
통이 랩은 '듣기, 관찰, 말하기, 연주'를 하나의 트랜스포머로 통합한 종단 간 풀 모달 모델인 Wan-Streamer v0.2를 출시했습니다. 종단 간 응답 지연 시간은 단 550ms에 불과하며, 출력 해상도는 v0.1의 192×336에서 640×368 @ 25FPS로 향상되...
통이 랩은 '듣기, 관찰, 말하기, 연주'를 하나의 트랜스포머로 통합한 종단 간 풀 모달 모델인 Wan-Streamer v0.2를 출시했습니다. 종단 간 응답 지연 시간은 단
550ms에 불과하며, 출력 해상도는 v0.1의 192×336에서 640×368 @ 25FPS로 향상되었고, 초저지연을 유지하면서 화질을 향상시키는 Thinker-Performer 듀얼 채널 아키텍처를 사용합니다.
通义实验室发布 Wan-Streamer v0.2,这是一款将"听、看、说、演"统一进单个 Transformer 的端到端全模态模型。
其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。
通义实验室发布端到端全模态模型 Wan-Streamer v0.2,将“听、看、说、演”统一进单个 Transformer,端到端响应延迟为 550ms。
公开材料显示,v0.2 的输出分辨率由 v0.1 的 192×336 提升至 640×368,并以 25FPS 输出,形成了版本间的明确参数对比。
Aioga 判断,此次更新的核心看点是同时推进输出画质与响应速度,并通过 Thinker-Performer 双通路架构维持较低延迟。
值得关注的是,将多种交互能力统一到单个 Transformer,可能为实时全模态交互提供新的技术路径,但材料未说明实际应用效果。 后续值得关注公开材料是否补充测试环境、延迟口径、画质评测方法及实际场景表现,以便判断这些指标在不同条件下的稳定性。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.
수집 채널: 요약 집계 · 원본 도메인: mp.weixin.qq.com
출처: 公众号:通义实验室(千问)
원문 링크: 원문 열기
Aioga 아카이브: 정보 페이지 보기
Content record: summary-fallback · Updated: 2026-07-17T07:14:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga는 전 세계 AI 동향을 집계하고 확인과 인용을 위해 출처 정보를 보존합니다.