SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。
其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。
SANA-Video 2.0 adalah sebuah Transformer difusi video hybrid, tersedia dalam dua skala yaitu 5B dan 14B, dapat menghasilkan video hingga 720p pada satu GPU...
SANA-Video 2.0 adalah sebuah Transformer difusi video hybrid, tersedia dalam dua skala yaitu 5B dan
14B, dapat menghasilkan video hingga 720p pada satu GPU. Hybrid Linear-Softmax Attention-nya mencampur perhatian linier dan softmax dalam rasio 3:1, dan dengan Block Attention Residuals meningkatkan peringkat efektif lapisan dalam sekitar 12%.
SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。
其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。
SANA-Video 2.0 是混合视频扩散 Transformer,包含 5B 与 14B 两种规模,公开材料称其可在单 GPU 上生成最高 720p 视频。
该模型采用 Hybrid Linear-Softmax Attention,按 3:1 比例混合线性与 softmax 注意力,并引入 Block Attention Residuals。
Aioga 判断,方案重点是在视频生成中组合不同注意力机制,并通过残差设计改善深层表示;其实际效率与生成质量仍需更多公开结果支撑。
材料称 Block Attention Residuals 可将深层有效秩提升约 12%。这可能为控制视频扩散 Transformer 的计算负担与深层表示能力提供研究参考。 值得关注后续是否披露 5B 与 14B 模型的生成速度、显存占用、质量评测和测试条件,以验证单 GPU 生成最高 720p 视频的适用范围。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
Sumber: HuggingFace Daily Papers(社区热门论文)
原文链接: Buka sumber asli
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-23T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。