SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。
其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。
SANA-Video 2.0 là một Transformer khuếch tán video hỗn hợp, cung cấp hai quy mô là 5B và 14B, có thể tạo video lên đến 720p trên một GPU duy nhất. Chú ý Hỗ...
SANA-Video 2.0 là một Transformer khuếch tán video hỗn hợp, cung cấp hai quy mô là 5B và 14B, có thể
tạo video lên đến 720p trên một GPU duy nhất. Chú ý Hỗn hợp Tuyến tính-Softmax của nó trộn tuyến tính và chú ý softmax theo tỷ lệ 3:1, kết hợp với Khối Dư Chú ý để nâng cấp bậc hiệu quả sâu khoảng 12%.
SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。
其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。
SANA-Video 2.0 是混合视频扩散 Transformer,包含 5B 与 14B 两种规模,公开材料称其可在单 GPU 上生成最高 720p 视频。
该模型采用 Hybrid Linear-Softmax Attention,按 3:1 比例混合线性与 softmax 注意力,并引入 Block Attention Residuals。
Aioga 判断,方案重点是在视频生成中组合不同注意力机制,并通过残差设计改善深层表示;其实际效率与生成质量仍需更多公开结果支撑。
材料称 Block Attention Residuals 可将深层有效秩提升约 12%。这可能为控制视频扩散 Transformer 的计算负担与深层表示能力提供研究参考。 值得关注后续是否披露 5B 与 14B 模型的生成速度、显存占用、质量评测和测试条件,以验证单 GPU 生成最高 720p 视频的适用范围。
当前抓取源提供的是标题、摘要、来源和原文入口,不直接搬运完整原文。完整报道请通过下方原文链接前往来源站点查看。
抓取通道: 摘要聚合 · 原始域名: arxiv.org
Nguồn: HuggingFace Daily Papers(社区热门论文)
原文链接: Mở nguồn gốc
Aioga 归档: 查看情报页
Content record: summary-fallback · Updated: 2026-07-23T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。