SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。
其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。
SANA-Video 2.0 はハイブリッド動画拡散トランスフォーマーで、5B と 14B の二つの規模を提供し、単一 GPU 上で最大 720p の動画を生成できます。そのハイブリッド・リニア-ソフトマックス注意機構は、3:1 の比率で線形注意とソフトマックス注意を混合し、ブロック注意残差と組み合わせること...
SANA-Video 2.0 はハイブリッド動画拡散トランスフォーマーで、5B と 14B の二つの規模を提供し、単一 GPU 上で最大 720p の動画を生成できます。
そのハイブリッド・リニア-ソフトマックス注意機構は、3:1 の比率で線形注意とソフトマックス注意を混合し、ブロック注意残差と組み合わせることで深層の有効ランクを約 12% 向上させます。
SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。
其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。
SANA-Video 2.0 是混合视频扩散 Transformer,包含 5B 与 14B 两种规模,公开材料称其可在单 GPU 上生成最高 720p 视频。
该模型采用 Hybrid Linear-Softmax Attention,按 3:1 比例混合线性与 softmax 注意力,并引入 Block Attention Residuals。
Aioga 判断,方案重点是在视频生成中组合不同注意力机制,并通过残差设计改善深层表示;其实际效率与生成质量仍需更多公开结果支撑。
材料称 Block Attention Residuals 可将深层有效秩提升约 12%。这可能为控制视频扩散 Transformer 的计算负担与深层表示能力提供研究参考。 值得关注后续是否披露 5B 与 14B 模型的生成速度、显存占用、质量评测和测试条件,以验证单 GPU 生成最高 720p 视频的适用范围。
取得元が提供するタイトル、要約、出典、元記事リンクを掲載しています。記事全文は転載していません。
取得経路: 要約集約 · 元ドメイン: arxiv.org
出典: HuggingFace Daily Papers(社区热门论文)
元記事: 元記事を開く
Aioga アーカイブ: 情報ページを開く
Content record: summary-fallback · Updated: 2026-07-23T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga は世界の AI 動向を集約し、確認と引用のため出典情報を保持します。