SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。
其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。
SANA-Video 2.0은 혼합 비디오 확산 Transformer로, 5B 및 14B 두 가지 규모를 제공하며 단일 GPU에서 최대 720p 비디오를 생성할 수 있습니다. 그 Hybrid Linear-Softmax Attention은 선형과 softmax 주의를 3:1 비율로...
SANA-Video 2.0은 혼합 비디오 확산 Transformer로, 5B 및 14B 두 가지 규모를 제공하며 단일 GPU에서 최대 720p 비디오를 생성할 수 있습니다. 그
Hybrid Linear-Softmax Attention은 선형과 softmax 주의를 3:1 비율로 혼합하며, Block Attention Residuals와 함께 깊은 층의 유효 랭크를 약 12% 향상시킵니다.
SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。
其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。
SANA-Video 2.0 是混合视频扩散 Transformer,包含 5B 与 14B 两种规模,公开材料称其可在单 GPU 上生成最高 720p 视频。
该模型采用 Hybrid Linear-Softmax Attention,按 3:1 比例混合线性与 softmax 注意力,并引入 Block Attention Residuals。
Aioga 判断,方案重点是在视频生成中组合不同注意力机制,并通过残差设计改善深层表示;其实际效率与生成质量仍需更多公开结果支撑。
材料称 Block Attention Residuals 可将深层有效秩提升约 12%。这可能为控制视频扩散 Transformer 的计算负担与深层表示能力提供研究参考。 值得关注后续是否披露 5B 与 14B 模型的生成速度、显存占用、质量评测和测试条件,以验证单 GPU 生成最高 720p 视频的适用范围。
수집 피드는 제목, 요약, 출처와 원문 링크를 제공합니다. Aioga는 원문 전체를 재게시하지 않습니다.
수집 채널: 요약 집계 · 원본 도메인: arxiv.org
출처: HuggingFace Daily Papers(社区热门论文)
원문 링크: 원문 열기
Aioga 아카이브: 정보 페이지 보기
Content record: summary-fallback · Updated: 2026-07-23T00:00:00.000Z

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。
立即访问 api.w173.comAioga는 전 세계 AI 동향을 집계하고 확인과 인용을 위해 출처 정보를 보존합니다.