Aioga
AI资讯 / AI资讯
返回 AI资讯

Fine-tune video and image models at scale with NVIDIA NeMo Automodel and Diffusers

Hugging Face:Blog(RSS)Aioga 编辑团队2026-07-17T15:57:54.000Z热度

Fine-tune video and image models at scale with NVIDIA NeMo Automodel and Diffusers。该动态由...

AI资讯Hugging Face:Blog(RSS)

今日 AI 情报摘要

Fine-tune video and image models at scale with NVIDIA NeMo Automodel and Diffusers。

该动态由 Hugging Face:Blog(RSS) 发布,Aioga 已同步发布时间、来源和原文入口,并将继续跟踪官方更新与行业反馈。

中文正文 · AI 翻译

目录:#table-of-contents 什么是 NeMo Automodel?:#what-is-nemo-automodel 支持的扩散模型:#supported-diffusion-models 此次合作解锁的内容:#what-this-collaboration-unlocks 微调工作流程概览:#a-look-at-the-fine-tuning-workflow 1. 预编码数据集:#1-pre-encode-the-dataset 2. 使用现有 FLUX YAML 启动训练:#2-launch-training-with-the-existing-flux-yaml 3. 从微调的检查点生成:#3-generate-from-the-fine-tuned-checkpoint 4. 性能:#4-performance 其他微调/LoRA 示例:#other-finetunedlora-examples 今天就试试:#try-it-today 即将推出:Python 风格的配方 API:#coming-next-pythonic-recipe-apis 资源:#resources NVIDIA 和 Hugging Face 的联合发布。特别感谢 Hugging Face 的 Sayak Paul 对集成工作的贡献,以及共同撰写此博客。

Fine-tune video and image models at scale with NVIDIA NeMo Automodel and  Diffusers
Fine-tune video and image models at scale with NVIDIA NeMo Automodel and  Diffusers

扩散模型驱动了过去两年一些最令人兴奋的开源发布,例如用于文本到图像的 FLUX.1-dev:https://huggingface.co/black-forest-labs/FLUX.1-dev 以及 Wan 2.1:https://huggingface.co/Wan-AI/Wan2.1-T2V-1.3B-Diffusers 和 HunyuanVideo:https://huggingface.co/hunyuanvideo-community/HunyuanVideo-1.5-Diffusers-720p_t2v 用于文本到视频。🤗 Diffusers:https://github.com/huggingface/diffusers 库已经成为这些模型的事实标准归属,为研究人员和开发者提供一个单一、一致的接口用于推理、适配和流水线组合。

此外,扩散模型的训练和微调也在不断增加,这需要提供高效内存分片、潜变量缓存、多分辨率分桶以及能够从单 GPU 平滑扩展到数百 GPU 的配置的工具。

为了满足这些技术需求,我们提供了 NVIDIA NeMo Automodel:https://github.com/NVIDIA-NeMo/Automodel 开源库。今天,我们重点介绍 NVIDIA 和 Hugging Face 之间的合作,将生产级分布式扩散训练带到 Hugging Face Hub 上的任何 Diffusers 格式模型——无需检查点转换,无需为任何新模型重写代码。此集成记录在 Diffusers 训练指南中:https://docs.nvidia.com/nemo/automodel/recipes-e2e-examples/diffusion-fine-tuning,并且完全开源,遵循 Apache 2.0。

NeMo Automodel 是一个开源的 PyTorch DTensor 原生训练库,是 NVIDIA NeMo 框架的一部分,其设计围绕着对 Diffusers 生态系统重要的两个原则:

AutoModel 目前仅支持流匹配模型。在底层,它使用流匹配作为训练目标,通过潜在空间训练(使用预编码的 VAE 输出)和多分辨率桶式数据加载来加速吞吐量。

NeMo Automodel 集成提供了现成的微调方案,适用于以下开源扩散模型。该列表反映了当前位于 examples/diffusion/finetune 中的方案。

对于 Diffusers 用户来说,实际收益可以分解为几个具体能力。

无需检查点转换。来自 Hub 的预训练权重开箱即用。无需进行单独的“训练格式”转换再转换回去。你微调后的检查点可以直接加载到 DiffusionPipeline 进行推理,或者上传回 Hub 分享。下游工具——量化、编译、LoRA 适配器、自定义采样器——都可以继续使用。

快速支持新模型。当一个新的扩散模型加入 Diffusers 时,在 NeMo Automodel 中启用它只需少量、独立的代码添加——一个数据预处理处理器和一个模型适配器——而不需要完整的自定义训练脚本。其余的方案堆栈(FSDP2、桶式数据加载、检查点保存、生成)保持不变,并且同样适用 YAML 驱动的工作流程。

完整且参数高效的微调。支持完整微调和 LoRA 风格的 PEFT,因此你可以在最大质量(在大型集群上进行完整 FT)或最大效率(在单节点上进行 LoRA)之间进行选择。同样的方案结构可以处理两者。

可扩展训练,超越内置脚本提供的能力。NeMo Automodel 添加了如 FSDP2、张量、上下文和流水线并行的分片方案,多节点编排(当前为 SLURM,未来支持 Kubernetes)以及多分辨率分桶。这些能力使得训练更大模型如 FLUX.1-dev(12B)和 HunyuanVideo(13B)成为可能。

在本节中,我们将演示对任何支持的模型进行微调的典型工作流程。推荐安装 Automodel 的方式是使用 NeMo Automodel Docker 容器(nvcr.io/nvidia/nemo-automodel:26.06),该容器预装了 PyTorch、TransformerEngine 以及其他 CUDA 编译的依赖项。或者,也可以通过 pip3 安装:pip3 install nemo-automodel,或从源码安装:pip3 install git+https://github.com/NVIDIA-NeMo/Automodel.git;所有安装选项请参见安装指南:https://docs.nvidia.com/nemo/automodel/latest/get-started/installation。

本指南演示了在 78 张 Rider–Waite 塔罗牌数据集(https://huggingface.co/datasets/multimodalart/1920-raider-waite-tarot-public-domain)上对 FLUX.1-dev 进行完整 Transformer 微调,然后从生成的检查点进行生成。它重复使用已提交的 YAML 配置,并将运行特定设置作为命令行覆盖应用,因此无需新的配置文件。

扩散训练方案在每次训练步骤中使用缓存的 VAE 潜变量和文本嵌入,而不是重新编码源图像。直接从 Hugging Face 流式获取 78 张 Rider–Waite 图像,并将预处理分配到所有可见 GPU 上:

标题中已经包含 trtcrd 触发词令牌。基于此像素预算和数据集的人像纵横比,预处理将样本分配到展示运行使用的 384×640 桶中。

对于图像训练,预处理会生成 .pt 缓存文件和分片元数据:

直接使用 examples/diffusion/finetune/flux_t2i_flow.yaml。该 YAML 已选择 FLUX.1-dev、完整 Transformer 微调、FLUX 流匹配适配器,有效批量大小为 32,并使用八路 FSDP2。

将塔罗牌特定的路径和设置作为命令行覆盖提供:

运行会在步骤 50、100、150 和 200 生成检查点。最终检查点标记为 epoch_66_step_199;该标签为零起始,即使它表示已完成的第 200 个优化器步骤。

使用现有的 FLUX 生成 YAML,并将 model.checkpoint 指向完整训练检查点:

包含 trtcrd 以调用学习到的塔罗牌风格。作为对照比较,保持种子和场景固定,但省略触发词令牌:

在步骤200中,被触发的宇航员提示保持其要求的内容,同时获得奶油色、红色和黑色的复古调色板、厚重的墨线轮廓、平面色域、旧纸张色调以及寓言卡片构图。未触发的宇航员保持摄影风格,这表明所学效果主要与trtcrd相关,而不是全局替换基础模型。

所有测量均在一台配置8× NVIDIA H100 80GB GPU的节点上收集。结果为三个稳态10步窗口的平均值 ± 样本标准差。

每个样本为一个49帧的视频剪辑。

微调和LoRA的结果展示了NeMo Automodel在领域专属化方面的强大能力。例如,将Wan 2.1模型在吉卜力视频数据集上进行微调,成功地调整了输出风格,通过与基线相比花朵外观的明显变化得到验证。

我们还观察到了使用LoRA的独特影响,将适配器应用到Wan 2.1后,视频呈现出典型的吉卜力风格,尤其在角色眼睛的高光表现上非常明显。

这些案例,包括FLUX.2的示例,确认用户可以通过完全微调实现最高质量,也可以通过LoRA风格的PEFT实现最高效率,从而将输出定制到特定的风格领域。

了解更多集成信息并查看更多微调示例,请参阅NeMo Automodel文档:https://docs.nvidia.com/nemo/automodel/recipes-e2e-examples/diffusion-fine-tuning

YAML非常适合可复现的配置,尤其适合希望拥有可提交、可审阅、可重复使用文件的团队,但许多团队也需要编程接口。

在即将发布的NeMo Automodel版本中,我们计划通过完全类型化的Python API展示扩散配方。用户将能够直接通过Python组合相同的模型、数据、优化器、PEFT/LoRA、并行性、检查点和生成组件。

Python化路径旨在使配方更容易从现有训练代码、笔记本和实验工作流中使用,并提供与YAML快速入门路径并行的优质Python接口。

情报判断

Aioga 编辑摘要

Aioga 编辑摘要:NVIDIA 与 Hugging Face 合作,通过 NeMo Automodel 开源库为任意 Diffusers 格式模型提供生产级分布式扩散训练,无需检查点转换或模型重写。 Aioga 将其归入「AI资讯」方向,重点关注它对真实使用和行业竞争的影响。

背景分析

背景分析:模型与研究类动态需要结合能力边界、开放方式、成本、可用性和真实任务表现判断,单项指标领先不等于已经形成稳定采用。

Aioga 观点

Aioga 判断:这条动态更适合作为行业观察信号,当前信息足以建立线索,但不足以推导长期结论。

影响与后续

影响分析:对相关团队而言,短期应先核对来源、可用范围和实际成本,再判断是否值得接入或跟进。 后续观察:继续观察官方文档、实际可用性、价格变化、开发者反馈和竞品回应。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: huggingface.co

来源: Hugging Face:Blog(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-17T15:57:54.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Fine-tune video and image models at scale with NVIDIA NeMo Automodel and Diffusers。该动态由...

Hugging Face:Blog(RSS)2026-07-17T15:57:54.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。