Aioga
AI资讯 / 模型更新
返回 AI资讯

FLUX 3 x mimic:新一代视频动作模型

Hacker News 热门(buzzing.cc 中文翻译)Aioga 编辑团队2026-07-24T11:55:45.885Z热度 75

Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出...

模型更新Hacker News 热门(buzzing.cc 中文翻译)

今日 AI 情报摘要

Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。

该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。 加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。

中文正文 · AI 翻译

FLUX 3 的早期版本,我们的新型多模态基础模型:https://bfl.ai/blog/flux-3,现在已经在机器人上运行。我们给了 Mimic Robotics:https://www.mimicrobotics.com/ 早期访问 FLUX.3 的机会。他们在机器人学习和部署方面的优势,结合模型的世界知识和 BFL 的基础模型专业知识,产生了 FLUX-mimic:下一代视频动作模型。

FLUX 3 x mimic: The Next Generation of Video-Action Models

FLUX 1 和 FLUX 2 生成功能是生成图像。FLUX 3 扩展到了多模态,并联合生成视听内容——同时也为 FLUX-mimic 提供了基础:这是一个视频动作模型,由 Mimic 协作开发,可在已经在奥迪测试和部署的机器人上运行。

乍一看,生成逼真的视觉内容和控制机器人似乎没有什么共同点。一个需要生成像素,另一个需要理解当你触碰和操作物理世界时它的响应方式。如果一个模型两者都能做到,它从来不只是一个内容生成模型。它是一个世界行为模型,而内容生成只是它可以做的一件事。

FLUX 3 是一个模型,从一开始就跨图像、视频和音频联合训练。训练中最苛刻的部分——占总计算成本的超过 95%——是视频预测。为了生成逼真的视频,模型别无选择,只能学习接触、运动、重量、因果关系;任何一个学错了,看起来就会不对。学习精准地呈现世界意味着学习世界如何运作。

相对而言,音频是容易的模态。它的维度低,细节远少于视频,在带音频的 720p 视频中占不到 0.5% 的 token。一旦模型完成了学习视频理解的艰难工作,它将学习视频和音频之间的因果关系,以预测与唇部动作同步的语音以及与引起物理事件同步的音效。

动作遵循相同的形式:机器人状态的低维表示,与视觉观测紧密关联。动作、音频和视频帧都是单一底层物理现实的部分表示。在模型学习了视频和音频背后的物理过程之后,动作预测并不是一个新的突破——它只是对模型已经建模的现实的另一种观察视角。

如果这种框架是正确的,教 FLUX 3 去预测动作不应产生长期的负面影响:我们预计在模型需要学习动作空间的结构并将其内部世界表示与之对齐的过程中,会出现短暂的扰动期,然后模型会恢复到全性能状态。这正是我们观察到的情况。

在一次大规模训练中,我们将动作预测加入训练计划,并观察其对视频生成质量的影响。在模型开始整合新的动作模态时,人类对文本到视频和图像到视频的评分最初下降了最多 10%。在 3500 步之后,模型在视频生成任务上恢复了之前的全部质量,同时现在也能预测动作。

FLUX 3 x mimic:新一代视频动作模型

每个系列在加入动作预测前都已归一化到自身的质量水平。数值越高越好。

模型必须将动作整合到其输入和输出中——但这样做并没有永久消耗其能力。模型只需学习这种新模态与其现有世界模型的关系。一旦弄明白这一点,原有能力的性能损失就消失了。视频生成与动作预测不需要独立的基础。相同的骨干支撑着两者。

这使得物理人工智能成为 Black Forest Labs 路线图的自然延伸,而不是方向的改变。内容创作是我们多模态 FLUX 3 骨干在图像、视频和音频上的功能。物理人工智能是其在动作上的应用。一个基础模型,以视觉智能为核心,支持两类应用。我们没有构建一个独立的基础模型。我们专注于难点:构建一个理解世界的模型。在其中行动,是这种理解所使能的。

当我们将 FLUX 3 骨干指向实际生产线上的真实自动化任务会发生什么?

这是mimic和BFL创建FLUX-mimic来回答的问题。mimic构建自己的机器人,并在机器人学习、灵巧操控和生产部署方面拥有专业知识;BFL构建视觉基础模型,并提供多模态训练和建模专业知识。我们共同开发了适用于工业需求并集成到mimic全栈部署系统中的新一代通用操控模型。FLUX-mimic是基于FLUX 3骨干的动作视频模型。

我们的理论是,FLUX 3必须学习世界的内部表示才能生成视频。FLUX-mimic遵循这一理论,并从FLUX骨干学习到的世界表示中解码动作。这种方法最早由mimic-video开创,在视频预测路径提取的中间特征基础上训练轻量级动作解码器。

FLUX 3 x mimic:新一代视频动作模型

架构概览:FLUX-mimic是如何构建在FLUX 3之上的

这种方法的成功取决于两个相关但不同的方面:FLUX学习到的世界模型的质量以及该世界模型特征表示的质量。世界模型的质量直接关系到生成质量:如果模型不理解世界的行为,就无法模拟它。然而,即使是最好的世界模型也无法帮助动作解码器,如果它不可访问:如果特征空间在模态之间的因果关系上保持非线性纠缠,那么从特征表示理解这些关系仍然和从原始输入理解它们一样困难——表示质量至关重要。

生成质量和表示质量长期以来一直是分开研究和处理的。生成方法能够产生高质量的世界模型,使模拟成为可能,并且它们在计算投资上表现出可预测的规模规律。然而,与更专门的表示学习方法相比,它们产生的表示较不易解耦,这限制了其在需要世界理解的任务中的用途。

由于生成模型本身依赖于它们自己的特征,它们在表示质量上的差异似乎有些不合常理。生成模型中表示的改进应当提升其世界模型的质量,并使其在下游任务中更可用。在我们的工作《Self-Flow:https://bfl.ai/research/self-flow》中,我们展示了如何在单一框架中统一生成与表示学习,并正是观察到了这种相互促进的改进:世界模型得到了提升——通过视频、图像和音频生成质量来衡量——其表示质量也提升了——通过机器人控制任务在仿真中的成功率来衡量。

FLUX 3 x mimic:新一代视频动作模型

Self-Flow 与 Flow Matching (FM) 对比。左图:每种模态的生成误差(Fréchet距离),均归一化为 FM=100(数值越低越好)。右图:在微调后四组任务中的操作任务成功率平均值(数值越高越好)。

Self-Flow 的扩展规律依旧成立,而 FLUX 3 是这一规律的应用:Self-Flow 的扩大版本。它在数千万小时的一般视频内容上进行训练,从第一天起就尽可能广泛地学习世界动态,并在数十万小时的以人类和机器人操作任务为重点的视频内容上训练,以准备作为视觉智能的核心。这种规模化将 Self-Flow 的实验室成功转化为现实。模拟实际工厂应用中 FLUX-mimic:覆盖生产和物流工作的日常场景——将零件放入结构化托盘,将电子控制单元插入紧密配合的夹具中,组装组件,以及处理传统自动化无法接触的柔软、灵活材料如密封件和电缆。

基准测试显示,即使 FLUX 骨干网络完全冻结,动作解码器也超过了以往的视觉-语言-动作模型——在这种设置下,以往模型无法成功。这凸显了规模化赋予我们的骨干网络丰富的世界知识及操作能力,以及 Self-Flow 如何使这些知识可以从骨干网络的特征表示中轻松解码。当骨干网络与动作解码器一起进行微调时,FLUX-mimic 达到最先进的成功率。

FLUX 3 x mimic:新一代视频动作模型

虚线表示每个模型在 20 次自主试验中的中位成功率。数值越高越好。

一个在可解码表示中暴露世界知识的骨干网络,会改变教机器人新任务所需的方式。如果物理知识已经包含在表示中并且易于获取,适应一个任务就不再是教模型世界如何运作——它只需学习这个特定任务如何映射到它已知的知识上。昂贵的部分在机器人开始移动之前就已经完成。

这一点直接体现在新任务所需的示范数据量上。在我们的 Self-Flow 实验中,与没有 Self-Flow 的视频模型相比,动作预测在训练步数上只需一半即可达到相同的成功率——更好的表示使世界知识更容易提取,因此达到相同能力所需的数据更少。mimic-video 论文报告视频动作模型比视觉-语言-动作模型的样本效率高达 10 倍;FLUX-mimic 结合了这两种效果。

同样的好处也体现在行为上。FLUX-mimic 天然能够从失败中恢复:机器人抓取失败后会自我纠正,再次抓取并完成任务。任何示范集都不可能覆盖任务可能出错的每种情况。未曾示范的恢复必须来源于别的地方——来自一个已经知道世界如何运作的模型。

骨干网络预测的未来(上图),以及机器人从解码动作产生的展开结果(下图)。

现实世界部署提出了一个硬性约束:模型必须像世界一样快速行动。FLUX-mimic 的主要计算成本在骨干网络中。它是模型中最大的组成部分,在 mimic 优化的部署堆栈中,其延迟实际上决定了整个系统的上限。

这也是我们方法论第二次体现价值的地方。更好的表示意味着每个参数具备更多能力:一个学习了结构良好的世界模型的模型,比未学习的模型达到同一性能水平所需的容量更少。对于部署来说,这直接转化为能够运行一个更小的骨干网络——更小的骨干网络意味着更快的骨干网络。

FLUX 3 x mimic:新一代视频动作模型

在100万次训练步骤的CLIP评分;分数越高越好。主干网络的深度是部署延迟的主要驱动因素,因此更少的层意味着模型运行更快。

因此,FLUX-mimic的主干网络可以优化到在单个NVIDIA RTX 5090 GPU上从输入到世界表示的时间少于80毫秒——这与人类视觉反应时间处于同一数量级。

实际部署需要对完整部署堆栈进行额外优化,以避免增加任何额外延迟:mimic 的优化涵盖从动作解码器,到传感器、模型与执行器之间的进程间延迟消减,再到实时分块,使预测和执行重叠,保持机器人平稳运行而无抖动。最终结果是一个反应时间为101毫秒的自包含机器人系统。

所有这些都回到了自动化最重要的地方:工厂。奥迪运营着汽车行业中最自动化的生产网络之一——这让它对传统自动化仍然止步的环节有清晰的认识。尽管机器人技术投资已达数十年,但涉及灵活零件和精细操作的任务仍然依赖人工,这在很大程度上出于经济原因:高端生产的品类多样性使得常规编程的机器人单元在每种情况下重新设计成本过高。基于学习的系统改变了这种计算方式。

“与mimic合作,奥迪一直在测试和部署FLUX-mimic。我们已经看到这些机器人能够完成传统机器人技术根本无法实现的复杂软体操作工作。这对于辅助员工、提高效率,以及在生产和物流操作中扩展灵活自动化来说都具有重大影响。对于我们来说,与mimic和Black Forest Labs等先锋公司合作,对于推动物理人工智能前沿并在实际生产环境中验证这些创新至关重要。”——奥迪生产实验室,Christoph Schneider

FLUX-mimic 是一个专门构建的机器人模型——也是未来发展的一个验证实例。它的样本效率和鲁棒性源自 FLUX 3 的骨干网络以及它所展现的高质量表示,而非特定任务的工程设计。这正是该方法能够跨任务、跨行业和跨硬件进行迁移的原因。通过 mimic 阅读更多内容:https://www.mimicrobotics.com/blog/introducing-flux-mimic。

一个模型,以视觉智能为核心,能够生成图像、视频和音频——并驱动生产线上的机器人。内容创作和物理 AI 是同一基础的两种应用。

情报判断

Aioga 编辑摘要

Black Forest Labs 公开 FLUX 3 早期版本,该模型从训练之初联合处理图像、视频与音频,并与 mimic 合作形成视频动作模型 FLUX-mimic,相关机器人已在奥迪测试和部署。

背景分析

FLUX 1 和 FLUX 2 主要生成图像,FLUX 3 扩展至联合生成视听内容。材料称,视频预测占总训练算力成本的 95% 以上,而带音频的 720p 视频中,音频所占令牌不足 0.5%。

Aioga 观点

Aioga 判断,这次更新的重点并非单纯增加一种生成模态,而是尝试把视频、音频与机器人动作视为同一物理现实的不同表征。不过,“世界模型”式解释目前主要来自发布方论述。

影响与后续

加入动作预测后,文本到视频和图像到视频的人类评分最初最多下降 10%,训练 3500 步后恢复此前质量并具备动作预测能力。值得关注的是,该结果来自一次大规模训练运行。 后续值得关注 FLUX-mimic 在更多机器人任务中的测试与部署表现,以及视频质量恢复现象能否在不同训练设置下重复。材料尚未提供具体任务成功率、安全指标或与其他模型的对比结果。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: 摘要聚合 · 原始域名: bfl.ai

来源: Hacker News 热门(buzzing.cc 中文翻译)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-24T11:55:45.885Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出...

Hacker News 热门(buzzing.cc 中文翻译)2026-07-24T11:55:45.885Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。