Aioga
AI资讯 / 模型更新
返回 AI资讯

Flux 3 多模态前沿模型发布,支持图像/视频/音频联合学习

Black Forest Labs:Blog(网页)Aioga 编辑团队2026-07-22T16:00:00.000Z热度 59

Flux 3 多模态前沿模型发布,通过联合学习图像、视频和音频构建统一的世界表征。该模型现已开放 Early Access。

模型更新Black Forest Labs:Blog(网页)

今日 AI 情报摘要

Flux 3 多模态前沿模型发布,通过联合学习图像、视频和音频构建统一的世界表征。

该模型现已开放 Early Access。

中文正文 · AI 翻译

FLUX 3 现已提供早期访问。

FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence.

FLUX 3 是我们新的多模态基础模型。它在统一架构中同时从图像、视频和音频中学习,因为它需要学习的不是这些元素的任何一个孤立部分。而是模型必须学习世界的表示:物体如何保持完整,事物如何运动,以及事件听起来如何。

没有单一模态能提供完整的描述。每种模态都是同一底层现实的投影,由不同的传感器捕捉,每种传感器在过程中都会丢失一些信息。图像捕捉特定时间点的空间结构和关系。视频恢复时间维度并揭示时间动态和物理规律。音频揭示机械现象与声学之间的因果关系,这是单靠视觉无法检测的。语言将这些感知与目标、抽象和指令联系起来。

从单一模态学习,你会得到该投影的良好模型。从所有模态同时学习,它们的相互约束让你知道更多:声音必须与撞击匹配,运动必须遵守质量规律,未来必须从过去推导出来。模态不再是分离的,而是关于同一底层现实的证据。

FLUX 3 是我们第一个完全基于这一原理构建的模型,也是我们开发现实世界视觉智能使命的一个里程碑:能够在物理和数字环境中感知、预测和行动的模型。内容创作和物理人工智能的初步结果表明,这是正确的路径。

Flux 3 多模态前沿模型发布,支持图像/视频/音频联合学习

FLUX 3 建立在 Self-Flow(https://bfl.ai/research/self-flow)的基础上,这是我们在相同底层架构中高效对齐多模态生成和理解的方法。基于这一方法,我们显著扩大了计算和数据资源,以便同时跨视频、图像和音频训练 FLUX 3。

Flux 3 多模态前沿模型发布,支持图像/视频/音频联合学习

Self-Flow 与 Flow Matching (FM) 对比。左图:每种模态的生成误差(Fréchet 距离),每个模态归一化为 FM = 100(值越低越好)。右图:微调后四组任务中操作任务的平均成功率(值越高越好)。

因此,FLUX 3 能够混合多种模态并联合生成图像和视频+音频;既可以从纯文本提示生成,也可以在提供图像和视频等输入参考时生成。我们在下面重点介绍了模型的一些关键能力。

FLUX 3 可以在单次生成中创建长度最长为 20 秒、带音频的高度多样化视频。

其核心能力包括以下内容(所有输出均包含原生音频生成):

在下面的初步分析中,我们生成了带音频的 10 秒文本到视频剪辑,分辨率为 720p。

Flux 3 多模态前沿模型发布,支持图像/视频/音频联合学习

评估仍处于早期阶段,我们预期会有进一步的改进。

由于模型及其相关工具尚在开发中,这些结果是初步的,我们预期在早期访问阶段会有进一步改进。在早期评估中,FLUX 3 在最多 69% 的比较中被优于 Grok Imagine Video,在 60% 的比较中优于 Kling v3 Pro,在 59% 的比较中优于 Happy Horse v1,在 57% 的比较中优于 Happy Horse 1.1,在 52% 的比较中优于 Seedance 2.0 和 Gemini Omni Flash。FLUX 3 在 77% 的比较中优于 Runway Gen-4.5,在 93% 的比较中优于 Luma Ray 3.2。

虽然仍在开发中,FLUX 3 Video 已经在捕捉人类面部表情、将声音与物理事件关联以及多语言能力方面表现出特别强的能力。此外,这些能力可以结合起来创建持续几分钟的序列,其中视觉参考有助于确保角色在所有场景中保持一致。

FLUX 3 Video 现已通过早期访问提供:https://bfl.ai/models/flux-3

FLUX 3 可以合成和编辑各种风格、纵横比和分辨率的图像。在中期训练期间进行的初步评估显示,FLUX 3 已经比早期版本有了显著提升:其处理复杂提示和文本生成的能力显著提高。模型可以生成多种输出风格(见下列样例),并能够用多种语言渲染高精度文本。

Flux 3 多模态前沿模型发布,支持图像/视频/音频联合学习

与视频评估一样,这些是初步结果,我们预期在发布前会有进一步改进。我们将在未来几周为 FLUX 3 图像开启早期访问阶段。

FLUX 3 对世界的理解已经扩展到动作预测。我们采取了两条路线实现这一点:一是将原生动作预测直接整合到 FLUX 3 中,扩大我们在 Self-Flow 中的初步工作;二是使用预训练的视频骨干网络作为具有动态感知的基础,之后可以用有限的任务特定数据对专业动作模型进行微调。

在第二条路线中,Mimic Robotics 是最早获得 FLUX 3 早期访问权限的合作伙伴之一。我们共同开发了 FLUX-mimic,这是一种视频动作模型,将 FLUX 3 的骨干网络与 Mimic 在机器人学习、灵巧操作和生产部署的专业知识结合起来。阅读我们的论文,了解为什么物理 AI 和内容创作运行在相同的基础上,以及它如何在奥迪的实际生产任务中进行测试:https://bfl.ai/blog/flux-3-mimic

在接下来的数周和数月内,我们将提供以下功能,每一项功能在正式发布前都会经过早期访问阶段,以确保顺利推出、收集反馈并进行严格的安全测试。所有功能都基于相同的多模态流匹配模型。这些功能和模型包括:

我们还将发布有关基础方法的更多技术细节。

在此申请早期访问:https://tally.so/r/44d9NX

我们才刚刚开始触及多功能、高能力、统一的多模态模型的表面,以及它们将带来的可能性。从交互式图像和视频编辑、模拟,到计算机使用和物理 AI,前沿领域正广阔无垠。在逐步推出这些新功能的同时,我们已经在开发下一代模型。我们的目标是在同一个统一模型中实现感知、动作和语言预测的统一。

如果您有兴趣探索和构建 FLUX 3,请在此联系我们。如果您有兴趣参与我们的使命,请加入我们!我们正在德国和美国招聘:https://bfl.ai/careers

Flux 3 多模态前沿模型发布,支持图像/视频/音频联合学习

情报判断

Aioga 编辑摘要

Black Forest Labs宣布推出多模态基础模型FLUX 3,并开放Early Access。该模型在统一架构中共同学习图像、视频和音频,目标是形成对现实世界的综合表示。

背景分析

材料称,图像提供空间结构,视频补充时间变化,音频揭示视觉难以捕捉的机械现象与声学关系,语言则连接感知、目标、抽象概念和指令。FLUX 3建立在Self-Flow方法之上。

Aioga 观点

Aioga判断,FLUX 3的核心看点不是单独增加模态,而是尝试让不同模态相互约束,以支持对物体、运动和事件的联合建模。不过,现有材料仅披露方向与早期结果,尚不足以判断实际性能。

影响与后续

材料显示,FLUX 3能够混合模态,并联合生成图像以及视频和音频,可由纯文本提示驱动,也可使用图像或视频作为输入参考。其对内容创作和物理AI的潜在影响值得关注,但具体应用效果仍需观察。 值得关注Early Access阶段公开的实际案例、评测和使用边界,尤其是图像、视频与音频协同生成是否稳定,以及其在内容创作和物理AI场景中的表现。材料目前未提供用户规模、性能数字或商业化安排。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: REST API · 原始域名: bfl.ai

来源: Black Forest Labs:Blog(网页)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-22T16:00:00.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Flux 3 多模态前沿模型发布,通过联合学习图像、视频和音频构建统一的世界表征。该模型现已开放 Early Access。

Black Forest Labs:Blog(网页)2026-07-22T16:00:00.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。