Aioga
AI资讯 / 模型更新
返回 AI资讯

Black Forest Labs 发布 FLUX 3:统一图像、视频、音频与机器人动作预测的多模态基础模型

MarkTechPost(RSS)Aioga 编辑团队2026-07-26T17:50:23.000Z热度 70

Black Forest Labs 发布 FLUX 3,这是首个在单一架构中联合学习图像、视频和音频,并从同一组权重输出视频、音频和动作预测的多模态基础模型。FLUX 3 Vi...

模型更新MarkTechPost(RSS)

今日 AI 情报摘要

Black Forest Labs 发布 FLUX 3,这是首个在单一架构中联合学习图像、视频和音频,并从同一组权重输出视频、音频和动作预测的多模态基础模型。

FLUX 3 Video 可单次生成长达 20 秒、带原生音频的视频,在 10 秒 720p 文本生成视频的人类偏好测试中,以 93% 的偏好率击败 Luma Ray 3.2。

中文正文 · AI 翻译

黑森林实验室(BFL)发布了 FLUX 3:https://bfl.ai/blog/flux-3,这是一种多模态基础模型,在单一架构中从图像、视频和音频中学习。它也是首个可通过一组权重实现视频、音频和动作预测的 FLUX 模型。

黑森林实验室(BFL)的研究团队认为,没有任何单一模态能完整描述世界。图像在瞬间捕捉空间结构。视频还原时间并揭示物理动态。音频揭示机械事件与声音之间的因果关系。每种模态都被视为对同一底层现实的有损投影。

同时在所有模态上进行训练意味着模态之间相互约束。声音必须与撞击匹配。运动必须遵循质量规律。研究团队称 FLUX 3 是其完全基于这一原则构建的首个模型。

FLUX 3 建立在 Self-Flow 基础上:https://bfl.ai/research/self-flow,这是 BFL 在单一架构中对齐多模态生成和理解的方法。Self-Flow 将流匹配目标与自监督特征重建目标结合起来。GitHub 上的参考实现:https://github.com/black-forest-labs/Self-Flow 使用 Apache-2.0 许可证,并采用 SiT-XL/2,每个 token 配置时间步条件。训练采用每 token 25% 的掩码比率,并从第 20 层 EMA 教师到第 8 层学生进行自蒸馏。

已发布的检查点是 ImageNet 256×256 的研究模型,并不是 FLUX 3。BFL 表示,他们在同一方法上‘显著扩大了计算和数据资源’,以同时在视频、图像和音频上训练 FLUX 3。Self-Flow 本身是在 2026 年 3 月推出的,因此对于此次发布来说并不新颖。新颖之处在于规模。

FLUX 3 视频可在一次生成中制作最长 20 秒的片段,并附带原生音频。支持的模式包括文本到视频、图像到视频、参考片段的视频到视频、关键帧到视频以实现受控过渡,以及基于输入视频和音频的生成型视频-音频延续。

BFL 还列出了多语言对话、将片段串联成多镜头序列的代理性链式操作,以及带有动画设计的强大排版生成。BFL 团队报告在人物面部表情以及将声音与物理事件关联方面表现尤为突出。

BFL 团队发布了初步的人类偏好结果。实验设置为 10 秒的文字转视频片段,分辨率为 720p 并带音频。在比较中,FLUX 3 在 93% 的情况下被偏好于 Luma Ray 3.2,在 77% 的情况下被偏好于 Runway Gen-4.5。与 Grok Imagine Video 对比时,这一比例高达 69%,然后是 Kling v3 Pro 为 60%,Happy Horse v1 为 59%,Happy Horse 1.1 为 57%。与 Seedance 2.0 和 Gemini Omni Flash 比较时,结果为 52%,接近抛硬币般的随机。

查看 FLUX 3 公告:https://bfl.ai/blog/flux-3,FLUX 3 x mimic 技术文章:https://bfl.ai/blog/flux-3-mimic 以及 Self-Flow 论文:https://arxiv.org/abs/2603.06507。所有研究成果均归功于该项目的研究人员。

Black Forest Labs 发布 FLUX 3:统一图像、视频、音频与机器人动作预测的多模态基础模型

Michal Sutter 是一名数据科学专业人士,拥有帕多瓦大学的数据科学理学硕士学位。凭借在统计分析、机器学习和数据工程方面的坚实基础,Michal 擅长将复杂数据集转化为可操作的洞见。

KwaiKAT Team Releases KAT-Coder-V2.5
FAIRChem v2 UMA for Multidomain Atomistic Simulation across Molecules, Catalysts, Materials, Vibrations, and Molecular Dynamics

构建一个自主事件场地运营者 [完整代码]:https://pxllnk.co/twdn5

谢谢!我们的团队会尽快联系您 🙌

情报判断

Aioga 编辑摘要

Black Forest Labs 发布 FLUX 3,称其以单一架构联合学习图像、视频与音频,并由同一组权重进行视频、音频和动作预测。FLUX 3 Video 支持单次生成最长20秒且带原生音频的视频。

背景分析

FLUX 3 基于 BFL 的 Self-Flow 方法,将流匹配目标与自监督特征重建目标结合。公开的 Self-Flow 检查点只是 ImageNet 256×256研究模型,并非 FLUX 3;BFL 称此次主要变化是扩大计算与数据资源。

Aioga 观点

Aioga 判断,FLUX 3 的核心看点不是单项生成能力,而是以统一权重覆盖多种模态及动作预测。其让声音、运动与视觉信息相互约束的设计思路值得关注,但实际一致性仍需更多公开测试验证。

影响与后续

该模型覆盖文本生成视频、图生视频、视频转换、关键帧过渡及视频音频续写等模式。Aioga 判断,这可能为多镜头内容制作和物理事件声画匹配提供更统一的工作路径,但材料未说明实际部署成本。 后续应关注 BFL 是否披露完整评测方法、样本规模及更多第三方测试。现有结果由团队发布,显示其在10秒、720p、带音频测试中对 Luma Ray 3.2 获得93%偏好率,不宜直接外推至全部场景。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: marktechpost.com

来源: MarkTechPost(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-26T17:50:23.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

Black Forest Labs 发布 FLUX 3,这是首个在单一架构中联合学习图像、视频和音频,并从同一组权重输出视频、音频和动作预测的多模态基础模型。FLUX 3 Vi...

MarkTechPost(RSS)2026-07-26T17:50:23.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。