Aioga
AI资讯 / 模型更新
返回 AI资讯

Black Forest Labs 发布 Flux 3:可生成带原生音频的 20 秒视频,并推出机器人动作模型 Flux-mimic

The Decoder:AI News(RSS)Aioga 编辑团队2026-07-23T18:03:01.000Z热度 68

德国 AI 公司 Black Forest Labs 发布多模态基础模型 Flux 3,可同时从图像、视频和音频中学习,首次支持生成带原生音频、最长 20 秒的视频。

模型更新The Decoder:AI News(RSS)

今日 AI 情报摘要

德国 AI 公司 Black Forest Labs 发布多模态基础模型 Flux 3,可同时从图像、视频和音频中学习,首次支持生成带原生音频、最长 20 秒的视频。

中文正文 · AI 翻译

德国人工智能公司黑森林实验室(Black Forest Labs, BFL)发布了Flux 3,一种多模态基础模型,可同时从图像、视频和音频中学习。在BFL的早期测试中,它在视频生成方面击败了多个竞争对手。

Image description

BFL将Flux 3描述为迈向“现实世界视觉智能”的一步,它将视觉智能定义为能够“在物理和数字环境中感知、预测和行动”的模型。该公司是构建所谓世界模型的更广泛推动的一部分:https://the-decoder.com/google-deepmind-argues-video-generators-already-contain-the-world-models-computer-vision-has-been-missing/。

BFL认为,没有单一模态能够完整捕捉现实。图像展示空间结构,视频捕捉其随时间的变化,音频可以揭示机械事件与其产生的声音之间的联系。对三者进行联合训练可以让它们互相填补空白,赋予模型比单独训练每种模态更多的信息。Ad

Flux 3现在可以首次生成带有原生音频的视频:https://bfl.ai/blog/flux-3,视频片段最长可达20秒。它支持文本到视频、图像到视频、视频到视频、基于关键帧的过渡、多语言对话,以及用于更长多镜头序列的由代理驱动的片段链接。BFL表示,该模型在处理人类面部表情和将声音与物理事件匹配方面特别出色。Ad DEC_D_Incontent-1

在使用720p、10秒视频片段的早期评估中,BFL报告称Flux 3在93%的比较中优于Luma Ray 3.2,在77%的比较中优于Runway Gen-4.5,在69%的比较中优于Grok Imagine Video。面对更强的竞争者时优势缩小。Flux 3在60%的时间内优于Kling v3 Pro,59%优于Happy Horse v1,57%优于Happy Horse 1.1,以及52%优于Seedance 2.0和Gemini Omni Flash。

BFL表示,这些结果为初步结果,目前尚无独立测试。若能匹配已经进入好莱坞的领先系统如Seedance:https://the-decoder.com/hollywood-wants-seedance-banned-and-reportedly-also-wants-to-keep-using-it/,以及Gemini Omni Flash,将使Flux 3跻身顶级视频模型行列。Ad

Black Forest Labs 发布 Flux 3:可生成带原生音频的 20 秒视频,并推出机器人动作模型 Flux-mimic

BFL还预计Flux 3将在图像生成方面有所提高,特别是在处理复杂提示和多语言文本准确呈现方面。公司计划在未来几周内推出Flux 3 Image的抢先体验版本。

BFL表示,该模型还可以基于对世界的理解预测动作。公司与Mimic Robotics合作开发了Flux-mimic,一种视频动作模型:https://bfl.ai/blog/flux-3-mimic,目前正在奥迪的生产任务中进行测试。广告 DEC_D_Incontent-2

Flux 3基于Self-Flow:https://bfl.ai/research/self-flow,这是BFL用于让一个模型同时生成和理解内容的方法。多模态变换器使用专门组件将图像、视频和音频转换为共享的内部表示,然后再转换回输出结果。广告

Black Forest Labs 发布 Flux 3:可生成带原生音频的 20 秒视频,并推出机器人动作模型 Flux-mimic

动作组件为机器人应用提供了基础。BFL表示,这种统一学习过程比之前标准的流匹配方法在生成质量和模型对物理世界的理解方面都能提供更好的结果。

BFL正在分阶段推出所有功能,并通过早期访问阶段进行反馈和安全测试。Flux 3 Video:https://bfl.ai/models/flux-3已可用,Flux 3 Image将在未来几周内推出。动作预测最初将通过精选合作伙伴提供。

BFL还计划以“Flux 3 Dev”的名义发布多模态骨干网络的开放权重访问。长期来看,公司正在研发下一代模型,旨在将感知、动作和语言预测结合于单一模型中。

保持对AI的关注。清晰、有用,无废话。

关注The Decoder以获取AI新闻、背景故事和专家分析。

The Decoder:https://the-decoder.com/

情报判断

Aioga 编辑摘要

德国 AI 公司 Black Forest Labs 发布多模态基础模型 Flux 3,称其可共同学习图像、视频和音频,并首次生成带原生音频、最长 20 秒的视频;公司还与 Mimic Robotics 开发了视频动作模型 Flux-mimic。

背景分析

Flux 3 支持文本生成视频、图像生成视频、视频转视频、关键帧转场、多语言对话,以及由代理连接多个片段的多镜头序列。Black Forest Labs 称其早期测试中击败多家竞品,但结果仍属初步评估。

Aioga 观点

Aioga 判断,Flux 3 的主要看点是把视频生成与原生音频、动作理解放在同一模型叙事中。不过,现有优势主要来自 Black Forest Labs 的早期测试,且材料明确表示尚无独立测试,结论仍需谨慎。

影响与后续

如果后续评测能够复现公司公布的偏好结果,原生音频与画面中物理事件的声音匹配可能提升视频生成的完整度。Flux-mimic 在 Audi 生产任务中的测试,也值得关注其从视觉内容生成走向动作预测的进展。 后续应重点核查独立评测是否出现,以及 Flux 3 在更强竞争对手上的表现是否稳定;同时关注 Black Forest Labs 计划在未来数周开放早期体验的 Flux 3 Image,以及 Flux-mimic 的生产任务测试进展。

来源与版权说明

本页正文由公开来源页面提取并按原有信息整理,同时保留来源、发布时间和原文入口。版权归原作者及来源网站所有,请通过原文链接核验和阅读来源版本。

抓取通道: RSS · 原始域名: the-decoder.com

来源: The Decoder:AI News(RSS)

原文链接: 打开原始来源

Aioga 归档: 查看情报页

Content record: source-page · Updated: 2026-07-23T18:03:01.000Z

API 中转站
API RELAY · DEVELOPER INFRASTRUCTURE

API 中转站

统一接入主流 AI 模型 API,为开发、测试与生产环境提供稳定调用入口。

立即访问 api.w173.com
AIOGA SHARE POSTER

分享这篇 AI 情报

德国 AI 公司 Black Forest Labs 发布多模态基础模型 Flux 3,可同时从图像、视频和音频中学习,首次支持生成带原生音频、最长 20 秒的视频。

The Decoder:AI News(RSS)2026-07-23T18:03:01.000Z
扫码打开文章详情扫码直达文章详情

Aioga 自动聚合全球 AI 动态,并保留来源信息用于核验与引用。