IT之家:https://www.ithome.com/ 7 月 24 日消息,Black Forest Labs 昨日(7 月 23 日)发布博文,宣布以 Early Access 方式,上线推出 Flux 3 多模态基础模型, 采用统一架构联合学习图像、视频和音频。

在训练方面,IT之家援引博文介绍,该模型基于 Self-Flow(自监督流匹配)学习框架扩展,同步训练视频、图像和音频,在 FLUX.1 和 FLUX.2 系列基础上,扩大至多模态生成与理解任务。

Black Forest Labs publie le modèle multimodal FLUX 3, capable de générer en une seule fois une vidéo de 20 secondes avec audio natif
Black Forest Labs publie le modèle multimodal FLUX 3, capable de générer en une seule fois une vidéo de 20 secondes avec audio natif

FLUX 3 可在单次生成中输出最长 20 秒的视频,并附带原生音频。官方表示该模型支持文生视频、图生视频、视频生视频、输入视频与音频续写、关键帧转视频、多语言对话,以及多镜头串联。

Black Forest Labs publie le modèle multimodal FLUX 3, capable de générer en une seule fois une vidéo de 20 secondes avec audio natif

性能方面,在带声音的 10 秒、720p 视频人工评测方面,结果显示,FLUX 3 对比 Grok Imagine Video 的胜率为 69%,对比 Seedance 2.0 的胜率为 52%,对比 Gemini Omni Flash 的胜率也为 52%。

Black Forest Labs publie le modèle multimodal FLUX 3, capable de générer en une seule fois une vidéo de 20 secondes avec audio natif

在机器人方向,Black Forest Labs 正与 Mimic Robotics 合作,研究将 FLUX 3 用作机器人行为预测模型。

图像能力方面,官方称 FLUX 3 可完成图像生成与编辑,覆盖多种风格、宽高比和分辨率。

Black Forest Labs publie le modèle multimodal FLUX 3, capable de générer en une seule fois une vidéo de 20 secondes avec audio natif