Black Forest Labs发布FLUX 3:图像/视频/音频/机器人动作多模态模型
Black Forest Labs发布FLUX 3多模态模型,首次用同一套权重统一预测图像、视频、音频与机器人动作。
AI 深度解读
导读:图像生成厂商Black Forest Labs发布FLUX 3,首次把图像、视频、音频和机器人动作预测放进同一套模型权重里训练,核心主张是“单一模态给不出完整的世界描述”,只有让各模态互相约束才能生成物理上自洽的内容。
- 底层方法是BFL自研的Self-Flow,把flow matching生成目标和自监督特征重建目标结合,用EMA teacher到student的自蒸馏训练,这次首次把该方法规模化用到视频、图像、音频的联合训练上。
- FLUX 3 Video可单次生成长达20秒的视频片段并原生带音频,支持文本生视频、图片生视频、参考视频的视频生视频、关键帧过渡,以及基于输入视频音频的续写生成。
- 官方特别提到在人物面部表情和“声音匹配物理事件”(比如碰撞声要对上撞击动作)上表现突出,这正是多模态联合训练要解决的一致性问题。
- BFL公布的初步人类偏好评测显示,在10秒720p带音频的文本生视频对比中,FLUX 3对Luma Ray 3.2的胜率达93%,对Runway Gen-4.5的胜率为77%。
- 看点:视频生成赛道已经卷到“原生音频+物理一致性”这一层,FLUX 3把动作预测也纳入同一模型,意味着BFL在为具身智能/机器人场景埋伏笔。
本内容由 AI 生成,仅供参考,请注意甄别