Black Forest Labs发布FLUX 3:图像/视频/音频/机器人动作多模态模型

📡 MarkTechPost2026-07-27 01:50

Black Forest Labs发布FLUX 3多模态模型,首次用同一套权重统一预测图像、视频、音频与机器人动作。

AI 深度解读

导读:图像生成厂商Black Forest Labs发布FLUX 3,首次把图像、视频、音频和机器人动作预测放进同一套模型权重里训练,核心主张是“单一模态给不出完整的世界描述”,只有让各模态互相约束才能生成物理上自洽的内容。

  • 底层方法是BFL自研的Self-Flow,把flow matching生成目标和自监督特征重建目标结合,用EMA teacher到student的自蒸馏训练,这次首次把该方法规模化用到视频、图像、音频的联合训练上。
  • FLUX 3 Video可单次生成长达20秒的视频片段并原生带音频,支持文本生视频、图片生视频、参考视频的视频生视频、关键帧过渡,以及基于输入视频音频的续写生成。
  • 官方特别提到在人物面部表情和“声音匹配物理事件”(比如碰撞声要对上撞击动作)上表现突出,这正是多模态联合训练要解决的一致性问题。
  • BFL公布的初步人类偏好评测显示,在10秒720p带音频的文本生视频对比中,FLUX 3对Luma Ray 3.2的胜率达93%,对Runway Gen-4.5的胜率为77%。
  • 看点:视频生成赛道已经卷到“原生音频+物理一致性”这一层,FLUX 3把动作预测也纳入同一模型,意味着BFL在为具身智能/机器人场景埋伏笔。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com