Black Forest Labs 发布 Flux 3:首次支持生成带原生音频的视频

📡 The Decoder2026-07-24 02:03

Black Forest Labs发布Flux 3,首次支持生成带原生音频的最长20秒视频,并已在机器人任务上测试。

AI 深度解读

Black Forest Labs 发布新一代多模态基础模型 Flux 3,首次让生成视频自带原生音效,单条时长可达20秒,视频生成的“哑巴”时代开始被打破。

  • 模型同时在图像、视频、音频数据上训练,画面与声音由同一模型同步生成,不再依赖后期配音配乐
  • 生成视频时长上限20秒,BFL官方称这是公司历史上首次支持原生音频视频生成
  • 内部测试显示效果略优于当前市场标杆Seedance 2.0,但第三方独立评测尚未跟进,实际水平待验证
  • BFL的终局目标是“世界模型”,Flux 3 已被用于机器人任务的探索性测试,视频生成只是阶段性产物
  • 音画同步生成若稳定可用,将直接压缩短视频、广告、虚拟主播等内容的后期制作环节
  • 对内容生产而言,“一步到位”出片配音是效率杀器;但官方自测数据的水分要等独立评测才能挤干,值得持续跟进。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com