Black Forest Labs 发布 Flux 3:首次支持生成带原生音频的视频
Black Forest Labs发布Flux 3,首次支持生成带原生音频的最长20秒视频,并已在机器人任务上测试。
AI 深度解读
Black Forest Labs 发布新一代多模态基础模型 Flux 3,首次让生成视频自带原生音效,单条时长可达20秒,视频生成的“哑巴”时代开始被打破。
- 模型同时在图像、视频、音频数据上训练,画面与声音由同一模型同步生成,不再依赖后期配音配乐
- 生成视频时长上限20秒,BFL官方称这是公司历史上首次支持原生音频视频生成
- 内部测试显示效果略优于当前市场标杆Seedance 2.0,但第三方独立评测尚未跟进,实际水平待验证
- BFL的终局目标是“世界模型”,Flux 3 已被用于机器人任务的探索性测试,视频生成只是阶段性产物
- 音画同步生成若稳定可用,将直接压缩短视频、广告、虚拟主播等内容的后期制作环节
- 对内容生产而言,“一步到位”出片配音是效率杀器;但官方自测数据的水分要等独立评测才能挤干,值得持续跟进。
本内容由 AI 生成,仅供参考,请注意甄别