FLUX 3多模态模型发布:单次生成20秒视频并带原生音频
Black Forest Labs发布Flux 3多模态模型,统一架构联合训练图像视频音频,单次可生成20秒带原生音频视频。
AI 深度解读
Black Forest Labs以Early Access方式发布多模态基础模型FLUX 3,首次用统一架构联合训练图像、视频与音频生成,单次生成即可输出带原生声音的视频。
- 模型基于Self-Flow(自监督流匹配)框架扩展,在FLUX.1、FLUX.2基础上把训练范围延伸到多模态生成与理解任务
- 单次生成最长达20秒视频且自带原生音频,支持文生视频、图生视频、视频生视频、视频音频续写、关键帧转视频、多语言对话及多镜头串联
- 官方人工评测显示,在10秒720p带声视频对比中,FLUX 3对Grok Imagine Video胜率69%,对Seedance 2.0与Gemini Omni Flash的胜率均为52%
- 图像能力上同样支持多风格、多宽高比、多分辨率的生成与编辑
- Black Forest Labs正与Mimic Robotics合作,探索把FLUX 3用作机器人行为预测模型
- 影响/看点:把图像、视频、音频统一进同一套架构并首次原生带声,FLUX 3不仅冲击视频生成赛道的胜率排位,其在机器人行为预测上的延伸也打开了新的应用想象空间。
本内容由 AI 生成,仅供参考,请注意甄别