DeepMind 官方发布 Gemini Omni 1.1 Flash:支持更精细的视频生成控制
DeepMind发布Gemini Omni 1.1 Flash模型,为开发者提供更精细的视频生成控制能力。
AI 深度解读
Google DeepMind 于 2026 年 8 月 27 日正式发布视频生成与控制模型 Gemini Omni 1.1 Flash,通过强化时序上下文关联与关键帧控制,重点提升了生成式视频在工业化生产与工具开发中的可控性。
- 场景延展功能支持分析最多 10 秒的前序视频上下文,相较于此前仅参考最后 1 秒的模型,显著改善了画面连贯性与叙事一致性,单次可按 10 秒步长延展至最长 40 秒。
- 支持指定镜头的起始帧与结束帧,模型可在两帧关键画面之间自动生成平滑过渡与连续运镜,适用于变焦、环绕拍摄与无缝循环视频制作。
- 新增 360p 分辨率草稿预览模式,生成速度相比标准 720p 提升约 60%,计算成本降至三分之一,便于开发者快速验证提示词与镜头构图。
- 模型已通过 Google AI Studio 中的 Gemini API 及企业级平台向开发者开放,并支持通过 Interactions API 进行多轮自然语言视频编辑。
- 影响/看点:多秒级上下文参考与起止帧插值机制若能在复杂运镜下维持物理规律真实度,意味着数字媒体与影视后期创作者制作长镜头的迭代成本可能明显降低,其规模化应用效果取决于高分辨率渲染时的画面一致性。
- 资料依据:Google DeepMind 官方博客(https://deepmind.google/blog/gemini-omni-1-1-flash-lets-you-build-with-more-control/)
本内容由 AI 生成,仅供参考,请注意甄别