谷歌发布 Gemini Omni 1.1 Flash:支持40秒场景扩展、首尾帧控制与4K超分
谷歌发布 Gemini Omni 1.1 Flash 视频生成模型,新增 40 秒场景扩展、首尾帧控制与 4K 超分等能力。
AI 深度解读
谷歌于 2026 年 8 月 29 日发布原生多模态视频生成与编辑模型 Gemini Omni 1.1 Flash,针对视频生成的上下文时长、镜头控制与分辨率输出进行了技术升级。
- 场景扩展能力获得提升,模型可读取最多 10 秒的前序上下文(此前版本仅参考 1 秒),支持按 10 秒步长累计扩展至最高 40 秒,单次调用生成 3 至 10 秒视频。
- 增加关键帧控制机制,支持固定首尾帧(<FIRST_FRAME> 与 <LAST_FRAME>)生成中间过渡运镜,并支持传入最多 3 个各 3 秒的视频片段作为角色一致性参考。
- 支持生成成本仅为 720p 三分之一的 360p 草稿预览,最终成片支持超分至 4K 分辨率。
- 编辑模式基于 Interactions API 实现状态化管理,调用时传入上一轮交互标识即可在保留未提及内容的前提下进行局部修改,该模型已在 Google AI Studio 及企业平台上线。
- 影响/看点在于,状态化视频编辑与更长上下文扩展若能在复杂动态场景中保持时间轴与画面一致性,可能降低视频创作者在分镜预览和素材修改过程中的制作门槛与推理成本。
- 资料依据:
- MarkTechPost(2026-08-29):https://www.marktechpost.com/2026/08/29/google-ai-releases-gemini-omni-1-1-flash-40-second-scene-extension-first-last-frame-control-and-4k-upscaling/
- Google AI for Developers(2026-08-29):https://ai.google.dev/gemini-api/docs/models/gemini
本内容由 AI 生成,仅供参考,请注意甄别