谷歌 Gemini 引入基于智能体的视频分析,Token 消耗最高降低 88%
谷歌为 Gemini 系列引入智能体视频分析功能,自主选择关键片段使 Token 消耗最高降低 88%。
AI 深度解读
谷歌于 2026 年 9 月 1 日宣布在 Gemini API(涵盖 3.7 Flash、3.6 Flash 与 3.5 Flash-Lite)中引入基于智能体的视频理解机制,使长视频分析的 Token 消耗降低最高达 88%。
- 新机制取代了传统的固定帧率全量扫描方式,允许模型根据具体查询任务自主判断并按需检索视频片段、选择分辨率与对应模态。
- 官方数据显示,在多小时超长视频处理中,该技术可减少至多 88% 的 Token 消耗,并将视频处理成本降低最高 66%。
- 通过过滤无关帧并减少上下文噪声干扰,模型在长视频内容问答上的准确率提升最高达 7%。
- 影响/看点:按需采样的智能体视频理解能显著降低长视频多模态处理的计算开销,但对于需要高频动作连续识别的高动态短视频场景,节约效果可能并不显著。
- 资料依据:
- Google(2026-09-01):https://blog.google/technology/developers/gemini-agentic-video/
- The Decoder(2026-09-02):https://the-decoder.com/google-geminis-new-agent-based-video-analysis-cuts-token-usage-by-up-to-88-percent/
本内容由 AI 生成,仅供参考,请注意甄别