谷歌 Gemini API 推出智能体视频处理能力:Token 消耗最高降低 88%
谷歌 Gemini API 推出 Agentic Video 功能,在提升长视频分析质量的同时将 Token 消耗最高降低 88%。
AI 深度解读
谷歌在 Gemini API 中上线 Agentic Video 视频处理模式,通过智能体机制大幅降低长视频分析中的 Token 消耗并提升理解准确率。
- 谷歌开发者关系负责人 Logan Kilpatrick 于 2026 年 9 月 1 日公布,Gemini API 新增基于智能体机制的 Agentic Video 处理能力,支持按单个视频进行配置调用。
- 该特性已适配包括 Gemini 3.7 Flash 在内的最新模型,基准测试数据显示,在长视频评测集 LVBench 上准确率由 85.1% 提升至 88.6%,同时 Token 消耗降低 88.0%。
- 谷歌官方开发文档显示,该机制通过智能抽帧与动态注意力调度,改变了以往全量视频帧密集编码的计算模式,显著优化长视频理解的性价比。
- 影响/看点:此项更新可能显著降低开发者处理长时序监控、视频检索和会议记录等多模态任务的调用成本,其实际应用效益取决于在用户自定义非标准视频场景中的稳定表现。
- 资料依据:
- Google Developers(2026-09-01):https://ai.google.dev/gemini-api/docs/vision
- X:Logan Kilpatrick (@OfficialLoganK)(2026-09-01):https://x.com/OfficialLoganK/status/2094843143623680264
本内容由 AI 生成,仅供参考,请注意甄别