谷歌为 Gemini Flash 推出智能体视频理解功能,视频 Token 消耗最高降低 88%
谷歌为Gemini Flash引入智能体视频理解技术,通过按需动态导航视频使Token消耗降低最高88%。
AI 深度解读
谷歌在其 Gemini Flash 系列模型中上线智能体视频理解功能,将传统的单次全量抽帧转换为按需检索的主动导航模式。
- 传统处理默认按每秒 1 帧固定采样整段视频,而新模式由模型自主调用内置视频工具,针对性搜索和检查关键时间片段、音频与字幕。
- 官方评测数据显示,在长视频场景下该机制最高可减少 88% 的视频 Token 消耗与 66% 的调用费用,标准基准测试准确率提升最高达 7%。
- 该能力以托管 API 形式在 Google AI Studio 及 Gemini 企业平台提供,支持本地上传与公开 YouTube 链接,导航过程中的推理将按思考 Token 计费。
- 影响/看点:该功能降低了长视频多模态推理的调用成本,未来普及程度取决于其在高度动态、细节密集的短片段定位中的识别稳定性。
- 资料依据:
- MarkTechPost(2026-09-04):https://www.marktechpost.com/2026/09/04/google-agentic-video-understanding-gemini-flash-models/
- Google 开发者文档(2026-09-04):https://ai.google.dev/gemini-api/docs/vision
本内容由 AI 生成,仅供参考,请注意甄别