谷歌为 Gemini Flash 推出智能体视频理解功能,视频 Token 消耗最高降低 88%

📡 MarkTechPost2026-09-05 12:37

谷歌为Gemini Flash引入智能体视频理解技术,通过按需动态导航视频使Token消耗降低最高88%。

AI 深度解读

谷歌在其 Gemini Flash 系列模型中上线智能体视频理解功能,将传统的单次全量抽帧转换为按需检索的主动导航模式。

  • 传统处理默认按每秒 1 帧固定采样整段视频,而新模式由模型自主调用内置视频工具,针对性搜索和检查关键时间片段、音频与字幕。
  • 官方评测数据显示,在长视频场景下该机制最高可减少 88% 的视频 Token 消耗与 66% 的调用费用,标准基准测试准确率提升最高达 7%。
  • 该能力以托管 API 形式在 Google AI Studio 及 Gemini 企业平台提供,支持本地上传与公开 YouTube 链接,导航过程中的推理将按思考 Token 计费。
  • 影响/看点:该功能降低了长视频多模态推理的调用成本,未来普及程度取决于其在高度动态、细节密集的短片段定位中的识别稳定性。
  • 资料依据:
  • MarkTechPost(2026-09-04):https://www.marktechpost.com/2026/09/04/google-agentic-video-understanding-gemini-flash-models/
  • Google 开发者文档(2026-09-04):https://ai.google.dev/gemini-api/docs/vision

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手