Google DeepMind 推出基于 Gemini 的智能体级视频理解技术

📡 Google DeepMind Blog2026-09-02 01:08

Google DeepMind推出基于Gemini的智能体级视频理解技术,提升复杂长视频分析与交互能力。

AI 深度解读

Google DeepMind 于 2026 年 9 月 1 日在官方博客宣布为 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 推出智能体级视频理解技术,通过动态工具调度降低了多模态视频分析的算力成本与计算冗余。

  • 该技术改变了以往按固定帧率全量输入视频的静态处理模式,允许模型根据具体任务目标主动决定抽帧时机、分析倍速及模态通道(视觉帧、音频或字幕)。
  • 基准测试数据显示,结合智能体视频理解后,Gemini 3.7 Flash 在视频分析任务中的 Token 消耗降低最高达 88%,分析成本降低最高达 66%,同时准确率提升最高达 7%。
  • 这种动态检索机制在处理 10 分钟至数小时的长视频时表现出更突出的效率优势,缓解了以往在长视频分析中高成本与信息丢失之间的权衡问题。
  • 该能力已在 Google AI Studio 及 Gemini 企业级智能体平台上线,支持用户上传的视频文件与 YouTube 视频分析。
  • 影响/看点:按需采样的智能体视频理解技术可能显著降低长视频解析的推理成本,其在实际业务场景中的推广效果取决于动态定位关键片段时的准确度与多模态工具调用的稳定性。
  • 资料依据:
  • Google DeepMind 官方博客(2026-09-01):https://deepmind.google/blog/introducing-agentic-video-in-gemini/

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手