Google DeepMind 为最新 Gemini 模型引入智能体视频理解能力,Token 消耗最高减少 88%

📡 Google DeepMind2026-09-02 01:29

Google DeepMind 为 Gemini 模型引入智能体视频理解能力,分析准确率更高且最多减少 88% 的 Token 消耗。

AI 深度解读

Google DeepMind 为最新 Gemini 系列模型引入智能体视频理解能力,在提高长视频理解精度的同时将 Token 消耗最高减少 88%。

  • 模型通过联合分析视频的字幕文本、音轨信息与视觉画面,自主推理并动态抽取关键时间节点的画面帧,避免全量逐帧扫描。
  • 在长视频基准 LVBench 上,测试准确率由 85.1% 提升至 88.6%,Token 节省比例达 88.0%。
  • 官方说明显示该优化在数十分钟至数小时的长视频分析场景中计算效率提升尤为明显。
  • 影响/看点:动态抽帧推理可能使超长音视频内容处理的计算开销进入实用区间,其实际运行稳定性取决于跨模态线索定位的准确性与音画同步的鲁棒性。
  • 资料依据:
  • X:Google DeepMind (@GoogleDeepMind)(2026-09-01):https://x.com/GoogleDeepMind/status/2094840179676660097

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手