谷歌发布 Gemini 3.8 Live 实时多模态交互模型

📡 Testing Catalog2026-09-16 16:32

谷歌发布Gemini 3.8 Live交互模型,支持近实时视觉交互、后台工具调用及多语言检测并开启预览。

AI 深度解读

谷歌正式发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 实时多模态交互模型,重点优化低延迟语音对话与多步骤后台推理的协同能力。

  • 边思考边交互能力:Extended Thinking 版本支持在持续流式输出语音的同时执行后台深度推理与异步工具调用,减少复杂任务处理中的停顿与静音。
  • 实时多模态感知:支持近实时视觉输入理解,可结合摄像头实时画面或屏幕共享内容进行上下文问答与分析。
  • 多语言自动切换:支持 97 种语言的自动检测与无缝切换,提升跨语言交互的流畅度。
  • 开放与部署路径:模型已上线 Gemini API 与 Google AI Studio 提供开发者预览,并逐步集成至 Search Live 与 Gemini Live 等终端功能。
  • 影响/看点:双轨实时交互架构可能改善语音助手在复杂专业任务中的响应体验,其规模化普及取决于高并发环境下的端到端延迟表现与推理计算成本。
  • 资料依据:
  • X:Testing Catalog (@testingcatalog)(2026-09-16):https://x.com/testingcatalog/status/2100140717058195825
  • Google 官方博客(2026-09-15):https://blog.google/technology/ai/gemini-live-update/

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手