谷歌 DeepMind 发布 Gemini 3.8 Live:支持实时虚拟人形象交互
谷歌 DeepMind 推出 Gemini 3.8 Live,支持通过实时虚拟人形象与用户交互。
AI 深度解读
谷歌 DeepMind 宣布在 Gemini 3.8 Live 中推出 Live Avatar 功能,为原生实时对话模型引入近实时虚拟人形象交互能力,探索从纯语音转向端到端视听交互的技术路径。
- 形象与语音生成:通过将近实时视频生成与语音流结合,构建具备视觉形象的虚拟角色,支持唇形同步与面部表情联动。
- 多语言端到端同步:具备原生多语种语音同步能力,支持在 97 种语言间切换并动态适配唇形与表情,减少视觉漂移。
- 异步工具调用机制:虚拟人在保持前端连续音视频对话的同时,可在后台异步执行工具调用与数据检索,处理预订等复杂事务。
- 商业化落地场景:该功能已上线 Gemini Enterprise,主要面向企业级客服应答与业务导览等交互场景。
- 影响/看点:该技术将多模态对话拓展至全真视觉形象交互,如果其实时生成延迟与多语言同步表现稳定,可能促使企业客服和虚拟助理从单纯语音向端到端虚拟形象交互演进。
- 资料依据:
- Google DeepMind Blog(2026-09-24):https://deepmind.google/blog/introducing-gemini-38-live-with-live-avatar/
本内容由 AI 生成,仅供参考,请注意甄别