谷歌 DeepMind 发布三款 Gemini Robotics 2 物理智能模型,支持全身控制与多机协作

📡 MarkTechPost2026-07-31 01:20

谷歌 DeepMind 发布 Gemini Robotics 2 三款物理智能模型,支持机器人全身控制、五指精细操作与多机协作,分级开放访问权限。

AI 深度解读

谷歌 DeepMind 一口气发布三款 Gemini Robotics 2 模型,把机器人智能从「桌面级抓取」正式推进到「全身控制+多指灵巧+多机协作」,这是具身智能从局部动作走向整体行为的关键一步。

  • 三款模型分工明确:Gemini Robotics 2 是视觉-语言-动作(VLA)模型,负责把感知和语言转成全身运动控制,能驱动人形机器人从脚到手指的全身动作;Gemini Robotics ER 2 是基于 Gemini 3.5 Flash 的具身推理模型,负责高层规划和多步任务跟踪(仅公开预览,原生支持多模态输入、最长 128k 上下文);On-Device 2 基于 Gemma 打造,针对本地端侧运行做了优化
  • 实测由 Apptronik 的人形机器人 Apollo 2 演示,单一模型即可驱动两种不同灵巧手加一个 Franka Duo 夹爪,展示了跨机型的技能迁移能力
  • 系统设计上采用「大脑+四肢」分工:ER 2 做任务规划和追踪,把具体动作执行以「工具」形式交给 VLA 模型,开发者可将底层控制接口注册为可调用工具
  • 官方也坦承短板:多指灵巧操作的成功率区间仍在 32%-92%,波动较大;同时发布了新安全基准 ASIMOV-Agentic,已开源在 Hugging Face(CC-BY-4.0)
  • 这标志着具身智能的竞争焦点正从「能不能抓」转向「能不能协同、能不能迁移到不同机身」,多指灵巧度的巨大方差也说明距离稳定商用还有明显差距,值得持续跟踪而非立即神话。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com