TANGO:基于全身视觉-语言-动作(VLA)模型的人形机器人复杂环境导航
提出人形机器人全身导航框架TANGO,可结合语言指令与第一视角画面,直接预测29自由度动作以穿越复杂杂乱环境。
AI 深度解读
据 arXiv 于 2026 年 9 月 8 日公布的论文,研究人员提出人形机器人全身视觉-语言导航框架 TANGO,旨在解决杂乱三维空间中的语言引导避障移动问题。
- 与传统二维路径规划不同,TANGO 直接根据自然语言指令和第一视角 RGB 图像预测 29 自由度关节空间动作,实现手臂、躯干与步态的连续协调。
- 采用纯仿真训练管线,结合全局路径规划、运动学全身生成、障碍感知运动编辑与强化学习跟踪,合成具备物理可行性的动作监督数据。
- 在模拟实验中取得领先的导航表现,并在无需真实导航数据微调的情况下,零样本部署至宇树 Unitree G1 人形机器人上完成真实复杂场景穿越。
- 影响/看点:该框架验证了纯仿真合成全身动作监督在具身导航中的可行性,未来规模化应用取决于真机面对未见动态障碍与复杂多变地形时的泛化鲁棒性。
- 资料依据:
- arXiv(2026-09-08):https://arxiv.org/abs/2609.09158
- HuggingFace Daily Papers(2026-09-08):https://huggingface.co/papers/2609.09158
本内容由 AI 生成,仅供参考,请注意甄别