自变量机器人开源 HOST 框架:看一段人类视频就能学会新技能
自变量机器人开源HOST框架,机器人看一段数十秒人类视频即可学会新技能,成功率62%,数据需求比传统微调降低50倍。
AI 深度解读
自变量机器人开源HOST框架,让机器人看一段几十秒的人类视频就能学会新技能且不遗忘旧技能,一次性解决了机器人学习“看得懂但学不会”的老问题。
- 核心思路反直觉:不是把人类动作翻译成机器人动作去模仿,而是先想象动作执行后的结果,再从结果反推需要执行的动作
- 关键技术是“按任务进度对齐”而非按时间对齐——用动态时间规整算法把人类视频每一帧和机器人操作每一步映射到同一向量空间,解决进度错位问题
- 模型结构是双专家MoT架构,视频专家负责定位进度、预测画面,动作专家负责把预测转化为具体动作
- 训练分同体预训练和人机视频训练两阶段,逐步把人类示范迁移成机器人技能
- 实测29秒人类视频学习成功率62%,超零样本基线45个百分点,数据需求比Pi-0.5+微调方案少50倍,学习速度快500倍
- 论文、代码全部开源,意味着家庭服务机器人未来有望摆脱专业数据采集,直接靠“看视频”就学新活儿,是具身智能数据效率上的一次实打实突破。
本内容由 AI 生成,仅供参考,请注意甄别