Show-Harness:让视觉语言模型直接驱动机器人控制的语义中间件
研究团队推出语义中间件Show-Harness,通过离散语义动作接口让视觉语言模型直接驱动机器人控制。
AI 深度解读
研究团队于 2026 年 9 月提出具身中间件 Show-Harness,使基础视觉语言模型(VLM)无需昂贵的具身预训练即可直接驱动机器人完成操作控制。
- 框架抽象出一组离散语义动作单元作为高层意图接口,由各本体的专用解释器将其确定性映射为底层物理动作。
- 方案支持闭源前沿视觉模型进行零样本机器人控制,也支持开源轻量模型仅用数小时 GPU 微调实现适配。
- 研发了图形界面操控工具 GUMI,使多硬件形态下的示教数据采集摆脱了对专业遥操作硬件的依赖。
- 跨任务与跨本体的实测证明,该语义接口在不同机器人构型与物理环境中具有较好的泛化控制表现。
- 影响/看点:该方案可能降低具身智能控制器的训练与硬件适配门槛,但其在精密工业操作场景下的可行性仍取决于高层离散语义动作能否有效覆盖高频、连续的力控反馈需求。
- 资料依据:
- arXiv(2026-09-09):https://arxiv.org/abs/2609.10522
- HuggingFace(2026-09-09):https://huggingface.co/papers/2609.10522
本内容由 AI 生成,仅供参考,请注意甄别