Long-WAM:扩展世界动作模型的上下文能力
提出Long-WAM扩展世界动作模型的视觉历史,在机器人控制中利用更长上下文提升任务成功率。
AI 深度解读
论文提出 Long-WAM,一套面向实时机器人控制的世界—动作模型框架,重点研究如何利用更长的视觉历史而不牺牲控制延迟,关注价值在于连接长时程记忆与在线操作。
- 在 RoboCasa GR-1 上,将上下文从 0 秒增加到 19.2 秒后,成功率由 63.3% 提升至 78.7%。
- 论文称,双向预训练初始化并未带来同等收益,说明历史长度本身不等于有效利用历史。
- 通过流式编码、异步执行和硬件加速,RTX 5090 上每个动作块包含未来视频预测的耗时为 107.4 毫秒。
- 在动态叠杯实验中,Long-WAM 达到 95% 成功率,而对比的 Pi0.5 和 Fast-WAM 在 20 次试验中均未成功。
- 影响/看点:如果这些结果能在更多机器人、任务和控制频率下复现,长上下文可能成为长时程操作的有效组成部分;但当前数字来自论文选定基准和设备,不能直接等同于普遍性能优势。
- 资料依据:
- Long-WAM 论文(2026-10-07):https://arxiv.org/abs/2610.10528
- Long-WAM DOI 记录(2026-10-07):https://doi.org/10.48550/arXiv.2610.10528
本内容由 AI 生成,仅供参考,请注意甄别