Long-WAM:扩展世界动作模型的上下文能力

📡 HuggingFace Daily Papers2026-10-07 08:00

提出Long-WAM扩展世界动作模型的视觉历史,在机器人控制中利用更长上下文提升任务成功率。

AI 深度解读

论文提出 Long-WAM,一套面向实时机器人控制的世界—动作模型框架,重点研究如何利用更长的视觉历史而不牺牲控制延迟,关注价值在于连接长时程记忆与在线操作。

  • 在 RoboCasa GR-1 上,将上下文从 0 秒增加到 19.2 秒后,成功率由 63.3% 提升至 78.7%。
  • 论文称,双向预训练初始化并未带来同等收益,说明历史长度本身不等于有效利用历史。
  • 通过流式编码、异步执行和硬件加速,RTX 5090 上每个动作块包含未来视频预测的耗时为 107.4 毫秒。
  • 在动态叠杯实验中,Long-WAM 达到 95% 成功率,而对比的 Pi0.5 和 Fast-WAM 在 20 次试验中均未成功。
  • 影响/看点:如果这些结果能在更多机器人、任务和控制频率下复现,长上下文可能成为长时程操作的有效组成部分;但当前数字来自论文选定基准和设备,不能直接等同于普遍性能优势。
  • 资料依据:
  • Long-WAM 论文(2026-10-07):https://arxiv.org/abs/2610.10528
  • Long-WAM DOI 记录(2026-10-07):https://doi.org/10.48550/arXiv.2610.10528

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手