时序距离JEPA:用于潜在世界模型预测控制的规划感知表示学习
提出时序距离JEPA,从无奖励轨迹中挖掘有向时序成本,用于潜在世界模型规划。
AI 深度解读
这篇论文提出了时序距离JEPA(TD-JEPA),一种在潜在世界模型中利用轨迹时序信息学习规划感知表示的方法,解决了传统JEPA在模型预测控制中规划与表示不匹配的问题。
- 传统JEPA通过短视的潜在预测训练世界模型,但规划需要评估多步想象序列的目标进展,两者目标不一致。
- TD-JEPA从离线轨迹中挖掘有向时序成本:同轨迹步序提供正样本,跨轨迹对作为助阴性样本,并加入 rollout 一致性项对齐规划步长。
- 该成本既可直接作为拓扑规划的成本函数,也可作为表示信号改进欧几里得规划性能,实现成本与表示的协同优化。
- 在锁定评估中,使用挖掘成本使 Two-Room 成功率从 97.4% 提升至 100.0%,OGB-Cube 的欧几里得规划提升 14.2 个点,Push-T 也有改进。
- 消融实验表明,有向头、跨轨迹负样本和 rollout 一致性均不可或缺。
- 这一工作缩小了JEPA世界模型规划器的训练与规划差距,通过发现离线日志中的时序进展结构并共同设计部署成本,为基于模型的强化学习提供了新思路。
本内容由 AI 生成,仅供参考,请注意甄别