清华具身模型登顶全球榜单,靠视频预测与动作学习解耦突围

📡 量子位 资讯2026-10-09 11:52

清华团队通过分阶段解耦视频预测与动作学习,研发的具身模型登顶全球榜单。

AI 深度解读

清华大学、星动纪元等团队发布 VPP2 世界动作模型论文,核心是将视频预测与动作学习分阶段训练,并报告其在若干机器人基准中的较高成绩,关注价值在于探索视频模型规模之外的具身学习路径。

  • 论文《Video Prediction Policy 2: Predict Better, Act Better》于 2026-10-07 提交,采用事件级视频预训练、固定预测范围蒸馏和 MoT 动作模块。
  • 论文称,VPP2-14B 在开放任务视频预测指令遵循测试中比 Cosmos3-64B 高 11.0 个百分点。
  • 论文还报告其在真实世界零样本 ALOHA 任务中比最强基线高 18.5 个百分点,并在 LIBERO-Pro、LIBERO-OOD 和 RoboDojo 的所列方法中取得最高成绩。
  • 这些结果来自论文设定的测试集和评测协议,不能直接等同于所有机器人场景中的通用能力;论文摘要本身也没有证明“解耦”是全部性能差异的唯一原因。
  • 影响/看点:若不同团队能在统一数据、硬件和评测条件下复现,分阶段训练可能降低视频泛化与动作控制相互干扰的风险;其实际价值仍取决于跨任务、跨本体和长期运行中的稳定性。
  • 资料依据:
  • Video Prediction Policy 2: Predict Better, Act Better(2026-10-07):https://arxiv.org/abs/2610.10270
  • Video Prediction Policy 2 官方代码(2026-10-07):https://github.com/roboterax/video-prediction-policy-2

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手