REFACTOR-VLA:类型化运动程序的无监督库学习

📡 Apple Machine Learning Research2026-09-02 08:00

提出REFACTOR-VLA,通过无监督学习从运动程序中发现可复用抽象,提升长时程任务表现。

AI 深度解读

苹果机器学习研究团队提出 REFACTOR-VLA 框架,旨在解决现有单体视觉-语言-动作模型在长周期操作任务中缺乏可复用行为抽象与可解释性的问题。

  • 醒/睡双阶段架构:在睡眠阶段利用潜在世界模型推演并通过行为等价核对动作片段进行无监督聚类;在清醒阶段基于类型系统生成结构化 lambda 表达式指导动作生成。
  • 双重准入筛选:生成的技能模块必须同时通过最小描述长度准则与回报保留门控测试,才会被正式收录入技能程序库中。
  • 训练与扩展规律:基准测试表明将世界模型参数从 1.88 亿扩至 4.3 亿反而导致性能在全部测试套中下滑,否定了单纯增大模型规模的收益假设;而在预热阶段引入辅助对比损失则使聚类质量显著提升。
  • 影响/看点:这意味着具身智能在复杂操作中结合程序化符号抽象可有效增强多步规划能力,其实际泛化效果取决于世界模型动力学预测精度与符号程序在连续物理空间中的对齐程度。
  • 资料依据:
  • Apple Machine Learning Research(2026-09-02):https://machinelearning.apple.com/research/refactor-vla-motor-programs
  • arXiv(2026-09-02):https://arxiv.org/abs/2609.01215

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手