ViSkill:用持续进化的视觉原生技能强化视觉语言模型智能体
ViSkill把成功交互整理为视觉技能卡,并用检索、奖励塑形和持续回写形成技能进化闭环。
AI 深度解读
论文提出 ViSkill,用可持续更新的视觉技能卡片帮助视觉语言模型智能体学习任务策略,关注价值在于尝试把空间经验直接保留为视觉结构,而不是全部转写成文本。
- 技能卡片由成功交互轨迹提炼而来,并在推理时参与行动选择和奖励塑形。
- 新的成功轨迹还会反向写入技能库,形成技能积累与策略优化的闭环。
- 论文在 Sokoban、FrozenLake 和 PrimitiveSkill 任务上报告总体成功率 0.89,加入冷启动后为 0.91。
- 这些任务主要用于验证方法机制,不能据此直接推断其在开放环境或现实机器人中的表现。
- 影响/看点:如果技能库能在任务变化后保持可检索、可修正,视觉智能体可能减少重复探索;能否迁移到更复杂任务,取决于技能表示的泛化能力和错误轨迹的过滤机制。资料依据:
- ViSkill 论文(2026-10-08):https://arxiv.org/abs/2610.12403
- ViSkill 代码仓库(2026-10-08):https://github.com/ZJU-REAL/ViSkill
本内容由 AI 生成,仅供参考,请注意甄别