StreamPI:面向具身 VLA 大模型的流式多模态时序建模框架
研究团队提出 StreamPI 框架,在零新增参数下为单帧具身 VLA 模型赋予流式多模态时序推理与控制能力。
AI 深度解读
2026 年 8 月,香港大学与 ACE Robotics 等机构研究人员在 arXiv 发布预印本论文,提出面向具身操作的流式多模态时序建模框架 StreamPI,在不增加额外模型参数的前提下赋予单帧视觉语言动作(VLA)模型时序推理能力。
- 提出指令锚定时序建模,将每次视觉观测与语言指令成对作为原子时序单元,对内使用双向注意力完成跨模态融合,对外使用因果注意力实现自回归流式推理。
- 引入随机间隔流式训练策略,通过调节帧采样间隔并引入随机扰动,使模型能够适应真实机器人异步部署中的帧时序波动。
- 依托大语言模型主干的长度外推特性,直接继承预训练单帧模型权重,同时支持灵活的单帧与多帧推理模式。
- 在真实机器人操作任务及 LIBERO 仿真基准测试中,表现优于基线模型 pi0.5。
- 影响/看点:该方法降低了单帧具身模型向流式时序模型迁移的重训与参数成本,其实际落地成效取决于复杂物理动态接触场景对更长历史观测窗口的需求与算力权衡。
- 资料依据:
- 1. arXiv 预印本论文(2026年8月):https://arxiv.org/abs/2608.26067
本内容由 AI 生成,仅供参考,请注意甄别