PhysBrain 1.5:从视觉语言模型迈向具身物理基础模型
研究团队推出具身物理模型PhysBrain 1.5,将视觉、动作与物理状态预测统一为自回归序列,从人类交互视频中学习物理规律。
AI 深度解读
研究团队于2026年9月14日在arXiv推出8B具身物理基础模型PhysBrain 1.5,探索了物理环境感知、动作生成与未来状态预测的统一自回归建模。
- 模型将自然语言回答、末端执行器运动轨迹以及密集视觉目标统一离散化编码,采用自回归Next-token预测范式联合训练。
- 预训练阶段完全依托人类交互视频提取具身监督信号,通过情境切片对齐语义空间上下文与运动变化序列。
- 微调阶段结合了人类示范、真实机器人轨迹与仿真经验的多源混合数据。
- 在28个具身理解评测基准中取得72.5的平均得分,同时展示了末端轨迹生成与未来场景深度、掩码预测能力。
- 影响/看点:该工作展示了视觉语言模型向物理世界因果推断底座迁移的可行路径,但在物理实体机器人上的泛化控制精度仍有待实际硬件闭环检验。
- 资料依据:
- arXiv(2026-09-14):https://arxiv.org/abs/2609.14973
- Hugging Face(2026-09-14):https://huggingface.co/papers/2609.14973
本内容由 AI 生成,仅供参考,请注意甄别