早期基准测试显示 GPT-6 Astra 空间与机器人推理能力大幅跃升
早期基准测试显示,GPT-6 Astra 在空间理解与机器人双臂操控推理能力上实现大幅跃升。
AI 深度解读
双臂机器人基准测试 StationeryBench 公布最新评估结果,显示 OpenAI 的 GPT-6 Astra 在三维空间理解与复杂桌面操作任务中表现出显著优势,其关注价值在于为通用大模型控制物理机器人提供了早期定量依据。
- 在双臂 YAM 机器人控制的 200 次试验中,GPT-6 Astra 完全完成了 100 项文具操作任务中的 7 项,中位数任务进度达到 46 分。
- 对照的多模态基线模型 MolmoAct2 任务完全完成数为 0 项,中位数任务进度仅为 12 分。
- 研究人员分析认为该模型在三维空间几何推理上展现出明显进展,推测其在预训练中引入了大量 Blender 等三维仿真场景数据。
- 评测团队已在 GitHub 上公开了完整的测试代码、操作轨迹与视频记录。
- 影响/看点:该测试表明前沿多模态大模型在复杂物理空间交互中具备更强的空间推理能力,但 7% 的全任务完成率也表明其距离工业与家用场景的稳定可靠部署仍有较长技术路径需要跨越。
- 资料依据:
- The Decoder(2026-09-12):https://the-decoder.com/gpt-6-astra-appears-to-show-a-step-change-in-spatial-reasoning-based-on-early-benchmarks/
- GitHub:Robocurve(2026-09-12):https://github.com/robocurve/stationerybench
本内容由 AI 生成,仅供参考,请注意甄别