清华团队推出 PACE-Bench:评测智能体在动态物理环境中的代码自适应能力

📡 面壁智能 OpenBMB2026-08-26 22:00

清华团队推出PACE-Bench,评测智能体面对物理环境变化时修改代码并重新适应的能力。

AI 深度解读

清华大学自然语言处理团队发布 PACE-Bench,用动态物理环境检验智能体能否依据执行反馈修改代码、适应环境变化;其价值在于把评测重点从固定条件下的任务完成,推进到环境突变后的恢复能力。

  • 论文《PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments》于2026年8月14日提交至 arXiv,设置144组源环境到目标环境的适应任务,覆盖六类物理领域。
  • 目标环境会改变物理参数,但保留任务目标与接口,智能体必须通过有限次数的代码修改和模拟器反馈重新设计方案。
  • 论文报告称,Reflexion+Qwen3-14B在完整基准上的成功率为35.9%;GPT-5.5在 Statics 子集、完整预算下达到66.7%,二者并非同一测试范围。
  • 研究还发现,基于模拟器结果的反思优于未经验证的自我修订;即使直接告知物理变化,也没有消除性能上限,说明难点更多在机制重设计,而不只是参数推断。
  • 这类基准对代码智能体和具身智能体都有参考意义,但结果依赖任务构造、预算和模拟器与现实世界的差异。
  • 影响/看点:PACE-Bench可能促使智能体评测更多关注环境变化后的恢复与重构能力;这一影响能否成立,取决于基准任务是否具有足够的现实代表性,以及模拟器反馈能否有效映射到真实环境。
  • 资料依据:《PACE-Bench: Benchmarking Physics Adaptation via Code Evolution in Dynamic Environments》,2026年8月14日,https://arxiv.org/abs/2608.14441;PACE-Bench论文页面,https://huggingface.co/papers/2608.14441

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手