AMAP 团队发布 LoopArena:评测大模型作为循环工程运行时控制器的能力
AMAP团队发布LoopArena基准,用于评测大模型引导编码智能体执行长任务的控制与循环能力。
AI 深度解读
高德地图(AMAP)团队于 2026 年 8 月发布评测基准 LoopArena(arXiv: 2608.28281),专门评估大语言模型作为运行时控制器引导固定编码智能体完成长程工程任务的能力。
- 针对循环工程中难以解耦控制策略与执行智能体能力的问题,该基准固定下游 Worker 编码智能体,单独评测外层 Controller 模型的调度与纠错水平。
- 设立三种评测模式,涵盖下一步循环合约选择、任务切片重复控制以及端到端全任务闭环执行。
- 全任务评测中最佳严格成功率仅为 24.69%,显示长程复杂循环控制能力仍有较大提升空间;任务切片评测可在保持极高排序一致性(Spearman 相关系数 0.9747)的同时降低约 64.4% 的推理成本。
- 影响/看点:该基准为长流程自动化软件工程的顶层控制架构提供了标准化量化工具,有助于推动控制模型与执行智能体的模块化分工演进。
- 资料依据:
- DAIR.AI 官方账号(2026-08-31):https://x.com/dair_ai/status/2094511549306315189
- arXiv 论文库(2026-08-31):https://arxiv.org/abs/2608.28281
本内容由 AI 生成,仅供参考,请注意甄别