Arena 评测 7 款模型在 Claude Code、Codex 等测试框架下的编码效果与成本差异
Arena 评测了 7 款模型在三种代码测试框架下的表现,发现测试框架对任务成功率影响有限但显著影响成本。
AI 深度解读
Arena 发布了一项针对 7 款模型在三种不同编码脚手架(harness)下的横向评测,揭示了运行框架对模型代码生成成功率影响有限但对调用成本影响显著的工程规律。
- 评测团队于 2026 年 9 月 16 日测试了 7 款主流大模型分别接入 Claude Code、Codex 和 Pi 三种 harness 的表现,共覆盖 21 组实验组合。
- 实验结果表明,不同 harness 之间的任务最终成功率差异较小,表明模型自身的代码推理基础起主导作用。
- 评测同时指出不同框架在提示词构造、上下文管理与工具调用策略上的差异,导致不同 harness 之间的 Token 消耗与计费成本存在显著差距。
- 影响/看点:这一发现意味着企业在构建代码辅助工具时无需受限于特定专属框架,但在选型与自研 harness 时需将上下文压缩与调用策略列为成本控制的关键考量。
- 资料依据:
- X:Arena(2026-09-16):https://x.com/arena/status/2100280949661667413
- LMSYS Org(2026-09-16):https://lmarena.ai/blog/2026/09/16/coding-harness-benchmark/
本内容由 AI 生成,仅供参考,请注意甄别