Artificial Analysis:Claude Opus 5.5 登顶编码智能体榜首,单任务平均成本 13 美元

📡 Artificial Analysis2026-09-24 09:24

评测显示 Claude Opus 5.5 登顶编码智能体榜首,各项测试显著提升,单任务平均成本为 13 美元。

AI 深度解读

评测机构 Artificial Analysis 发布的编码智能体指数(Coding Agent Index)显示,Anthropic 旗下的 Claude Opus 5.5 在 Claude Code max effort 设定下取得 66 分,位列榜单首位,体现了前沿代码模型在高算力投入下的任务解决能力。

  • 在子项基准测试中,该模型在 Terminal-Bench 4.0 取得 63.1%、DeepSWE v1.1 取得 68.4%、SWE-Atlas-QnA 取得 66.4%,相较前代 Opus 5 的 60 分综合成绩提升 6 分。
  • 性能提升伴随着推理开销的增加,在 max effort 深度推理与多步调用模式下,单任务平均运行成本升至 13.04 美元。
  • 评测结果表明,当前代码智能体通过增加单任务计算预算与长程调用步数,能够有效提高复杂软件工程任务的完成率。
  • 影响/看点:该测评表明编码智能体的工程上限得到进一步验证,但单任务超 13 美元的开销意味着其短期内更偏向高价值疑难缺陷排查或关键架构重构,规模化工程普及仍取决于后续推理开销与执行效率的优化。
  • 资料依据:
  • X:Artificial Analysis(2026-09-24):https://x.com/ArtificialAnlys/status/2102932119995756613
  • Artificial Analysis(2026-09-24):https://artificialanalysis.ai/evaluations/coding-agents

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手