Testing Catalog:Claude Opus 5.5 智能体编码与系统操作跑分刷新纪录
Anthropic发布Claude Opus 5.5,在智能体编码与系统操作基准测试中刷新纪录且成本降低40%。
AI 深度解读
Anthropic 发布 Claude 5.5 系列首款模型 Claude Opus 5.5,其关注价值在于智能体编码与系统交互基准得分刷新行业记录的同时优化了调用成本。
- 官方公布的基准数据显示,该模型在终端智能体编码基准 Terminal-Bench 4.0 中得分 66.4%,在模拟操作系统操作的 OSWorld 2.0 中取得 81.8% 的成绩。
- 该模型在大多数常规任务上的综合表现看齐 Claude Fable 5.1,且运行成本相较前代 Opus 5 降低了 40%。
- 相关评测均在最高自适应思考强度与生产环境安全防护开启的状态下进行测试。
- 影响/看点在于,若该模型在实际软件工程长流程和复杂桌面操作中展现出与基准相符的泛化稳定性,将进一步推进自动化编程与系统代理的实用化进程。
- 资料依据:
- Testing Catalog(2026-09-22):https://x.com/testingcatalog/status/2102437617128403057
- Anthropic 官方发布说明(2026-09-22):https://www.anthropic.com/news/claude-opus-5-5
本内容由 AI 生成,仅供参考,请注意甄别