Real-SWE:基于真实企业私有代码库的 AI 编码基准测试
新基准测试 Real-SWE 发布,旨在基于真实世界中的企业私有代码库来评估 AI 编程模型的实际能力。
AI 深度解读
Specific Labs 发布了名为 Real-SWE 的全新 AI 编码基准测试,通过引入真实企业私有生产代码库,评估编程智能体在闭源业务系统中的实际工程解决能力。
- 真实私有代码:测试任务源自企业授权的私有代码库,涵盖计费税收、客户迁移等多服务复杂系统,避免公开代码污染与记忆作弊。
- 原生 Harness 评测:评估体系绑定模型与对应原生工程框架(如 Claude Code、Codex CLI、Gemini CLI 等),覆盖代码、基础设施与外部依赖环境。
- 任务与执行规模:包含 10 项端到端企业工程任务,共进行 640 次独立运行评测(每项任务独立运行 8 次计算 pass@1 解决率)。
- 当前榜单表现:Fable 5.1 搭配 Claude Code 以 38.8% 的解决率位列榜首,GPT-6 Astra 与 Gemini 3.8 Flash 分别以 33.8% 和 31.2% 位列第二与第三。
- 影响/看点:Real-SWE 意味着代码评测从开源合成题目转向防御数据污染的企业实战,这一评测范式能否成为行业通行标准取决于其私有任务库的更新频率与企业场景代表性广度。
- 资料依据:
- Specific Labs(2026-09-13):https://withspecific.com/benchmarks/real-swe
- Hacker News(2026-09-13):https://news.ycombinator.com/item?id=41528930
本内容由 AI 生成,仅供参考,请注意甄别