Bug Hunt 实测:Meta Muse Spark 1.3 代码模型表现位列前沿梯队
Bug Hunt实测显示,Meta Muse Spark 1.3成功修复33个真实代码缺陷,表现与Fable 5.1并列前沿梯队。
AI 深度解读
在针对实际工程代码的第三方基准测试 Bug Hunt 中,Meta 的 Muse Spark 1.3 模型展现出较强的缺陷修复能力,为前沿代码模型的工程表现提供了实测参考。
- 测试由行业研究人员基于 2 个真实代码仓库和 105 个预设植入 Bug 展开,评估模型在真实软件工程场景下的代码定位与自动修复能力。
- 实测结果显示,Muse Spark 1.3(max 版本)成功修复 33 个 Bug,与 Fable 5.1(high 版本)并列第一。
- 同批次测试中,Muse Spark 1.3 的修复成绩高于 Grok 4.6(xhigh 版本,修复 27 个)与 Opus 5(max 版本,修复 27 个),而 Muse Spark 1.3(high 版本)修复数为 19 个。
- 影响/看点:测试数据表明 Meta 在专用代码生成与排错领域取得进展,但其实际工程应用价值仍取决于模型面对非标准化代码库时的泛化能力及验证成本。
- 资料依据:
- X:Alexandr Wang(2026-09-13):https://x.com/alexandr_wang/status/2099157412171374780
- GitHub:Bug Hunt Bench(2026-09-13):https://github.com/bughunt-bench/bug-hunt-evaluation
- Meta AI(2026-09-10):https://ai.meta.com/blog/muse-spark-1-3-code-engineering
本内容由 AI 生成,仅供参考,请注意甄别