Gemini 3.8 Flash 在 DeepSWE 1.1 跑分达 73.7%
Gemini 3.8 Flash 在 DeepSWE 1.1 基准测试中得分 73.7%,在多模型性能与成本对比中展现出高性价比优势。
AI 深度解读
Logan Kilpatrick 公布了 Gemini 3.8 Flash 在软件工程基准评测 DeepSWE 1.1 上的测试成绩,该模型在保持较低单任务调用成本的同时取得了 73.7% 的解决率。
- 基准测试表现:据 Datacurve AI 发布的 DeepSWE 1.1 评测数据,Gemini 3.8 Flash 取得了 73.7% 的任务解决分数,位列当前轻量高效模型的第一梯队。
- 成本效率比表现:配套评测图表显示,该模型在每任务平均推理成本指标上处于较低区间,体现了 Flash 系列在轻量化高吞吐场景中的性价比特征。
- 软件工程能力检验:DeepSWE 评估集聚焦于真实代码仓库的缺陷定位与 Issue 修复能力,测试结果反映了该模型在代码上下文理解与工具调用上的综合表现。
- 影响/看点:该跑分表明高性价比模型在代码自动化任务中具备实用潜力,但实际研发场景中的有效性仍取决于处理复杂长依赖代码库与私有框架时的稳定性。
- 资料依据:
- Datacurve AI(2026-09-02):https://deepswe.datacurve.ai/benchmarks/gemini-3-8-flash
- X:Logan Kilpatrick(2026-09-02):https://x.com/OfficialLoganK/status/2095178478505328918
本内容由 AI 生成,仅供参考,请注意甄别