DeepSeek-V4.1-Flash 跃居 Agent Arena 开源第三,单任务成本仅 0.07 美元
DeepSeek-V4.1-Flash 登上 Agent Arena 开源模型第三位,单任务中位成本仅约 0.07 美元。
AI 深度解读
Agent Arena 于 2026 年 9 月 14 日公布最新评测数据,DeepSeek-V4.1-Flash(Max)位列开源模型第三名并刷新帕累托前沿,展现了高性价比开源模型在智能体任务上的效费比优势。
- 评测数据显示,DeepSeek-V4.1-Flash(Max)在基线之上实现 4.87% 的净改进幅度,单任务中位数推理成本仅为 0.07 美元。
- 与同处开源前列的模型相比,该模型保留了 Hy4 preview 约 98% 的净改进幅度且成本降低 73%,保留了 Kimi K3(Max)约 76% 的性能且成本降低 92%。
- 与 Claude Fable 5.1(Max)等头部闭源模型相比,其以 1% 至 3% 的成本保留了 35% 至 54% 的性能改进,使多款旧版本模型退出帕累托前沿。
- 据 Hugging Face 官方文档公布的架构信息,该模型采用 552B 参数混合专家架构与单向编解码器(CED),并结合 KV 缓存压缩技术降低推理资源消耗。
- 影响/看点:该评测结果表明端到端智能体任务的推理成本正在快速下降,若开发者在实际生产环境中能维持与基准相符的完成率,轻量级高性价比模型可能会加快复杂智能体工作流的规模化部署。
- 资料依据:
- X:Arena (@arena)(2026-09-14):https://x.com/arena/status/2099606881845321841
- Hugging Face(2026-09-10):https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
本内容由 AI 生成,仅供参考,请注意甄别