DeepSeek 发布 V4.1-Flash:大幅降低 Agent 内存需求与推理成本
DeepSeek 发布多模态模型 V4.1-Flash,将 KV 缓存显存占用缩减至前代四分之一,大幅降低 Agent 推理成本。
AI 深度解读
DeepSeek 于 2026 年 9 月 10 日发布多模态开源模型 V4.1-Flash 并公开技术报告,其核心改进在于降低 Agent 运行时的 KV 缓存内存占用与输入计算开销。
- 模型总参数量为 5520 亿,采用因果编码器与解码器分离架构,输入读取时每个 Token 仅激活 80 亿参数,文本输出时激活 160 亿参数,输入计算需求较前代减少近半。
- 显存内的 KV 缓存占用压缩至前代 V4-Flash 的四分之一,离线卸载部分缩小至八分之一,并支持以 FP4 格式存储主 KV 缓存以进一步降低内存占用。
- 在 DeepSWE v1.1 编程测试中,模型得分 74.2%,但在 ProgramBench、复杂图像理解以及高门槛科学推理任务上,与前沿超大规模闭源模型相比仍存在性能差距。
- 模型基于 MIT 协议在 Hugging Face 开源,API 保持与 V4-Flash 相同的计费标准,并允许用户通过调节推理深度在算力成本与输出质量之间权衡。
- 影响/看点:该架构优化若能在多轮工具调用的复杂 Agent 场景中稳定发挥,可能显著降低长上下文应用的部署与推理成本,但其实际效果仍取决于在真实生产任务中对安全边界与复杂推理能力的把控。
- 资料依据:
- The Decoder(2026-09-10):https://the-decoder.com/new-deepseek-model-v4-1-flash-cuts-memory-needs-for-ai-agents/
- DeepSeek(2026-09-10):https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash/blob/main/DeepSeek_V41_Tech_Report.pdf
本内容由 AI 生成,仅供参考,请注意甄别