DeepSeek 正式发布 V4.1 Flash 模型:全新 552B 架构大幅压缩 KV 缓存
DeepSeek正式发布552B参数的V4.1 Flash模型,采用全新MoE架构并大幅降低推理与显存成本。
AI 深度解读
深度求索(DeepSeek)于 2026 年 9 月 10 日正式发布 DeepSeek V4.1 Flash 模型,采用全新 552B 参数 MoE 架构并显著降低 KV 缓存资源消耗。
- 模型采用 Causal-Encoder-Decoder 非对称结构,输入激活参数为 8B,输出激活参数为 16B,以更低计算开销提升吞吐性能。
- 针对长上下文与智能体场景重构缓存机制,KV Cache 占用较上一代减少至四分之一,相比初代模型降至 1/437。
- 官方基准测试显示其综合性能与智能体能力超越 V4 Pro,API 单价同步下调并维持峰谷分时计费策略,原 V4 Pro 将被有序替代。
- 影响/看点:KV 缓存占用的大幅降低有助于显著压降长文本分析与多轮智能体应用的部署及调用成本,其规模化效应取决于高并发实际业务场景中的推理质量一致性。
- 资料依据:
- IT之家(2026-09-10):https://www.ithome.com/1/000/719.htm
- Hugging Face(2026-09-10):https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
本内容由 AI 生成,仅供参考,请注意甄别