DeepSeek 正式发布 V4.1 Flash:支持 1M 上下文与超低 KV 缓存占用
DeepSeek发布V4.1 Flash模型权重,支持1M上下文及FP4 KV缓存技术,并开源相关推理部署方案。
AI 深度解读
技术媒体 MarkTechPost 于 2026 年 9 月 10 日发布技术解析,披露了 DeepSeek V4.1 Flash 在 1M 上下文支持与多项注意力优化技术上的实现细节。
- 模型包含 552B 骨干参数与 196B Engram 参数,全局 KV 缓存足迹压缩至每 Token 约 890 字节,并支持 FP4 低比特量化。
- 采用 20 层因果编码器加 20 层解码器的结构,解码端通过投影权重复用编码器状态计算全局注意力,减少了预填充阶段约一半的计算量。
- 引入压缩稀疏注意力 CSA2 技术,通过全量计算、重新索引与直接复用三种分层模式降低注意力层冗余计算。
- 模型权重遵循 MIT 开源协议发布,已同步适配 vLLM 与 SGLang 等开源推理框架。
- 影响/看点:跨层注意力复用与 FP4 缓存机制为超长文本推理提供了工程实现范例,该方案的普及取决于开源推理生态对非对称结构算子的持续优化与硬件适配完善度。
- 资料依据:
- MarkTechPost(2026-09-10):https://www.marktechpost.com/2026/09/10/deepseek-ai-released-deepseek-v4-1-flash-with-1m-context-fp4-kv-cache-and-cross-layer-attention-reuse/
- Hugging Face(2026-09-10):https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
本内容由 AI 生成,仅供参考,请注意甄别