DeepSeek开源552B多模态模型V4.1-Flash:创新CED架构大幅压缩KV缓存
DeepSeek开源552B多模态模型V4.1-Flash,采用CED架构大幅降低KV缓存并支持百万上下文。
AI 深度解读
DeepSeek 于 2026 年 9 月 14 日在 Hugging Face 开源多模态模型 DeepSeek-V4.1-Flash,聚焦于长上下文场景下的显存占用与计算缓存优化。
- 模型总参数量为 552B,基于混合专家架构,单 token 激活 16B 参数(预填充阶段激活 8B 参数),支持最长 100 万 token 的上下文窗口。
- 采用因果编码-解码(CED)架构,结合跨步注意力与 FP4 KV 缓存技术,将全局 KV 缓存压缩至每 token 890 字节。
- 配合滑动窗口注意力边界重放机制,持久化 KV 缓存开销降低至约初始状态的八分之一,预训练多模态语料规模达 45T token。
- 影响/看点:若 CED 架构与低比特缓存技术在主流推理框架中得到稳定适配,可能显著降低百万级超长上下文多模态任务的显存占用与硬件部署门槛。
- 资料依据:
- Hugging Face deepseek-ai 官方模型库(2026-09-14):https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash
- X 平台马东锡 NLP 账号(2026-09-14):https://x.com/dongxi_nlp/status/2099397246479401151
本内容由 AI 生成,仅供参考,请注意甄别