DeepSeek-V4.1-Flash:突破 KV Cache 压缩极限的 552B 多模态 MoE 模型

📡 HuggingFace Daily Papers2026-09-17 08:00

DeepSeek推出552B多模态MoE模型DeepSeek-V4.1-Flash,采用CED架构降低长文本KV缓存与算力开销。

AI 深度解读

DeepSeek 发布 552B 多模态混合专家模型 DeepSeek-V4.1-Flash,通过因果编码器-解码器架构与跨层压缩技术降低长上下文推理的 KV Cache 存储与带宽负载。

  • 异构激活的 CED 架构:采用因果编码器-解码器(CED)设计,在 Prefill 阶段仅激活 8B 参数,Decode 阶段激活 16B 参数,针对长输入智能体负载降低算力开销。
  • 多维度 KV Cache 压缩:结合 CSA2 跨层 KV 缓存复用与 FP4 低精度量化,使全局 HBM KV Cache 降至每 Token 890 字节,约为前代 V4-Flash 的四分之一。
  • 分级存储优化:引入 SWA Bounded Replay 部署机制,将保存在 SSD 与主机内存中的持久化 KV Cache 占用降至前代约八分之一,支持最高 100 万 Token 上下文。
  • 预训练与开源发布:模型在 45T 多模态 Token 上完成预训练与后训练对齐,并在 Hugging Face 公开开源模型权重。
  • 影响/看点:KV Cache 占用的有效缩减有望降低百万级超长上下文 Agent 任务的单并发部署成本,其实际吞吐收益取决于硬件对 FP4 算子加速的支持程度与解码延迟表现。
  • 资料依据:
  • arXiv(2026-09-17):https://arxiv.org/abs/2609.19969
  • Hugging Face(2026-09-17):https://huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手