SemiAnalysis 详解 DeepSeek-V4.1-Flash:552B 架构仅激活 8B-16B 参数
SemiAnalysis 深入解析 DeepSeek-V4.1-Flash 架构,指出其 552B 骨干在推理时仅激活 8B 至 16B 参数。
AI 深度解读
DeepSeek 于 2026 年 9 月 10 日发布 DeepSeek-V4.1-Flash 模型,SemiAnalysis 对其 552B 骨干架构中仅激活 8B 至 16B 参数的高效稀疏设计进行了深入解析。
- 据 SemiAnalysis 于 2026 年 9 月 10 日分析及 DeepSeek 官方发布资料,DeepSeek-V4.1-Flash 采用因果编码器-解码器架构,总参数量达 552B,但 prefill 阶段仅激活 8B 参数、decode 阶段仅激活 16B 参数。
- 模型接入了 196B 参数的 Engram 记忆模块,通过稀疏检索机制获取记忆,有效减少全激活带来的计算开销。
- 该模型引入有界重放(bounded replay)机制,使持久 KV 缓存占用相比前代 V4-Flash 减少约 8 倍,显著压缩了长序列推理的显存需求。
- 影响/看点:超低激活参数与极小 KV 缓存若在高并发生产环境中保持低延迟与高吞吐,意味着超大参数模型的部署成本和硬件门槛将显著降低,其落地普及取决于实际硬件生态的适配效率与服务稳定性。
- 资料依据:
- X:SemiAnalysis(2026-09-10):https://x.com/SemiAnalysis_/status/2098017781367091420
- DeepSeek 官方发布(2026-09-10):https://github.com/deepseek-ai/DeepSeek-V4
本内容由 AI 生成,仅供参考,请注意甄别