Gated DeltaNet 为何能扛住 4-bit 量化:混合 27B 大模型的全量 NVFP4 W4A4 量化
研究显示,Gated DeltaNet各层采用全量4比特量化后,模型性能接近BF16且推理更快、占用更小。
AI 深度解读
研究人员提出 Minima 量化方案,首次对包含 Gated DeltaNet(GDN)线性注意力层的 27B 混合架构模型实现全量 496 个线性层的 NVFP4 W4A4 量化,验证了循环层在低比特量化下的高鲁棒性。
- 打破精度顾虑:此前社区因担忧循环累积误差而对 GDN 维持高精度,该研究证实 GDN 循环部分可完全量化,在 4K/32K 困惑度及多项基准测试中表现与 BF16 相当。
- 显存与推理性能:全量量化使模型显存压缩至 17.5 GiB,首字预填充速度提升 14% 至 19%,且长文本困惑度差距随位置增加而缩小。
- 误差消除机理:NVFP4 的 16 元素分块缩放控制了残差离群值,门控参数化压缩了计算误差,Delta 规则的循环更新可在数百步内遗忘冲击,单 token 量化开销随上下文长度被稀释。
- 影响/看点:该成果证明了混合架构在超低比特部署上的显存优势,为长文本模型的轻量化落地提供了新方案,其实用价值的完全释放取决于支持 NVFP4 低精度硬件的普及进度。
- 资料依据:
- arXiv 论文预印本(2026-09-03):https://arxiv.org/abs/2609.04098
- Hugging Face 模型库(2026-09-03):https://huggingface.co/minima-ai/mnma_qwen3.8_27b_nvfp4
本内容由 AI 生成,仅供参考,请注意甄别