Gated DeltaNet 为何能扛住 4-bit 量化:混合 27B 大模型的全量 NVFP4 W4A4 量化

📡 HuggingFace Daily Papers2026-09-03 08:00

研究显示,Gated DeltaNet各层采用全量4比特量化后,模型性能接近BF16且推理更快、占用更小。

AI 深度解读

研究人员提出 Minima 量化方案,首次对包含 Gated DeltaNet(GDN)线性注意力层的 27B 混合架构模型实现全量 496 个线性层的 NVFP4 W4A4 量化,验证了循环层在低比特量化下的高鲁棒性。

  • 打破精度顾虑:此前社区因担忧循环累积误差而对 GDN 维持高精度,该研究证实 GDN 循环部分可完全量化,在 4K/32K 困惑度及多项基准测试中表现与 BF16 相当。
  • 显存与推理性能:全量量化使模型显存压缩至 17.5 GiB,首字预填充速度提升 14% 至 19%,且长文本困惑度差距随位置增加而缩小。
  • 误差消除机理:NVFP4 的 16 元素分块缩放控制了残差离群值,门控参数化压缩了计算误差,Delta 规则的循环更新可在数百步内遗忘冲击,单 token 量化开销随上下文长度被稀释。
  • 影响/看点:该成果证明了混合架构在超低比特部署上的显存优势,为长文本模型的轻量化落地提供了新方案,其实用价值的完全释放取决于支持 NVFP4 低精度硬件的普及进度。
  • 资料依据:
  • arXiv 论文预印本(2026-09-03):https://arxiv.org/abs/2609.04098
  • Hugging Face 模型库(2026-09-03):https://huggingface.co/minima-ai/mnma_qwen3.8_27b_nvfp4

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手