突破 1.58-bit 极限:三元大语言模型新研究突破量化瓶颈
新研究突破了三元大语言模型的1.58-bit量化瓶颈,推动极低比特模型发展。
AI 深度解读
研究团队在 arXiv 上发表论文提出针对三元大语言模型的新型存储布局 BITCOS,通过利用非均匀分布特性突破了传统 1.58 比特每权重的存储下限。
- 理论局限方面,传统三元模型部署采用五三进制打包(5-trit packing),在等概率假设下每个权重需占用 1.625 比特。
- 统计实测方面,论文对 29 个三元大模型进行统计,发现权重中零元素的占比最高可达 51.5%。
- 布局改进方面,BITCOS 采用稠密存在位图加紧凑符号向量的方案,每权重存储开销降为 2-z 比特(z 为零密度),在最稀疏模型上达到 1.485 比特。
- 运行性能方面,结合针对 AVX-512、AVX2 及 Intel Xe2 GPU 的解包优化,在五种硬件平台上实现端到端解码吞吐提升 1.18 倍(CPU)与 1.27 倍(GPU)。
- 影响/看点:该方案为三元大语言模型在边缘与端侧设备的轻量化部署提供了更紧凑的压缩路径,但能否推广取决于主流推理框架对其定制算子的支持进度。
- 资料依据:
- arXiv(2026-09-14):https://arxiv.org/abs/2609.16338
- Hacker News(2026-09-16):https://news.ycombinator.com/item?id=41560938
本内容由 AI 生成,仅供参考,请注意甄别