PrismML推出Bonsai 2 27B模型:以1/9内存占用保留Qwen3.8近98%性能
PrismML发布三值量化模型Bonsai 2 27B,基于Qwen3.8,以不到九分之一内存保留原模型98.2%的性能。
AI 深度解读
PrismML 推出三值量化模型 Bonsai 2 27B,以不足基础模型九分之一的内存占用保留了 Qwen3.8 27B 基础模型 98.2% 的综合基准性能。
- 模型基于 Qwen3.8 27B 进行三值量化与微调,总大小仅 5.9GB,每个权重有效比特为 1.76,并支持 262K 上下文窗口。
- 运行性能方面,在 NVIDIA GeForce RTX 5090 上词元吞吐量达 143 TPS,在 Apple M5 Max 上达 46.8 TPS;RTX 4090 上的能效为 0.714 mWh/Token,比全精度 8B 模型低 40%。
- 模型以 Apache 2.0 许可证开源权重,支持 CUDA 与 Apple MLX 框架,定位为在本地承担编程智能体、计算机使用工作流及私有文档解析等任务。
- 影响/看点:表明极低比特量化技术在保持大模型核心性能上取得实质进展,有望大幅降低消费级硬件部署 27B 级别大模型的门槛,但其在长程复杂推理下的实际稳定性仍需更多真实场景检验。
- 资料依据:
- IT之家(2026-09-18):https://www.ithome.com/1/004/072.htm
- Hugging Face 官方发布(2026-09-18):https://huggingface.co/Qwen/Qwen3.8-27B
本内容由 AI 生成,仅供参考,请注意甄别