PrismML推出Bonsai 2 27B模型:以1/9内存占用保留Qwen3.8近98%性能

📡 IT之家2026-09-18 13:42

PrismML发布三值量化模型Bonsai 2 27B,基于Qwen3.8,以不到九分之一内存保留原模型98.2%的性能。

AI 深度解读

PrismML 推出三值量化模型 Bonsai 2 27B,以不足基础模型九分之一的内存占用保留了 Qwen3.8 27B 基础模型 98.2% 的综合基准性能。

  • 模型基于 Qwen3.8 27B 进行三值量化与微调,总大小仅 5.9GB,每个权重有效比特为 1.76,并支持 262K 上下文窗口。
  • 运行性能方面,在 NVIDIA GeForce RTX 5090 上词元吞吐量达 143 TPS,在 Apple M5 Max 上达 46.8 TPS;RTX 4090 上的能效为 0.714 mWh/Token,比全精度 8B 模型低 40%。
  • 模型以 Apache 2.0 许可证开源权重,支持 CUDA 与 Apple MLX 框架,定位为在本地承担编程智能体、计算机使用工作流及私有文档解析等任务。
  • 影响/看点:表明极低比特量化技术在保持大模型核心性能上取得实质进展,有望大幅降低消费级硬件部署 27B 级别大模型的门槛,但其在长程复杂推理下的实际稳定性仍需更多真实场景检验。
  • 资料依据:
  • IT之家(2026-09-18):https://www.ithome.com/1/004/072.htm
  • Hugging Face 官方发布(2026-09-18):https://huggingface.co/Qwen/Qwen3.8-27B

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手