腾讯混元开源 Hy4 轻量版:从 1.5TB 压缩至 214GB,支持异构设备推理
腾讯开源混元 Hy4 轻量版,通过量化技术将 770B MoE 模型压缩至 214GB 并支持异构设备推理。
AI 深度解读
腾讯混元团队于 2026 年 9 月 1 日开源 Hy4 preview 轻量版模型,依托混合量化技术将 770B 总参数量 MoE 模型的权重体积从近 1.5TB 压缩至约 214GB,并验证了跨设备异构联合推理方案。
- 压缩方案结合了 Sherry 稀疏三值量化算法(将路由专家层压缩至平均 1.25 比特)与 MIX-STQ1_0 混合精度策略,根据敏感度分层决定量化位宽以抑制精度损失。
- 评测数据显示模型在长文理解和多轮长检索任务上保持稳定,MCP Atlas 得分从 83.7 微调至 83.2,SWE-Bench multi 得分由 82.9 降至 81.3。
- 团队与 prima.cpp 合作在单张 4090 笔记本与四卡 A4000 服务器(合计 80GB 显存、64GB 内存)上实现 MoE 拆分调度,达成 1.02 token/s 的推理速度。
- 量化模型已上线 Hugging Face 与 GitHub,支持 llama.cpp、vLLM 和 SGLang 等主流推理框架。
- 影响/看点:大参数 MoE 模型的极端量化与异构调度验证,为本地与分布式消费级硬件运行超大规模模型提供了可行路径,但其商用价值仍取决于跨设备局域网通信延迟以及特定复杂推理对低比特量化误差的容忍度。
- 资料依据:
- IT之家(2026-09-01):https://www.ithome.com/0/996/880.htm
- Hugging Face(2026-09-01):https://huggingface.co/AngelSlim/Hy4-preview-GGUF
本内容由 AI 生成,仅供参考,请注意甄别