腾讯混元发布MIX-STQ量化方案,将770B大模型压缩至200GB且精度几乎无损

📡 腾讯混元2026-08-29 13:31

腾讯混元推出MIX-STQ混合量化方案,将770B大模型从1.5TB压缩至200GB且精度几乎无损。

AI 深度解读

腾讯混元于 2026 年 8 月底发布了基于 AngelSlim 框架的 MIX-STQ 混合量化方案,将拥有 7700 亿参数的 Hy4-preview 大模型权重压缩至约 200GiB,为超大规模 MoE 模型降低硬件部署门槛提供了技术参考。

  • 模型与显存变化:腾讯混元官方账号发布的信息显示,Hy4-preview 为 770B 总参数、49B 激活参数且支持 100 万 token 上下文的 MoE 架构,经 MIX-STQ1_0 方案处理后,模型文件从 BF16 格式的 1.5TB 压缩至约 200GiB 的 GGUF 格式。
  • 动态混合位宽策略:该方案利用校准数据评估不同网络层的重要性,对部分非敏感层压缩至 1.31-bit(STQ1_0),对关键层保留至 2.06-bit(IQ2_XXS),通过在固定显存预算内按需分配位宽以控制精度损失。
  • 基准测试表现:根据官方公布的对比数据,量化后模型在 MCP Atlas 基准上为 83.2(BF16 为 83.7),SWE-Bench multi 上为 81.3(BF16 为 82.9),MRCR 上为 81.1(BF16 为 81.3),IFBench 上为 72.5(BF16 为 73.5),各项测试下降幅度在 0.2 至 1.6 个百分点之间。
  • 影响/看点:该方案意味着超大参数量模型在单机多卡或高配工作站上的本地部署可行性得到提升,但实际量化效果的复现通常依赖于校准数据集的覆盖质量以及专用算子在不同推理框架上的适配进度。
  • 资料依据:
  • 1. 腾讯混元 X 官方账号发布(https://x.com/TencentHunyuan/status/2093572224342954019)
  • 2. Hugging Face 社区 AngelSlim 仓库(https://huggingface.co/AngelSlim/Hy4-preview-GGUF)
  • 3. 腾讯混元技术研究博客(https://hy.tencent.ai/research/hy4-preview)

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手