阿里开源 125B 极稀疏新架构:激活仅 6B,SWE-bench Pro 跑分超 Claude
阿里开源 125B 极稀疏模型新架构,每 token 仅激活 6B,SWE-bench Pro 评测跑分超越 Claude。
AI 深度解读
阿里巴巴 Qwen 团队于 2026 年 8 月 26 日开源 Qwen3.8-Flash-Next 架构,为下一代 Qwen4 在超稀疏激活与低成本推理方向提供了公开技术验证。
- 极稀疏参数配置:模型总参数为 125B,外加 51B 可卸载至主机内存的 N-gram 嵌入表,单 token 激活参数仅 6B,官方称训练计算开销降至 Qwen3.7-Plus 的九分之一。
- 混合架构创新:整合门控 DeltaNet 与稀疏注意力(QSA)机制,原生支持 25.6 万 token 上下文,并可通过 YaRN 技术扩展至 100 万 token。
- 基准测试表现:在 Qwen 官方公布的内部评测中,该模型在 SWE-bench Pro 上取得 62.5 分,高于测试对比组中的 Claude Opus 4.6 Max(53.4 分)。
- 影响/看点:该架构可能显著降低长上下文编程与复杂智能体任务的显存和计算成本,但其在多样化实际业务中的鲁棒性仍有待开源社区的独立测试验证。
- 资料依据:
- 1. Qwen 官方发布(2026-08-26):https://qwen.ai
- 2. ModelScope 开源仓库(2026-08-26):https://modelscope.cn
本内容由 AI 生成,仅供参考,请注意甄别