小米公布 MiMo-V3 核心架构 HySparse2,专为长程多轮 Agent 优化推理效率
小米公布MiMo-V3核心架构HySparse2,通过优化KV共享与稀疏机制,降低长程Agent推理开销并提升检索精度。
AI 深度解读
小米大模型团队于 2026 年 9 月 24 日公开面向 MiMo-V3 的核心注意力架构 HySparse2,重点优化长程多轮 Agent 在工具调用与长历史检索中的计算开销与显存占用。
- 借鉴 YOCO 设计采用前后分段结构,前半部分为混合全注意力与滑动窗口注意力的 Self-Decoder,后半部分为混合全注意力与稀疏注意力的 Cross-Decoder。
- 引入两级 KV 共享机制,通过 KV Bridging 跨阶段提前构建键值缓存,并在同一 Hybrid Block 内部实现全注意力与稀疏注意力层间的 KV 与索引复用(KV Reuse)。
- 将稀疏选择粒度从上一代的块级升级为 token 级,提高长历史中离散关键信息的检索精度。
- 影响/看点:该架构若在 MiMo-V3 实际模型中落地并保持生成质量,可能降低多轮 Agent 在处理长文档与复杂调用日志时的显存开销与推理延迟。
- 资料依据:
- Xiaomi MiMo 官方团队(2026-09-24):https://github.com/Xiaomi-MiMo
- IT之家(2026-09-24):https://www.ithome.com/1/006/839.htm
本内容由 AI 生成,仅供参考,请注意甄别