小米官宣 MiMo-V3 采用全新 HySparse 2 架构:大幅降低预填充与 KV 缓存开销
小米宣布 MiMo-V3 采用全新 HySparse 2 架构,大幅降低百万长文本下的预填充计算量与 KV 缓存占用。
AI 深度解读
小米大模型团队公布了面向智能体推理场景设计的 HySparse 2 架构,该架构将应用于即将推出的 MiMo-V3 模型中以降低长上下文计算开销。
- 针对智能体长文本观察与多轮交互负载,论文提出了 KV 桥接(KV Bridging)与混合块内 KV 重用(KV Reuse)等核心机制。
- 采用 Token 级别的选择替代块级别选择,让本地和全局 Token 共享同一个 KV 缓存,预填充在自解码器完成时即可停止。
- 官方测试显示,在 1M Token 长度下预填充 FLOPs 降低 5.02 倍,KV 缓存缩小 4.5 倍,并在长文本检索评测中取得更好表现。
- 影响/看点:HySparse 2 架构有望降低智能体在长上下文多轮推理下的硬件显存与时延负担,其实际价值取决于在全量 MiMo-V3 上的通用泛化能力与真实落地效果。
- 资料依据:
- IT之家(2026-09-23):https://www.ithome.com/1/006/502.htm
- arXiv(2026-09-23):https://arxiv.org/pdf/2609.26368
本内容由 AI 生成,仅供参考,请注意甄别