小米 MiMo-V2.6 技术报告:260 万美元 RL 算力与三维扩展将万亿参数 MoE 推入前沿梯队

📡 邵猛2026-10-10 15:57

小米 LLM-Core 发布 MiMo-V2.6 技术报告,用 260 万美元 RL 算力,从训练批次、环境多样性、评分器三维扩展万亿参数 MoE。

AI 深度解读

小米发布 MiMo-V2.6 技术报告,核心讨论如何沿批次规模、环境多样性和评分器计算三个维度扩展强化学习,关注价值在于它把大模型后训练从单一算力投入转向训练系统协同设计。

  • 论文称,训练采用异步强化学习,每步处理 1568 个样本,最高支持 100 万上下文长度。
  • 环境覆盖代码、通用任务、视觉和网络安全,并结合多种智能体执行框架。
  • 报告提出组级智能体评分,以改善长程任务的奖励信号,同时推动更短、更节省 token 的解答。
  • 模型采用 MoE 路由冻结和多层防奖励投机机制,论文同时公开训练动态、环境及强化学习框架。
  • arXiv 页面显示论文由 Xiaomi LLM-Core Team 提交,发表于 2026-10-08;论文摘要支持上述技术描述,但“260 万美元”成本和“前沿梯队”属于条目概括,不能仅据摘要判断。
  • 影响/看点:如果公开代码和环境能够被独立复现实验验证,这项工作可能降低大规模 RL 方法的复现门槛;其实际价值仍取决于开放材料完整性、基准结果和训练成本能否被外部团队重复核算。
  • 资料依据:
  • arXiv 论文(2026-10-08):https://arxiv.org/abs/2610.11959
  • 小米 MiMo 官方页面(2026-10-08):https://mimo.xiaomi.com/mimo-v2-6
  • Hugging Face 论文页(2026-10-08):https://huggingface.co/papers/2610.11959

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com →
AI 助手