小米 MiMo-V2.6 公开 RL 训练细节:多任务智能体混合调度与异步扩展

📡 Elvis Saravia2026-09-17 05:35

小米公开 MiMo-V2.6 强化学习训练技术细节,已投入超百万美元并计划逐步开源相关方案。

AI 深度解读

小米 MiMo 团队公开其 MiMo-V2.6 模型的大规模强化学习训练细节,披露其在算力扩展、智能体环境与评分机制上的系统设计。

  • 算力扩展规模:训练采用全异步架构,单步处理约 20 亿 tokens,单批次包含 1568 个 prompts 与 16 次 rollouts,目前研发投入已超 100 万美元。
  • 多环境与多 Harness:采用多任务智能体强化学习,单次训练运行中混合调度多个环境测试套件,提升智能体泛化适应能力。
  • 信用分配与奖励:在评分环节引入组内智能体信用分配机制,将单元测试用例与细粒度评分量表(rubric)奖励相结合。
  • 影响/看点:公开多任务智能体的大规模 RL 工程细节可能为开源社区探索复杂推理与环境交互提供重要经验,但其复现与跟进门槛仍受限于数百万美元级的算力开销与集群调度稳定性。
  • 资料依据:
  • X:Elvis Saravia (@omarsar0, DAIR.AI)(2026-09-16):https://x.com/omarsar0/status/2100337683277173009
  • GitHub:Xiaomi MiMo 官方仓库(2026-09-16):https://github.com/xiaomi/mimo-v2.6-rl

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手