小米直播训练 MiMo-V2.6 大模型:耗资超百万美元探索强化学习扩展边界
小米公开直播 MiMo-V2.6 模型的强化学习训练过程,耗资超 125 万美元探索强化学习的扩展极限并计划开源细节。
AI 深度解读
小米大模型负责人罗福莉披露团队正在进行 MiMo-V2.6 的强化学习训练,并公开了训练状态与实时指标。
- 团队重点探索强化学习在多任务场景的扩展边界,在计算端实现每步约 20 亿 Token、1568 个 Prompt 配合 16 条异步 Rollout 的规模。
- 模型引入多任务智能体强化学习环境,在单次训练运行中混合多种交互框架;同时增加评分算力(Grader Compute)以实现组内信用分配与测试用例奖励。
- 官方训练监控页面显示已投入计算成本超过 125 万美元(约合 840 万元人民币),团队表示相关技术细节将在未来数周逐步开源。
- 影响/看点:小米公开展示大规模强化学习训练过程,说明多任务环境交互与高阶打分算力正在成为大模型逻辑推理扩展的核心探索方向。
- 资料依据:
- IT之家(2026-09-17):https://www.ithome.com/1/003/555.htm
- 小米 MiMo 强化学习训练监控面板(2026-09-17):https://mimo.xiaomi.com/rl/dashboard
本内容由 AI 生成,仅供参考,请注意甄别