小米直播 MiMo-v2.6 模型 Agentic RL 后训练过程
小米开启 MiMo-v2.6 模型的强化学习后训练直播,实时展示双模型智能体训练进展与算力消耗。
AI 深度解读
小米通过线上直播公开了 MiMo-v2.6-pro 与 Flash 两款模型的强化学习(RL)后训练过程,展示了针对智能体任务的端到端训练监控。
- 开发者观察指出,直播展示的训练阶段聚焦于智能体强化学习,实时展示两款模型在特定基准上的演进轨迹。
- 数据显示 MiMo-v2.6-pro 在 DeepSWE 代码基准上当前得分为 62,尚处于早期训练收敛阶段,低于 DeepSeek 同类模型的既有水平。
- 行业人士根据公开算力规模推算其后训练算力消耗成本约每秒 10 美元,反映出智能体模型训练对集群算力的密集需求。
- 影响/看点:公开训练流向业界展示了硬件厂商在智能体自研模型上的投入决心,但模型最终能力仍取决于强化学习阶段探索效率与奖励模型的稳定性。
- 资料依据:
- X(karminski)(2026-09-16):https://x.com/karminski3/status/2100351980451635580
- Xiaomi AI(2026-09-16):https://github.com/Xiaomi/MiMo
本内容由 AI 生成,仅供参考,请注意甄别