小米开源大模型负责人罗福莉公布 MiMo-V2.6 强化学习训练技术进展
小米公布大模型 MiMo-V2.6 的强化学习训练进展,涵盖异步计算、环境混合调度与评分机制。
AI 深度解读
小米开源大模型负责人罗福莉披露正在进行的 MiMo-V2.6 强化学习(RL)训练技术细节与扩展探索。
- 计算规模层面,训练单步消耗约 2B tokens,采用 1568 条 prompt 配合 16 次 rollout 的全异步架构运行。
- 评测环境与 harness 层面,采用多任务 agentic RL 架构,单次训练运行中混合多种评估环境。
- 评分机制层面,引入 agentic 组内信用分配机制,并将代码测试用例与 rubric(评分规则)奖励信号相结合。
- 团队表示训练旨在探索强化学习扩展边界,计划在后续数周逐步开源技术细节并公开训练过程。
- 影响/看点:该训练方案意味着小米正尝试通过大规模强化学习与信用分配机制提升 Agent 复杂决策能力,其最终效果取决于奖励模型在多任务长链路推理中对幻觉与作弊策略的抑制表现。
- 资料依据:
- 罗福莉个人 X 账号发布(2026-09-16):https://x.com/_LuoFuli/status/2100296686719610932
- 小米 GitHub 官方组织(2026-09-16):https://github.com/XiaomiMiMo
本内容由 AI 生成,仅供参考,请注意甄别