SemiAnalysis 解读小米后训练直播指标:MiMo V2.6 双模型并行强化学习训练
SemiAnalysis分析小米直播数据指出,小米正并行进行1T参数Pro版与310B参数Flash版的强化学习训练。
AI 深度解读
分析机构 SemiAnalysis 对小米 MiMo-V2.6 后训练直播的运行指标进行测算,显示小米正同步针对不同计算规格的双模型架构开展强化学习(RL)训练。
- 双规格模型矩阵布局:直播监测数据显示小米正在同时训练旗舰级 MiMo V2.6 Pro(总参数量 1T,单 Token 激活 42B)与轻量化 MiMo V2.6 Flash(总参数量 310B,单 Token 激活 15B)。
- 混合专家(MoE)稀疏激活:两款模型均采用 MoE 稀疏激活设计,激活参数比例维持在总参数量的 4% 至 5% 左右,兼顾表征容量与推理吞吐效率。
- 强化学习后训练工程:公开直播展示了分布式集群上的实时 RL 训练收敛指标与调度状态,体现了其在后训练阶段的算力调度与算子优化能力。
- 影响/看点:分级 MoE 强化学习训练有助于在端侧与云端服务间实现更具梯度的推理部署,其实际应用价值取决于模型在多轮复杂推理与代码任务上的最终基准评测表现及量产成本。
- 资料依据:
- X:SemiAnalysis (@SemiAnalysis_)(2026-09-18):https://x.com/SemiAnalysis_/status/2100781906879012870
- Xiaomi MiMo Official Repository(2026-09-18):https://github.com/Xiaomi-MiMo/MiMo
本内容由 AI 生成,仅供参考,请注意甄别