Miles v0.1:面向前沿大模型后训练的生产级强化学习系统
发布开源全栈强化学习后训练系统Miles v0.1,基于SGLang与多后端构建,支持全参及LoRA RL等多种前沿训练范式。
AI 深度解读
arXiv 与 GitHub 于 2026 年 9 月 8 日同步公开 Miles v0.1,这是一套面向前沿大模型后训练的开源强化学习系统,强调组件的高效性、可靠性与可定制性。
- 系统架构:基于 SGLang 构建 Rollout 采样引擎,训练端兼容 Megatron-LM 与 PyTorch FSDP 两种后端,并提供三种权重同步传输机制以适应不同硬件部署拓扑。
- 训练支持:不仅支持全参数与 LoRA 模式的强化学习,还涵盖同策略蒸馏、监督微调以及真正的同策略对齐,并可延伸应用于扩散模型。
- 实测性能:在 64 张 NVIDIA GB300 GPU 上对 7440 亿总参数(400 亿激活参数)的 GLM-5.2 模型进行终端编程任务异步训练,前 30 步测得的单步时间中位数为 263 秒。
- 影响/看点:该系统为超大规模智能体任务提供了模块化后训练基础设施,若在异构集群与更长上下文场景下维持通信效率,可能降低超大模型强化学习探索的工程门槛。
- 资料依据:
- arXiv(2026-09-08):https://arxiv.org/abs/2609.08368
- GitHub(2026-09-08):https://github.com/radixark/miles
本内容由 AI 生成,仅供参考,请注意甄别