英伟达发布Molt:PyTorch原生智能体强化学习框架
英伟达NeMo团队发布PyTorch原生智能体强化学习框架Molt,代码量仅8.6K行,远小于verl和slime等同类框架
AI 深度解读
英伟达NeMo团队发布Molt,一个PyTorch原生的智能体强化学习框架,主打代码轻量到一个研究者能装进脑子里、AI编程助手也能完整读懂的设计目标,直接对标verl、slime、OpenRLHF等主流方案。
- 核心代码量仅约8.6K行,对比之下verl约62K行、slime约25K行、OpenRLHF约7.2K行,精简幅度明显
- 采用Ray做任务调度和异步队列、vLLM做推理rollout、NVIDIA AutoModel加FSDP2做训练,三个组件均未做魔改分叉,上游更新可以直接跟进而不用重新合并代码
- 支持流式请求池让prompt分组持续在途,推理引擎不会因等待训练而空闲;还支持部分rollout,训练时暂停引擎、用NCCL广播权重分片、再恢复未完成的请求而不是直接丢弃
- 以Apache 2.0协议开源,提供Slurm脚本和预构建容器,推荐配置是2节点16张H100(8张训练加8张推理),门槛对准前沿及次前沿实验室、经费充足的AI创业公司和高校多节点算力团队
- 支持多轮工具调用智能体、代码执行智能体、视觉语言环境、LLM当裁判的奖励回路,以及向小模型做在线策略蒸馏等应用
- 又一个大厂把内部强化学习基础设施标准化开源,agentic RL的工具链门槛正在被持续拉低,中小团队复现前沿训练方法的可行性在增加。
本内容由 AI 生成,仅供参考,请注意甄别