ISO:面向可验证奖励强化学习的原生优化栈
提出ISO框架,利用模型权重的谱结构实现可验证奖励强化学习中的固定谱优化,支持离线合并与在线训练。
AI 深度解读
本文提出等谱优化(ISO),一个面向可验证奖励强化学习(RLVR)的原生优化框架,通过固定权重谱、优化输入输出帧变量,实现了离线模型合并和在线训练加速,在 1.5B 到 8B 模型上显著提升训练效率。
- RLVR 中奖励反馈到权重更新的优化层尚未被充分理解,本文通过模型权重的奇异结构识别出谱继承现象:RLVR 可复用基模型的权重谱,仅通过改变关联的输入输出奇异帧来获取新行为。
- ISO 将谱继承操作化为固定谱优化框架,包含离线和在线两种实例。
- 离线 ISO-Merger 合并共享基模型专家的帧变化,无需后合并数据、 rollout、梯度更新或在线策略蒸馏,在无数据合并方法中取得最强聚合性能。
- 在线 ISO-Optimizer 在固定基谱下优化帧变量,兼容 AdamW 和 Muon 等优化器。
- 在 Qwen3-8B-Base 上,ISO-AdamW 仅用 100 步达到 AdamW 270 步的准确率(0.495),并在 210 步进一步提升至 0.509。
- 影响/看点:ISO 为 RLVR 提供了缺失的优化层设计原则——继承谱、优化帧,显著提升训练效率,为后训练优化提供了新范式。
本内容由 AI 生成,仅供参考,请注意甄别