[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"aihot-art-102772":3},{"itemId":4,"vertical":5,"category":6,"source":7,"score":8,"title":9,"summary":10,"analysis":11,"url":12,"coverUrl":13,"direction":13,"marketSignal":13,"publishedAt":14},"102772","ai","论文研究","HuggingFace Daily Papers",64,"ISO：面向可验证奖励强化学习的原生优化栈","提出ISO框架，利用模型权重的谱结构实现可验证奖励强化学习中的固定谱优化，支持离线合并与在线训练。","本文提出等谱优化（ISO），一个面向可验证奖励强化学习（RLVR）的原生优化框架，通过固定权重谱、优化输入输出帧变量，实现了离线模型合并和在线训练加速，在 1.5B 到 8B 模型上显著提升训练效率。\n\n· RLVR 中奖励反馈到权重更新的优化层尚未被充分理解，本文通过模型权重的奇异结构识别出谱继承现象：RLVR 可复用基模型的权重谱，仅通过改变关联的输入输出奇异帧来获取新行为。\n· ISO 将谱继承操作化为固定谱优化框架，包含离线和在线两种实例。\n· 离线 ISO-Merger 合并共享基模型专家的帧变化，无需后合并数据、 rollout、梯度更新或在线策略蒸馏，在无数据合并方法中取得最强聚合性能。\n· 在线 ISO-Optimizer 在固定基谱下优化帧变量，兼容 AdamW 和 Muon 等优化器。\n· 在 Qwen3-8B-Base 上，ISO-AdamW 仅用 100 步达到 AdamW 270 步的准确率（0.495），并在 210 步进一步提升至 0.509。\n\n影响\u002F看点：ISO 为 RLVR 提供了缺失的优化层设计原则——继承谱、优化帧，显著提升训练效率，为后训练优化提供了新范式。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.19331",null,"2026-07-22 01:51:36"]