论文揭示进化策略(ES)在推理后训练中的机制:具备比 GRPO 更广的解空间覆盖
论文研究了进化策略在LLM推理后训练中的机制,表明其比GRPO具有更广的解空间覆盖和更好的探索能力。
AI 深度解读
2026年8月,研究人员系统揭示了进化策略(ES)在大模型推理后训练中的优化机制,证实其相较主流 GRPO 方法能提供更广泛的解空间覆盖度。
- 理论推导与实证分析显示,主流 GRPO 方法在训练中易出现策略熵坍缩,而 ES 凭借群体多样性在提升 Pass@1 的同时可实现更高的 Pass@K 覆盖。
- 针对两者特性,论文设计了序贯式 GRPO-ES 训练策略,将 GRPO 在单一输出精度上的优势与 ES 在解空间探索上的收益相结合。
- 研究发现 ES 引发的全模型参数漂移中,任务性能增益主要来自稀疏的大幅度参数更新,这种功能稀疏性避免了模型在保留评估集上出现灾难性遗忘。
- 超参数分析表明,基础模型规模越大,ES 维持优化所需的最优群体规模越小。
- 影响/看点:该成果确立了 ES 作为显存高效且具备强探索能力的独立后训练范式,其广泛落地仍需在更多通用多模态及复杂非数学任务上检验泛化边界。
- 资料依据:arXiv 论文(https://arxiv.org/abs/2608.27351)、HuggingFace Daily Papers(https://arxiv.org/abs/2608.27351)。
本内容由 AI 生成,仅供参考,请注意甄别