苹果提出DACA-GRPO:面向扩散语言模型强化学习的去噪感知信用分配
苹果提出DACA-GRPO方法,通过去噪时序信用分配优化扩散语言模型的强化学习训练效果。
AI 深度解读
苹果机器学习研究团队提出了面向扩散语言模型(Diffusion LLM)强化学习训练的新方法 DACA-GRPO,旨在解决扩散轨迹中的信用分配缺失与似然估计偏差问题。
- 研究指出,现存适用于扩散模型的强化学习方法将所有去噪时间步视为同等权重,且依赖高方差、有系统偏差的均值场似然估计,制约了策略优化效率。
- DACA-GRPO 引入去噪感知机制,对扩散生成轨迹中的不同去噪步骤进行时序信用分配,并对似然估计进行校正。
- 该算法设计为轻量级且即插即用,可直接集成至现有的各类 GRPO 风格强化学习训练框架中。
- 影响/看点:该方法可能提升扩散架构语言模型在后训练阶段的对齐与强化学习收敛效率,其推广价值取决于在更大参数规模与复杂推理任务中的泛化表现。
- 资料依据:
- Apple Machine Learning Research(2026-09-16):https://machinelearning.apple.com/research/denoising-aware-credit-assignment
本内容由 AI 生成,仅供参考,请注意甄别