[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"aihot-art-97240":3},{"itemId":4,"vertical":5,"category":6,"source":7,"score":8,"title":9,"summary":10,"analysis":11,"url":12,"coverUrl":13,"direction":13,"marketSignal":13,"publishedAt":14},"97240","ai","论文研究","HuggingFace Daily Papers",64,"LLM-as-a-Coach：面向非可验证任务的体验式学习","提出体验式学习框架，将LLM从评判者转为教练，通过高带宽反馈提升非可验证任务性能。","LLM-as-a-Coach提出体验式学习（EL），用高带宽文本反馈替代标量奖励，在非可验证任务上超越传统强化学习。\n· 传统RL将基于评分标准的评估压缩为标量奖励，丢失了丰富的文本反馈，且混淆了不同质量水平的回答。EL将反馈模型从“裁判”转变为“教练”，将每次策略输出的评估提炼为可迁移的体验知识。\n· 体验知识通过上下文蒸馏内化到策略中，相比标量奖励提供了更密集的监督，并保留了高质量回答间的细粒度偏好。\n· 在两种策略族上，使用策略自身或专有模型的反馈，EL在保留和未见过的开放式任务上持续优于基于评分标准的RL。\n· EL在训练分布外泛化更好，并缓解了奖励破解问题。\n影响\u002F看点：体验知识作为更丰富、更可泛化的学习信号，为后训练阶段处理非可验证任务提供了新范式，有望推动LLM在开放场景下的能力提升。","https:\u002F\u002Farxiv.org\u002Fabs\u002F2607.18110",null,"2026-07-20 08:00:00"]