论文提出 CREST 框架:面向多轮智能体的验证器约束分层信用分配方法
论文提出CREST框架,通过分层信用分配与验证器约束,改善多轮智能体决策训练的准确性。
AI 深度解读
研究团队于 2026 年 8 月发布论文《Teach the Magnitude, Not the Direction》,提出面向多轮多步语言模型智能体的分层信用分配框架 CrEST。
- 针对传统强化学习依赖整条轨迹奖励容易导致轮次间信用稀释的问题,CrEST 在轮次层级为每一步分配经过验证的独立优势值。
- 引入同一模型作为自教师(Self-Teacher),利用熵门控机制仅调节不确定决策的学习更新幅度,而不改变验证器判定的梯度更新方向。
- 在 BFCL V3 和 WildToolBench 等复杂工具调用基准测试中,该方法规避了传统蒸馏受限于教师模型性能上限的约束,提升了长轨迹多轮任务的优化效果。
- 影响/看点:该框架将教师监督与强化学习验证解耦,意味着多轮工具调用智能体能以更高样本效率进行策略优化,其实际收益依赖于验证器对各单轮状态判定的精确度。
- 资料依据:
- Rohan Paul 个人账号(2026-08-31):https://x.com/rohanpaul_ai/status/2094488388816499099
- arXiv 论文预印本(2026-08-31):https://arxiv.org/abs/2608.28281
本内容由 AI 生成,仅供参考,请注意甄别