Salesforce 发布评测基准与模型协同进化研究:在策略修正解决模仿失效
Salesforce 论文提出在策略修正方法,以解决评测基准与模型协同进化过程中的模仿失效问题。
AI 深度解读
Salesforce AI 于 2026 年 9 月 10 日发布论文《Co-Evolving Harnesses and Models: On-Policy Correction Helps Weaker Models Catch Up Where Imitation Fails》,为解决模型评测框架与模型协同演进过程中的模仿失效问题提供了新方法。
- 据 DAIR.AI 创始人 Elvis Saravia 于 2026 年 9 月 10 日推介及 Salesforce AI 研究论文显示,评测基准框架与大模型的协同演进已成为模型工程领域的重要研究方向。
- 论文指出,当较弱模型通过离线模仿强模型生成的轨迹时,容易因状态分布偏移而累积误差,最终导致策略模仿失效。
- 研究提出在策略修正机制,通过让弱模型在自身策略生成的执行路径上进行探索并引入校正信号,有效改善了分布外泛化能力。
- 影响/看点:该机制若在复杂智能体系统与自动化测试基准中得到广泛应用,意味着中小参数模型能够以更低成本缩小与前沿模型的性能差距,其实际效能取决于在线采样质量与环境反馈信号的准确性。
- 资料依据:
- X:Elvis Saravia(2026-09-10):https://x.com/omarsar0/status/2097958286146605446
- Salesforce AI Research(2026-09-10):https://arxiv.org/abs/2609.05832
本内容由 AI 生成,仅供参考,请注意甄别