Perplexity 发布智能体后训练新研究:通过自蒸馏使工具调用失败率降低 21%
Perplexity公布智能体后训练新方法,通过自蒸馏与轨迹修正使工具调用失败率降低约21%。
AI 深度解读
Perplexity 首席执行官 Aravind Srinivas 于 2026 年 9 月 22 日公布其 Computer 智能体后训练研究,通过结合拒绝采样微调与自蒸馏技术,使线上工具调用失败率降低约 21%。
- 核心优化机制:该方法通过模仿高质量专家轨迹并显式纠正可避免的错误操作,重点减少复杂交互中的无效与格式错误调用。
- 训练与蒸馏方法:研究结合了拒绝采样微调(RFT)与提示引导的自蒸馏,使模型学会在执行过程中主动规避工具使用偏差。
- 实测对比数据:线上 A/B 测试及模型对比显示,较晚阶段的训练检查点相较早期版本使工具调用失败率下降了 21.2%。
- 影响/看点:针对性纠错的后训练证明能有效抑制智能体执行偏航,若能跨模型架构迁移,可能为降低自动化工具调用的工程维护成本提供可行路径。
- 资料依据:
- X:Aravind Srinivas(2026-09-22):https://x.com/AravSrinivas/status/2102497917185802737
- Perplexity(2026-09-22):https://www.perplexity.ai/hub/blog/computer-agent-post-training
本内容由 AI 生成,仅供参考,请注意甄别