苹果 ML 团队提出 PROOF-Gen:优化轨迹数据提升智能体工具调用蒸馏效果

📡 Apple Machine Learning Research2026-08-26 08:00

苹果团队提出PROOF-Gen,通过优化失败轨迹改进工具调用智能体的蒸馏训练。

AI 深度解读

苹果机器学习研究团队于2026年8月24日在论文《PROOF-Gen: From Optimized Data to Better Distillation》中提出一种面向工具调用蒸馏的数据优化方法,关注价值在于它尝试利用失败轨迹降低教师模型反复生成数据的成本。

  • 论文指出,现有流程通常保留教师模型成功完成任务的轨迹,丢弃失败样本,因此困难场景难以形成有效反馈。
  • 在τ2-bench测试中,教师试验有57%未通过,其中约三分之二属于“近失误”,即大部分工具调用正确,但被一个关键错误导致失败。
  • PROOF-Gen让反思模块根据执行轨迹和评测反馈,为具体场景生成纠正提示,再引导教师模型重新生成可用轨迹。
  • 纠正提示在训练前会被移除,学生模型学习的是清洁示例,而不是依赖特定场景的额外脚手架。
  • 论文报告称,该方法恢复了93%的失败场景;在Qwen3-4B-Instruct-2507上,Pass^1从0.132升至0.529,但这些结果依赖论文所设定的数据、模型和评测条件。
  • 影响/看点:如果类似收益能在更多任务和不同教师模型上复现,工具调用蒸馏可能从“筛选成功样本”转向“修复失败样本”;实际价值取决于反思成本、评测反馈质量,以及修复后的轨迹能否迁移到真实部署场景。
  • 资料依据: arXiv论文《PROOF-Gen: From Optimized Data to Better Distillation》(2026年8月24日),https://arxiv.org/abs/2608.23911;Apple Machine Learning Research《PROOF-Gen: From Optimized Data to Better Distillation》(2026年8月),https://machinelearning.apple.com/research/proof-gen-optimized-distillation

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手