微软与 UCSD 提出 TailSFT:过滤已拟合样本可显著提升后续强化学习效果

📡 Rohan Paul2026-09-04 07:56

微软与 UCSD 团队提出 TailSFT,通过过滤已拟合样本避免抹去罕见正确行为,从而提升后续强化学习表现。

AI 深度解读

微软研究院(Microsoft Research)与加州大学圣地亚哥分校(UCSD)研究团队于 2026 年 8 月在 arXiv 发布论文, 提出名为 TailSFT 的监督微调改进方法, 旨在解决标准 SFT 阶段因过度拟合高频常见样本而削弱后续强化学习探索能力的问题。

  • 论文指出, 标准 SFT 流程若包含模型已有较高概率正确生成的样本, 会使模型收敛于局部拟合状态, 反而抹平了强化学习探索所需的罕见正确行为。
  • TailSFT 采用样本过滤机制, 在 SFT 训练过程中动态剔除模型已充分拟合的数据序列, 促使参数更新集中于未充分学习的分布长尾(Tail)区域。
  • 在 OLMo-3 7B 模型上的数学与代码基准测试显示, TailSFT 使 pass@16 覆盖指标取得最高 17% 的绝对提升, 并在随后的 GRPO 强化学习中转化为最高 4% 的 pass@1 准确率增益。
  • 该方法计算开销较低, 同时提供了用于判定是否适合应用该过滤机制的诊断工具。
  • 影响/看点:这一研究意味着大模型后训练阶段从孤立调优转向阶段协同, 若在更大规模基础模型和多样化任务中验证其有效性, 可能促使开发者重构 SFT 数据筛选逻辑以降低强化学习的探索门槛。
  • 资料依据:
  • arXiv(2026-08-31):https://arxiv.org/abs/2608.25756
  • X:Rohan Paul(2026-09-03):https://x.com/rohanpaul_ai/status/2095662235561677296

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手