Nathan Lambert 发布 Olmo 3 后训练新方法 TailSFT,显著优化强化学习效率

📡 Nathan Lambert2026-09-12 20:38

研究者提出基于 Olmo 3 的后训练方法 TailSFT,通过提升覆盖度显著优化强化学习效果。

AI 深度解读

Nathan Lambert 等研究者发布针对 OLMo-3 的后训练方法 TailSFT,通过长尾样本过滤降低后续强化学习的探索成本。

  • TailSFT 在监督微调阶段过滤已充分拟合的数据序列,将算力与模型容量集中于分布长尾的低置信度区域。
  • 在 OLMo-3 7B 模型上的数学与代码评测中,该方法将 pass@16 指标提升了最高 17% 的绝对值。
  • 经过 TailSFT 优化的模型作为初始权重,在后续 GRPO 强化学习训练中带来了最高 4% 的绝对 pass@1 性能增益。
  • 影响/看点:该研究表明 SFT 阶段的覆盖率优化能够有效支持后续强化学习训练,其实用效果取决于特定任务的长尾分布特征与样本过滤标准的设置。
  • 资料依据:
  • arXiv 论文预印本(2026-08-28):https://arxiv.org/abs/2608.25756
  • X:Nathan Lambert(2026-09-12):https://x.com/natolambert/status/2098753179273805973

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手