面壁智能与清华提出长上下文推理数据配方,无需特殊奖励工程

📡 面壁智能 OpenBMB2026-07-24 21:00

面壁智能与清华提出数据配方,无需特殊奖励工程即可提升长上下文推理能力。

AI 深度解读

面壁智能与清华 NLP 提出一种无需特殊奖励工程的长上下文推理数据配方,仅用极简 GRPO 和精心设计的数据集即取得显著提升。

  • 方法将长上下文推理分解为检索、多证据合成与推理三种能力,并构建 8 个数据集(约 1.4 万条样本)进行训练。
  • 在 Qwen3-4B/8B/30B-A3B 模型上,七个长上下文基准平均提升分别达 +7.2、+3.2 和 +6.4,效果可泛化至 512K+ token。
  • 核心贡献在于证明数据配方的质量可以替代复杂的奖励工程,降低 RL 训练门槛。
  • 该工作为长上下文推理的强化学习提供了更简洁、可复现的基线方案。
  • 影响/看点:这一数据配方有望成为长上下文 RL 训练的标准参考,推动更多团队在没有专门奖励设计的情况下提升模型推理能力。

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com