面壁智能与清华提出长上下文推理数据配方,无需特殊奖励工程
面壁智能与清华提出数据配方,无需特殊奖励工程即可提升长上下文推理能力。
AI 深度解读
面壁智能与清华 NLP 提出一种无需特殊奖励工程的长上下文推理数据配方,仅用极简 GRPO 和精心设计的数据集即取得显著提升。
- 方法将长上下文推理分解为检索、多证据合成与推理三种能力,并构建 8 个数据集(约 1.4 万条样本)进行训练。
- 在 Qwen3-4B/8B/30B-A3B 模型上,七个长上下文基准平均提升分别达 +7.2、+3.2 和 +6.4,效果可泛化至 512K+ token。
- 核心贡献在于证明数据配方的质量可以替代复杂的奖励工程,降低 RL 训练门槛。
- 该工作为长上下文推理的强化学习提供了更简洁、可复现的基线方案。
- 影响/看点:这一数据配方有望成为长上下文 RL 训练的标准参考,推动更多团队在没有专门奖励设计的情况下提升模型推理能力。
本内容由 AI 生成,仅供参考,请注意甄别