PaperGym:以评分标准为核心演化研究计划生成能力

📡 HuggingFace Daily Papers2026-08-31 08:00

提出以论文评分标准构建研究计划训练环境,支持通过强化学习演化科研方案生成能力。

AI 深度解读

浙江大学等机构的研究团队推出了 PaperGym 框架,将学术论文转化为针对 AI 研究计划生成的强化学习训练环境,以缓解该任务缺乏客观验证环境与评价基准的问题。

  • 传统从论文提取评分标准的方法容易出现问题与标准同源的情况,导致模型仅通过词句改写即可获得奖励;PaperGym 从研究目标与背景提取问题、从方法与实验提取评估标准,将标准泄漏率降至 3.7%。
  • 训练框架分为两阶段,先将评分标准作为特权上下文用于教师指导,再将其作为组相对策略优化(GRPO)的奖励信号。
  • 在 Qwen3 系列模型上的实验表明,该训练流程在五个基准测试上的平均分提升最高达 5.6 分,训练后的 Qwen3-8B 在 ResearchQA 上的评分为 73.48。
  • 项目公开了完整训练流程、包含 2 万个样本的 PaperGym-20k 数据集以及专门的创新与设计评测基准。
  • 影响/看点:该方案为缺乏确定答案的开放式科研规划任务提供了结构化的强化学习环境构建思路,其实际表现取决于评分标准抽取质量及在更广泛交叉学科领域的泛化适应能力。
  • 资料依据:
  • arXiv(2026-08-31):https://arxiv.org/abs/2608.31119
  • GitHub(2026-08-31):https://github.com/ZJU-REAL/PaperGym

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手