AutoSciRub:先评估再改进的自动研究智能体评分标准生成
提出先生成任务专属评分标准、再执行和迭代修订的自动科研智能体框架。
AI 深度解读
论文《Learning to Evaluate Before Improving》提出AutoSciRub,让研究智能体在执行任务前先生成可执行评分标准,再据此指导研究、逐项核验和定向修改,关注价值在于把开放式科研任务中隐含的分析要求和证据要求显式化。
- 框架先将模糊指令拆解为原子化科学目标,并结合相关文献与任务可见数据生成可验证标准。
- 在ResearchClawBench上,作者报告固定Codex配置平均提升2.08分,固定DeepSeek-V4-Flash配置平均提升2.95分。
- 在AstaBench E2E Discovery随机抽取的20项任务上,三个智能体框架平均提升16.8分,同时保持或增加成功完成任务数。
- 论文目前标注为工作进行中,且部分实验使用小规模样本,结论仍受基准设计和评分方式影响。
- 影响/看点:先评估再执行可能减少研究报告遗漏关键分析的情况,但实际效果取决于评分标准是否正确、文献依据是否充分,以及核验循环带来的成本是否可接受。
- 资料依据:
- arXiv(2026-08-31):https://arxiv.org/abs/2608.31076
- AutoSciRub GitHub仓库(2026-08-20):https://github.com/zjunlp/AutoSciRub
本内容由 AI 生成,仅供参考,请注意甄别