PaperBanana-Interact:结合多轮人类反馈优化科学图表
发布多轮科学图表优化基准,并利用用户模拟器评估图表根据反馈持续修订的能力。
AI 深度解读
研究人员针对科学图表自动生成难以在单轮交互中满足学者表达需求的问题,提出了多轮人机交互图表优化框架 PaperBanana-Interact 与对应评估基准。
- 针对 14 名用户的预调研显示所有参与者在初稿后均提出修改需求且 86% 对修改后图表更满意,证实单轮生成难以满足细粒度排版与表达偏好。
- 研究构建了包含 292 张图表与 3518 条用户需求的 MTPaperBananaBench 基准,并设计用户模拟器以降低多轮人机交互评估成本。
- 评估发现多轮交互系统普遍存在随轮次推进图表质量逐渐退化的 “质量漂移” 以及后续修改丢失先前已实现特性的 “遗忘” 两大缺陷。
- PaperBanana-Interact 采用基于内部批判与修正循环的多智能体架构,在质量得分上较基线提升 11.9 至 18.6 分,同时将遗忘率降低 3.7 至 6.2 分。
- 影响/看点:该成果意味着智能体辅助学术制图正从单次提示词生成转向多轮可控微调,其实际落地取决于对复杂矢量排版软件的接口兼容度与推理时延表现。
- 资料依据:
- arXiv(2026-08-31):https://arxiv.org/abs/2608.30241
- Hugging Face Daily Papers(2026-08-31):https://huggingface.co/papers/2608.30241
本内容由 AI 生成,仅供参考,请注意甄别