论文评估LLM多轮信息寻求能力:大模型能否判断提问时机与信息充分性
新论文提出了评估大模型多轮信息寻求能力的基准,重点测试模型能否准确判断信息是否充分以及何时停止追问。
AI 深度解读
哈佛大学等机构研究团队于 2026 年 8 月在 arXiv 发布论文,评估大语言模型在多轮交互中的信息寻求能力,其关注价值在于揭示了模型在条件不完备时主动提问时机与信息量判断上的显著缺陷。
- 论文构建了包含 5,251 道题目及 9,006 个任务实例的 MT-InfoSeek 测试集,涵盖数学、逻辑、生物、医学及通用知识等多个领域。
- 评测显示模型普遍存在低估缺失信息量的倾向;在特定逻辑问题中,模型低估所需信息的频率是高估的近四倍,往往在获取充分信息前过早停止提问并给出猜测性回答。
- 现有的最终答案准确率容易掩盖信息获取过程的不足,论文提出以“最终信息充分性”作为独立评估维度,证明主动信息寻求能力与单纯答案生成能力存在明显区别。
- 影响/看点:该研究表明现有大模型在主动交互与需求澄清方面仍存局限,如果未来在模型训练中强化多轮提问策略与信息充分性验证,可能有助于降低实际应用中的推测性误判。
- 资料依据:
- arXiv论文库(2026-08-20):https://arxiv.org/abs/2608.14808
- X平台 Rohan Paul(2026-09-13):https://x.com/rohanpaul_ai/status/2098966898742349888
本内容由 AI 生成,仅供参考,请注意甄别