最新研究揭示:仅提供多余工具就会导致 LLM 直接作答准确率骤降至 63.5%
研究显示仅提供未调用的多余工具就会让大模型作答率骤降,但通过系统提示词可大幅缓解。
AI 深度解读
2026 年 9 月 15 日公开的学术预印本论文揭示了工具配置对大语言模型基础问答能力的负面干扰,为智能体架构中的工具注入策略提供了量化参考。
- 论文在 10 个领域构建了 500 组测试查询对,对比评估了六款主流大模型在有无工具环境下的作答表现。
- 测试结果显示,仅在上下文中提供非必要工具,模型的直接作答率便从无工具基准的 98.2% 下降至 63.5%,即使该工具在推理过程中从未被实际调用。
- 研究指出,多余的工具描述可能分散模型的注意力分布;通过增加一句明确工具适用范围的系统提示词,作答率最高可挽回 45.6 个百分点。
- 影响/看点:这一发现意味着在智能体架构中盲目堆叠工具接口可能会削弱模型的基础推理可靠性,开发团队需在运行时根据任务类型实施动态工具过滤与精确的提示词约束。
- 资料依据:
- arXiv(2026-09-15):https://arxiv.org/abs/2609.14157
- X:DAIR.AI (@dair_ai)(2026-09-16):https://x.com/dair_ai/status/2100077223252512956
本内容由 AI 生成,仅供参考,请注意甄别