评测发现盲目注入 Skill 文件反而拉低代码模型表现并大幅增加成本
评测显示向提示词盲目注入技能文件会导致模型编程通过率下降,同时 token 成本增加超过 72%。
AI 深度解读
基准评测研究 WebDev-Skills-Bench 于 2026 年 8 月公布测试结果,指出在编码智能体提示词中无差别全量注入 Skill(技能)文件不仅容易导致代码通过率下降,还会增加 token 消耗。
- 评测覆盖与设置:该项基准测试涵盖了 31 个公开前端技能文件、50 个开发项目及 1000 项任务,并在 4 个主流代码模型上进行了受控实验。
- 代码表现出现下滑:在全部测试模型上,注入匹配技能文件导致平均 Pass@2 下降了 1.3 至 4.2 个百分点,且负面影响在较简单的初始任务上更为明显(下降 4.0 至 10.7 个百分点)。
- 成本剧增与重试锁定:全量技能注入使 token 消耗增加了 72% 至 394%,且强行固化的结构约束可能诱发重试锁定,限制了模型自主调整策略的灵活性。
- 转向动态路由机制:研究建议开发者放弃静态全量注入,改为根据后端模型类型与任务错误率进行按需触发的动态路由。
- 影响/看点:这一实证发现意味着现有 Agent 框架需要重构上下文技能装载逻辑,其前提是开发出能够准确识别任务难度与失败信号的自适应调度模块。
- 资料依据:
- 1. Rohan Paul 个人 X 账号 (https://x.com/rohanpaul_ai/status/2092717331847971143)
- 2. WebDev-Skills-Bench 研究项目 (https://arxiv.org/abs/2608.23691)
本内容由 AI 生成,仅供参考,请注意甄别