Claude Code 引入插件评估工作流:支持 6 类评分器与 Skill 持续集成门禁
Anthropic 为 Claude Code 引入插件评估工作流,提供 6 类评分器并支持作为技能持续集成的质检门禁。
AI 深度解读
Anthropic 为 Claude Code 引入插件自动化评估工作流,支持通过多维度评分器和对照实验验证自定义 Skill 与插件的实际效果。
- 在 Claude Code v2.1.269 及以上版本中提供「claude plugin eval」命令,针对真实提示词运行插件测试。
- 内置 6 类评分器,包含基于文本和文件的本地无成本评分(regex、tool_used、tool_order、file_exists)以及调用模型评估的判别器(llm、baseline)。
- 采用对照实验机制计算带插件与裸模型的增量分差(Δ),帮助开发者排查自然语言未能成功激活 Skill 的缺陷,并可集成至持续集成流水线作为质量门禁。
- 影响/看点:该评估机制使 Agent 技能开发从主观测试转向可量化的自动化质检,但调用模型裁判时会产生额外的 API 计费开销。
- 资料依据:
- MarkTechPost(2026-09-11):https://www.marktechpost.com/2026/09/11/anthropic-adds-plugin-evals-to-claude-code-6-grader-types-a-no-plugin-baseline-and-a-ci-gate-for-skills/
- Claude Code 官方文档(2026-09-11):https://docs.anthropic.com/en/docs/agents-and-tools/claude-code
本内容由 AI 生成,仅供参考,请注意甄别