Claude Code 引入插件评估工作流:支持 6 类评分器与 Skill 持续集成门禁

📡 MarkTechPost2026-09-12 05:05

Anthropic 为 Claude Code 引入插件评估工作流,提供 6 类评分器并支持作为技能持续集成的质检门禁。

AI 深度解读

Anthropic 为 Claude Code 引入插件自动化评估工作流,支持通过多维度评分器和对照实验验证自定义 Skill 与插件的实际效果。

  • 在 Claude Code v2.1.269 及以上版本中提供「claude plugin eval」命令,针对真实提示词运行插件测试。
  • 内置 6 类评分器,包含基于文本和文件的本地无成本评分(regex、tool_used、tool_order、file_exists)以及调用模型评估的判别器(llm、baseline)。
  • 采用对照实验机制计算带插件与裸模型的增量分差(Δ),帮助开发者排查自然语言未能成功激活 Skill 的缺陷,并可集成至持续集成流水线作为质量门禁。
  • 影响/看点:该评估机制使 Agent 技能开发从主观测试转向可量化的自动化质检,但调用模型裁判时会产生额外的 API 计费开销。
  • 资料依据:
  • MarkTechPost(2026-09-11):https://www.marktechpost.com/2026/09/11/anthropic-adds-plugin-evals-to-claude-code-6-grader-types-a-no-plugin-baseline-and-a-ci-gate-for-skills/
  • Claude Code 官方文档(2026-09-11):https://docs.anthropic.com/en/docs/agents-and-tools/claude-code

本内容由 AI 生成,仅供参考,请注意甄别

查看原文 ↗
看实时 AI 热点雷达 实时信息流 · 事件聚类 · 订阅推送 —— 完整产品在 aihot.aicxd.com
AI 助手