Anthropic发布Claude Code插件评估工具,涵盖六种评分类型
近日,Anthropic发布了针对Claude Code的新插件评估工作流。该claude plugin eval命令通过使用真实的提示来测试插件,并对结果进行评分和对比无插件加载情况下的表现。此功能帮助开发者了解技能是否触发、能否在编辑或新模型下存活以及是否优于基础模型。每个评估运行和裁判评分都是真实模型调用,费用将根据计划或API账户计费。评估套件位于插件的evals/目录中,每个案例包含一个prompt.md文件和一个graders/文件夹。提示内容直接发送给Claude,而@path提及不会被展开。Grader文件定义了评分类型、权重和臂别,包括基于转录和磁盘文件计算的免费类型(如regex、tool_used等)以及需要调用评判模型并计费的类型(如llm和baseline)。claude plugin eval init命令可以初始化评估套件,并根据开发者提供的信息生成案例和评分器。在持续集成环境中,--bare <name>选项会创建一个空白模板。每个案例默认运行两次:一次加载插件,一次不加载插件,其差异值Δ表示插件的贡献程度。常见的问题包括技能触发失败或自然语言表述下Claude未选择使用特定技能的情况。评估结果将保存在evals/results/<timestamp>/report.html中,并根据账户支持情况发布到claude.ai平台。
