Eval Harness 技能
一个用于 Claude Code 会话的正式评估框架,实现了评估驱动开发 (EDD) 原则。
何时激活
- 为 AI 辅助工作流程设置评估驱动开发 (EDD)
- 定义 Claude Code 任务完成的标准(通过/失败)
- 使用 pass@k 指标衡量代理可靠性
- 为提示或代理变更创建回归测试套件
- 跨模型版本对代理性能进行基准测试
理念
评估驱动开发将评估视为 "AI 开发的单元测试":
- 在实现 之前 定义预期行为
- 在开发过程中持续运行评估
- 跟踪每次更改的回归情况
- 使用 pass@k 指标来衡量可靠性
评估类型
能力评估
测试 Claude 是否能完成之前无法完成的事情:
[能力评估:功能名称]
任务:描述 Claude 应完成的工作
成功标准:
- [ ] 标准 1
- [ ] 标准 2
- [ ] 标准 标准 3
预期输出:对预期结果的描述
回归评估
确保更改不会破坏现有功能:
[回归评估:功能名称]
基线:SHA 或检查点名称
测试:
- 现有测试-1:通过/失败
- 现有测试-2:通过/失败
- 现有测试-3:通过/失败
结果:X/Y 通过(之前为 Y/Y)
评分器类型
1. 基于代码的评分器
使用代码进行确定性检查:
# Check if file contains expected pattern
grep -q "export function handleAuth" src/auth.ts && echo "PASS" || echo "FAIL"
# Check if tests pass
npm test -- --testPathPattern="auth" && echo "PASS" || echo "FAIL"
# Check if build succeeds
npm run build && echo "PASS" || echo "FAIL"
2. 基于模型的评分器
使用 Claude 来评估开放式输出:
[MODEL GRADER PROMPT]
评估以下代码变更:
1. 它是否解决了所述问题?
2. 它的结构是否良好?
3. 是否处理了边界情况?
4. 错误处理是否恰当?
评分:1-5 (1=差,5=优秀)
推理:[解释]
3. 人工评分器
标记为需要手动审查:
[HUMAN REVIEW REQUIRED]
变更:对更改内容的描述
原因:为何需要人工审核
风险等级:…