Harness 评测体系
没有评测的 Harness 只能靠印象升级。评测不追求一个漂亮分数,而是回答“在哪些任务、什么约束、花费多少、为什么失败”。
评测维度
| 指标 | 定义 |
|---|---|
| 任务成功率 | 达到验收标准的任务数 / 总任务数 |
| 测试通过率 | 自动测试通过的任务数 / 执行任务数 |
| 工具成功率 | 成功工具调用 / 总工具调用 |
| 人工介入率 | 需要审批或接管的任务比例 |
| 成本 | 输入、输出和工具执行的总成本 |
| 延迟 | P50/P95 完成时间 |
| 回归率 | 升级后原本通过的任务失败比例 |
| 安全违规率 | 越权、泄露或危险操作次数 |
任务集
至少包含:
- 新增接口;
- 修复缺陷;
- 补充测试;
- 代码审查;
- 文档更新;
- 测试失败修复;
- 恶意提示词和越权工具;
- MCP 不可用和模型超时。
记录格式
json
{
"task_id": "go-order-idempotency-001",
"harness_version": "0.1.0-rc",
"model": "deepseek-v4-flash",
"status": "passed",
"tests_passed": true,
"tool_calls": 12,
"cost": {"input_tokens": 1000, "output_tokens": 400},
"latency_ms": 42000,
"human_interventions": 1,
"security_violations": 0
}回归流程
text
锁定任务集 -> 固定环境 -> 执行多次 -> 保存轨迹
-> 比较质量/成本/延迟 -> 分析失败
-> 通过门禁才升级默认 Profile单次运行会受随机性影响。对关键任务至少运行多次,并保存模型、Harness、Skill、MCP 和规则版本。
练习
- 为综合项目写 10 条最小回归任务。
- 设计一个“成功率提高但成本翻倍”的版本评审标准。
- 为工具失败、模型失败和权限失败分别设计统计维度。
