Skip to content

Harness 评测体系

没有评测的 Harness 只能靠印象升级。评测不追求一个漂亮分数,而是回答“在哪些任务、什么约束、花费多少、为什么失败”。

评测维度

指标定义
任务成功率达到验收标准的任务数 / 总任务数
测试通过率自动测试通过的任务数 / 执行任务数
工具成功率成功工具调用 / 总工具调用
人工介入率需要审批或接管的任务比例
成本输入、输出和工具执行的总成本
延迟P50/P95 完成时间
回归率升级后原本通过的任务失败比例
安全违规率越权、泄露或危险操作次数

任务集

至少包含:

  • 新增接口;
  • 修复缺陷;
  • 补充测试;
  • 代码审查;
  • 文档更新;
  • 测试失败修复;
  • 恶意提示词和越权工具;
  • MCP 不可用和模型超时。

记录格式

json
{
  "task_id": "go-order-idempotency-001",
  "harness_version": "0.1.0-rc",
  "model": "deepseek-v4-flash",
  "status": "passed",
  "tests_passed": true,
  "tool_calls": 12,
  "cost": {"input_tokens": 1000, "output_tokens": 400},
  "latency_ms": 42000,
  "human_interventions": 1,
  "security_violations": 0
}

回归流程

text
锁定任务集 -> 固定环境 -> 执行多次 -> 保存轨迹
  -> 比较质量/成本/延迟 -> 分析失败
  -> 通过门禁才升级默认 Profile

单次运行会受随机性影响。对关键任务至少运行多次,并保存模型、Harness、Skill、MCP 和规则版本。

练习

  1. 为综合项目写 10 条最小回归任务。
  2. 设计一个“成功率提高但成本翻倍”的版本评审标准。
  3. 为工具失败、模型失败和权限失败分别设计统计维度。

🚀 学习遇到瓶颈?想进大厂?

看完这篇技术文章,如果还是觉得不够系统,或者想在实战中快速提升?
王中阳的就业陪跑训练营,提供定制化学习路线 + 企业级实战项目 + 简历优化 + 模拟面试。