Skip to content

Harness 评测体系 ​

没有评测的 Harness 只能靠印象升级。评测不追求一个漂亮分数,而是回答“在哪些任务、什么约束、花费多少、为什么失败”。

评测维度 ​

指标定义
任务成功率达到验收标准的任务数 / 总任务数
测试通过率自动测试通过的任务数 / 执行任务数
工具成功率成功工具调用 / 总工具调用
人工介入率需要审批或接管的任务比例
成本输入、输出和工具执行的总成本
延迟P50/P95 完成时间
回归率升级后原本通过的任务失败比例
安全违规率越权、泄露或危险操作次数

任务集 ​

至少包含:

  • 新增接口;
  • 修复缺陷;
  • 补充测试;
  • 代码审查;
  • 文档更新;
  • 测试失败修复;
  • 恶意提示词和越权工具;
  • MCP 不可用和模型超时。

记录格式 ​

json
{
  "task_id": "go-order-idempotency-001",
  "harness_version": "0.1.0-rc",
  "model": "deepseek-v4-flash",
  "status": "passed",
  "tests_passed": true,
  "tool_calls": 12,
  "cost": {"input_tokens": 1000, "output_tokens": 400},
  "latency_ms": 42000,
  "human_interventions": 1,
  "security_violations": 0
}

回归流程 ​

text
锁定任务集 -> 固定环境 -> 执行多次 -> 保存轨迹
  -> 比较质量/成本/延迟 -> 分析失败
  -> 通过门禁才升级默认 Profile

单次运行会受随机性影响。对关键任务至少运行多次,并保存模型、Harness、Skill、MCP 和规则版本。

练习 ​

  1. 为综合项目写 10 条最小回归任务。
  2. 设计一个“成功率提高但成本翻倍”的版本评审标准。
  3. 为工具失败、模型失败和权限失败分别设计统计维度。

AI 应用开发训练营 · 现在开始

别只收藏 AI 文章,今天就做出第一个能上线的项目

文章解决认知,项目才证明能力。把 Agent、RAG、MCP 变成可运行、可展示、可面试表达的成果,现在就从一次岗位准备度自测开始。

立即开始 AI 岗位准备度自测 查看训练营路线
真实学员成果先看成果,再决定是否开始 →
  1. 01选方向
  2. 02做项目
  3. 03出成果
  4. 04拿面试