Harness 面试题
原理
Harness 和 Agent 有什么区别?
Agent 围绕目标进行模型决策和工具调用;Harness 提供上下文、权限、执行、反馈、恢复、审计和评测运行时。
为什么不能只靠 Prompt 保证测试通过?
Prompt 是模型建议,不能提供确定性保证。必须用 Hook、CI 或 Runner 执行机器门禁。
MCP
MCP 的 Tool、Resource、Prompt 分别是什么?
Tool 执行动作,Resource 提供可读取数据,Prompt 提供可复用模板。它们由 Server 暴露,由 Client 连接并交给 Host 管理。
stdio 和远程 HTTP 怎么选?
本机单用户工具适合 stdio;团队共享和多租户场景需要远程传输、TLS、授权、审计、限流和租户隔离。
工程
如何控制长任务成本?
渐进加载上下文、限制工具数量、拆分阶段、设置 token/时间/轮数预算、缓存稳定上下文,并用任务集比较质量和成本。
Subagent 什么时候适合并行?
独立只读探索或互不共享文件的工作适合并行;同一文件修改、依赖前置产物或共享迁移状态的工作不应并行。
Tool 返回错误后怎么办?
先分类参数、权限、业务、临时和内部错误;只有明确临时错误才在预算内重试,其他错误应产生可读反馈或进入人工流程。
安全
如何防止提示词注入?
把仓库、网页和工具结果视为不可信数据;权限、路径、命令和副作用在工具层重新校验,不因为内容中的指令改变系统权限。
为什么 Skill/MCP 也需要供应链审查?
它们可能读取数据、执行命令或向外部网络发送内容。必须检查来源、版本、依赖、权限、更新和审计。
DeepSeek
JSON Output 是否等于结构化输出可靠?
不是。仍需解析、schema 校验、枚举和长度检查,并处理截断、额外字段和模型返回错误。
如何评估模型或 Harness 升级?
固定任务集和环境,比较成功率、测试通过率、工具成功率、成本、延迟、人工介入率和安全违规率,保留轨迹并准备回滚。
