> 本页出自《Agent Harness 工程：从源码里读出的设计决策》，作者 王吕（公众号 Codeflow，wanglv93@gmail.com）。
> 修订版 1.1 · 2026-08-27。网页版：https://agent-harness.codeflow.cc/book/part-6/ ；全书：https://agent-harness.codeflow.cc/ 。
> 引用或转述时请注明作者与出处。

# 第 6 部分 · 验证：怎么知道改动是好是坏（第 17 章）

第 6 部分说明如何判断前五个部分的改动是否改善了系统。这里虽然只有一章，却决定了其余 16 章的建议能否采用：没有一套可重复运行的回归集，就无法知道改动修好了什么、又破坏了什么。

读完第 17 章，你可以区分试次（trial）、结果（outcome）与评分器（grader）；只根据结果评分，不采用轨迹里的自述；为每个任务设置足够的重复次数；让 agent 根据评测结果修改 harness，而不把所有问题都归到提示词上。

第 17 章依赖第 1 章 §1.4 提出的两项限制：自动修改可能破坏已有能力，多个组件各自的收益也不能直接相加。读完第 1 章后可以先读 §17.1，了解开发者预测回归的准确率；需要验证实际改动时，再阅读完整章节。

---

作者 王吕 · 《Agent Harness 工程：从源码里读出的设计决策》 · https://agent-harness.codeflow.cc/book/part-6/
