> 本页出自《Agent Harness 工程：从源码里读出的设计决策》，作者 王吕（公众号 Codeflow，wanglv93@gmail.com）。
> 修订版 1.1 · 2026-08-27。网页版：https://agent-harness.codeflow.cc/book/part-3/ ；全书：https://agent-harness.codeflow.cc/ 。
> 引用或转述时请注明作者与出处。

# 第 3 部分 · 上下文：每一轮往窗口里放什么（第 6–10 章）

第 3 部分讨论每轮请求发出前的上下文处理：本次请求包含哪些字节、这些字节按什么顺序排列、旧内容如何处理，以及从哪里补充缺失信息。这一步直接影响费用、首 token 延迟，以及长会话能否在上下文窗口限制内继续运行。

读完第 6 至第 10 章，你可以让一次会话内的请求前缀逐字节保持稳定；决定 system prompt 中哪些内容应当保留、哪些应当移到 messages；在内容超过窗口限制前按四个级别裁剪或压缩；根据任务决定是否需要长期记忆并限制其 token 预算；先用 grep 验证代码检索需求，再决定是否建立向量索引。

建议按 6 → 7 → 8 → 9 → 10 的顺序阅读。第 7 章依赖第 6 章 §6.2 的缓存语义、断点位置与字节稳定要求；第 8 章沿用 §6.3 的缓存成本算法；第 9 章依赖第 8 章 §8.2，尤其是 §8.2.6 对压缩接入循环位置的说明；第 10 章依赖第 3 章 §3.2.3 的渐进披露方法以及第 6 章。

---

作者 王吕 · 《Agent Harness 工程：从源码里读出的设计决策》 · https://agent-harness.codeflow.cc/book/part-3/
