第 3 部分 · 上下文:每一轮往窗口里放什么(第 6–10 章)
第 3 部分讨论每轮请求发出前的上下文处理:本次请求包含哪些字节、这些字节按什么顺序排列、旧内容如何处理,以及从哪里补充缺失信息。这一步直接影响费用、首 token 延迟,以及长会话能否在上下文窗口限制内继续运行。
读完第 6 至第 10 章,你可以让一次会话内的请求前缀逐字节保持稳定;决定 system prompt 中哪些内容应当保留、哪些应当移到 messages;在内容超过窗口限制前按四个级别裁剪或压缩;根据任务决定是否需要长期记忆并限制其 token 预算;先用 grep 验证代码检索需求,再决定是否建立向量索引。
建议按 6 → 7 → 8 → 9 → 10 的顺序阅读。第 7 章依赖第 6 章 §6.2 的缓存语义、断点位置与字节稳定要求;第 8 章沿用 §6.3 的缓存成本算法;第 9 章依赖第 8 章 §8.2,尤其是 §8.2.6 对压缩接入循环位置的说明;第 10 章依赖第 3 章 §3.2.3 的渐进披露方法以及第 6 章。
