它刚读过文件,下一步为什么又忘了?
教学案例:登录超时任务已经读过配置文件,但下一轮模型又问了一遍。原因通常不是它故意偷懒,而是模型每次只看见系统这次递交的一份有限材料。
把它想成一张工作台:任务、项目规则、工具说明、相关文件、刚才的测试结果都要摆上去。位置有限,Harness 必须决定哪些常驻、哪些按需读取、哪些只留摘要。
Token、上下文窗口、缓存等术语都服务同一个产品问题:怎样让当前判断拿到足够信息,又不把无关历史塞满工作台。
把上下文想成模型当前的工作台:登录超时任务、项目规则、相关文件、工具说明和最新测试结果都要争夺有限位置。Harness 决定谁进入、谁摘要、谁暂时留在外部。
模型这一轮究竟看见了什么?
模型不会一直看着整个项目。登录超时任务的目标、现行规则、相关文件片段和最新测试结果,必须在本次调用时重新装进有限的输入包。
- 目标
修复登录超时,测试通过且不改变公开 API。
- 规则
只读当前仓库;修改两个目标文件前先确认。
- 代码
auth/session.ts与相关测试片段。 - 最新结果
17/18 passed,一个 Mock 仍失败。
未放进来的文件不会被模型自动记住;大文件只保留位置,需要时重新读取。
例如重新读取测试 Mock,或请求修改文件。
下一轮必须重新选择要保留的目标、规则、文件与结果。
一次模型调用可以被产品经理读懂
一次调用可以简化成三包材料:必须遵守的规则、可以使用的工具、当前任务所需的事实。模型返回文字或一个工具请求,工具结果再进入下一轮。
登录超时任务中,当前错误、相关实现、测试文件和最近一次测试结果应该在场;无关目录和很早的搜索日志不必一直占位置。
官方事实查看这一结论的依据与边界+
OpenAI 的 Codex Agent Loop 文章公开描述了 instructions、tools、input、工具结果回填与长任务压缩等 Codex 案例机制。
OPUnrolling the Codex agent loop官方工程文章 · 核验 2026-07-14把预算花在最值钱的决策上
先保证任务目标、项目边界和最新错误不会丢,再按当前步骤读取最相关文件。不要把整个仓库一次塞入,也不要平均截断所有材料。
系统还要为模型的下一步和最终交付留出空间。上下文策略同时影响遗漏、速度和成本,但用户首先感受到的是:Agent 有没有读对文件、有没有忘记关键限制。
本站推演查看这一结论的依据与边界+
工作台比喻与装箱顺序是本站教学示例,不是 OpenAI 推荐的固定比例。
OPUnrolling the Codex agent loop官方工程文章 · 核验 2026-07-14压缩要保留可恢复任务所需的骨架
好的压缩保留目标、硬约束、已经排除的原因、关键文件位置、失败测试和下一步;原始文件仍留在项目里,需要时可以重新读取。
一旦摘要去掉了来源、否定条件或版本,后续模型可能沿着错误前提稳定执行。压缩策略必须进入测试,而不能被当成无害的后台优化。
官方事实查看这一结论的依据与边界+
OpenAI 对 Codex Agent Loop 的公开拆解说明了上下文窗口有限、长任务需要压缩,并强调保留继续任务所需的关键信息。
OPUnrolling the Codex agent loop官方工程文章 · 核验 2026-07-14Context Window、Cache 和 Memory 的边界
Context Window 是本次调用的工作台;KV Cache 是计算加速;Memory 是产品以后还会取回的信息。三者都可能让用户感觉“记得”,但解决的不是同一个问题。
界面不必显示每个 Token,却应该让用户看见关键文件、被保留的约束,以及信息不足时为什么暂停。
官方事实查看这一结论的依据与边界+
Hugging Face 官方说明 KV Cache 复用注意力层已经计算过的 Key/Value 状态以减少重复计算;它是推理优化,不是产品层长期记忆。
HUCaching · Transformers官方文档 · 核验 2026-07-14有术语没听懂?在这里用人话再看一遍7 个词+
- LLM API
- 应用向大语言模型提交指令、工具说明和输入,并接收文字或结构化动作的接口。
- Token
- 模型处理文字的片段单位;字符数只能粗略估算 Token 数。
- Context Window
- 一次模型调用可处理的输入和输出总容量。
- Instructions
- 告诉模型角色、目标、规则和行为边界的高优先级输入。
- KV Cache
- 复用已计算序列状态的推理优化,减少重复计算,但不是产品层长期记忆。
- Compaction
- 在长任务中把旧上下文压缩成可继续工作的摘要、状态和回源指针。
- Memory
- 由产品选择、持久化并在未来任务中检索的信息。
本章依据与证据边界1 条补充结论 · 6 份原始材料+
下面补充本章的其他依据,并说明每份材料能证明什么、不能证明什么。
- [5]
Anthropic 文档公开说明 Claude Code 的记忆/规则管理方式;这是 Claude Code 产品案例,不代表所有 Agent 的统一 Memory 实现。
官方事实ANManage Claude's memory官方文档 · 核验 2026-07-14
查看全部一手材料与源码证据 6 条
这份文档把 Claude Code 的 Agent Loop 描述为收集上下文、采取行动、验证结果三个相互交织的阶段,并说明模型与工具如何通过结果反馈持续调整。它还解释 Claude Code 作为 Harness 所承担的上下文管理、执行环境、会话、压缩、检查点和权限职责。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方方法 · 核验 2026-07-23Effective context engineering for AI agentsAnthropic这份材料将 Context Engineering 定义为持续选择和维护推理时最合适的信息,而不只是改写一条 Prompt。它支持最小高信号上下文、按需检索、工具结果压缩、结构化笔记、Compaction 与 Subagent 隔离等长任务策略。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-23How Claude remembers your projectAnthropic这份文档区分由人维护的 CLAUDE.md 持久指令与由 Claude 写入的 Auto Memory,并描述它们的作用域、加载顺序、存储位置和容量边界。它强调这些内容会作为上下文影响模型,而不是不可绕过的技术策略,并支持用户检查、修改和删除记忆。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-23Unrolling the Codex agent loopOpenAI这份材料逐步解释 Codex Harness 如何组装 instructions、tools 与 input,通过 Responses API 在一次 Turn 内循环完成模型推理和工具调用。它还说明对话增长、上下文窗口、Prompt Caching 与 Compaction 为什么属于 Harness 的核心工程责任。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。固定提交源码 · 核验 2026-07-23Hermes Agent context compression and tool runtimeNous Research这份同提交文档解释 Hermes 如何区分稳定、上下文和易变 Prompt 层,并在压力下裁剪旧工具输出、保留边界、生成结构化摘要和修复工具调用配对。它支持课程讨论上下文压缩与缓存边界,不用来证明未在该文档中展开的工具运行时。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。官方产品实现 · 核验 2026-07-14Hermes Agent Context Compression and CachingNous Research当前文档公开工具结果裁剪、头尾保护、结构化摘要、重压缩和缓存策略,并说明摘要模型窗口不足时中段上下文可能在无摘要情况下被丢弃。
证据边界:Compaction 不能保证信息无损,也不是长期 Memory。