怎样在正确时刻,把正确资料交给模型?
Context Engineering(上下文工程)是持续决定模型这一刻应该看到什么、按什么顺序看到,以及信息超限时保留和舍弃什么。
教学案例:Agent 搜到三个 timeout 文件,其中一个是已经废弃的示例。若系统只按关键词排名,它可能认真修改一份根本不会运行的代码。
上下文工程用人话说,就是在每一步替模型准备正确材料。系统先给项目地图和规则,再按当前问题读取实现、测试与最近错误;同时保留文件路径、版本和选择理由,方便回头核对。
同一个模型在两个产品里表现不同,常常不是 Prompt 长短不同,而是一个拿到了正确项目事实,另一个被旧文件和噪声带偏。
Agent 每一步都依赖 Harness 构造的新输入。高质量上下文需要渐进披露:先给稳定地图,再按任务读取细节;让信息可检索、可验证、不过期。
候选资料怎样进入本轮输入包?
同一个登录超时任务,现行代码与测试优先于旧 README;每份材料都要检查权限、权威性、时效、相关性和预算,冲突不能静默合并。
- 当前代码与测试
- 项目规则
- 旧 README
- 搜索结果
- 上一轮工具回执
- 1有权限只读已授权仓库
- 2来源更权威当前代码和测试优先
- 3仍然有效旧 README 标记过期
- 4与当前步骤相关只选 timeout 路径
- 5放得进预算全文保留位置,按需重读
若规则冲突,显式呈现并等待选择,不替用户偷偷合并。
先给地图,再按问题读取细节
项目说明、允许修改的目录和完成标准可以先进入工作台;相关实现、测试和错误日志再按当前假设读取。每份材料保留路径和版本,结论才能回到原文件。
敏感凭证、无关目录和外部内容里的可疑指令不应因为“搜索相关”就进入普通上下文。
官方事实查看这一结论的依据与边界+
OpenAI 的 Harness Engineering 案例强调为 Agent 提供可导航、可验证的仓库信息和反馈环境。
OPHarness engineering: agent-first world官方工程文章 · 核验 2026-07-14搜索命中不等于应该使用
文件名包含 timeout,只说明文字相关,不证明它属于当前运行路径。系统还要比较导入关系、测试引用和最近修改,并在冲突时展示差异或继续查证。
来自 Issue、README 和网页的文字首先是任务材料,不能因为它声称“忽略原规则”就获得更高指令权。
官方事实查看这一结论的依据与边界+
Codex Agent Loop 的公开说明包含上下文组装、工具结果回填与长任务压缩。
OPUnrolling the Codex agent loop官方工程文章 · 核验 2026-07-14回到登录超时任务看一次选择错误
教学项目里,示例目录和真实实现都包含 timeout。只看关键词时,示例排在前面;加入导入关系和测试引用后,系统发现真实调用落在 auth/session.ts,并把示例降为补充材料。
修复点不在“让模型更认真”,而在材料选择规则:当前运行路径优先、测试引用优先、废弃目录默认排除,仍有冲突就让用户看见。
本站推演查看这一结论的依据与边界+
本站的 Context Pipeline 七步与 always/on-demand/never 分层是通用教学框架。
OPHarness engineering: agent-first world官方工程文章 · 核验 2026-07-14把材料分成常驻、按需和禁入
登录超时任务的常驻层放目标、项目规则和完成标准;按需层放实现文件、测试和日志;禁入层放密钥、项目外文件和未经授权的网络内容。
常驻规则改动要评审,按需材料要记录为什么被选中,禁入内容由确定性边界拦截。这样“给模型看什么”才是可维护的产品设计。
本站推演查看这一结论的依据与边界+
登录超时项目中的废弃示例与真实实现冲突为本站教学案例,不对应任何真实仓库事故。
OPHarness engineering: agent-first world官方工程文章 · 核验 2026-07-14有术语没听懂?在这里用人话再看一遍5 个词+
- Context Engineering
- 持续选择、组织、压缩、更新和治理模型当前可见信息的系统工作。
- 渐进披露
- 先提供稳定地图和索引,再根据当前任务按需读取细节。
- Scope
- 信息生效的范围,例如用户、团队、项目、任务或单次调用。
- TTL
- 信息在多长时间后需要过期或重新确认。
- 上下文污染
- 无关、过期、冲突或不可信信息进入模型并影响判断。
本章依据与证据边界1 条补充结论 · 11 份原始材料+
下面补充本章的其他依据,并说明每份材料能证明什么、不能证明什么。
- [5]
常驻、按需、禁入三层是本站为产品学习者整理的上下文治理方法。
本站推演OPUnrolling the Codex agent loop官方工程文章 · 核验 2026-07-14
查看全部一手材料与源码证据 11 条
这份文档把 Claude Code 的 Agent Loop 描述为收集上下文、采取行动、验证结果三个相互交织的阶段,并说明模型与工具如何通过结果反馈持续调整。它还解释 Claude Code 作为 Harness 所承担的上下文管理、执行环境、会话、压缩、检查点和权限职责。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方方法 · 核验 2026-07-23Effective context engineering for AI agentsAnthropic这份材料将 Context Engineering 定义为持续选择和维护推理时最合适的信息,而不只是改写一条 Prompt。它支持最小高信号上下文、按需检索、工具结果压缩、结构化笔记、Compaction 与 Subagent 隔离等长任务策略。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-23How Claude remembers your projectAnthropic这份文档区分由人维护的 CLAUDE.md 持久指令与由 Claude 写入的 Auto Memory,并描述它们的作用域、加载顺序、存储位置和容量边界。它强调这些内容会作为上下文影响模型,而不是不可绕过的技术策略,并支持用户检查、修改和删除记忆。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-23Create custom subagentsAnthropic这份文档说明 Subagent 使用独立上下文完成委派任务并向主会话返回摘要,可分别配置模型、工具、权限、Skill、MCP、Memory、Hook 与 Worktree 隔离。它支持把 Subagent 的价值定位为上下文隔离、并行和专业化,而不是把增加 Agent 数量等同于自动提升结果质量。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方方法 · 核验 2026-07-23Effective harnesses for long-running agentsAnthropic这份材料展示 Compaction 仍不足以解决跨上下文长任务,并总结一次做太多、半成品难接续和过早宣布完成等失败模式。它用初始化环境、功能清单、进度文件、Git 历史、增量推进和端到端验证说明 Harness 如何把连续性写入环境。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-23Unrolling the Codex agent loopOpenAI这份材料逐步解释 Codex Harness 如何组装 instructions、tools 与 input,通过 Responses API 在一次 Turn 内循环完成模型推理和工具调用。它还说明对话增长、上下文窗口、Prompt Caching 与 Compaction 为什么属于 Harness 的核心工程责任。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方方法 · 核验 2026-07-23Harness engineering: leveraging Codex in an agent-first worldOpenAI这份案例说明当 Agent 承担大量执行工作时,人类工作的重心会转向表达意图、设计环境、维护可读知识和建立反馈回路。它支持用仓库内版本化知识、机械化架构约束、测试、Lint 与可操作错误信息提升 Agent 的可读性、自治性和长期一致性。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。固定提交源码 · 核验 2026-07-23Hermes Agent context compression and tool runtimeNous Research这份同提交文档解释 Hermes 如何区分稳定、上下文和易变 Prompt 层,并在压力下裁剪旧工具输出、保留边界、生成结构化摘要和修复工具调用配对。它支持课程讨论上下文压缩与缓存边界,不用来证明未在该文档中展开的工具运行时。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。官方方法 · 核验 2026-07-23Harnessing Claude’s intelligenceClaude by Anthropic这份官方设计说明展示 Claude Code 团队如何把模型能力放进工具、上下文、权限与反馈环境,并把 Harness 视为随模型变化而持续调整的产品系统。
证据边界:它解释团队经验,不代表每个领域都应复制 Claude Code 的产品结构。官方产品实现 · 核验 2026-07-14Hermes Agent Persistent MemoryNous Research当前文档说明 Hermes 使用有字符上限的 MEMORY.md 与 USER.md、会话开始时冻结注入、写入审批、安全扫描,以及基于 FTS5 的 Session Search。
证据边界:可写 Memory 不等于事实正确、无限记忆、向量 RAG 或模型权重更新。官方产品实现 · 核验 2026-07-14Hermes Agent Context Compression and CachingNous Research当前文档公开工具结果裁剪、头尾保护、结构化摘要、重压缩和缓存策略,并说明摘要模型窗口不足时中段上下文可能在无摘要情况下被丢弃。
证据边界:Compaction 不能保证信息无损,也不是长期 Memory。