Agent 跑几小时,中断后怎样继续?
教学案例:登录超时修复扩展到大型仓库。Agent 已找到根因、写入补丁,相关测试正在运行时网络断开。重新连接后,它不能再次写补丁,也不能把未知的测试结果显示成成功。
长任务能力不是“能一直跑”,而是已有结果能保存、当前状态能解释、中断后能从可信位置继续。进度也不该只显示一个猜出来的百分比。
把任务拆成可验证阶段,持续外置状态和证据,保存检查点与未完成事项。恢复时重建必要上下文,而不是依赖模型“记得”。
六小时任务怎样暂停、恢复,又不重复副作用?
检查点不是一段聊天摘要。恢复前必须核对目标、资料版本、工具版本、外部回执和剩余预算。
- 排队中Queued · 等待资源
- 运行中Running · 产出阶段结果并持续保存检查点
- 验收中Verifying · 检查结果和副作用
- 已完成Completed · 证据通过
动作前暂停;批准后从原位置继续。
暂停可恢复;取消停止新动作并保存已有结果。
有限重试;超过预算转人工或部分交付。
明确已完成、未完成和下一步选择。
目标 · 材料版本 · 已完成阶段 · 证据位置 · 外部回执 · 待决事项 · 剩余预算
目标是否变化?资料是否换版?工具是否兼容?外部动作是否已发生?预算是否仍有效?
检查点保存的是继续工作的最小充分状态
检查点至少保存任务目标、项目版本、已完成阶段、补丁哈希、测试命令与回执、未决项和剩余预算。原始文件仍在仓库中,但必须能重新定位。
恢复时先核对环境是否变化,再从最后可信检查点继续。直接把旧摘要送回模型,可能在过期前提上稳定执行。
官方事实查看这一结论的依据与边界+
OpenAI App Server 的 Thread 和事件模型为长任务持久状态与客户端重连提供了公开产品案例。
OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14预算变化需要用户可选的降级方案
达到时间或费用阈值时,可以只跑相关测试、继续完整测试,或停止并交付补丁与已完成检查。选择必须说明会损失什么。
异步通知应包含产物、验证和待决策事项。只发送“任务完成”会把复核负担留给用户。
官方事实查看这一结论的依据与边界+
OpenAI 的 Harness Engineering 案例强调持久产物、环境反馈和可恢复的长周期工作。
OPHarness engineering: agent-first world官方工程文章 · 核验 2026-07-14任务记录与执行环境要分开
任务记录保存目标、事件和证据;执行环境真正接触文件、命令和凭证。执行环境重启后,任务记录仍应存在,并能先核对项目版本再决定是否恢复。
生产系统还要处理身份、凭证、环境健康、事件持久化和审计。Anthropic 的 Managed Agents 是一个公开产品案例,不是行业唯一标准。
官方事实查看这一结论的依据与边界+
Anthropic 的 Managed Agents 文章把 Agent、Environment 与 Session 拆开,并描述凭证、隔离执行、持久事件和恢复等生产责任;这是其产品架构案例。
CLBuilding with Claude Managed Agents官方工程文章 · 核验 2026-07-14有术语没听懂?在这里用人话再看一遍6 个词+
- 长任务
- 持续时间、步骤或外部依赖足以使中断与恢复成为核心产品需求的任务。
- 检查点
- 能够在中断后恢复工作的状态、证据和外部回执快照。
- 外置状态
- 保存在模型上下文之外、可持久读取的任务事实。
- 阶段产物
- 在整体结束前已经可独立检查和复用的中间交付。
- 恢复语义
- 系统如何确认旧状态、避免重复动作并从正确位置继续。
- Brain / Hands
- 把任务编排与上下文责任同隔离执行环境分开的生产架构视角。
本章依据与证据边界2 条补充结论 · 18 份原始材料+
下面补充本章的其他依据,并说明每份材料能证明什么、不能证明什么。
- [4]
Anthropic 的长任务 Harness 工程文章说明长周期应用开发需要外置状态、阶段验证与可恢复工作;具体实现属于其案例。
官方事实ANHarness design for long-running application development官方工程文章 · 核验 2026-07-14 - [5]
本站检查点字段和四种预算选择是教学设计,不代表 Codex 固定实现。
本站推演OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14
查看全部一手材料与源码证据 18 条
这份文档把 Claude Code 的 Agent Loop 描述为收集上下文、采取行动、验证结果三个相互交织的阶段,并说明模型与工具如何通过结果反馈持续调整。它还解释 Claude Code 作为 Harness 所承担的上下文管理、执行环境、会话、压缩、检查点和权限职责。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方方法 · 核验 2026-07-23Effective context engineering for AI agentsAnthropic这份材料将 Context Engineering 定义为持续选择和维护推理时最合适的信息,而不只是改写一条 Prompt。它支持最小高信号上下文、按需检索、工具结果压缩、结构化笔记、Compaction 与 Subagent 隔离等长任务策略。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-23Create custom subagentsAnthropic这份文档说明 Subagent 使用独立上下文完成委派任务并向主会话返回摘要,可分别配置模型、工具、权限、Skill、MCP、Memory、Hook 与 Worktree 隔离。它支持把 Subagent 的价值定位为上下文隔离、并行和专业化,而不是把增加 Agent 数量等同于自动提升结果质量。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方方法 · 核验 2026-07-23Effective harnesses for long-running agentsAnthropic这份材料展示 Compaction 仍不足以解决跨上下文长任务,并总结一次做太多、半成品难接续和过早宣布完成等失败模式。它用初始化环境、功能清单、进度文件、Git 历史、增量推进和端到端验证说明 Harness 如何把连续性写入环境。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-23Unlocking the Codex harness: how we built the App ServerOpenAI这份材料说明 Codex App Server 如何以双向 JSON-RPC/JSONL 协议把同一 Harness 暴露给 CLI、IDE、桌面与 Web 客户端。它定义 Thread、Turn、Item 及流式事件、审批暂停、持久化和重连语义,是课程讲解 Agent 客户端协议与多端复用的直接实现依据。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方方法 · 核验 2026-07-23Harness engineering: leveraging Codex in an agent-first worldOpenAI这份案例说明当 Agent 承担大量执行工作时,人类工作的重心会转向表达意图、设计环境、维护可读知识和建立反馈回路。它支持用仓库内版本化知识、机械化架构约束、测试、Lint 与可操作错误信息提升 Agent 的可读性、自治性和长期一致性。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。固定提交源码 · 核验 2026-07-23Grok Build session orchestration loop(固定提交)xAI该文件展示 Session Actor 怎样统一接收命令、模型 Turn 完成、工具与 MCP 事件、会话状态和停止事件,再启动下一段工作或进入 Idle;它证明生产 Loop 还要管理并发事件、生命周期与恢复,而不是只有“模型想一步、工具做一步”。
证据边界:单个调度文件不能证明完整 Prompt 组装、全部工具执行、最终终止条件或线上任务可靠性;这些结论仍需结合相邻模块与运行证据。固定提交源码 · 核验 2026-07-23Hermes Agent tool-call validation and recoveryNous Research这段固定提交源码展示 Hermes 如何检查工具名和 JSON 参数、限制委派数量、去重调用,并用结构化工具结果把可恢复错误送回下一轮。它直接证明生产级 Agent Loop 在模型输出与真实动作之间还需要确定性处理。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent budget, completion and cleanup finalizationNous Research这段固定提交源码定义 Turn 结束时的预算耗尽、回退与完成判定,并把轨迹保存、资源清理和清理错误纳入统一关账。它支持课程把 completed 视为需要系统证据与退出处理的状态,而不是模型的一句话。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent durable session finalizationNous Research这段固定提交源码在 Turn 结束时修复未闭合的工具消息序列,并把最终消息和会话状态持久化;持久化失败会作为清理错误保留,而不是静默伪装成完整成功。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent context compression and tool runtimeNous Research这份同提交文档解释 Hermes 如何区分稳定、上下文和易变 Prompt 层,并在压力下裁剪旧工具输出、保留边界、生成结构化摘要和修复工具调用配对。它支持课程讨论上下文压缩与缓存边界,不用来证明未在该文档中展开的工具运行时。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent async delegation and turn finalizationNous Research这段源码说明后台 Subagent 的完成结果进入共享队列,并在 Agent 空闲时形成新的 Turn,而不是插进正在进行的工具序列;这样可以保持消息角色顺序与 Prompt Cache 稳定。这是 Hermes 的实现选择,不是行业统一协议。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。官方产品实现 · 核验 2026-07-23The evolution of agentic surfaces: building with Claude Managed AgentsClaude by Anthropic这份官方材料定义 Agent、Environment 与 Session 三类生产资源,并说明 Brain/Hands 分离、持久事件、凭证代理、可恢复状态和自托管执行环境。
证据边界:官方自测延迟和客户案例不能直接外推为所有 Agent 产品的 ROI。官方产品实现 · 核验 2026-07-23How we built our multi-agent research systemAnthropic这份生产案例披露 Orchestrator-Worker、独立上下文、并行搜索、恢复与评测方法,也明确多 Agent 的高 Token 成本和对串行、强共享上下文任务的限制。
证据边界:内部研究 Eval 的提升不能证明多 Agent 对所有任务都优于单 Agent。官方产品实现 · 核验 2026-07-23Auto mode for Claude CodeClaude by Anthropic官方说明 Auto Mode 会在工具调用前用分类器评估潜在破坏性动作,风险低于完全跳过权限,同时承认仍可能误放行危险动作或误拦截正常动作。
证据边界:分类器存在不等于风险被消除,也不替代隔离环境和最小权限。官方产品实现 · 核验 2026-07-23A harness for every task: dynamic workflows in Claude CodeClaude by Anthropic这份材料说明 Claude Code 如何让用户为长程、并行、结构化或对抗任务编写动态 Harness,并以多个独立上下文完成分解、验证和汇总。
证据边界:动态工作流不是默认更优;协调、Token、延迟和错误传播仍需针对任务测量。官方产品实现 · 核验 2026-07-14Hermes Agent SessionsNous Research当前文档说明 Hermes 将完整消息与工具历史保存在 SQLite,会话可恢复和跨端检索,但恢复历史不等于把所有旧字节持续塞回模型上下文。
证据边界:持久会话不自动保证恢复无副作用,也不是隐私删除或长期语义记忆。官方产品实现 · 核验 2026-07-14Hermes Agent Context Compression and CachingNous Research当前文档公开工具结果裁剪、头尾保护、结构化摘要、重压缩和缓存策略,并说明摘要模型窗口不足时中段上下文可能在无摘要情况下被丢弃。
证据边界:Compaction 不能保证信息无损,也不是长期 Memory。