Agent 失败时,怎样找到第一个错点?
教学假数据:任务要求分析 corpus-v2 的十份访谈,系统却沿用了上一次任务缓存的 corpus-v1。最终报告结构完整、引用也能打开,但其中两条结论来自旧版本。
不要从最终文案猜原因。沿任务记录往回看:用户选择的是 v2,任务契约保存的是 v2,但 Context Pack 装入了 v1。第一次偏离发生在材料装载,而不是模型写结论时。
失败分类只是为了回答两个问题:第一次在哪里偏离,应该由谁修。它不是一张需要背诵的术语表。
固定目标版本、实际读取版本和最终引用,沿记录找到第一次分叉。本例根因是 Context Pack 装入旧缓存,不是模型最后写错一句话。
先固定正确版本与实际版本
任务开始时记录目标版本 corpus-v2;每次读取材料时记录实际 corpus_hash;交付时把报告引用重新与 v2 对照。三处事实一摆在一起,版本错配就不再靠猜。
最终“引用能打开”只是症状检查。正确标准是“引用来自本次被授权并锁定的 corpus-v2”。
官方事实查看这一结论的依据与边界+
Anthropic 的可信 Agent 指南强调从真实行动、失败与环境反馈建立可观察、可改进的质量证据。
ANTrustworthy agents in practice官方研究 · 核验 2026-07-14找到第一次偏离,再分配修复人
本例的首次偏离是 Context Pack 读取了旧缓存,Owner 是上下文与缓存模块;模型随后基于旧材料归纳,只是连锁结果。改 Prompt 或更换模型都没有触及根因。
其他失败也用同一方法:工具没有执行、权限错误放行、Verifier 漏检、客户端把失败显示成完成。类别的用途是把修复送到正确责任层。
官方事实查看这一结论的依据与边界+
Anthropic 的可信 Agent 研究讨论现实部署中的错误、控制和风险。
ANTrustworthy agents in practice官方研究 · 核验 2026-07-14修复后把这个样本留在回归集
修复包含三件事:任务启动时锁定 corpus_hash;恢复任务时再次比较版本;Verifier 发现引用不属于本次 corpus 时直接阻断交付。
把 corpus-v1/v2 错配保存成固定任务。以后每次改缓存、上下文或恢复逻辑都重跑;连续通过才说明这类失败被控制,而不只是被解释。
本站推演查看这一结论的依据与边界+
corpus-v1/v2 版本错配是本站教学假数据,用于演示首次偏离、责任归属与回归任务,不指向任何真实事故。
ANTrustworthy agents in practice官方研究 · 核验 2026-07-14有术语没听懂?在这里用人话再看一遍4 个词+
- 失败分类
- 用稳定类别描述失败发生在哪个任务阶段与责任层。
- 症状
- 用户最终看到的问题,不一定等于真正根因。
- 根因
- 最早导致后续错误、且能够通过具体修复控制的机制问题。
- 回归任务
- 未来版本必须重复运行、用来防止同类问题再次出现的固定样本。
本章依据与证据边界1 条补充结论 · 14 份原始材料+
下面补充本章的其他依据,并说明每份材料能证明什么、不能证明什么。
- [4]
本站的失败类别与 Owner 路由是产品诊断框架,不是 Anthropic 发布的固定分类法。
本站推演ANTrustworthy agents in practice官方研究 · 核验 2026-07-14
查看全部一手材料与源码证据 14 条
这份文档说明 Claude Code 如何以 allow、ask、deny 规则和不同 Permission Mode 控制工具、命令、路径与外部访问,并明确 deny 优先于 ask 和 allow。它也说明权限由客户端执行而不是依赖模型遵守,以及权限、Hook、工作目录与 Sandbox 如何组合形成纵深防御。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-23SandboxingAnthropic这份文档界定了 Claude Code Sandbox 对 Bash 命令及其子进程施加的文件系统和网络边界,并区分自动允许与常规审批模式。它同时明确 Read、Edit、Write 等内置文件工具仍由权限系统控制,Sandbox 不是覆盖所有工具和桌面操作的通用隔离层。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-23Automate actions with hooksAnthropic这份指南以格式化、阻断危险命令、权限处理、通知和上下文注入等例子说明 Hook 适合确定生命周期事件上的自动化。它支持产品经理把必须执行的治理规则从概率性 Prompt 中移出,并理解多个匹配 Hook 并行执行时的合并与副作用风险。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-11Hooks referenceAnthropic这份参考文档定义 Session、Prompt、Tool、Permission、Subagent、Compaction 等 Hook 事件及其输入输出协议。它还区分 command、HTTP、MCP tool、prompt 与 agent handler,并说明异步 Hook、阻断决策、超时和 Subagent Hook 的具体限制。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-23Running Codex safely at OpenAIOpenAI这份材料展示 OpenAI 在真实内部工作流中如何组合 Sandbox、Approval、网络策略、身份凭证、规则和管理员强制配置。它也说明 Agent 原生遥测如何记录用户意图、审批、工具、MCP 与网络决策,让安全团队能够审计发生了什么以及为什么发生。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-11Tracing - OpenAI Agents SDKOpenAI Agents SDK这份文档定义 Trace 与 Span,并说明 Agents SDK 默认记录 Agent 运行、模型生成、工具调用、Handoff、Guardrail 和自定义事件。它支持课程把轨迹观测落到可实现的数据结构,同时提醒默认 Trace 可能包含模型及工具输入输出等敏感数据,需要显式配置采集与导出策略。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。固定提交源码 · 核验 2026-07-23Grok Build session orchestration loop(固定提交)xAI该文件展示 Session Actor 怎样统一接收命令、模型 Turn 完成、工具与 MCP 事件、会话状态和停止事件,再启动下一段工作或进入 Idle;它证明生产 Loop 还要管理并发事件、生命周期与恢复,而不是只有“模型想一步、工具做一步”。
证据边界:单个调度文件不能证明完整 Prompt 组装、全部工具执行、最终终止条件或线上任务可靠性;这些结论仍需结合相邻模块与运行证据。固定提交源码 · 核验 2026-07-23Grok Build permission manager(固定提交)xAI该文件把 Always Approve、Auto、Ask 模式、策略 allow/deny/ask、MCP 授权记忆、命令拆分、安全命令判断和人工 Prompt 编排进同一个确定性权限管理器。它支持把权限设计理解为 Harness 的决策与状态系统。
证据边界:权限管理器不是 Sandbox 本身;源码存在也不能证明策略无绕过、分类器无误判或所有客户端都采用相同默认配置。固定提交源码 · 核验 2026-07-23Hermes Agent tool-call validation and recoveryNous Research这段固定提交源码展示 Hermes 如何检查工具名和 JSON 参数、限制委派数量、去重调用,并用结构化工具结果把可恢复错误送回下一轮。它直接证明生产级 Agent Loop 在模型输出与真实动作之间还需要确定性处理。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent tool execution and guardrail handoffNous Research这段固定提交源码先持久化工具调用,再交给执行器产生真实副作用;若工具 Guardrail 阻断,则写入明确的受控终止原因。它证明工具执行、恢复与用户可见状态需要由 Harness 收口。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent budget, completion and cleanup finalizationNous Research这段固定提交源码定义 Turn 结束时的预算耗尽、回退与完成判定,并把轨迹保存、资源清理和清理错误纳入统一关账。它支持课程把 completed 视为需要系统证据与退出处理的状态,而不是模型的一句话。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent durable session finalizationNous Research这段固定提交源码在 Turn 结束时修复未闭合的工具消息序列,并把最终消息和会话状态持久化;持久化失败会作为清理错误保留,而不是静默伪装成完整成功。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。协议规范 · 核验 2026-07-14MCP Security Best PracticesModel Context Protocol官方安全指南覆盖 confused deputy、token passthrough、SSRF、session hijacking、最小 scope、用户同意和本地 Server 信任。
证据边界:遵循清单不能消除 Prompt Injection、实现漏洞或第三方供应链风险。官方产品实现 · 核验 2026-07-14Hermes Agent Context Compression and CachingNous Research当前文档公开工具结果裁剪、头尾保护、结构化摘要、重压缩和缓存策略,并说明摘要模型窗口不足时中段上下文可能在无摘要情况下被丢弃。
证据边界:Compaction 不能保证信息无损,也不是长期 Memory。