哪些动作能自动做,哪些必须先问你?
权限决定 Agent 被允许做什么,审批决定何时必须等人,沙箱则限制动作即使出错也只能影响一个受控范围。
教学案例:在登录超时任务里,搜索和读取当前项目可以自动进行;修改两个目标文件要先展示范围;读取 .env、跨项目访问或执行危险命令应直接拒绝。
每一步都弹窗不会更安全,只会让用户习惯无脑确认。审批负责让用户做真正重要的决定,沙箱则在技术上限制文件、网络、进程和凭证;两者不能互相代替。
频繁无差别审批会形成确认疲劳。更好的系统根据资源范围、动作可逆性、外部影响和用户授权形成策略,在真正关键的节点提供具体、可理解的选择。
模型提出“改文件”以后,为什么不会直接执行?
权限课重点:权限策略(Policy)决定放行、询问或拒绝,沙箱(Sandbox)再限制实际可触达范围。
- 1提出意图
模型 → 运行系统edit_file(path, patch) - 2校验合同
参数类型、项目范围、幂等键
运行系统内部 - 3判断风险
放行自动继续;询问先等用户;拒绝直接阻断
权限策略 → 用户 - 4受限执行
在文件、网络、命令边界内调用工具
沙箱 → 工具 - 5回传事实
改动对比、退出码、结构化错误和外部回执
工具 → 运行系统 - 6记录与验证
写入事件记录,交给验收器(Verifier),并成为下一轮新观察(Observation)
运行系统 → 证据 / 模型
从 Capability Request 到执行
Agent 请求修改时要说明文件、原因、预计 Diff 和准备运行的测试。策略可自动允许项目内搜索与读取,修改明确文件时询问,访问密钥和项目外目录时拒绝。
审批卡要让用户能判断影响:改哪里、为什么、能否撤销、这次允许到什么范围。不要只放一个含糊的“继续”按钮。
官方事实查看这一结论的依据与边界+
OpenAI 公开描述了 Codex 在内部使用中的沙箱与安全运行实践;这是 Codex 案例而非唯一行业实现。
OPRunning Codex safely at OpenAI官方工程文章 · 核验 2026-07-14拒绝也是正式产品状态
用户拒绝写入时,前面的搜索、原因假设和建议补丁仍然可以交付。Agent 应停在“等待确认”或“已拒绝”,不能换种说法反复索要同一权限。
恢复路径要在需求阶段设计:可改为只展示补丁、缩小文件范围,或由用户手动执行。拒绝不等于整个任务崩溃。
官方事实查看这一结论的依据与边界+
Anthropic 的可信 Agent 研究强调自主性必须配合监控、控制和现实部署中的安全边界。
ANTrustworthy agents in practice官方研究 · 核验 2026-07-14自动模式也必须保留硬边界
产品可以用规则或风险分类帮助低风险动作自动通过,但这种判断会出错。自动化越强,越需要沙箱、最小权限、凭证隔离、审计和立即停止。
Claude Code 的具体权限模式只是产品案例。课程关注的通用责任是:自动执行不等于取消边界,分类器也不是安全证明。
官方事实查看这一结论的依据与边界+
Anthropic 将 Auto Mode 描述为相对跳过权限风险更低的中间路径,同时明确分类器会误放行或误阻止,仍建议隔离环境。
CLAuto mode for Claude Code官方工程文章 · 核验 2026-07-14一次写入怎样被权限逐层限制
解析工具调用,先应用模式门禁,再经过权限策略和必要审批,最后在工作区/沙箱边界内执行并返回结构化结果。
产品经理要决定:模型只拥有提出动作的能力;真正的安全来自不可被提示词绕过的 Harness 与运行时边界。
查看 Grok Build 官方仓库中的对应实现提交 a5727c596045 · 核验 2026-07-23+
证据边界:审批是产品控制点,沙箱是技术执行边界;两者都不保证工具逻辑正确,也不能互相替代。
有术语没听懂?在这里用人话再看一遍6 个词+
- 最小权限
- 默认只给完成当前任务所需的最小资源与动作范围。
- 沙箱
- 用技术边界隔离文件、网络、进程、设备或凭证访问。
- Capability Request
- Agent 对某项具体能力、资源范围和执行理由的结构化请求。
- 确认疲劳
- 频繁低信号弹窗使用户形成无脑批准习惯,反而降低安全性。
- 可逆性
- 动作造成的变化是否能低成本、完整地撤销。
- 风险分类器
- 在动作执行前估计其破坏性并允许、阻止或升级审批的模型或规则组件;它不是安全证明。
本章依据与证据边界1 条补充结论 · 13 份原始材料+
下面补充本章的其他依据,并说明每份材料能证明什么、不能证明什么。
- [4]
本站五维风险评分和三档授权是教学框架;具体权限模式与边界应以产品现行文档为准。
本站推演ANChoose a permission mode官方文档 · 核验 2026-07-14
查看全部一手材料与源码证据 13 条
这份文档说明 Claude Code 如何以 allow、ask、deny 规则和不同 Permission Mode 控制工具、命令、路径与外部访问,并明确 deny 优先于 ask 和 allow。它也说明权限由客户端执行而不是依赖模型遵守,以及权限、Hook、工作目录与 Sandbox 如何组合形成纵深防御。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-23SandboxingAnthropic这份文档界定了 Claude Code Sandbox 对 Bash 命令及其子进程施加的文件系统和网络边界,并区分自动允许与常规审批模式。它同时明确 Read、Edit、Write 等内置文件工具仍由权限系统控制,Sandbox 不是覆盖所有工具和桌面操作的通用隔离层。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-23Automate actions with hooksAnthropic这份指南以格式化、阻断危险命令、权限处理、通知和上下文注入等例子说明 Hook 适合确定生命周期事件上的自动化。它支持产品经理把必须执行的治理规则从概率性 Prompt 中移出,并理解多个匹配 Hook 并行执行时的合并与副作用风险。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-11Hooks referenceAnthropic这份参考文档定义 Session、Prompt、Tool、Permission、Subagent、Compaction 等 Hook 事件及其输入输出协议。它还区分 command、HTTP、MCP tool、prompt 与 agent handler,并说明异步 Hook、阻断决策、超时和 Subagent Hook 的具体限制。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-23Running Codex safely at OpenAIOpenAI这份材料展示 OpenAI 在真实内部工作流中如何组合 Sandbox、Approval、网络策略、身份凭证、规则和管理员强制配置。它也说明 Agent 原生遥测如何记录用户意图、审批、工具、MCP 与网络决策,让安全团队能够审计发生了什么以及为什么发生。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。固定提交源码 · 核验 2026-07-23Grok Build repository map(固定提交)xAI固定提交 README 将公开范围界定为 grok CLI/TUI 与 Agent Runtime 的 Rust 源码快照,并标出 TUI、Agent Runtime、工具、Workspace、MCP、Sandbox 等主要 crate;仓库由 xAI 内部 monorepo 定期同步且不接受外部贡献。
证据边界:这个快照不是 Grok Build 服务端源码,也不能代表后续线上版本、内部 monorepo 的全部模块或每项功能的运行效果。固定提交源码 · 核验 2026-07-23Grok Build permission manager(固定提交)xAI该文件把 Always Approve、Auto、Ask 模式、策略 allow/deny/ask、MCP 授权记忆、命令拆分、安全命令判断和人工 Prompt 编排进同一个确定性权限管理器。它支持把权限设计理解为 Harness 的决策与状态系统。
证据边界:权限管理器不是 Sandbox 本身;源码存在也不能证明策略无绕过、分类器无误判或所有客户端都采用相同默认配置。固定提交源码 · 核验 2026-07-23Hermes Agent tool execution and guardrail handoffNous Research这段固定提交源码先持久化工具调用,再交给执行器产生真实副作用;若工具 Guardrail 阻断,则写入明确的受控终止原因。它证明工具执行、恢复与用户可见状态需要由 Harness 收口。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。官方产品实现 · 核验 2026-07-23Auto mode for Claude CodeClaude by Anthropic官方说明 Auto Mode 会在工具调用前用分类器评估潜在破坏性动作,风险低于完全跳过权限,同时承认仍可能误放行危险动作或误拦截正常动作。
证据边界:分类器存在不等于风险被消除,也不替代隔离环境和最小权限。协议规范 · 核验 2026-07-14Model Context Protocol AuthorizationModel Context Protocol现行规范定义 HTTP MCP 的 OAuth 2.1 角色、Protected Resource Metadata、Resource Indicators、scope、token audience、PKCE 和授权错误处理。
证据边界:协议兼容不自动等于某个 Server 安全、可信或符合业务授权。协议规范 · 核验 2026-07-14MCP Security Best PracticesModel Context Protocol官方安全指南覆盖 confused deputy、token passthrough、SSRF、session hijacking、最小 scope、用户同意和本地 Server 信任。
证据边界:遵循清单不能消除 Prompt Injection、实现漏洞或第三方供应链风险。独立研究结论 · 核验 2026-07-14InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated LLM AgentsACL Anthology该同行评审 benchmark 用 1,054 个测试覆盖工具型 Agent 的间接 Prompt Injection、用户伤害和私有数据外泄。
证据边界:单一 benchmark 的攻击成功率不能直接代表当前某款产品的线上风险。官方产品实现 · 核验 2026-07-23Use Claude Code DesktopClaude by Anthropic官方桌面端文档说明 Code tab 与 CLI 使用同一底层引擎,并明确展示权限模式、可中断会话、可视 Diff 与行级评论、Preview 自动验证、终端、CI 状态和 PR 监控等用户可见流程。
证据边界:桌面端产品文档只能证明当前可见功能与交互合同,不能证明闭源客户端内部模块、线上默认效果或所有版本行为。