模型可以判断,哪些事必须由系统保证?
具体任务是:用户把十份访谈放进已授权目录,Agent 要读完十份材料,找出共同问题,列出反例,并为每条结论附上可以打开的原文位置。它先生成内部草稿,外部分享必须由用户确认。
模型适合比较材料、提出主题和寻找反例;系统必须保证只读授权范围、记录 10/10 处理进度、核对引用、保存草稿,并在外部分享前停下来。模型说“已经读完”不算证据。
这一课只学一个判断:开放问题可以让模型判断,不可妥协的边界必须由系统强制。后面的任务契约、失败诊断、评测和作品都沿用这十份访谈。
用户把十份访谈放进授权目录。模型可以比较材料、提出主题和寻找反例;系统必须保证读完 10/10、引用真的存在、原文不越界,并在外部分享前停下。
先把任务分成判断与保证
模型判断哪些说法可能是共同问题、哪些材料互相冲突;系统保证十份材料都被处理、引用真的存在、原文没有越出授权范围。产品经理决定这些发现是否足以影响路线图。
只读查询可以连续进行;扩大目录、读取未脱敏材料或向外分享时再停下来。用户只在真正需要承担责任的节点被打断。
官方事实查看这一结论的依据与边界+
OpenAI 公开说明 Codex 的沙箱、审批、网络策略、身份与审计共同工作,低风险动作顺畅而高风险动作停下检查。
OPRunning Codex safely at OpenAI官方工程文章 · 核验 2026-07-14一句 Prompt 不能代替真实边界
Prompt 可以提醒模型“不要外发原文”,却不能阻止工具真的发送。授权目录、只读工具、外发审批和分享回执必须由系统实现。
最简单的检查方法是问:如果模型判断错了,哪一层还会拦住?如果答案仍是“模型会再检查一次”,这条边界还没有真正落地。
官方事实查看这一结论的依据与边界+
Anthropic 的可信 Agent 研究强调能力、边界与人工控制需要组合,不能依赖单一防线。
ANTrustworthy agents in practice官方研究 · 核验 2026-07-14用户只需要看到能核对的事实
运行中展示已读 7/10、正在找反例、引用了哪些原文、还缺什么材料;交付时展示草稿、引用检查结果和仍需人工判断的地方。
不需要展示模型的隐藏思维。用户能够暂停、拒绝外发、打开引用和接管任务,已经足以监督这次工作。
本站推演查看这一结论的依据与边界+
本站把模型、外围运行系统、工具、界面、结果检查和用户做成责任矩阵,是用于产品设计的教学推演。
OPRunning Codex safely at OpenAI官方工程文章 · 核验 2026-07-14有术语没听懂?在这里用人话再看一遍4 个词+
- Prompt / Instructions
- 提供给模型的行为说明与任务规则,能引导但不能当作不可绕过的技术边界。
- Permission
- 决定哪些资源和动作允许、需要询问或拒绝的强制策略。
- Sandbox
- 在操作系统或运行环境层限制进程能够访问的文件、网络和系统能力。
- Verifier
- 通过测试、业务回执、状态查询或规则检查,确认真实环境结果是否符合完成标准。