怎样写一份工程师能实现的 Agent 方案?
Agent 产品 PRD 必须把任务结果、工具与权限、运行状态、失败恢复和评测证据写进同一份可实现合同。
Agent PRD 要把不确定性和真实环境写进产品。它需要说明谁接收任务、谁判断下一步、谁采取行动、谁拦截风险、谁保存进度,以及谁根据外部证据验收结果。
一句“上传资料,AI 自动总结,准确率 95%”无法指导实现。研发不知道读哪些资料、工具怎样返回,设计不知道审批和失败怎么呈现,测试不知道 95% 的任务分布和评分器。
一份可实施的方案要说清用户为什么需要它、第一版做到哪里、正常和失败时用户会看到什么,以及用什么结果判断做成了。
完成后,你会得到结业作品的主体。岗位要求对照、证据缺口和 20 分钟答辩将在下一课补进同一份作品。
不要承诺一条固定流程,而要定义任务契约、可用环境、策略边界、事件状态、人工控制点、成功证据和失败处理。把不确定性写进产品,而不是留给开发猜。
第一部分:用户任务与 MVP 楔子
写清目标用户、真实替代方案、任务频率、价值、风险和完成证据。第一版选择一个窄而完整的任务,例如“把十份访谈变成逐条可回源的洞察”;万能研究平台,留给第十个版本再说。
非目标必须具体:不自动向外发送、不读取未授权目录、不代替产品负责人做路线图决策。边界让团队能够建立真实任务集。
官方事实查看这一结论的依据与边界+
DeepSeek Agent Harness 招聘信息被用于校验 PRD 是否同时连接用户、工程、研究和长期产品演进。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14第二部分:谁接收、判断、行动和验收
沿一次真实任务回答六个问题:谁接收用户目标和材料,谁判断下一步,谁读取或修改外部系统,谁在越界前拦截,谁保存进度与证据,谁确认任务真正完成。
每次行动都写清输入、输出、失败后交给谁,以及用户能看到什么。这样工程师可以分工,设计师可以画状态,测试也知道从哪里核对。
官方事实查看这一结论的依据与边界+
OpenAI App Server 提供了线程、事件、审批和多客户端协议的 Codex 产品案例。
OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14第三部分:状态与交互验收
正常流程不足以验收 Agent。状态矩阵至少覆盖启动、计划、执行、等待审批、工具失败、权限拒绝、上下文超限、取消、部分完成、恢复和最终交付。
每个状态写用户看到什么、能做什么、系统保存什么、下一状态如何触发。原型要让用户真正暂停、纠偏、拒绝和复核;只画 Happy Path 的原型,验收不了 Agent。
官方事实查看这一结论的依据与边界+
Anthropic Agent Eval 方法支持用任务、重复 Trial、Outcome 和 Grader 定义质量与回归。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14第四部分:怎样从测试走到上线
先让同一组真实任务重复运行,确认结果不是偶然;再让内部用户试用,观察他们在哪里接管或返工;通过后才向少量真实用户开放。
灰度前写清哪些结果允许扩大范围,哪些风险必须暂停,以及怎样退回上一个稳定版本。模型或系统升级后,用同一组任务重新检查。
本站推演查看这一结论的依据与边界+
本站 PRD 四部分、状态矩阵和六件套是综合教学模板,不是 DeepSeek、OpenAI 或 Anthropic 的官方 PRD 格式。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14有术语没听懂?在这里用人话再看一遍6 个词+
- Agent PRD
- 同时定义用户任务、概率性系统边界、交互状态、风险、Eval 与发布的产品需求文件。
- MVP 楔子
- 第一版选择的窄而完整、能建立真实价值和反馈闭环的任务入口。
- 非目标
- 当前版本明确不解决或不允许执行的范围。
- 状态矩阵
- 逐状态说明触发、系统行为、用户能力、产物和下一步的验收表。
- 上线 Gate
- 进入下一发布阶段前必须通过的能力、安全、成本和体验门槛。
- Kill Criteria
- 出现哪些证据时应停止、缩小或放弃当前方案。
本章依据与证据边界15 份原始材料+
下面补充本章的其他依据,并说明每份材料能证明什么、不能证明什么。
查看全部一手材料与源码证据 15 条
这份材料区分了由预定义代码路径控制的 Workflow 与由模型动态控制过程的 Agent,并强调先采用能工作的最简单方案。它还给出 Prompt Chaining、Routing、Parallelization、Orchestrator-Workers、Evaluator-Optimizer 等组合模式,以及何时值得承担 Agent 的延迟、成本和复合错误。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方方法 · 核验 2026-07-23Writing effective tools for AI agents - with AI agentsAnthropic这份材料把工具定义为确定性系统与非确定性 Agent 之间的合同,说明工具名称、参数、描述、错误反馈和返回内容都会改变模型行为。它支持用真实任务和留出集评测工具,并强调更少重叠、边界清晰、返回高信号且 Token 高效的工具通常更可靠。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方方法 · 核验 2026-07-23Effective context engineering for AI agentsAnthropic这份材料将 Context Engineering 定义为持续选择和维护推理时最合适的信息,而不只是改写一条 Prompt。它支持最小高信号上下文、按需检索、工具结果压缩、结构化笔记、Compaction 与 Subagent 隔离等长任务策略。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-23Configure permissionsAnthropic这份文档说明 Claude Code 如何以 allow、ask、deny 规则和不同 Permission Mode 控制工具、命令、路径与外部访问,并明确 deny 优先于 ask 和 allow。它也说明权限由客户端执行而不是依赖模型遵守,以及权限、Hook、工作目录与 Sandbox 如何组合形成纵深防御。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方方法 · 核验 2026-07-23Effective harnesses for long-running agentsAnthropic这份材料展示 Compaction 仍不足以解决跨上下文长任务,并总结一次做太多、半成品难接续和过早宣布完成等失败模式。它用初始化环境、功能清单、进度文件、Git 历史、增量推进和端到端验证说明 Harness 如何把连续性写入环境。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方方法 · 核验 2026-07-23Demystifying evals for AI agentsAnthropic这份材料定义 Task、Trial、Grader、Transcript、Outcome、Evaluation Harness 与 Agent Harness,并强调评估 Agent 时实际评估的是模型与 Harness 的组合。它支持用多次 Trial、代码/模型/人工 Grader、Outcome 与轨迹联合评分,以及分别建设 Capability Eval 和 Regression Eval。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方方法 · 核验 2026-07-23A practical guide to building agentsOpenAI这份指南面向产品与工程团队,给出 Agent 使用场景判断、Model/Tools/Instructions 基础结构、单 Agent 与多 Agent 编排和 Guardrail 设计。它支持从复杂决策、难维护规则和非结构化信息出发选择场景,并强调先强化单 Agent、从小范围真实用户验证开始。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-23Unlocking the Codex harness: how we built the App ServerOpenAI这份材料说明 Codex App Server 如何以双向 JSON-RPC/JSONL 协议把同一 Harness 暴露给 CLI、IDE、桌面与 Web 客户端。它定义 Thread、Turn、Item 及流式事件、审批暂停、持久化和重连语义,是课程讲解 Agent 客户端协议与多端复用的直接实现依据。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方方法 · 核验 2026-07-23Harness engineering: leveraging Codex in an agent-first worldOpenAI这份案例说明当 Agent 承担大量执行工作时,人类工作的重心会转向表达意图、设计环境、维护可读知识和建立反馈回路。它支持用仓库内版本化知识、机械化架构约束、测试、Lint 与可操作错误信息提升 Agent 的可读性、自治性和长期一致性。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-23Running Codex safely at OpenAIOpenAI这份材料展示 OpenAI 在真实内部工作流中如何组合 Sandbox、Approval、网络策略、身份凭证、规则和管理员强制配置。它也说明 Agent 原生遥测如何记录用户意图、审批、工具、MCP 与网络决策,让安全团队能够审计发生了什么以及为什么发生。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。固定提交源码 · 核验 2026-07-23Hermes Agent budget, completion and cleanup finalizationNous Research这段固定提交源码定义 Turn 结束时的预算耗尽、回退与完成判定,并把轨迹保存、资源清理和清理错误纳入统一关账。它支持课程把 completed 视为需要系统证据与退出处理的状态,而不是模型的一句话。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent durable session finalizationNous Research这段固定提交源码在 Turn 结束时修复未闭合的工具消息序列,并把最终消息和会话状态持久化;持久化失败会作为清理错误保留,而不是静默伪装成完整成功。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent async delegation and turn finalizationNous Research这段源码说明后台 Subagent 的完成结果进入共享队列,并在 Agent 空闲时形成新的 Turn,而不是插进正在进行的工具序列;这样可以保持消息角色顺序与 Prompt Cache 稳定。这是 Hermes 的实现选择,不是行业统一协议。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。官方产品实现 · 核验 2026-07-23The evolution of agentic surfaces: building with Claude Managed AgentsClaude by Anthropic这份官方材料定义 Agent、Environment 与 Session 三类生产资源,并说明 Brain/Hands 分离、持久事件、凭证代理、可恢复状态和自托管执行环境。
证据边界:官方自测延迟和客户案例不能直接外推为所有 Agent 产品的 ROI。官方岗位原文 · 核验 2026-07-23AI 产品经理(Agent Harness 产品方向)DeepSeek官方岗位原文要求路线图、真实任务与用户反馈、模型行为判断、Vibe Coding、UI/UX、Harness 技术原理、数据研究和模型与 Harness 共同进化。
证据边界:公开 JD 不披露 DeepSeek 内部路线图、面试题、组织分工或唯一合格答案。