怎样用一份作品证明你会设计 Agent?
先把公开岗位要求逐条对应到作品:哪一项已经有任务、方案或运行记录支撑,哪一项还缺证据。
再补最关键的证据缺口,例如一次权限拒绝、失败恢复或重复运行结果,让核心判断都能被核对。
最后围绕同一个十份访谈产品准备 20 分钟答辩,讲清用户问题、系统取舍、运行证据和下一步。
沿用上一课作品包,把公开岗位要求逐条对到已有证据;缺少的补一条运行记录或 Eval。面试重点不是猜公司内部答案,而是展示可验证的产品判断。
先把岗位要求对到现有作品
建立三列表:公开岗位要求、作品里的证据、仍缺的证据。理解 Agent 架构对应六层图与任务 Trace;0–1 产品设计对应任务契约、PRD 和原型;评测能力对应十题 Eval 与发布门槛。
岗位页面没有公开的信息就写“未知”,不要猜内部模型、团队和路线图。你的作品证明能力,不冒充公司方案。
官方事实查看这一结论的依据与边界+
DeepSeek Agent Harness 招聘信息是本站结业能力标准的一手依据,但不披露其内部路线图。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14只补真正缺失的运行证据
检查作品里每个承诺是否都有证据:权限规则有拒绝记录,完成标准有 Verifier 结果,失败恢复有 Trace,版本判断有多次 Trial。缺哪一项只补哪一项。
如果现阶段无法运行真实模型,就如实使用教学假数据和浏览器 Mini Harness,并说明它只能证明产品逻辑,不能证明线上模型质量。
官方事实查看这一结论的依据与边界+
OpenAI 的 Harness Engineering 案例说明外围环境、文档、工具与反馈可以显著影响 Agent 在复杂任务中的有效性。
OPHarness engineering: agent-first world官方工程文章 · 核验 2026-07-14用 20 分钟讲清一次产品判断
建议节奏:3 分钟讲用户与任务,5 分钟讲 Agent 怎样工作,4 分钟讲权限和失败,4 分钟讲 Eval 与运行证据,2 分钟讲取舍,2 分钟留给追问。
准备三个追问:为什么不是固定 Workflow,为什么用户愿意托付,哪个证据会让你停止。回答仍回到同一作品,不临场堆新术语。
官方事实查看这一结论的依据与边界+
Anthropic 的 Agent Eval 方法支持用真实任务、重复 Trial 和分层评分建立质量证据。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14有术语没听懂?在这里用人话再看一遍3 个词+
- 岗位对照
- 把公开要求、作品证据和证据缺口逐条对应,不把课程完成等同于获得岗位。
- 运行证据
- 真实或明确标注为教学假数据的事件、文件、测试和 Eval 结果。
- 答辩
- 在有限时间内讲清用户问题、系统取舍、证据边界和会改变结论的信息。
本章依据与证据边界1 条补充结论 · 9 份原始材料+
下面补充本章的其他依据,并说明每份材料能证明什么、不能证明什么。
- [4]
本站的十份访谈作品、岗位对照表和 20 分钟答辩结构均为候选人教学推演,不代表 DeepSeek 计划。
本站推演DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14
查看全部一手材料与源码证据 9 条
这份材料展示 Compaction 仍不足以解决跨上下文长任务,并总结一次做太多、半成品难接续和过早宣布完成等失败模式。它用初始化环境、功能清单、进度文件、Git 历史、增量推进和端到端验证说明 Harness 如何把连续性写入环境。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方方法 · 核验 2026-07-23Demystifying evals for AI agentsAnthropic这份材料定义 Task、Trial、Grader、Transcript、Outcome、Evaluation Harness 与 Agent Harness,并强调评估 Agent 时实际评估的是模型与 Harness 的组合。它支持用多次 Trial、代码/模型/人工 Grader、Outcome 与轨迹联合评分,以及分别建设 Capability Eval 和 Regression Eval。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方方法 · 核验 2026-07-23Harness engineering: leveraging Codex in an agent-first worldOpenAI这份案例说明当 Agent 承担大量执行工作时,人类工作的重心会转向表达意图、设计环境、维护可读知识和建立反馈回路。它支持用仓库内版本化知识、机械化架构约束、测试、Lint 与可操作错误信息提升 Agent 的可读性、自治性和长期一致性。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。厂商研究 · 核验 2026-07-23Agentic coding and persistent returns to expertiseAnthropic这项 Anthropic 研究讨论不同经验水平开发者怎样使用 Claude Code,以及领域与工程经验为何仍会影响任务选择、监督、验证和最终产出。
证据边界:厂商研究不能单独证明所有用户、任务与组织都获得相同生产率收益。官方方法 · 核验 2026-07-23Harnessing Claude’s intelligenceClaude by Anthropic这份官方设计说明展示 Claude Code 团队如何把模型能力放进工具、上下文、权限与反馈环境,并把 Harness 视为随模型变化而持续调整的产品系统。
证据边界:它解释团队经验,不代表每个领域都应复制 Claude Code 的产品结构。官方产品实现 · 核验 2026-07-23A harness for every task: dynamic workflows in Claude CodeClaude by Anthropic这份材料说明 Claude Code 如何让用户为长程、并行、结构化或对抗任务编写动态 Harness,并以多个独立上下文完成分解、验证和汇总。
证据边界:动态工作流不是默认更优;协调、Token、延迟和错误传播仍需针对任务测量。官方岗位原文 · 核验 2026-07-23AI 产品经理(Agent Harness 产品方向)DeepSeek官方岗位原文要求路线图、真实任务与用户反馈、模型行为判断、Vibe Coding、UI/UX、Harness 技术原理、数据研究和模型与 Harness 共同进化。
证据边界:公开 JD 不披露 DeepSeek 内部路线图、面试题、组织分工或唯一合格答案。独立研究结论 · 核验 2026-07-14We are Changing our Developer Productivity Experiment DesignMETRMETR 说明后续实验受到参与者和任务选择效应影响,数据只能很弱地支持晚 2025 工具带来更大加速,无法可靠估计幅度。
证据边界:原始点估计和自报体验都不足以给出当前普遍提效比例。独立研究结论 · 核验 2026-07-14AI Agents That MatterPrinceton NLP论文指出只追准确率会忽略成本、复现性、下游适用性、留出集和基准过拟合,并提出联合优化准确率与成本。
证据边界:该框架本身不能替代具体产品的真实用户任务、风险与商业指标。