共 51 道题。答案默认隐藏;每一题都标注对应课程,展开后可看回答框架、追问、常见失分点和事实来源。
Harness 是模型与真实环境之间的运行与产品系统:它组装上下文、驱动 Agent Loop、执行工具、管理权限和状态,并把过程与结果交付给用户。
例如在“读取十份访谈并生成可回源报告”任务中,说明上下文、模型、工具、权限和验证器分别在何时接手。
具体模块名称和实现会随产品变化;回答要区分通用职责与某个产品的实现选择。
如果模型升级了,Harness 还需要改吗?
只说“套壳”或只罗列 Prompt、工具,忽略状态、权限和交付。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14Workflow 的路径由代码预先编排;Agent 由模型根据环境反馈动态决定过程。实际产品常把两者组合:用 Workflow 固定高风险边界,用 Agent 处理开放决策。
例如在“读取十份访谈并生成可回源报告”任务中,说明上下文、模型、工具、权限和验证器分别在何时接手。
具体模块名称和实现会随产品变化;回答要区分通用职责与某个产品的实现选择。
什么时候不应该做 Agent?
把所有自动化都叫 Agent,或认为 Agent 一定优于 Workflow。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANBuilding effective agents官方工程文章 · 核验 2026-07-14Harness 组装输入并调用模型;模型返回工具请求或最终回答;若请求工具,Harness 校验权限、执行并把 Observation 加回上下文,循环直到完成、失败、超限或等待用户。
例如在“读取十份访谈并生成可回源报告”任务中,说明上下文、模型、工具、权限和验证器分别在何时接手。
具体模块名称和实现会随产品变化;回答要区分通用职责与某个产品的实现选择。
怎样防止无限循环?
只背“思考—行动—观察”,没有权限、预算和终止状态。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
OPUnrolling the Codex agent loop官方工程文章 · 核验 2026-07-14Prompt Engineering 优化单次指令表达;Context Engineering 管理整个任务生命周期中哪些规则、历史、文件、工具和观察在何时进入模型输入。
例如在“读取十份访谈并生成可回源报告”任务中,说明上下文、模型、工具、权限和验证器分别在何时接手。
具体模块名称和实现会随产品变化;回答要区分通用职责与某个产品的实现选择。
如何评估一次上下文策略?
把 Context Engineering 说成“写更长的 Prompt”。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
OPHarness engineering: agent-first world官方工程文章 · 核验 2026-07-14不是。KV Cache 是模型推理计算层对已处理序列状态的缓存;Agent Memory 是产品/Harness 层选择、持久化并在未来取回的信息。
例如在“读取十份访谈并生成可回源报告”任务中,说明上下文、模型、工具、权限和验证器分别在何时接手。
具体模块名称和实现会随产品变化;回答要区分通用职责与某个产品的实现选择。
Context Window 又处在哪一层?
把所有“记住”都当作长期记忆。
支持 KV Cache 是推理层复用注意力 K/V 状态、减少重复计算的技术事实。
HUCaching · Transformers官方文档 · 核验 2026-07-14支持 Agent 产品会选择、持久化、加载和治理跨任务规则与记忆。
ANManage Claude's memory官方文档 · 核验 2026-07-14支持 Context Window、Prompt Caching 与 Harness 上下文管理属于不同责任。
OPUnrolling the Codex agent loop官方工程文章 · 核验 2026-07-14Skill 封装怎么做;MCP 标准化连接什么外部能力;Hook 保证在某个事件点确定性执行什么规则。
例如在“读取十份访谈并生成可回源报告”任务中,说明上下文、模型、工具、权限和验证器分别在何时接手。
具体模块名称和实现会随产品变化;回答要区分通用职责与某个产品的实现选择。
给一个三者组合使用的例子。
回答成三个同义的插件系统。
支持 Skill 以按需加载的说明、资料和脚本封装可复用做事方法。
ANExtend Claude with skills官方文档 · 核验 2026-07-14支持 MCP 的 Host—Client—Server 与 Tools、Resources、Prompts 连接模型和外部系统。
MOMCP architecture overview官方文档 · 核验 2026-07-14支持 Hook 在确定生命周期事件触发脚本或治理动作。
ANAutomate workflows with hooks官方文档 · 核验 2026-07-14因为不仅客户端会发任务,服务端也会在 Turn 中主动请求审批或补充输入,并持续推送工具、Diff 和进度事件。
例如在“读取十份访谈并生成可回源报告”任务中,说明上下文、模型、工具、权限和验证器分别在何时接手。
具体模块名称和实现会随产品变化;回答要区分通用职责与某个产品的实现选择。
断线重连后如何恢复一致状态?
把 Agent 当成普通 HTTP 问答接口。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14当子任务相互独立、上下文可以隔离、输出契约清晰且并行收益大于协调成本时。
例如在“读取十份访谈并生成可回源报告”任务中,说明上下文、模型、工具、权限和验证器分别在何时接手。
具体模块名称和实现会随产品变化;回答要区分通用职责与某个产品的实现选择。
主 Agent 应该如何解决子 Agent 结论冲突?
认为 Agent 越多效果必然越好。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANCreate custom subagents官方文档 · 核验 2026-07-14产品经理仍从用户问题和商业价值出发,但还要判断该用单次 AI、Workflow 还是 Agent,并把模型边界、工程边界、数据权限、评测和失败恢复写进产品。
例如把十份访谈的研究任务拆成目标、允许动作、人工确认点和可检查交付物,再说明为什么选择 Agent 或 Workflow。
Agent 不是默认答案。路径稳定、风险高或验收规则明确的步骤,通常应保留确定性流程。
Agent 产品经理与企业 AI 流程产品经理有哪些共同能力?
把 AI 产品经理缩减成会写 Prompt,或假设所有场景都应该 Agent 化。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14看任务是否有清晰价值和完成证据、路径是否开放、工具是否可用、错误是否可控,以及用户是否愿意托付。
例如把十份访谈的研究任务拆成目标、允许动作、人工确认点和可检查交付物,再说明为什么选择 Agent 或 Workflow。
Agent 不是默认答案。路径稳定、风险高或验收规则明确的步骤,通常应保留确定性流程。
请举一个不该 Agent 化的例子。
从技术炫酷出发,没有用户托付意愿。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANBuilding effective agents官方工程文章 · 核验 2026-07-14按动作风险、可逆性和用户意图置信度分层:低风险自动执行,中风险批量预览或阶段确认,高风险逐项审批。
例如把十份访谈的研究任务拆成目标、允许动作、人工确认点和可检查交付物,再说明为什么选择 Agent 或 Workflow。
Agent 不是默认答案。路径稳定、风险高或验收规则明确的步骤,通常应保留确定性流程。
如何衡量审批体验是否合理?
把控制权等同于审批弹窗数量。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
OPRunning Codex safely at OpenAI官方工程文章 · 核验 2026-07-14除结果外,还应交付关键动作、验证证据、变更影响、剩余不确定性与下一步,让用户能快速验收。
例如把十份访谈的研究任务拆成目标、允许动作、人工确认点和可检查交付物,再说明为什么选择 Agent 或 Workflow。
Agent 不是默认答案。路径稳定、风险高或验收规则明确的步骤,通常应保留确定性流程。
什么时候应该展示详细轨迹?
只返回“已完成”,不给验证证据。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14把任务拆为可验证阶段,外置状态、保存检查点,提供异步通知、预算控制、重连恢复与阶段纠偏。
例如把十份访谈的研究任务拆成目标、允许动作、人工确认点和可检查交付物,再说明为什么选择 Agent 或 Workflow。
Agent 不是默认答案。路径稳定、风险高或验收规则明确的步骤,通常应保留确定性流程。
用户离开后 Agent 遇到审批怎么办?
只加一个 Loading 页面。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14让用户知道记住了什么、来源是什么、何时生效,并能编辑、删除和设置范围;自动写入要谨慎且可追溯。
例如把十份访谈的研究任务拆成目标、允许动作、人工确认点和可检查交付物,再说明为什么选择 Agent 或 Workflow。
Agent 不是默认答案。路径稳定、风险高或验收规则明确的步骤,通常应保留确定性流程。
什么信息绝对不应该默认长期记忆?
只讨论数据库结构,不讨论信任和生命周期。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANManage Claude's memory官方文档 · 核验 2026-07-14先选一个高价值窄任务,例如“把十份访谈记录变成可回源的洞察”,定义输入、完成证据、来源引用和人工判断点,再决定工具与界面。
例如把十份访谈的研究任务拆成目标、允许动作、人工确认点和可检查交付物,再说明为什么选择 Agent 或 Workflow。
Agent 不是默认答案。路径稳定、风险高或验收规则明确的步骤,通常应保留确定性流程。
第一版你会明确不做什么?
一上来做万能研究平台。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANBuilding effective agents官方工程文章 · 核验 2026-07-14先用现有真实任务集回归,识别新增能力和新失败,再判断是移除旧脚手架、扩大任务边界还是改善控制体验,而非直接堆新功能。
例如把十份访谈的研究任务拆成目标、允许动作、人工确认点和可检查交付物,再说明为什么选择 Agent 或 Workflow。
Agent 不是默认答案。路径稳定、风险高或验收规则明确的步骤,通常应保留确定性流程。
哪些旧功能可能应该删除?
把模型发布等同于立即上线新入口。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
OPHarness engineering: agent-first world官方工程文章 · 核验 2026-07-14两者都要。最终状态决定有没有完成,执行轨迹决定是否安全、合规、高效、可恢复。
例如固定同一批访谈与环境,重复运行多次,同时检查引用覆盖、事实错误、人工介入、成本和最终文件。
一次成功、一个平均分或模型自评都不能代表稳定能力;必须限定任务、版本、环境和试验次数。
如果结果正确但过程越权,算成功吗?
只看最终文字相似度。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14先用 5 个高价值真实任务跑通环境重置、完成证据和评分方法,再扩到 10 个课程任务与 20 个结业任务;每题保存版本、黄金证据并重复运行建立基线。
例如固定同一批访谈与环境,重复运行多次,同时检查引用覆盖、事实错误、人工介入、成本和最终文件。
一次成功、一个平均分或模型自评都不能代表稳定能力;必须限定任务、版本、环境和试验次数。
测试集如何避免过拟合?
先追求上千条低质量数据。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14以特定场景中可验证的有效任务完成为核心,同时用人工介入、成本、延迟和风险作护栏。
例如固定同一批访谈与环境,重复运行多次,同时检查引用覆盖、事实错误、人工介入、成本和最终文件。
一次成功、一个平均分或模型自评都不能代表稳定能力;必须限定任务、版本、环境和试验次数。
消息数为什么通常不是好指标?
只给出“DAU”或“任务成功率”一个词。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14获取可复现任务和完整轨迹,找到首次偏离点,再按目标理解、上下文、计划、工具、权限、验证和交付分类。
例如固定同一批访谈与环境,重复运行多次,同时检查引用覆盖、事实错误、人工介入、成本和最终文件。
一次成功、一个平均分或模型自评都不能代表稳定能力;必须限定任务、版本、环境和试验次数。
没有完整轨迹时怎么办?
直接把反馈转给模型团队。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14先访谈明确“信任”的行为表现,再离线检查能力影响,最后灰度比较高风险任务中的继续率、纠偏率、返工和完成率。
例如固定同一批访谈与环境,重复运行多次,同时检查引用覆盖、事实错误、人工介入、成本和最终文件。
一次成功、一个平均分或模型自评都不能代表稳定能力;必须限定任务、版本、环境和试验次数。
什么结果会让你放弃方案?
只发满意度问卷。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANTrustworthy agents in practice官方研究 · 核验 2026-07-14固定模型无法做到时,至少固定任务、仓库、权限、完成标准和运行次数;分别记录成功、介入、时间、成本、恢复和交付体验,并区分模型与 Harness 差异。
例如固定同一批访谈与环境,重复运行多次,同时检查引用覆盖、事实错误、人工介入、成本和最终文件。
一次成功、一个平均分或模型自评都不能代表稳定能力;必须限定任务、版本、环境和试验次数。
模型不同导致的差异如何处理?
照着官网功能表打勾。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14Agent 默认只获得完成当前任务所需的最小资源和动作权限,随着明确需要与用户授权再逐步扩大。
例如内部保存可以自动执行,向外部发送报告必须暂停等待确认,并用审计记录证明实际发生了什么。
Prompt 约束不能代替权限、沙箱、审批和外部结果验证;高风险动作必须由工程机制兜底。
最小权限会不会伤害体验?
把最小权限理解为所有动作都弹窗。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANTrustworthy agents in practice官方研究 · 核验 2026-07-14合并同类低风险动作、记住有范围的授权、突出真正高风险节点,并用具体影响说明请求。
例如内部保存可以自动执行,向外部发送报告必须暂停等待确认,并用审计记录证明实际发生了什么。
Prompt 约束不能代替权限、沙箱、审批和外部结果验证;高风险动作必须由工程机制兜底。
哪些动作不能批量授权?
认为多弹窗天然更安全。
支持自主性需要与人类控制、风险和现实部署边界组合设计。
ANTrustworthy agents in practice官方研究 · 核验 2026-07-14支持按动作与环境组合 Sandbox、Approval、网络和审计,而非无差别弹窗。
OPRunning Codex safely at OpenAI官方工程文章 · 核验 2026-07-14把错误结构化返回 Agent,区分可重试、需换路径、需用户输入和不可恢复;限制重试并保留已有产物。
例如内部保存可以自动执行,向外部发送报告必须暂停等待确认,并用审计记录证明实际发生了什么。
Prompt 约束不能代替权限、沙箱、审批和外部结果验证;高风险动作必须由工程机制兜底。
重试策略如何设计?
无限重试或只显示“未知错误”。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANBuilding effective agents官方工程文章 · 核验 2026-07-14将外部内容视为不可信数据,隔离指令与资料,限制工具权限,对敏感动作要求明确授权,并检测内容试图改变系统目标。
例如内部保存可以自动执行,向外部发送报告必须暂停等待确认,并用审计记录证明实际发生了什么。
Prompt 约束不能代替权限、沙箱、审批和外部结果验证;高风险动作必须由工程机制兜底。
只靠模型识别注入够吗?
回答“加一条不要被攻击的 Prompt”。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANTrustworthy agents in practice官方研究 · 核验 2026-07-14先控制影响并保留审计轨迹,再定位原始意图、计划、工具参数、审批策略与界面表达的首次失效点;随后补回归任务和防护。
例如内部保存可以自动执行,向外部发送报告必须暂停等待确认,并用审计记录证明实际发生了什么。
Prompt 约束不能代替权限、沙箱、审批和外部结果验证;高风险动作必须由工程机制兜底。
产品上要增加哪三道防线?
只归咎用户或模型。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANTrustworthy agents in practice官方研究 · 核验 2026-07-14因为用户价值和产品差异发生在端到端执行轨迹中,功能存在不代表真实任务能可靠完成。
例如先读官方产品合同,再锁定源码版本,最后用同一任务运行,明确三类证据分别能证明什么。
官方文档证明产品承诺,固定源码证明某版实现,单次运行只证明该环境下发生过什么,三者不能互相替代。
如何选择第一个研究任务?
只罗列导航与功能入口。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14把“顺”“聪明”“可控”等感受拆成可观察事件和指标,提出可证伪假设,再通过重复任务、访谈或实验验证。
例如先读官方产品合同,再锁定源码版本,最后用同一任务运行,明确三类证据分别能证明什么。
官方文档证明产品承诺,固定源码证明某版实现,单次运行只证明该环境下发生过什么,三者不能互相替代。
给“更有信任感”设计三个观察指标。
用个人一次体验代表全部用户。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14先访谈最近真实工作而非想象功能,收集任务频率、价值、风险、完成证据与当前替代方案,再用低保真代理测试真实托付行为。
例如先读官方产品合同,再锁定源码版本,最后用同一任务运行,明确三类证据分别能证明什么。
官方文档证明产品承诺,固定源码证明某版实现,单次运行只证明该环境下发生过什么,三者不能互相替代。
问卷应该问什么、不问什么?
直接问“你想要一个什么 Agent”。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANTrustworthy agents in practice官方研究 · 核验 2026-07-14先用真实任务建立模型边界与工程边界的共同语言,再掌握任务定义、Agent Loop、Context、Tool Use 与 Eval;不要先陷入模型名词或功能追新。
例如用一条真实工作任务连续练习六周,每周留下任务定义、运行轨迹、失败复盘和改进后的作品。
目标不是替代工程师,而是能理解接口、日志、权限、失败状态和验收证据,并与工程共同做取舍。
一个月学习计划怎么排?
只收藏资讯、背术语或追逐最新模型。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14目标不是替代工程师,而是能读懂系统边界、调用 API、处理数据、看懂日志与事件、做原型、验证假设,并知道哪些承诺必须由工程机制保证。
例如用一条真实工作任务连续练习六周,每周留下任务定义、运行轨迹、失败复盘和改进后的作品。
目标不是替代工程师,而是能理解接口、日志、权限、失败状态和验收证据,并与工程共同做取舍。
如何证明自己的动手能力?
回答“现在 AI 会写代码,所以不需要懂”。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14通过同任务重复测试、跨模型或跨 Harness 对比、保存失败轨迹和定义质量层级,逐渐形成能被别人复核的判断标准。
例如用一条真实工作任务连续练习六周,每周留下任务定义、运行轨迹、失败复盘和改进后的作品。
目标不是替代工程师,而是能理解接口、日志、权限、失败状态和验收证据,并与工程共同做取舍。
请举一个你形成判断标准的例子。
用产品名和使用时长代替具体判断。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14用四类作品代替空泛热情:真实任务轨迹研究、Agent 评测集、Harness PRD 与可运行原型,并清楚讲出失败、边界和迭代。
例如用一条真实工作任务连续练习六周,每周留下任务定义、运行轨迹、失败复盘和改进后的作品。
目标不是替代工程师,而是能理解接口、日志、权限、失败状态和验收证据,并与工程共同做取舍。
面试时如何讲这个项目?
只说自己每天使用很多 AI 工具。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14先以真实高价值任务建立能力与体验基线,再围绕任务深度、可靠性、扩展生态和反馈闭环设目标,按内部 dogfood—开发者—更广用户渐进发布。
例如把十份访谈研究 Agent 讲成候选人方案:每个判断都对应公开岗位要求或作品证据,未知信息明确标注。
公开招聘信息只能校准能力方向,不能推出内部组织分工、真实面试题或唯一正确方案。
你会明确砍掉哪类需求?
从功能脑暴开始,没有任务基线与取舍。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14把真实任务的结果、轨迹和人工反馈结构化归因:模型问题进入训练与模型评测,Harness 问题进入上下文、工具、策略和交互迭代,再用同一任务集验证组合收益。
例如把十份访谈研究 Agent 讲成候选人方案:每个判断都对应公开岗位要求或作品证据,未知信息明确标注。
公开招聘信息只能校准能力方向,不能推出内部组织分工、真实面试题或唯一正确方案。
怎样避免两个团队互相甩锅?
只说“加强沟通”,没有共同数据和评测。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14先不凭 6 个百分点做决定。我会确认任务、环境和版本可比,用同一任务做配对且多次 Trial,报告提升的不确定性与分场景结果;再检查安全、成本、延迟等硬门槛。只有提升既可信、对关键用户有意义、护栏也通过,才进入灰度而不是直接全量。
例如固定同一批访谈与环境,重复运行多次,同时检查引用覆盖、事实错误、人工介入、成本和最终文件。
一次成功、一个平均分或模型自评都不能代表稳定能力;必须限定任务、版本、环境和试验次数。
如果预算只允许每道任务运行一次,你会怎样提高结论可信度?
只报一个平均成功率或 p 值,不说明样本、随机性、任务分布、实际收益与安全护栏。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14我会把黑盒等待改成可控制的任务状态:先重述目标和完成证据,再显示当前里程碑、已产生的可验收结果、阻塞与审批;用户随时能暂停、纠偏、缩小范围或恢复。过程采用渐进披露,展示动作与证据,不直接倾倒内部思维链。
例如把十份访谈的研究任务拆成目标、允许动作、人工确认点和可检查交付物,再说明为什么选择 Agent 或 Workflow。
Agent 不是默认答案。路径稳定、风险高或验收规则明确的步骤,通常应保留确定性流程。
哪些执行过程应该展示,哪些信息反而不应该直接暴露给用户?
把体验改进等同于增加动画,或把模型内部思维链当成透明度,仍不给控制权和完成证据。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14先把争论统一到同一用户任务和发布门槛:研究负责要验证的能力假设,工程定义稳定性与回滚硬约束,设计定义用户控制与体验指标。我会用窄范围原型和共同 Eval 产出证据,在可逆灰度里试验;未过安全门槛不发布,未产生用户收益也不为技术新颖性上线。
例如把十份访谈研究 Agent 讲成候选人方案:每个判断都对应公开岗位要求或作品证据,未知信息明确标注。
公开招聘信息只能校准能力方向,不能推出内部组织分工、真实面试题或唯一正确方案。
当三方仍不能达成一致,而窗口期只剩两周,你如何做最终决定?
只说“拉齐共识、加强沟通”,没有共同任务、量化门槛、责任人、期限和升级机制。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14不按声音大小排需求。我会先确认是谁、在哪个真实任务的哪一步受阻,把帖子、工单、访谈与失败 Trace 对齐;再看目标用户覆盖、问题频率、价值、风险和现有替代方案,并主动抽样沉默用户。最终把社区信号写成可证伪假设,用原型或灰度验证真实采用与任务收益。
例如先读官方产品合同,再锁定源码版本,最后用同一任务运行,明确三类证据分别能证明什么。
官方文档证明产品承诺,固定源码证明某版实现,单次运行只证明该环境下发生过什么,三者不能互相替代。
当社区呼声很高,但行为数据几乎没有使用意愿时,你更相信哪一个?
统计点赞数就进路线图,或反过来只信埋点而忽略新需求尚无入口可用。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14先按不可逆性和影响上限处置误删:立即收紧或关闭删除能力、保全审计证据、确认受影响范围并提供恢复与沟通;同时让独立负责人分析延迟,但不让高频体验投诉挤掉安全止血。完成根因修复、回归任务和分级发布后,才恢复高风险动作。
例如内部保存可以自动执行,向外部发送报告必须暂停等待确认,并用审计记录证明实际发生了什么。
Prompt 约束不能代替权限、沙箱、审批和外部结果验证;高风险动作必须由工程机制兜底。
如果误删暂时无法稳定复现,你会在什么条件下重新开放删除能力?
只按反馈量排序,或急着找责任团队,没有先止血、恢复用户、保留证据和设置重新开放门槛。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
OPRunning Codex safely at OpenAI官方工程文章 · 核验 2026-07-14把账算到“每个可验证成功任务”,而不是每次调用:按任务价值和难度比较成功率、人工节省、p50/p95 延迟、Token、工具调用与总成本。高价值难任务可以接受更高预算,低价值高频任务必须有严格上限;再用上下文裁剪、缓存、模型路由、并行和重试策略寻找不牺牲质量的改进。
例如固定同一批访谈与环境,重复运行多次,同时检查引用覆盖、事实错误、人工介入、成本和最终文件。
一次成功、一个平均分或模型自评都不能代表稳定能力;必须限定任务、版本、环境和试验次数。
如果高价值用户愿意等,但新用户会因首轮延迟流失,你会怎样设计产品策略?
只说换便宜模型或压缩 Prompt,不看每个有效任务的价值、长尾延迟、失败重试和质量损失。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14我会先用一分钟定义用户任务、非目标和验收证据,再画出 Model—Harness—Tool—Environment 边界;随后沿一次真实 Trace 打开最关键模块,解释输入、状态变化、输出、失败与测试。最后说明哪些代码由我判断并验证、放弃过什么方案,以及下一版会用什么 Eval 决定。
例如用一条真实工作任务连续练习六周,每周留下任务定义、运行轨迹、失败复盘和改进后的作品。
目标不是替代工程师,而是能理解接口、日志、权限、失败状态和验收证据,并与工程共同做取舍。
如果暂时拿掉模型,这个项目还有哪些行为是代码确定性保证的?
只展示漂亮界面或代码行数,讲不清用户结果、自己做的判断、失败边界和验证证据。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
OPHarness engineering: agent-first world官方工程文章 · 核验 2026-07-14Auto Mode 在工具执行前用分类器判断风险,安全动作继续、风险动作阻止或升级;跳过权限则绕开检查。分类器仍可能误放行或误拦截,所以两者风险不同,但 Auto Mode 也不能替代隔离环境、最小权限、凭证边界与审计。
例如内部保存可以自动执行,向外部发送报告必须暂停等待确认,并用审计记录证明实际发生了什么。
Prompt 约束不能代替权限、沙箱、审批和外部结果验证;高风险动作必须由工程机制兜底。
如果 Auto Mode 经常误拦正常命令,你会怎样优化体验而不降低安全底线?
只说 Auto Mode 更安全,或把它等同于无人值守的绝对安全。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
CLAuto mode for Claude Code官方工程文章 · 核验 2026-07-14先把主张拆成可观察机制:它是否复盘 Session、写入有来源的 Memory、修改可审计的 Skill,并在后续固定任务中带来可重复收益;同时检查审批、版本、回滚和副作用。除非存在训练流程与权重证据,不能把这些 Harness 更新说成模型权重自我训练。
例如在“读取十份访谈并生成可回源报告”任务中,说明上下文、模型、工具、权限和验证器分别在何时接手。
具体模块名称和实现会随产品变化;回答要区分通用职责与某个产品的实现选择。
若后续表现变好,但无法定位是哪条 Memory 或 Skill 造成的,你会怎么处理?
把会话历史、记忆、上下文压缩和模型训练混成一个“越用越聪明”。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
NOHermes Agent sessions官方源码 · 核验 2026-07-14Session History 是完整工作记录;Session Search 按需找过去原话;Memory 保存少量跨任务信息;Compaction 压缩当前上下文以便继续;Prompt/KV Cache 复用模型计算。它们的容量、生命周期、真实性和治理责任都不同。
例如在“读取十份访谈并生成可回源报告”任务中,说明上下文、模型、工具、权限和验证器分别在何时接手。
具体模块名称和实现会随产品变化;回答要区分通用职责与某个产品的实现选择。
为什么把全部聊天历史塞进上下文不是一个可持续的 Memory 方案?
把所有带“记住”效果的机制当成同一个数据库功能。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
NOHermes Agent sessions官方源码 · 核验 2026-07-14应通过原任务集验证并删除已经妨碍模型的过度分解、重复提示和冗余评审;但身份、凭证、权限、沙箱、状态持久化、事件、恢复、验证和审计仍是生产系统责任,不会因为模型更聪明自动消失。
例如在“读取十份访谈并生成可回源报告”任务中,说明上下文、模型、工具、权限和验证器分别在何时接手。
具体模块名称和实现会随产品变化;回答要区分通用职责与某个产品的实现选择。
你会先删哪一类旧脚手架?如何证明删除没有造成回归?
回答成“模型越强,Harness 越不重要”或反过来永远保留所有旧规则。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
CLHarnessing Claude’s intelligence官方工程文章 · 核验 2026-07-14只有当上下文需要隔离、子任务真正可并行或专业化明显降低错误时才优先考虑。用相同任务比较单/多 Agent 的质量、墙钟时间、总 Token、工具冲突、汇总成本和错误传播;串行依赖强时,多 Agent 可能更差。
例如在“读取十份访谈并生成可回源报告”任务中,说明上下文、模型、工具、权限和验证器分别在何时接手。
具体模块名称和实现会随产品变化;回答要区分通用职责与某个产品的实现选择。
如果墙钟时间下降 30%,但总 Token 增加五倍,你会采用吗?
把更多 Agent 当作能力升级,不做单 Agent 基线和协调成本实验。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
GOTowards a science of scaling agent systems官方研究 · 核验 2026-07-14先把厂商数字当待验证假设,固定目标用户、任务、版本与基线;同时测完成质量、返工、人工介入、周期、成本和风险,并做分层与长期观察。相反研究不用于否定一切,而用于检查样本、工具、任务和选择偏差,决定结论能外推多远。
例如固定同一批访谈与环境,重复运行多次,同时检查引用覆盖、事实错误、人工介入、成本和最终文件。
一次成功、一个平均分或模型自评都不能代表稳定能力;必须限定任务、版本、环境和试验次数。
METR 与 Microsoft 的研究方向不同,你会怎样向管理层解释而不简单选边?
直接引用“10x”或一个平均百分比,没有任务、样本、基线、成本和反证边界。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
MEMeasuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity论文 / 基准 · 核验 2026-07-14MCP 标准化 Host、Client、Server 如何发现和调用 Tools、Resources、Prompts;授权信任决定谁代表谁行动、令牌能用于哪个资源、Server 能看到什么数据以及如何撤销。协议连通不等于 Server 可信或工具安全。
例如内部保存可以自动执行,向外部发送报告必须暂停等待确认,并用审计记录证明实际发生了什么。
Prompt 约束不能代替权限、沙箱、审批和外部结果验证;高风险动作必须由工程机制兜底。
企业引入第三方 MCP Server 前,你会要求哪五项安全验收?
只背 Host—Client—Server 架构,或把支持 MCP 当成完成了企业安全设计。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
MOMCP Security Best Practices官方文档 · 核验 2026-07-14先保存岗位 ID、核验日期与短句原文信号,再单独写本站解释、课程内容和作品证据。原文能证明公开岗位期望,不能证明内部组织、路线图或面试评分表;课程目标必须允许读者回源并看见解释边界。
例如把十份访谈研究 Agent 讲成候选人方案:每个判断都对应公开岗位要求或作品证据,未知信息明确标注。
公开招聘信息只能校准能力方向,不能推出内部组织分工、真实面试题或唯一正确方案。
如果岗位页下线,你怎样维护这套对齐标准?
把招聘摘要、社区转述或本站能力框架当成 DeepSeek 官方面试答案。
支持这道题中的核心事实与产品案例;回答的组织方式与取舍顺序是教学建议,不是来源原话。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14