同一个任务做十次,怎样才算可靠?
Agent 评测不是给一段回答打分,而是让同一任务重复运行,再同时检查真实结果、行动轨迹、成本、风险与体验。
先记住五个词:Task 是题目;Trial 是独立做一次;Trace 是这次做过什么;Outcome 是真实结果;Grader 是按标准检查结果的人或程序。
例如同一个“十份访谈生成可回源洞察”任务独立跑三次。每次都从相同材料和权限开始,保存过程,最后检查引用、反例、原文保护和草稿文件。这样才能看出稳定性。
复杂统计、排行榜和模型评分器校准放在可选深挖。主线先学会用少量真实任务、清楚标准和重复运行做一次可信版本判断。
Task 是题目,Trial 是独立做一次,Trace 是做过什么,Outcome 是真实结果,Grader 是按标准检查。对同一个十份访谈任务跑三次,才能区分偶尔成功和稳定完成。
为什么一次成功不能证明 Agent 可靠?
一次独立试跑(Trial)同时产生可观察轨迹(Trace)和真实结果(Outcome);把同一任务(Task)从干净环境重复运行,才能看见稳定性、失败类型、成本与风险。
目标、资料版本、权限、工具、完成证据
工具、审批、错误、成本、首次偏离点
文件、测试、引用、业务状态与副作用
能力报告(Capability)/ 回归发布门槛(Regression)
先把五个词放进同一条运行记录
Task 写清十份材料、授权范围和完成标准;Trial 从干净环境独立运行一次;Trace 保存读取、引用、审批和失败;Outcome 是实际草稿和文件状态;Grader 对照规则判定。
五个词分别回答:测什么、跑哪一次、发生了什么、现实中留下什么、按什么判对错。不要把它们压成一个“准确率”。
官方事实查看这一结论的依据与边界+
Anthropic 的 Agent Eval 方法强调从代表真实使用的任务开始,并为任务准备可验证结果、参考证据与正反样本。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14先用五道最重要的题
题 1 检查每条洞察能否回到真实引用;题 2 检查来源冲突时是否保留冲突;题 3 检查未授权原文是否始终未读;题 4 检查工具失败后是否诚实降级;题 5 检查材料不足时是否停止编造。
每题固定 corpus 版本、权限和通过标准。先把五题跑通,再扩到本课提供的十题标准案例。
官方事实查看这一结论的依据与边界+
Anthropic 的 Agent Eval 文章区分 Task、Trial、Transcript 与 Outcome;本站将可观察过程统一称为 Trace,并通过重复运行观察非确定性。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14能机器检查的,不交给感觉
引用是否存在、10/10 是否处理、原文是否越权、草稿是否保存,都由代码或真实状态检查。洞察是否有价值、反例是否充分,再交给清楚 Rubric 和人工抽样。
Grader 不要求模型走唯一固定路径。只要结果达标、过程没有越权,新路径可以被接受。
官方事实查看这一结论的依据与边界+
Anthropic 建议按结果类型组合代码、模型与人工 Grader,并用人工样本校准模型评分器。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14版本判断看三次运行和失败分布
同一题至少跑三次,保留全部成功和失败。权限越界、错误引用和“证据不足仍下结论”属于阻断项,只要出现一次就不能发布。
报告写清模型、Harness、工具和 corpus 版本。可选深挖再学习 Capability、Regression、pass@k、评分器校准和公开基准边界;这些概念不能替代最小 Eval。
本站推演查看这一结论的依据与边界+
本站用三次运行和阻断项组织最小发布判断,是将公开评测方法翻译成产品教学的做法。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14有术语没听懂?在这里用人话再看一遍6 个词+
- Task
- 包含目标、环境、工具、完成证据和约束的一道 Agent 评测任务。
- Trial
- 同一 Task 的一次独立运行。
- Trace
- Trial 中可观察的模型输出、工具、状态、审批与结果记录;官方资料也可能使用 Transcript 或 Trajectory。
- Outcome
- 运行结束后环境中的真实结果,而不是 Agent 自己说完成。
- Grader
- 用代码、状态、模型或人工对 Outcome 与关键轨迹进行评分的检查器。
- Eval Harness
- 负责重置环境、运行多次 Trial、记录版本并汇总评分的评测系统。
本章依据与证据边界3 条补充结论 · 18 份原始材料+
下面补充本章的其他依据,并说明每份材料能证明什么、不能证明什么。
- [5]
公开的 Agent 基准最佳实践强调任务有效性、评分器漏洞、复现性、版本与外部有效性;这些进阶问题在本课可选深挖中保留。
独立研究ZHEstablishing Best Practices for Building Rigorous Agentic Benchmarks论文 / 基准 · 核验 2026-07-14 - [6]
AI Agents That Matter 提醒评测同时报告成本、可复现性并警惕基准过拟合;其结论同样受研究样本与时间限制。
独立研究KAAI Agents That Matter论文 / 基准 · 核验 2026-07-14 - [7]
SWE-bench 是使用真实 GitHub Issue 与代码仓库评测软件工程能力的公开基准案例。
独立研究PRSWE-bench: Can Language Models Resolve GitHub Issues?论文 / 基准 · 核验 2026-07-14
查看全部一手材料与源码证据 18 条
这份材料把工具定义为确定性系统与非确定性 Agent 之间的合同,说明工具名称、参数、描述、错误反馈和返回内容都会改变模型行为。它支持用真实任务和留出集评测工具,并强调更少重叠、边界清晰、返回高信号且 Token 高效的工具通常更可靠。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-23Create custom subagentsAnthropic这份文档说明 Subagent 使用独立上下文完成委派任务并向主会话返回摘要,可分别配置模型、工具、权限、Skill、MCP、Memory、Hook 与 Worktree 隔离。它支持把 Subagent 的价值定位为上下文隔离、并行和专业化,而不是把增加 Agent 数量等同于自动提升结果质量。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方方法 · 核验 2026-07-23Effective harnesses for long-running agentsAnthropic这份材料展示 Compaction 仍不足以解决跨上下文长任务,并总结一次做太多、半成品难接续和过早宣布完成等失败模式。它用初始化环境、功能清单、进度文件、Git 历史、增量推进和端到端验证说明 Harness 如何把连续性写入环境。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方方法 · 核验 2026-07-23Demystifying evals for AI agentsAnthropic这份材料定义 Task、Trial、Grader、Transcript、Outcome、Evaluation Harness 与 Agent Harness,并强调评估 Agent 时实际评估的是模型与 Harness 的组合。它支持用多次 Trial、代码/模型/人工 Grader、Outcome 与轨迹联合评分,以及分别建设 Capability Eval 和 Regression Eval。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方方法 · 核验 2026-07-23Harness engineering: leveraging Codex in an agent-first worldOpenAI这份案例说明当 Agent 承担大量执行工作时,人类工作的重心会转向表达意图、设计环境、维护可读知识和建立反馈回路。它支持用仓库内版本化知识、机械化架构约束、测试、Lint 与可操作错误信息提升 Agent 的可读性、自治性和长期一致性。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-11Tracing - OpenAI Agents SDKOpenAI Agents SDK这份文档定义 Trace 与 Span,并说明 Agents SDK 默认记录 Agent 运行、模型生成、工具调用、Handoff、Guardrail 和自定义事件。它支持课程把轨迹观测落到可实现的数据结构,同时提醒默认 Trace 可能包含模型及工具输入输出等敏感数据,需要显式配置采集与导出策略。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。固定提交源码 · 核验 2026-07-23Grok Build session orchestration loop(固定提交)xAI该文件展示 Session Actor 怎样统一接收命令、模型 Turn 完成、工具与 MCP 事件、会话状态和停止事件,再启动下一段工作或进入 Idle;它证明生产 Loop 还要管理并发事件、生命周期与恢复,而不是只有“模型想一步、工具做一步”。
证据边界:单个调度文件不能证明完整 Prompt 组装、全部工具执行、最终终止条件或线上任务可靠性;这些结论仍需结合相邻模块与运行证据。固定提交源码 · 核验 2026-07-23Hermes Agent tool-call validation and recoveryNous Research这段固定提交源码展示 Hermes 如何检查工具名和 JSON 参数、限制委派数量、去重调用,并用结构化工具结果把可恢复错误送回下一轮。它直接证明生产级 Agent Loop 在模型输出与真实动作之间还需要确定性处理。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent budget, completion and cleanup finalizationNous Research这段固定提交源码定义 Turn 结束时的预算耗尽、回退与完成判定,并把轨迹保存、资源清理和清理错误纳入统一关账。它支持课程把 completed 视为需要系统证据与退出处理的状态,而不是模型的一句话。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent durable session finalizationNous Research这段固定提交源码在 Turn 结束时修复未闭合的工具消息序列,并把最终消息和会话状态持久化;持久化失败会作为清理错误保留,而不是静默伪装成完整成功。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。官方产品实现 · 核验 2026-07-23How we built our multi-agent research systemAnthropic这份生产案例披露 Orchestrator-Worker、独立上下文、并行搜索、恢复与评测方法,也明确多 Agent 的高 Token 成本和对串行、强共享上下文任务的限制。
证据边界:内部研究 Eval 的提升不能证明多 Agent 对所有任务都优于单 Agent。官方产品实现 · 核验 2026-07-23A harness for every task: dynamic workflows in Claude CodeClaude by Anthropic这份材料说明 Claude Code 如何让用户为长程、并行、结构化或对抗任务编写动态 Harness,并以多个独立上下文完成分解、验证和汇总。
证据边界:动态工作流不是默认更优;协调、Token、延迟和错误传播仍需针对任务测量。官方岗位原文 · 核验 2026-07-23AI 产品经理(Agent Harness 产品方向)DeepSeek官方岗位原文要求路线图、真实任务与用户反馈、模型行为判断、Vibe Coding、UI/UX、Harness 技术原理、数据研究和模型与 Harness 共同进化。
证据边界:公开 JD 不披露 DeepSeek 内部路线图、面试题、组织分工或唯一合格答案。独立研究结论 · 核验 2026-07-14Towards a Science of Scaling Agent SystemsGoogle Research受控实验表明多 Agent 在可分解并行任务上可能显著提升,在严格串行任务上可能下降 39%–70%,工具密集任务还会承担额外协调成本。
证据边界:论文仍受基准、模型、配置和版本限制,不能当作所有生产任务的固定公式。独立研究结论 · 核验 2026-07-14AI Agents That MatterPrinceton NLP论文指出只追准确率会忽略成本、复现性、下游适用性、留出集和基准过拟合,并提出联合优化准确率与成本。
证据边界:该框架本身不能替代具体产品的真实用户任务、风险与商业指标。独立研究结论 · 核验 2026-07-14Establishing Best Practices for Building Rigorous Agentic BenchmarksNeurIPS该研究系统讨论 Agent benchmark 的任务设计、污染、评分可靠性、统计报告和复现要求。
证据边界:严谨 benchmark 仍不能单独证明部署后的用户价值和组织 ROI。独立研究结论 · 核验 2026-07-14InjecAgent: Benchmarking Indirect Prompt Injections in Tool-Integrated LLM AgentsACL Anthology该同行评审 benchmark 用 1,054 个测试覆盖工具型 Agent 的间接 Prompt Injection、用户伤害和私有数据外泄。
证据边界:单一 benchmark 的攻击成功率不能直接代表当前某款产品的线上风险。官方产品实现 · 核验 2026-07-23Use Claude Code DesktopClaude by Anthropic官方桌面端文档说明 Code tab 与 CLI 使用同一底层引擎,并明确展示权限模式、可中断会话、可视 Diff 与行级评论、Preview 自动验证、终端、CI 状态和 PR 监控等用户可见流程。
证据边界:桌面端产品文档只能证明当前可见功能与交互合同,不能证明闭源客户端内部模块、线上默认效果或所有版本行为。