Agent 产品真正应该看什么指标?
消息数、Token 和报告数只说明系统很忙。更接近价值的指标是:一份通过引用检查、无需大改并被用于评审的洞察草稿。
再配三类护栏:用户花了多少时间复核、一次任务花多少钱、是否出现越权或看似完成但实际错误。主指标变好而护栏失控,版本仍然不能放量。
以“可验证的有效任务完成”为核心,按场景组合成功率、完成深度、人工介入、时间节省、复用、成本、延迟和风险。没有单个指标能覆盖所有 Agent。
先定义什么叫一次有效完成
十份访谈任务只有同时满足引用检查通过、无需大幅重写、在约定时间内被用户采用,才算一次有效完成。分母是实际发起这类任务的合格用户或任务。
如果有效完成下降,再向下看材料覆盖、工具失败、人工接管、恢复、成本和时延。指标树的作用是找到可以行动的责任层。
官方事实查看这一结论的依据与边界+
Anthropic 的 Agent Eval 方法支持用真实任务、重复运行和结果证据衡量 Agent 质量。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14简单任务和复杂任务分开看
如果新版多做了简单摘要,总成功率可能上升,但跨十份材料找反例的复杂任务反而退化。至少按任务难度、新老用户和版本分别看。
复杂高价值任务可以使用更强策略和更高预算,但必须证明额外成本换来了可验证质量,而不是更多文字。
官方事实查看这一结论的依据与边界+
DeepSeek 招聘信息强调 Agent 产品需在更多场景、更深入地帮助更多人,并连接模型与产品反馈。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14速度只是证据链的一环
先看任务是否完成,再看用户是否采用、是否减少返工,最后才看团队决策周期是否改善。越接近业务结果,越需要更长观察,不能用生成速度代替。
公开研究既有变快也有变慢的结果,因为用户、工具和任务不同。它们提醒我们为自己的用户和任务验证,而不是替本产品给出结论。
独立研究查看这一结论的依据与边界+
METR 在其早期 2025 年特定样本中观察到资深开源开发者使用当时 AI 工具慢 19%;该页面已标注结论时效,不能外推到所有 Agent。
MEMeasuring the Impact of Early-2025 AI on Experienced Open-Source Developer Productivity论文 / 基准 · 核验 2026-07-14有术语没听懂?在这里用人话再看一遍6 个词+
- 北极星指标
- 最能代表目标用户持续获得核心价值的主要产品指标。
- 护栏指标
- 防止主指标以牺牲成本、风险、质量或体验为代价增长的约束指标。
- P95
- 95% 样本不超过的时延或成本位置,用来观察尾部体验。
- 分层
- 把不同难度、用户和版本分开比较,避免总体数字掩盖局部退化。
- 静默错误
- 系统看似完成但结果错误,且没有向用户暴露失败信号。
- 指标链
- 把任务结果、用户采用、团队流程和业务结果逐层连接,并注明每层的证据强度。
本章依据与证据边界2 条补充结论 · 12 份原始材料+
下面补充本章的其他依据,并说明每份材料能证明什么、不能证明什么。
- [4]
Microsoft Research 汇总三项现场随机实验后报告任务完成量提高 26.08%;研究对象是代码补全助手,不等同于自主 Agent。
独立研究MIThe Effects of Generative AI on High-Skilled Work官方研究 · 核验 2026-07-14 - [5]
本站的质量加权完成、指标树和 Go/No-Go 规则是产品指标教学推演。
本站推演ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14
查看全部一手材料与源码证据 12 条
这份材料定义 Task、Trial、Grader、Transcript、Outcome、Evaluation Harness 与 Agent Harness,并强调评估 Agent 时实际评估的是模型与 Harness 的组合。它支持用多次 Trial、代码/模型/人工 Grader、Outcome 与轨迹联合评分,以及分别建设 Capability Eval 和 Regression Eval。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-23Running Codex safely at OpenAIOpenAI这份材料展示 OpenAI 在真实内部工作流中如何组合 Sandbox、Approval、网络策略、身份凭证、规则和管理员强制配置。它也说明 Agent 原生遥测如何记录用户意图、审批、工具、MCP 与网络决策,让安全团队能够审计发生了什么以及为什么发生。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-11Tracing - OpenAI Agents SDKOpenAI Agents SDK这份文档定义 Trace 与 Span,并说明 Agents SDK 默认记录 Agent 运行、模型生成、工具调用、Handoff、Guardrail 和自定义事件。它支持课程把轨迹观测落到可实现的数据结构,同时提醒默认 Trace 可能包含模型及工具输入输出等敏感数据,需要显式配置采集与导出策略。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。厂商研究 · 核验 2026-07-23Agentic coding and persistent returns to expertiseAnthropic这项 Anthropic 研究讨论不同经验水平开发者怎样使用 Claude Code,以及领域与工程经验为何仍会影响任务选择、监督、验证和最终产出。
证据边界:厂商研究不能单独证明所有用户、任务与组织都获得相同生产率收益。官方产品实现 · 核验 2026-07-23How we built our multi-agent research systemAnthropic这份生产案例披露 Orchestrator-Worker、独立上下文、并行搜索、恢复与评测方法,也明确多 Agent 的高 Token 成本和对串行、强共享上下文任务的限制。
证据边界:内部研究 Eval 的提升不能证明多 Agent 对所有任务都优于单 Agent。官方岗位原文 · 核验 2026-07-23AI 产品经理(Agent Harness 产品方向)DeepSeek官方岗位原文要求路线图、真实任务与用户反馈、模型行为判断、Vibe Coding、UI/UX、Harness 技术原理、数据研究和模型与 Harness 共同进化。
证据边界:公开 JD 不披露 DeepSeek 内部路线图、面试题、组织分工或唯一合格答案。独立研究结论 · 核验 2026-07-14Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer ProductivityMETR该随机实验在经验丰富的开源开发者和自有成熟仓库任务中观察到早期 2025 AI 工具使完成时间增加 19%。
证据边界:研究页面已明确标注结果过时,不能外推到 2026 工具、所有开发者或非编码 Agent。独立研究结论 · 核验 2026-07-14We are Changing our Developer Productivity Experiment DesignMETRMETR 说明后续实验受到参与者和任务选择效应影响,数据只能很弱地支持晚 2025 工具带来更大加速,无法可靠估计幅度。
证据边界:原始点估计和自报体验都不足以给出当前普遍提效比例。独立研究结论 · 核验 2026-07-14The Effects of Generative AI on High-Skilled WorkMicrosoft Research三个企业随机实验合并 4,867 名开发者后,AI 编码助手组完成任务数提高 26.08%,且较少经验开发者的采用和收益更高。
证据边界:研究对象是代码补全助手和企业任务,不等于自主 Agent 的净收益或质量提升。独立研究结论 · 核验 2026-07-14Towards a Science of Scaling Agent SystemsGoogle Research受控实验表明多 Agent 在可分解并行任务上可能显著提升,在严格串行任务上可能下降 39%–70%,工具密集任务还会承担额外协调成本。
证据边界:论文仍受基准、模型、配置和版本限制,不能当作所有生产任务的固定公式。独立研究结论 · 核验 2026-07-14AI Agents That MatterPrinceton NLP论文指出只追准确率会忽略成本、复现性、下游适用性、留出集和基准过拟合,并提出联合优化准确率与成本。
证据边界:该框架本身不能替代具体产品的真实用户任务、风险与商业指标。独立研究结论 · 核验 2026-07-14Establishing Best Practices for Building Rigorous Agentic BenchmarksNeurIPS该研究系统讨论 Agent benchmark 的任务设计、污染、评分可靠性、统计报告和复现要求。
证据边界:严谨 benchmark 仍不能单独证明部署后的用户价值和组织 ROI。