用户说喜欢,为什么还不能上线?
用户说喜欢计划面板,不等于它真的减少返工。先用访谈理解原因,再用离线 Eval 排除质量和安全退化,最后只对一小部分真实任务开放。
实验期间固定模型、Harness、工具和材料版本。否则结果变好或变坏时,不知道是哪一项变化造成的。
表达偏好不等于行为收益。先通过访谈理解原因,再用任务评测排除能力退化,最后通过灰度观察完成率、打断率、耗时和留存。
用户说喜欢以后,产品还要过哪几关?
十份访谈先帮助理解原因;离线 Eval 检查能力和风险;内部试用暴露真实工具问题;小流量灰度验证行为。任一护栏失败,都应停下或回滚。
- 1访谈理解问题与机制
用户为什么需要计划面板?它在哪一步减少不确定?
形成假设 - 2离线评测(Eval)固定任务重复运行
结果、引用、权限和失败处理没有退化。
能力关卡(Gate) - 3内部试用观察真实协作
记录等待、改计划、人工接管和工具故障。
可用性关卡(Gate) - 4小流量灰度验证真实行为变化
完成率、耗时与护栏按预先规则判断。
产品关卡(Gate) - 5发布或回滚只按预注册条件收口
越权、静默错误或关键任务退化立即停止。
人工决定
先访谈,再离线检查,最后小流量
访谈发现用户在哪一步失去理解和控制;离线 Eval 检查引用、权限和失败路径;团队内部先用;通过后再给小部分用户灰度。
每一步都有停止条件。出现越权、引用退化或静默错误时立即回滚,不因为满意度提高继续放量。
官方事实查看这一结论的依据与边界+
Anthropic 的 Agent Eval 方法强调先用可重复任务与多次 Trial 建立能力和回归证据。
ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14运行前先写下判断标准
开始前写明对谁开放、改变什么、看哪个主指标、哪些护栏不能变差、什么情况停止。十份访谈任务应按完整任务分组,不让同一次任务跨两种体验。
失败记录只保留改进所需的最少字段。原文或敏感轨迹进入分析前需要用户同意、脱敏、访问控制和删除期限。
官方事实查看这一结论的依据与边界+
DeepSeek 招聘信息体现真实用户反馈、工程与研究之间需要持续闭环。
DEAI 产品经理(Agent Harness 产品方向)官方招聘 · 核验 2026-07-14提前写下什么会推翻原假设
例如计划面板提高完成率,却显著增加等待;或只帮助熟练用户、伤害新用户,都不能宣布整体成功。分层差异和副作用要与平均结果一起报告。
如果样本不足或选择偏差太大,就把结论降为“尚未确认”,缩小范围或继续收集证据。不要换一个更好看的指标。
独立研究查看这一结论的依据与边界+
METR 2026 更新公开说明其后续研究受选择偏差影响,不能可靠估计总体生产率;这是主动降低结论强度的反证案例。
MEUpdated analysis of AI coding productivity uplift论文 / 基准 · 核验 2026-07-14有术语没听懂?在这里用人话再看一遍4 个词+
- Dogfood
- 团队在真实内部工作中先使用产品,发现实验室任务遗漏的问题。
- 灰度
- 把新版本逐步开放给受控流量,并保留停止和回滚能力。
- 版本固定
- 实验期间保持模型、Harness、工具和材料版本不变,避免原因混在一起。
- 反证条件
- 在实验前写明哪些结果、分层差异或副作用会推翻或削弱原假设。
本章依据与证据边界2 条补充结论 · 8 份原始材料+
下面补充本章的其他依据,并说明每份材料能证明什么、不能证明什么。
- [4]
Microsoft Research 的现场实验说明真实行为研究可以补充离线任务,但其代码补全场景不能直接外推到自主 Agent。
独立研究MIThe Effects of Generative AI on High-Skilled Work官方研究 · 核验 2026-07-14 - [5]
本站从访谈到灰度的五阶段 Gate、随机单元、反证条件和隐私闭环是实验教学框架。
本站推演ANDemystifying evals for AI agents官方工程文章 · 核验 2026-07-14
查看全部一手材料与源码证据 8 条
这份材料定义 Task、Trial、Grader、Transcript、Outcome、Evaluation Harness 与 Agent Harness,并强调评估 Agent 时实际评估的是模型与 Harness 的组合。它支持用多次 Trial、代码/模型/人工 Grader、Outcome 与轨迹联合评分,以及分别建设 Capability Eval 和 Regression Eval。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-11Tracing - OpenAI Agents SDKOpenAI Agents SDK这份文档定义 Trace 与 Span,并说明 Agents SDK 默认记录 Agent 运行、模型生成、工具调用、Handoff、Guardrail 和自定义事件。它支持课程把轨迹观测落到可实现的数据结构,同时提醒默认 Trace 可能包含模型及工具输入输出等敏感数据,需要显式配置采集与导出策略。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。独立研究结论 · 核验 2026-07-14Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer ProductivityMETR该随机实验在经验丰富的开源开发者和自有成熟仓库任务中观察到早期 2025 AI 工具使完成时间增加 19%。
证据边界:研究页面已明确标注结果过时,不能外推到 2026 工具、所有开发者或非编码 Agent。独立研究结论 · 核验 2026-07-14We are Changing our Developer Productivity Experiment DesignMETRMETR 说明后续实验受到参与者和任务选择效应影响,数据只能很弱地支持晚 2025 工具带来更大加速,无法可靠估计幅度。
证据边界:原始点估计和自报体验都不足以给出当前普遍提效比例。独立研究结论 · 核验 2026-07-14The Effects of Generative AI on High-Skilled WorkMicrosoft Research三个企业随机实验合并 4,867 名开发者后,AI 编码助手组完成任务数提高 26.08%,且较少经验开发者的采用和收益更高。
证据边界:研究对象是代码补全助手和企业任务,不等于自主 Agent 的净收益或质量提升。独立研究结论 · 核验 2026-07-14Towards a Science of Scaling Agent SystemsGoogle Research受控实验表明多 Agent 在可分解并行任务上可能显著提升,在严格串行任务上可能下降 39%–70%,工具密集任务还会承担额外协调成本。
证据边界:论文仍受基准、模型、配置和版本限制,不能当作所有生产任务的固定公式。独立研究结论 · 核验 2026-07-14AI Agents That MatterPrinceton NLP论文指出只追准确率会忽略成本、复现性、下游适用性、留出集和基准过拟合,并提出联合优化准确率与成本。
证据边界:该框架本身不能替代具体产品的真实用户任务、风险与商业指标。独立研究结论 · 核验 2026-07-14Establishing Best Practices for Building Rigorous Agentic BenchmarksNeurIPS该研究系统讨论 Agent benchmark 的任务设计、污染、评分可靠性、统计报告和复现要求。
证据边界:严谨 benchmark 仍不能单独证明部署后的用户价值和组织 ROI。