Agent 比聊天模型多了什么?
Agent Harness 是包在模型外面的一整套运行系统:它准备上下文、开放工具、限制权限、保存状态,并检查任务是否真的完成。
本课的文件名、日志和测试数字全部是教学假数据。任务很具体:登录超时测试偶发失败,请找到原因、修复代码,并运行相关测试证明修好了。
如果只把任务发给聊天模型,它最多给出排查建议。它看不到当前项目,也不能搜索代码、修改文件或运行测试。Agent 多出来的是一套围绕模型的运行系统:把项目交给模型,提供工具,保存每一步结果,检查权限,最后用真实证据交付。
这套运行系统通常叫 Harness。Diff 指修改前后文件内容的对比。先记住这两个词就够了:模型提出下一步,Harness 让工具受控执行;用户通过 Diff 和测试结果检查到底发生了什么。
模型只能根据眼前材料提出下一步。让它真的读取文件、修改代码、等待批准、运行测试并交付 Diff 的,是模型之外的一整套运行系统。Harness 是这套系统的常用称呼,不需要先背定义。
一句任务,怎样穿过运行系统变成真实结果?
左边是用户看到的过程,右边是同一步背后的系统责任。责任可以合并实现,但不能消失。
“修复登录超时,并运行测试证明修好了。”
- 01正在调查读取项目规则,搜索 timeout
- 02等待确认准备修改 2 个文件
- 03正在验证运行 18 项相关测试
- 04交付结果改动对比(Diff)+ 18/18 测试通过 + 未决风险
只把任务、规则、相关文件和最新工具结果送给模型。
根据当前证据提出下一步:继续读、调用工具或给出结果。
保存进度,把工具结果送回下一轮,并支持暂停与恢复。
决定放行、询问或拒绝,并限制文件、网络和命令边界。
真正读取、搜索、编辑代码并运行测试。
从改动对比、退出码和测试结果判断是否真的完成。
先跟完一次任务
用户输入“登录超时测试失败,请找到原因、修复并运行测试”。系统先读取项目说明和最近错误;模型请求搜索 timeout;搜索工具返回两个相关文件;模型读到时间单位写错,提出最小修改;系统在写入前暂停,请用户确认文件范围。
用户允许后,编辑工具修改代码,终端工具运行相关测试。测试 18/18 通过,系统把根因、Diff、测试结果和未决风险放进交付。用户最终拿到的不是一句回答,而是一组能被检查的环境变化和证据。
官方事实查看这一结论的依据与边界+
OpenAI 对 Codex Agent Loop 的公开拆解说明模型输入由 instructions、tools 与 input 组成,工具结果会回到后续循环。
OPUnrolling the Codex agent loop官方工程文章 · 核验 2026-07-14再把刚才发生的事拆成四个部分
界面接收任务并展示进度与确认;Harness 准备模型当前看见的文件和规则,并管理权限与状态;模型提出下一步,工具真正读取、修改和测试;最后由验证结果决定继续还是完成。
工程实现可以把几个责任写进同一模块,也可以拆成多个服务,但责任不能凭空消失。后面的 Pi 会展示最小版本,Grok Build 会展示生产系统怎样补上会话、工作区、隔离、扩展和恢复。
官方事实查看这一结论的依据与边界+
OpenAI App Server 将 Thread、Turn、Item、审批和事件作为 Codex Harness 的公开产品接口。
OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14为什么更强的模型也不能替代整套系统
模型可能判断错,但系统也可能给错文件、把失败的命令显示成成功、默认开放过大权限,或者没有运行测试就宣布完成。换模型只会解决其中一部分问题。
产品经理定位失败时,要沿任务记录找到第一个偏离:模型当时看到了什么、提出了什么、工具实际做了什么、系统记录了什么。能找到第一次出错的位置,问题才有明确负责人和回归办法。
官方事实查看这一结论的依据与边界+
Anthropic 强调工具设计、环境反馈与简单可组合模式对有效 Agent 的重要性。
ANBuilding effective agents官方工程文章 · 核验 2026-07-14有术语没听懂?在这里用人话再看一遍8 个词+
- Model
- 根据当前输入预测文字或结构化动作的模型;它只看到被送入本次调用的信息。
- Harness
- 连接模型和环境的运行系统,管理上下文、工具、状态、策略、循环和交付。
- Client
- 用户实际协作的 CLI、IDE、桌面、Web 或移动端界面。
- Tool
- 由 Harness 调用、能够读取或改变真实环境的窄能力合同。
- Environment
- 文件、代码仓库、数据库、业务系统、网页等任务发生的真实世界。
- Diff
- 文件修改前后的内容对比,用来检查改了哪里、是否超出批准范围。
- Turn
- 一次用户驱动的工作单元,内部可以包含多次模型调用、工具执行和审批。
- Observation
- 工具执行后返回给模型的新事实,例如文件内容、错误、退出码或业务回执。
本章依据与证据边界10 份原始材料+
下面补充本章的其他依据,并说明每份材料能证明什么、不能证明什么。
查看全部一手材料与源码证据 10 条
这份材料区分了由预定义代码路径控制的 Workflow 与由模型动态控制过程的 Agent,并强调先采用能工作的最简单方案。它还给出 Prompt Chaining、Routing、Parallelization、Orchestrator-Workers、Evaluator-Optimizer 等组合模式,以及何时值得承担 Agent 的延迟、成本和复合错误。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-23How Claude Code worksAnthropic这份文档把 Claude Code 的 Agent Loop 描述为收集上下文、采取行动、验证结果三个相互交织的阶段,并说明模型与工具如何通过结果反馈持续调整。它还解释 Claude Code 作为 Harness 所承担的上下文管理、执行环境、会话、压缩、检查点和权限职责。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方方法 · 核验 2026-07-23A practical guide to building agentsOpenAI这份指南面向产品与工程团队,给出 Agent 使用场景判断、Model/Tools/Instructions 基础结构、单 Agent 与多 Agent 编排和 Guardrail 设计。它支持从复杂决策、难维护规则和非结构化信息出发选择场景,并强调先强化单 Agent、从小范围真实用户验证开始。
证据边界:官方经验与自测不能单独证明普遍收益,结论不得越过其样本、版本和适用范围。官方产品实现 · 核验 2026-07-23Unrolling the Codex agent loopOpenAI这份材料逐步解释 Codex Harness 如何组装 instructions、tools 与 input,通过 Responses API 在一次 Turn 内循环完成模型推理和工具调用。它还说明对话增长、上下文窗口、Prompt Caching 与 Compaction 为什么属于 Harness 的核心工程责任。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-16Grok Build is Now Open SourcexAIxAI 官方说明本次公开的是 Grok Build 编码 Agent 与终端 TUI,并明确列出 Agent Loop、代码交互工具、终端 UI,以及 Skills、Plugins、Hooks、MCP Servers、Subagents 等扩展系统。它让课程可以用真实实现核对 Harness 责任,而不是让产品经理通读源码。
证据边界:官方公告没有说明 Grok Build 的服务端实现,也不能证明托管产品的完整架构、真实任务成功率或这些设计适用于所有 Agent。固定提交源码 · 核验 2026-07-23Grok Build repository map(固定提交)xAI固定提交 README 将公开范围界定为 grok CLI/TUI 与 Agent Runtime 的 Rust 源码快照,并标出 TUI、Agent Runtime、工具、Workspace、MCP、Sandbox 等主要 crate;仓库由 xAI 内部 monorepo 定期同步且不接受外部贡献。
证据边界:这个快照不是 Grok Build 服务端源码,也不能代表后续线上版本、内部 monorepo 的全部模块或每项功能的运行效果。固定提交源码 · 核验 2026-07-23Hermes Agent repository and architecture guidanceNous Research这份固定提交的仓库说明展示 Hermes Agent 如何用同一个窄腰核心服务 CLI、TUI、桌面与消息入口,并优先通过 Skills、Plugins 与 MCP 扩展。它还把 Prompt Cache、核心工具数量和扩展 Footprint 当成真实架构约束,说明工具越多并不自动更强。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。官方方法 · 核验 2026-07-23Harnessing Claude’s intelligenceClaude by Anthropic这份官方设计说明展示 Claude Code 团队如何把模型能力放进工具、上下文、权限与反馈环境,并把 Harness 视为随模型变化而持续调整的产品系统。
证据边界:它解释团队经验,不代表每个领域都应复制 Claude Code 的产品结构。官方产品实现 · 核验 2026-07-23The evolution of agentic surfaces: building with Claude Managed AgentsClaude by Anthropic这份官方材料定义 Agent、Environment 与 Session 三类生产资源,并说明 Brain/Hands 分离、持久事件、凭证代理、可恢复状态和自托管执行环境。
证据边界:官方自测延迟和客户案例不能直接外推为所有 Agent 产品的 ROI。官方岗位原文 · 核验 2026-07-23AI 产品经理(Agent Harness 产品方向)DeepSeek官方岗位原文要求路线图、真实任务与用户反馈、模型行为判断、Vibe Coding、UI/UX、Harness 技术原理、数据研究和模型与 Harness 共同进化。
证据边界:公开 JD 不披露 DeepSeek 内部路线图、面试题、组织分工或唯一合格答案。