五种 Coding Agent,真正差在哪?
比较 Coding Agent 不能只比模型回答,而要用同一个任务检查它怎样规划、调用工具、请求权限、处理失败并交付可核对结果。
教学案例:仍然是“定位登录超时失败、修改代码并运行测试”。同一任务不变,才能看出不同 Agent 在读取范围、修改确认、失败恢复和结果验收上的真实差别。
先用 Pi 看最小骨架:模型怎样循环、工具怎样执行、状态怎样保存。再用 Grok Build 看生产系统怎样补上工作区、权限、界面和扩展。最后用 Claude Code、Codex、NousResearch/hermes-agent 对应的 Hermes Agent 比较用户真正经历的协作过程。
比较时始终带着同一组问题:它如何理解任务、采取行动、请求确认、处理失败并交付证据。官方说明、固定版本代码和实际运行记录分别回答不同问题。
用同一个任务与环境观察:启动成本、计划方式、读取范围、权限节奏、Diff 体验、测试验证、长任务恢复、记忆和扩展生态。功能存在只是门槛,完整任务体验才是产品。
先用 Pi 看见最小骨架
让 Pi 处理登录超时任务时,只追四件事:它把什么交给模型,怎样执行搜索和测试,工具结果怎样回到下一轮,什么时候结束。认出这四项责任以后,大型 Agent 就不再像一团黑箱。
Pi 的公开文档只能证明它承诺和公开了哪些机制,不能证明其他产品采用同一结构,也不能替代真实运行。
官方事实查看这一结论的依据与边界+
Pi 官方文档公开 Session、Compaction、Security、Extensions、Skills 与 SDK,适合核对精简 Harness 的责任范围;它不证明其他产品采用同一结构。
PIPi Documentation官方文档 · 核验 2026-07-16再用 Grok Build 看生产系统怎样接线
最小循环能跑起来,还不等于可以交给真实用户。Grok Build 的固定源码帮助核对工作区、工具、权限、会话和终端界面怎样围绕同一任务协作。阅读时从产品问题反查相关模块,不从第一行开始通读。
固定源码只证明那个版本的公开实现。它不包含所有服务端能力,也不证明线上质量,更不是唯一正确架构。
固定源码观察查看这一结论的依据与边界+
Grok Build 固定提交公开 CLI、TUI、Agent Runtime、工具、Workspace 与扩展模块;它不包含服务端,也不证明线上质量。
XAxai-org/grok-build(固定提交)官方源码 · 核验 2026-07-16固定源码观察查看这一结论的依据与边界+
Nous Research 的固定提交源码用于核对 Hermes 的窄腰核心、扩展策略与当前实现;仓库自述不被当作独立行业结论。
NOHermes Agent repository architecture (fixed commit)官方源码 · 核验 2026-07-14最后比较成熟产品的用户体验
让 Claude Code、Codex 与 Hermes Agent 都从同一项目版本开始。记录它们先读什么、何时展示计划、改文件前怎样确认、测试失败后怎样继续,以及最终给用户什么证据。
“聪明、顺滑、稳定”太模糊。更有用的观察是:是否读错范围、用户要纠正几次、失败后能否继续、Diff 是否清楚、测试结果是否真的决定完成。
官方事实查看这一结论的依据与边界+
Anthropic 官方文档用于支持 Claude Code 当前公开能力与使用方式;黑盒运行结果仍是模型、Harness、Runtime 与客户端的复合表现。
ANHow Claude Code works官方文档 · 核验 2026-07-14官方事实查看这一结论的依据与边界+
Hermes 当前文档把有界 Memory、SQLite FTS5 Session Search 与完整会话历史分开;这支持机制区分,不支持“模型权重持续学习”的说法。
NOHermes Agent sessions官方源码 · 核验 2026-07-14官方事实查看这一结论的依据与边界+
OpenAI Codex 官方文档用于支持 Codex 当前公开能力与使用方式;动态文档与固定源码快照需要分开记录。
OPCodex CLI documentation官方文档 · 核验 2026-07-14官方事实查看这一结论的依据与边界+
OpenAI App Server 文章公开了 Codex Thread、Turn、Item 与多客户端 Harness 接口案例。
OPUnlocking the Codex harness: App Server官方工程文章 · 核验 2026-07-14结论必须分清事实、观察和解释
官方文档说明产品公开承诺;固定源码说明某个版本怎样实现;任务记录说明本次试跑真实发生了什么;解释则可能被新证据推翻。四类内容不能混在一句结论里。
比较时固定任务、项目版本、权限和完成标准,并保留失败与反例。结论只回答“哪种产品更适合哪类用户和任务”,不做脱离场景的总排行榜。
独立研究查看这一结论的依据与边界+
公开 Agent 基准研究强调任务定义、评分、复现与外部有效性;因此本课要求每次比较固定任务与版本,进行多次 Trial,并主动记录反证和适用范围。
ZHEstablishing Best Practices for Building Rigorous Agentic Benchmarks论文 / 基准 · 核验 2026-07-14有术语没听懂?在这里用人话再看一遍6 个词+
- 产品分层地图
- 按 Model、Harness、Runtime、Client 与 User 责任记录一个 Agent 产品的公开事实和观察。
- 复合结果
- 多个系统层共同作用产生的最终任务表现,不能直接归因给单一模型。
- 核验日期
- 说明易变化的产品事实在哪一天由哪个官方来源确认。
- 观察
- 在固定任务中真实记录到的行为,不等同于对内部原因的证明。
- 推断
- 根据事实和观察提出、仍可被新证据推翻的原因解释。
- 证据边界
- 明确一条材料能支持哪种结论,以及哪些内部机制、长期可靠性或业务收益仍未被证明。
本章依据与证据边界16 份原始材料+
下面补充本章的其他依据,并说明每份材料能证明什么、不能证明什么。
查看全部一手材料与源码证据 16 条
这份材料逐步解释 Codex Harness 如何组装 instructions、tools 与 input,通过 Responses API 在一次 Turn 内循环完成模型推理和工具调用。它还说明对话增长、上下文窗口、Prompt Caching 与 Compaction 为什么属于 Harness 的核心工程责任。
证据边界:官方文档不能单独证明未公开内部实现、长期可靠性或真实用户收益。官方产品实现 · 核验 2026-07-16Grok Build is Now Open SourcexAIxAI 官方说明本次公开的是 Grok Build 编码 Agent 与终端 TUI,并明确列出 Agent Loop、代码交互工具、终端 UI,以及 Skills、Plugins、Hooks、MCP Servers、Subagents 等扩展系统。它让课程可以用真实实现核对 Harness 责任,而不是让产品经理通读源码。
证据边界:官方公告没有说明 Grok Build 的服务端实现,也不能证明托管产品的完整架构、真实任务成功率或这些设计适用于所有 Agent。固定提交源码 · 核验 2026-07-23Grok Build repository map(固定提交)xAI固定提交 README 将公开范围界定为 grok CLI/TUI 与 Agent Runtime 的 Rust 源码快照,并标出 TUI、Agent Runtime、工具、Workspace、MCP、Sandbox 等主要 crate;仓库由 xAI 内部 monorepo 定期同步且不接受外部贡献。
证据边界:这个快照不是 Grok Build 服务端源码,也不能代表后续线上版本、内部 monorepo 的全部模块或每项功能的运行效果。固定提交源码 · 核验 2026-07-23Grok Build session orchestration loop(固定提交)xAI该文件展示 Session Actor 怎样统一接收命令、模型 Turn 完成、工具与 MCP 事件、会话状态和停止事件,再启动下一段工作或进入 Idle;它证明生产 Loop 还要管理并发事件、生命周期与恢复,而不是只有“模型想一步、工具做一步”。
证据边界:单个调度文件不能证明完整 Prompt 组装、全部工具执行、最终终止条件或线上任务可靠性;这些结论仍需结合相邻模块与运行证据。固定提交源码 · 核验 2026-07-23Grok Build permission manager(固定提交)xAI该文件把 Always Approve、Auto、Ask 模式、策略 allow/deny/ask、MCP 授权记忆、命令拆分、安全命令判断和人工 Prompt 编排进同一个确定性权限管理器。它支持把权限设计理解为 Harness 的决策与状态系统。
证据边界:权限管理器不是 Sandbox 本身;源码存在也不能证明策略无绕过、分类器无误判或所有客户端都采用相同默认配置。固定提交源码 · 核验 2026-07-23Grok Build third-party provenance index(固定提交)xAI根目录 THIRD-PARTY-NOTICES 是依赖、内置主题、Vendored 代码与源码移植的归属和许可证索引,可用于核对一个生产 Harness 的供应链边界。
证据边界:第三方清单只能证明所列归属与许可证声明,不能证明 Grok Build 的整体架构来自某个项目,也不能证明依赖没有安全或兼容性风险。固定提交源码 · 核验 2026-07-23Grok Build tool ports notice(固定提交)xAI工具 crate 的 NOTICE 明确说明 apply_patch、grep_files、list_dir、read_file 从 openai/codex 移植,bash、edit、glob、grep、read、skill、todowrite、write 从 sst/opencode 移植;这些实现经过跨语言翻译、Tool Trait 适配与扩展。
证据边界:这只证明列出的工具实现存在来源与改造关系,不证明 Grok Build 复制了 Codex 或 OpenCode 的整体 Agent 架构,也不能假设改造后的行为完全一致。固定提交源码 · 核验 2026-07-23Hermes Agent repository and architecture guidanceNous Research这份固定提交的仓库说明展示 Hermes Agent 如何用同一个窄腰核心服务 CLI、TUI、桌面与消息入口,并优先通过 Skills、Plugins 与 MCP 扩展。它还把 Prompt Cache、核心工具数量和扩展 Footprint 当成真实架构约束,说明工具越多并不自动更强。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent tool-call validation and recoveryNous Research这段固定提交源码展示 Hermes 如何检查工具名和 JSON 参数、限制委派数量、去重调用,并用结构化工具结果把可恢复错误送回下一轮。它直接证明生产级 Agent Loop 在模型输出与真实动作之间还需要确定性处理。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。固定提交源码 · 核验 2026-07-23Hermes Agent async delegation and turn finalizationNous Research这段源码说明后台 Subagent 的完成结果进入共享队列,并在 Agent 空闲时形成新的 Turn,而不是插进正在进行的工具序列;这样可以保持消息角色顺序与 Prompt Cache 稳定。这是 Hermes 的实现选择,不是行业统一协议。
证据边界:固定提交只能证明该版本的公开实现,不能代表现行私有产品、真实任务质量或行业统一架构。厂商研究 · 核验 2026-07-23Agentic coding and persistent returns to expertiseAnthropic这项 Anthropic 研究讨论不同经验水平开发者怎样使用 Claude Code,以及领域与工程经验为何仍会影响任务选择、监督、验证和最终产出。
证据边界:厂商研究不能单独证明所有用户、任务与组织都获得相同生产率收益。官方产品实现 · 核验 2026-07-14Hermes Agent Persistent MemoryNous Research当前文档说明 Hermes 使用有字符上限的 MEMORY.md 与 USER.md、会话开始时冻结注入、写入审批、安全扫描,以及基于 FTS5 的 Session Search。
证据边界:可写 Memory 不等于事实正确、无限记忆、向量 RAG 或模型权重更新。官方产品实现 · 核验 2026-07-14Hermes Agent Skills SystemNous Research当前文档说明 Agent 可以创建、修改和删除 Skill,并通过 write_approval 将更改暂存供人工检查;Skill 被定义为按需加载的程序性记忆。
证据边界:Skill 自修改不等于方法必然改进,也不等于模型参数学习。独立研究结论 · 核验 2026-07-14Measuring the Impact of Early-2025 AI on Experienced Open-Source Developer ProductivityMETR该随机实验在经验丰富的开源开发者和自有成熟仓库任务中观察到早期 2025 AI 工具使完成时间增加 19%。
证据边界:研究页面已明确标注结果过时,不能外推到 2026 工具、所有开发者或非编码 Agent。独立研究结论 · 核验 2026-07-14The Effects of Generative AI on High-Skilled WorkMicrosoft Research三个企业随机实验合并 4,867 名开发者后,AI 编码助手组完成任务数提高 26.08%,且较少经验开发者的采用和收益更高。
证据边界:研究对象是代码补全助手和企业任务,不等于自主 Agent 的净收益或质量提升。官方产品实现 · 核验 2026-07-23Use Claude Code DesktopClaude by Anthropic官方桌面端文档说明 Code tab 与 CLI 使用同一底层引擎,并明确展示权限模式、可中断会话、可视 Diff 与行级评论、Preview 自动验证、终端、CI 状态和 PR 监控等用户可见流程。
证据边界:桌面端产品文档只能证明当前可见功能与交互合同,不能证明闭源客户端内部模块、线上默认效果或所有版本行为。