Artificial Analysis 榜单上 60 = 60 的"假平局",扣掉速度、扣掉成本、扣掉可治理性之后,真正的差距落在四个变量上 — 它们决定产研团队未来 12 个月的工作流。Codex + GPT-5.5 留作三种场景的战术备选。
Artificial Analysis 2026-05 发布的「Coding Agent Index」是首个把"模型 + 工具"捆绑测评的榜单:358 道题、3 轮 pass@1。Claude Code + Opus 4.7 与 Codex + GPT-5.5 综合得分都是 60 分(并列第二,仅次于 Cursor CLI + Opus 4.7 的 61 分)。相同质量下,前者单任务耗时 5.8 分钟 vs 7.1 分钟,API 成本 $1.24 vs $2.21。在四个决定变量(GitHub 强度、企业账号、成本敏感度、治理偏好)中,产研团队的通用画像更匹配 Claude Code,Codex 留作备选用于特定场景。
2026 年绕不开的产研决策:挑一个 AI 编程 Agent 做主工作流。Artificial Analysis 在 2026 年 5 月发布的「Coding Agent Index」首次把"模型 + Agent 工具"作为一个整体打分 — 这是目前最严肃的一份横评基准。这一节做三件事:确认原始出处、读懂榜单方法论、把「假平局」拆成真差距。
榜单原始页面 artificialanalysis.ai/agents/coding-agents,2026 年 5 月正式上线。核心创新点:不只测模型,而是把"模型 + Agent 工具"作为一个整体打分 — 这是与传统模型榜单(MMLU、HumanEval 之流)的根本区别。同一个 Opus 4.7,放进 Cursor CLI 拿 61 分,放进 Claude Code 拿 60 分;模型一样,工具不一样,结果就不一样。
方法论页 artificialanalysis.ai/methodology/coding-agents-benchmarking 披露了所有细节:
| 基准 | 评测领域 | 题量 | 重复 | 题目类型 | 评分方式 |
|---|---|---|---|---|---|
| SWE-Bench-Pro-Hard-AA | 代码修复 | 150 | 3 | 代码补丁 / 仓库改动 | 测试套件 pass/fail · pass@1 |
| Terminal-Bench v2 | 终端任务 | 84* | 3 | 终端命令执行 | 测试套件 pass/fail · pass@1 |
| SWE-Atlas-QnA | 代码理解 Q&A | 124 | 3 | 开放回答 | 评分量表 · pass@1 |
| * Terminal-Bench v2 原本 89 道,因环境兼容性问题剔除 5 道。三个基准均出自 Scale AI / Laude 研究院,业界认可度高。 | |||||
三个基准合计 358 道题,每道跑 3 次,取 pass@1 平均分,合成「Coding Agent Index」(等权合成)。每个 Agent 用默认 reasoning 配置(reflects "default user experience"),意味着榜单测的是真实开发者拿到手就用的水平,不是经过调优的"高分模式"。
① 358 道题 × 3 轮 = 1,074 次评测,样本量足够稀释偶然误差。② 3 个独立基准 + 等权合成,避免单一基准过拟合;Q&A / 代码修复 / 终端三类能力都覆盖。③ 默认配置,不允许 vendor 提交"特调"参数 — 这是该榜单与 SWE-Bench leaderboard 最大的区别。
| Agent + Model | 得分 | 单任务耗时 | 单任务 API 成本 | 平均 token / 任务 |
|---|---|---|---|---|
| Cursor CLI + Opus 4.7 (Medium) | 61 | 7.8 min | $1.47 | ~1.5M |
| Claude Code + Opus 4.7 (Medium) | 60 | 5.8 min | $1.24 | ~1.7M |
| Codex + GPT-5.5 (Medium) | 60 | 7.1 min | $2.21 | ~1.7M |
| Cursor CLI + GPT-5.5 (Medium) | 58 | 6.2 min | $1.61 | ~1.5M |
| Claude Code + GLM-5.1 (智谱) | 53 | 21.6 min | $2.26 | ~4.8M |
| Claude Code + Kimi K2.6 | 50 | 41.5 min | $0.76 | ~3.7M |
| Claude Code + DeepSeek V4 Pro (High) | 50 | 18.0 min | $0.35 | ~2.7M |
| Cursor CLI + Composer 2 (自研基于 Kimi K2.5) | 48 | 8.7 min | $0.07 | ~750K |
| Claude Code + Sonnet 4.6 (Medium) | 49 | 9.2 min | $1.02 | ~2.2M |
| Gemini CLI + Gemini 3.1 Pro (High) | 43 | 7.6 min | $1.60 | ~2.1M |
看完表格,三个事实立刻浮现 — 它们都被"60 = 60"这个标题数字掩盖了:
事实 1 · 速度差距是结构性的,不是噪声。Claude Code + Opus 4.7 的单任务耗时 5.8 分钟,全场最快;Codex + GPT-5.5 是 7.1 分钟。在 358 道题 × 3 轮 = 1,074 次任务的样本下,22% 的差距不可能是偶然 — 这是模型推理特征 + agent loop 设计共同的产物。把它换算成产研团队的日常:工程师每天若提 10 个任务,Claude Code 节省 13 分钟/人/天 ≈ 1 小时/人/周。
事实 2 · 成本差距更大,且方向与速度一致。$1.24 vs $2.21 = 便宜 44%。token 用量两边相近(都在 1.7M 量级),差距主要来自单价 — Opus 4.7 的 API 价格是 $5 input / $25 output per M tokens,GPT-5.5 是 $5 input / $30 output per M tokens。出 token 越多,GPT-5.5 越贵。
事实 3 · 同质量同 token,Codex 既慢又贵,意味着工程意义上 Codex 的 agent loop 效率偏低。这不是结论,但是值得标记的信号:Codex 在最近一年迭代的重点是 Cloud / GitHub PR Review / 自主性,在 CLI 本身的 token 经济学上没有 Claude Code 那种"快进快出"的内功优化。
60 不是平局。
是 Claude Code 用 78% 的资源做到了同样的 60。
如果选型只看榜单,答案早出来了:Claude Code。但产研团队的选型还要看四个变量,它们任何一个翻转,都可能让 Codex 反超。把这四个变量摊到桌面上,选型决策才能站得住脚:
| 团队画像 | Codex 优势 | Claude Code 优势 | 判定 |
|---|---|---|---|
| 以 GitHub PR 为核心工作流(代码 review、CI/CD、Issues 闭环) | 原生 @codex review、PR Review Pane、Agent HQ、Codex Cloud 异步 fire-and-forget | 需要 GitHub App + 手工集成 | 倾向 Codex |
| 以本地编码 + 人工 commit/push 为主 | 云端任务大多过度设计 | terminal-first、interactive、默认不静默推送 | 倾向 Claude Code |
| 已有账户 | Codex 集成度 | Claude Code 集成度 | 判定 |
|---|---|---|---|
| ChatGPT Enterprise / OpenAI Business | 直接复用 SCIM/EKM/SSO/RBAC/域名验证,GPT-5.5 已含 | 需要新签 Anthropic 企业合同 | 倾向 Codex |
| Claude for Enterprise / AWS Bedrock / Microsoft Foundry / GCP Vertex AI | 需要单独走 OpenAI 合规 | ZDR 默认开启,Bedrock / Vertex / Foundry 部署链路成熟 | 倾向 Claude Code |
| 都没有 — 从零起步 | pay-as-you-go,无 seat 费,起步轻 | 订阅制 ($20-200/seat) 月度成本可预测 | 看团队规模,小团队 Codex,中大团队 CC |
| 用量画像 | Codex 成本结构 | Claude Code 成本结构 | 判定 |
|---|---|---|---|
| 稳定重度用户(单人每天 >30 个任务) | pay-as-you-go,OpenAI 自报 $100-200/dev/月 | 订阅 Max $200/月或 Team $100/seat 封顶,超出走 API | 倾向 Claude Code(可预测) |
| 低强度试探性使用(单人每天 <10 个任务) | 按量,空闲不花钱 | 订阅有最低 $20/月起步 | 倾向 Codex |
| 波动巨大(项目期密集,日常稀疏) | 按量灵活 | 订阅过剩,API 更划算 | 倾向 Codex |
无论选哪个,"真实仓库下 Agent 可能烧掉你天真估算的 5-10 倍 token"(参见 Totalum 等多篇横评)。OpenAI 官方披露 Codex 重度用户人均 $100-200/月;Anthropic 也提醒 3-agent subagents 团队比单 agent 多用 7 倍 token。任何月度预算估算必须加 5-10x buffer,这点必须写进采购预算。Opus 4.7 还有一个细节:新 tokenizer 对同样文本可能多用最多 35% token。
| 团队治理偏好 | Codex | Claude Code | 判定 |
|---|---|---|---|
| 偏好"OS 级硬隔离",放心让 agent 跑长任务 | macOS Seatbelt / Linux Landlock+seccomp 内核层拦截 syscall;Codex Cloud 隔离容器 | 26 个 lifecycle hooks 在 application 层拦截 | 倾向 Codex |
| 偏好"规则可编程",代码规范、测试、PR 模板要 codify | profiles (careful / deep-review) + AGENTS.md 开放标准 | 5 层 cascading config(系统/企业/项目/用户/会话)+ 26 hooks + subagents 独立 context | 倾向 Claude Code |
| 担心 agent 误删/误推 | 默认"more autonomous",可能单次大动作不问 | 默认安全:"不会静默 rm、不会自动 push main" | 倾向 Claude Code |
把上面四个变量套到一个"中等规模、混合栈、注重代码质量、注重合规"的产研团队画像(这是绝大多数中国产研团队的真实样貌),三个变量倾向 Claude Code,一个变量倾向 Codex(GitHub 强度高的团队)。但即使是 GitHub 重度团队,GitHub 已经推出 Agent HQ,允许同时挂 Claude Code 和 Codex — 这就意味着我们可以把 Codex 当作"特定场景增强",而不是"主工作流"。
为什么是它?
什么时候应该升级为主选?
| 支柱 | 说明 | 对团队的意义 |
|---|---|---|
| ① 效率 | 同质量同 token 下,Claude Code 比 Codex 快 22%、省 44% API 成本 | 10 人团队若每人每天提 10 个任务,年节省 ≈ $32,000 + 2,500 工时 |
| ② 可预测性 | 订阅制(Team $100/seat 包月)+ ZDR 默认 + Bedrock/Vertex/Foundry 三大云部署 | 月度预算可签字、合规过审、风控可解释。Codex 是 pay-as-you-go,账单波动大 |
| ③ 可治理性 | 26 hooks + 5 层 cascading config + subagents + MCP 最成熟 | 团队代码规范、测试要求、PR 模板可以全部 codify,沉淀成资产 |
判定条件
动作:Codex 升主 / CC 配 PoC
判定条件
动作:Codex 主选;CC 走 API 试点
判定条件
动作:Codex Cloud 做专项 / CC 做日常
GitHub 在 2026 年推出 Agent HQ,官方支持「同一团队挂 Claude Code 和 Codex」。最稳的策略不是"二选一",而是 主选 + 战术增强:Claude Code 做日常 pair-coding、复杂重构、frontend 工作;Codex 做 PR Review、async 云端任务、安全检查。这是社区里有经验的团队最终的做法。
选型只是开始,落地才是关键。下面是一份四阶段、14 周的实施路线图,每个阶段都有明确的 owner、产出物、验收标准、退出条件。这份表可以直接拿去立项。
Owner:架构组 + 2 位 senior 工程师
动作:抓团队近 30 天 10 个真实 PR / bug fix,各跑 Claude Code + Opus 4.7 和 Codex + GPT-5.5 各 3 遍。记录:① 通过率;② diff 干净度(senior 盲评);③ 迭代轮次;④ 真实 API 账单。
产出:横评报告 + 真实账单 + 推荐再确认/翻转决策。
退出条件:CC 在团队真实任务上的速度优势 ≥ 15%、成本优势 ≥ 30%(即对外榜单的下沿)。如未达,触发"翻转复评"。
Owner:DevOps + 试点组 lead
动作:① 采购 Claude Code Team 套餐(测算 5-8 人 × $100/seat = $500-800/月),配 ZDR;② 建立项目级 CLAUDE.md(团队代码规范、技术栈、命名约定、测试要求);③ 配置 3-5 个核心 hooks(pre-commit 强制测试、敏感文件保护、PR 模板自动注入);④ 接入团队 MCP server(数据库 schema、内部 wiki、Jira);⑤ 周度复盘真实账单 + 工时收益。
产出:① 试点周报模板;② CLAUDE.md v1;③ hooks 配置;④ 真实 ROI 数字。
退出条件:试点组人均每周节省工时 ≥ 5 小时;账单 ≤ 预算上限(每人每月 ≤ $300 含订阅 + API)。
Owner:IT/DevOps + 各组 tech lead
动作:① 全员开 Team / Enterprise 账号,SSO + ZDR + MDM 推送 CLAUDE.md;② 在 GitHub repo 启用 Codex Cloud(用于 PR Review 和夜间批量 task);③ 培训(2 小时入门 + 4 小时进阶 + 工作坊);④ 建立内部"agent recipe 库"(团队总结的高频 prompt + workflow);⑤ 月度账单回顾 + 用量异常告警。
产出:① 全员上线 ≥ 80% 周活;② Codex 接管 PR Review 自动化;③ Recipe 库 ≥ 20 条高频模板。
退出条件:周活 ≥ 80%、CSAT ≥ 4/5、月度账单稳定在预算 ±15%。
Owner:架构组 + 安全合规 + 财务
动作:① 季度回顾榜单与价格变动(模型升级 / 价格降价 / 新 agent 出现);② 月度审计 hook 日志,确保敏感数据未外泄;③ 每月输出"工时节省 vs 账单成本"对照表归档管理层;④ 建立"AI agent 滥用红线"(禁止处理 PII / 客户数据 / 密钥);⑤ 持续维护 Recipe 库 + CLAUDE.md;⑥ 在团队代码评审中加入"AI 协作痕迹声明"(让 review 者知道哪部分是 AI 写的)。
产出:① 治理 SOP;② 季度 ROI 报告;③ 安全合规审计报告。
退出条件:无,治理是持续动作。
| 项目 | 5 人试点 / 月 | 20 人全员 / 月 | 50 人 / 月 | 说明 |
|---|---|---|---|---|
| Claude Code Team 订阅 | $500 | $2,000 | $5,000 | $100/seat 包月 |
| API 超量(重度用户 30% 概率溢出) | $300 | $1,500 | $4,000 | buffer,按真实账单结算 |
| Codex 战术接入(PR Review + Cloud) | $200 | $800 | $2,000 | pay-as-you-go,按 PR 量 |
| 培训 + Recipe 沉淀(一次性) | $2,000(首月) | $5,000(首月) | $10,000(首月) | 外部讲师 + 内部 workshop |
| 月度稳态合计 | $1,000 | $4,300 | $11,000 | ≈ ¥7,500 / ¥31,000 / ¥80,000 (7.2 汇率) |
| 预期工时节省(保守) | $8,000+ | $32,000+ | $80,000+ | 按 5 小时/人/周 × $50/h(全员保守) |
| 净 ROI | ≈ 8x | ≈ 7x | ≈ 7x | 不算"提升质量"和"加速产品迭代"的间接收益 |
① 设月度账单上限:超出 30% 自动报警,超出 50% 自动切到只读模式。② 禁止个人账号挂团队 repo,所有 agent 必须走团队 SSO。③ API key 季度轮换,泄露事件强制 stop loss。④ Opus 4.7 新 tokenizer 可能比同文本多用 35% token,buffer 必须留足。
选型不是一次性决策。下面是 8 个值得季度监控的信号,每一个都对应明确的"翻转动作"。这份表也建议放在团队 wiki 里,让架构组每季度回看一次:
| # | 监控信号 | 影响 | 触发动作 |
|---|---|---|---|
| 1 | Anthropic 收紧 Claude Code 用量配额、订阅价大幅上调 | 高 | 启动 Codex + GPT-5.5 并行 PoC,准备主备切换 |
| 2 | OpenAI 推出 GPT-5.6 / Codex 大版本升级,综合得分超过 Opus 4.7 ≥ 5 分 | 中 | 季度复评,启动 30 天 A/B 测试 |
| 3 | Cursor CLI + Opus 4.7 维持榜首,且 Cursor 推出企业方案 | 中 | 评估 Cursor 是否值得替换 Claude Code(注意 vendor lock-in 风险) |
| 4 | 开源模型(GLM / Kimi / DeepSeek)在团队真实任务上 ≥ 90% Claude Code 水平 | 高 | 启动"Claude Code + 开源模型"混挂方案,可降本 70%+ |
| 5 | GitHub Agent HQ 推出统一企业治理平台,支持多 agent 联挂 | 高 | 把 Codex 从"战术增强"升级为"标准侧轨",纳入 Agent HQ 统一治理 |
| 6 | 团队真实月账单连续 2 个月超预算 50%+ | 高 | 启动"轻量任务降级到 Sonnet 4.6 或 Haiku"策略,Recipe 库分级 |
| 7 | 合规审计发现 hook 日志中有敏感数据外泄 | 高 | 立即触发应急响应:撤销 key、审计影响范围、迁移到 Bedrock/Vertex 私有部署 |
| 8 | 新出现的 agent(如 GitHub Copilot Workspace、Devin)综合得分 ≥ 65 | 中 | 纳入下一季度 PoC 名单 |
这是绕不开的事实:Anthropic 和 OpenAI 都未对大陆开放官方 API。合规路径(企业级):① AWS Bedrock 东京 / 首尔 / 新加坡区,2026-02 起已纳入 HIPAA 合规;② Google Vertex AI(已支持 10 个 EU 区 + 部分亚太);③ Microsoft Foundry(2026 起官方支持 Claude Code,在 Azure 基础设施跑、数据保留在合规边界)。社区路径:CRS (Claude Relay Service)、cc-switch、LiteLLM 等中转 — 法务必须签字确认。任何走中转方案的方案,都必须写明数据归属和审计权限。
选型决策可以季度复评,
但"翻转动作"必须提前写好。
Artificial Analysis 榜单上 Claude Code + Opus 4.7 与 Codex + GPT-5.5 都是 60 分,看起来是平局。但当我们扣掉速度(CC 快 22%)、扣掉成本(CC 省 44%)、扣掉可治理性(CC 有 26 hooks + 5 层 cascading),"假平局"就变成了真差距。对绝大多数产研团队(中等规模、注重质量、注重合规、有月度预算),Claude Code + Opus 4.7 是主选;Codex + GPT-5.5 是备选,在 GitHub-native / ChatGPT Enterprise 已绑定 / 异步重负载三个场景下战术接入。
Q1 答案:榜单可信。原始出处是 Artificial Analysis(artificialanalysis.ai/agents/coding-agents),358 道题 × 3 轮,3 个独立基准等权合成,使用默认配置防止特调过拟合。
Q2 答案:同 60 分下,CC 单任务快 1.3 分钟、省 $0.97。10 人团队按日均 10 任务粗算,年节省 ≈ $32,000 + 2,500 工时。加上 ZDR + 多云合规 + 26 hooks 可治理性,综合优势压倒名字相似度。
Q3 答案:三个翻转条件 — ① GitHub PR 占工作流 60%+;② 已签 ChatGPT Enterprise;③ 需要大量 fire-and-forget 云端 async 重负载。任何一个达到,把 Codex 升为主选或与 CC 并轨。
Q4 答案:5 人试点月度 ≈ $1,000(¥7,500);20 人全员 ≈ $4,300(¥31,000);50 人 ≈ $11,000(¥80,000)。配 5-10x token buffer,设月度账单上限 + 自动告警。预期净 ROI ≈ 7-8 倍,不算质量提升。
Q5 答案:合规走 Bedrock(东京/首尔/新加坡) / Vertex / Microsoft Foundry 三选一,ZDR 默认开启。大陆访问也通过这三条路径走,法务过 Anthropic + 云供应商双约定。社区中转方案仅限非生产/非敏感场景。
Q6 答案:架构组定 CLAUDE.md 规范、安全合规月度审计 hook 日志、财务月度账单回顾、各组 tech lead 维护 Recipe 库。第 11 周起进入治理阶段是持续动作,季度复评榜单与价格。
这是绝大多数读者的场景。直接按本文方案执行:Claude Code Team 订阅 + Bedrock 东京/首尔区做合规底座 + Codex Cloud 战术接入做 PR Review。试点 4 周、推广 4 周、治理常态化。月度预算控制在 ¥7,500-31,000 区间。第一年关键不是省钱,是把 Recipe 库 + CLAUDE.md 沉淀下来 — 这是团队真正的资产,工具可换、资产不可换。
触发条件 B 已满足,建议反推:Codex 主选,Claude Code 走 API 试点做对比。立项时直接利用现有 SCIM/EKM/SSO 框架,避免重新走法务和 IT 流程。但坚持做 2 周 PoC,用团队真实任务验证 Codex 在你们栈上的实际表现 — 不要直接照搬榜单。配置 Codex profiles(careful / deep-review)做权限分级,启用 Codex Cloud 做夜间 batch 重构。
触发条件 C 中部分满足。建议起步用 Claude Code Pro($20/月) + API 按需,等用量稳定后再决定升级 Team / Max。同时挂 Codex pay-as-you-go 作为试错备份。优先把 CLAUDE.md 写好,核心 hooks 配上(即使 Pro 单人订阅也能用)。不要急着推 Recipe 库 — 创业团队的工作流变得快,过早 codify 反而是包袱。等团队稳定 + 用量稳定再走标准化。
榜单只是参考,
真正的差距在落地。
· Artificial Analysis · Coding Agent Index(原始榜单) https://artificialanalysis.ai/agents/coding-agents
· Artificial Analysis · Coding Agents Benchmarking Methodology https://artificialanalysis.ai/methodology/coding-agents-benchmarking
· Scale AI · SWE-Bench Pro Leaderboard(公开数据集) https://labs.scale.com/leaderboard/swe_bench_pro_public
· SWE-Bench Pro 论文(arXiv 2509.16941) https://arxiv.org/pdf/2509.16941
· Laude 研究院 · Terminal-Bench v2 https://www.tbench.ai/
· OpenAI Codex · Models & GPT-5.5 接入 https://developers.openai.com/codex/models
· OpenAI Codex · Pricing https://developers.openai.com/codex/pricing
· OpenAI Codex · GitHub Code Review 集成 https://developers.openai.com/codex/integrations/github
· OpenAI Codex · Changelog(含 PR Review Pane 2026-04 更新) https://developers.openai.com/codex/changelog
· Anthropic Claude API · Pricing(Opus 4.7 / Sonnet 4.6 / Haiku 4.5) https://platform.claude.com/docs/en/about-claude/pricing
· Claude Code · Zero Data Retention(ZDR) https://code.claude.com/docs/en/zero-data-retention
· Anthropic Claude API · Data Retention 政策 https://platform.claude.com/docs/en/build-with-claude/api-and-data-retention
· Microsoft Foundry · 配置 Claude Code(企业部署) https://learn.microsoft.com/zh-cn/azure/foundry/foundry-models/how-to/configure-claude-code
· GitHub Blog · Pick your agent — Use Claude and Codex on Agent HQ https://github.blog/news-insights/company-news/pick-your-agent-use-claude-and-codex-on-agent-hq/
· Codex CLI vs Claude Code 2026 — Architecture, Pricing, China Access https://blakecrosley.com/blog/codex-vs-claude-code-2026
· Claude Code vs Codex 2026 — Totalum 横评 https://www.totalum.app/blog/claude-code-vs-codex-2026
· Developers Digest · Claude Code Agent Teams、Subagents、MCP 2026 Playbook https://www.developersdigest.tech/blog/claude-code-agent-teams-subagents-2026
· CloudZero · Claude Opus 4.7 Pricing 实战分析(含新 tokenizer 影响) https://www.cloudzero.com/blog/claude-opus-4-7-pricing/
· AWS 官方博客 · Claude Code 接入自建开源模型(企业私有化降本实践) https://aws.amazon.com/cn/blogs/china/claude-code-open-source-model-enterprise-practice/
· Claude Relay Service (CRS) 国内中转(社区方案,法务需评估) https://github.com/Wei-Shaw/claude-relay-service