TECH RESEARCH · Vol.1 No.01 2026.05.18
选型决策 · 立项就绪
产研团队工具栈 · Claude Code (Opus 4.7) vs Codex CLI (GPT-5.5)

主选 Claude Code 4.7。

Artificial Analysis 榜单上 60 = 60 的"假平局",扣掉速度、扣掉成本、扣掉可治理性之后,真正的差距落在四个变量上 — 它们决定产研团队未来 12 个月的工作流。Codex + GPT-5.5 留作三种场景的战术备选。

系列 / 工具栈选型推演 · Vol.1 No.01 发布 / 2026-05-18 关键词 / Claude Code · Codex · Opus 4.7 · GPT-5.5 · 选型 · 落地方案
推荐结论:主选 Claude Code + Opus 4.7,备选 Codex + GPT-5.5 — 总分打平下,速度快 22%、API 成本省 44%、可治理性更强

Artificial Analysis 2026-05 发布的「Coding Agent Index」是首个把"模型 + 工具"捆绑测评的榜单:358 道题、3 轮 pass@1。Claude Code + Opus 4.7 与 Codex + GPT-5.5 综合得分都是 60 分(并列第二,仅次于 Cursor CLI + Opus 4.7 的 61 分)。相同质量下,前者单任务耗时 5.8 分钟 vs 7.1 分钟,API 成本 $1.24 vs $2.21。在四个决定变量(GitHub 强度、企业账号、成本敏感度、治理偏好)中,产研团队的通用画像更匹配 Claude Code,Codex 留作备选用于特定场景。

综合得分
60 = 60
CC 与 Codex 并列第二
单任务耗时
5.8 vs 7.1 min
CC 快 22%
单任务 API 成本
$1.24 vs $2.21
CC 省 44%
推广周期
14 周
PoC → 全员上线
Q1这份榜单可信吗?原始出处在哪里?方法论站得住脚吗?
Q2同样 60 分,凭什么主选 Claude Code 而不是 Codex?是不是因为名字像?
Q3什么情况下应该反过来 — 把 Codex 升级为主选?
Q4采购成本到底多少?Pro / Max / Team / Enterprise / API 怎么选?月度预算怎么报?
Q5合规怎么过?代码会不会被外泄?ZDR / Bedrock / Vertex / Foundry 怎么选?
Q614 周推广完之后怎么治理?谁来定规范、谁来管账单、谁来防滥用?
ACT I · 命题与事实The 60 = 60 illusion

01一手榜单 — 60 = 60,但不是平局。

2026 年绕不开的产研决策:挑一个 AI 编程 Agent 做主工作流。Artificial Analysis 在 2026 年 5 月发布的「Coding Agent Index」首次把"模型 + Agent 工具"作为一个整体打分 — 这是目前最严肃的一份横评基准。这一节做三件事:确认原始出处、读懂榜单方法论、把「假平局」拆成真差距。

原始出处:Artificial Analysis 的「Coding Agent Index」

榜单原始页面 artificialanalysis.ai/agents/coding-agents,2026 年 5 月正式上线。核心创新点:不只测模型,而是把"模型 + Agent 工具"作为一个整体打分 — 这是与传统模型榜单(MMLU、HumanEval 之流)的根本区别。同一个 Opus 4.7,放进 Cursor CLI 拿 61 分,放进 Claude Code 拿 60 分;模型一样,工具不一样,结果就不一样。

方法论页 artificialanalysis.ai/methodology/coding-agents-benchmarking 披露了所有细节:

基准评测领域题量重复题目类型评分方式
SWE-Bench-Pro-Hard-AA代码修复1503代码补丁 / 仓库改动测试套件 pass/fail · pass@1
Terminal-Bench v2终端任务84*3终端命令执行测试套件 pass/fail · pass@1
SWE-Atlas-QnA代码理解 Q&A1243开放回答评分量表 · pass@1
* Terminal-Bench v2 原本 89 道,因环境兼容性问题剔除 5 道。三个基准均出自 Scale AI / Laude 研究院,业界认可度高。

三个基准合计 358 道题,每道跑 3 次,取 pass@1 平均分,合成「Coding Agent Index」(等权合成)。每个 Agent 用默认 reasoning 配置(reflects "default user experience"),意味着榜单测的是真实开发者拿到手就用的水平,不是经过调优的"高分模式"

方法论站得住脚的三个理由

358 道题 × 3 轮 = 1,074 次评测,样本量足够稀释偶然误差。② 3 个独立基准 + 等权合成,避免单一基准过拟合;Q&A / 代码修复 / 终端三类能力都覆盖。③ 默认配置,不允许 vendor 提交"特调"参数 — 这是该榜单与 SWE-Bench leaderboard 最大的区别。

榜单事实:总分排名与效率指标

Agent + Model得分单任务耗时单任务 API 成本平均 token / 任务
Cursor CLI + Opus 4.7 (Medium)617.8 min$1.47~1.5M
Claude Code + Opus 4.7 (Medium)605.8 min$1.24~1.7M
Codex + GPT-5.5 (Medium)607.1 min$2.21~1.7M
Cursor CLI + GPT-5.5 (Medium)586.2 min$1.61~1.5M
Claude Code + GLM-5.1 (智谱)5321.6 min$2.26~4.8M
Claude Code + Kimi K2.65041.5 min$0.76~3.7M
Claude Code + DeepSeek V4 Pro (High)5018.0 min$0.35~2.7M
Cursor CLI + Composer 2 (自研基于 Kimi K2.5)488.7 min$0.07~750K
Claude Code + Sonnet 4.6 (Medium)499.2 min$1.02~2.2M
Gemini CLI + Gemini 3.1 Pro (High)437.6 min$1.60~2.1M

真差距:三个被总分掩盖的事实

看完表格,三个事实立刻浮现 — 它们都被"60 = 60"这个标题数字掩盖了:

事实 1 · 速度差距是结构性的,不是噪声。Claude Code + Opus 4.7 的单任务耗时 5.8 分钟,全场最快;Codex + GPT-5.5 是 7.1 分钟。在 358 道题 × 3 轮 = 1,074 次任务的样本下,22% 的差距不可能是偶然 — 这是模型推理特征 + agent loop 设计共同的产物。把它换算成产研团队的日常:工程师每天若提 10 个任务,Claude Code 节省 13 分钟/人/天 ≈ 1 小时/人/周

事实 2 · 成本差距更大,且方向与速度一致。$1.24 vs $2.21 = 便宜 44%。token 用量两边相近(都在 1.7M 量级),差距主要来自单价 — Opus 4.7 的 API 价格是 $5 input / $25 output per M tokens,GPT-5.5 是 $5 input / $30 output per M tokens。出 token 越多,GPT-5.5 越贵

事实 3 · 同质量同 token,Codex 既慢又贵,意味着工程意义上 Codex 的 agent loop 效率偏低。这不是结论,但是值得标记的信号:Codex 在最近一年迭代的重点是 Cloud / GitHub PR Review / 自主性,在 CLI 本身的 token 经济学上没有 Claude Code 那种"快进快出"的内功优化。

60 不是平局。
是 Claude Code 用 78% 的资源做到了同样的 60。

ACT II · 四个决定变量Four variables that override the leaderboard

02速度和成本不是全部 — 还有四个变量决定团队 12 个月的工作流。

如果选型只看榜单,答案早出来了:Claude Code。但产研团队的选型还要看四个变量,它们任何一个翻转,都可能让 Codex 反超。把这四个变量摊到桌面上,选型决策才能站得住脚:

变量 1 · 团队的 GitHub 强度

团队画像Codex 优势Claude Code 优势判定
以 GitHub PR 为核心工作流(代码 review、CI/CD、Issues 闭环)原生 @codex review、PR Review Pane、Agent HQ、Codex Cloud 异步 fire-and-forget需要 GitHub App + 手工集成倾向 Codex
以本地编码 + 人工 commit/push 为主云端任务大多过度设计terminal-first、interactive、默认不静默推送倾向 Claude Code

变量 2 · 团队是否已绑定云供应商或 AI 企业账户

已有账户Codex 集成度Claude Code 集成度判定
ChatGPT Enterprise / OpenAI Business直接复用 SCIM/EKM/SSO/RBAC/域名验证,GPT-5.5 已含需要新签 Anthropic 企业合同倾向 Codex
Claude for Enterprise / AWS Bedrock / Microsoft Foundry / GCP Vertex AI需要单独走 OpenAI 合规ZDR 默认开启,Bedrock / Vertex / Foundry 部署链路成熟倾向 Claude Code
都没有 — 从零起步pay-as-you-go,无 seat 费,起步轻订阅制 ($20-200/seat) 月度成本可预测看团队规模,小团队 Codex,中大团队 CC

变量 3 · 成本敏感度与用量画像

用量画像Codex 成本结构Claude Code 成本结构判定
稳定重度用户(单人每天 >30 个任务)pay-as-you-go,OpenAI 自报 $100-200/dev/月订阅 Max $200/月或 Team $100/seat 封顶,超出走 API倾向 Claude Code(可预测)
低强度试探性使用(单人每天 <10 个任务)按量,空闲不花钱订阅有最低 $20/月起步倾向 Codex
波动巨大(项目期密集,日常稀疏)按量灵活订阅过剩,API 更划算倾向 Codex
真实成本警告 · 两边都披露过

无论选哪个,"真实仓库下 Agent 可能烧掉你天真估算的 5-10 倍 token"(参见 Totalum 等多篇横评)。OpenAI 官方披露 Codex 重度用户人均 $100-200/月;Anthropic 也提醒 3-agent subagents 团队比单 agent 多用 7 倍 token。任何月度预算估算必须加 5-10x buffer,这点必须写进采购预算。Opus 4.7 还有一个细节:新 tokenizer 对同样文本可能多用最多 35% token。

变量 4 · 安全沙箱 vs 可编程治理

团队治理偏好CodexClaude Code判定
偏好"OS 级硬隔离",放心让 agent 跑长任务macOS Seatbelt / Linux Landlock+seccomp 内核层拦截 syscall;Codex Cloud 隔离容器26 个 lifecycle hooks 在 application 层拦截倾向 Codex
偏好"规则可编程",代码规范、测试、PR 模板要 codifyprofiles (careful / deep-review) + AGENTS.md 开放标准5 层 cascading config(系统/企业/项目/用户/会话)+ 26 hooks + subagents 独立 context倾向 Claude Code
担心 agent 误删/误推默认"more autonomous",可能单次大动作不问默认安全:"不会静默 rm、不会自动 push main"倾向 Claude Code
ACT III · 推荐与备选Primary, backup, and the trigger to flip

03把四个变量套到产研团队上 — 主选 Claude Code,Codex 留作备选。

把上面四个变量套到一个"中等规模、混合栈、注重代码质量、注重合规"的产研团队画像(这是绝大多数中国产研团队的真实样貌),三个变量倾向 Claude Code,一个变量倾向 Codex(GitHub 强度高的团队)。但即使是 GitHub 重度团队,GitHub 已经推出 Agent HQ,允许同时挂 Claude Code 和 Codex — 这就意味着我们可以把 Codex 当作"特定场景增强",而不是"主工作流"。

★ 主选 · PRIMARY

Claude Code + Claude Opus 4.7

综合 60 · 速度 5.8 min · 成本 $1.24

为什么是它?

  • 同质量下最快、最省:60 分但 token 经济学最强
  • 订阅制可预测:Pro $20 / Max $100~$200 / Team $100/seat,适合规模化采购,月度预算可签字
  • 合规链路成熟:ZDR 默认开启,Bedrock(东京/首尔/新加坡)、Vertex AI、Microsoft Foundry 多云部署可选
  • 可治理性最强:26 个 lifecycle hooks + 5 层 cascading config + subagents 独立 context,可以把代码规范 codify 进 hooks
  • 默认行为安全:不会静默 rm,不会自动 push main,适合"人和 agent 紧密 pair"
  • MCP 生态最大:`claude mcp add` 极简,社区工具数倍于 Codex
○ 备选 · BACKUP

Codex + GPT-5.5 (Medium)

综合 60 · 速度 7.1 min · 成本 $2.21

什么时候应该升级为主选?

  • GitHub PR 是核心工作流:`@codex review` + PR Review Pane + Agent HQ 是 Anthropic 短期内追不上的产品形态
  • 已经签了 ChatGPT Enterprise:SCIM/EKM/SSO/RBAC 零成本复用
  • 需要大量 fire-and-forget 云端 async 任务:Codex Cloud 把任务丢给云沙箱跑完返 diff,无人值守
  • 对 OS 级隔离有强诉求:Seatbelt/Landlock/seccomp 比 application 层 hooks 更难逃逸
  • 用量波动巨大:pay-as-you-go,无 seat 费,空窗期不烧钱

主选 Claude Code 的三大支柱

支柱说明对团队的意义
① 效率同质量同 token 下,Claude Code 比 Codex 快 22%、省 44% API 成本10 人团队若每人每天提 10 个任务,年节省 ≈ $32,000 + 2,500 工时
② 可预测性订阅制(Team $100/seat 包月)+ ZDR 默认 + Bedrock/Vertex/Foundry 三大云部署月度预算可签字、合规过审、风控可解释。Codex 是 pay-as-you-go,账单波动大
③ 可治理性26 hooks + 5 层 cascading config + subagents + MCP 最成熟团队代码规范、测试要求、PR 模板可以全部 codify,沉淀成资产

备选 Codex 的三个触发条件 — 任何一个达到,就翻转

触发 A · GitHub-Native
If > 60%
PR-driven 工作流

判定条件

  • 团队 60% 以上代码改动通过 GitHub PR 闭环
  • 对自动化 review、async PR 编辑有刚需
  • 愿意用 GitHub Agent HQ 双挂

动作:Codex 升主 / CC 配 PoC

触发 B · 企业账户
If 已有
ChatGPT Enterprise

判定条件

  • 公司已签 ChatGPT Enterprise 合同
  • SCIM/EKM/SSO 已配,法务已过
  • 不想重启与 Anthropic 的合规走流程

动作:Codex 主选;CC 走 API 试点

触发 C · 异步重负载
If 需要
夜间 batch 重构

判定条件

  • 有大量"夜里跑批量重构"的诉求
  • 需要 OS 级硬隔离,worried about agent 误删
  • 能接受云端任务(数据出本机)

动作:Codex Cloud 做专项 / CC 做日常

混用建议(强烈建议)

GitHub 在 2026 年推出 Agent HQ,官方支持「同一团队挂 Claude Code 和 Codex」。最稳的策略不是"二选一",而是 主选 + 战术增强:Claude Code 做日常 pair-coding、复杂重构、frontend 工作;Codex 做 PR Review、async 云端任务、安全检查。这是社区里有经验的团队最终的做法。

ACT IV · 落地方案Fourteen weeks from zero to governed adoption

0414 周路线图 — 从 PoC 到全员治理。

选型只是开始,落地才是关键。下面是一份四阶段、14 周的实施路线图,每个阶段都有明确的 owner、产出物、验收标准、退出条件。这份表可以直接拿去立项。

第 1-2 周
PoC 阶段
POC对榜单结论的内部验证

Owner:架构组 + 2 位 senior 工程师

动作:抓团队近 30 天 10 个真实 PR / bug fix,各跑 Claude Code + Opus 4.7 和 Codex + GPT-5.5 各 3 遍。记录:① 通过率;② diff 干净度(senior 盲评);③ 迭代轮次;④ 真实 API 账单。

产出:横评报告 + 真实账单 + 推荐再确认/翻转决策。

退出条件:CC 在团队真实任务上的速度优势 ≥ 15%、成本优势 ≥ 30%(即对外榜单的下沿)。如未达,触发"翻转复评"。

第 3-6 周
试点阶段
PILOT5-8 人种子团队全量切换

Owner:DevOps + 试点组 lead

动作:① 采购 Claude Code Team 套餐(测算 5-8 人 × $100/seat = $500-800/月),配 ZDR;② 建立项目级 CLAUDE.md(团队代码规范、技术栈、命名约定、测试要求);③ 配置 3-5 个核心 hooks(pre-commit 强制测试、敏感文件保护、PR 模板自动注入);④ 接入团队 MCP server(数据库 schema、内部 wiki、Jira);⑤ 周度复盘真实账单 + 工时收益。

产出:① 试点周报模板;② CLAUDE.md v1;③ hooks 配置;④ 真实 ROI 数字。

退出条件:试点组人均每周节省工时 ≥ 5 小时;账单 ≤ 预算上限(每人每月 ≤ $300 含订阅 + API)。

第 7-10 周
推广阶段
ROLLOUT全员部署 + Codex 战术接入

Owner:IT/DevOps + 各组 tech lead

动作:① 全员开 Team / Enterprise 账号,SSO + ZDR + MDM 推送 CLAUDE.md;② 在 GitHub repo 启用 Codex Cloud(用于 PR Review 和夜间批量 task);③ 培训(2 小时入门 + 4 小时进阶 + 工作坊);④ 建立内部"agent recipe 库"(团队总结的高频 prompt + workflow);⑤ 月度账单回顾 + 用量异常告警。

产出:① 全员上线 ≥ 80% 周活;② Codex 接管 PR Review 自动化;③ Recipe 库 ≥ 20 条高频模板。

退出条件:周活 ≥ 80%、CSAT ≥ 4/5、月度账单稳定在预算 ±15%。

第 11 周起
治理阶段
GOVERN持续治理、安全、ROI 回溯

Owner:架构组 + 安全合规 + 财务

动作:① 季度回顾榜单与价格变动(模型升级 / 价格降价 / 新 agent 出现);② 月度审计 hook 日志,确保敏感数据未外泄;③ 每月输出"工时节省 vs 账单成本"对照表归档管理层;④ 建立"AI agent 滥用红线"(禁止处理 PII / 客户数据 / 密钥);⑤ 持续维护 Recipe 库 + CLAUDE.md;⑥ 在团队代码评审中加入"AI 协作痕迹声明"(让 review 者知道哪部分是 AI 写的)。

产出:① 治理 SOP;② 季度 ROI 报告;③ 安全合规审计报告。

退出条件:无,治理是持续动作。

预算估算(可直接套用)

项目5 人试点 / 月20 人全员 / 月50 人 / 月说明
Claude Code Team 订阅$500$2,000$5,000$100/seat 包月
API 超量(重度用户 30% 概率溢出)$300$1,500$4,000buffer,按真实账单结算
Codex 战术接入(PR Review + Cloud)$200$800$2,000pay-as-you-go,按 PR 量
培训 + Recipe 沉淀(一次性)$2,000(首月)$5,000(首月)$10,000(首月)外部讲师 + 内部 workshop
月度稳态合计$1,000$4,300$11,000≈ ¥7,500 / ¥31,000 / ¥80,000 (7.2 汇率)
预期工时节省(保守)$8,000+$32,000+$80,000+按 5 小时/人/周 × $50/h(全员保守)
净 ROI≈ 8x≈ 7x≈ 7x不算"提升质量"和"加速产品迭代"的间接收益
预算红线 · 必须写进采购单

设月度账单上限:超出 30% 自动报警,超出 50% 自动切到只读模式。② 禁止个人账号挂团队 repo,所有 agent 必须走团队 SSO。③ API key 季度轮换,泄露事件强制 stop loss。④ Opus 4.7 新 tokenizer 可能比同文本多用 35% token,buffer 必须留足

ACT V · 风险与监控What can flip the recommendation, and what to do

05八个监控信号 — 触发就动手,不要"再观察一下"。

选型不是一次性决策。下面是 8 个值得季度监控的信号,每一个都对应明确的"翻转动作"。这份表也建议放在团队 wiki 里,让架构组每季度回看一次:

#监控信号影响触发动作
1Anthropic 收紧 Claude Code 用量配额、订阅价大幅上调启动 Codex + GPT-5.5 并行 PoC,准备主备切换
2OpenAI 推出 GPT-5.6 / Codex 大版本升级,综合得分超过 Opus 4.7 ≥ 5 分季度复评,启动 30 天 A/B 测试
3Cursor CLI + Opus 4.7 维持榜首,且 Cursor 推出企业方案评估 Cursor 是否值得替换 Claude Code(注意 vendor lock-in 风险)
4开源模型(GLM / Kimi / DeepSeek)在团队真实任务上 ≥ 90% Claude Code 水平启动"Claude Code + 开源模型"混挂方案,可降本 70%+
5GitHub Agent HQ 推出统一企业治理平台,支持多 agent 联挂把 Codex 从"战术增强"升级为"标准侧轨",纳入 Agent HQ 统一治理
6团队真实月账单连续 2 个月超预算 50%+启动"轻量任务降级到 Sonnet 4.6 或 Haiku"策略,Recipe 库分级
7合规审计发现 hook 日志中有敏感数据外泄立即触发应急响应:撤销 key、审计影响范围、迁移到 Bedrock/Vertex 私有部署
8新出现的 agent(如 GitHub Copilot Workspace、Devin)综合得分 ≥ 65纳入下一季度 PoC 名单

合规与中国大陆访问的现实考量

两家都没有大陆官方 API

这是绕不开的事实:Anthropic 和 OpenAI 都未对大陆开放官方 API。合规路径(企业级):① AWS Bedrock 东京 / 首尔 / 新加坡区,2026-02 起已纳入 HIPAA 合规;② Google Vertex AI(已支持 10 个 EU 区 + 部分亚太);③ Microsoft Foundry(2026 起官方支持 Claude Code,在 Azure 基础设施跑、数据保留在合规边界)。社区路径:CRS (Claude Relay Service)、cc-switch、LiteLLM 等中转 — 法务必须签字确认。任何走中转方案的方案,都必须写明数据归属和审计权限。

选型决策可以季度复评,
但"翻转动作"必须提前写好。

底色判断 — 一句话结论。

Artificial Analysis 榜单上 Claude Code + Opus 4.7 与 Codex + GPT-5.5 都是 60 分,看起来是平局。但当我们扣掉速度(CC 快 22%)、扣掉成本(CC 省 44%)、扣掉可治理性(CC 有 26 hooks + 5 层 cascading),"假平局"就变成了真差距。对绝大多数产研团队(中等规模、注重质量、注重合规、有月度预算),Claude Code + Opus 4.7 是主选;Codex + GPT-5.5 是备选,在 GitHub-native / ChatGPT Enterprise 已绑定 / 异步重负载三个场景下战术接入。

"60 不是平局。
是 Claude Code 用 78% 的资源做到了同样的 60。"

Q1 答案:榜单可信。原始出处是 Artificial Analysis(artificialanalysis.ai/agents/coding-agents),358 道题 × 3 轮,3 个独立基准等权合成,使用默认配置防止特调过拟合。

Q2 答案:同 60 分下,CC 单任务快 1.3 分钟、省 $0.97。10 人团队按日均 10 任务粗算,年节省 ≈ $32,000 + 2,500 工时。加上 ZDR + 多云合规 + 26 hooks 可治理性,综合优势压倒名字相似度。

Q3 答案:三个翻转条件 — ① GitHub PR 占工作流 60%+;② 已签 ChatGPT Enterprise;③ 需要大量 fire-and-forget 云端 async 重负载。任何一个达到,把 Codex 升为主选或与 CC 并轨。

Q4 答案:5 人试点月度 ≈ $1,000(¥7,500);20 人全员 ≈ $4,300(¥31,000);50 人 ≈ $11,000(¥80,000)。配 5-10x token buffer,设月度账单上限 + 自动告警。预期净 ROI ≈ 7-8 倍,不算质量提升。

Q5 答案:合规走 Bedrock(东京/首尔/新加坡) / Vertex / Microsoft Foundry 三选一,ZDR 默认开启。大陆访问也通过这三条路径走,法务过 Anthropic + 云供应商双约定。社区中转方案仅限非生产/非敏感场景。

Q6 答案:架构组定 CLAUDE.md 规范、安全合规月度审计 hook 日志、财务月度账单回顾、各组 tech lead 维护 Recipe 库。第 11 周起进入治理阶段是持续动作,季度复评榜单与价格。

06三类团队画像 — 不同情况怎么落地。

① 中小产研团队(5-20 人,中国国内,混合栈)

这是绝大多数读者的场景。直接按本文方案执行:Claude Code Team 订阅 + Bedrock 东京/首尔区做合规底座 + Codex Cloud 战术接入做 PR Review。试点 4 周、推广 4 周、治理常态化。月度预算控制在 ¥7,500-31,000 区间。第一年关键不是省钱,是把 Recipe 库 + CLAUDE.md 沉淀下来 — 这是团队真正的资产,工具可换、资产不可换。

② 大型企业 / 已有 ChatGPT Enterprise 合同的团队

触发条件 B 已满足,建议反推:Codex 主选,Claude Code 走 API 试点做对比。立项时直接利用现有 SCIM/EKM/SSO 框架,避免重新走法务和 IT 流程。但坚持做 2 周 PoC,用团队真实任务验证 Codex 在你们栈上的实际表现 — 不要直接照搬榜单。配置 Codex profiles(careful / deep-review)做权限分级,启用 Codex Cloud 做夜间 batch 重构。

③ 创业团队 / 用量波动大 / 不要订阅成本压力

触发条件 C 中部分满足。建议起步用 Claude Code Pro($20/月) + API 按需,等用量稳定后再决定升级 Team / Max。同时挂 Codex pay-as-you-go 作为试错备份。优先把 CLAUDE.md 写好,核心 hooks 配上(即使 Pro 单人订阅也能用)。不要急着推 Recipe 库 — 创业团队的工作流变得快,过早 codify 反而是包袱。等团队稳定 + 用量稳定再走标准化

榜单只是参考,
真正的差距在落地。

主要数据与参考资料 / Sources

· Artificial Analysis · Coding Agent Index(原始榜单) https://artificialanalysis.ai/agents/coding-agents

· Artificial Analysis · Coding Agents Benchmarking Methodology https://artificialanalysis.ai/methodology/coding-agents-benchmarking

· Scale AI · SWE-Bench Pro Leaderboard(公开数据集) https://labs.scale.com/leaderboard/swe_bench_pro_public

· SWE-Bench Pro 论文(arXiv 2509.16941) https://arxiv.org/pdf/2509.16941

· Laude 研究院 · Terminal-Bench v2 https://www.tbench.ai/

· OpenAI Codex · Models & GPT-5.5 接入 https://developers.openai.com/codex/models

· OpenAI Codex · Pricing https://developers.openai.com/codex/pricing

· OpenAI Codex · GitHub Code Review 集成 https://developers.openai.com/codex/integrations/github

· OpenAI Codex · Changelog(含 PR Review Pane 2026-04 更新) https://developers.openai.com/codex/changelog

· Anthropic Claude API · Pricing(Opus 4.7 / Sonnet 4.6 / Haiku 4.5) https://platform.claude.com/docs/en/about-claude/pricing

· Claude Code · Zero Data Retention(ZDR) https://code.claude.com/docs/en/zero-data-retention

· Anthropic Claude API · Data Retention 政策 https://platform.claude.com/docs/en/build-with-claude/api-and-data-retention

· Microsoft Foundry · 配置 Claude Code(企业部署) https://learn.microsoft.com/zh-cn/azure/foundry/foundry-models/how-to/configure-claude-code

· GitHub Blog · Pick your agent — Use Claude and Codex on Agent HQ https://github.blog/news-insights/company-news/pick-your-agent-use-claude-and-codex-on-agent-hq/

· Codex CLI vs Claude Code 2026 — Architecture, Pricing, China Access https://blakecrosley.com/blog/codex-vs-claude-code-2026

· Claude Code vs Codex 2026 — Totalum 横评 https://www.totalum.app/blog/claude-code-vs-codex-2026

· Developers Digest · Claude Code Agent Teams、Subagents、MCP 2026 Playbook https://www.developersdigest.tech/blog/claude-code-agent-teams-subagents-2026

· CloudZero · Claude Opus 4.7 Pricing 实战分析(含新 tokenizer 影响) https://www.cloudzero.com/blog/claude-opus-4-7-pricing/

· AWS 官方博客 · Claude Code 接入自建开源模型(企业私有化降本实践) https://aws.amazon.com/cn/blogs/china/claude-code-open-source-model-enterprise-practice/

· Claude Relay Service (CRS) 国内中转(社区方案,法务需评估) https://github.com/Wei-Shaw/claude-relay-service

Tech Research · Vol.1 No.01 · 2026-05-18
60 不是平局 — 是 Claude Code 用 78% 的资源做到了同样的 60。