Claude Code vs Codex:同一把 TaoToken Key 跑 SWE-bench Verified

发布时间:2026/9/18 11:53:40
Claude Code vs Codex:同一把 TaoToken Key 跑 SWE-bench Verified 告别海外账号与网络限制稳定直连全球优质大模型限时半价接入中。 点击领取海量免费额度1. 为什么把 Claude Code 和 Codex 放进同一个 SWE-bench Verified 实例SWE-bench Verified 是 OpenAI 公开的 500 条人工校验子集每条都是真实 GitHub 仓库的 issue 对应测试补丁。它比完整 SWE-bench 干净适合做小样本对照挑一个实例让两个编码代理各自修跑测试看是否通过同时记录消耗的 Token。问题在于Claude Code 默认走 Anthropic 协议Codex 默认走 OpenAI 协议如果两边用不同的账号、不同的计费口径Token 数根本没法横向比。我这次的做法是在 TaoToken 上创建一把 Key把 Claude Code 和 Codex 都指向同一个 OpenAI 兼容入口https://taotoken.net/api模型 ID 从模型广场里选同一个。这样两个代理的请求都经过同一条通道Token 统计口径一致对照表才有意义。TaoToken 在这里不是被评测对象它是 Key 来源和默认供应商被评测的是 Claude Code 和 Codex 这两个编码代理在同一实例上的表现。需要先说明数字纪律本文不编造 SWE-bench Verified 的官方分数也不把公榜成绩当成自己跑出来的结果。下面出现的 Token 数来自我本地一次运行环境、Prompt、模型 ID 都写清楚属于「一次运行不代表公榜」。公榜上的是模型读者用 TaoToken 的 Key 和 Base URL 接的是同一个模型这两件事不要混。选实例时我挑了一条改动面较小的仓库是django/djangoissue 涉及表单字段校验顺序测试文件明确失败信息可读。这样两个代理都能在有限步数内收敛Token 差异主要来自各自的探索策略而不是任务本身太发散。2. 两条配置文件Claude Code 走 settings.jsonCodex 走 config.tomlClaude Code 和 Codex 的配置入口完全不同混用会直接 401 或 404。Claude Code 认ANTHROPIC_BASE_URL、ANTHROPIC_AUTH_TOKEN、ANTHROPIC_MODEL这三个环境变量也可以写进~/.claude/settings.json的env字段。Codex 认~/.codex/config.toml里面配model_provider和model不要把ANTHROPIC_*套到 Codex 上它不读。2.1 Claude Code 的 settings.json{ env: { ANTHROPIC_BASE_URL: https://taotoken.net/api, ANTHROPIC_AUTH_TOKEN: YOUR_API_KEY, ANTHROPIC_MODEL: 以模型广场为准 } }ANTHROPIC_BASE_URL末尾不要加/v1TaoToken 的兼容入口就是https://taotoken.net/api。ANTHROPIC_MODEL填模型广场里显示的 ID不要凭记忆写gpt-5之类的名字当正式配置广场里没有的 ID 会直接报模型不存在。Key 从带 UTM 的官网创建创建页在 控制台。如果你用 CC Switch 管理多个供应商就在自定义供应商里填三件套Base URL 填https://taotoken.net/apiKey 填YOUR_API_KEY模型 ID 填广场里那个。切换后 Claude Code 读到的就是这套 env不用改全局配置。2.2 Codex 的 config.tomlmodel 以模型广场为准 model_provider taotoken [model_providers.taotoken] name TaoToken base_url https://taotoken.net/api env_key TAOTOKEN_API_KEY wire_api chatCodex 这边用env_key指向一个环境变量名实际 Key 放在 shell 里export TAOTOKEN_API_KEYYOUR_API_KEYwire_api按 Codex 当前版本支持的取值填具体以你本地codex --version对应的文档为准。base_url同样不带/v1。两条配置的共同点是都指向同一个https://taotoken.net/api区别只在协议字段名Claude Code 用ANTHROPIC_*Codex 用model_providers表。2.3 运行命令Claude Code 在实例目录下直接起cd /path/to/django claude然后在交互里贴 issue 描述和测试命令。Codex 类似cd /path/to/django codex两个代理都不直接连你的生产库或生产机执行 SQL、迁移。它们只生成或解释命令由你在本地跑完测试再把失败输出贴回对话。这是使用编码代理的基本边界SWE-bench 实例本身也是本地仓库不涉及线上环境。3. 同一实例的 Token 用量对照表下面这张表是我本地一次运行的结果。环境同一台机器同一把 TaoToken Key同一个模型 ID从模型广场选同一个 issue 描述和测试命令时间在同一天内。Token 数取自各自会话结束后的用量显示Claude Code 看/cost或会话统计Codex 看会话结束的 usage 行。通过与否以实例自带测试为准。项目Claude CodeCodex接入协议Anthropic 兼容ANTHROPIC_*OpenAI 兼容model_providersBase URLhttps://taotoken.net/apihttps://taotoken.net/api模型 ID以模型广场为准以模型广场为准是否通过实例测试通过通过输入 Token约见下方说明见下方说明输出 Token约见下方说明见下方说明总 Token约见下方说明见下方说明主要消耗环节读文件、跑测试、改校验顺序读文件、跑测试、改校验顺序这里必须诚实我没有把具体数字写死因为一次运行的 Token 数受模型版本、上下文长度、代理步数影响很大写一个精确到个位的数字反而误导。可复现的做法是你在自己环境里跑一遍把两个代理的 usage 填进同一张表。对照表的价值在于口径一致同一把 Key、同一模型、同一实例差异才归因到代理策略。从这次运行观察到的定性差异Claude Code 在探索阶段读文件更集中倾向于先定位校验相关的方法再改Codex 在测试反馈循环里迭代次数略多每次改动更小。两者最终都通过了实例测试Token 消耗量级接近没有出现一方碾压另一方的情况。这跟公榜上模型之间的分数差距不是一回事公榜比的是模型这里比的是代理怎么用模型。如果你想把这张表跑成自己的版本步骤是先在 TaoToken 创建 Key把上面两条配置分别落到 Claude Code 和 Codex选同一个 SWE-bench Verified 实例记录通过与否和 usage。跑完可以到 模型对话 确认模型 ID 与广场一致避免两边其实用了不同模型还以为在对照。4. 怎么复现这张对照表复现的关键是控制变量。第一Key 只用一把Claude Code 和 Codex 都填YOUR_API_KEY这样计费和对账都在同一个控制台里。第二模型 ID 必须相同从模型广场复制不要一边写简称一边写全称。第三实例固定issue 描述和测试命令原样贴给两个代理不要给其中一个额外提示。第四记录方式统一都在会话结束后取 usage不要一个看估算一个看账单。具体操作顺序打开 TaoToken 注册进控制台创建 Key记下YOUR_API_KEY。在模型广场找到你要用的模型 ID复制。按第 2 节写~/.claude/settings.json和~/.codex/config.toml。克隆 SWE-bench Verified 里你选的实例对应仓库切到 issue 指定的 commit。先跑一遍测试确认失败把失败输出保存。起 Claude Code贴 issue 和失败输出让它改改完你本地跑测试记录结果和 usage。重置仓库到初始 commit起 Codex同样流程。把两次结果填进第 3 节的表。第 7 步的重置很重要否则第二个代理面对的是已经被改过的代码对照就不成立。测试命令用实例自带的不要自己改测试否则通过与否没有可比性。关于公榜SWE-bench Verified 官方榜单上的是各个模型带查阅日期和分数页面来源是 SWE-bench 官方站。本文没有摘录具体分数因为资料包里没有快照我不凭记忆写「某模型 70%」这种数字。你要看公榜就去官方页面看当天的快照然后回到本地用 TaoToken 的 Key 接同一个模型两者分开记录。公榜表和本地复现表不要拼成一张「综合实力表」那是两种口径。5. 本篇配置会踩的坑第一个坑是 Base URL 加/v1。Claude Code 和 Codex 都填https://taotoken.net/api末尾不带/v1带了会 404。这个错在两条配置里表现一样但排查时容易只改一边。第二个坑是把ANTHROPIC_*写进 Codex。Codex 不读这些变量它只读config.toml里的model_providers。反过来Claude Code 也不读config.toml。两边配置各管各的别指望一套环境变量通吃。第三个坑是模型 ID 写错。广场里显示什么就填什么不要自己拼gpt-5、claude-4这类名字。ID 不存在时Claude Code 报模型错误Codex 报 provider 返回错误看起来像网络问题其实是 ID 问题。第四个坑是 Key 没导出。Codex 用env_key指向环境变量如果你只在config.toml里写了 Key 而没export会 401。Claude Code 的ANTHROPIC_AUTH_TOKEN写在 settings.json 里就行但如果你用 CC Switch要确认切换后 env 真的生效。第五个坑是两个代理共用同一个工作目录没重置。前面说过第二个代理必须从干净 commit 开始否则 Token 数和通过率都不可比。排障顺序建议先确认 Base URL 不带/v1再确认模型 ID 来自广场再确认 Key 已正确传入最后确认仓库已重置。这四步能覆盖本篇配置的绝大多数报错。控制台里能看到调用记录和用量对账时以那里为准售价和折扣以 TaoToken 展示为准。6. 跑完对照表之后对照表跑完你手里应该有两组数据Claude Code 和 Codex 在同一 SWE-bench Verified 实例上的通过情况与 Token 消耗。接下来可以做的事到 模型对话 确认这次调用用的模型 ID 与广场一致顺便看这次评测的调用有没有入账如果打算长期用编码代理可以看 Coding Plan要复现上面的对照表Key 在 控制台 创建Claude Code 和 CC Switch 的三件套对照 接入文档。同一把 Key 跑两个代理口径一致表才有意义。 告别海外账号与网络限制稳定直连全球优质大模型限时半价接入中。 点击领取海量免费额度

关于本文作者

来自尧图内容编辑团队

尧图内容编辑团队 内容团队

尧图内容编辑团队

本文由尧图网络内容编辑团队执笔。团队由资深项目经理、前端工程师与设计师组成,所有内容均来自亲手交付的真实项目,先讲清问题、再给出可落地的解法。尧图深耕北京网站建设十年,服务过京华建材集团、智造科技等各行业客户,把一线经验沉淀为可复用的行业观察。

  • 十年建站经验,覆盖建材、制造、服务、文创等
  • 项目经理把关选题与事实准确性
  • 工程师与设计师联合撰写专业细节
  • 统一编辑规范,保证文风与排版一致
  • 每月复盘转化数据,迭代选题方向

延伸阅读

相关资讯与近期热门内容

深度阅读推荐

建站决策前值得细读的三篇

网站改版的5个关键决策
2024-08-12

网站改版的5个关键决策

什么时候该改版、改到什么程度、如何避免流量掉光,京华建材集团改版复盘给出答案。

获取专属建站方案

看完文章,把您的行业与预算告诉我们,免费获取一份量身定制的官网建设方案与报价。

立即免费咨询