GPT-6.1 Sol 与 Claude Sonnet 5.5 的标价都是每百万输入 token $2、每百万输出 token $10,而且发布仅相隔一天:Sonnet 5.5 是 2026 年 9 月 28 日,GPT-6.1 Sol 是 9 月 29 日。两家厂商都没有做过彼此的基准测试。OpenAI 把 GPT-6.1 Sol 与 Claude Opus 5.5 和 Fable 5.1 做对比,Anthropic 则把 Sonnet 5.5 与 GPT-6 Sol(上一代 Sol)做对比。诚实的选法是让两者在你自己的任务上跑一遍,比较单任务成本,而不是每 token 价格。
下文包括:规格与价格并排对比、各家声明了什么以及对比的是哪个模型、第三方数据(全部针对 GPT-6 Sol,而非 6.1),以及一套你可以用 Apifox 自行完成对比的方法。想单独了解每个模型,请阅读 what is GPT-6.1 Sol 和 what is Claude Sonnet 5.5。
GPT-6.1 Sol vs Claude Sonnet 5.5:规格与定价
来源:OpenAI 的定价页、Anthropic 的 Sonnet 5.5 概览和定价页,以及下文链接的 GPT-6.1 Sol 模型页。
| GPT-6.1 Sol | Claude Sonnet 5.5 | |
|---|---|---|
| 模型 ID | gpt-6.1-sol |
claude-sonnet-5-5(Bedrock:anthropic.claude-sonnet-5-5) |
| 发布时间 | 2026 年 9 月 29 日 | 2026 年 9 月 28 日 |
| 每 1M 输入 / 输出 | $2 / $10 | $2 / $10 |
| 每 1M 缓存读取 | $0.10 | $0.20 |
| 每 1M 缓存写入 | $2.50 | $2.50(5 分钟)、$4(1 小时) |
| 每 1M Batch | $1 / $5 | $1 / $5 |
| 超过 272K 输入 token 的提示词 | 整个请求按输入 $4、缓存 $0.20、输出 $15 计费 | 在 1M 窗口内无溢价 |
| 更快的档位 | Fast 为 $4 / $20;Ultrafast「即将推出」 | 不提供 Fast 模式 |
| 上下文窗口 | 1,050,000(最大输入 922,000) | 1M |
| 最大输出 | 128,000 | 128K(Batch 加 beta header 时为 300K) |
| 知识截止日期 | 2026 年 4 月 30 日 | 2026 年 6 月 |
| 推理强度档位 | low、medium(默认)、high、xhigh、max;没有 none |
low、medium、high(API 默认)、xhigh、max;思考无法关闭(最低档为 between_tools) |
| API 形态 | Responses(带工具)、Chat Completions(无工具)、Batch | Messages、Batch |
| 其它平台 | OpenRouter(openai/gpt-6.1-sol) |
Bedrock、Google Cloud、Microsoft Foundry、AWS 上的 Claude Platform |
| 免费访问 | 没有。Plus、Pro、Business、Enterprise 和 Edu 可在 ChatGPT Work 和 Codex 中使用(不在 Chat 中;Enterprise 和 Edu 需管理员启用,见模型文档);API 没有免费额度 | 任何人都可以在 Claude.ai 上与之对话;API 按 token 计费 |
有两行与成本最相关。GPT-6.1 Sol 的缓存读取费用是 Sonnet 5.5 的一半,所以复用长系统提示词在 OpenAI 这边更便宜。超过 272K 输入 token 后,天平反转:GPT-6.1 Sol 模型页规定整个请求按输入与缓存费率的 2 倍、输出费率的 1.5 倍计费,而 Sonnet 5.5 仍保持 $2 和 $10。一个 400,000 token 的提示词配 5,000 token 的答案,在未命中缓存时,GPT-6.1 Sol 上约为 $1.68,Sonnet 5.5 上约为 $0.85。
各家声明了什么,以及对比的是哪个模型
| OpenAI 对 GPT-6.1 Sol | Anthropic 对 Claude Sonnet 5.5 | |
|---|---|---|
| 对比对象 | GPT-6 Sol、GPT-6 Astra、Claude Opus 5.5、Claude Fable 5.1 | Sonnet 5、Opus 5.5、GPT-6 Sol(两张图中为 GPT-5.6 Sol) |
| 是否包含对方模型 | 否 | 否(当时 GPT-6.1 Sol 尚不存在) |
| 核心卖点 | 「接近 Astra 的智能水平」,价格只有 Astra 标准 token 价格的五分之一 | 比 Sonnet 5 快 30% 以上,单任务成本最多低 30% |
| 数据由谁跑的 | OpenAI(其脚注说明竞品结果来自公开报告) | Anthropic,另有 Cognition、Cursor、Artificial Analysis 和 Surge AI 负责具名基准测试 |
OpenAI 的 GPT-6.1 Sol 发布公告在正文中陈述了以下 OpenAI 自报结果:
- AutomationBench 1.0.6,medium 强度:比 Opus 5.5 高 2.2 个百分点,成本约为其三分之一;比 GPT-6 Sol 高 4.8 个百分点。
- Terminal-Bench Science 0.1,max 强度:单任务 $5.47,而 Opus 5.5 为 $23.21。GPT-6 Astra 仍然得分最高,为 68.1%。
- OSWorld 2.0 离线,max 强度:比 GPT-6 Sol 高 7 个百分点,成本不到一半。
Anthropic 的 Sonnet 5.5 发布公告包含一列 GPT-6 Sol 数据:
- FrontierCode 1.1,由 Cognition 运行:Sonnet 5.5 在 xhigh 下得 52.1%(max 下 46.2%),而 GPT-6 Sol 为 49.3%。Anthropic 称在 high 强度下,Sonnet 5.5 以约五分之一的成本达到 GPT-6 Sol 的最佳成绩。
- GDPval-AA v2.1 与 AA-Briefcase v1.1,由 Artificial Analysis 运行:1844 对 1487,以及 1811 对 1483。
Sonnet 5.5 benchmarks breakdown 覆盖了 Anthropic 表格的其余部分。
Opus 5.5 同时出现在两张图上,而且两家厂商都报告了 AutomationBench 和 Terminal-Bench Science,所以很自然会想把两者桥接起来。但数字对不上。OpenAI 报告的是在自家 harness 上 medium 强度的 AutomationBench 1.0.6,而 Anthropic 的系统卡汇总表在 max 强度下运行其 Claude 模型(Sonnet 5.5 44.7、Opus 5.5 42.5;GPT-6 Sol 32.0)。Anthropic 给出 Sonnet 5.5 在 Terminal-Bench Science 上的 59.9%,但 OpenAI 的正文没有给出 GPT-6.1 Sol 的原始分数。此外 OpenAI 在 OSWorld 2.0 离线版上测试 computer use,Anthropic 测的是 OSWorld 2.1。GPT-6 Sol vs Claude Opus 5.5 comparison 也撞上了同一堵墙。
第三方测到了什么(针对 GPT-6 Sol,而非 6.1)
搜索结果里的每一份第三方对比都把 Sonnet 5.5 与 GPT-6 Sol 配对。最完整的是 Artificial Analysis,其 Intelligence Index v4.3.2 汇总了 10 项评测:
| 强度 | Sonnet 5.5 指数 | Sonnet 5.5 单任务成本 | GPT-6 Sol 指数 | GPT-6 Sol 单任务成本 |
|---|---|---|---|---|
| medium | 41 | $0.59 | 40 | $0.25 |
| high | 47 | $1.08 | 43 | $0.38 |
| xhigh | 52 | $2.74 | 44 | $0.52 |
| max | 56 | $7.60 | 48 | $1.05 |
在 max 强度下,同一页面测得 Sonnet 5.5 为每秒 138 个输出 token,GPT-6 Sol 为 76。在列出的每一档强度上,Sonnet 5.5 得分更高、单任务成本也更高,尽管标价相同;差异来自 token 消耗量。Sonnet 5.5 在 high 档(47,$1.08)与 GPT-6 Sol 在 max 档(48,$1.05)相当接近。
Anthropic 自家的图表数据则两边都有利。在 AA-Briefcase 上,GPT-6 Sol 在每一档强度的单任务成本都更低(medium 下 $0.34 对 $1.64),而 Sonnet 5.5 得分更高。在 FrontierCode 上,Sonnet 5.5 在 high 档以 $0.42 的单任务成本达到 49.4%,而 GPT-6 Sol 在 max 档以 $2.07 达到 49.3%。
以上全部针对的是较旧的 Sol。OpenAI 称 GPT-6.1 Sol 在多项基准测试上以相同或更低的强度超过 GPT-6 Sol,所以第三方测试之后,这一行应该还会变化。
按各家自己的说法,各自更可能强在哪里
GPT-6.1 Sol。OpenAI 把它定位为「复杂的编码、computer use 和专业工作,且你希望以更低成本获得接近 Astra 的表现」。它宣称的提升在于 Agent 自动化、computer use 和科学任务,以及低强度下更少的事实性错误。在价格上,它适合 272K 输入 token 以内的缓存密集型负载,也是两者中唯一有付费速度档(Fast)的。
Claude Sonnet 5.5。Anthropic 把它定位为边界清晰的日常任务、缺陷修复,以及需要打磨的文档、幻灯片和表格,并称 Opus 5.5「在复杂、开放式的任务上仍明显更强」(见 Sonnet 5.5 vs Opus 5.5)。它宣称的强项是 Agent 编码(max 档下 Terminal-Bench 4.0 得 70.6%,由 Anthropic 运行)、知识工作和 computer use(OSWorld 2.1 部分得分 80.1%)。在价格上,它适合超过 272K token 的提示词,并且可在 Bedrock、Google Cloud 和 Microsoft Foundry 上运行。
有两种行为会让粗暴的测试失真。默认强度不同(GPT-6.1 Sol 是 medium,Sonnet 5.5 在 API 上是 high),所以要对比相匹配的设置。此外两者都不接受采样旋钮:Sonnet 5.5 在非默认的 temperature、top_p 或 top_k 下返回 400,而 OpenAI 的 GPT-6 指南要求当强度不是 none 时去掉 temperature 和 top_p。请用重复运行来控制方差。
在 Apifox 中自己跑这次对比
从你的真实流量中挑 20 到 50 个答案可校验的任务,例如某个 JSON 字段或一个标签。然后在 Apifox 中:
- 创建一个环境,把
OPENAI_API_KEY和ANTHROPIC_API_KEY存为 secret,并加上EFFORT。 - 保存两个共享
{{prompt}}变量的请求。两者的形态不同(Responses 参考、Messages 参考);API formats comparison 解释了原因:
POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json
{"model": "gpt-6.1-sol", "reasoning": {"effort": "{{EFFORT}}"},
"max_output_tokens": 25000, "input": "{{prompt}}"}
POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json
{"model": "claude-sonnet-5-5", "max_tokens": 25000,
"output_config": {"effort": "{{EFFORT}}"},
"messages": [{"role": "user", "content": "{{prompt}}"}]}
- 为每种形态添加断言,然后再针对
expected列对答案本身加一条断言:
| 检查项 | OpenAI Responses | Anthropic Messages |
|---|---|---|
| 正常结束 | $.status 等于 completed |
$.stop_reason 等于 end_turn |
| 答案存在 | $.output[*].type 包含 message |
$.content[*].type 包含 text |
| 输出 token(含推理) | $.usage.output_tokens |
$.usage.output_tokens |
| 缓存读取 | $.usage.input_tokens_details.cached_tokens |
$.usage.cache_read_input_tokens |
| 缓存写入 | $.usage.input_tokens_details.cache_write_tokens |
$.usage.cache_creation_input_tokens |
- 在后置脚本中为每个响应计价。OpenAI 的
input_tokens包含缓存和缓存写入 token,所以在套用 $2 费率之前要先减去它们(OpenAI prompt caching)。Anthropic 的input_tokens只统计最后一个缓存断点之后的 token(Anthropic prompt caching)。在 OpenAI 一侧还要套用 272K 规则。 - 把两个请求放进同一个测试场景,把提示词以单行、不含双引号的形式放进 CSV,然后在你关心的每个强度上用 Apifox CLI 运行:
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
-d prompts.csv --env-var "EFFORT=medium" -r cli,junit
用总花费除以通过的任务数:那就是你的单任务成本。两边都至少跑 medium 和 high,因为同一个强度名称在不同厂商之间并未按相同方式校准。请求细节请见 GPT-6.1 Sol API guide 和 how to use the Claude Sonnet 5.5 API。
FAQ
GPT-6.1 Sol 比 Claude Sonnet 5.5 便宜吗?标价相同,都是每 1M $2/$10。GPT-6.1 Sol 的缓存读取更便宜;超过 272K 输入 token 后 Sonnet 5.5 更便宜。真实成本取决于每个任务消耗的 token。
哪个在编码上更好?没有共用的基准测试。Anthropic 报告 Sonnet 5.5 在 FrontierCode 上高于 GPT-6 Sol;OpenAI 报告 GPT-6.1 Sol 比 GPT-6 Sol 的最佳 DeepSWE 成绩高 6.4 个百分点。请在你自己的代码库上测试。
哪个更快?Artificial Analysis 在 max 强度下测得 Sonnet 5.5 为每秒 138 token,GPT-6 Sol 为 76。目前还没有 GPT-6.1 Sol 的第三方数据。
两者有免费的吗?GPT-6.1 Sol 没有免费额度。Sonnet 5.5 可在 Claude.ai 聊天应用中使用,但 API 按 token 计费。参见 how to use Claude Sonnet 5.5 for free。
同时跑一遍再做选择
HiFox:将 Agent 变成真正的队友
另外,我们也在思考,AI 如何从个人提效走进团队协作。
HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。
👉 立即体验 HiFox:https://hifox.com
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,
欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。