GPT-6.1 Sol 对比 Claude Sonnet 5.5:同为 $2/$10,相隔一天发布

GPT-6.1 Sol 与 Claude Sonnet 5.5 标价同为 $2/$10 且相隔一天发布,但没有任何共用基准测试。本文并排对比规格与价格、拆解两家各自的对比对象、列出第三方数据,并给出自行实测的方法。

用 Apifox,节省研发团队的每一分钟

GPT-6.1 Sol 对比 Claude Sonnet 5.5:同为 $2/$10,相隔一天发布

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

GPT-6.1 Sol 与 Claude Sonnet 5.5 的标价都是每百万输入 token $2、每百万输出 token $10,而且发布仅相隔一天:Sonnet 5.5 是 2026 年 9 月 28 日,GPT-6.1 Sol 是 9 月 29 日。两家厂商都没有做过彼此的基准测试。OpenAI 把 GPT-6.1 Sol 与 Claude Opus 5.5 和 Fable 5.1 做对比,Anthropic 则把 Sonnet 5.5 与 GPT-6 Sol(上一代 Sol)做对比。诚实的选法是让两者在你自己的任务上跑一遍,比较单任务成本,而不是每 token 价格。

下文包括:规格与价格并排对比、各家声明了什么以及对比的是哪个模型、第三方数据(全部针对 GPT-6 Sol,而非 6.1),以及一套你可以用 Apifox 自行完成对比的方法。想单独了解每个模型,请阅读 what is GPT-6.1 Sol 和 what is Claude Sonnet 5.5。

GPT-6.1 Sol vs Claude Sonnet 5.5:规格与定价

来源:OpenAI 的定价页、Anthropic 的 Sonnet 5.5 概览和定价页,以及下文链接的 GPT-6.1 Sol 模型页。

GPT-6.1 Sol Claude Sonnet 5.5
模型 ID gpt-6.1-sol claude-sonnet-5-5(Bedrock:anthropic.claude-sonnet-5-5)
发布时间 2026 年 9 月 29 日 2026 年 9 月 28 日
每 1M 输入 / 输出 $2 / $10 $2 / $10
每 1M 缓存读取 $0.10 $0.20
每 1M 缓存写入 $2.50 $2.50(5 分钟)、$4(1 小时)
每 1M Batch $1 / $5 $1 / $5
超过 272K 输入 token 的提示词 整个请求按输入 $4、缓存 $0.20、输出 $15 计费 在 1M 窗口内无溢价
更快的档位 Fast 为 $4 / $20;Ultrafast「即将推出」 不提供 Fast 模式
上下文窗口 1,050,000(最大输入 922,000) 1M
最大输出 128,000 128K(Batch 加 beta header 时为 300K)
知识截止日期 2026 年 4 月 30 日 2026 年 6 月
推理强度档位 low、medium(默认)、high、xhigh、max;没有 none low、medium、high(API 默认)、xhigh、max;思考无法关闭(最低档为 between_tools)
API 形态 Responses(带工具)、Chat Completions(无工具)、Batch Messages、Batch
其它平台 OpenRouter(openai/gpt-6.1-sol) Bedrock、Google Cloud、Microsoft Foundry、AWS 上的 Claude Platform
免费访问 没有。Plus、Pro、Business、Enterprise 和 Edu 可在 ChatGPT Work 和 Codex 中使用(不在 Chat 中;Enterprise 和 Edu 需管理员启用,见模型文档);API 没有免费额度 任何人都可以在 Claude.ai 上与之对话;API 按 token 计费

有两行与成本最相关。GPT-6.1 Sol 的缓存读取费用是 Sonnet 5.5 的一半,所以复用长系统提示词在 OpenAI 这边更便宜。超过 272K 输入 token 后,天平反转:GPT-6.1 Sol 模型页规定整个请求按输入与缓存费率的 2 倍、输出费率的 1.5 倍计费,而 Sonnet 5.5 仍保持 $2 和 $10。一个 400,000 token 的提示词配 5,000 token 的答案,在未命中缓存时,GPT-6.1 Sol 上约为 $1.68,Sonnet 5.5 上约为 $0.85。

各家声明了什么,以及对比的是哪个模型

OpenAI 对 GPT-6.1 Sol Anthropic 对 Claude Sonnet 5.5
对比对象 GPT-6 Sol、GPT-6 Astra、Claude Opus 5.5、Claude Fable 5.1 Sonnet 5、Opus 5.5、GPT-6 Sol(两张图中为 GPT-5.6 Sol)
是否包含对方模型 否 否(当时 GPT-6.1 Sol 尚不存在)
核心卖点 「接近 Astra 的智能水平」,价格只有 Astra 标准 token 价格的五分之一 比 Sonnet 5 快 30% 以上,单任务成本最多低 30%
数据由谁跑的 OpenAI(其脚注说明竞品结果来自公开报告) Anthropic,另有 Cognition、Cursor、Artificial Analysis 和 Surge AI 负责具名基准测试

OpenAI 的 GPT-6.1 Sol 发布公告在正文中陈述了以下 OpenAI 自报结果:

  • AutomationBench 1.0.6,medium 强度:比 Opus 5.5 高 2.2 个百分点,成本约为其三分之一;比 GPT-6 Sol 高 4.8 个百分点。
  • Terminal-Bench Science 0.1,max 强度:单任务 $5.47,而 Opus 5.5 为 $23.21。GPT-6 Astra 仍然得分最高,为 68.1%。
  • OSWorld 2.0 离线,max 强度:比 GPT-6 Sol 高 7 个百分点,成本不到一半。

Anthropic 的 Sonnet 5.5 发布公告包含一列 GPT-6 Sol 数据:

  • FrontierCode 1.1,由 Cognition 运行:Sonnet 5.5 在 xhigh 下得 52.1%(max 下 46.2%),而 GPT-6 Sol 为 49.3%。Anthropic 称在 high 强度下,Sonnet 5.5 以约五分之一的成本达到 GPT-6 Sol 的最佳成绩。
  • GDPval-AA v2.1 与 AA-Briefcase v1.1,由 Artificial Analysis 运行:1844 对 1487,以及 1811 对 1483。

Sonnet 5.5 benchmarks breakdown 覆盖了 Anthropic 表格的其余部分。

Opus 5.5 同时出现在两张图上,而且两家厂商都报告了 AutomationBench 和 Terminal-Bench Science,所以很自然会想把两者桥接起来。但数字对不上。OpenAI 报告的是在自家 harness 上 medium 强度的 AutomationBench 1.0.6,而 Anthropic 的系统卡汇总表在 max 强度下运行其 Claude 模型(Sonnet 5.5 44.7、Opus 5.5 42.5;GPT-6 Sol 32.0)。Anthropic 给出 Sonnet 5.5 在 Terminal-Bench Science 上的 59.9%,但 OpenAI 的正文没有给出 GPT-6.1 Sol 的原始分数。此外 OpenAI 在 OSWorld 2.0 离线版上测试 computer use,Anthropic 测的是 OSWorld 2.1。GPT-6 Sol vs Claude Opus 5.5 comparison 也撞上了同一堵墙。

第三方测到了什么(针对 GPT-6 Sol,而非 6.1)

搜索结果里的每一份第三方对比都把 Sonnet 5.5 与 GPT-6 Sol 配对。最完整的是 Artificial Analysis,其 Intelligence Index v4.3.2 汇总了 10 项评测:

强度 Sonnet 5.5 指数 Sonnet 5.5 单任务成本 GPT-6 Sol 指数 GPT-6 Sol 单任务成本
medium 41 $0.59 40 $0.25
high 47 $1.08 43 $0.38
xhigh 52 $2.74 44 $0.52
max 56 $7.60 48 $1.05

在 max 强度下,同一页面测得 Sonnet 5.5 为每秒 138 个输出 token,GPT-6 Sol 为 76。在列出的每一档强度上,Sonnet 5.5 得分更高、单任务成本也更高,尽管标价相同;差异来自 token 消耗量。Sonnet 5.5 在 high 档(47,$1.08)与 GPT-6 Sol 在 max 档(48,$1.05)相当接近。

Anthropic 自家的图表数据则两边都有利。在 AA-Briefcase 上,GPT-6 Sol 在每一档强度的单任务成本都更低(medium 下 $0.34 对 $1.64),而 Sonnet 5.5 得分更高。在 FrontierCode 上,Sonnet 5.5 在 high 档以 $0.42 的单任务成本达到 49.4%,而 GPT-6 Sol 在 max 档以 $2.07 达到 49.3%。

以上全部针对的是较旧的 Sol。OpenAI 称 GPT-6.1 Sol 在多项基准测试上以相同或更低的强度超过 GPT-6 Sol,所以第三方测试之后,这一行应该还会变化。

按各家自己的说法,各自更可能强在哪里

GPT-6.1 Sol。OpenAI 把它定位为「复杂的编码、computer use 和专业工作,且你希望以更低成本获得接近 Astra 的表现」。它宣称的提升在于 Agent 自动化、computer use 和科学任务,以及低强度下更少的事实性错误。在价格上,它适合 272K 输入 token 以内的缓存密集型负载,也是两者中唯一有付费速度档(Fast)的。

Claude Sonnet 5.5。Anthropic 把它定位为边界清晰的日常任务、缺陷修复,以及需要打磨的文档、幻灯片和表格,并称 Opus 5.5「在复杂、开放式的任务上仍明显更强」(见 Sonnet 5.5 vs Opus 5.5)。它宣称的强项是 Agent 编码(max 档下 Terminal-Bench 4.0 得 70.6%,由 Anthropic 运行)、知识工作和 computer use(OSWorld 2.1 部分得分 80.1%)。在价格上,它适合超过 272K token 的提示词,并且可在 Bedrock、Google Cloud 和 Microsoft Foundry 上运行。

有两种行为会让粗暴的测试失真。默认强度不同(GPT-6.1 Sol 是 medium,Sonnet 5.5 在 API 上是 high),所以要对比相匹配的设置。此外两者都不接受采样旋钮:Sonnet 5.5 在非默认的 temperature、top_p 或 top_k 下返回 400,而 OpenAI 的 GPT-6 指南要求当强度不是 none 时去掉 temperature 和 top_p。请用重复运行来控制方差。

在 Apifox 中自己跑这次对比

从你的真实流量中挑 20 到 50 个答案可校验的任务,例如某个 JSON 字段或一个标签。然后在 Apifox 中:

  1. 创建一个环境,把 OPENAI_API_KEY 和 ANTHROPIC_API_KEY 存为 secret,并加上 EFFORT。
  2. 保存两个共享 {{prompt}} 变量的请求。两者的形态不同(Responses 参考、Messages 参考);API formats comparison 解释了原因:
POST https://api.openai.com/v1/responses
Authorization: Bearer {{OPENAI_API_KEY}}
Content-Type: application/json

{"model": "gpt-6.1-sol", "reasoning": {"effort": "{{EFFORT}}"},
 "max_output_tokens": 25000, "input": "{{prompt}}"}
POST https://api.anthropic.com/v1/messages
x-api-key: {{ANTHROPIC_API_KEY}}
anthropic-version: 2023-06-01
content-type: application/json

{"model": "claude-sonnet-5-5", "max_tokens": 25000,
 "output_config": {"effort": "{{EFFORT}}"},
 "messages": [{"role": "user", "content": "{{prompt}}"}]}
  1. 为每种形态添加断言,然后再针对 expected 列对答案本身加一条断言:
检查项 OpenAI Responses Anthropic Messages
正常结束 $.status 等于 completed $.stop_reason 等于 end_turn
答案存在 $.output[*].type 包含 message $.content[*].type 包含 text
输出 token(含推理) $.usage.output_tokens $.usage.output_tokens
缓存读取 $.usage.input_tokens_details.cached_tokens $.usage.cache_read_input_tokens
缓存写入 $.usage.input_tokens_details.cache_write_tokens $.usage.cache_creation_input_tokens
  1. 在后置脚本中为每个响应计价。OpenAI 的 input_tokens 包含缓存和缓存写入 token,所以在套用 $2 费率之前要先减去它们(OpenAI prompt caching)。Anthropic 的 input_tokens 只统计最后一个缓存断点之后的 token(Anthropic prompt caching)。在 OpenAI 一侧还要套用 272K 规则。
  2. 把两个请求放进同一个测试场景,把提示词以单行、不含双引号的形式放进 CSV,然后在你关心的每个强度上用 Apifox CLI 运行:
apidog run --access-token "$APIDOG_ACCESS_TOKEN" -t "$SCENARIO_ID" -e "$ENV_ID" \
  -d prompts.csv --env-var "EFFORT=medium" -r cli,junit

用总花费除以通过的任务数:那就是你的单任务成本。两边都至少跑 medium 和 high,因为同一个强度名称在不同厂商之间并未按相同方式校准。请求细节请见 GPT-6.1 Sol API guide 和 how to use the Claude Sonnet 5.5 API。

FAQ

GPT-6.1 Sol 比 Claude Sonnet 5.5 便宜吗?标价相同,都是每 1M $2/$10。GPT-6.1 Sol 的缓存读取更便宜;超过 272K 输入 token 后 Sonnet 5.5 更便宜。真实成本取决于每个任务消耗的 token。

哪个在编码上更好?没有共用的基准测试。Anthropic 报告 Sonnet 5.5 在 FrontierCode 上高于 GPT-6 Sol;OpenAI 报告 GPT-6.1 Sol 比 GPT-6 Sol 的最佳 DeepSWE 成绩高 6.4 个百分点。请在你自己的代码库上测试。

哪个更快?Artificial Analysis 在 max 强度下测得 Sonnet 5.5 为每秒 138 token,GPT-6 Sol 为 76。目前还没有 GPT-6.1 Sol 的第三方数据。

两者有免费的吗?GPT-6.1 Sol 没有免费额度。Sonnet 5.5 可在 Claude.ai 聊天应用中使用,但 API 按 token 计费。参见 how to use Claude Sonnet 5.5 for free。

同时跑一遍再做选择


HiFox:将 Agent 变成真正的队友

另外,我们也在思考,AI 如何从个人提效走进团队协作。

HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。

👉 立即体验 HiFox:https://hifox.com

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,
欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

AI Coding 交流群