GPT-6 Sol vs Claude Opus 5.5:价格、基准,以及没人真正做过的那个对比

两个模型同一天发布,导致所有公开对比表都建立在已被替换的基线之上。本文列出双方公布的数字、两组基准真正可比的部分、计入缓存后的价格差,以及如何在自己的流量上做决策。

用 Apifox,节省研发团队的每一分钟

GPT-6 Sol vs Claude Opus 5.5:价格、基准,以及没人真正做过的那个对比

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

你有一个写在配置文件里的 model id,和这个星期必须做出的一个决定。2026 年 9 月 22 日,OpenAI 发布了 GPT-6 Sol,Anthropic 发布了 Claude Opus 5.5,前后相差几个小时。从那之后你找到的每一张对比表都带着一个洞,而这个洞比看上去更大。

这个洞是这样的。OpenAI 的发布文章拿 Sol 去对标 Claude Opus 5,因为那篇文章写出来的时候 Claude Opus 5.5 还不存在。Anthropic 随后在同一天发布 Opus 5.5,定价比 Opus 5 低 20%。于是开发者之间互相转引的那句头条式说法——Sol 以单任务成本的一小部分达到甚至超过 Opus 档的质量——所测量的对象,是一个在测量结果公布几小时之内就被取代的模型。

这并不说明 OpenAI 的数字是错的。它说明这些数字以一种特定的方式过时了,而了解过时到什么程度,就是好的路由决策和昂贵的路由决策之间的差别。下面讲:两家各自公布了什么、两套基准测试真正在哪里相交、把缓存算进来后价格差到底是多少,以及如何在自己的接口上测试两者。

想了解两天之内三款前沿模型发布的更大图景,请看《2026 年 9 月 AI 模型价格战》。

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

规格表并列对比

GPT-6 Sol Claude Opus 5.5
API model id gpt-6-sol claude-opus-5-5
输入 / 1M token $2 $4
输出 / 1M token $10 $20
缓存输入读取 90% 折扣 $0.20 / 1M
缓存写入 我们手上资料未公布 $5 / 1M
上下文窗口 872,000 token 1,000,000 token
最大输出 我们手上资料未公布 128,000 token
Artificial Analysis Intelligence Index 48 58,在 212 个模型中排名第 1
可以在哪里调用 API、ChatGPT Work、Codex Claude Platform、AWS、Google Cloud、Azure

有两行承载了大部分决策。

在纯粹的 token 价格上,Sol 的输入和输出都正好是 Opus 5.5 的一半。不是大约一半,是正好一半。在跨厂商对比里这干净得少见,也让心算变得很容易。

在 Artificial Analysis Intelligence Index 上——这是第三方评分,不是厂商声明——Opus 5.5 得 58 分,在 212 个模型中排第一,而 Sol 是 48 分。所以这场对比的形态并不陌生:你为榜首付双倍价钱,问题在于你的工作负载能不能感知到这个差别。

Sol 的上下文窗口是 872,000 token,而 Opus 5.5 是完整的 100 万。对大多数工作来说这根本用不到。如果你要把整个 monorepo,或者一份 400-endpoint 的 OpenAPI 文档再加上历史记录塞进一次调用,先量一下,因为它的失效方式是硬性拒绝,而不是输出质量下降。

可得性也很重要。Sol 上线了 API,以及面向 Plus、Pro、Business、Enterprise 和 Edu 账号的 ChatGPT Work 和 Codex,目前还没有进入 Chat。Opus 5.5 发布首日就覆盖 Claude Platform、AWS、Google Cloud 和 Azure;如果你本来就通过 Bedrock 或 Vertex 走流量,这就是「走一轮采购流程」和「改一处配置」的差别。

OpenAI 做不了的那场对比

OpenAI 自己给出的单任务成本数字,是它发布文章里最有用的部分,而这些数字全都指向 Opus 5:

基准测试 GPT-6 Sol Claude Opus 5 成本关系
AutomationBench 1.0.6 xhigh 强度 33.2%,单任务 $0.27 max 强度 26.9% Opus 5 的单任务成本是 Sol 的 11.1x
Agents’ Last Exam V1 max 强度 56.4% 低于 Sol 的得分 Sol 的单任务成本低 60%
DeepSWE 1.1 max 强度 68.8% n/a 与 xhigh 强度 69.9% 的 Fable 5 相差 1.1pp,单任务成本约低 80%
OSWorld 2.0 离线 xhigh 强度 60.5% medium 强度 60.3% 单任务成本约低 80%

把 AutomationBench 那一行再读一遍。Sol 在 extra-high 推理强度下击败了 max 强度的 Opus 5,单任务成本大约只有 Opus 5 的 9%。整个讨论里真正在起作用的,就是这个数字。

现在把 Opus 5.5 放上去。Anthropic 公布了自己测的 Opus 5.5 AutomationBench 成绩:40.0%。OpenAI 测得的 Opus 5 在 AutomationBench 1.0.6 上是 26.9%。如果这是同一个基准的同一个版本——这是一个不小的「如果」——那么 Sol 曾以 6.3 分优势击败的那个 Opus 数字,已经被一个领先 Sol 6.8 分的数字取代了。这场对比不只是过时了,它反过来了。

有两点提醒,你在任何相关讨论里都该带上:

  1. OpenAI 标明了版本号,1.0.6。我们手上的 Anthropic 数字没有带版本字符串。同名基准在不同版本之间会漂移,各家的测试框架也不一样。在有人把两个模型放进同一套框架跑一遍之前,26.9 到 40.0 这个跳变只能当作方向性参考。
  2. OpenAI 依然明确表示,GPT-6 Astra「在各个维度上仍然是我们最好的模型」。Sol 是 GPT-6 家族里的性价比档,不是它的上限,所以从 Sol 的对比里推断 OpenAI 的前沿水平属于范畴错误。前沿对前沿应该读 Astra 对 Opus 5.5,而两家都没有公布这组数据。

还有一处重叠。Anthropic 报告 Opus 5.5 在 OSWorld 2.0 上是 81.8%,而 OpenAI 报告 Sol 在 OSWorld 2.0 离线版上是 60.5%。这可能是同一套测试的不同变体,而 21 分的差距正是那种最后被发现是「苹果比橘子」的数字。别把它当成正面交锋来引用。

价格差到底是什么

按 token 算的差距是干净的 2x。你实际付出的差距不是,原因是提示缓存。

Opus 5.5 的缓存输入读取价格是每百万 token $0.20,相当于它 $4 输入费率的 5%。GPT-6 与 Sol 同步发布了一个缓存版本,把缓存输入读取的价格打掉 90%,这让 Sol 的缓存读取也落在每百万 $0.20。在重复前缀上——也就是 agent 提示词里永远不变的那部分——两个模型的成本相同。

拿一个具体的 agent 负载来说:每次运行 50,000 输入 token、3,000 输出 token、每天 1,000 次运行,其中 45,000 个输入 token 是稳定前缀(系统提示词、工具 schema、OpenAPI 文档、约定文件)。

每日成本 GPT-6 Sol Claude Opus 5.5 倍率
无缓存命中 $130 $260 2.00x
前缀已缓存 $49 $89 1.82x

这是按已公布费率算出来的,不是实测,而且不包含缓存写入——Opus 5.5 的写入是每百万 $5,Sol 的写入费率在我们手上的资料里没有公布。方向是可靠的:你越依赖缓存,便宜模型的优势就被压得越薄,因为折扣最终落在同一个底价上。激进的缓存使用者买到的是 1.8x 的差距,不是 2x。

而且按 token 计价本来就是错误的单位。OpenAI 自己的内部数字说明了原因:它的研究员中位数每天在编码 agent 上花掉超过 $600,而 90th 百分位每天花 $7,000。没人靠给 token 定错价达到这个数。他们是靠一遍遍重试、分支、重读上下文的循环达到的。一个单价翻倍、但一次跑完而不是跑三次的模型,才是更便宜的模型。

还有一点价格背景,因为它经常被错误引用。OpenAI 称 Sol 和 Luna 比 GPT-5.6 promotional 定价便宜 50%。「促销价」(promotional)是 OpenAI 自己的用词。对照我们当时在 GPT-5.6 定价拆解里记录的 GPT-5.6 标价,Sol 的 $2/$10 降幅比标题看上去更大,但这个标题本身是拿折扣价对比出来的,不是标价。引用时要带上这个限定。

延迟:便宜的模型不是快的模型

Artificial Analysis 测得 GPT-6 Sol 的「max」推理档位输出速度为每秒 115.2 个 token,102.15 second time to first token。这是第三方对最高推理档位的测量,不是厂商数据,也不代表 Sol 在更低推理强度下的表现。把它当作「最坏能坏到什么程度」的上限,而不是典型响应时间。

它依然会改变你的实现方式。首 token 之前要等一百秒,意味着:

  • 你默认的 HTTP 客户端超时是错的。大多数库默认 30 秒或 60 秒。
  • 调用链前面任何一个负载均衡器、API 网关或 serverless 函数都有自己的空闲超时,而且很可能比你客户端的更短。
  • 流式不再是锦上添花。没有它,你没有任何信号能知道请求还活着。
  • 在超时时触发的重试逻辑,会同时让你的账单和延迟翻倍。

Anthropic 关于 Opus 5.5 的对应说法是相对的:输出比 Opus 5 快 30%。这是厂商对一个比值的表述,不是一个每秒 token 数的数字,所以没法跟 Artificial Analysis 的数字放在同一个坐标轴上。你只能在自己的工作负载上把两者都测一遍。

这是普通的 API 测试工作。把同一个提示词发到两个接口,记录首字节时间和总时长,跑足够多次以看清离散程度,顺手对响应 schema 做断言。在 Apifox 里,你可以把两个调用放在同一个项目中,作为测试场景运行,并把延迟历史与断言放在一起,而不是丢在一个草稿文件里。

两种请求形态的差异大到值得在意:

# Anthropic
curl https://api.anthropic.com/v1/messages \
  -H "x-api-key: $ANTHROPIC_API_KEY" \
  -H "anthropic-version: 2023-06-01" \
  -H "content-type: application/json" \
  -d '{
    "model": "claude-opus-5-5",
    "max_tokens": 1024,
    "stream": true,
    "messages": [{"role": "user", "content": "Summarize this OpenAPI path."}]
  }'
# OpenAI
curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "content-type: application/json" \
  -d '{
    "model": "gpt-6-sol",
    "stream": true,
    "input": "Summarize this OpenAPI path."
  }'

不同的鉴权 header、不同的 body 字段、不同的流式事件格式。你为了在两者之间来回切换而写的任何抽象层,都是你此后要自己维护的代码,而且当任何一家发布新字段时,它总是第一个坏掉。

怎么选

如果你的工作负载是 选择 原因
高吞吐、前缀稳定、能容忍重试 GPT-6 Sol token 单价只有一半,缓存又把底价压得很低
长时间自主运行,出错的代价很高 Claude Opus 5.5 在第三方智能指数和 Anthropic 自己的 AutomationBench 数字上领先
上下文超过 872k token 时受限 Claude Opus 5.5 完整的 100 万 token 窗口
已经通过 Bedrock、Vertex 或 Azure 走流量 Claude Opus 5.5 发布首日就在这三家全部上线
已经在用 Codex 或 ChatGPT Work GPT-6 Sol 它最先落地的地方
还没定 两个都用,放在路由器后面 1.8x 的缓存后价差足够小,可以按任务而不是按忠诚度来路由

对大多数团队来说,最后一行才是诚实的答案。在 1.8x 的缓存后价差下,做路由回本的速度比任何一家的营销都快。把高吞吐、定义清晰的工作发给 Sol,把耗时长、模糊、做错代价高的工作发给 Opus 5.5。测量每个已完成任务的成本,一个月后再看一遍,并且不要从任何一家的发布文章里抄一张基准表就当它是当前的。其中一家的对比对象,在同一个下午就被替换掉了。

开发必备:API 全流程管理神器 Apifox

介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。

如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

Apifox

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。

获取专属报价与部署方案

icon 详细的私有化部署系统架构与安全白皮书
icon 针对您公司规模的专属报价单
icon 免费的 1v1 专属产品演示 (Demo) 机会
获取部署方案
* 提交后,我们的客户经理将在 1 个工作日内与您联系
林俊锋 企业微信
@Apifox 专属顾问
扫码备注: 私有化 + 公司名