什么是 GPT-6 Sol?模型 ID、定价、872K 上下文与基准成绩

OpenAI 沿用了 Sol 这个名字,但底下的模型换了。本文说明 GPT-6 Sol 的模型 ID、$2/$10 定价、872,000 token 上下文、基准得分,以及它与 GPT-5.6 Sol、Astra、Luna 的真实关系。

用 Apifox,节省研发团队的每一分钟

什么是 GPT-6 Sol?模型 ID、定价、872K 上下文与基准成绩

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

如果你在 2026 年 9 月 22 日的更新日志里看到 gpt-6-sol 上线,并以为那就是你已经集成好的 GPT-5.6 Sol,请先在这里停下。它不是同一个模型。OpenAI 沿用了档位名,在下面换了一个新模型,训练方法与 GPT-6 Astra 相似,但价格不同、上下文窗口不同、基准测试画像也不同。

这个命名决定会让团队多花钱、多花调试时间。本文讲清楚 GPT-6 Sol 到底是什么:模型 ID、价格、OpenAI 公布的数字、一项已经过时的测量,以及你今天能在哪里调用它。

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

GPT-6 Sol 一览

项目 值
API 模型 ID gpt-6-sol
输入价格 每百万 token $2
输出价格 每百万 token $10
缓存输入读取 90% 折扣
上下文窗口 872,000 token
Artificial Analysis 智能指数 48
发布时间 2026 年 9 月 22 日,与 GPT-6 Luna 同期
可用入口 ChatGPT Work 和 Codex,以及 API
不可用入口 Chat(截至发布时)

作为同一家族内的对照:GPT-6 Astra 是 $10/$50,GPT-6 Luna 是 $0.10/$0.50,上下文窗口 1M,指数 37。OpenAI 自己的说法是 Astra “依然是我们在各方面表现最好的模型”,所以 Sol 不是旗舰,它是单任务成本发生变化的那个档位。

它是新模型,不是改了名的档位

GPT-5.6 家族是 Sol、Terra 和 Luna。GPT-6 家族是 Astra、Sol 和 Luna。两个名字延续下来,一个没有,一个是新的。

没有 GPT-6 Terra。如果你围绕 GPT-5.6 的命名方案搭了一套档位阶梯,中间那一级已经没了,而剩下的几级高度也都不一样了。我们早先那篇 Sol 与 Terra、Luna 的对比描述的是上一代,应当当作历史来读。

价格沿革把这次断裂暴露得很清楚:

档位 GPT-5.6 标价 GPT-5.6 促销价 GPT-6 价格
Sol $5 / $30 $4 / $20 $2 / $10
Terra $2.50 / $15 $2 / $12 没有 GPT-6 Terra
Luna $1 / $6 $0.20 / $1.20 $0.10 / $0.50

价格均为每百万输入 token 和每百万输出 token。GPT-5.6 的标价行与促销价行来自我们当时的报道:《GPT-5.6 定价》和《GPT-5.6 降价》。

“便宜 50%”到底是什么意思

OpenAI 说 Sol 和 Luna 比 GPT-5.6 的 promotional 定价便宜 50%。“促销”这个词是 OpenAI 自己用的,而且很关键:比较对象是一个折扣价,不是 GPT-5.6 发布时的标价。

以 GPT-5.6 Sol 的标价 $5/$30 衡量,GPT-6 Sol 的 $2/$10 相当于输入降 60%、输出降 67%。真实降幅比标题上的数字更大,而标题是从一个折扣价算起的。两句话同时成立,而你要放进预算模型的是第二句,不是第一句。

有一件事没有变:更低的每 token 价格并不会自动带来更低的账单。推理模型会把输出 token 花在思考上。一个每 token 便宜一半、却思考三倍时间的模型并不省钱。这正是 OpenAI 在发布数字里用单任务成本而不是每 token 成本打头的原因。

公布的基准测试

下面每个数字都来自 OpenAI 的发布材料。推理 effort 设置写在括号里,因为这些模型在不同 effort 档位下得分差别很大,一行不带 effort 设置的基准测试数字没法用。

基准测试 GPT-6 Sol 对照点
AutomationBench 1.0.6 33.2%(xhigh),单任务 $0.27 GPT-6 Astra(low)30.3%,成本是 Sol 的 3.9 倍;Claude Opus 5(max)26.9%,成本是 Sol 的 11.1 倍
Agents’ Last Exam V1 56.4%(max) 高于 Claude Opus 5 的最好成绩,单任务成本低 60%
DeepSWE 1.1 68.8%(max) 与 xhigh 的 Claude Fable 5(69.9%)相差 1.1 个百分点,单任务成本约低 80%
OSWorld 2.0 offline 60.5%(xhigh) Claude Opus 5(medium)60.3%,单任务成本约低 80%

四项的模式是一致的:Sol 落在它所对比的前沿模型持平或略高的位置,而单任务成本只是它们的一小部分。在 AutomationBench 上,xhigh 的 Sol 击败 max 的 Claude Opus 5,成本只有 Opus 5 单任务成本的 9%。一套用 Claude Fable 5.1 加 Opus 5 兜底的配置得分 31.4%,低于 Sol,成本却超过它的 8.9x。

OpenAI 还表示,Sol 的事实性错误大约只有前代的一半。

那个在发布当天就过期的对比

再读一遍那张表,注意它对标的是哪个 Claude 模型:Claude Opus 5。

Anthropic 在同一天发布了 Claude Opus 5.5,价格 $4/$20,而 Opus 5 是 $5/$25,并以 58 分拿下 Artificial Analysis 智能指数 212 个模型中的第一名。OpenAI 的发布文章写在这个模型存在之前,所以每一句“以 9% 的成本击败 Opus 5”,对标的都是一个在几小时内就被取代的模型。

这并不说明 OpenAI 的数字错了,对它们所做的那次对比而言它们是准确的。它意味着你不该把这些数字当作当前格局写进 2027 年的采购材料。如果你需要 Sol 对 Opus 5.5 的答案,目前还没有人公布过,社交媒体上流传的正面对比数据来自个人测试者,而非两家厂商。

我们的价格战主文用一张表把三次发布放在一起追踪。

便宜的模型不是快的模型

Artificial Analysis 的第三方测量显示,GPT-6 Sol 在 max 推理配置下的输出速度为每秒 115.2 个 token,time to first token of 102.15 seconds。更便宜的 GPT-6 Luna 首 token 时间更慢,为 124.23 秒。

围绕这些数字做规划之前有两点要说明。它们是第三方数据,不是厂商公布的。而且它们专指 max 推理档位,也就是运行成本最高、响应最慢的设置。更低的 effort 档位表现会不一样,而 OpenAI 没有公布自己的延迟数据。

即便带上这两点,结果的形状才是要记住的东西。首 token 到达前等 102 秒,不是你现有超时配置大概率能撑过去的差距。默认的 HTTP 客户端超时在 30 或 60 秒。负载均衡器会判定空闲。serverless 函数会撞到执行上限。如果你要把一个同步接口从 GPT-5.6 Sol 迁到高 effort 的 GPT-6 Sol,集成工作在你的超时和流式层,不在提示词里。

这件事值得你自己测,而不是信我们或 Artificial Analysis。在 Apifox 中,你可以把一个请求指向 OpenAI 的接口,把模型 ID 设为环境变量,让一个集合覆盖所有档位,然后直接从每次运行里读出响应时间。把同一个请求在三个 effort 档位上各建一遍,保存为测试场景,大约十分钟你就有了一份针对自己提示词的延迟表。你的超时配置就应该基于这个数字来定。

提示缓存这次是实打实的发布

OpenAI 还随模型一同发布了缓存改动,对跑 agent 的人来说,这些改动比标价更重要:

  • 90% discount on cached input reads. 在 $2 的输入价下,缓存读取是每百万 token $0.20。
  • Higher cache hit rates by default,无需改动任何代码。
  • Changing reasoning effort or tool availability no longer breaks the cache. 此前,在对话中途提高 effort 会让缓存前缀失效。
  • Explicit breakpoints,因此你可以自己选择缓存前缀在哪里结束,而不是靠猜。
  • A Prompt Caching Dashboard and a diagnostics tool,命中率从此不再是看不见的。

GitHub 报告称,在数十亿次请求中,需要重新处理的提示 token 减少了 50% 以上。在 872,000 token 的上下文窗口上,20% 与 80% 命中率的差别,就是一个能活下去的 agent 产品和一个被你悄悄关掉的产品之间的差别。

effort 与工具可用性那项改动是最容易被忽略的。agent 循环在任务变难时例行提高 effort,并在规划步骤和执行步骤之间切换工具集。在旧行为下,这两个动作都会在上下文最长的时候把缓存扔掉。

今天能在哪里调用它

入口 GPT-6 Sol
API 可以,模型 ID gpt-6-sol
ChatGPT Work 可以,面向 Plus、Pro、Business、Enterprise 和 Edu
Codex 可以,面向 Plus、Pro、Business、Enterprise 和 Edu
Chat 尚未
Free 和 Go 档位 桌面版中的 GPT-6 Luna

最容易让人踩坑的是 Chat 这个缺口。如果你习惯先把提示词丢进 ChatGPT 的消费者入口做个基本验证再写进代码,你在那里找不到 GPT-6 Sol。用 Codex,或者直接走 API。

一个最小调用长这样:

curl https://api.openai.com/v1/responses \
  -H "Authorization: Bearer $OPENAI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-sol",
    "input": "Summarize the breaking changes in this OpenAPI diff.",
    "reasoning": { "effort": "high" }
  }'

上线之前,先对照 OpenAI 当前的模型参考确认请求结构。模型 ID 是我们已经核实过的那部分。

这对你值多少

OpenAI 发布材料里的一个数字能说明这一定价冲着谁而来:OpenAI 研究员每天在编程 agent 上的支出中位数超过 $600,90th 百分位每天花 $7,000。在那个规模上,单任务成本降 80% 是一行预算项,不是四舍五入的零头。

对大多数团队来说,这笔账更小也更具体:

来自 换用 GPT-6 Sol 的理由
GPT-5.6 Sol 相对标价输入降 60%、输出降 67%,事实性也更好。先测一遍,输出会不一样。
GPT-6 Astra 从 $10/$50 降到 $2/$10,而且 xhigh 的 Sol 在 AutomationBench 上击败了 low 的 Astra。但 OpenAI 仍然称 Astra 是各方面最好的模型,所以把 Astra 留给最难的活。
Claude Opus 5 OpenAI 的数字大幅偏向 Sol。这些数字早于 $4/$20 的 Opus 5.5,所以请自己重跑一遍对比。
GPT-6 Luna Luna 便宜 20x,价格 $0.10/$0.50,窗口还更大,为 1M。如果你的工作负载量大且不属于前沿难度,就从那里开始。

无论走哪条路,这次切换都是行为变更,不是配置变更。同样的提示词,新的模型,不同的输出。在把生产流量路由过去之前,先拿现有的 API 测试套件对新模型 ID 跑一遍,并且对响应结构和延迟加断言,而不只是断言 200 状态码。这恰好就是“基准测试成绩好”的模型和“在你的技术栈里能跑”的模型之间的差距。

开发必备:API 全流程管理神器 Apifox

介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。

如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

Apifox

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。

获取专属报价与部署方案

icon 详细的私有化部署系统架构与安全白皮书
icon 针对您公司规模的专属报价单
icon 免费的 1v1 专属产品演示 (Demo) 机会
获取部署方案
* 提交后,我们的客户经理将在 1 个工作日内与您联系
林俊锋 企业微信
@Apifox 专属顾问
扫码备注: 私有化 + 公司名