如果你在 2026 年 9 月 22 日的更新日志里看到 gpt-6-sol 上线,并以为那就是你已经集成好的 GPT-5.6 Sol,请先在这里停下。它不是同一个模型。OpenAI 沿用了档位名,在下面换了一个新模型,训练方法与 GPT-6 Astra 相似,但价格不同、上下文窗口不同、基准测试画像也不同。
这个命名决定会让团队多花钱、多花调试时间。本文讲清楚 GPT-6 Sol 到底是什么:模型 ID、价格、OpenAI 公布的数字、一项已经过时的测量,以及你今天能在哪里调用它。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
GPT-6 Sol 一览
| 项目 | 值 |
|---|---|
| API 模型 ID | gpt-6-sol |
| 输入价格 | 每百万 token $2 |
| 输出价格 | 每百万 token $10 |
| 缓存输入读取 | 90% 折扣 |
| 上下文窗口 | 872,000 token |
| Artificial Analysis 智能指数 | 48 |
| 发布时间 | 2026 年 9 月 22 日,与 GPT-6 Luna 同期 |
| 可用入口 | ChatGPT Work 和 Codex,以及 API |
| 不可用入口 | Chat(截至发布时) |
作为同一家族内的对照:GPT-6 Astra 是 $10/$50,GPT-6 Luna 是 $0.10/$0.50,上下文窗口 1M,指数 37。OpenAI 自己的说法是 Astra “依然是我们在各方面表现最好的模型”,所以 Sol 不是旗舰,它是单任务成本发生变化的那个档位。
它是新模型,不是改了名的档位
GPT-5.6 家族是 Sol、Terra 和 Luna。GPT-6 家族是 Astra、Sol 和 Luna。两个名字延续下来,一个没有,一个是新的。

没有 GPT-6 Terra。如果你围绕 GPT-5.6 的命名方案搭了一套档位阶梯,中间那一级已经没了,而剩下的几级高度也都不一样了。我们早先那篇 Sol 与 Terra、Luna 的对比描述的是上一代,应当当作历史来读。
价格沿革把这次断裂暴露得很清楚:
| 档位 | GPT-5.6 标价 | GPT-5.6 促销价 | GPT-6 价格 |
|---|---|---|---|
| Sol | $5 / $30 | $4 / $20 | $2 / $10 |
| Terra | $2.50 / $15 | $2 / $12 | 没有 GPT-6 Terra |
| Luna | $1 / $6 | $0.20 / $1.20 | $0.10 / $0.50 |
价格均为每百万输入 token 和每百万输出 token。GPT-5.6 的标价行与促销价行来自我们当时的报道:《GPT-5.6 定价》和《GPT-5.6 降价》。
“便宜 50%”到底是什么意思
OpenAI 说 Sol 和 Luna 比 GPT-5.6 的 promotional 定价便宜 50%。“促销”这个词是 OpenAI 自己用的,而且很关键:比较对象是一个折扣价,不是 GPT-5.6 发布时的标价。
以 GPT-5.6 Sol 的标价 $5/$30 衡量,GPT-6 Sol 的 $2/$10 相当于输入降 60%、输出降 67%。真实降幅比标题上的数字更大,而标题是从一个折扣价算起的。两句话同时成立,而你要放进预算模型的是第二句,不是第一句。
有一件事没有变:更低的每 token 价格并不会自动带来更低的账单。推理模型会把输出 token 花在思考上。一个每 token 便宜一半、却思考三倍时间的模型并不省钱。这正是 OpenAI 在发布数字里用单任务成本而不是每 token 成本打头的原因。
公布的基准测试
下面每个数字都来自 OpenAI 的发布材料。推理 effort 设置写在括号里,因为这些模型在不同 effort 档位下得分差别很大,一行不带 effort 设置的基准测试数字没法用。
| 基准测试 | GPT-6 Sol | 对照点 |
|---|---|---|
| AutomationBench 1.0.6 | 33.2%(xhigh),单任务 $0.27 | GPT-6 Astra(low)30.3%,成本是 Sol 的 3.9 倍;Claude Opus 5(max)26.9%,成本是 Sol 的 11.1 倍 |
| Agents’ Last Exam V1 | 56.4%(max) | 高于 Claude Opus 5 的最好成绩,单任务成本低 60% |
| DeepSWE 1.1 | 68.8%(max) | 与 xhigh 的 Claude Fable 5(69.9%)相差 1.1 个百分点,单任务成本约低 80% |
| OSWorld 2.0 offline | 60.5%(xhigh) | Claude Opus 5(medium)60.3%,单任务成本约低 80% |
四项的模式是一致的:Sol 落在它所对比的前沿模型持平或略高的位置,而单任务成本只是它们的一小部分。在 AutomationBench 上,xhigh 的 Sol 击败 max 的 Claude Opus 5,成本只有 Opus 5 单任务成本的 9%。一套用 Claude Fable 5.1 加 Opus 5 兜底的配置得分 31.4%,低于 Sol,成本却超过它的 8.9x。
OpenAI 还表示,Sol 的事实性错误大约只有前代的一半。
那个在发布当天就过期的对比
再读一遍那张表,注意它对标的是哪个 Claude 模型:Claude Opus 5。
Anthropic 在同一天发布了 Claude Opus 5.5,价格 $4/$20,而 Opus 5 是 $5/$25,并以 58 分拿下 Artificial Analysis 智能指数 212 个模型中的第一名。OpenAI 的发布文章写在这个模型存在之前,所以每一句“以 9% 的成本击败 Opus 5”,对标的都是一个在几小时内就被取代的模型。
这并不说明 OpenAI 的数字错了,对它们所做的那次对比而言它们是准确的。它意味着你不该把这些数字当作当前格局写进 2027 年的采购材料。如果你需要 Sol 对 Opus 5.5 的答案,目前还没有人公布过,社交媒体上流传的正面对比数据来自个人测试者,而非两家厂商。
我们的价格战主文用一张表把三次发布放在一起追踪。
便宜的模型不是快的模型
Artificial Analysis 的第三方测量显示,GPT-6 Sol 在 max 推理配置下的输出速度为每秒 115.2 个 token,time to first token of 102.15 seconds。更便宜的 GPT-6 Luna 首 token 时间更慢,为 124.23 秒。
围绕这些数字做规划之前有两点要说明。它们是第三方数据,不是厂商公布的。而且它们专指 max 推理档位,也就是运行成本最高、响应最慢的设置。更低的 effort 档位表现会不一样,而 OpenAI 没有公布自己的延迟数据。
即便带上这两点,结果的形状才是要记住的东西。首 token 到达前等 102 秒,不是你现有超时配置大概率能撑过去的差距。默认的 HTTP 客户端超时在 30 或 60 秒。负载均衡器会判定空闲。serverless 函数会撞到执行上限。如果你要把一个同步接口从 GPT-5.6 Sol 迁到高 effort 的 GPT-6 Sol,集成工作在你的超时和流式层,不在提示词里。
这件事值得你自己测,而不是信我们或 Artificial Analysis。在 Apifox 中,你可以把一个请求指向 OpenAI 的接口,把模型 ID 设为环境变量,让一个集合覆盖所有档位,然后直接从每次运行里读出响应时间。把同一个请求在三个 effort 档位上各建一遍,保存为测试场景,大约十分钟你就有了一份针对自己提示词的延迟表。你的超时配置就应该基于这个数字来定。
提示缓存这次是实打实的发布
OpenAI 还随模型一同发布了缓存改动,对跑 agent 的人来说,这些改动比标价更重要:
- 90% discount on cached input reads. 在 $2 的输入价下,缓存读取是每百万 token $0.20。
- Higher cache hit rates by default,无需改动任何代码。
- Changing reasoning effort or tool availability no longer breaks the cache. 此前,在对话中途提高 effort 会让缓存前缀失效。
- Explicit breakpoints,因此你可以自己选择缓存前缀在哪里结束,而不是靠猜。
- A Prompt Caching Dashboard and a diagnostics tool,命中率从此不再是看不见的。
GitHub 报告称,在数十亿次请求中,需要重新处理的提示 token 减少了 50% 以上。在 872,000 token 的上下文窗口上,20% 与 80% 命中率的差别,就是一个能活下去的 agent 产品和一个被你悄悄关掉的产品之间的差别。
effort 与工具可用性那项改动是最容易被忽略的。agent 循环在任务变难时例行提高 effort,并在规划步骤和执行步骤之间切换工具集。在旧行为下,这两个动作都会在上下文最长的时候把缓存扔掉。
今天能在哪里调用它
| 入口 | GPT-6 Sol |
|---|---|
| API | 可以,模型 ID gpt-6-sol |
| ChatGPT Work | 可以,面向 Plus、Pro、Business、Enterprise 和 Edu |
| Codex | 可以,面向 Plus、Pro、Business、Enterprise 和 Edu |
| Chat | 尚未 |
| Free 和 Go 档位 | 桌面版中的 GPT-6 Luna |
最容易让人踩坑的是 Chat 这个缺口。如果你习惯先把提示词丢进 ChatGPT 的消费者入口做个基本验证再写进代码,你在那里找不到 GPT-6 Sol。用 Codex,或者直接走 API。
一个最小调用长这样:
curl https://api.openai.com/v1/responses \
-H "Authorization: Bearer $OPENAI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-sol",
"input": "Summarize the breaking changes in this OpenAPI diff.",
"reasoning": { "effort": "high" }
}'
上线之前,先对照 OpenAI 当前的模型参考确认请求结构。模型 ID 是我们已经核实过的那部分。
这对你值多少
OpenAI 发布材料里的一个数字能说明这一定价冲着谁而来:OpenAI 研究员每天在编程 agent 上的支出中位数超过 $600,90th 百分位每天花 $7,000。在那个规模上,单任务成本降 80% 是一行预算项,不是四舍五入的零头。
对大多数团队来说,这笔账更小也更具体:
| 来自 | 换用 GPT-6 Sol 的理由 |
|---|---|
| GPT-5.6 Sol | 相对标价输入降 60%、输出降 67%,事实性也更好。先测一遍,输出会不一样。 |
| GPT-6 Astra | 从 $10/$50 降到 $2/$10,而且 xhigh 的 Sol 在 AutomationBench 上击败了 low 的 Astra。但 OpenAI 仍然称 Astra 是各方面最好的模型,所以把 Astra 留给最难的活。 |
| Claude Opus 5 | OpenAI 的数字大幅偏向 Sol。这些数字早于 $4/$20 的 Opus 5.5,所以请自己重跑一遍对比。 |
| GPT-6 Luna | Luna 便宜 20x,价格 $0.10/$0.50,窗口还更大,为 1M。如果你的工作负载量大且不属于前沿难度,就从那里开始。 |
无论走哪条路,这次切换都是行为变更,不是配置变更。同样的提示词,新的模型,不同的输出。在把生产流量路由过去之前,先拿现有的 API 测试套件对新模型 ID 跑一遍,并且对响应结构和延迟加断言,而不只是断言 200 状态码。这恰好就是“基准测试成绩好”的模型和“在你的技术栈里能跑”的模型之间的差距。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会