OpenAI 于 2026 年 9 月 22 日发布 GPT-6 Sol,标题是每个和财务沾边的工程师都注意到的“便宜 50%”。比什么便宜 50%,恰恰是决定你的迁移表格算得对、还是差了三分之一的那一点。
答案就在 OpenAI 自己的措辞里。Sol 比 GPT-5.6 的 promotional 价格便宜 50%。不是标价。这一个形容词换掉了基准,而一旦你把基准换回我们自己在 GPT-5.6 发布时记录的标价,降幅就比标题更大,而不是更小。两件事同时成立,这就是这句话值得读两遍的原因。
底下还有第二处更有用的更正。每 token 价格是厂商喜欢写进标题的东西,也是你能在账单上核对的东西。但它并不是这次变动最大的地方。每个已完成任务的成本变化更大,因为 Sol 用更少的 token 完成同样的工作,同时 reasoning effort 更高。本文把这两个单位并排放。想了解两天内三场前沿发布的更大背景,见《2026 年 9 月模型价格战》。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
GPT-6 Sol 定价一览
| 项目 | 值 |
|---|---|
| API 模型 ID | gpt-6-sol |
| 输入 | 每百万 token $2 |
| 输出 | 每百万 token $10 |
| 缓存输入读取 | 90% 折扣 |
| 上下文窗口 | 872,000 token |
| 可用情况 | 在 ChatGPT Work 和 Codex 中面向 Plus、Pro、Business、Enterprise 和 Edu |
| 尚未在以下入口提供 | Chat |
对 $2 的输入费率打 90% 折扣,换算下来是每百万缓存输入 token $0.20。这是我们对 OpenAI 公布的折扣做的算术,而不是单独公布的费率,而它正是对 agent 循环最重要的那个数字。
这个 50% 是拿促销价做基准算出来的
下面是价格谱系,基于我们自己关于 GPT-5.6 的报道。标价一列是我们在那次发布时于《GPT-5.6 定价》中记录的数字。促销一列是 OpenAI 用来对比其新模型的折后费率。
| 档位 | GPT-5.6 标价 | GPT-5.6 促销价 | GPT-6 |
|---|---|---|---|
| Sol | $5 / $30 | $4 / $20 | $2 / $10 |
| Terra | $2.50 / $15 | $2 / $12 | 未发布 GPT-6 Terra |
| Luna | $1 / $6 | $0.20 / $1.20 | $0.10 / $0.50 |
对比促销价,$2/$10 的 GPT-6 Sol 在计量的输入和输出两端都恰好便宜 50%。这是 OpenAI 的说法,而且对得上。
对比标价,同样的 $2/$10 相当于输入降 60%、输出降 67%。如果你现在的账单按 $5/$30 计费——因为你从来没拿到、或者没注意到那次促销——你的节省比营销数字更大。如果你本来就在促销价上,你拿到的就是 50%。
有一点结构上的说明:没有 GPT-6 Terra。这个家族是 Astra、Sol 和 Luna,而 GPT-5.6 是 Sol、Terra 和 Luna。配置文件里出现 Terra 这个 id 并没有直接继任者,所以你实际上是在 Sol 和 Luna 之间做选择。我们那篇讲 Sol、Terra 和 Luna 命名的文章写的是上一代阵容,现在读起来已经是历史了。
真正发生位移的单位是单任务成本
token 费率告诉你一次调用花多少钱,而不是一个答案花多少钱,因为两个模型可以用相差悬殊的 token 数达到同样的结果。OpenAI 按每个已完成任务的成本对 Sol 做了基准测试,正是在这里,这件事从一次降价变成了对某一类工作的重新定价。
在 AutomationBench 1.0.6 上:
| 模型与 effort | 得分 | 单任务成本 |
|---|---|---|
| GPT-6 Sol,xhigh | 33.2% | $0.27 |
| GPT-6 Astra,low | 30.3% | 3.9x Sol |
| Claude Fable 5.1 配 Opus 5 fallback,max | 31.4% | 超过 8.9x Sol |
| Claude Opus 5,max | 26.9% | 11.1x Sol |
把最上面一行和最后一行放在一起读。Sol 在 extra-high reasoning effort 下得分高于 max effort 的 Claude Opus 5,而单任务成本只有 Opus 5 的 9%。以 $0.27 为基准,这些乘数算下来,low effort 的 Astra 约为每个任务 $1.05,max 的 Opus 5 约为每个任务 $3.00——这是我们的算术,不是 OpenAI 印出来的费率。
同样的模式在 OpenAI 公布的其他评测中反复出现:
- Agents' Last Exam V1:Sol 在 max 下得分 56.4%,高于 Claude Opus 5 的最好成绩,单任务成本低 60%。
- DeepSWE 1.1:Sol 在 max 下得分 68.8%,与 xhigh 下的 Claude Fable 5(69.9%)相差 1.1 个百分点,单任务成本约低 80%。
- OSWorld 2.0 offline:Sol 在 xhigh 下得分 60.5%,对比 medium 下 Claude Opus 5 的 60.3%,单任务成本同样约低 80%。
- 事实性:Sol 犯的错误约为其前代的一半。
这里必须插一条提醒。OpenAI 发布材料里所有与 Claude 的对比都是针对 Claude Opus 5 的,因为写那篇帖子时 Claude Opus 5.5 还不存在。Anthropic 在同一天发布了 $4/$20 的 Opus 5.5,低于 Opus 5 的 $5/$25,所以“单任务成本为 Opus 5 的 9%”这句话,衡量的对象是一个在数小时内就被取代的模型。这在多大程度上成立、又在多大程度上不成立,我们在《GPT-6 Sol vs Claude Opus 5.5》里做了推演。没有任何厂商公布过 Sol 对比 Opus 5.5 的表格;社交平台上流传的那些对照图是从推文里拼出来的。
为什么两个单位给出的结论不一致
如果 Sol 每 token 比促销价的 GPT-5.6 Sol 便宜 50%,那为什么在上面那些基准测试行里,它每任务便宜 60% 到 91%?这个区间是我们算的,读的是 OpenAI 自己给出的数字跨度:低端 60% 来自 Agents' Last Exam,高端 91% 来自 9%-of-Opus-5 那一行的另一面。
因为 reasoning effort 是用 token 换准确率,而 Sol 站在这条曲线上更好的位置。一个需要试三次的便宜模型并不便宜。这就是为什么 OpenAI 的表格总是把分数和 effort 等级配成对:xhigh、max、medium 和 low 不是装饰性标签,它们就是成本轴。
结果就是:你不能用当前的 token 用量乘以新费率来估算你的 GPT-6 账单。每个任务的 token 用量同样会变,而且随你选择的 effort 双向变化。
缓存改变了实际输入费率
GPT-6 随一次实打实的提示缓存更新一同发布,对一篇讲定价的文章来说,只有一个数字重要:缓存输入读取享 90% 折扣,这让 Sol 在 prompt 中被缓存那部分的实际输入费率降到每百万 token $0.20。
对于一个每一步都重发大段稳定前缀的 agent 来说,这就是架构可行与不可行之间的差别。OpenAI 还表示默认命中率更高,更改 reasoning effort 或工具可用性不再使缓存失效,并且显式断点让你自己决定缓存前缀在哪里结束。GitHub 表示,在数十亿次请求中,需要重新处理的 prompt token 减少了 50% 以上。
有一个缺口:我们的资料没有给出 GPT-6 的缓存写入费率。Anthropic 为 Opus 5.5 公布了这一项,OpenAI 的材料里没有为 Sol 公布,所以不要把写入当成免费。命中缓存的具体机制见《GPT-6 提示缓存》。
一个算例
取一个常见的 agent 步骤:40,000 token 的 prompt 加 2,000 token 的补全,每月跑 100,000 次。以下全部是按上面的费率做的算术。
| 场景 | 每次调用 | 每 100,000 次调用 |
|---|---|---|
| GPT-5.6 Sol,标价 $5 / $30 | $0.26 | $26,000 |
| GPT-5.6 Sol,促销价 $4 / $20 | $0.20 | $20,000 |
| GPT-6 Sol,无缓存命中 | $0.10 | $10,000 |
| GPT-6 Sol,prompt 中 32k 被缓存 | $0.0424 | $4,240 |
从促销那一行到未缓存的 GPT-6 那一行,就是广告里说的 50%。从标价那一行到缓存那一行是 84%,而最后这一段里的大部分来自缓存,不是来自降价。如果这次发布只让你记住一条预算经验,就记这一条。
规模在另一个方向上同样重要。OpenAI 披露其内部研究员在 coding agent 上的花费中位数超过每天 $600,90th 百分位超过每天 $7,000。这些费率就是为这种用量形态设计的,如果你自己的 agent 开销看起来很吓人,这是个有用的现实参照。
低价买不到的东西
Sol 是便宜且强的档位,不是快的档位。第三方机构 Artificial Analysis(不代表任何一家厂商)测得 GPT-6 Sol 的 max reasoning 变体输出速度为 115.2 token/秒,首 token 时间 102.15 秒。这个数字专门针对 max 变体,并且带有第三方测量的全部保留条件,但它的形态是真的:高 reasoning effort 意味着在第一个 token 到达之前有一段漫长的静默等待。任何有用户在等的地方,都需要更低的 effort 设置或换一个档位。我们在《GPT-6 Sol 延迟》里做了拆解。
Sol 也不是家族里的顶配。OpenAI 明确表示,$10/$50 的 GPT-6 Astra“在所有方面仍然是我们最好的模型”。对于已经在用 Astra 的团队,问题是哪些工作负载经得起往下降一档——这正是《从 Astra 迁移到 Sol》的主题。而且 Sol 还没有进入 Chat:它通过 ChatGPT Work 和 Codex 面向 Plus、Pro、Business、Enterprise 和 Edu 提供,此外还有 API 上的 gpt-6-sol。
在你自己的流量上核对账单
厂商的单任务成本表是在厂商自己的测试框架上、针对厂商自己的工作负载测出来的。你的会不一样。在批复预算之前:
- 把真实的生产 prompt 发给
gpt-6-sol,从响应里读出usage,而不是靠字符数估算。 - 把同一个 prompt 在两档 effort 下各跑一次,记录两者的 token 用量和实际耗时。更便宜的设置不一定每个任务都更便宜。
- 把缓存命中和未命中的情况分开测量。对 prompt 中错误的那一半打 90% 折扣,几乎毫无价值。
- 如果下游有任何超时限制,就记录首 token 时间,而不只是总延迟。
这就是普通的 HTTP 请求测试,所以把调用搭起来,把两个 effort 变体保存成不同的请求,对响应结构做断言,并在 Apifox 里观察耗时,而不是写一个用完就扔的临时脚本。保存成集合之后,下次价格一变,这个对比会自己重跑——从目前的证据看,那天很快就会到。
简要版本
GPT-6 Sol 每百万输入 token $2、每百万输出 token $10,上下文 872,000 token,缓存读取享 90% 折扣。广告里的 50% 降幅是拿 GPT-5.6 促销价做基准算的;对比我们在那次发布时记录的标价,则是输入降 60%、输出降 67%。这两个都不是这次发布里最大的数字。对照 OpenAI 做过基准测试的那些模型,每个已完成任务的成本下降了 60% 到 91%,而提示缓存还能在剩下的部分再咬掉一大口。按任务编预算,在自己的流量上核对,并且记住:那个 50% 前面永远挂着“促销”二字。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会