OpenAI 于 2026 年 9 月 22 日发布 GPT-6 Sol 和 GPT-6 Luna,与 GPT-6 Astra 一同组成三档模型家族。大多数团队做的第一件事是打开定价页,看到 Luna 旁边的 $0.10 和 Astra 旁边的 $10,然后断定顶档贵一百倍。
这个数字是真的,但它也是错误的计量单位。你不会把 token 交付到生产环境。你交付的是完成的工作:一个被解决的工单、一个被迁移的文件、一个被跑完的浏览器任务。推理模型自己决定这件事要花多少 token,而你传入的 effort 等级会让这个答案相差一个数量级。一个跑在最大 effort 的便宜模型,每个完成任务的成本可能高于一个快速作答的贵模型。
这篇是 GPT-6 时代对我们此前《GPT-5.6 Sol vs Terra vs Luna》对比的接续。那篇文章按每百万 token 的价格比较各档,对那一代模型来说那是正确的单位。这一篇按单任务成本比较,因为 OpenAI 自己就是用这个单位来论证新模型的。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
纸面上的三个档位
| 模型 | API id | 输入 $/M | 输出 $/M | 缓存输入 | 上下文 | AA Intelligence Index |
|---|---|---|---|---|---|---|
| GPT-6 Astra | 见我们的 Astra API 指南 | $10 | $50 | 发布表格中未给出 | 未给出 | 未公布 |
| GPT-6 Sol | gpt-6-sol |
$2 | $10 | 读取享 90% 折扣 | 872k | 48 |
| GPT-6 Luna | gpt-6-luna |
$0.10 | $0.50 | 读取享 90% 折扣 | 1M | 37 |
这张表里有两处会让人意外。
第一,Luna 的上下文窗口是三档中最大的。家族里最便宜的模型能吃下整整一百万 token,而 Sol 到 872k 就封顶了。如果你的工作负载是“大量阅读、少量决策”,那么受约束的并不是这个预算档。
第二,Astra 那一行有空缺。Sol 和 Luna 的发布帖没有重申 Astra 的上下文窗口,也没有重申它的缓存读取费率,Astra 同样没有与其他两者并列公布 Artificial Analysis 指数得分。这些是素材里的空白,不是零。
Sol 和 Luna 都被描述为比 GPT-5.6 便宜 50%,而 OpenAI 自己的措辞是:这项对比针对的是 GPT-5.6 的 promotional 价格。这个限定语足够重要,我们专门为它写了一篇拆解。与我们当时记录下的 GPT-5.6 标价相比,降幅比标题更大。
为什么每 token 价格不再能预测你的账单
在费率表和账单之间,隔着三个彼此独立的乘数。

Reasoning tokens are output tokens. 模型在作答前先思考,而这些思考按输出费率计费,输出费率是输入费率的五倍——三个档位都是如此。一个用 8,000 token 推理换来 200 token 答案的任务,按 8,200 token 的答案计费。
Effort level is a dial, not a flag. OpenAI 的基准测试表按 effort 设置分别报告结果:low、medium、high、xhigh、max。就预算而言,同一模型在 max effort 和 low effort 下,是两个不同定价的不同产品。
Agent loops resend the prompt. 一个十二步的 agent 在每一步都会重发它的系统提示、工具定义和累积的历史。除非缓存把它吸收掉,输入量会随步数呈二次增长——这正是 GPT-6 随模型一同发布缓存更新的原因:缓存输入读取享 90% 折扣,并且变更 reasoning effort 或工具不再使前缀失效。
把这些放到一个真实的 agent 任务上:十二次模型调用、40k token 的 prompt 前缀、每次调用 2k 输出 token。假设第一次调用按完整输入价付费,其余十一次从缓存读取该前缀。
| 档位 | 未缓存输入 | 缓存输入 | 输出 | 单任务成本 |
|---|---|---|---|---|
| Luna | $0.004 | $0.0044 | $0.012 | $0.02 |
| Sol | $0.08 | $0.088 | $0.24 | $0.41 |
| Astra,假设无缓存折扣 | $0.40 | $4.40 | $1.20 | $6.00 |
| Astra,如果享有同样的 90% 读取折扣 | $0.40 | $0.44 | $1.20 | $2.04 |
标称的输入价格比是 1:20:100。一旦把缓存算进来,差距会拉大到约 1:20:294,也可能又压缩回 1:20:100,完全取决于发布表格没有给出的那个 Astra 缓存读取费率。仅这一个未知数,就能让顶档的单任务成本变化三倍。在围绕 Astra 编预算之前,先弄清楚你的账户上这个数字是多少。
OpenAI 自己的单任务成本数字说明了什么
发布帖把分数和相对成本放在一起公布,这才是最有用的部分。在 AutomationBench 1.0.6 上:
| 模型与 effort | 得分 | 单任务成本 |
|---|---|---|
| GPT-6 Sol,xhigh | 33.2% | $0.27 |
| GPT-6 Astra,low | 30.3% | 3.9x Sol |
| Claude Fable 5.1 配 Opus 5 fallback,max | 31.4% | 超过 8.9x Sol |
| Claude Opus 5,max | 26.9% | 11.1x Sol |
请慢慢读最上面这一对。中档在 xhigh effort 下比旗舰在 low effort 下高 2.9 分,而单任务成本约为其四分之一。以 $0.27 为基准,这让 low effort 的 Astra 落在接近 $1.05 的位置——这是基于 OpenAI 给出的乘数做的算术,不是 OpenAI 印出来的数字。
同样的形态在别处反复出现:
- Agents’ Last Exam V1:Sol 在 max 下得分 56.4%,高于 Claude Opus 5 的最好成绩,单任务成本低 60%。
- DeepSWE 1.1:Sol 在 max 下达到 68.8%,与 xhigh 下的 Claude Fable 5 相差 1.1 分,单任务成本约低 80%。Luna 在 max 下达到 66.6%,与 medium effort 下的 Opus 5 和 Fable 5 相当,单任务成本比 Opus 5 低 93%、比 Fable 5 低 96%。
- OSWorld 2.0 offline:Sol 在 xhigh 下得分 60.5%,对比 medium 下 Opus 5 的 60.3%,单任务成本便宜约 80%。Luna 在 max 下以十分之一的成本击败 medium 下的 GPT-5.6 Sol。
- Factuality:Sol 的错误约为前代的一半。更高 effort 的 Luna 与 GPT-5.6 Sol 持平,成本约为其百分之一。
- Cost movement within the tier:Luna 在 high effort 下比自己的前代高 5.4 分,单任务成本低 58%。
有两点必须诚实说明。上面每一个对比都是针对 Claude Opus 5 写的,因为 Anthropic 在同一天发布了 Opus 5.5,而 OpenAI 的帖子早于它。另外,那张表里的 Astra 数字只是一个 low effort 的数据点;OpenAI 明确表示 Astra“在所有方面仍然是我们最好的模型”。这里没有任何一句说 Astra 输了。它说的是:用 low effort 的 Astra 去买 30.3%,是一种昂贵的方式。
消失的那个档位,以及发生位移的那个
GPT-5.6 是 Sol、Terra 和 Luna。GPT-6 是 Astra、Sol 和 Luna。没有 GPT-6 Terra。
这不是把老的中档改个名。Astra 的位置在 GPT-5.6 Sol 之上,而 GPT-6 Sol 以远低于该档位名称历史费率的价格,继承了中间的位置。如果你的代码今天固定使用 gpt-5.6-terra,那么按角色对应最接近的 GPT-6 模型是 Sol,而不是某个同名的继任者。我们那篇命名解释如今已经成为代际历史,而不是当下的对照表。
两个沿用下来的名字,它们的价格谱系:
| 档位名称 | GPT-5.6 标价 | GPT-6 |
|---|---|---|
| Sol | $5 / $30 | $2 / $10 |
| Luna | $1 / $6 | $0.10 / $0.50 |
同样的名字,不同的模型,不同的成本结构。你的配置里任何把档位名称当作稳定能力等级来处理的地方,都需要重新读一遍。
如何选档位
| 工作负载 | 档位 | 原因 |
|---|---|---|
| 分类、抽取、路由、打标签 | Luna,low 或 medium | 输出只有一个词时,reasoning token 就是全部账单。输出费率最低的直接取胜。 |
| 大文档摄取、长转录文本、整仓库读取 | Luna | 1M 上下文、$0.10 输入价,以及任何你发送两次的内容都享有 90% 缓存读取折扣。 |
| Coding agent、多步工具调用、浏览器自动化 | Sol,high 或 xhigh | 这正是 OpenAI 公布的单任务成本数字相对表内所有其他方案最有优势的区间。 |
| 测试生成、schema 校验、规范评审 | 先用 Luna,失败再上 Sol | 按结果路由,而不是靠猜。把失败的提升一档重试。 |
| 真正的前沿工作,且答错的代价很高 | Astra | 厂商称其在所有方面都是最好。把它当作兜底来编预算,而不是默认选项。 |
第四行里的路由模式才是真正省钱的那个。先跑便宜档,用程序校验输出,只把失败的部分升级。如果 Luna 以每个任务 $0.02 清掉队列的 80%,Sol 以 $0.41 收拾剩下的,你的混合成本大约是 $0.10,而不是 $0.41。
在你假设便宜档同时也是快档之前,先看一条关于延迟的脚注。第三方机构 Artificial Analysis(不代表两家厂商中的任何一家)测得,Sol 的 max reasoning variants 为 115.2 输出 token/秒、首 token 时间 102.15 秒,Luna 为 153.9 token/秒、首 token 时间 124.23 秒。这些都是 max effort 下的数字,不能用来描述一次 low effort 的调用。两分钟的首 token 时间对 API 契约意味着什么,我们在那篇延迟文章里拆解过。
在你自己的流量上测量
厂商的单任务成本数字来自厂商自己的测试框架。你的会不一样,而唯一能决定事情的对比,是在你自己的 prompt 上跑出来的那个。
每个响应里的 usage 字段都带着你需要的东西:
{
"model": "gpt-6-luna",
"usage": {
"input_tokens": 41200,
"input_tokens_details": { "cached_tokens": 39800 },
"output_tokens": 2140,
"total_tokens": 43340
}
}
那一次调用按 Luna 费率计算的成本:1,400 未缓存输入按 $0.10/M,39,800 缓存输入按 $0.01/M,2,140 输出按 $0.50/M。即 $0.00014 加 $0.000398 加 $0.00107,约为 $0.0016。要乘上任务需要的调用次数,而不是任务数量。
三条规则让测量结果可信:
- Count whole tasks, not calls. 把一次运行中每一步的 usage 都加起来,包括重试和失败的那些。
- Hold effort constant per row. 一张 Luna-at-max 对比 Sol-at-low 的表,如果你不在表头里说明,它就什么也告诉不了你。
- Log the cached token count separately. 在冷缓存上跑的档位对比会美化贵的那个模型,因为便宜模型的优势在重复前缀上最大。
实际操作中,这就是一个保存下来的请求、一个用于模型 id 的变量,以及对 usage 字段的一条断言。Apifox 很擅长处理这种形态:把调用定义一次,通过环境变量切换模型,再把这个集合当作测试场景来跑,这样 usage 数字会落进一份报告,而不是三个终端窗口。同一个场景还能在某个档位调价时当作回归检查——按这个发布节奏,那不过是几个月内的事。
简要版本
按 token 算,Luna 的输入价格比 Astra 便宜一百倍。按任务算,在 OpenAI 自己公布的基准测试上,排名就没那么干净了:Sol 在 xhigh effort 下于 AutomationBench 击败 low effort 的 Astra,而成本约为其四分之一;Luna 在 max effort 下与单任务成本高它十倍的模型已经相差无几。
从 Luna 起步,失败就升级,把 Astra 留给那些答错比答慢代价更高的工作。然后自己去测量,因为上面每一个数字都是在别人的工作负载上产生的。
想了解同一 48 小时内两场发布的全景,见我们的《2026 年 9 月 AI 模型价格战》综述。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会