GPT-6 Luna vs Sol vs Astra:按单任务成本选档位

把 $0.10 和 $10 直接对比会得出「顶配贵一百倍」的错误结论,因为生产环境交付的是完成的任务而不是 token。本文用单任务成本这一个单位,说明三档模型各自适合什么工作负载。

用 Apifox,节省研发团队的每一分钟

GPT-6 Luna vs Sol vs Astra:按单任务成本选档位

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

OpenAI 于 2026 年 9 月 22 日发布 GPT-6 Sol 和 GPT-6 Luna,与 GPT-6 Astra 一同组成三档模型家族。大多数团队做的第一件事是打开定价页,看到 Luna 旁边的 $0.10 和 Astra 旁边的 $10,然后断定顶档贵一百倍。

这个数字是真的,但它也是错误的计量单位。你不会把 token 交付到生产环境。你交付的是完成的工作:一个被解决的工单、一个被迁移的文件、一个被跑完的浏览器任务。推理模型自己决定这件事要花多少 token,而你传入的 effort 等级会让这个答案相差一个数量级。一个跑在最大 effort 的便宜模型,每个完成任务的成本可能高于一个快速作答的贵模型。

这篇是 GPT-6 时代对我们此前《GPT-5.6 Sol vs Terra vs Luna》对比的接续。那篇文章按每百万 token 的价格比较各档,对那一代模型来说那是正确的单位。这一篇按单任务成本比较,因为 OpenAI 自己就是用这个单位来论证新模型的。

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

纸面上的三个档位

模型 API id 输入 $/M 输出 $/M 缓存输入 上下文 AA Intelligence Index
GPT-6 Astra 见我们的 Astra API 指南 $10 $50 发布表格中未给出 未给出 未公布
GPT-6 Sol gpt-6-sol $2 $10 读取享 90% 折扣 872k 48
GPT-6 Luna gpt-6-luna $0.10 $0.50 读取享 90% 折扣 1M 37

这张表里有两处会让人意外。

第一,Luna 的上下文窗口是三档中最大的。家族里最便宜的模型能吃下整整一百万 token,而 Sol 到 872k 就封顶了。如果你的工作负载是“大量阅读、少量决策”,那么受约束的并不是这个预算档。

第二,Astra 那一行有空缺。Sol 和 Luna 的发布帖没有重申 Astra 的上下文窗口,也没有重申它的缓存读取费率,Astra 同样没有与其他两者并列公布 Artificial Analysis 指数得分。这些是素材里的空白,不是零。

Sol 和 Luna 都被描述为比 GPT-5.6 便宜 50%,而 OpenAI 自己的措辞是:这项对比针对的是 GPT-5.6 的 promotional 价格。这个限定语足够重要,我们专门为它写了一篇拆解。与我们当时记录下的 GPT-5.6 标价相比,降幅比标题更大。

为什么每 token 价格不再能预测你的账单

在费率表和账单之间,隔着三个彼此独立的乘数。

Reasoning tokens are output tokens. 模型在作答前先思考,而这些思考按输出费率计费,输出费率是输入费率的五倍——三个档位都是如此。一个用 8,000 token 推理换来 200 token 答案的任务,按 8,200 token 的答案计费。

Effort level is a dial, not a flag. OpenAI 的基准测试表按 effort 设置分别报告结果:low、medium、high、xhigh、max。就预算而言,同一模型在 max effort 和 low effort 下,是两个不同定价的不同产品。

Agent loops resend the prompt. 一个十二步的 agent 在每一步都会重发它的系统提示、工具定义和累积的历史。除非缓存把它吸收掉,输入量会随步数呈二次增长——这正是 GPT-6 随模型一同发布缓存更新的原因:缓存输入读取享 90% 折扣,并且变更 reasoning effort 或工具不再使前缀失效。

把这些放到一个真实的 agent 任务上:十二次模型调用、40k token 的 prompt 前缀、每次调用 2k 输出 token。假设第一次调用按完整输入价付费,其余十一次从缓存读取该前缀。

档位 未缓存输入 缓存输入 输出 单任务成本
Luna $0.004 $0.0044 $0.012 $0.02
Sol $0.08 $0.088 $0.24 $0.41
Astra,假设无缓存折扣 $0.40 $4.40 $1.20 $6.00
Astra,如果享有同样的 90% 读取折扣 $0.40 $0.44 $1.20 $2.04

标称的输入价格比是 1:20:100。一旦把缓存算进来,差距会拉大到约 1:20:294,也可能又压缩回 1:20:100,完全取决于发布表格没有给出的那个 Astra 缓存读取费率。仅这一个未知数,就能让顶档的单任务成本变化三倍。在围绕 Astra 编预算之前,先弄清楚你的账户上这个数字是多少。

OpenAI 自己的单任务成本数字说明了什么

发布帖把分数和相对成本放在一起公布,这才是最有用的部分。在 AutomationBench 1.0.6 上:

模型与 effort 得分 单任务成本
GPT-6 Sol,xhigh 33.2% $0.27
GPT-6 Astra,low 30.3% 3.9x Sol
Claude Fable 5.1 配 Opus 5 fallback,max 31.4% 超过 8.9x Sol
Claude Opus 5,max 26.9% 11.1x Sol

请慢慢读最上面这一对。中档在 xhigh effort 下比旗舰在 low effort 下高 2.9 分,而单任务成本约为其四分之一。以 $0.27 为基准,这让 low effort 的 Astra 落在接近 $1.05 的位置——这是基于 OpenAI 给出的乘数做的算术,不是 OpenAI 印出来的数字。

同样的形态在别处反复出现:

  • Agents’ Last Exam V1:Sol 在 max 下得分 56.4%,高于 Claude Opus 5 的最好成绩,单任务成本低 60%。
  • DeepSWE 1.1:Sol 在 max 下达到 68.8%,与 xhigh 下的 Claude Fable 5 相差 1.1 分,单任务成本约低 80%。Luna 在 max 下达到 66.6%,与 medium effort 下的 Opus 5 和 Fable 5 相当,单任务成本比 Opus 5 低 93%、比 Fable 5 低 96%。
  • OSWorld 2.0 offline:Sol 在 xhigh 下得分 60.5%,对比 medium 下 Opus 5 的 60.3%,单任务成本便宜约 80%。Luna 在 max 下以十分之一的成本击败 medium 下的 GPT-5.6 Sol。
  • Factuality:Sol 的错误约为前代的一半。更高 effort 的 Luna 与 GPT-5.6 Sol 持平,成本约为其百分之一。
  • Cost movement within the tier:Luna 在 high effort 下比自己的前代高 5.4 分,单任务成本低 58%。

有两点必须诚实说明。上面每一个对比都是针对 Claude Opus 5 写的,因为 Anthropic 在同一天发布了 Opus 5.5,而 OpenAI 的帖子早于它。另外,那张表里的 Astra 数字只是一个 low effort 的数据点;OpenAI 明确表示 Astra“在所有方面仍然是我们最好的模型”。这里没有任何一句说 Astra 输了。它说的是:用 low effort 的 Astra 去买 30.3%,是一种昂贵的方式。

消失的那个档位,以及发生位移的那个

GPT-5.6 是 Sol、Terra 和 Luna。GPT-6 是 Astra、Sol 和 Luna。没有 GPT-6 Terra。

这不是把老的中档改个名。Astra 的位置在 GPT-5.6 Sol 之上,而 GPT-6 Sol 以远低于该档位名称历史费率的价格,继承了中间的位置。如果你的代码今天固定使用 gpt-5.6-terra,那么按角色对应最接近的 GPT-6 模型是 Sol,而不是某个同名的继任者。我们那篇命名解释如今已经成为代际历史,而不是当下的对照表。

两个沿用下来的名字,它们的价格谱系:

档位名称 GPT-5.6 标价 GPT-6
Sol $5 / $30 $2 / $10
Luna $1 / $6 $0.10 / $0.50

同样的名字,不同的模型,不同的成本结构。你的配置里任何把档位名称当作稳定能力等级来处理的地方,都需要重新读一遍。

如何选档位

工作负载 档位 原因
分类、抽取、路由、打标签 Luna,low 或 medium 输出只有一个词时,reasoning token 就是全部账单。输出费率最低的直接取胜。
大文档摄取、长转录文本、整仓库读取 Luna 1M 上下文、$0.10 输入价,以及任何你发送两次的内容都享有 90% 缓存读取折扣。
Coding agent、多步工具调用、浏览器自动化 Sol,high 或 xhigh 这正是 OpenAI 公布的单任务成本数字相对表内所有其他方案最有优势的区间。
测试生成、schema 校验、规范评审 先用 Luna,失败再上 Sol 按结果路由,而不是靠猜。把失败的提升一档重试。
真正的前沿工作,且答错的代价很高 Astra 厂商称其在所有方面都是最好。把它当作兜底来编预算,而不是默认选项。

第四行里的路由模式才是真正省钱的那个。先跑便宜档,用程序校验输出,只把失败的部分升级。如果 Luna 以每个任务 $0.02 清掉队列的 80%,Sol 以 $0.41 收拾剩下的,你的混合成本大约是 $0.10,而不是 $0.41。

在你假设便宜档同时也是快档之前,先看一条关于延迟的脚注。第三方机构 Artificial Analysis(不代表两家厂商中的任何一家)测得,Sol 的 max reasoning variants 为 115.2 输出 token/秒、首 token 时间 102.15 秒,Luna 为 153.9 token/秒、首 token 时间 124.23 秒。这些都是 max effort 下的数字,不能用来描述一次 low effort 的调用。两分钟的首 token 时间对 API 契约意味着什么,我们在那篇延迟文章里拆解过。

在你自己的流量上测量

厂商的单任务成本数字来自厂商自己的测试框架。你的会不一样,而唯一能决定事情的对比,是在你自己的 prompt 上跑出来的那个。

每个响应里的 usage 字段都带着你需要的东西:

{
  "model": "gpt-6-luna",
  "usage": {
    "input_tokens": 41200,
    "input_tokens_details": { "cached_tokens": 39800 },
    "output_tokens": 2140,
    "total_tokens": 43340
  }
}

那一次调用按 Luna 费率计算的成本:1,400 未缓存输入按 $0.10/M,39,800 缓存输入按 $0.01/M,2,140 输出按 $0.50/M。即 $0.00014 加 $0.000398 加 $0.00107,约为 $0.0016。要乘上任务需要的调用次数,而不是任务数量。

三条规则让测量结果可信:

  1. Count whole tasks, not calls. 把一次运行中每一步的 usage 都加起来,包括重试和失败的那些。
  2. Hold effort constant per row. 一张 Luna-at-max 对比 Sol-at-low 的表,如果你不在表头里说明,它就什么也告诉不了你。
  3. Log the cached token count separately. 在冷缓存上跑的档位对比会美化贵的那个模型,因为便宜模型的优势在重复前缀上最大。

实际操作中,这就是一个保存下来的请求、一个用于模型 id 的变量,以及对 usage 字段的一条断言。Apifox 很擅长处理这种形态:把调用定义一次,通过环境变量切换模型,再把这个集合当作测试场景来跑,这样 usage 数字会落进一份报告,而不是三个终端窗口。同一个场景还能在某个档位调价时当作回归检查——按这个发布节奏,那不过是几个月内的事。

简要版本

按 token 算,Luna 的输入价格比 Astra 便宜一百倍。按任务算,在 OpenAI 自己公布的基准测试上,排名就没那么干净了:Sol 在 xhigh effort 下于 AutomationBench 击败 low effort 的 Astra,而成本约为其四分之一;Luna 在 max effort 下与单任务成本高它十倍的模型已经相差无几。

从 Luna 起步,失败就升级,把 Astra 留给那些答错比答慢代价更高的工作。然后自己去测量,因为上面每一个数字都是在别人的工作负载上产生的。

想了解同一 48 小时内两场发布的全景,见我们的《2026 年 9 月 AI 模型价格战》综述。

开发必备:API 全流程管理神器 Apifox

介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。

如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

Apifox

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。

获取专属报价与部署方案

icon 详细的私有化部署系统架构与安全白皮书
icon 针对您公司规模的专属报价单
icon 免费的 1v1 专属产品演示 (Demo) 机会
获取部署方案
* 提交后,我们的客户经理将在 1 个工作日内与您联系
林俊锋 企业微信
@Apifox 专属顾问
扫码备注: 私有化 + 公司名