如果你维护着一张模型价格表,它这一周已经过期了。xAI 在 9 月 21 日发布了 Grok 4.7。第二天,Anthropic 发布了 Claude Opus 5.5,OpenAI 发布了两款新的 GPT-6 模型 Sol and Luna。48 小时里三次发布,同一天两家前沿实验室,而你成本模型里的每一行现在都是错的。
每 token 的数字在下面。更有价值的一点是:每 token 价格已经不再是大家在竞争的计量单位,而且本周最响亮的说法之一在发布后几个小时内就失效了。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
所有新价格汇成一张表
| 模型 | API id | 输入 $/M | 输出 $/M | 缓存输入 | 上下文 | AA 智能指数 |
|---|---|---|---|---|---|---|
| Claude Opus 5.5 | claude-opus-5-5 |
$4 | $20 | $0.20 读取,$5 写入 | 1M | 58,212 个中排名第 1 |
| GPT-6 Sol | gpt-6-sol |
$2 | $10 | 读取降价 90% | 872k | 48 |
| GPT-6 Luna | gpt-6-luna |
$0.10 | $0.50 | 读取降价 90% | 1M | 37 |
| GPT-6 Astra | 不适用 | $10 | $50 | 不适用 | 不适用 | 不适用 |
| Claude Opus 5(上一代) | claude-opus-5 |
$5 | $25 | 不适用 | 不适用 | 不适用 |
| Grok 4.7(9 月 21 日) | 不适用 | $2 | $6 | 不适用 | 不适用 | 不适用 |
有三点很突出。Opus 5.5 是 $4/$20,而 Opus 5 是 $5/$25,也就是说旗舰便宜了 20%,同时以 58 分拿下 Artificial Analysis 指数第一。Sol 的输入和输出价格都只有 Astra 的五分之一。而 Luna 把 1M 上下文窗口带到了每百万输入 token 十美分。
Anthropic 还为 Opus 5.5 列出了快速模式 $8/$40 和 128k 最大输出。如果你从我们的 Claude Opus 5 定价或 GPT-5.6 定价文章里硬编码过费率,那些页面现在描述的是上一代。
真正变动的是单任务成本,而不是每 token 成本
OpenAI 的发布文章不是以每 token 费率开场的,而是以每个已完成任务的成本开场,它公布的那张表是本周最有意思的材料。
| 模型(reasoning effort) | AutomationBench 1.0.6 | 单任务成本 |
|---|---|---|
| GPT-6 Sol(xhigh) | 33.2% | $0.27 |
| Fable 5.1 带 Opus 5 兜底(max) | 31.4% | 超过 Sol 的 8.9x |
| GPT-6 Astra(low) | 30.3% | 是 Sol 的 3.9x |
| Claude Opus 5(max) | 26.9% | 是 Sol 的 11.1x |
仔细看最后一行。extra-high reasoning 的 Sol 得分高于 max 档位的 Opus 5,而单任务成本只有 Opus 5 的约 9%。单任务成本是诚实的单位,因为它把每 token 定价藏起来的东西都算了进去:reasoning token、工具调用、重试,以及一个模型在停下来之前需要多少轮。一个标价是两倍、但用三分之一 token 就干完同样活的模型更便宜,而没有任何定价页会告诉你这一点。
这个模式在重复。在 Agents’ Last Exam V1 上,max 档位的 Sol 得分 56.4%,高于 Opus 5 的最好成绩,单任务成本低 60%。在 DeepSWE 1.1 上,max 档位的 Sol 达到 68.8%,与 xhigh 档位的 Fable 5(69.9%)只差 1.1 分,而单任务成本大约便宜 80%;max 档位的 Luna 得分 66.6%,OpenAI 把它与中等 effort 的 Opus 5 和 Fable 5 归在同一档,单任务成本比 Opus 5 低 93%、比 Fable 5 低 96%。在 OSWorld 2.0 离线测试中,xhigh 档位的 Sol 得分 60.5%,对手是中等档位 Opus 5 的 60.3%,同样单任务成本便宜约 80%。在事实性上,OpenAI 称 Sol 的错误量约为前代的一半,而更高 effort 的 Luna 以约百分之一的成本与 GPT-5.6 Sol 持平。
实际后果是:采购问题不再是“每百万 token 多少钱”,而是“我的一个任务端到端要花多少钱”,而这只有你自己的任务负载能回答。
当天发布、当天就失效的那份对比
上面每一条主张都是对照 Claude Opus 5 测出来的,因为 OpenAI 写那篇文章时 Opus 5.5 还不存在。Anthropic 在几小时后就发布了 Opus 5.5:比 Opus 5 便宜 20%,按 Anthropic 自己的数字运行成本低 40%、输出快 30%,并登顶 Artificial Analysis 指数。
所以“以 9% 的单任务成本胜过 Opus 5”是一句关于某个当天下午就被取代的模型的真话。没有人公布过 Sol-versus-Opus-5.5 的单任务成本数字,因为这些表里的每一个测试框架都在 Opus 5.5 出现之前就跑完了。如果你正要凭着这个比例迁移某个任务负载,你对比的是一个你已经不会再部署的模型。
反方向也要小心。Anthropic 自己关于 Opus 5.5 的表格写的是:Terminal-Bench 4.0 为 66.4%、FrontierCode v1.1 为 54.4%、CursorBench 4.0 为 57.8%、GDPval-AA v2.1 达到 1846 Elo、AutomationBench 为 40.0%、Humanity’s Last Exam 带工具为 67.7%、OSWorld 2.0 为 81.8%、Chartography 为 89.0%。那个 AutomationBench 40.0% 不能和 OpenAI 的 33.2% 相减:测试框架版本不同、effort 设置不同、运行批次不同,也没有说明共同的基线。两家厂商引用同一个基准测试名字,并不构成正面对比。OpenAI 自己的说法是 Astra“在所有方面仍然是我们最好的模型”,所以本周 GPT-6 的故事讲的是价格和效率,而不是新的天花板。X 上流传的、把具体的 Opus 5.5 数字和具体的 Astra 数字并列的对比是推文,不是厂商数据。
“便宜 50%”是对照一个折扣算出来的,而真实降幅更大
OpenAI 表示 Sol 和 Luna 都比 GPT-5.6 promotional pricing 便宜 50%。“促销”是 OpenAI 自己的用词,而且这个词是承重的:被减半的基线是一个折扣价,不是标准标价。本周有很多报道把这个限定词丢掉了。
下面是它的谱系,用的是我们当时在自家发布报道里记录的 GPT-5.6 标价:
| 档位 | GPT-5.6 标价(每 1M 输入 / 输出) | GPT-5.6 促销价 | GPT-6 |
|---|---|---|---|
| Sol | $5 / $30 | $4 / $20 | $2 / $10 |
| Terra | $2.50 / $15 | $2 / $12 | 未发布 GPT-6 Terra |
| Luna | $1 / $6 | $0.20 / $1.20 | $0.10 / $0.50 |
由此得出两点。第一,标题的诚实版本比标题本身更猛:对照 GPT-5.6 标价,$2/$10 的 Sol 相当于输入降 60%、输出降 67%,而 $0.10/$0.50 的 Luna 是 90% 和 92%。OpenAI 对照的是自家的促销价,对任何按标价做预算的人来说,这低估了这次变动。
第二,没有 GPT-6 Terra。GPT-5.6 是 Sol、Terra 和 Luna;GPT-6 是 Astra、Sol 和 Luna。如果你的配置里钉着中间档位,没有任何对等的继任者在等着它,而我们那篇 GPT-5.6 命名指南现在读起来是历史,而不是当前地图。
便宜的模型不是快的模型
Artificial Analysis 测量了这些新模型。对 max reasoning variants,它报告 GPT-6 Sol 的输出速率为 115.2 token/秒、首 token 时间 102.15 秒,Luna 为 153.9 token/秒、首 token 时间 124.23 秒。[待核实] 这些是第三方数字,不是厂商数字,而且描述的是最高 reasoning 档位,不是你在 low 或 medium effort 下会看到的结果。
从方向上看,这就是价格战给出的交换:用成本的一小部分换取接近前沿的质量,代价是第一个字节到达之前的延迟。对批处理任务或夜间 agent 运行来说没问题,对人类正在等待的请求来说是致命的。
这件事要自己测,而不是从排行榜上继承,因为它会随你的 effort 设置、prompt 大小和区域变化。把 Apifox 指向每个候选模型的 completions 接口,用你实际会上线的 effort 档位发送同一个 prompt,并把首字节时间和总响应时间记录在 body 旁边。把它保存成测试场景,下一次发布就只是一次重跑,而不是一个研究项目。
缓存是本周降价的另一半
与这些模型一同,OpenAI 为 GPT-6 发布了一次真正的提示缓存更新:缓存输入读取 90% 折扣、默认更高的命中率、Prompt Caching Dashboard、诊断工具,以及两个比折扣更重要的行为修复。修改 reasoning effort 或工具可用性不再使缓存失效,而显式断点让你决定缓存前缀在哪里结束。OpenAI 提到 GitHub 在数十亿次请求中需要重新处理的 prompt token 减少了 50% 以上。Anthropic 那一侧在上面的表里:Opus 5.5 的缓存读取每百万 $0.20,而全新输入是 $4,所以一次缓存读取是一次全新输入的 5%。
如果你的 agent 每一轮都重发一大段 system prompt 和一份臃肿的工具 schema——大多数都是如此——这些改动对你账单的影响会超过这里任何一个标价。这让缓存成为本周最持久的一项,也是值得围绕它做工程的一项。
这周该做什么
- Move model ids into config, not code. 两天里有三个 id 变了。
claude-opus-5-5、gpt-6-sol和gpt-6-luna应该放进你可以随时切换的环境变量里,而不是客户端封装里的字符串字面量。 - Re-run your own eval before switching. 厂商的单任务成本表是在厂商的测试框架上、针对厂商的任务测出来的。你的会不一样。
- Instrument cost per task. 把输入、输出和 reasoning token 与已完成的工作单元一起记录,重试也要算进去。按 token 的看板在接下来这一年里都会误导你。
- Set a latency budget and test at shipping effort. 一个单任务成本便宜 93%、首 token 却慢两分钟的模型,是另一种产品,而不是更便宜的产品。
- Audit your cache boundary. 稳定前缀放在前面,易变内容放在后面,平台支持的地方用显式断点。
- Update contract tests for the new envelopes. Sol 是 872k 上下文,Luna 和 Opus 5.5 是 1M,而 Opus 5.5 的输出上限是 128k。按上个月的限额写下的断言会静默通过,然后在生产里被截断。
- Route by task instead of migrating wholesale. 每百万输入 token 从 $0.10 到 $10 的跨度是两个数量级。抽取和分类用便宜档位,确实需要昂贵档位的工作才用昂贵档位。
一个用来理解规模数字:OpenAI 披露其内部研究员的编码 agent 日均花费中位数超过 $600,第 90 百分位为 $7,000。这种幅度的降价针对的正是有这样预算空间的任务负载。如果你的规模更小,它们主要给你的是在同一预算下跑更好模型的选项。
可用性简述
Sol 和 Luna 已进入 Plus、Pro、Business、Enterprise 和 Edu 的 ChatGPT Work 与 Codex。Free 和 Go 可以在桌面版里用 Luna。两者都还没进 Chat。API id 是 gpt-6-sol 和 gpt-6-luna,与现有的 GPT-6 Astra API 并存。Opus 5.5 运行在 Claude Platform、AWS、Google Cloud 和 Azure 上。
想了解逐个模型的细节:什么是 Claude Opus 5.5、什么是 GPT-6 Sol、什么是 GPT-6 Luna、Sol 与 Opus 5.5 的正面交锋,以及 GPT-6 提示缓存发布。
总结
标价降了,但真正的事件是这个行业换了计量单位。单任务成本、缓存命中率和首 token 时间现在决定一个模型让你花多少钱,而它们没有一个出现在定价页上。这周就用你自己的流量把这三个都测一遍,因为大家在引用的那些对比表在发布的那一刻就已经过期了。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会