你有一个接口,用来给工单分类,或者从 webhook payload 里取出三个字段,或者给一条日志写一行摘要。它每个月要跑几百万次。质量标准是“够用且稳定”,而财务团队唯一在意的数字就是账单。
在 2026-09-22 之前,这个价位属于 Google 的 Flash 系列和 DeepSeek。随后 OpenAI 发布了 GPT-6 Luna,输入 $0.10 / 百万 token、输出 $0.50 / 百万 token,还带 1M 上下文窗口,这一档一下子挤满了人。
问题在于,这三个标价并不是同一类数字。一个是对照促销价算出来的降幅,一个会在某个日历日期失效,一个则取决于你的任务在一天中的哪个时段运行。把它们按页面上的原样并排比较,你就会选错模型。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
截至 2026-09-23 的公开价格
| 模型 | API id | 输入 $/M | 输出 $/M | 缓存输入 $/M | 上下文 |
|---|---|---|---|---|---|
| GPT-6 Luna | gpt-6-luna |
$0.10 | $0.50 | 读取降价 90% | 1M |
| Gemini 3.8 Flash | gemini-3.8-flash |
$0.75,2027 年 1 月 1 日起 $1.50 | $3.75,之后 $7.50 | $0.075,之后 $0.15 | 定价页未说明 |
| DeepSeek Flash | deepseek-flash |
$0.30 高峰 / $0.15 低谷(缓存未命中) | $1.20 高峰 / $0.60 低谷 | $0.006 高峰 / $0.003 低谷 | 1M |
Luna 和 DeepSeek 的价格来自各自厂商的定价页。Gemini 这一行来自 Google API 定价页的付费档位。
只看平价的每 token 输入价格,Luna 比 Gemini 3.8 Flash 便宜 7.5x,比高峰时段的 DeepSeek Flash 便宜 3x。输出价格上分别是 7.5x 和 2.4x。如果你从不使用缓存、也从不看脚注,那这就是全部结论。可后面有三个脚注,每一个都可能让结论翻转。
脚注一:OpenAI 的降幅是对照促销价算出来的
OpenAI 称 Luna 以及它更大的兄弟型号 Sol 比 GPT-5.6 的促销价便宜 50%。“促销”是 OpenAI 自己的说法,每次复述这个结论时都应带上这个词。
我们在发布报道中记录过 GPT-5.6 Luna 的标价:输入 $1.00、输出 $6.00。如果以标价而不是促销价来衡量,GPT-6 Luna 的 $0.10 和 $0.50 相当于输入降价 90%、输出降价 92%。真实降幅其实比标题更大,只是标题被锚定在了一个折扣上。
这在实操上意味着:$0.10 和 $0.50 是作为 Luna 的正式价格发布的,不是促销价,所以可以据此做规划。但不要把“比 GPT-5.6 促销价便宜 50%”当成 同口径的代际对比,因为它不是。如果你正在迁移,可以看什么是 GPT-6 Luna,以及 GPT-5.6 Sol vs Terra vs Luna 里对前代档位的拆分。
脚注二:Gemini Flash 的价格带到期日
Google 的定价页把两个数字印在同一个格子里。Gemini 3.8 Flash 现在的价格是输入 $0.75、输出 $3.75,“有效期至 2026 年 12 月 31 日”,之后“从 2027 年 1 月 1 日起”变为 $1.50 和 $7.50。上下文缓存遵循同样的规律:现在 $0.075,明年 1 月 $0.15。Gemini 3.7 Flash 和 3.6 Flash 的行完全一样。
如果你这周基于 Flash 做一个 12-month 的成本模型,那么其中有三个月是按双倍价格计算的。一个团队若按今天的费率给明年的 Flash 支出编 $60k 预算,在用量不变的前提下,实际账单大约是 $90k。这可不是舍入误差。
同一页面上还有两个相关事实。列表中已经没有 Gemini 3.8 Flash-Lite 或 3.7 Flash-Lite。现存最便宜的 Flash-Lite 条目是 Gemini 3.5 Flash-Lite(输入 $0.30、输出 $2.50)和 Gemini 2.5 Flash-Lite(输入 $0.10、输出 $0.40)。最后这一行是整个对比里唯一在输出价格上低于 Luna 的条目,而它已经落后两代了。
脚注三:DeepSeek 的价格取决于时钟
DeepSeek 同时公布高峰和低谷两列价格。高峰时段为 UTC 周一至周五 01:00 至 04:00 和 06:00 至 10:00,不含中国法定节假日。低谷价格整体是高峰的一半。对于 deepseek-flash 来说,就是 缓存未命中输入 $0.30 对 $0.15、输出 $1.20 对 $0.60。
对夜间批处理任务来说这相当于白送钱:把 cron 挪到窗口之外,账单直接减半。但对全球化的交互式流量来说,这是个建模难题,因为你的实际费率是一个混合值,除非把自己的请求分布对照 UTC 时钟测量过,否则你根本报不出一个数。如果 DeepSeek 是认真的候选方案,就在每次调用时把 UTC 时间戳和 token 计数一起记下来,否则你的成本模型只是一张披着电子表格外衣的猜测。
我们此前对该定价结构的拆解见 DeepSeek-V4.1-Flash 定价。
档位真正拉开差距的地方:缓存输入
| 模型 | 平价输入 $/M | 缓存读取 $/M | 折扣 |
|---|---|---|---|
| GPT-6 Luna | $0.10 | $0.01 | 90% |
| Gemini 3.8 Flash | $0.75 | $0.075 | 90% |
| DeepSeek Flash(高峰) | $0.30 | $0.006 | 98% |
DeepSeek 的缓存命中价是整个对比中最便宜的输入价格,比它自己的未命中价低 50x;但它的未命中价同时也是 Luna 平价费率的 3x。也就是说,DeepSeek 对拥有长而稳定前缀的任务回报惊人,却会惩罚每次都发送全新 prompt 的任务。Luna 的这个比值更平,这主要意味着它出错的方式更少。
GPT-6 还发布了一次真正的缓存能力更新,而不只是一条价格线:默认更高的命中率、缓存读取 90% 折扣、Prompt Caching Dashboard 和诊断工具、用来指定缓存前缀在哪结束的显式断点,以及最实用的一点——修改 reasoning effort 或工具可用性不再使缓存失效。GitHub 报告称,在数十亿次请求中,需要重新处理的 prompt token 减少了 50% 以上。如果你曾经眼看着命中率因为有人多开了一个工具而崩塌,你就知道这个特性的价值。更多内容见 GPT-6 提示缓存发布说明。
按 token 计价是错的单位
OpenAI 在公布准确率的同时也公布了单任务成本,这是更诚实的表述方式。在 DeepSWE 1.1 上,Luna 在最高 reasoning 档位得分 66.6%,OpenAI 称这与中等 effort 的 Claude Opus 5 和 Fable 5 相当,而单任务成本比 Opus 5 低 93%、比 Fable 5 低 96%。在 OSWorld 2.0 离线测试中,最高档位的 Luna 以约十分之一的成本胜过中等档位的 GPT-5.6 Sol。在事实性上,更高 effort 的 Luna 以约百分之一的成本与 GPT-5.6 Sol 持平。在 AutomationBench 1.0.6 上对比自己的前代,高 effort 的 Luna 得分高 5.4 分,单任务成本低 58%。
接下来这一点比上面所有内容都更重要:无论 Google 还是 DeepSeek,都没有针对 Gemini 3.8 Flash 或 deepseek-flash 公布这些基准测试上的 cost-per-task 数据。所以本文是一份三方价格对比,外加一家厂商关于自己单任务成本的主张。它不是一份三方 agent 能力排行榜;如果有人给你看这样一份榜单,那要么他在用一个本该说明名字的第三方测试框架,要么就是在编数字。
每 token 对比之所以会误导人,原因在于 reasoning token。一个每 token 便宜 3x 的模型,如果为了完成同一件事多输出 5x 的 token,反而让你花得更多。包含思考过程的输出 token 才是你真正付费的东西,而这个比例只有你自己的任务负载知道。
延迟陷阱
Artificial Analysis(第三方机构,而不是两家厂商中的任何一方)测得 GPT-6 Luna 的输出速率为 153.9 token/秒,首 token 时间 124.23 秒;GPT-6 Sol 为 115.2 token/秒,首 token 时间 102.15 秒。这些数字对应的是“max” reasoning 档位,所以应当读作上限,而不是默认 effort 下的表现。两者都未经 第一方数据验证,请谨慎对待。
但方向本身才是关键。在这一代里,便宜的模型并不是快的模型。两分钟才出首 token,对夜间数据补全任务完全够用,放在聊天框后面则完全不可用。如果你的接口面向用户,那么决定答案的是你所选 effort 档位下的首 token 时间,而不是每百万 token 多少美元。
自己动手测:一个请求,三个环境
三家提供商都接受 OpenAI 格式的 chat completions 调用,所以不需要准备三个客户端。
| 提供商 | 前置 URL | 模型 id |
|---|---|---|
| OpenAI | https://api.openai.com/v1 |
gpt-6-luna |
| Google,OpenAI 兼容层 | https://generativelanguage.googleapis.com/v1beta/openai/ |
gemini-3.8-flash |
| DeepSeek | https://api.deepseek.com |
deepseek-flash |
把请求构建一次,将 base_url、model_id 和 api_key 放进一个 Apifox 环境,然后切换环境,用同一个已保存的请求分别打到三家提供商。没有复制粘贴的 curl,你的三个 prompt 版本之间也不会彼此漂移。
POST {{base_url}}/chat/completions
Authorization: Bearer {{api_key}}
Content-Type: application/json
{
"model": "{{model_id}}",
"messages": [
{"role": "system", "content": "Extract order_id and status. Reply with JSON only."},
{"role": "user", "content": "{{ticket_body}}"}
]
}
Apifox 支持与 Postman 兼容的响应后脚本,所以可以在同一遍里对结构和延迟做断言,并记录 usage 块:
pm.test("content parses as the JSON we asked for", () => {
const parsed = JSON.parse(pm.response.json().choices[0].message.content);
pm.expect(parsed).to.have.property("order_id");
});
pm.test("first byte to last byte under 3s", () => {
pm.expect(pm.response.responseTime).to.be.below(3000);
});
console.log(pm.response.json().usage);
然后用同样的 200 个真实 payload 跑一遍每个环境,每次调用记录四件事:usage.prompt_tokens、usage.completion_tokens、响应时间,以及断言是否通过。把 token 数乘以上面的价格表,再除以通过次数。这样得到的是单次正确答案成本,它是唯一能真正决定选择的数字。DeepSeek 那一遍要跑两次,一次在 UTC 高峰窗口内,一次在窗口外,否则你只测了一半的价格。
该选哪个
| 如果你的任务负载是 | 就选 | 原因 |
|---|---|---|
| 批处理、前缀长且稳定、对缓存友好 | DeepSeek Flash,低谷时段 | 缓存命中时每百万 $0.003,是这一档里最便宜的输入 |
| 每次都是全新的长 prompt、没有可靠前缀、需要 1M 上下文 | GPT-6 Luna | $0.10 平价输入、1M 窗口、不依赖时钟 |
| 已经跑在 Google 基础设施上,或者需要 Gemini 的多模态能力 | Gemini 3.8 Flash | 今天可用,但现在就要为 2027 年 1 月 1 日的翻倍留出预算 |
| 面向用户、受延迟约束 | 谁在你自己的 TTFT 测试里胜出就选谁 | 这三者都不能只凭价格就安全选定 |
| 量极大、以成本建模为先 | 参见更深入的 Luna 成本模型 | 缓存折扣会改变排名 |
最后一行有单独一篇文章:GPT-6 Luna 面向高并发 API 负载。
总结
GPT-6 Luna 目前是 sub-$1 档位里最便宜的平价、无条件、无脚注的价格,而且还附带 1M 上下文窗口。DeepSeek Flash 在缓存输入上大幅领先,却在缓存未命中时输得很惨。Gemini 3.8 Flash 是三者中今天最贵的,而到 1 月会变成两倍。
但这些都不能告诉你该上线什么。用你自己的 payload 把三家都跑一遍,测量单次正确答案成本和首 token 时间,并在下一次发布到来时 重跑一次——按目前的节奏,这会在一个月内发生。想了解 9 月最后一周整体格局的变化,请看 2026 年 9 月的 AI 模型价格战。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会