谷歌在 2026 年 8 月 13 日(即 3.6 Flash 发布三周后)推出了 Gemini 3.7 Flash,并称其为“我们最智能的主力模型”。对于任何关注 API 账单的人来说,最关键的细节不在于跑分,而在于定价表:每百万 input token 0.75 美元、每百万 output token 3.75 美元的推广期费率将于 2026 年 12 月 31 日到期。从 2027 年 1 月 1 日起,这两项费率都将翻倍。
这意味着你基于该模型构建的所有工作负载的费用都将预定翻倍。一个现在每月花费 790 美元的聊天机器人,到 1 月在代码、流量或提示词没有任何改变的情况下,费用将变成每月 1,575 美元。因此,在为 3.7 Flash 项目制定预算时,请针对这两种费率阶段都进行建模,而不要只盯着标价。
本指南将详细介绍这两个费率阶段、三种实际工作负载的 token 计算方法、该价格与其他模型 API 的对比,以及在价格翻倍前如何降低开支。如果你还没有发送过第一个请求,Gemini 3.7 Flash API 快速入门会涵盖配置步骤。一旦你开始调用,Apifox 会在每个响应中展示 usageMetadata token 计数,因此下面的每个估算值都可以作为与实际流量进行对比的参考数据。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
TL;DR
- 推广期费率:每 100 万 input token 0.75 美元,每 100 万 output token 3.75 美元,有效期至 2026 年 12 月 31 日。
- 自 2027 年 1 月 1 日起的标准费率:input 1.50 美元,output 7.50 美元。正好翻倍。
- 推广期价格是 Gemini 3.6 Flash 发布时价格的一半。
- 该模型在 100 万 token 的上下文窗口内支持文本、图像、视频、音频和 PDF 输入,且 output token 上限为 64k。
- 实例估算:一个每天处理 10,000 个请求的聊天机器人,在推广期费率下每天运行费用约为 26 美元,在标准费率下每天约为 52.50 美元。
- 上下文缓存(context caching)、限制输出长度、批处理以及将轻量流量路由到更小的模型是降低开支的主要手段。
两个费率阶段
Gemini 3.7 Flash 推出时采用的是限时折扣,而不是永久定价。以下是 Gemini API 的完整费用概览:
有两点非常引人注目。首先,推广期费率是 Gemini 3.6 Flash 发布时价格的一半,这使得接下来的四个半月成为该模型系列有史以来最便宜的时间窗口。如果你正在权衡是否从 3.6 升级,3.6 到 3.7 Flash 迁移指南涵盖了替换步骤;单是降价节省的费用就足以弥补回归测试的成本。
其次,在这两个阶段,output token 的成本都是 input token 的 5 倍。这一比例决定了本指南后面提到的每一个优化决策:缩减冗长的系统提示词(system prompt)只能省下蝇头小利,而限制失控的输出则能省下大笔资金。
上述费率涵盖了通过 AI Studio Key 计费的 Gemini API。Vertex AI 则通过 Google Cloud 计费并使用其独立的 SKU,且诸如 context caching(上下文缓存)和 batch processing(批量处理)等功能均有各自的独立计费项,因此在确定预算之前,请务必在 官方定价页面 上核实最新数据。
实际工作负载的成本
在乘以流量之前,每百万 token 的价格毫无意义。以下是三个假设前提下的工作负载概况,你可以根据自己的实际数据进行替换。
工作负载 1:客户支持聊天机器人
假设每天 10,000 次请求。每次请求携带约 2,000 个输入 token(系统提示词、简短的历史窗口、用户消息),并返回约 300 个输出 token。
| 计费项 | 每日 Token | 优惠价/天 | 标准价/天 |
|---|---|---|---|
| 输入 | 20M | $15.00 | $30.00 |
| 输出 | 3M | $11.25 | $22.50 |
| 总计 | 23M | $26.25 | $52.50 |
按 30 天计算,每月成本约为 $788(优惠价)或 $1,575(标准价)。目前,每轮对话的成本约为四分之一个美分。
工作负载 2:PDF 文档流水线
Gemini 3.7 Flash 可原生读取 PDF,且其 GDP.pdf 基准测试分数相较于 3.6 Flash 从 22.0% 提升至 34.0%,因此文档提取是 Google 预期你在此运行的工作负载。假设每天处理 500 份文档,每份文档平均 40,000 个输入 token(如长合同或报告),生成 1,000 个 token 的结构化摘要。
| 计费项 | 每日 Token | 优惠价/天 | 标准价/天 |
|---|---|---|---|
| 输入 | 20M | $15.00 | $30.00 |
| 输出 | 0.5M | $1.88 | $3.75 |
| 总计 | 20.5M | $16.88 | $33.75 |
目前每月约为 $506,1 月起约为 $1,013。注意其成本构成:由于文档很长而摘要很短,输入成本占主导地位。缓存和批量处理对这类工作负载的影响最为显著。
工作负载 3:Agent 循环
Agent 会成倍增加调用次数。假设每天 200 个任务,每个任务平均 12 次模型调用,其中每次调用携带 8,000 个输入 token(不断增长的上下文加上工具结果),并返回 400 个输出 token。
| 计费项 | 每日 Token | 优惠价/天 | 标准价/天 |
|---|---|---|---|
| 输入 | 19.2M | $14.40 | $28.80 |
| 输出 | 0.96M | $3.60 | $7.20 |
| 总计 | 20.16M | $18.00 | $36.00 |
这意味着每月成本为 $540(优惠价)或 $1,080(标准价)。Agent 计费带来的教训是:上下文会随着每一步操作而增长,因此调用次数和上下文长度是复合增长的。如果一个任务从 12 次调用激增到 20 次,成本会增加 67%,而定价表中没有任何条款能预警这一点。
还有一个值得记住的数字:64k 的输出上限将每次调用的最坏情况限制在目前约 $0.24,明年约为 $0.48。如果重试循环在每次尝试中都达到输出上限,成本会迅速增加,但它不会无限制地增长。
3.7 Flash 定价对比
跨服务商的每 token 精确价格对比几周就会过时,因此请将其视为一种市场定位分析,而非价格表。
Gemini 3.7 Flash 定位为主力模型层级:其价格远低于 Gemini 自家的 Pro 系列、Claude 的大型模型或 OpenAI 的旗舰系列等前沿模型,同时其基准测试得分(在 DeepSWE v1.1 上为 65.3%,WebDev Arena Elo 评分为 1588)与不久前旗舰模型的得分相差无几。谷歌的判断是,大多数生产环境的流量并不需要前沿模型,而其推出的首发优惠则是一个为期四个月的邀请,供您在自己的工作负载上测试这一论断。
竞争背景也同样重要。廉价模型供应商一直在向相反的方向调整价格;DeepSeek 提高了其 API 费率,迫使团队重新评估 Token 预算,这一情况已在 DeepSeek 涨价与成本优化指南中有所提及。这一教训同样适用于 Gemini:任何你用来构建利润空间的价格都可能会发生变动,而且谷歌已经明确告知了你变动的日期和幅度。这已经比大多数供应商提供的提前警告要多得多。
如果您的流量是突发性的或实验性的,请记住价格翻倍只会影响持续性的工作负载。在首发优惠期间花费 3 美元的原型项目,之后也只需 6 美元,这无伤大雅。但如果是一个每月花费 10,000 美元的流水线(pipeline)飙升至 20,000 美元,这绝对会变成财务团队在二月份向你质问的账单项目。
降低 Token 开销的五种方法
5 倍的输出与输入价格比以及一月份的价格翻倍,都指向了同一套优化杠杆。
限制每个接口的输出 Token 数量。 将 generationConfig 中的 maxOutputTokens 设置为每个接口所需的最小值。客服回复很少需要超过 500 个 Token;如果保留默认的 64k 限制,意味着一次异常的生成可能会耗费普通生成的 100 倍成本。这是投资回报率最高的一项改动,因为输出 Token 带有 5 倍的乘数效应。
缓存静态上下文。 如果每个请求都重复发送相同的 3,000 Token 的系统提示词和政策文档,那么您每天都要为这些完全相同的字节支付数千次全额输入费用。上下文缓存会以优惠费率对重复的 Token 进行计费;请查看 Gemini API 接口文档 以了解当前的缓存配置和费率。对于上述聊天机器人,缓存 1,500 Token 的静态前缀可以削减将近一半的输入账单费用。
批量处理非交互式任务。 文档流水线并不需要亚秒级的响应。批处理通过牺牲延迟来换取折扣费率,而夜间的文档批处理运行正是为这种流量模式而设计的。
根据路由选择合适规格的模型。 并非每次调用都需要 3.7 Flash。分类、路由和简短提取任务通常在 Flash-Lite 级别的模型上运行良好,且成本仅为前者的一小部分。请将 3.7 Flash 留给那些确实物有所值的调用:多步规划、调试、工具调用链。
在免费层进行原型设计。 在产生任何付费 Token 之前,AI Studio 的免费配额足以帮您确定提示词和响应的数据模型。Gemini API 免费访问指南介绍了免费额度的覆盖范围以及限制条件。
使用 Apifox 监控每个接口的开销
估算只能帮你制定预算,而单次请求的度量才能帮你守住预算。每个 Gemini 响应都包含一个 usageMetadata 块,其中记录了 prompt 和 output 的 token 数量,这意味着你的 API 测试层还可以兼作成本计量器。
在 Apifox 中,工作流如下所示:
- 在集合中为每个生产接口(对话轮次、文档摘要、agent 步骤)保存一个请求,并将 API key 绑定到
GEMINI_API_KEY环境变量。 - 构建一个测试场景,针对真实的 payload 发送每个请求,并从响应中提取
usageMetadata.promptTokenCount和usageMetadata.candidatesTokenCount。 - 对这些计数添加断言。如果对 prompt 的修改导致聊天接口超出了(例如)2,500 个输入 token,该场景就会在变更发布前报错失败,避免无意中增加 25% 的账单费用。
- 每次修改 prompt 或数据模型时重新运行该场景。Token 数量的增加(退化)与延迟增加类似;不同之处在于,Token 的增加最终会变成真金白银的账单。
将测得的计数乘以本指南中的档位价格,你就能得到基于真实响应而非凭空猜测的每个接口的成本数据。已经在使用基于断言的 API 测试套件的团队会觉得这个模式似曾相识;面向 QA 工程师的 API 测试指南介绍了如何在整个服务中构建此类场景。
FAQ
Gemini 3.7 Flash 的价格什么时候翻倍?
2027 年 1 月 1 日。每 100 万输入 token 0.75 美元和每 100 万输出 token 3.75 美元的前期推广价将持续到 2026 年 12 月 31 日,之后将调整为 1.50 美元和 7.50 美元的标准费率。Google 在发布时就公布了这两个档位的价格,因此这一价格上涨是既定计划,而非猜测。
Gemini 3.7 Flash 比 Gemini 3.6 Flash 更便宜吗?
在发布初期,是的。3.7 Flash 的推广价格只有 3.6 Flash 发布价格的一半,而在各项基准测试中都有所提升(DeepSWE v1.1 从 49.0% 提升到了 65.3%)。如果你想进行横向对比,可以在 Gemini 3.7 Flash 快速参考中查看完整的规格和基准测试对比表。
推广价格适用于 Vertex AI 吗?
本指南中的费率是通过 AI Studio 密钥计费的 Gemini API 价格。Vertex AI 则通过 Google Cloud 计费,拥有自己的 SKU 和企业条款。如果你在 Vertex 上运行生产流量,请在 GCP 计费控制台和官方定价页面中确认当前数据,而不要想当然地认为两者价格一致。
哪些内容会计入输入 token 账单?
你发送的所有内容:文本、图片、视频、音频和 PDF 页面都会转换为 token 并按输入费率计费。长文档和包含大量媒体的请求往往会带来意想不到的输入成本,这就是为什么上面的管道示例中假设每个文档有 40,000 个 token。每个响应中的 usageMetadata 块会在请求完成后向你展示准确的计数。
如何在发送请求之前估算 token 数量?
使用 API 的 countTokens 接口在不生成任何内容的情况下测量 payload,或者发送少量具有代表性的请求并从响应中读取 usageMetadata。无论使用哪种方式,都请使用真实的 payload 进行测量。从其他服务商处获得的分词器经验在不同的模型系列之间很难通用。
3.7 Flash 在你技术栈中的定位
处于首发优惠价的 Gemini 3.7 Flash 是此类能力模型中有史以来最便宜的,而且 Google 已经告知了你该优惠截止的准确日期。理性的做法是:现在就将你的主力业务流量迁移到它上面,在优惠进行期间测量每个接口的实际 token 消耗,并利用这四个月的数据来决定哪些业务保留在 3.7 Flash 上,哪些降级到更轻量的模型,以及在标准资费账单到来之前预测其大致金额。
该计划中负责测量的这一半需要工具支持。下载 Apifox 以将你的 Gemini 请求、环境、token 断言和成本检查保留在同一个工作区中,这样一月份的账单就会是一个你早已预测到的数字,而不是一个让你始料未及的数字。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会