Google 于 2026 年 7 月 21 日更新了其 Flash 级别模型,主力模型版本跃升至 Gemini 3.6 Flash。如果你正在生产环境中运行 3.5 Flash,简而言之:3.6 Flash 是一个更便宜、Token 效率更高的无缝替代方案,大多数团队都应该进行升级。相同的模型系列,相同的 1M Token 上下文,相同的输入价格。每个 Token 的输出成本更低,且模型在完成相同任务时写入的输出 Token 更少。有关新模型的完整介绍,请参阅什么是 Gemini 3.6 Flash。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
简短结论
建议升级。Gemini 3.6 Flash 保持了每百万 Token 1.50 美元的输入价格,将输出价格从每百万 Token 9.00 美元降至 7.50 美元,并且在执行相同任务时,产生的输出 Token 比 3.5 Flash 减少约 17%。它在计算机使用基准测试中的得分也更高(在 OSWorld-Verified 上为 83.0 对比 78.4),并且在多步骤工作流中需要的推理步骤更少。暂缓升级的唯一原因:你已在生产环境中锁定并验证了 3.5 Flash,且目前还无法重新运行评估。
究竟有哪些提升
主要有四个方面的变化,这些也是迁移的理由。

更少的输出 Token。 在执行相同任务时,Gemini 3.6 Flash 产生的输出 Token 比 3.5 Flash 减少约 17%。输出 Token 包含了思考 Token,因此效率更高的推理模型只需写入更少的内容即可得出相同的答案。由于你需要为每个输出 Token 付费,这直接关系到成本支出,而非虚荣指标。
更低的输出价格。 Google 将输出价格从每百万 Token 9.00 美元降至 7.50 美元。在上述 Token 数量减少的基础上,每 Token 费率又降低了 17%。
更好的计算机使用能力。 在用于测试操作真实计算机界面的基准测试 OSWorld-Verified 上,3.6 Flash 的得分从 3.5 Flash 的 78.4 提升至 83.0。如果你正在构建能够点击 UI、填写表单或操作工具的 Agent,这一提升将直接体现为失败步骤的减少。
更少的推理步骤和工具调用。 在多步骤的 Agent 工作流中,3.6 Flash 以更少的推理步骤和更少的工具调用即可达成目标。每次避免的工具调用都省去了一次您无需付费也无需等待的往返(round trip),因此这与任何 Agent 化任务中的 token 节省产生了叠加效应。代码编写的准确率也得到了提升,这在模型需要编辑文件或生成 diff(其中一个错误的 token 就会导致构建失败)的场景中尤为重要。
这些改变均未影响 API 的形态。它拥有相同的请求格式、相同的输入模态(文本、图片、视频、音频、PDF)以及相同的文本输出。
这对您的账单意味着什么
两种降低成本的效应叠加在了一起。您不仅能享受更低的单个输出 token 价格,而且需要付费的输出 token 数量也减少了。它们是乘数效应,而不仅仅是简单的相加。
举个例子说明。假设某项每日任务在 3.5 Flash 上生成了 1000 万个输出 token:
- 在 3.5 Flash 上: 10M 输出 token x 每 1M $9.00 = 输出项每日花费 $90.00。
- 在 3.6 Flash 上: 减少 17% 的输出 token 后约为 8.3M token,每 1M $7.50 = 每日花费 $62.25。
这相当于该工作负载在输出端降低了约 31% 的成本,而且您不需要修改任何 prompt。您的输入成本保持不变,因为输入价格同样是每百万 $1.50,且您的 prompt 并没有改变。在包含大量工具调用的 Agent 工作负载中,这一降幅可能会更大,因为更少的往返次数同样会减少整个运行过程中的总 token 数。
您的实际节省幅度取决于您的输入与输出比例。读取多、写入少任务(如分类、提取)的总体变化较小,因为节省的费用主要集中在输出端。而写入多的任务(如起草、代码生成、长 Agent 追踪)收益最大。关于费率、缓存以及思考 token 细节的完整说明,请参阅 Gemini 3.6 Flash 定价以及官方的 Gemini API 定价文档。
还有理由继续使用 3.5 Flash 吗?
有,但范围很窄。请坦率地评估您属于哪种情况。
固定使用 3.5 Flash 的合理原因是您已经在生产环境中对其进行了验证,且目前无法重新进行测试。也许您有一个与合规性签字绑定的锁定评估套件。也许您有经过 prompt 微调的输出,且下游解析器依赖于此,而在此迭代(sprint)中无法安排回归窗口。更换模型会微妙地改变输出,在您今天无法重新验证的系统中,“更便宜”并不值得冒着系统默默崩溃的风险。在这种情况下,请继续固定使用 gemini-3.5-flash,直到您有测试窗口,然后再从容地进行迁移。
澄清一下:3.5 Flash 不会在 3.6 发布当天就下线。它仍可以通过 API 使用,固定使用它是一个合理的短期决定。这不是“是否”升级的问题,而是“何时”升级的问题。对于大多数没有硬性验证限制的团队来说,资金成本和模型质量都表明现在就应该进行升级。
如何迁移
实操部分只需修改一行代码。在您的 API 调用中,更换模型 ID:
- 从
gemini-3.5-flash - 修改为
gemini-3.6-flash
这就是全部的代码更改。请求 body、auth 和接口都保持不变,因此你的集成中没有其他地方需要改动。如需了解完整的单步请求演示,请参阅如何使用 Gemini 3.6 Flash API 以及 Gemini API 文档。
真正的工作在于验证,而非模型替换。在将新的模型 ID 推送到生产环境之前,你需要:
- 针对 3.6 Flash 重新运行你的评估套件,并将其质量评分与 3.5 Flash 基线进行对比。
- 重新运行你的回归测试,因为不同版本之间的输出结构(shape)和措辞可能会发生变化。
- 检查所有依赖精确结构解析模型输出的内容(例如 JSON key、正则表达式、下游数据模型校验)。
- 在完全推广之前,先通过部分真实流量样本观察延迟和 Token 消耗。
如果你的输出会喂给另一个服务,请像对待任何依赖升级一样对待这次替换:在特性开关(feature flag)后进行更改,对比效果,然后推广。
在 Apifox 中对替换进行回归测试
这正是 Apifox 在迁移中发挥价值的地方。Apifox 是一个 API 客户端和测试平台,因此是在你信任并将其投入生产环境之前,验证 3.6 Flash 行为是否符合预期的首选之地。它本身并不运行模型,而是发送请求并检查响应。
一种对两个模型进行 A/B 测试的清晰方法:
- 保存你现有的 Gemini 请求。 在 Apifox 中构建指向 Gemini API 的
POST调用,并将你的 API key 存储在环境变量中,以防其直接暴露在请求 body 中。 - 克隆该请求。 仅修改一个地方:将模型 ID 从
gemini-3.5-flash改为gemini-3.6-flash。其他所有内容保持完全一致,以便进行同等对比。 - 添加断言。 对状态码以及你的应用实际读取的 JSON 字段进行断言,这样一旦结构发生变化就会立即报错,而不会隐蔽地传导到下游。
- 对比响应和延迟。 触发这两个请求,将输出进行并排对比,并检查 3.6 的响应是否依然能通过 3.5 响应所通过的每一个断言。记录每个请求的响应时间和 Token 使用情况。
- 持续保持断言为绿色(通过状态)。 将两者保存为一个测试场景并将其设置为定时任务以进行回归测试,这样未来的模型或 prompt 变更就不会在暗中破坏契约。
这就是最实在的工作流:克隆请求,仅更改模型 ID,然后让断言来告诉你替换是否安全。如果你想针对自己的 Gemini 调用进行对比,可以下载 Apifox。
FAQ
Gemini 3.6 Flash 是 3.5 Flash 的无缝替代品吗? 从机械性操作上来说,是的。你只需将模型 ID 从 gemini-3.5-flash 更改为 gemini-3.6-flash,请求的其他部分保持不变。但你仍然应该在投产前重新运行评估和回归测试,因为不同版本之间的输出措辞和结构可能会发生变化。
输入价格有变动吗? 没有。两个模型的输入价格仍保持在每百万 Token 1.50 美元。只有输出价格发生了变化,从每百万 Token 9.00 美元降至 7.50 美元。
为什么该模型是 3.6,而 Lite 和 Cyber 变体却是 3.5? 谷歌在此次更新中仅将主力 Flash 模型升级到了 3.6。Flash-Lite 和 Flash Cyber 仍作为 3.5 版本发布。该系列不同层级的版本号并非步调一致,因此请认准模型 ID,而不仅仅是系列版本号。
我的账单一定会下降 31% 吗? 不,这个数字只是针对输出密集型工作负载的示例说明。您的实际节省费用取决于您的输入与输出 Token 比例。输出密集型任务节省最多;读取密集型任务节省较少,因为折扣主要体现在输出上。
3.5 Flash 还能用吗? 能用。它仍然可以通过 API 获取。如果您已经对其进行了验证,但目前还无法重新进行测试,那么短期内锁定在该版本是一个合理的选择。请计划在下一个测试周期中进行迁移。
关于该模型所替代的前一代版本,请参阅什么是 Gemini 3.5。
对于大多数团队而言,数据和基准测试结果是一致的:将模型 ID 更改为 gemini-3.6-flash,在 Apifox 中运行您的评估并进行快速的回归测试,即可享受更便宜、更高效的模型。只有在验证锁定迫使您不得不维持现状时,才继续锁定 3.5 Flash,并在迁移窗口开启的第一时间进行迁移。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会