Gemini 3.7 Flash 是谷歌最新推出的主力 AI 模型,于 2026 年 8 月 13 日发布,距离 Gemini 3.6 Flash 发布仅隔三周。它保留了前代模型 1M token 的上下文窗口和多模态输入能力,同时在编程和智能体(agent)基准测试中取得了巨大进步,其 API 的起步推广价为每 100 万输入 token 0.75 美元。谷歌称其为“我们最智能的主力模型”。
这三周的发布间隔正是核心所在。在 Gemini 3.5 Pro 依然推迟 的情况下,谷歌正以迭代节奏快速发布 Flash 的更新,这意味着中端模型现在成为了有趣的工程成果首先落地的阵地。基准测试的增量数据也印证了这一点:DeepSWE 飙升了 16 个百分点,AutomationBench 几乎翻倍,且推广期定价仅为 3.6 Flash 发布价的一半。
本文将涵盖所有变化:谷歌在其发布声明中零散提及的完整基准测试对照表、您需要标记在日程表上的价格有效期、目前您可以访问该模型的所有途径,以及一个只需五分钟即可运行的 cURL 请求。如果您需要更深入的接口逐步讲解,Gemini 3.7 Flash API 快速入门将与本篇说明配合使用,同时 Apifox 为您提供了一个工作空间,供您在决定切换之前,针对现有提示词测试新模型。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
TL;DR
- Gemini 3.7 Flash 于 2026 年 8 月 13 日发布,距离 3.6 Flash 仅三周。模型 ID:
gemini-3.7-flash。 - 编程和智能体基准测试大幅提升:DeepSWE v1.1 从 49.0% 升至 65.3%,AutomationBench 从 17.0% 升至 30.4%,WebDev Arena Elo 评分从 1538 升至 1588。
- API 推广期价格为每 100 万输入 token 0.75 美元,每 100 万输出 token 3.75 美元,是 3.6 Flash 发布价的一半。标准费率(1.50 美元 / 7.50 美元)将于 2027 年 1 月 1 日开始生效。
- 规格保持不变:1M token 输入上下文、64k 输出限制、多模态输入(文本、图像、视频、音频、PDF)、函数调用(function calling)、Google 搜索作为工具(search as a tool)以及计算机使用(computer use)。
- 目前已在 160 多个国家/地区上线,可通过 Gemini API、AI Studio、Gemini App、Gemini Spark、Google Antigravity、Android Studio 和 Gemini Enterprise 进行访问。
- Gemini 3.5 Pro 依然推迟发布;谷歌在推出下一个旗舰模型之前,正优先发布 Flash 的改进版本。
什么是 Gemini 3.7 Flash
Flash 是 Gemini 系列中的中端模型:比 Pro 更便宜、更快,比 Flash-Lite 更智能,并且针对构成大多数生产环境 AI 流量的高并发工作负载进行了优化。Gemini 3.7 Flash 是 3.x 系列中的第三个 Flash 版本,谷歌对其定位也随之发生了变化。官方公告将其首要定位为编程和智能体模型,其次才是聊天模型。

规格参数继承自 3.6 Flash:
- 上下文 (Context): 1M token 输入窗口,64k token 输出限制。
- 输入模态 (Input modalities): 文本、图片、视频、音频和 PDF。输出为文本。
- 工具支持 (Tooling): function calling、作为工具的搜索(search as a tool)以及 computer use。
- 安全防护 (Safety): 随版本发布了更新的 CBRN(化学、生物、放射性及核武器)及网络安全防护措施。
发生改变的是行为,而非架构。谷歌表示,Gemini 3.7 Flash 的调试 (debug) 表现更好,首次尝试生成可部署的生产级代码的成功率更高,在遇到障碍时能够灵活应对,在意图模糊时主动提问以进行澄清,并且能以更高的保真度遵循指令。以上是官方的宣传,而下方的基准测试则是佐证。
基准测试提升:3.6 vs 3.7
谷歌将这些数据分散在了一篇博客文章和一份模型卡中。以下是汇总表,展示了关键的差异变化:
| 基准测试 | Gemini 3.6 Flash | Gemini 3.7 Flash | 变化 |
|---|---|---|---|
| DeepSWE v1.1 (智能体编码 / agentic coding) | 49.0% | 65.3% | +16.3 pts |
| FrontierCode 1.1 Main | 34.4% | 43.6% | +9.2 pts |
| WebDev Arena (Elo) | 1538 | 1588 | +50 Elo |
| GDP.pdf (文档推理) | 22.0% | 34.0% | +12.0 pts |
| AutomationBench (智能体任务) | 17.0% | 30.4% | +13.4 pts |
另外两项独立评分使评估更加完整:在法律推理基准测试 Harvey LAB-AA 上获得 90.7% 的评分,以及在 128k-needle 长上下文检索中达到 97.0% 的准确率。如果你需要向模型输入长文档,第二项数据就至关重要;在深层检索中,检索质量往往是许多模型在暗中败下阵来的地方。
表格中呈现的规律非常一致。提升幅度最大的是智能体(agentic)基准测试,这些测试旨在评估多步骤的工作流,而非单次输出的回答。AutomationBench 从 17.0% 飙升至 30.4%,这种幅度的提升彻底改变了中阶模型所能处理的任务范围。关于此次发布的媒体报道将 DeepSWE 的提升列为头条成果,这并非毫无道理:在短短三周内,智能体编码(agentic coding)能力提升了 16 个百分点,这在任何模型产品线中都是罕见的。为了更好地理解基准测试差异在竞品模型之间的具体体现,Grok 4.6 vs GPT 5.6 vs Claude 的对比展示了类似差距在实际工作负载中的具体表现。
代码生成与智能体提升
基准测试表格告诉了我们有哪些提升。而谷歌的发布说明则展示了这些提升在实际应用中的表现,并且其官方陈述足够具体,可供实际测试验证:
- 调试。 该模型更擅长定位故障的根本原因,而不是修补表面症状。DeepSWE 的提升是这一点的有力数据支撑,因为该基准测试对真实仓库中跨多个文件的 Bug 修复进行了评分。
- 首次尝试即部署的代码。 Google 声称有更多生成的代码无需修正轮次即可直接运行。FrontierCode 提升了 9.2 分,这是最接近的公开衡量指标。
- 障碍处理。 当工具调用失败或文件丢失时,3.7 Flash 会调整其计划,而不是陷入死循环。这就是 AutomationBench 所强调的行为。
- 意图澄清。 当请求含糊不清时,模型会进行提问而不是凭空猜测。在 Agent 流水线中,进行一次澄清交互的成本远低于一个错误的 5,000-Token 回答。
- 指令忠实度。 输出格式请求、长度限制和否定约束在长期对话中能更可靠地得到遵守。
工具栈与原始分数同等重要。函数调用(Function calling)和搜索工具(search-as-a-tool)继承自 3.6,而对计算机使用(computer use)的支持意味着在没有可用 API 来完成任务时,模型可以操作浏览器。这最后一项功能对开发者来说处于一个尴尬的境地:它虽然强大,但与结构化的接口相比,速度较慢且确定性较低。计算机使用与结构化 API 的对比分析详细介绍了这两种方法各自适用的场景。
价格:半价优惠至 2026 年 12 月 31 日
Gemini 3.7 Flash 在 Gemini API 上推出了两阶段的价格方案:
促销价格是 Gemini 3.6 Flash 发布时价格的一半,这使得接下来的四个半月成为该模型系列有史以来最便宜的窗口期。然而,关键在于 1 月 1 日价格将翻倍。如果您围绕 $0.75 的输入 Token 制定预算,除非您现在就做好规划,否则该预算在五个月内就会超支。
两点实用的建议。第一,在发布任何内容之前,先在官方价格页面上核实当前的费率;因为促销窗口期此前曾发生过变化。第二,按照标准费率而非促销费率来估算您 2027 年的成本。完整的实例(包括针对聊天机器人、文档流水线和 Agent 循环的 Token 计算)可以在 Gemini 3.7 Flash 的详细价格分析中找到。
今天您可以在哪里使用它
Google 在第一天就将 3.7 Flash 推送到了其所有服务领域,覆盖 160 多个国家:
- Gemini API. 开发者路径。从 AI Studio 获取密钥并直接调用
gemini-3.7-flash。 - Google AI Studio. 在编写代码之前进行 prompt 测试的浏览器端演练场。
- Gemini app. 面向消费者的聊天应用在发布时已接入该新模型。
- Gemini Spark. 适用于 AI Pro 和 Ultra 订阅用户。
- Google Antigravity. Google 的 Agent 开发环境运行于其上。
- Android Studio. IDE 集成获取了该模型以提供代码辅助。
- Gemini Enterprise. 面向有合规要求组织的托管服务。
对于大规模的 API 访问,你还可以通过 aiplatform.googleapis.com 走 Vertex AI 路径,并支持 OAuth、IAM 和审计日志。相同的模型,相同的请求数据模型,不同的 auth 和托管保证。
为什么 Google 在 Gemini 3.5 Pro 之前发布 Flash
这种发布顺序很不寻常。旗舰模型通常会率先发布,然后是更便宜的版本。Google 却反其道而行之:7 月底发布了 3.6 Flash,三周后发布了 3.7 Flash,而 Gemini 3.5 Pro 依然没有发布日期。Axios 报道称,Google 刻意在下一个旗舰模型发布前推出 Flash 的更新,而 Pro 模型则继续推迟。
如果将其视为一种策略而非进度延误,这一举动就合情合理了。大多数生产环境的流量都运行在中端模型上,因为这正是每个 Token 的成本与可接受质量的交汇点。改进 Flash 提升了大多数客户每天都在接触的模型。这也能在各大主流实验室快速迭代发布产品的时期,让 Google 始终保持在发布周期的舆论中心,同时又不会过早消耗掉旗舰模型发布的热度。
对于开发者来说,实际结果是 Flash 级别不再落后。Agent 能力正率先在这里落地。如果你之前因为等待 Pro 而推迟了将工作负载从 3.6 迁出的计划,那么 3.6 到 3.7 Flash 的迁移指南已经涵盖了这一切换过程。对于大多数代码库而言,这只需要修改一行模型 ID,并进行一次回归测试。
如何在五分钟内体验该 API
你需要从 AI Studio 获取一个 API 密钥。创建一个,将其导出,然后发送你的第一个请求:
export GEMINI_API_KEY="AIza..."
curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
-H "x-goog-api-key: $GEMINI_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"parts": [{ "text": "Review this function for bugs: def dedupe(items): return list(set(items))" }]
}],
"generationConfig": {
"temperature": 0.4,
"maxOutputTokens": 1024
}
}'
响应会以 candidates 数组的形式返回,生成的文本位于 content.parts 中,此外还有一个报告具体输入和输出 Token 数量的 usageMetadata 块。从第一天起就要关注该模块;它是你的计费表。对于流式传输,只需将 :generateContent 替换为 :streamGenerateContent?alt=sse,接口就会返回服务器发送事件(server-sent events)。
一旦首次调用成功,即可将测试从终端移出。在 Apifox 中,导入 Generative Language API 接口定义/规范,将 GEMINI_API_KEY 作为环境变量绑定到 x-goog-api-key header,并将模型 ID 保存为 path 变量。现在你可以并排运行相同的提示词,对比 gemini-3.6-flash 和 gemini-3.7-flash 的表现,实时查看 SSE 流式渲染,并将响应保存为示例,从而避免回归测试消耗额外的 token。这是针对你自己的提示词验证谷歌宣称的“更强的指令遵循能力”最快的方法,而无需偏听发布公告的一家之言。
FAQ
Gemini 3.7 Flash 可以免费使用吗?
Gemini API 通过 AI Studio 提供免费层级,并有每日配额限制,这足以支持原型开发。付费使用方面,在 2026 年 12 月 31 日之前,将享受每百万输入 token 0.75 美元的首发优惠价格。如果你想更充分地利用免费配额,可以参考免费获取 Gemini API 访问权限的指南,了解具体的限制以及如何在限制范围内进行操作。
Gemini 3.6 Flash 和 3.7 Flash 有什么区别?
规格相同,但表现更好。上下文窗口、输出限制、模态和工具支持均未改变。性能提升主要体现在代码和 Agent 基准测试上:DeepSWE 提升了 16.3 分,AutomationBench 提升了 13.4 分,WebDev Arena 提升了 50 Elo 分数。谷歌还宣称其拥有更好的调试、指令遵循以及多步规划能力。
Gemini 3.7 Flash 是否会取代 Gemini 3.5 Pro?
不会。Pro 依然是处理最难推理任务的旗舰层级,且 Gemini 3.5 Pro 仍处于开发中。Flash 3.7 是谷歌推荐用于大规模生产环境工作的模型,在这些场景中,成本和延迟与质量同等重要。
2027 年 1 月 1 日后的定价会有什么变化?
首发优惠价结束,转为标准定价:每百万输入 token 1.50 美元,每百万输出 token 7.50 美元,是首发价格的两倍。对于任何将持续到 2026 年以后的业务负载,请按标准费率规划预算。
Gemini 3.7 Flash 可以处理图像和 PDF 吗?
可以。输入模态在同一个 contents 数组中支持文本、图像、视频、音频和 PDF。输出仅为文本。在 GDP.pdf 基准测试中,其得分从 22.0% 提升至 34.0%,这是谷歌证明其文档理解能力与代码能力同步提升的有力证据。
3.7 Flash 在你的技术栈中扮演什么角色
Gemini 3.7 Flash 是一款兼具 Agent 级基准测试得分与四个月价格优惠的中端模型。这一组合使得你需要决定的不再是“是否”对其进行评估,而是“多快”对其进行评估。Agent 能力的提升在公开基准测试中有实打实的数据支持,其规格与你目前在 3.6 上运行的规格一致,而首发价格意味着现在进行测试的成本只有明年 1 月进行相同评估时的一半。
合理的步骤是:在 gemini-3.7-flash 上运行你现有的 prompt 套件,对比输出结果和 Token 使用情况,并与你当前的模型进行比较,让结果来决定赢家。下载 Apifox 即可在一个工作区中运行该对比;将你 3.6 版本的响应保存为示例,针对 3.7 重放相同的请求,只需一个下午,你就能知道基准测试的表现是否符合你实际的工作负载。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会