Gemini 3.7 Flash 有哪些新变化?特性、基准测试及 API 访问

距离上代仅三周,谷歌重磅推出Gemini 3.7 Flash!新模型在编程和智能体基准测试中表现惊艳,且API价格腰斩。一文带你快速掌握其新特性、基准数据与接入指南!

用 Apifox,节省研发团队的每一分钟

Gemini 3.7 Flash 有哪些新变化?特性、基准测试及 API 访问

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

Gemini 3.7 Flash 是谷歌最新推出的主力 AI 模型,于 2026 年 8 月 13 日发布,距离 Gemini 3.6 Flash 发布仅隔三周。它保留了前代模型 1M token 的上下文窗口和多模态输入能力,同时在编程和智能体(agent)基准测试中取得了巨大进步,其 API 的起步推广价为每 100 万输入 token 0.75 美元。谷歌称其为“我们最智能的主力模型”。

这三周的发布间隔正是核心所在。在 Gemini 3.5 Pro 依然推迟 的情况下,谷歌正以迭代节奏快速发布 Flash 的更新,这意味着中端模型现在成为了有趣的工程成果首先落地的阵地。基准测试的增量数据也印证了这一点:DeepSWE 飙升了 16 个百分点,AutomationBench 几乎翻倍,且推广期定价仅为 3.6 Flash 发布价的一半。

本文将涵盖所有变化:谷歌在其发布声明中零散提及的完整基准测试对照表、您需要标记在日程表上的价格有效期、目前您可以访问该模型的所有途径,以及一个只需五分钟即可运行的 cURL 请求。如果您需要更深入的接口逐步讲解,Gemini 3.7 Flash API 快速入门将与本篇说明配合使用,同时 Apifox 为您提供了一个工作空间,供您在决定切换之前,针对现有提示词测试新模型。

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

TL;DR

  • Gemini 3.7 Flash 于 2026 年 8 月 13 日发布,距离 3.6 Flash 仅三周。模型 ID:gemini-3.7-flash
  • 编程和智能体基准测试大幅提升:DeepSWE v1.1 从 49.0% 升至 65.3%,AutomationBench 从 17.0% 升至 30.4%,WebDev Arena Elo 评分从 1538 升至 1588。
  • API 推广期价格为每 100 万输入 token 0.75 美元,每 100 万输出 token 3.75 美元,是 3.6 Flash 发布价的一半。标准费率(1.50 美元 / 7.50 美元)将于 2027 年 1 月 1 日开始生效。
  • 规格保持不变:1M token 输入上下文、64k 输出限制、多模态输入(文本、图像、视频、音频、PDF)、函数调用(function calling)、Google 搜索作为工具(search as a tool)以及计算机使用(computer use)。
  • 目前已在 160 多个国家/地区上线,可通过 Gemini API、AI Studio、Gemini App、Gemini Spark、Google Antigravity、Android Studio 和 Gemini Enterprise 进行访问。
  • Gemini 3.5 Pro 依然推迟发布;谷歌在推出下一个旗舰模型之前,正优先发布 Flash 的改进版本。

什么是 Gemini 3.7 Flash

Flash 是 Gemini 系列中的中端模型:比 Pro 更便宜、更快,比 Flash-Lite 更智能,并且针对构成大多数生产环境 AI 流量的高并发工作负载进行了优化。Gemini 3.7 Flash 是 3.x 系列中的第三个 Flash 版本,谷歌对其定位也随之发生了变化。官方公告将其首要定位为编程和智能体模型,其次才是聊天模型。

规格参数继承自 3.6 Flash:

  • 上下文 (Context): 1M token 输入窗口,64k token 输出限制。
  • 输入模态 (Input modalities): 文本、图片、视频、音频和 PDF。输出为文本。
  • 工具支持 (Tooling): function calling、作为工具的搜索(search as a tool)以及 computer use。
  • 安全防护 (Safety): 随版本发布了更新的 CBRN(化学、生物、放射性及核武器)及网络安全防护措施。

发生改变的是行为,而非架构。谷歌表示,Gemini 3.7 Flash 的调试 (debug) 表现更好,首次尝试生成可部署的生产级代码的成功率更高,在遇到障碍时能够灵活应对,在意图模糊时主动提问以进行澄清,并且能以更高的保真度遵循指令。以上是官方的宣传,而下方的基准测试则是佐证。

基准测试提升:3.6 vs 3.7

谷歌将这些数据分散在了一篇博客文章和一份模型卡中。以下是汇总表,展示了关键的差异变化:

基准测试 Gemini 3.6 Flash Gemini 3.7 Flash 变化
DeepSWE v1.1 (智能体编码 / agentic coding) 49.0% 65.3% +16.3 pts
FrontierCode 1.1 Main 34.4% 43.6% +9.2 pts
WebDev Arena (Elo) 1538 1588 +50 Elo
GDP.pdf (文档推理) 22.0% 34.0% +12.0 pts
AutomationBench (智能体任务) 17.0% 30.4% +13.4 pts

另外两项独立评分使评估更加完整:在法律推理基准测试 Harvey LAB-AA 上获得 90.7% 的评分,以及在 128k-needle 长上下文检索中达到 97.0% 的准确率。如果你需要向模型输入长文档,第二项数据就至关重要;在深层检索中,检索质量往往是许多模型在暗中败下阵来的地方。

表格中呈现的规律非常一致。提升幅度最大的是智能体(agentic)基准测试,这些测试旨在评估多步骤的工作流,而非单次输出的回答。AutomationBench 从 17.0% 飙升至 30.4%,这种幅度的提升彻底改变了中阶模型所能处理的任务范围。关于此次发布的媒体报道将 DeepSWE 的提升列为头条成果,这并非毫无道理:在短短三周内,智能体编码(agentic coding)能力提升了 16 个百分点,这在任何模型产品线中都是罕见的。为了更好地理解基准测试差异在竞品模型之间的具体体现,Grok 4.6 vs GPT 5.6 vs Claude 的对比展示了类似差距在实际工作负载中的具体表现。

代码生成与智能体提升

基准测试表格告诉了我们有哪些提升。而谷歌的发布说明则展示了这些提升在实际应用中的表现,并且其官方陈述足够具体,可供实际测试验证:

  • 调试。 该模型更擅长定位故障的根本原因,而不是修补表面症状。DeepSWE 的提升是这一点的有力数据支撑,因为该基准测试对真实仓库中跨多个文件的 Bug 修复进行了评分。
  • 首次尝试即部署的代码。 Google 声称有更多生成的代码无需修正轮次即可直接运行。FrontierCode 提升了 9.2 分,这是最接近的公开衡量指标。
  • 障碍处理。 当工具调用失败或文件丢失时,3.7 Flash 会调整其计划,而不是陷入死循环。这就是 AutomationBench 所强调的行为。
  • 意图澄清。 当请求含糊不清时,模型会进行提问而不是凭空猜测。在 Agent 流水线中,进行一次澄清交互的成本远低于一个错误的 5,000-Token 回答。
  • 指令忠实度。 输出格式请求、长度限制和否定约束在长期对话中能更可靠地得到遵守。

工具栈与原始分数同等重要。函数调用(Function calling)和搜索工具(search-as-a-tool)继承自 3.6,而对计算机使用(computer use)的支持意味着在没有可用 API 来完成任务时,模型可以操作浏览器。这最后一项功能对开发者来说处于一个尴尬的境地:它虽然强大,但与结构化的接口相比,速度较慢且确定性较低。计算机使用与结构化 API 的对比分析详细介绍了这两种方法各自适用的场景。

价格:半价优惠至 2026 年 12 月 31 日

Gemini 3.7 Flash 在 Gemini API 上推出了两阶段的价格方案:

促销价格是 Gemini 3.6 Flash 发布时价格的一半,这使得接下来的四个半月成为该模型系列有史以来最便宜的窗口期。然而,关键在于 1 月 1 日价格将翻倍。如果您围绕 $0.75 的输入 Token 制定预算,除非您现在就做好规划,否则该预算在五个月内就会超支。

两点实用的建议。第一,在发布任何内容之前,先在官方价格页面上核实当前的费率;因为促销窗口期此前曾发生过变化。第二,按照标准费率而非促销费率来估算您 2027 年的成本。完整的实例(包括针对聊天机器人、文档流水线和 Agent 循环的 Token 计算)可以在 Gemini 3.7 Flash 的详细价格分析中找到。

今天您可以在哪里使用它

Google 在第一天就将 3.7 Flash 推送到了其所有服务领域,覆盖 160 多个国家:

  • Gemini API. 开发者路径。从 AI Studio 获取密钥并直接调用 gemini-3.7-flash
  • Google AI Studio. 在编写代码之前进行 prompt 测试的浏览器端演练场。
  • Gemini app. 面向消费者的聊天应用在发布时已接入该新模型。
  • Gemini Spark. 适用于 AI Pro 和 Ultra 订阅用户。
  • Google Antigravity. Google 的 Agent 开发环境运行于其上。
  • Android Studio. IDE 集成获取了该模型以提供代码辅助。
  • Gemini Enterprise. 面向有合规要求组织的托管服务。

对于大规模的 API 访问,你还可以通过 aiplatform.googleapis.com 走 Vertex AI 路径,并支持 OAuth、IAM 和审计日志。相同的模型,相同的请求数据模型,不同的 auth 和托管保证。

为什么 Google 在 Gemini 3.5 Pro 之前发布 Flash

这种发布顺序很不寻常。旗舰模型通常会率先发布,然后是更便宜的版本。Google 却反其道而行之:7 月底发布了 3.6 Flash,三周后发布了 3.7 Flash,而 Gemini 3.5 Pro 依然没有发布日期。Axios 报道称,Google 刻意在下一个旗舰模型发布前推出 Flash 的更新,而 Pro 模型则继续推迟。

如果将其视为一种策略而非进度延误,这一举动就合情合理了。大多数生产环境的流量都运行在中端模型上,因为这正是每个 Token 的成本与可接受质量的交汇点。改进 Flash 提升了大多数客户每天都在接触的模型。这也能在各大主流实验室快速迭代发布产品的时期,让 Google 始终保持在发布周期的舆论中心,同时又不会过早消耗掉旗舰模型发布的热度。

对于开发者来说,实际结果是 Flash 级别不再落后。Agent 能力正率先在这里落地。如果你之前因为等待 Pro 而推迟了将工作负载从 3.6 迁出的计划,那么 3.6 到 3.7 Flash 的迁移指南已经涵盖了这一切换过程。对于大多数代码库而言,这只需要修改一行模型 ID,并进行一次回归测试。

如何在五分钟内体验该 API

你需要从 AI Studio 获取一个 API 密钥。创建一个,将其导出,然后发送你的第一个请求:

export GEMINI_API_KEY="AIza..."

curl "https://generativelanguage.googleapis.com/v1beta/models/gemini-3.7-flash:generateContent" \
  -H "x-goog-api-key: $GEMINI_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{
      "parts": [{ "text": "Review this function for bugs: def dedupe(items): return list(set(items))" }]
    }],
    "generationConfig": {
      "temperature": 0.4,
      "maxOutputTokens": 1024
    }
  }'

响应会以 candidates 数组的形式返回,生成的文本位于 content.parts 中,此外还有一个报告具体输入和输出 Token 数量的 usageMetadata 块。从第一天起就要关注该模块;它是你的计费表。对于流式传输,只需将 :generateContent 替换为 :streamGenerateContent?alt=sse,接口就会返回服务器发送事件(server-sent events)。

一旦首次调用成功,即可将测试从终端移出。在 Apifox 中,导入 Generative Language API 接口定义/规范,将 GEMINI_API_KEY 作为环境变量绑定到 x-goog-api-key header,并将模型 ID 保存为 path 变量。现在你可以并排运行相同的提示词,对比 gemini-3.6-flashgemini-3.7-flash 的表现,实时查看 SSE 流式渲染,并将响应保存为示例,从而避免回归测试消耗额外的 token。这是针对你自己的提示词验证谷歌宣称的“更强的指令遵循能力”最快的方法,而无需偏听发布公告的一家之言。

FAQ

Gemini 3.7 Flash 可以免费使用吗?

Gemini API 通过 AI Studio 提供免费层级,并有每日配额限制,这足以支持原型开发。付费使用方面,在 2026 年 12 月 31 日之前,将享受每百万输入 token 0.75 美元的首发优惠价格。如果你想更充分地利用免费配额,可以参考免费获取 Gemini API 访问权限的指南,了解具体的限制以及如何在限制范围内进行操作。

Gemini 3.6 Flash 和 3.7 Flash 有什么区别?

规格相同,但表现更好。上下文窗口、输出限制、模态和工具支持均未改变。性能提升主要体现在代码和 Agent 基准测试上:DeepSWE 提升了 16.3 分,AutomationBench 提升了 13.4 分,WebDev Arena 提升了 50 Elo 分数。谷歌还宣称其拥有更好的调试、指令遵循以及多步规划能力。

Gemini 3.7 Flash 是否会取代 Gemini 3.5 Pro?

不会。Pro 依然是处理最难推理任务的旗舰层级,且 Gemini 3.5 Pro 仍处于开发中。Flash 3.7 是谷歌推荐用于大规模生产环境工作的模型,在这些场景中,成本和延迟与质量同等重要。

2027 年 1 月 1 日后的定价会有什么变化?

首发优惠价结束,转为标准定价:每百万输入 token 1.50 美元,每百万输出 token 7.50 美元,是首发价格的两倍。对于任何将持续到 2026 年以后的业务负载,请按标准费率规划预算。

Gemini 3.7 Flash 可以处理图像和 PDF 吗?

可以。输入模态在同一个 contents 数组中支持文本、图像、视频、音频和 PDF。输出仅为文本。在 GDP.pdf 基准测试中,其得分从 22.0% 提升至 34.0%,这是谷歌证明其文档理解能力与代码能力同步提升的有力证据。

3.7 Flash 在你的技术栈中扮演什么角色

Gemini 3.7 Flash 是一款兼具 Agent 级基准测试得分与四个月价格优惠的中端模型。这一组合使得你需要决定的不再是“是否”对其进行评估,而是“多快”对其进行评估。Agent 能力的提升在公开基准测试中有实打实的数据支持,其规格与你目前在 3.6 上运行的规格一致,而首发价格意味着现在进行测试的成本只有明年 1 月进行相同评估时的一半。

合理的步骤是:在 gemini-3.7-flash 上运行你现有的 prompt 套件,对比输出结果和 Token 使用情况,并与你当前的模型进行比较,让结果来决定赢家。下载 Apifox 即可在一个工作区中运行该对比;将你 3.6 版本的响应保存为示例,针对 3.7 重放相同的请求,只需一个下午,你就能知道基准测试的表现是否符合你实际的工作负载。

开发必备:API 全流程管理神器 Apifox

介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。

如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用

Apifox

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案

获取专属报价与部署方案

icon 详细的私有化部署系统架构与安全白皮书
icon 针对您公司规模的专属报价单
icon 免费的 1v1 专属产品演示 (Demo) 机会
获取部署方案
* 提交后,我们的客户经理将在 1 个工作日内与您联系
林俊锋 企业微信
@Apifox 专属顾问
扫码备注: 私有化 + 公司名