Google 于 2026 年 8 月 13 日发布了 Gemini 3.7 Flash,距离 3.6 Flash 发布仅过了三周,并称其为“我们最智能的实用主力模型”。基准测试的增幅印证了这一信心:DeepSWE 评分从 49.0% 跃升至 65.3%,AutomationBench 从 17.0% 攀升至 30.4%,而且每 100 万输入 Token 仅 0.75 美元的首发促销价仅为 3.6 Flash 发布时价格的一半。
这一组合迫使每个 API 团队在这个季度面临一个问题:一款快速且廉价的 Gemini 模型,现在是否已经能处理你原先路由给 Claude 或 GPT 的工作负载?本次对比将紧扣你可以验证的指标:上下文窗口、多模态支持、工具支持、价格结构以及你要集成的请求数据模型。在竞争对手的数据不具备可比性的地方,我们会予以说明。并且,由于“你应该使用哪款 API”的真实答案取决于“哪款模型在你的实际工作负载中表现最佳”,因此最后一部分将展示在做出决定之前,如何在 Apifox 中并排运行这三款模型进行对比。
如果你最终选择了 Gemini 并需要配置步骤,Gemini 3.7 Flash API 快速入门涵盖了密钥、接口以及首次请求的相关内容。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
TL;DR
- Gemini 3.7 Flash:100 万 Token 上下文,64k 输出限制,支持文本、图像、视频、音频和 PDF 的原生输入,此外还支持函数调用、搜索工具和计算机使用(computer use)。
- 首发价格:截至 2026 年 12 月 31 日,价格为每 100 万输入 Token 0.75 美元,每 100 万输出 Token 3.75 美元;2027 年 1 月 1 日起价格将翻倍至 1.50 美元和 7.50 美元。
- 相比 3.6 Flash 的编程能力提升:DeepSWE v1.1 从 49.0% 提升至 65.3%,FrontierCode 1.1 Main 从 34.4% 提升至 43.6%,AutomationBench 从 17.0% 提升至 30.4%。
- Claude Fable 5 和 GPT-5.6 Sol 在前沿编程深度和智能体(Agent)一致性方面依然领先,但单 Token 价格是其数倍。
- 这三家供应商使用互不兼容的请求数据模型:Google 的
contents、Anthropic 的 Messages 以及 OpenAI 的messages。 - 基准测试仅能预测平均表现,并不代表你的具体工作负载;在做决定前,建议针对三款 API 进行一次包含 20 个提示词的横向评测。
如何解读本次对比
这 spinal 不是一场前沿旗舰模型之间的对决。Claude Fable 5 和 GPT-5.6 Sol 是旨在实现极致能力的旗舰模型;而 Gemini 3.7 Flash 则是一款高性价比的实用模型,定价更适合高吞吐量场景。谷歌在其旗舰模型还在等待上线之际率先推出了它:据 Axios 报道,Gemini 3.5 Pro 依然延期,而 Flash 的更新版本则抢先落地。
但这次对比依然很有必要:3.7 Flash 发布时的评分已经达到了几周前前沿旗舰模型所在的水平,即使旗舰模型依然保持领先,这也改变了工作负载路由的考量。
在此有两点需要注意。首先,这里的每个数字都是发布周由厂商报告的数据;在独立评估结果出炉之前,请仅将其视为趋势参考。其次,基准测试的变体版本非常重要。谷歌报告的是 FrontierCode 1.1 Main 的数据,而 Claude 和 GPT 在发布时公布的数据来自 Extended 分支,因此这些列在此处不会共存于同一个表格中。
编码与 Agent 任务
AutomationBench 上的大幅提升是 Agent 构建者们应该重点关注的。在三周内让 Agent 相关基准测试的成绩几乎翻倍,这表明“在工具调用上思考更严谨”的说法绝非仅仅是营销噱头。
这与 Claude 和 GPT 相比如何?在 DeepSWE v1.1 上,前沿梯队中 GPT-5.6 Sol Max 在发布时取得了 73.0% 的成绩,而 Grok 4.6 为 65.9%;我们的 Grok 4.6 vs GPT-5.6 Sol vs Claude Fable 5 对比分析深入涵盖了这些结果。Sol Max 在仓库级 Bug 修复方面保持着明显的领先优势,而 Claude Fable 5 的强项在于代码编写和智能体评估方面的一致性,在这些评估中它很少跌出前两名。Gemini 3.7 Flash 尚未缩小这一差距。它以极低的成本达到了近在咫尺的水平,这与“分数最高者胜出”有着不同的价值主张。
另外两个专业领域的数字让这一图景更加完整:在用于法律推理的 Harvey LAB-AA 上达到 90.7%,以及在 128k 针尖检索上达到 97.0%,这一分数让 1M 窗口在实际应用中变得值得信赖。
多模态输入
这是这三个 API 之间最清晰的结构性差异。Gemini 3.7 Flash 在同一个接口的 contents 数组中同时接受文本、图像、视频、音频和 PDF。Claude 和 GPT 能很好地处理文本和图像,但在文本到达模型之前,视频和音频工作负载通常需要通过单独的转录或预处理步骤。
如果您的产品涉及文档,那么 GDP.pdf 从 22.0% 跃升至 34.0% 就是一个值得关注的信号:该基准测试衡量的是对包含表格、扫描件和排版破损的真实 PDF 的推理能力。直接将合同或发票输入模型而无需 OCR 流水线,从而在您的架构中省去了一个极易出错的环节。
实用规则:对于文本和图像对话,模态差异并不明显。对于视频帧、通话录音或成堆的文档,Gemini 是这三者中唯一一个能将输入流水线简化为单次 API 调用的模型。
定价理念
这三家厂商采取了不同的定价策略,其中的差异揭示了每个模型的适用对象。
谷歌对 3.7 Flash 的定价旨在抢占市场。每 100 万输入 Token $0.75 和每 100 万输出 Token $3.75 的推广费率将持续到 2026 年 12 月 31 日,这是 3.6 Flash 发布时价格的一半。2027 年 1 月 1 日起,标准费率将调整为 $1.50 和 $7.50,正好翻了一倍。这个截止日期是一个强力推手:谷歌希望在价格调整之前锁定您的流量。完整的 Token 费用计算,以及针对聊天机器人和智能体循环的实用示例,已包含在我们的《Gemini 3.7 Flash 定价详解》中。
Anthropic 和 OpenAI 将其旗舰模型定位为高端能力。费率因层级而异且经常变动,但大体趋势一致:前沿模型的输出 Token 成本是 Flash 模型的数倍,而且这两家厂商的溢价优势在于减少运行失败的次数,而不是提供更便宜的 Token。Anthropic 添加了一个 effort parameter,用于在单个模型内部权衡成本与能力;而 OpenAI 则通过区分不同的模型大小来进行分层。
哪种理念能胜出取决于你的失败经济学。一个在任务中失败的廉价模型所产生的修复工作,其成本远高于节省下来的 Token;而一个高端模型只有在成功避免这些失败时,其溢价才物有所值。对比每个已完成任务的成本,而非每个 Token 的成本,并在 2027 年 1 月 1 日 Gemini 费率翻倍后重新评估价格。
API 易用性
数据模型差异是你在切换服务商或在它们之间路由时付出的代价。以下是三种形式下相同的单轮请求。
Google 的 Gemini API 将对话轮次封装在 contents 的 parts 中,而生成设置则位于 generationConfig 中:
{
"contents": [
{ "role": "user", "parts": [{ "text": "Summarize this changelog." }] }
],
"generationConfig": { "temperature": 0.3, "maxOutputTokens": 1024 }
}
Anthropic 的 Messages API 将模型和必填的 max_tokens 放在最外层,并将系统提示词作为一个独立的字段:
{
"model": "claude-fable-5",
"max_tokens": 1024,
"system": "You summarize changelogs in three bullets.",
"messages": [{ "role": "user", "content": "Summarize this changelog." }]
}
OpenAI 则将系统提示词直接折叠到 messages 数组本身中:
{
"model": "gpt-5.6-sol",
"messages": [
{ "role": "system", "content": "You summarize changelogs in three bullets." },
{ "role": "user", "content": "Summarize this changelog." }
]
}
仅看文本用例,它们似乎足够接近,完全可以通过适配器来抹平差异。但工具调用才是抽象出现泄漏的地方:Google 在 tools 数组中使用 functionDeclarations 声明函数,并通过 toolConfig 控制调用;Anthropic 使用其专属的工具数据模型以及不同的响应块;而 OpenAI 则又有一套自己的函数格式。尽管这三者都基于服务器发送事件(server-sent events),但流式传输的 chunk 结构也各不相同。网关和兼容接口虽然规范化了基本的聊天格式,但多模态部分和工具调用在转换过程中很少能完好无损地保留下来;我们在 DeepSeek V4 Pro 的 API 格式对比中也记录了不同厂商之间存在的相同问题。
关于集成的建议其实朴实无华:在你的产品与模型之间保持一个轻量级的服务商抽象层。照此实践的团队可以在几天内完成服务商的切换,而不是耗费数个季度。
何时选择哪一个
将基准测试和数据模型浓缩为一个决策清单:
- 选择 Gemini 3.7 Flash,用于高流量的 Agent 访问、摄取视频、音频或 PDF 的多模态流水线,以及任何单次调用成本会限制产品利润率的工作负载。它也是计算机操作(computer-use)实验的天然沙盒;我们关于计算机操作与结构化 API 的对比分析详细介绍了该功能在何时能发挥其价值。
- 选择 Claude Fable 5,用于长周期的自主任务:持续数小时的 Agent 会话、单步出错就会导致一小时的进度付诸东流的任务,以及那些能够通过调节 effort parameter 的成本/能力平衡来获得高回报的工作负载。
- 选择 GPT-5.6 Sol,用于在几乎无需监管的情况下跨大型现有代码库运行的仓库级代码 Agent,以及希望围绕该 API 获得最深厚第三方生态支持的团队。
- 尽可能选择路由(router)。大多数生产团队最终都会采用这样一种模式:由一个便宜的默认模型处理绝大部分流量,而最难的 10% 则升级路由给前沿模型。Gemini 3.7 Flash 发布的数据表明,它在这一架构中是一个非常可靠的默认模型,而 3.6 Flash 则并非如此。
在同一个 Apifox 工作区中测试这三家服务商
真正有价值的对比,是用你自己的提示词进行的实际运行对比。Apifox 在单个项目中管理 Google、Anthropic 和 OpenAI 的集合,因此你可以用一下午的时间完成这场同台竞技,而不是耗费整个迭代周期(sprint):
- 创建三个环境,每个服务商各一个,每个环境都包含其特有的前置 URL 和 auth header:Gemini 为
x-goog-api-key,Anthropic 为x-api-key,OpenAI 为 Bearer Token。这样,切换服务商只需要通过下拉菜单选择,而不需要修改代码。 - 从你的产品中收集 20 个真实提示词。包括你的系统提示词、如果你使用了函数调用(function calling)则包含你的工具定义,以及至少五个已知的疑难用例。
- 为你关心的指标添加断言:响应的有效性、各服务商使用量数据块中的 Token 数量、延迟阈值。对于工具调用(tool-calling)的工作负载,断言工具调用的 JSON 能够正常解析并匹配你的数据模型;模型在这一步出错的概率要远高于纯文本生成。
- 每个套件针对每个模型运行三次。 LLM 的输出存在随机性;运行三次可以暴露单次演示所隐藏的偏差。对比成功率和每个成功任务的成本。
- 保留这个测试套件。 现在的模型发布间隔仅有数周;3.7 Flash 与 3.6 仅相隔三周发布。拥有现成测试套件的团队可以在一下午的时间内重新做出决策,而不是凭经验猜测。
FAQ
在编程方面,Gemini 3.7 Flash 是否优于 Claude 或 GPT?
在顶尖水平上并非如此。GPT-5.6 Sol Max 在 DeepSWE v1.1 上取得了 73.0% 的成绩,而 3.7 Flash 为 65.3%,且 Claude Fable 5 在编程和 Agent 基准测试的稳定性上处于领先地位。改变的是性价比(price-to-score ratio):3.7 Flash 在达到几周前还属于前沿模型水平的分数的同时,收费却仅为实用型模型的费率。
Gemini 3.7 Flash 比 Claude 或 GPT 便宜多少?
在 2026 年 12 月 31 日之前,Gemini 3.7 Flash 的价格为每 100 万输入 Token 0.75 美元,每 100 万输出 Token 3.75 美元。前沿的 Claude 和 GPT 模型每 Token 的收费要高出数倍;在您估算成本前,请先查看实时的价格页面。请注意,首发优惠价格将于 2027 年 1 月 1 日翻倍。
我可以通过 OpenAI SDK 调用 Gemini 3.7 Flash 吗?
Google 提供了一个兼容 OpenAI 的接口,可以处理基本的聊天格式,因此通过替换 base_url 就能实现文本输入和文本输出。但多模态部分和工具调用(tool calls)无法完美映射,因此对于纯文本聊天之外的任何内容,请使用原生的 contents 数据模型。针对 Gemini 3.7 Flash 的函数调用(function calling)教程完整展示了原生工具的格式。
Gemini 3.7 Flash 支持电脑操作和搜索 Grounding 吗?
是的。它内置了函数调用、搜索工具和电脑操作功能,并更新了 CBRN(化学、生物、放射性核和核)和网络安全防护栏。其在 AutomationBench 上的表现从 17.0% 提升至 30.4%,这是已公布的能代表其 Agent 循环(agentic loop)性能提升的最直接指标。
哪里可以使用 Gemini 3.7 Flash?
它在 160 多个国家/地区均可使用,包括使用 AI Studio 密钥的 Gemini API、Google AI Studio、Gemini 应用、面向 AI Pro 和 Ultra 订阅者的 Gemini Spark、Google Antigravity、Android Studio 以及 Gemini Enterprise。生产环境中的 GCP 团队可以通过 Vertex AI,使用 OAuth 代替 API 密钥进行调用。
3.7 Flash 在您技术栈中的定位
从这次对比中得出“Gemini 已追平最前沿水平”的结论是错误的。它还没有;Sol 在项目仓库级(repo-scale)的代码深度上仍然独占鳌头,而 Fable 5 在长时程(long-horizon)可靠性上依旧领先。正确的启示是“基准线下移了”:现在以主力模型的价格,就能买到一季度前只有高端模型才能达到的分数,这重新定义了任何路由架构的默认选择。Flash 级别的模型处理大部分常规任务,旗舰模型处理升级后的复杂任务。
决策是可衡量的,所以请去实际衡量。将所有三个服务商接入同一个工作区,结合断言(assertions)运行您的真实 Prompt,让每个已完成任务的成本来决定胜负。免费下载 Apifox,配置这三个环境,您就能在首发特惠窗口期结束前获得供应商级的验证数据。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会