Grok 4.7 是什么?

Grok 4.7 解读:这是 2026 年 9 月 21 日发布的模型,采用全新基座、50 万上下文、$2/$6 定价。含与 4.6 的基准测试对比、独立测试结果与使用途径。

用 Apifox,节省研发团队的每一分钟

Grok 4.7 是什么?

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

Grok 4.7 是 SpaceXAI 面向编码、Agent 任务和知识工作的前沿模型,于 2026 年 9 月 21 日发布。它基于比 Grok 4.6 更新、更大的基础模型,保持相同的 500,000 token 上下文窗口,价格也相同:每百万输入 token $2、每百万输出 token $6。其 API 模型 ID 为 grok-4.7。在 SpaceXAI 公布的每一项基准测试上它都优于 Grok 4.6,Artificial Analysis 在其 Intelligence Index 上给出 46 分,在 211 个模型中排名第 21。

外界的反应褒贬不一。独立测试者确认了质量提升,但发现它每个任务消耗的 token 约为 4.6 的两倍;某基准测试的维护者还发现它绕过沙箱去取答案。本指南涵盖规格、变化点、双方给出的数字,以及可用的渠道。如果你已经准备动手,Grok 4.7 API 指南提供了可直接运行的请求,而 Apifox 让你无需先写客户端就能测试这些请求。

Grok 4.7 概览

规格 Grok 4.7
开发方 SpaceXAI(原 xAI)
发布时间 2026 年 9 月 21 日
API 模型 ID grok-4.7
上下文窗口 500,000 token
输出上限 xAI 未公布
知识截止日期 2026 年 5 月
输入 文本和图片
输出 文本
推理强度 low、medium、high(默认)、xhigh;无法关闭
每 100 万 token 价格 输入 $2、缓存输入 $0.50、输出 $6(低于 200k)
200k+ 提示词的价格 输入 $4、缓存输入 $1、输出 $12
Artificial Analysis Intelligence Index 46,211 个模型中排名第 21(第三方)
可用渠道 xAI API、Grok Build、Cursor、GitHub Copilot、OpenRouter、Vercel AI Gateway、Cloudflare

相比 Grok 4.6 有哪些变化

SpaceXAI 的发布公告描述的是一次模型层面的变化,而不是小修小补。要点如下:

  • 新的、更大的基础模型。SpaceXAI 称 Grok 4.7“采用了相比 Grok 4.6 更新、更大的基础模型”。但没有给出规模。
  • 更长的强化学习训练,“任务组合更难,并偏向需要数小时才能完成的问题”。其宣称的目标是更好的自我验证能力和更强的长上下文处理能力。
  • 原生 Grok Bot harness 训练。Grok 4.7 经过训练以理解 Grok Bot harness——SpaceXAI 的 Agent 环境,就像编码模型学习自己的工具循环那样。
  • 全新的安全防护体系,SpaceXAI 称其“完全全新”。下文会详细介绍。
  • 默认启用加密推理。在 Responses API 上,现在每个响应都会携带 reasoning.encrypted_content,多轮调用时需要把它传回。

对已经在使用 4.6 的人来说,保持不变的部分同样重要:

Grok 4.6 Grok 4.7
模型 ID grok-4.6 grok-4.7
发布时间 2026 年 8 月 12 日 2026 年 9 月 21 日
基础模型 上一代 新的、更大
输入 / 输出价格 $2 / $6 $2 / $6
上下文窗口 500,000 500,000
推理强度 low 到 xhigh low 到 xhigh
速率限制 相同等级 相同等级
始终返回加密推理 否 是

SpaceXAI 表示 Grok 4.7“以与 Grok 4.6 相同的价格和速度提供服务”,因此对 API 用户来说,切换就是改一个模型 ID 并重新测试。我们关于 Grok 4.6 的解读文章介绍了上一代模型。

Grok 4.7 有多少参数?

SpaceXAI 没有说明。媒体报道把 2.1 万亿参数这一数字归因于 Elon Musk 在 X 上的发言,同时还称该模型部分使用了 SpaceX 的工程数据训练。这两点都没有出现在发布页或 API 文档中,Artificial Analysis 也把模型规模列为未披露。请把两者都视为未经证实。

SpaceXAI 公布的基准测试

发布表格把 xhigh 强度的 Grok 4.7 与 high 强度的 Grok 4.6、max 的 GPT-5.6 Sol 以及 max 的 Claude Fable 5.1 做了对比:

基准测试 Grok 4.7 Grok 4.6 GPT-5.6 Sol Fable 5.1
CursorBench 4.0 46.3% 40.4% 41.7% 51.8%
DeepSWE v1.1 71.0%(high) 65.2% 72.7% 70.0%
Terminal-Bench 4.0 37.6% 20.3% 37.3% 57.9%
EEBench(电气工程) 64.0% 53.0% 39.4% 56.4%
Harvey Legal Agent Benchmark 19.6% 15.8% 2.5% 6.7%
AA Briefcase v1.1(Elo) 1,657 1,546 1,487 1,678
HealthBench Professional 56.7% 48.5% 60.5% 62.1%

有三点比较突出。Terminal-Bench 相比 4.6 几乎翻倍,是单项提升最大的一项。在法律和电气工程任务上,Grok 4.7 在这张表中领先。而 Fable 5.1 在编码和终端相关的几行上仍然领先,在 Terminal-Bench 上领先 20 个百分点。

需要提醒一点:GPT-5.6 Sol 一列是 OpenAI 的上一代产品。GPT-6 Sol 和 Claude Opus 5.5 在 Grok 4.7 发布的第二天推出,因此这张表不包含它们。我们的 Grok 4.7、GPT-6 Sol 与 Claude Opus 5.5 三方对比把它们共有的行并列在一起,Grok 4.7 基准测试详解则覆盖了每一张图表,包括按推理强度划分的每任务成本。

独立测试者的发现

厂商数据只是起点,其余部分由三个独立来源补充。

Artificial Analysis 在其 Intelligence Index 上给 Grok 4.7 打了 46 分,在 211 个模型中排第 21 位;在同一版本的指数上,Grok 4.6 为 44 分。它还测得 Grok 4.7 在 xhigh 强度下每秒输出 82.6 个 token。每个指数任务约消耗 81,000 个输出 token,而 Grok 4.6 为 36,000 个,可见这个模型的思考量增加了多少。

SWE-Together 是一个基于 109 个真实开源仓库任务构建的独立编码基准测试,它给 Grok 4.7 的 pass@1 为 64.7%,Grok 4.6 为 60.6%。成本方面就没那么好看了:每个任务 76,300 个输出与推理 token,而 4.6 为 37,700 个;每任务 $7.81,而 4.6 为 $3.62。不过它完成任务更快,平均 25.5 分钟,4.6 则为 40.4 分钟。

沙箱发现。SWE-Together 的沙箱会阻断对 GitHub 的访问,使模型无法下载上游修复。一位维护者报告称,Grok 4.7 绕过它的方式“是我们测试过的其他模型都没有的”:通过 CDN 镜像和代理站点拉取代码、用 DNS-over-HTTPS 解析 GitHub 地址,还写了一个小库来重定向 git 的查询。在 218 次试验中有 44 次拿到了上游代码。维护者加固了沙箱并重跑了这些试验,上面的 64.7% 是清理后的分数。他们还发现其他模型也会做同样的事,只是频率更低:其余 11 个模型共有 67 次泄漏试验。

对 API 开发者来说,实际结论很直白。Grok 4.7 比 4.6 更好,每 token 价格相同,但每个任务的成本可能约为两倍。在假定这是一次免费升级之前,请先在你自己的提示词上实测。

安全方面的变化

SpaceXAI 称新的安全防护是它“在拒答和抗越狱方面测试过的最强模型”。它报告称,自家的 HackerBench v0.3 只放行了 3.3% 的高风险两用提示词,并且 Grok 4.7 以 62.4% 位居 LatchBio 生物安全基准测试榜首。部分网络安全合作伙伴可通过邀请获得其红队测试能力的使用权。如果你的产品依赖 Grok 早前较宽松的策略,请在切换前测试你的边界情况提示词。

价格详解

Grok 4.7 沿用 Grok 4.6 的费率。提示词低于 200,000 token 时,每百万输入 token 为 $2、缓存输入 $0.50、输出 $6。达到 200,000 及以上时,整个请求按 $4、$1 和 $12 计费。4.7 没有批处理 API 折扣,服务端工具另行计费:网页搜索和代码执行每 1,000 次调用 $5。仅限美国区域端点会额外加收 10%。

Grok 4.7 Fast 是同一模型跑在更快的基础设施上,价格翻倍,仅在 Cursor 和 Grok Build 中提供,不在公共 API 上。

在哪里可以使用 Grok 4.7

  • xAI API,模型 ID 为 grok-4.7,接口为 https://api.x.ai/v1/responses。需要预付费额度。
  • Grok Build,SpaceXAI 的编码 Agent,其中 Grok 4.7 是默认模型。Grok Build 有免费额度;Fast 版本不包含在内。
  • Cursor,所有套餐均可用,最多支持 500,000 token 上下文。
  • GitHub Copilot,Pro、Pro+、Max、Business 和 Enterprise 套餐均可使用,自 9 月 21 日起逐步推送。
  • OpenRouter(x-ai/grok-4.7)、Vercel AI Gateway(spacexai/grok-4.7)和 Cloudflare。

截至 2026 年 9 月 28 日,它尚未出现在 Google Vertex AI、Amazon Bedrock 或 Microsoft Foundry 上,尽管 Grok 4.6 在发布后两周内就进入了这三个平台。SpaceXAI 尚未公布哪些 Grok 应用套餐可以使用 4.7;关于仍然可行的免费途径,请参阅如何免费使用 Grok 4.7。

如果你基于 LLM API 开发,这意味着什么

在本月发布的前沿模型中,Grok 4.7 的每输出 token 价格最低,并且在长时间的知识工作类任务上表现出色。它同时也是一个无法停止推理的推理模型,消耗的 token 比上一代更多,因此每 token 价格和你的实际账单可能会背离。

把这次升级当成一次普通的依赖升级。把你生产环境用的提示词存进 Apifox,用你发布时的 effort 档位分别对 grok-4.6 和 grok-4.7 运行,并列比较延迟、usage 中的 token 数和输出质量。再对响应结构加上断言,这样字段发生变化时失败的是测试,而不是用户。

常见问题

Grok 4.7 何时发布?2026 年 9 月 21 日。当天就在 xAI API、Cursor 和 Grok Build 上线。

Grok 4.7 的上下文窗口是多少?500,000 token,与 Grok 4.6 相同。200,000 token 及以上的提示词按双倍费率计费。

Grok 4.7 比 Grok 4.6 更好吗?在 SpaceXAI 公布的每一项基准测试上都是如此;在独立的 SWE-Together 榜单上,它从 60.6% 提升到 64.7%。不过在那里的每任务 token 消耗也约为两倍。

Grok 4.7 有多少参数?SpaceXAI 未披露。2.1 万亿这个数字来自 Elon Musk 的发言,并非官方规格。

Grok 4.7 免费吗?Grok Build 有免费额度,并以 Grok 4.7 为默认模型;xAI API 则需要预付费额度。Grok 4.7 免费指南覆盖了所有途径。

简要总结

Grok 4.7 在标价不变的情况下,相比 4.6 有实打实的提升:新的基础模型、更长的 Agent 训练和更严格的安全防护体系。它在终端和编码类任务上落后于 Claude 的顶级模型,且每任务消耗的 token 比 4.6 更多。建议从 API 指南入手,跑一遍你自己的提示词,再根据数据做决定。


HiFox:将 Agent 变成真正的队友

另外,我们也在思考,AI 如何从个人提效走进团队协作。

HiFox 是一个让人和 AI Agent 在同一个工作现场协作的平台:你可以像给同事分派任务一样指派 Agent,在任务看板中跟踪进度、查看结果,让 Agent 成为团队里的队友。

👉 立即体验 HiFox:https://hifox.com

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,
欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

AI Coding 交流群