xAI 于 2026 年 7 月 8 日发布了 Grok 4.5,并公布了四个编码基准测试和一个效率图表。这些数据确实很有意思,但显然也是经过精心挑选的。本文将为你梳理所有已公布的数据、它们的来源、缺失的信息,以及如何自己运行评估,而不是干等着排行榜更新。
一句话总结:Grok 4.5 的基准测试表现类似于强大的第二梯队编码模型,与 Claude Opus 4.8 互有胜负,但落后于行业最前沿的模型,而且它最亮眼的数据是输出效率,而非任何准确率得分。
xAI 公布的所有数据
来自官方公告的完整四个图表数据:
DeepSWE 1.0 (pass@1)
| 模型 | 得分 |
|---|---|
| Claude Fable 5 (max) | 66.1% |
| GPT 5.5 (xhigh) | 64.31% |
| Grok 4.5 | 62.0% |
| Claude Opus 4.8 (max) | 55.75% |
| Claude Opus 4.7 (max) | 40.12% |
DeepSWE 1.1
| 模型 | 得分 |
|---|---|
| Claude Fable 5 (max) | 70% |
| GPT 5.5 (xhigh) | 67% |
| Claude Opus 4.8 (max) | 59% |
| Grok 4.5 | 53% |
| GLM 5.2 | 44% |
Terminal Bench 2.1
| 模型 | 得分 |
|---|---|
| Claude Fable 5 (max) | 84.3% |
| GPT 5.5 (xhigh) | 83.4% |
| Grok 4.5 | 83.3% |
| Claude Opus 4.8 (max) | 78.9% |
| Claude Opus 4.7 (max) | 78.9% |
SWE Bench Pro (解决率)
| 模型 | 得分 |
|---|---|
| Claude Fable 5 (max) | 80.4% |
| Claude Opus 4.8 (max) | 69.2% |
| Grok 4.5 | 64.7% |
| Claude Opus 4.7 (max) | 64.3% |
| GLM 5.2 | 62.1% |
| GPT 5.5 (xhigh) | 58.6% |
此外还有效率图表:Grok 4.5 在每个 SWE Bench Pro 任务中平均输出 15,954 个 token,而 Opus 4.8 (max) 为 67,020 个,相差 4.2 倍。

这些数据的来源
xAI 图表上的小字说明比以往更加重要:
- DeepSWE 1.0“由 Datacurve 创建,由 AA 使用各个模型提供商的测试套件(harnesses)运行。”
- DeepSWE 1.1 使用了“由 Datacurve 运行的 mini-swe-agent harness”。
- “竞争对手的数据引自各开发者发布的系统卡(system cards)或基准测试排行榜。”
翻译一下:这是一个“拼盘”。有些数据来自第三方评估机构,有些来自竞争对手自己的营销页面,最后由带有销售目的的厂商拼凑在一起。这比单纯的自我报告要更透明,而且 Datacurve 的参与也增加了一定可信度。但它依然称不上是独立的评估:不同来源的 harness、脚手架(scaffolding)和 effort 设置各不相同,而这其中的每一项都可能让 Agent 得分产生几分的偏差。目前除了这个拼盘数据外,还没有任何外部机构发布过 Grok 4.5 的数据。
对同一组图表的三种解读
与 Opus 4.8 相比,双方互有胜负。 两胜(DeepSWE 1.0 领先 6.25 个百分点,Terminal Bench 领先 4.4 个百分点),两败(DeepSWE 1.1 落后 6 个百分点,SWE Bench Pro 落后 4.5 个百分点)。马斯克所谓的“Opus 级别”定位在他自己发布的数据面前站得住脚,但更过头的说法就不行了。请注意不同基准测试结果的倾斜方向:Grok 在以终端为导向和较早的评估测试中获胜,而 Opus 则在更新、更复杂的仓库级评估测试中获胜。完整的正面对决(包含价格因素分析),请参阅 Grok 4.5 vs Claude Opus 4.8。
与行业顶尖模型相比,毫无胜算,而 xAI 也没有假装不是这样。 在 xAI 自己的展示页面上,Claude Fable 5 (max) 在所有四个图表中都名列前茅,而 GPT 5.5 (xhigh) 在四个图表中的三个里击败了 Grok 4.5。有意思的是,xAI 并没有把这些数据裁剪掉,而是公开展示了出来。其卖点显然是性价比,而不是霸主地位。Fable 的数据在实际中意味着什么,我们在 Fable 5 基准测试分析中进行了探讨。
与其前代产品相比,提升是实实在在的,但幅度有限。 在这些图表上,Opus 4.7 到 4.8 的跨越让大多数代际差距都相形见绌;而在两个共同的基准测试中,Grok 4.5 对 GLM 5.2 这种价格仅为其零头的模型的领先优势为 9-11 分。注重“单位美元能力”的买家应该从双向仔细审视这些差距。
xAI 希望你关注的指标
效率图表是这次发布会的战略核心。解决每个任务平均消耗 15,954 个输出 Token,而 Opus 4.8 (max) 则为 67,020 个,这意味着 Grok 4.5 在完成同等工作时,其输出量不到后者的四分之一,且传输速度达到每秒 80 个 Token。
这是一个合理且真实的指标,而非宣传噱头。输出 Token 意味着计费成本和消耗的时间;在 Agent 循环中,这种成本会随着每一个步骤复利式累积。一个在 SWE Bench Pro 上得分低 4.5 分但输出 Token 减少 4.2 倍的模型,依然是高吞吐量管线的理性选择,这正是我们定价分析中所量化的权衡(按公开价格计算,每个已解决的任务输出成本约为 ~$0.10 对比 ~$1.68)。
两点注意事项:这是厂商自己测量的单一基准测试。此外,对于对比模型来说,冗长并不等同于浪费:Opus 的长输出是其延伸推理的过程,这正是它在某些评估测试中胜出的原因之一。效率与深度之间存在着切实的权衡,世上没有免费的午餐。
遗漏的信息
值得持观望态度几周的理由:
- 缺乏独立的第三方评估测试。 截至 7 月 9 日,尚未被 Artificial Analysis 智能指数收录,未在 LMArena 上排位,也没有社区对 SWE-bench 的复制性测试。
- 仅限于代码能力。 尽管 xAI 将该模型也推广用于“知识性工作”,但并未发布任何关于通用推理、数学、科学或安全方面的基准测试。其办公能力也是以演示形式推出,而非正式的评估测试。
- 未公开 Grok 本身的推理模式(effort-mode)。 竞争对手的模型都标注了模式(如 max、xhigh);而 Grok 4.5 的得分究竟代表其默认配置还是最大化配置,文中并未说明。
- 处于发布首周的模型。 在任何模型发布后的第一个月内,性能回退、服务不稳定以及悄无声息的能力变动都是常见现象。
运行真正有意义的基准测试:你自己的测试
公开的基准测试预测的是平均水平,而不是您具体的工作负载。在做切换决策时,轻量级的私有化评估比上述所有方式都更有效:
- 从您自己的待办任务(backlog)中收集 10-20 个真实任务:包括 prompt、代码库上下文以及预期结果。
- 在 Apifox 中,为每个候选模型构建并保存一个请求。由于 xAI 和 Anthropic 都提供了兼容 OpenAI 的接口,因此测试套件只需要一个包含模型变量的集合,而不需要三套代码。
- 针对
grok-4.5和您现有的模型运行每个任务。对usageobject 进行断言并捕获延迟,这样您就可以在同一次运行中评估质量、速度和 Token 消耗。 - 尽可能对输出进行盲测评分;模型名称对评审人员产生的偏见远比大家承认的要大。
最后一步是检验“高效率”说法是否符合实际的关键:如果 Grok 4.5 在您的 prompt 下输出的内容没有明显变短,那么宣传中的经济效益就不适用于您。免费下载 Apifox,整个测试套件的搭建只需一个小时。关于 xAI 端的配置详情,请参阅我们的 Grok 4.5 API 指南。
常见问题
xAI 为 Grok 4.5 发布了哪些基准测试? 四个编程评估(DeepSWE 1.0 和 1.1、Terminal Bench 2.1、SWE Bench Pro)以及与 Opus 4.8 的 Token 效率对比。不包含编程之外的其他领域。
是否有针对 Grok 4.5 的独立第三方基准测试? 目前还没有。公布的数据混合了 Datacurve 运行的评估以及其他厂商系统说明书(system card)中的数据。独立的指数通常会在重大产品发布后的几周内公布。
Grok 4.5 是否击败了 Claude Opus 4.8? 在公布的四个基准测试中,Grok 4.5 在其中两个上胜出,且成本要低得多。Opus 则在两个难度更高的仓库级(repo-level)评估中胜出。请参阅完整的对比。
Grok 4.5 是目前最强的编程模型吗? 不是,xAI 自己的图表也证实了这一点:Claude Fable 5 (max) 在所有已公布的基准测试中都处于领先地位。Grok 4.5 的竞争优势在于性价比(单位美元的智能度)。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会