Grok 4.5 基准测试:xAI 官方说明与解读指南

xAI 发布 Grok 4.5 编码基准测试,数据亮眼但暗藏玄机。本文深度解析其与 Claude、GPT 的对比,揭秘 4.2 倍输出效率背后的真相,并教你如何进行私有化测评。

用 Apifox,节省研发团队的每一分钟

Grok 4.5 基准测试:xAI 官方说明与解读指南

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

xAI 于 2026 年 7 月 8 日发布了 Grok 4.5,并公布了四项编码基准测试和一张效率图表。这些数据非常有趣,且经过精心挑选。本文将解析发布的每一项数据、其来源、缺失的信息,以及如何在不等待排行榜更新的情况下进行自我评估。

坦率地说:Grok 4.5 表现得像是一个强大的第二梯队编码模型,其结果与 Claude Opus 4.8 相当,但落后于顶级模型;其最大的亮点是输出效率,而非单纯的准确率得分。

xAI 公布的所有数据

根据 官方公告,以下是全部四张图表:

DeepSWE 1.0 (pass@1)

模型 得分
Claude Fable 5 (max) 66.1%
GPT 5.5 (xhigh) 64.31%
Grok 4.5 62.0%
Claude Opus 4.8 (max) 55.75%
Claude Opus 4.7 (max) 40.12%

DeepSWE 1.1

模型 得分
Claude Fable 5 (max) 70%
GPT 5.5 (xhigh) 67%
Claude Opus 4.8 (max) 59%
Grok 4.5 53%
GLM 5.2 44%

Terminal Bench 2.1

模型 得分
Claude Fable 5 (max) 84.3%
GPT 5.5 (xhigh) 83.4%
Grok 4.5 83.3%
Claude Opus 4.8 (max) 78.9%
Claude Opus 4.7 (max) 78.9%

SWE Bench Pro (解决率)

模型 得分
Claude Fable 5 (max) 80.4%
Claude Opus 4.8 (max) 69.2%
Grok 4.5 64.7%
Claude Opus 4.7 (max) 64.3%
GLM 5.2 62.1%
GPT 5.5 (xhigh) 58.6%

效率图表也包含在内:Grok 4.5 在 SWE Bench Pro 中平均每个任务产生 15,954 个输出 token,而 Opus 4.8 (max) 为 67,020 个,这意味着两者有 4.2 倍的差距。

这些数据从何而来?

xAI 图表中的脚注说明比以往任何时候都更重要:

  • DeepSWE 1.0,“由 Datacurve 创建,运行在各模型提供商通过 AA 使用的支架(scaffolds)上。”
  • DeepSWE 1.1,“使用了由 Datacurve 运行的 mini-swe-agent 支架。”
  • “竞争对手的数据取自相关开发者发布的系统卡片或基准测试排行榜。”

翻译一下:这是一个“拼凑版”。有些数据来自第三方评估机构,有些来自竞争对手自己的营销页面,并由厂商(有销售目的的一方)汇总。这比单纯的自我报告更透明,且 Datacurve 的参与增加了可信度。尽管如此,这并非独立的第三方评估:不同来源的支架、环境和投入程度(effort settings)各不相同,而这些因素中的每一项都能让智能体(agentic)得分波动几个百分点。除了这个汇总数据外,目前还没有人发布 Grok 4.5 的独立评分。

对相同图表的三种解读

对比 Opus 4.8,确实各有胜负。 两项胜出(DeepSWE 1.0 领先 6.25,Terminal Bench 领先 4.4),两项落败(DeepSWE 1.1 落后 6,SWE Bench Pro 落后 4.5)。马斯克关于“Opus 级别”的定位与发布的数据相符;再高的评价就不客观了。请注意哪些基准测试在哪一方占优:Grok 在侧重终端(terminal-focused)和较旧的评估中获胜,而 Opus 在更新、更复杂的仓库级(repo-level)评估中获胜。关于包含价格在内的全面对比,请参阅 Grok 4.5 vs Claude Opus 4.8

对比 SOTA 边界模型,毫无悬念,xAI 也没有否认这一点。 Claude Fable 5 (max) 在 xAI 自己页面的所有四张图表中均位居榜首,而 GPT 5.5 (xhigh) 在四分之三的测试中超过了 Grok 4.5。有趣的是,xAI 并没有删减这些数据,而是直接发布了。其营销策略显然侧重于性价比,而非绝对的领先地位。关于 Fable 的数据在实践中意味着什么,已在我们的 Fable 5 基准测试分析中讨论。

对比其前代模型,升级是真实的,但范围有限。 在这些图表中,从 Opus 4.7 到 4.8 的跨度让大多数代际差异显得微不足道,而 Grok 4.5 对比 成本低得多 的 GLM 5.2,在两项共同基准测试中仅领先 9-11 分。追求单位成本能力(dollar-per-capability)的用户应仔细权衡这些差异。

xAI 希望你关注的指标

效率图表是此次发布的战略核心。解决每个任务仅需 15,954 个输出 token,而 Opus 4.8 (max) 需要 67,020 个,这意味着 Grok 4.5 以不到四分之一的输出量完成了相当的工作,且速度达到每秒 80 个 token。

这是一个合理的指标,而非误导。输出 token 是按资金和耗时计费的;在智能体循环中,每一步都会累积。一个在 SWE Bench Pro 中得分低 4.5 分但产生的 token 少 4.2 倍的模型,对于高吞吐量的流水线来说,仍然是一个理性的选择;这正是我们的 价格分析 所量化的权衡(按牌价计算,每个解决任务的输出成本约为 0.10 美元 vs 1.68 美元)。

但有两点提醒。这是由厂商测量的单一基准测试。而且对于对比模型来说,冗余并非浪费:Opus 冗长的输出是其扩展推理(extended reasoning)的一部分,这也是它赢得某些评估的原因。效率与深度之间存在真实的权衡,天下没有免费的午餐。

缺失了什么?

以下是需要推迟几周再做定论的原因:

  • 缺乏独立的第三方评估。 截至 7 月 9 日,Artificial Analysis 智能指数尚未录入,LMArena 尚未排名,社区也未进行 SWE-bench 复现。
  • 仅限编码。 xAI 尚未发布通用推理、数学、科学或安全方面的基准测试,尽管该模型也针对“知识工作”进行营销。办公协作能力仅以演示(demo)形式展示,而非评估数据。
  • Grok 自身的投入模式(effort mode)未说明。 竞争对手都标注了(max, xhigh);但未说明 Grok 4.5 的得分是反映了默认配置还是最高配置。
  • 发布仅一周的模型。 每次发布后的第一个月,性能退化(regressions)、服务不稳定和悄无声息的能力变化都很常见。

运行最重要的基准测试:你自己的

公开基准测试预测的是平均水平,而不是你的具体工作负载。一次轻量级的私有评估胜过上述所有数据:

  1. 从你自己的积压任务中收集 10-20 个真实任务:包含提示词(prompts)、代码库上下文和预期结果。
  2. Apifox 中,为每个候选模型创建一个保存的请求。xAI 和 Anthropic 都提供 OpenAI 兼容接口,因此支架是统一的,只需更改模型变量。
  3. 针对 grok-4.5 和你当前的模型运行每个任务。验证 usage 对象并记录延迟(latency),从而在同一次测试中对质量、速度和 token 消耗进行评分。
  4. 如果可能,进行盲测评分;模型名称对评估者的影响比人们承认的要大。

在最后一步中,效率主张将接受现实的检验:如果 Grok 4.5 在你的提示词下的输出并没有明显变短,那么宣传中的经济效益对你就不适用。免费下载 Apifox,整个环境搭建只需一小时。关于 xAI 端的设置详情,请参阅我们的 Grok 4.5 API 指南

常见问题解答

xAI 为 Grok 4.5 发布了哪些基准测试? 四项编码评估(DeepSWE 1.0 和 1.1, Terminal Bench 2.1, SWE Bench Pro)以及对比 Opus 4.8 的 token 效率对比。没有编码以外的数据。

是否有独立的 Grok 4.5 基准测试? 目前还没有。发布的数字混合了 Datacurve 执行的评估和其他厂商系统卡片中的数据。独立指数通常在大规模发布数周后才会公布。

Grok 4.5 超过了 Claude Opus 4.8 吗? 在发布的四项基准测试中胜出了两项,且成本低得多。Opus 在两项难度更高的仓库级评估中获胜。请参阅 完整对比

Grok 4.5 是目前最强的编码模型吗? 不是,xAI 自己的图表也说明了这一点:Claude Fable 5 (max) 在发布的每一项基准测试中都处于领先地位。Grok 4.5 竞争的是单位成本的智能水平。

开发必备:API 全流程管理神器 Apifox

介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。

如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用

Apifox

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案

获取专属报价与部署方案

icon 详细的私有化部署系统架构与安全白皮书
icon 针对您公司规模的专属报价单
icon 免费的 1v1 专属产品演示 (Demo) 机会
获取部署方案
* 提交后,我们的客户经理将在 1 个工作日内与您联系
林俊锋 企业微信
@Apifox 专属顾问
扫码备注: 私有化 + 公司名