xAI 于 2026 年 7 月 8 日发布了 Grok 4.5,并公布了四项编码基准测试和一张效率图表。这些数据非常有趣,且经过精心挑选。本文将解析发布的每一项数据、其来源、缺失的信息,以及如何在不等待排行榜更新的情况下进行自我评估。
坦率地说:Grok 4.5 表现得像是一个强大的第二梯队编码模型,其结果与 Claude Opus 4.8 相当,但落后于顶级模型;其最大的亮点是输出效率,而非单纯的准确率得分。
xAI 公布的所有数据
根据 官方公告,以下是全部四张图表:
DeepSWE 1.0 (pass@1)
| 模型 | 得分 |
|---|---|
| Claude Fable 5 (max) | 66.1% |
| GPT 5.5 (xhigh) | 64.31% |
| Grok 4.5 | 62.0% |
| Claude Opus 4.8 (max) | 55.75% |
| Claude Opus 4.7 (max) | 40.12% |
DeepSWE 1.1
| 模型 | 得分 |
|---|---|
| Claude Fable 5 (max) | 70% |
| GPT 5.5 (xhigh) | 67% |
| Claude Opus 4.8 (max) | 59% |
| Grok 4.5 | 53% |
| GLM 5.2 | 44% |
Terminal Bench 2.1
| 模型 | 得分 |
|---|---|
| Claude Fable 5 (max) | 84.3% |
| GPT 5.5 (xhigh) | 83.4% |
| Grok 4.5 | 83.3% |
| Claude Opus 4.8 (max) | 78.9% |
| Claude Opus 4.7 (max) | 78.9% |
SWE Bench Pro (解决率)
| 模型 | 得分 |
|---|---|
| Claude Fable 5 (max) | 80.4% |
| Claude Opus 4.8 (max) | 69.2% |
| Grok 4.5 | 64.7% |
| Claude Opus 4.7 (max) | 64.3% |
| GLM 5.2 | 62.1% |
| GPT 5.5 (xhigh) | 58.6% |
效率图表也包含在内:Grok 4.5 在 SWE Bench Pro 中平均每个任务产生 15,954 个输出 token,而 Opus 4.8 (max) 为 67,020 个,这意味着两者有 4.2 倍的差距。

这些数据从何而来?
xAI 图表中的脚注说明比以往任何时候都更重要:
- DeepSWE 1.0,“由 Datacurve 创建,运行在各模型提供商通过 AA 使用的支架(scaffolds)上。”
- DeepSWE 1.1,“使用了由 Datacurve 运行的 mini-swe-agent 支架。”
- “竞争对手的数据取自相关开发者发布的系统卡片或基准测试排行榜。”
翻译一下:这是一个“拼凑版”。有些数据来自第三方评估机构,有些来自竞争对手自己的营销页面,并由厂商(有销售目的的一方)汇总。这比单纯的自我报告更透明,且 Datacurve 的参与增加了可信度。尽管如此,这并非独立的第三方评估:不同来源的支架、环境和投入程度(effort settings)各不相同,而这些因素中的每一项都能让智能体(agentic)得分波动几个百分点。除了这个汇总数据外,目前还没有人发布 Grok 4.5 的独立评分。
对相同图表的三种解读
对比 Opus 4.8,确实各有胜负。 两项胜出(DeepSWE 1.0 领先 6.25,Terminal Bench 领先 4.4),两项落败(DeepSWE 1.1 落后 6,SWE Bench Pro 落后 4.5)。马斯克关于“Opus 级别”的定位与发布的数据相符;再高的评价就不客观了。请注意哪些基准测试在哪一方占优:Grok 在侧重终端(terminal-focused)和较旧的评估中获胜,而 Opus 在更新、更复杂的仓库级(repo-level)评估中获胜。关于包含价格在内的全面对比,请参阅 Grok 4.5 vs Claude Opus 4.8。
对比 SOTA 边界模型,毫无悬念,xAI 也没有否认这一点。 Claude Fable 5 (max) 在 xAI 自己页面的所有四张图表中均位居榜首,而 GPT 5.5 (xhigh) 在四分之三的测试中超过了 Grok 4.5。有趣的是,xAI 并没有删减这些数据,而是直接发布了。其营销策略显然侧重于性价比,而非绝对的领先地位。关于 Fable 的数据在实践中意味着什么,已在我们的 Fable 5 基准测试分析中讨论。
对比其前代模型,升级是真实的,但范围有限。 在这些图表中,从 Opus 4.7 到 4.8 的跨度让大多数代际差异显得微不足道,而 Grok 4.5 对比 成本低得多 的 GLM 5.2,在两项共同基准测试中仅领先 9-11 分。追求单位成本能力(dollar-per-capability)的用户应仔细权衡这些差异。
xAI 希望你关注的指标
效率图表是此次发布的战略核心。解决每个任务仅需 15,954 个输出 token,而 Opus 4.8 (max) 需要 67,020 个,这意味着 Grok 4.5 以不到四分之一的输出量完成了相当的工作,且速度达到每秒 80 个 token。
这是一个合理的指标,而非误导。输出 token 是按资金和耗时计费的;在智能体循环中,每一步都会累积。一个在 SWE Bench Pro 中得分低 4.5 分但产生的 token 少 4.2 倍的模型,对于高吞吐量的流水线来说,仍然是一个理性的选择;这正是我们的 价格分析 所量化的权衡(按牌价计算,每个解决任务的输出成本约为 0.10 美元 vs 1.68 美元)。
但有两点提醒。这是由厂商测量的单一基准测试。而且对于对比模型来说,冗余并非浪费:Opus 冗长的输出是其扩展推理(extended reasoning)的一部分,这也是它赢得某些评估的原因。效率与深度之间存在真实的权衡,天下没有免费的午餐。
缺失了什么?
以下是需要推迟几周再做定论的原因:
- 缺乏独立的第三方评估。 截至 7 月 9 日,Artificial Analysis 智能指数尚未录入,LMArena 尚未排名,社区也未进行 SWE-bench 复现。
- 仅限编码。 xAI 尚未发布通用推理、数学、科学或安全方面的基准测试,尽管该模型也针对“知识工作”进行营销。办公协作能力仅以演示(demo)形式展示,而非评估数据。
- Grok 自身的投入模式(effort mode)未说明。 竞争对手都标注了(max, xhigh);但未说明 Grok 4.5 的得分是反映了默认配置还是最高配置。
- 发布仅一周的模型。 每次发布后的第一个月,性能退化(regressions)、服务不稳定和悄无声息的能力变化都很常见。
运行最重要的基准测试:你自己的
公开基准测试预测的是平均水平,而不是你的具体工作负载。一次轻量级的私有评估胜过上述所有数据:
- 从你自己的积压任务中收集 10-20 个真实任务:包含提示词(prompts)、代码库上下文和预期结果。
- 在 Apifox 中,为每个候选模型创建一个保存的请求。xAI 和 Anthropic 都提供 OpenAI 兼容接口,因此支架是统一的,只需更改模型变量。
- 针对
grok-4.5和你当前的模型运行每个任务。验证usage对象并记录延迟(latency),从而在同一次测试中对质量、速度和 token 消耗进行评分。 - 如果可能,进行盲测评分;模型名称对评估者的影响比人们承认的要大。
在最后一步中,效率主张将接受现实的检验:如果 Grok 4.5 在你的提示词下的输出并没有明显变短,那么宣传中的经济效益对你就不适用。免费下载 Apifox,整个环境搭建只需一小时。关于 xAI 端的设置详情,请参阅我们的 Grok 4.5 API 指南。
常见问题解答
xAI 为 Grok 4.5 发布了哪些基准测试? 四项编码评估(DeepSWE 1.0 和 1.1, Terminal Bench 2.1, SWE Bench Pro)以及对比 Opus 4.8 的 token 效率对比。没有编码以外的数据。
是否有独立的 Grok 4.5 基准测试? 目前还没有。发布的数字混合了 Datacurve 执行的评估和其他厂商系统卡片中的数据。独立指数通常在大规模发布数周后才会公布。
Grok 4.5 超过了 Claude Opus 4.8 吗? 在发布的四项基准测试中胜出了两项,且成本低得多。Opus 在两项难度更高的仓库级评估中获胜。请参阅 完整对比。
Grok 4.5 是目前最强的编码模型吗? 不是,xAI 自己的图表也说明了这一点:Claude Fable 5 (max) 在发布的每一项基准测试中都处于领先地位。Grok 4.5 竞争的是单位成本的智能水平。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会