什么是 GLM-5.3?智谱开源代码模型详解

智谱AI重磅发布GLM-5.3代码模型!凭借卓越的后训练优化,其终端Agent与安全分析能力飙升,直逼Claude顶尖水平,且即将开源权重。一文带你快速掌握其核心优势与API接入指南。

用 Apifox,节省研发团队的每一分钟

什么是 GLM-5.3?智谱开源代码模型详解

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

GLM-5.3 是智谱 AI(Zhipu AI,在国际上以 Z.ai 的名称运营)于 2026 年 8 月 14 日发布的超大型语言模型。它是 GLM-5 基础模型的后训练(post-training)升级版本,专注于代码编写和 Agent 任务。智谱计划在发布后约两周内,在 Hugging Face 上公布其开放权重。在智谱的内部评估中,其代码能力相比 GLM-5.2 提升了 50%。

这种组合正是这次发布备受瞩目的原因:一家被 Seeking Alpha 称为“中国 OpenAI 挑战者”的实验室,推出了一款其声称“接近 Claude Fable 5”的代码模型,并计划开源其权重。该模型在 DeepSeek 最新发布(我们在 DeepSeek V4 Pro API 指南中已进行过报道)的第二天紧跟推出,表明中国的开源模型竞争已经进入了以周为单位的迭代节奏。

本文将介绍 GLM-5.3 是什么、基准测试(benchmarks)的表现(以及哪些是来自智谱官方的测试结果)、开放权重计划的具体细节,以及如何发送你的第一个请求。你可以在 Apifox 中直接测试该请求,无需编写任何代码。

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

TL;DR

  • GLM-5.3 于 2026 年 8 月 14 日由智谱 AI(Z.ai)发布。采用相同的 GLM-5 基础模型;所有提升均来自规模化的后训练(post-training)。
  • Terminal-Bench 3.0 评分从 4.6 跃升至 28.3,提升了 6.2 倍,在开源模型中位列第一。它在 Agents’ Last Exam 基准测试中也位列开源模型第一。
  • CyberGym:84.5%,略高于 Claude Mythos 5 和 GPT-5.6 Sol。ExploitBench:54.4%,仍落后于前沿模型。
  • 开放权重将于 2026 年 8 月 28 日左右在 Hugging Face 上线,在此之前智谱将进行其自称有史以来最广泛的安全风险评估。
  • 根据官方文档,GLM-5 系列架构为:混合专家模型(Mixture of Experts),总参数量 744B,每次前向传播约激活 40B 参数,支持 200K 上下文窗口。
  • API 兼容 OpenAI 格式,接口地址为 https://api.z.ai/api/paas/v4/chat/completions。发布时未公布针对 5.3 版本的具体定价。

GLM-5.3 是什么

GLM-5.3 是 GLM-5 系列中的第三个子版本,也是最专注的一个版本。智谱并没有对底层基础模型进行重新训练。根据官方文档的描述,GLM-5 基础模型是一个混合专家模型(Mixture of Experts),总参数量为 744B,单次前向传播激活约 40B 参数,并拥有 200K token 的上下文窗口;这些规格均保持不变。改变的是上层的优化:性能的提升完全来自于对相同基础权重进行的规模化后训练(scaled post-training)。

这一细节的重要性不容小觑。当一个实验室在不改变基座模型的情况下将模型提升到这种程度,后训练(post-training)流水线本身就成为了核心产品。智谱声称其代码能力比 GLM-5.2 提升了 50%,且目标工作负载非常明确:终端驱动的 Agent 任务、长周期软件工程和安全分析。这绝非一次通用的聊天功能升级。

简而言之:如果你希望以开源模型的经济成本获得强大的自主编码能力,并且在权重发布后能够选择在自己的硬件上运行,那么 GLM-5.3 就是你应该评估的模型。

GLM-5.3 基准测试:数据及其来源

来自 BigGo FinancePandaily 的发布报道指出了以下结果。请认真对待“数据来源”这一列:部分数据来自公共排行榜,而其他数据则来自智谱官方的评估测试,这两类证据的含金量并不相同。

基准测试 GLM-5.3 结果 背景信息 数据来源
Terminal-Bench 3.0 28.3(高于 4.6) 提升 6.2 倍;在开源模型中排名第一 发布报告
Agents’ Last Exam 在开源模型中排名第一 发布时未透露具体得分 发布报告
CyberGym 84.5% 略高于 Claude Mythos 5 和 GPT-5.6 Sol 发布报告
ExploitBench 54.4% 落后于前沿模型 发布报告
SWE-Marathon 约 GLM-5.2 的 2 倍 长周期软件工程 智谱内部测试
代码能力(综合) 比 GLM-5.2 提升 50% 智谱的核心宣传点 智谱内部测试

对此有两种合理的解读。乐观的解读是:在 Terminal-Bench 3.0 上从 4.6 跨越到 28.3 绝非偶然的误差。终端基准测试衡量的是模型能否在多个步骤中链式执行 Shell 命令、读取输出并在出错时进行恢复,而 GLM-5.2 在这方面的表现较为薄弱。在仅一个次版本更新中,从近乎垫底一跃成为开源模型中的第一名,这改变了开发者在构建 Agent 流水线时对模型的选择倾向。

怀疑的解读则是:最引人注目的两项声称——代码能力提升 50% 以及 SWE-Marathon 得分翻倍——均为智谱的内部数据,目前尚无公开的测试框架可供复现。这并不意味着这些数据是虚假的,但在权重正式发布且独立评估人员重新运行测试套件之前,它们仍处于未验证状态。

“逼近 Claude Fable 5”在实际中意味着什么

智谱官方给出的定位是,GLM-5.3 的代码和 Agent 能力“逼近 Claude Fable 5”。这一表述经过了仔细斟酌。

这一论断在哪些地方站得住脚:在 Agent 和终端任务方面,报道中的数据已接近前沿水平。在 Terminal-Bench 3.0 和 Agents’ Last Exam 中夺得开源模型第一名,意味着 GLM-5.3 在对自主编码 Agent 至关重要的任务上,已经超越了所有开源竞争对手。其在 CyberGym 上取得的 84.5% 成绩甚至微幅超越了 Claude Mythos 5 和 GPT-5.6 Sol,尽管领先幅度较小,多次运行之间的偏差也可能导致这种差异。

而在其表现不佳的领域:ExploitBench 得分为 54.4%,仍明显落后于前沿模型。漏洞利用开发强调在模糊环境下的深度多步推理,这一差距表明前沿模型在最困难的重推理任务中依然保有优势。“接近”是一个客观的用词,它并不是“平起平坐”,而且值得称赞的是,智谱本身也没有声称能够平起平坐。

在实际落地中,这对你的技术栈意味着:GLM-5.3 非常值得在终端 Agent、CI 自动化以及仓库级编码任务中进行直接的基准测试对比。对于最难的推理问题,前沿闭源模型目前可能仍保持领先。如果你想了解前沿模型在这些维度上的具体差异,我们的 Grok 4.6 vs GPT-5.6 vs Claude Fable 5 对比文章通过实际示例详细梳理了相同的基准测试类别。

开源权重发布计划:预计 8 月 28 日左右上线 Hugging Face

这次发布中最具长期影响的细节并不是基准测试数据。智谱承诺在发布后约两周内公开 GLM-5.3 的开源权重,这意味着它将于 2026 年 8 月 28 日左右在 zai-org Hugging Face organization 页面上发布,该公司之前的开源版本也都托管于此。

这两周的间隔是刻意为之的。智谱表示,他们为本次发布构建了迄今为止最广泛的风险审查系统,而安全基准测试的数据也解释了原因:在 CyberGym 上获得 84.5% 评分的模型具备显著的攻击性安全能力,公开释放这些权重与将其限制在受监控的 API 之后是截然不同的决定。这一审查窗口期是开源发布必须要付出的成本。

权重的发布对你意味着什么,取决于你的硬件配置。即使每个 token 仅激活约 40B 参数,在 744B 参数的 MoE 模型上进行全精度推理也属于服务端级别的硬件范畴,因此大多数团队会选择等待社区的量化版本。如果你计划在本地运行它,我们的本地托管 GLM-5.3 指南涵盖了硬件选型、服务栈配置,以及在权重发布前如何利用托管 API 建立基线。

GLM-5.3 在开源模型生态中的定位

最显而易见的对比对象是 DeepSeek。这两家实验室都来自中国,都发布了开源权重,定价都极具竞争力,且发布时间相差不到 24 小时。不同之处在于侧重点:DeepSeek 的 V4 Pro 系列是通用型旗舰,而 GLM-5.3 则是针对编码 Agent 的专属押注,他们认为编码 Agent 是最值得赢下的工作负载。如果你的业务流量主要集中在 Agent 编码,那么这种专业性就是你优先测试 GLM-5.3 的有力理由。

经济因素影响着整体局势。DeepSeek 最近的涨价(我们在 DeepSeek API 成本优化指南中对此进行了分析)表明了开源模型 API 定价变化之快,这促使更多团队转向自托管以作为对冲手段。而在 Terminal-Bench 中处于领先地位的开放权重模型 GLM-5.3 为这些团队提供了另一个可靠的选择。智谱在发布时并未公布 5.3 版本的具体 API 定价;作为参考,截至本文撰写时,官方定价页面列出的 GLM-5.2 价格为每 100 万输入 Token 1.4 美元,每 100 万输出 Token 4.4 美元,因此预计 5.3 的价格应该在这附近,大家在做预算前请先查看该页面。

开源生态环境也同样重要。一旦出现量化版本,GLM-5.3 就会加入到无需任何 API 依赖即可运行的模型库中。我们对 2026 年最佳本地大语言模型的综述涵盖了当前开源领跑者的现状;而这个在 Terminal-Bench 中拔得头筹的新成员将重新改写该榜单。

GLM Coding Plan 配额已重置

一个直接影响现有用户的发布日细节是:智谱在 8 月 14 日重置了所有用户的 GLM Coding Plan 配额。如果您通过 Z.ai 订阅了 Coding Plan,您的配额已在发布当天重新计算,这无疑是邀请您使用该配额来体验 5.3。

Coding Plan 是智谱针对编程工具提供的固定费率方案,与按 Token 付费的 API 接入不同,此次重置仅适用于该方案,不影响 API 计费。中国大陆用户可以通过 open.bigmodel.cn 获得相同的生态系统,该平台拥有自己的方案和计费模式。

五分钟快速体验 API

Z.ai 的 API 与 OpenAI 兼容,因此如果您调用过任何主流大语言模型的 API,其请求格式对您来说应该会很熟悉。国际版接口为 https://api.z.ai/api/paas/v4/chat/completions;中国大陆则使用 https://open.bigmodel.cn/api/paas/v4/chat/completions。auth 方式为 Bearer Token。需要注意的一点是:在发布时,官方文档中列出的模型 ID 仍为 glm-5,因此下方代码中的 glm-5.3 ID 遵循了 GLM-5 系列的命名惯例。在正式上线前,请先在模型文档页面确认准确的字符串。

export GLM_API_KEY="your-key-from-z.ai"

curl https://api.z.ai/api/paas/v4/chat/completions \
  -H "Authorization: Bearer $GLM_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      {
        "role": "user",
        "content": "Write a bash script that finds the five largest files in a git repo, excluding the .git directory."
      }
    ],
    "temperature": 0.6,
    "max_tokens": 1024
  }'

响应遵循 OpenAI 的数据模型:包含消息内容的 choices 数组,以及包含 Token 数量的 usage 块。

比修改 cURL 字符串更高效的调试流程:将请求导入 Apifox,将 GLM_API_KEY 保存为环境变量,并创建两个环境——一个用于 Z.ai 接口,另一个用于 bigmodel.cn。这样,切换区域或模型 ID 变成了简单的下拉菜单选择,而无需手动修改;保存的响应还将作为日后开源权重发布时的回归基线。

如需获取包含 Python 和 Node.js 客户端、流式传输以及错误处理在内的完整指南,请参阅完整的 GLM-5.3 API 快速入门。

常见问题 (FAQ)

GLM-5.3 开源了吗?

目前还没有,但它将是“权重开放”(open weight)的。智谱承诺在 2026 年 8 月 28 日左右(约在 API 发布两周后)在 Hugging Face 上发布权重,此前该模型将完成该公司称之为迄今为止最广泛的安全风险评估。在此之前,唯一的访问方式是通过托管 API。

GLM-5.3 与 GLM-5.2 有什么区别?

基础模型完全相同。所有的提升都来自于更大规模的后训练(post-training):智谱在内部评估中报告其代码能力提升了 50%,在 Terminal-Bench 3.0 上的得分从 4.6 跃升至 28.3,且 SWE-Marathon 得分近乎翻倍。上下文窗口、参数量和架构与 GLM-5 系列的基准保持一致。

GLM-5.3 如何收费?

智谱在发布时并未公布 GLM-5.3 的具体 API 定价。官方定价页面上 GLM-5.2 的价格为每百万输入 token 1.4 美元,每百万输出 token 4.4 美元,这可以作为最参考的基准。在制定预算前,请查看实时的定价页面。如果成本是您的主要考量因素,我们在 DeepSeek 降价后撰写的 API 成本优化指南中介绍的策略,同样适用于任何按 token 计费的 API。

我可以在自己的硬件上运行 GLM-5.3 吗?

在权重发布后是可以的,但有一些限制。GLM-5 系列是一个拥有 7440 亿参数的混合专家(MoE)模型,每次前向传播大约有 400 亿激活参数,因此全精度部署需要多 GPU 的服务器硬件。社区的量化版本会降低这一门槛;请参阅自托管准备指南以获取实际的配置建议。

在编写代码方面,GLM-5.3 比 Claude 或 GPT 更好吗?

在公开的智能体(agent)和终端(terminal)基准测试中,它极具竞争力:在 Terminal-Bench 3.0 上,它在开源模型中排名第一;在 CyberGym 上,它略微领先于 Claude Mythos 5 和 GPT-5.6 Sol。但在 ExploitBench 上,它以 54.4% 的成绩落后于行业顶尖水平。坦白地说,这取决于您的具体工作负载:在切换生产流量之前,建议像测试任何 API 一样,针对两者运行您自己的评估集。

GLM-5.3 在您技术栈中的定位

GLM-5.3 是一个定位明确的专业版本:接近前沿水平的 coding agent 性能,两周内开放权重,以及一个兼容 OpenAI 的 API,你今天就可以直接将现有代码指向它。其在终端和 agent 任务上的基准测试表现强劲,也客观承认了在 ExploitBench 上的差距,且在 8 月 28 日独立运行结果出炉前,部分数据仍处于未证实状态。这些信号足以支持我们对其进行评估,但尚不足以驱动迁移。

低成本的起步方式:发送上面的 cURL 请求,保存响应,并针对你的实际工作负载构建一个小型 prompt 套件。下载 Apifox 来管理该套件,将 Z.aibigmodel.cn 接口作为可切换的环境保持,并将今天的探索性调用转化为回归基线——当开放权重发布、你需要将自己的部署与托管 API 进行对比时,这就是你所需要的基准。

开发必备:API 全流程管理神器 Apifox

介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。

如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用

Apifox

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案

获取专属报价与部署方案

icon 详细的私有化部署系统架构与安全白皮书
icon 针对您公司规模的专属报价单
icon 免费的 1v1 专属产品演示 (Demo) 机会
获取部署方案
* 提交后,我们的客户经理将在 1 个工作日内与您联系
林俊锋 企业微信
@Apifox 专属顾问
扫码备注: 私有化 + 公司名