Z.ai 8月26、2026发布了GLM-5.3-Flash。它是320-billion-parameter专家混合模型,具有18十亿个活动参数,根据MIT许可证发货,并且是GLM-5系列中第一个本地处理图像而不是通过螺栓固定的视觉适配器处理图像的模型。
这也是许多开发人员在不知情的情况下已经使用了一周的模型。下面详细介绍一下。
如果您来到这里期望“Flash”意味着“快速”,那么这篇文章将不同意您的观点。该命名约定来自 Google,其中 Flash 模型确实属于低延迟层。在这里,它意味着不同的东西,正确区分会改变该模型是否适合您的工作负载。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
长话短说
- 它是什么: 开放权重 (MIT)320B-A18B专家混合模型 Z.ai,8月发布26、2026。
- 标题变化: 原生多模态。图像、视频和文件输入直接进入模型。GLM-5.3通过单独的适配器路由视觉,而GLM-5.2仅为文本。
- 语境: 1、048、576代币,1M窗口与GLM-5.3相同。
- 真正的卖点: 成本。 Z.ai 其价格约为GLM-5.2的十分之一,标价为每百万输入代币0.15美元和每百万输出代币0.50美元。
- 诚实的警告: 它并不快。Artificial Analysis每秒测量48.7输出令牌,这对于其大小级别来说很慢。第一个令牌的时间确实很好,为1.52秒。
- 哪里可以获得: 这 Z.ai API为
glm-5.3-flash,以及OpenRouter、Cloudflare Workers AI、Vercel AI Gateway和其他几个提供商。重量在Hugging Face上。
规格
| 财产 | 价值 |
|---|---|
| 总参数 | 320B |
| 有效参数 | 18B |
| 建筑学 | 专家混合、混合线性和稀疏注意力 |
| 执照 | MIT |
| 上下文窗口 | 1、048、576代币 |
| 输入方式 | 文本、图像、视频、文件 |
| 输出 | 文本 |
| 推理模式 | low, high, max (默认 max) |
| API型号 | glm-5.3-flash |
| Hugging Face | zai-org/GLM-5.3-Flash |
有一个需要谨慎对待的数字:最大输出令牌。OpenRouter列出131、072,Hugging Face型号卡表示163、840。这些消息来源不同意并且 Z.ai 尚未公布解决该问题的数字。如果您的应用程序依赖于很长的单代,请在围绕它进行构建之前根据您的实际提供商检查 limit。
原生多模态才是真正的新闻
GLM 系列中之前的所有视觉功能均以单独的模型或单独的路径形式出现。 Z.ai GLM-5V-Turbo和GLM-4.6V作为不同的视觉型号发售。如果您希望 GLM 模型查看屏幕截图,您可以调用与文本流量使用的端点不同的端点。
GLM-5.3-Flash推翻了这一点。图像、视频和文件是携带文本的同一聊天完成请求中的内容块。有一个模型 ID、一个计费行和一个上下文窗口,可同时保存您的图像和周围文本的一百万个标记。
最后一部分是有趣的部分。还接受图像的1M-token上下文窗口意味着您可以将长规格文档和渲染结果的屏幕截图放在同一提示中,并要求模型协调它们。 Z.ai自己的框架依赖于这一点:它描述了观察“界面、渲染结果和交互反馈”的模型,这是一个编码代理用例,而不是照片字幕用例。
如果您正在更广泛地使用视觉模型,我们的指南 GLM-5V-Turbo的API 涵盖了旧的专用视觉方法,并且 GLM-OCR用于文档理解 涵盖专业案例。
架构简介
Z.ai 在新的基础模型上构建GLM-5.3-Flash,而不是训练后的GLM-5.2。两种设计选择对其行为方式很重要:

混合注意力。 该模型将线性注意力与稀疏注意力混合在一起。线性注意力可以廉价地处理局部依赖关系;稀疏的注意力到达了全局相关的标记。所述结果大约比GLM-5.3少三倍的注意力计算,而KV cache大约比4.4小。
流形约束的超连接。 Z.ai在此版本中对其扩展效率工作的术语。目前还没有足够的公开细节来对其进行独立评估,因此请将其视为供应商描述的架构功能,而不是经过验证的优势。
KV cache的减少是具有明显实际后果的部分。KV cache使得长上下文推理在内存中变得昂贵,而通过4.4x缩小它是该模型可以以GLM-5.2十分之一的价格提供服务,同时保持1M窗口的主要原因。
训练使用语料库 Z.ai 大约描述为30万亿多式联运代币。
关于名字
Artificial Analysis测量GLM-5.3-Flash 48.7每秒输出令牌数。就上下文而言,这是同等尺寸的开放式重量模型的较低端。GLM-5.3是较大的兄弟,在相同的测量中以每秒大约86令牌的速度运行。
因此,Flash 模型的速度大约是非 Flash 模型的一半。
它所赢得的是第一个令牌的时间,为1.52秒,而开放权重中位数为2.14秒。如果您的工作负载是许多短暂的交互回合,那么这种响应能力就是真实的。如果您的工作负载生成长文档,您将比在GLM-5.3上等待更长的时间。
该模型提供的效率是 成本和内存,不是挂钟生成速度。更小的KV cache和更低的注意力计算意味着更便宜的每个代币价格和更小的服务占用空间。它们不会转化为更快的流媒体。
这很重要,因为发布后几天发布的大多数报道都重复了供应商框架,而没有检查吞吐量数据,而吞吐量数据始终是公开的。选择此型号是因为它价格便宜并且可以处理图像,而不是因为您希望它能够快速传输。
基准测试
发布时发布的数字 Z.ai,因此将它们视为供应商声明,直到第三方复制它们:

独立图形是Artificial Analysis,将GLM-5.3-Flash置于 57上的Intelligence Indexv4.1.1。GLM-5.3得分60。类似尺寸的开放权重模型的中位数是27,因此57在该类别中是一个很好的结果,尽管它低于其较大的兄弟模型。
Z.ai 该模型在编码和代理工作方面接近 Claude Opus4.8。这是供应商对其内部评估的描述,而不是第三方测量的结果,Intelligence Index与其自己的GLM-5.3之间的三点差距表明有必要进行一些限制。
关于 GLM 基准测试相对于之前版本的发展情况, 我们的GLM-5.2基准细分 解释了每项评估的实际衡量内容。
牛阿尔法周
8月20,一位匿名模特叫 ox-alpha 出现在第三方推理平台上,上下文窗口为1M-token,价格为零。几天之内,它就成为这些平台上最常用的模型之一。社区根据输出特征,在大约48小时内将其指纹识别到智普。

八月26, Z.ai 证实了这一点:Ox Alpha 是GLM-5.3-Flash,免费周是有意的负载测试。
Z.ai 还表示,在那一周,所有流量均在使用基于SGLang的堆栈的中国国内加速器上提供,并声称每个令牌的服务成本与主流 NVIDIA 硬件相当。这是供应商对其自己的基础设施的声明,没有可用的独立验证,因此请相应地权衡。
我们之前已经写过这个模式 Pony Alpha 原来是 DeepSeek 或 GLM 模型。在第三方路由器上的秘密发布正在成为标准的预发布步骤,而有用的结论是,具有可疑圆形上下文窗口的功能异常强大的匿名模型几乎总是某人未发布的旗舰收集评估数据。
如何实际使用它
主持API。 这 Z.ai 端点是OpenAI-compatible。将您现有的client 指向 https://api.z.ai/api/paas/v4/ 并将模型设置为 glm-5.3-flash。我们的 GLM-5.3-FlashAPI指南 逐步完成身份验证、图像输入有效负载和推理工作参数。
第三方提供商。 OpenRouter将其作为 z-ai/glm-5.3-flash。Cloudflare Workers AI、Vercel AI Gateway、DeepInfra、Novita、GMICloud、Baseten和 io.net。经销商之间的价格存在差异,有时差异很大。
编码剂。 Flash 包含在 GLM 编码计划中,据报道其可用配额是GLM-5.3的三倍,这也是订户切换的实际原因。 Z.ai的文档还指出,非高峰通话消耗标准积分的一半。
自托管。 这些砝码已获得MIT许可并在Hugging Face上使用。vLLM、SGLang、TokenSpeed和KTransformers都支持它,并且GGUF量化适用于较小的设备。
你应该使用它吗?
如果您需要在与文本相同的调用中理解图像或视频,如果每个令牌的成本是您正在优化的约束,或者如果您想要开放权重,您可以在许可下自行托管,请使用GLM-5.3-Flash。
如果您需要最后几点推理质量,或者如果生成吞吐量对您来说比价格更重要,请选择GLM-5.3。我们的 两者的并排比较 详细研究该决定,并且 GLM-5.3是什么 涵盖了其本身的基本模型。
无论您选择哪一种,交换都是OpenAI-compatible端点上的单行模型 ID 更改,这使得您可以轻松地针对您自己的工作负载进行测试,而不是信任任何人的基准表。这才是解决问题的正确方法。
正确测试模型交换意味着发送真实请求并检查真实响应,包括在 curl中难以手动滚动的多模式请求。 Apifox 让您可以将这些调用保存为可重用的集合,并附加一个ssertions,因此当您从GLM-5.3移动到 Flash 时,您可以确认响应形状没有改变,而不是在生产中查找。
常问问题
GLM-5.3-Flash是免费的吗? 不再。随着该模型的正式发布,免费的 Ox Alpha 周结束了。 9 月9、2026期间可享受50% 的启动折扣,此后适用标价。
比GLM-5.3快吗? 不会。相对于GLM-5.3的86,它每秒大约生成49个代币。它确实开始响应得更快,在第一个令牌的1.52秒内。
它真的可以处理一百万个上下文标记吗? 配置的窗口是1、048、576令牌,在模型配置中并由Artificial Analysis确认。注意OpenRouter列出了1、310、720的较大数字;将其视为提供商方列表而不是模型规格。
它接受视频吗? Z.ai的文档列出了文本、图像、视频和文件输入。视频支持比图像输入更新且应用范围较小,因此在依赖它之前,请先根据您自己的媒体对其进行验证。
这些砝码有什么许可证? MIT,权重发布于 zai-org/GLM-5.3-Flash 在Hugging Face上。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会