GLM-5.3-Flash是在MIT许可下发布的320-billion-parameter模型。这两个事实朝相反的方向发展:许可证说你可以随心所欲地运行它,而参数计数表明你将需要强大的硬件来完成它。
有趣的是,这些320十亿个参数中的18十亿个每个代币都是活跃的,并且存在量化构建。这种组合使该模型的设置远小于大多数指南假设的8xH200node。
这篇文章诚实地介绍了硬件层,从全精度生产node到工作站上的量化构建,并涵盖了自己运行它时是否有意义。
AI Coding 交流群
如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。
您实际加载的内容
| 财产 | 价值 |
|---|---|
| 总参数 | 320B |
| 每个代币活跃 | 18B |
| 建筑学 | MoE,混合线性和稀疏注意力 |
| 语境 | 1、048、576代币 |
| 执照 | MIT |
| 重量 | zai-org/GLM-5.3-Flash |
| GGUF量化 | unsloth/GLM-5.3-Flash-GGUF |
专家混合设计使这成为可能。所有320B参数都必须驻留在内存中,但只有18B参与任何给定的令牌,因此计算需求远低于总数建议的值。内存是你的绑定约束,而不是 FLOP。
Z.ai 还报告了KV cache大约比GLM-5.3小4.4倍,这对于长上下文工作非常重要。当上下文填满时,KV cache会消耗内存,而在1M-token窗口上,这通常会杀死你。
1级:量产node上的全精度
为了以真正的并发性提供全面的服务,参考配置是 8xH200node (每个141GB,总共约1,128GB)。8xH20node也可以工作。
粗略数字:仅权重需要在700到800GB区域内的某个位置,具体取决于精度,并且您需要 headroom 位于顶部以实现KV cache和运行时开销。像这样的node的租用云容量每天约为 $24到 $48。
vLLM
vLLM是常见的默认设置,拥有最广泛的生态系统支持。张量并行大小应该是 2 的幂:
vllm serve zai-org/GLM-5.3-Flash \
--tensor-parallel-size 8 \
--max-model-len 1048576 \
--trust-remote-code
从较小的开始 --max-model-len 当您验证设置时。立即请求完整的百万令牌窗口意味着为其分配KV cache,并且那里的故障看起来像是内存不足错误而不是配置问题。
SGLang
SGLang对此模型提供零日支持,并发布了H100、H200、B200、B300、GB200和GB300的配方,包括多模式服务。 Z.ai 使用基于SGLang的堆栈进行其自己的预启动服务。
python -m sglang.launch_server \
--model-path zai-org/GLM-5.3-Flash \
--tp 8 \
--context-length 1048576
SGLang往往在结构化输出和高并发代理工作负载上获胜。如果您提供的是编码代理而不是聊天界面,那么值得针对vLLM进行基准测试而不是默认。
如果您希望函数调用正常工作,这两个堆栈都需要配置一个工具调用解析器。检查每个项目文档中的当前标志,因为解析器名称在版本之间会发生变化。
Tier2:在较小的硬件上进行量化
这是大多数覆盖范围都会跳过的一层,但对于没有数据中心的任何人来说,这一层都很重要。
量化GGUF版本发布于 unsloth/GLM-5.3-Flash-GGUF,直至激进的1-bit和2-bit格式,例如IQ1_S和IQ2_XXS。320B模型的2-bit量化使权重达到高内存工作站或多 GPU 消费设备可以容纳的范围,特别是在 CPU 卸载的情况下。
两个诚实的警告:
激进的量化会降低质量。 IQ1_S距离完全精确还有很长的路要走。在320BMoE上,退化通常比应用于密集模型的相同处理更温和,因为会丢失更多冗余,但“运行”和“运行良好”是不同的说法。在做出任何结论之前,先在自己的任务中进行测试。
Unsloth 对该模型的文档标记为正在进行中。 定量可用性和推荐设置仍在变化。在规划围绕特定格式的构建之前检查实际发布的内容。
对于 CPU 密集型和混合设置, KTransformers 正是针对这种情况而设计的,将MoE专家保留在系统 RAM 中,并仅将需要的内容移至 GPU 上。在具有18B主动参数的MoE模型上,该架构非常适合。 TokenSpeed 也列在受支持的运行时中。
我们的指南 本地运行GLM-4.7-Flash 涵盖此工作流程的较小模型版本,以及 免费本地运行GLM-5 涵盖一般本地 GLM 设置。
计算出你的内存预算
两个数字决定配置是否合适。
重量。 BF16中每个参数大约为2字节,320B参数在开销之前约为640GB。FP8大约是这个数字的一半。4-bit量化使其接近160GB,而激进的2-bit格式仍然会降低质量,但会付出实际的质量代价。
KV cache。 这随着上下文长度和并发性而扩展,这让人们感到惊讶。在8K上下文中加载良好的配置可能会在128K中失败,因为缓存增长了,而不是权重增长了。 Z.ai报告的4.4x相对于GLM-5.3的减少在这里有很大帮助,但在代币中缩放仍然是线性的。
实际意义是根据实际上下文长度调整大小,而不是模型宣传的最大长度。很少有应用程序需要完整的一百万个令牌,并且为您从未使用过的窗口进行配置是使该模型看起来难以承受的最常见方法。
如果您正在关注这个家庭之前的公开举重故事, 我们的GLM-5.3自托管帖子 是在下降之前写的。 Flash 的权重现在已落在MIT下,因此此处的指导将取代它。
微调
MIT许可证可对mit进行微调和重新分配,这在这个能力级别上是不寻常的,也是您自己持有权重的最有力的理由。
对成本要现实一些。对于大多数团队来说,对320B模型进行全面微调是遥不可及的。像LoRA这样的参数高效方法是实用的路径,在专家混合模型上,还有一个额外的设计问题:是否适应路由器、专家或注意力层。这是一个活跃的领域,与密集模型相比,其指导性较差。
如果您的目标是领域适应而不是新功能,请首先针对基本模型测试提示和检索。在具有1M-token上下文窗口的模型上,将领域知识放入提示中通常比训练它更便宜、更好。
采样设置
Z.ai 按任务发布不同的建议:
| 使用案例 | 温度 | 顶部_p |
|---|---|---|
| 一般的 | 1.0 | 0.95 |
| 编码 | 0.95 | 1.0 |
该模型还支持三种推理模式 reasoning_effort,有值 low, high, 和 max. 最大是默认值。 在本地硬件上,这比在API上更重要,因为推理代币是您在挂钟时间而不是金钱上支付的。如果你的装备生成缓慢, low 就是能用和不能用的区别。
自托管具有经济意义吗?
通常不会,API价格就是原因。
按标价计算,GLM-5.3-Flash每百万输入代币的成本为0.15美元。每月大约 $1,000租用的8xH200node可以为您购买大约6.7十亿个APIusage的输入代币。持续将交易量维持在该水平以上是一项大型操作。
无论是饱和还是闲置,node的费用都是相同的,而API仅按您使用的量计费。除非您的全天候利用率确实很高,否则固定成本就会损失。
因此,自托管的原因不是成本:
- 数据驻留和隐私。 没有任何东西会离开您的基础设施。
- 没有评分 limits。 你的能力就是你的能力。
- 可用性保证。 不依赖于供应商的正常运行时间或定价决策。
- MIT许可证。 您可以修改、微调和重新分发。这对于这个能力级别的模型来说是不寻常的,也是列表中最有力的论据。
- 您已经拥有的硬件。 如果GPU被购买并闲置,边际成本就是电力,整个计算就会反转。
我们的定价细目 更详细地了解此比较的API方面。
验证您的部署
vLLM和SGLang都公开OpenAI-compatible端点,因此相同的请求形状适用于您的本地服务器和 Z.ai:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "zai-org/GLM-5.3-Flash",
"messages": [{"role": "user", "content": "reply with OK"}]
}'
除了烟雾检查之外,还值得测试:您实际需要的长度的长上下文行为、图像输入(如果您提供多模式服务)、使用真实模式的工具调用以及并发而不是单请求延迟下的吞吐量。
这是保存的测试集合得以保留的地方。观点 Apifox 在您的本地服务器和 Z.ai 以基本URL作为环境变量的端点,针对每个端点运行相同的套件,然后进行比较。您将很快发现您的量化构建是否仍然处理您的应用程序所依赖的工具模式,这是人们在生产中发现的故障模式。
常问问题
最低硬件是什么? 对于全精度,8xH200-classnode。对于量化的GGUF构建,尽管质量会随着量化级别的增加而下降,但要少得多。
我需要内存中的所有320B参数吗? 是的。每个令牌只有18B处于活动状态,但完整的集合必须是常驻的。内存是限制;计算不是。
vLLM还是SGLang哪个更好? SGLang通过已发布的多模式配方提供零日支持,并且经常在并发性和结构化输出方面获胜。vLLM拥有更广泛的生态系统支持。对您的工作量进行基准测试。
我可以在单个 GPU 上运行它吗? 不完全精确。通过KTransformers进行积极的量化和 CPU 卸载,高内存单 GPU 系统加上大量系统 RAM 是可行的。预计生成缓慢。
许可证真的是MIT吗? 是的。权重以MIT形式发布,可供mit商业使用、修改和重新分发。
开发必备:API 全流程管理神器 Apifox
介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。
如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用。

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案。
获取专属报价与部署方案
详细的私有化部署系统架构与安全白皮书
针对您公司规模的专属报价单
免费的 1v1 专属产品演示 (Demo) 机会