OrcaRouter 发布了 GLM-5.3-Flash 的去审查权重

未审查 GLM-5.3-Flash 如何降低对合法开发工作的过度拒答,并介绍评估、部署和审计方法。

用 Apifox,节省研发团队的每一分钟

OrcaRouter 发布了 GLM-5.3-Flash 的去审查权重

免费使用 Apifox

相关推荐

最新文章

API

一体化协作平台

API 设计

API 文档

API 调试

自动化测试

API Mock

API Hub

立即体验 Apifox
目录

速览:OrcaRouter 发布了 GLM-5.3-Flash 的去审查权重。这是一个拥有 320B 参数、18B 激活参数的混合专家模型,分两次发布:2026 年 8 月 29 日推出原生 block-FP8 版本,8 月 31 日推出面向 NVIDIA GPU 的 NVFP4 构建版本。现在也已有 GGUF 和 MLX 转换版本。厂商报告的拒答率大幅下降,例如 MaliciousInstruct 从 96% 降至 11%,但并没有降到零。最值得关注的并不是“去审查”本身,而是 OrcaRouter 的说法:GLM-5.3-Flash 的部分对齐机制并非由单一线性拒答方向介导,这意味着 Z.ai 的安全训练在结构上可能比这类技术通常针对的模型更深。

对齐消融(abliteration)如今已经很常见。有人拿到一个开放权重模型,找出与拒答相关的内部方向,将其移除,然后上传修改后的版本。大多数发布并不出彩,相关报道也往往不是过度吹捧,就是一味斥责。

AI Coding 交流群

如果你也在用 AI 写代码,或者正在研究 Cursor、Claude Code 这些工具,欢迎加入以下交流群。群里平时会聊一些 AI 编程的实际用法、开发工作流,还有各种新工具和新玩法。

但这次发布值得仔细阅读,原因与模型现在会说什么无关。发布说明包含了一项关于前沿开放权重模型内部如何表示对齐的负面结果。在可解释性研究中,负面结果比又一个未审查检查点更少见,也更有价值。

实际发布了什么

两次相隔两天的公告,之后又悄然推出了几种格式。

OrcaRouter 发布了原始 block-FP8 精度的 GLM-5.3-Flash 未审查权重,也就是说,从基础模型到修改后模型之间没有重新量化步骤。320B 参数、18B 激活参数,与基础模型的架构一致;我们曾在GLM-5.3-Flash 是什么和它与 GLM-5.3 的比较中介绍过。该帖子后来浏览量已超过 200 万。

2026 年 8 月 31 日:NVFP4。第二个构建版本面向 NVIDIA 的 4-bit 浮点格式,主打更小的占用和更快的推理。浏览量约 75,000,说明相比首次发布,格式版本吸引的是更窄的受众。

之后:GGUF 和 MLX。两次公告都表示还会推出其他量化格式。我们在 2026 年 9 月 1 日查看 Hugging Face 组织时,GLM-5.3-Flash-Uncensored-GGUFGLM-5.3-Flash-Uncensored-MLX 都已经存在,因此 llama.cpp 和 Apple Silicon 路径均已落地。当时这两个版本的下载量仍为零,NVFP4 版本为 5,而原始 FP8 版本为 1,541。当前关注点仍在公告上,还没有转移到具体制品。

从背景来看,这是一条产品线,而不是一次性的发布。同一组织还托管 Qwen3.8-27B 的对齐消融版本,仅其 FP8 版本就获得了超过 300,000 次下载;此外还有 Qwen3.8-Flash-Next 和 Gemma-4-26B。GLM 版本是现有目录中的最新成员。

这些权重采用 MIT 许可证,并将 zai-org/GLM-5.3-Flash 列为基础模型。模型卡片将其标记为 abliterated、vision-language、MoE,并支持 function-calling,因此基础模型的多模态和工具调用能力也随之保留。

“无需 LoRA、无需越狱提示词”是什么意思

公告中的这句话确实有具体含义,值得展开说明,因为它与大多数人想到的两种做法不同。

越狱提示词是在推理时操纵模型。安全训练仍然存在,只是通过对话绕开它。这种做法很脆弱,容易被修补,而且每次请求都会占用上下文。

LoRA adapter 是一组在加载时叠加的小型额外权重。基础模型没有改变,adapter 可以移除;它是附加到模型上的修改。

对齐消融会找出对应拒答行为的内部激活方向,并直接从权重中编辑掉。没有需要附加的东西,也没有需要剥离的东西。拒答行为从制品本身消失了,而不是在运行时被压制。

这一点在实践中很重要。你不能通过检查 adapter 或扫描提示词来审计经过对齐消融的模型,因为变化发生在权重中。如果你在任何重视来源追踪的环境中运行开放模型,就必须将基础模型谱系与实际检查点进行比对,这已经是一个真正的供应链问题。关于如何限制模型可以执行的操作,可参考我们的AI Agent 防护措施。

拒答数据

以下是 OrcaRouter 自行报告的修改前后数据,写作时还没有独立复现。请将其视为厂商报告。

基准测试 基础模型拒答率 对齐消融后
MaliciousInstruct 96% 11%
JailbreakBench 93% 12%
AdvBench 97% 15%
HarmBench 93% 18%
XSTest benign over-refusal 2.4% 0.4%

最后一行应该与前四行区别看待。XSTest 测量的是过度拒答,即模型因为表面上匹配到风险模式,而拒绝无害请求。这才是开发者在生产环境中真正会遇到的故障模式:仅仅因为出现了“password”一词,模型就拒绝帮助调试登录流程;或者因为要为自有基础设施编写网络扫描器,就拒绝提供代码。从 2.4% 降至 0.4% 的变化才具有日常工作的实际价值,但几乎没有人引用这一行。

前四行数据让它成为研究制品,而不是生产力工具;也正因为如此,许可证和你所在地的法律都比平时更重要。

你真正获得了什么

大多数关于对齐消融模型的报道都在争论它们是否应该存在,却没有回答为什么一个在工作的工程师会选择它。实际有四个优势,而且并不是标题里的那些数字暗示的优势。

它不再拒绝原本无害的工作。这是最重要的一点,也就是 XSTest 那一行:无害请求的过度拒答从 2.4% 降至 0.4%。过度拒答是每个开发者在经过安全调优的模型上都要付出的成本。模型因为看到“password”一词,就不愿帮助你调试密码重置流程;因为你拥有相关基础设施,就不愿编写端口扫描器;因为威胁报告描述了威胁,就拒绝为你总结。它们都不是安全收益,而是模型无法区分主题和意图;你只能通过反复重试、改写提示词和放弃任务来承担代价。把这个比例降低六倍,是最可能在你这一周的工作中体现出来的优势。

每次请求没有额外成本,也没有容易失效的东西。现在人们实际使用的替代方式,是围绕拒答做提示词工程。每次调用都会消耗上下文,结果不一致,而且提供商一旦修补就会失效。权重级修改没有这些特性。该行为成为制品本身的属性,因此在不同请求之间稳定,也不会在某个周二被悄悄改变。

开放权重意味着部署由你掌控。它采用 MIT 许可证,可以自行托管,也可以固定到精确的检查点。你的提示词和文档留在自己的基础设施内,无需经过供应商。你也不会因为提供商在季度中途收紧过滤器而导致已经上线的工作流失效。对于受监管环境而言,这种控制往往正是重点;未修改的权重同样适用这一理由,这也是我们撰写自托管 GLM-5.3 开放权重的原因。

能力面仍然存在。模型卡片仍列出 vision-language 和 function calling,因此这不是一个只有文本、被削弱的构建版本。基础模型的多模态和工具使用路径都保留下来;如果你计划将它用于 agent 场景而不是聊天,这一点很重要。

现在也要诚实地说明边界。这些优势都不是能力提升。对齐消融是行为编辑,已发表的相关工作通常发现它会付出一定的质量成本,而两次公告都没有报告推理、编码或视觉性能是否发生变化。你用可测量的拒答下降,换取了尚未测量的性能退化风险。基础模型原本做出的每个过滤决定,现在都由你负责,这不是省下来的成本,而是真实的人员配置和监控成本。

真正有意思的部分

公告末尾隐藏着一个值得阅读的发现。

拒答并没有统一降到零。在四个危害基准测试中,最终结果落在 11% 到 18% 之间,而不是 0% 到 2%。OrcaRouter 的解释是,GLM-5.3-Flash 的部分对齐机制并非由单一线性拒答方向介导,Z.ai 可能构建了比这项技术通常遇到的机制深得多的拒答机制。

这是一个关于模型内部结构的判断,如果能够成立,其意义比这次发布本身更大。

对齐消融的常见心智模型是:拒答主要位于激活空间中的一个方向。找到它、移除它,行为就会崩溃。它已经在足够多的模型上表现良好,以至于人们把它当成定论。但如果对某个模型执行该过程后,拒答率从 96% 降到 11% 就停住了,这说明至少对这个模型而言,心智模型并不完整,也说明部分对齐以该技术无法触及的形式存续。

这里有两个诚实的限定。第一,这是一个实验室对自身结果的解释,另一种解释仅仅是其实现没有发挥出全部效果。第二,剩余 11% 到 18% 的拒答率不应被任何人当作安全属性。拒绝 15% 有害请求的模型不是安全模型,而是不可靠的模型。

尽管如此,“我们的技术遇到了瓶颈,并认为原因在于架构”是实验室通常不会在发布文章中主动写出的内容。OrcaRouter 将这次发布描述为研究对齐如何被表示的制品,而不只是一次能力发布,这是更好的研究发表方式。

值得核验的说法

相关讨论中有两件事值得保持怀疑,这并不是对该发布的否定。

“Claude Opus 4.8 级别的智能。”后续帖子将该发布描述为让防御者拥有这一水平的智能。但这项说法没有任何基准测试支撑,而且比较对象并不是当前的 Opus 一代。把它当作营销表述。如果能力是否对等关系到你的使用场景,请自行评估。

把拒答率当作能力代理指标。低拒答不等于高能力。对齐消融是行为编辑,已发表的相关工作通常发现一般性能会因此有所退化。两次公告都没有说明相对于基础模型,推理、编码或视觉性能是否发生变化,而这才是大多数读者真正想知道的数字。关于未修改模型的基准测试和价格,可参考 GLM-5.3-Flash 价格和GLM-5.3-Flash API 指南。

运行方式与硬件现实

即使只有 18B 激活参数,320B 参数也不是适合笔记本的模型。现在可用的格式决定了谁能够实际运行它:

  • Block-FP8 是原始发布版本,面向数据中心 GPU,也是参考制品。
  • NVFP4 在 NVIDIA 硬件上用精度换取占用空间,是单节点部署的实用路径。
  • GGUF 打通了 llama.cpp 路径,量化可以激进到足以在高端工作站上运行。
  • MLX 面向 Apple Silicon;对于这么大的模型,这意味着需要非常大的统一内存配置。

如果你不是调用托管接口,而是自行托管,我们关于基础模型的教程可以直接参考:在本地运行 GLM-5.3-Flash和自托管 GLM-5.3 开放权重。如果想了解这一类别的更多背景,我们还维护了未审查 LLM 调查和无限制 LLM 介绍;DeepSeek R1 对齐消融版本是最接近的此前案例。

评估它其实是 API 测试问题

下面是实践部分,也是大多数报道完全跳过的部分。

如果你是在进行合法工作,例如安全研究、红蓝队演练,或评估自有过滤器能捕获什么,那么真正的工作就是针对一个接口运行大规模、可重复的请求套件,并对返回结果做断言。这就是 API 测试。响应体中包含模型输出,并不会让它变成一种全新的学科。

你会遇到的具体问题包括:

  • 需要对多个目标运行同一套测试。FP8、NVFP4、GGUF、未修改基础模型和托管接口之间都要比较。相同的请求、不同的前置 URL,才能对结果进行比较;否则就无法判断行为变化来自量化,还是来自采样。
  • 需要断言,而不是靠肉眼查看。拒答率是数百个提示词上的百分比。阅读对话记录无法扩展,也无法复现。
  • 需要下个月再次运行。权重会更新,量化版本会重新发布,一次测得的数字之后不一定还能引用。回归运行才是全部意义。
  • 非确定性是最难的部分。同一个提示词可能得到不同的补全。断言必须检查响应分类,而不是字符串相等;测试套件还需要足够多的样本,比例才有意义。我们在测试非确定性 AI Agent中直接讨论过这个问题。
  • 工具调用需要单独检查。模型卡片列出了 function calling。一个本应拒绝的调用却会调用工具的对齐消融模型,与只生成文本的模型有不同的风险面。这首先是 schema 和契约问题,其次才是安全问题。

这正是 API 平台的用途。在 Apifox 中,你可以定义一次接口,将提示词套件保存为集合,对响应字段做断言,通过环境变量在不同供应商或量化版本之间切换前置 URL,并在 CI 中运行整套测试,让数字可复现而不是停留在轶闻层面。我们曾在使用 Apifox 测试 GLM-5.3-Flash API中针对未修改模型介绍具体操作;同样的配置也适用于任何 OpenAI-compatible 接口。

这一通用原则远不止适用于该模型:一旦模型行为成为需要测量和防护的对象,你就需要像对待其他 API 契约一样严谨。相关内容:生产环境 AI Agent 可靠性。

红队工作需要审计轨迹,而不是终端

第二个实际问题在组织层面,而且对于这类工作不可或缺。

对未审查模型运行有害提示词基准测试,正是需要事前获批、事后可追溯的活动。谁运行的?针对哪个检查点?谁签字批准的?范围是什么?如果这些记录只存在于某位研究人员的 shell history 中,你拥有的不是研究项目,而是一项责任风险。

HiFox 面向需要在会话结束后仍能留存记录的工作,而这个用例与它尤其契合:

  • Backlog 中的任务不会启动运行。敏感评估要在执行前完成准备、限定范围并获得批准。这个门槛是这里最有价值的属性。
  • 任务才是记录,而不是提示词。进度、工具调用和结果会回流到任务中,Agent 的输出则作为可回复的评论保存。六个月后,你仍能知道运行了什么以及为什么运行。
  • Crew 是一个 leader Agent 加上其他 Agent 和人员,并以 leader-first 的方式运行。红队工作让审阅者参与其中是常态,不是例外。
  • 执行环境由你提供。你可以连接 Computer,也就是笔记本电脑、服务器或容器,HiFox 使用其中已安装的 Runtime。对于 320B 模型,这一点很具体:权重位于某一台特定 GPU 机器上,明确敏感评估在哪台机器运行是一种控制措施,而不是额外负担。
  • 采用团队已经熟悉的结构:空间、项目、迭代和任务,并支持 Jira 同步。

未审查模型是一种研究工具。没有记录地使用研究工具,正是组织最终无法解释发生了什么的原因。

法律与安全现实

这点很简短,但值得直说。

权重采用 MIT 许可证,许可证约束的是权重本身。它不会允许你利用输出去做违法之事,也不会把责任从你身上转移出去。当地法律、雇主政策以及你所使用的平台条款仍然适用,它们不会因为模型没有拒绝就例外。

合理用途正是发布方列出的那些:安全研究、可解释性工作、红蓝队演练和拒答机制研究。对于真正的问题是模型不愿协助日常安全工程的团队,XSTest 过度拒答的改善也是合理的日常使用理由。

如果你将任何模型部署给终端用户,未审查检查点会把全部过滤责任转移到自己的技术栈中。这是一个涉及人员和监控的设计决策,而不是一个配置开关。

FAQ

GLM-5.3-Flash-Uncensored 与 GLM-5.3-Flash 是同一个模型吗?它们具有相同的架构和基础权重,都是 320B 参数、18B 激活参数;区别是后者的拒答行为经过了编辑。基础模型介绍见GLM-5.3-Flash 是什么。

评估数据经过独立验证了吗?没有。公告中的所有数字都是 OrcaRouter 自行报告的结果,文章写作时没有第三方复现。列出的基准测试真实且公开,如果具备硬件条件就可以复现。

应该使用哪种格式?FP8 是参考制品,也是运行评估时使用的版本。NVFP4 是实用的单节点 NVIDIA 路径。GGUF 和 MLX 现在已经存在,适合工作站和 Apple Silicon 配置。预计量化会改变行为,这正是需要可重复测试套件而不是凭感觉判断的原因。

对齐消融会损害一般性能吗?相关已发表工作通常发现会有一定退化,而两次公告都没有说明该模型的情况。如果能力对你很重要,请对比基础模型自行测试,不要默认两者相同。

为什么拒答率停留在 11% 到 18%,而不是零?这是发布中最开放、也最有意思的问题。OrcaRouter 的说法是,部分对齐并不是由单一线性拒答方向承载;另一种解释是实现不完整。无论如何,都不要把剩余拒答率当成安全特性。

可以商用吗?权重采用 MIT 许可证,许可条件较为宽松。但这只是许可证层面的回答,不是针对你具体部署的法律或政策结论。尤其当输出会触达终端用户时,应咨询法务团队。

总结

三天内发布了两种格式,首个版本获得 200 万浏览量,背后还有一整套对齐消融模型目录。到现在,去除审查本身已经很常见。

真正值得保留的是这项负面结果。一项能够稳定压低多数开放模型拒答率的技术,让 GLM-5.3-Flash 从 96% 降到 11% 后停住;完成这项工作的实验室公开说明了这一点,而不是把数字四舍五入。如果独立复现能够验证它,就说明 Z.ai 训练该模型的方式确实有值得研究之处,这比检查点本身更有贡献。

如果你要使用它,请把枯燥但必要的部分做好。用可重复的请求套件测量行为,让它能指向任意接口并在下个月再次运行;这正是 Apifox的用途。记录谁针对哪些权重运行了什么、谁批准了运行;这正是 HiFox 的用途。

未审查模型不会让你免除了解自己运行了什么的义务,反而会提高这项义务。

开发必备:API 全流程管理神器 Apifox

介绍完上文的内容,我想额外介绍一个对开发者同样重要的效率工具 —— Apifox。作为一个集 API 文档、调试、设计、测试、Mock、自动化测试于一体的工具,Apifox 是目前提升研发效率的首选。

如果你正在开发项目,不妨试试其极其友好的界面设计,它完全兼容 Postman 和 Swagger 数据格式,导入数据非常方便,,即使是新手也能很快上手,点击这里即可注册使用

Apifox

值得一提的是,除了个人和常规团队使用,针对有高安全合规要求、或需要在内网环境协作的企业,Apifox 还提供了深度定制的私有化部署方案

获取专属报价与部署方案

icon 详细的私有化部署系统架构与安全白皮书
icon 针对您公司规模的专属报价单
icon 免费的 1v1 专属产品演示 (Demo) 机会
获取部署方案
* 提交后,我们的客户经理将在 1 个工作日内与您联系
林俊锋 企业微信
@Apifox 专属顾问
扫码备注: 私有化 + 公司名