# GLM-5.3 暂停两周后开源：权重一旦放出，就再也收不回了

**Summary:** Z.ai 在发现 GLM-5.3 的网络攻击能力增长超出预期后，将其权重扣留了两周。我认为这次暂停很有必要，但开源发布意味着后续的安全责任落在了每个部署者身上。

- Canonical: https://markhuang.ai/zh/news/glm-5-3-open-weights-safety-hold
- Language: zh-CN
- Author: [Mark Huang](https://markhuang.ai/about)
- Published: 2026-08-28
- Section: News
- Tags: GLM-5.3, 开源权重, AI 安全
- Source: [Z.ai on X](https://twitter.com/Zai_org/status/2093354097122455713)
- License: https://creativecommons.org/licenses/by-nc/4.0/

---

![一个打开的安全隔离舱，正将一枚紧凑的模型核心释放向防御盾牌和暴露的软件通道](https://cdn.markhuang.ai/news/glm-5-3-open-weights-safety-hold/hero.webp)

*安全暂停可以在发布前审查模型，但副本一旦扩散，权重就再也收不回来了。*

[Z.ai 于 2026 年 8 月 28 日宣布](https://twitter.com/Zai_org/status/2093354097122455713)，GLM-5.3 正式开放权重，可以下载、运行和定制。两周前公司首次推出这个模型时，坦言其网络攻防能力增长超出预期，随后便用这两周做安全评估和加固。

暂停两周值得做，但今天的发布确实让安全问题更难处理了。API 提供商可以监控流量、改访问规则、在端点后面打补丁——可一旦权重可以下载，这些决策就分散到了每一个跑副本的公司、研究者和个人手里。

## 暂停是检查点，不是控制手段

Z.ai 的[发布报告](https://z.ai/blog/glm-5.3)说，GLM-5.3 用的是和 GLM-5.2 一样的基础模型，性能提升来自后训练。按公司自己的测试，CyberGym 分数从 77.2% 涨到 84.5%，ExploitBench 覆盖率从 24.4% 涨到 54.4%。这些是 Z.ai 报的数字，不是独立复现的结果，但能看出他们为什么暂停发布权重。

暂停说明实验室对能力结果有反应，不是把发布日期钉死不动。但我翻不到一份发布说明，讲清楚加固到底改了什么。现在[Hugging Face 模型卡](https://huggingface.co/zai-org/GLM-5.3)上只重复了基准分数和部署说明，没说加固前后的安全对比、权重层的缓解措施，也没说这两周过了什么新的评估门槛。

这不等于说什么都没改。问题是外面的人没法判断这两周到底换来了什么。一个靠"权重可被检查和修改"立足的模型，它的安全工作也该经得起同样的检查。

> **Info:**
>
> Z.ai 报告称，CyberGym 在单次 Pass\@1 运行中覆盖了 1,507 项任务，每项任务没有总超时限制。ExploitBench 覆盖 41 项任务，分三个版本跑。这些细节有助于理解分数，但单靠这两个基准都没法预测模型在真实世界里的滥用风险。

## 开放权重帮的是真正守代码的人

开放的理由很实在。安全团队可以拿模型跑那些不能发给外部 API 的代码。开源维护者能看它怎么表现、怎么接进自己的工具链、不依赖 Z.ai 的服务就能复现结果。Z.ai 说他们的 GLM 工作已经在专家审查、筛选和去重之后，在 269 个项目里找到了 2,436 个漏洞。

同样的能力显然也能反过来用。[Axios 报道](https://www.axios.com/2026/08/14/china-open-source-ai-glm-53)，Z.ai 自己承认权重一公开，修改和用途就管不住了。这个模型在 ExploitBench 上拿了 54.4%，比 GLM-5.2 翻了一倍多，虽然还低于 Z.ai 测试的闭源模型。更强的漏洞挖掘能力可以帮维护者抢先找到缺陷，也能让攻击者利用已知目标的成本更低。

我想不到有什么干净的办法能只留一种用途、掐掉另一种。我更关心的是：模型下载之后，跟着它一起走的证据、默认配置和应急响应机制到底是什么。

## 许可证画的线，比想象中远得多

GLM-5.3 没用某些早期 GLM 版本上的 MIT 许可证。它的[专属许可证](https://huggingface.co/zai-org/GLM-5.3/blob/main/LICENSE)给了很大的权限——使用、修改、部署、微调、分发都行。但有个不寻常的条款：如果你运营模型即服务，公司加关联方在任何连续 12 个月里总收入超过 100 亿美元，商业使用前就得通过 Z.ai 的安全审查。

低于这条线的，许可证基本只要求保留版权声明、遵守适用法律。100 亿美元能罩住最大的几家商业托管商，但算不上通用的安全门槛。小一点的提供商照样可以通过 API 放出定制模型，本地部署更是可能完全没有提供方管控。

我不会把许可证当成这个产品的安全层。它就是一份授权文件，带了一个很窄的审查触发条件。真正管用的控制得落在部署指南、安全工具、模型文档，以及维护者怎么协调漏洞披露上。

## 7530 亿参数，开放不等于轻量

Hugging Face 把 GLM-5.3 标为 7530 亿参数模型，列出了 vLLM、SGLang、Transformers、KTransformers、Unsloth 这些推理框架的支持。这是开放访问，但本地跑起来没那么轻松。[LocalLLaMA 发布前的讨论](https://www.reddit.com/r/LocalLLaMA/comments/1vzjlxd/glm53_weights_will_be_released_tomorrow/)里，大家最关心的还是硬件和内存。

这个限制会把很多开发者推向量化版本和托管端点。但这不等于开放权重没价值，只是影响的路径变了。真正重要的下游玩家可能是推理托管商、工具厂商、安全团队，还有那些把巨大 checkpoint 变成更容易跑的东西的社区项目。

每个版本和工具链都得自己测，因为原始模型卡没法覆盖所有组合。编码工具链可能给模型 shell 权限，安全产品可能把它连到私有仓库，部署者得有自己的评估和隔离方案。[Claude 的网络评估事件](https://markhuang.ai/news/claude-cyber-eval-test-harness-risk)就是个教训：一个能力强的模型加上错误的网络边界，测试就可能变成真实的安全事件。

## 下载之后我会盯什么

我会盯三件事：两周加固到底做了什么有没有公开说明、网络基准有没有人独立重跑、部署方案有没有把能力跟网络隔离和审计日志绑在一起。我也会盯 Z.ai 的漏洞披露流程——大规模找漏洞没用，维护者拿到足够的时间和能用的证据才能修。

GLM-5.3 开放权重，对需要本地控制和硬核编码能力的团队来说是好事。但这也是一个 Z.ai 自己都说"网络能力超出预期"的模型，权重放出去就收不回来了。暂停两周说明他们有判断力。现在我想看的是，这个生态能不能让模型更容易被审查，而不是让高风险部署变成默认选项。
