GLM-5.3 开源权重发布:后训练驱动,编码与网络安全双线突破

8 月 28 日,智谱 AI 在 Hugging Face 上开放了 GLM-5.3 的模型权重。这款 8 月 14 日首次发布的模型,所有能力提升都来自后训练阶段,底座模型与 GLM-5.2 完全相同。开放权重后,社区可以通过 SGLang、vLLM、Transformers 等框架在本地部署。

底座没变,后训练拉满

GLM-5.3 和 GLM-5.2 共享同一个底座。智谱 AI 的做法是持续扩大后训练的规模和复杂度:更多的任务环境、更丰富多样的任务类型、更多的训练算力。他们把这套后训练技术栈叫做 slime,结合 Megatron 做训练、SGLang 做推理,让数学、代码、沙箱、验证器和长时间任务环境都能作为数据生成环节接入。

从 5.2 到 5.3,三个方向被扩展了。一是把任务从编程练习推向更接近真实工程师工作量的场景,有些任务相当于一个有经验工程师几天的工作量。二是在训练中引入了漏洞发现数据,结果网络安全能力增长得比预期快得多。三是保持了 SAO(带压缩的长上下文强化学习)策略,让模型在长时间任务上的增益不只是短任务。

编程:开源新标杆

GLM-5.3 在多项编程基准测试中拿到了开源最好成绩:

智谱 AI 的内部基准 Z.ai Code Bench 在 Max 难度下,GLM-5.3 用大约 75K 输出 token 达到 34.5% 完成率,而 GLM-5.2 在 96K token 下只有 23.4%。Claude Opus 4.8 在 120K token 下是 29.5%,Claude Fable 5 达到 39.5%。Token 效率的提升说明后训练不仅拉高了上限,也让推理更高效。

网络安全:从漏洞识别到完整利用链

最让人意外的进展出现在网络安全领域。智谱 AI 在后训练中加入了漏洞发现数据和环境,本意是让模型更好地识别和分析漏洞。但随着训练规模扩大,模型开始展现出超出预期的能力:它不只是能发现孤立的漏洞,而是能跨多个阶段推理,形成完整的利用链。

三个网络安全基准的表现:

这个模式很有意思:越接近真实攻击链的基准测试,GLM-5.3 相对 GLM-5.2 的提升越大,但与闭源前沿模型的差距也越大。能力增长最快的地方恰恰也是差距最大的地方。

在实际漏洞挖掘中,GLM-5.3 在 269 个开源项目中发现了 2,436 个漏洞,其中 1,097 个是中高危漏洞。最老的一个漏洞可以追溯到 1981 年,平均每个漏洞潜伏了 26.6 年。

部署方式和定价

开放权重后,GLM-5.3 可以通过 SGLang、vLLM、Transformers、KTransformers、Unsloth 等框架本地部署。智谱 AI 还提供了 TokenSpeed 和官方 Cookbook 作为参考。

通过 API 调用的话,OpenRouter 上的定价是输入 $1.40/百万 token、输出 $4.40/百万 token,支持 130 万 token 上下文窗口。模型有三个推理力度等级:low(轻量)、high(增强)、max(深度),编程任务推荐用 high。

总结

GLM-5.3 证明了一件事:在底座模型不变的情况下,后训练的规模扩展仍然有很大的提升空间。编程能力 50% 的提升、网络安全能力的意外爆发、Token 效率的显著改善,这些都来自同一个技术方向。开源权重的发布意味着社区可以直接使用和微调这个模型,对开源生态是个好消息。