架构基座与后训练技术栈
智谱 AI(Zhipu AI / Z.ai)正式发布新一代旗舰大模型 GLM-5.3。该模型在架构上完全沿用前代 743B 参数基座,全部性能跃升均来自 后训练强化学习的大规模扩展。
在底层技术栈方面,GLM-5.3 依托长上下文处理技术 IndexShare、面向长程任务的强化学习算法 SAO,以及开源大规模异步分布式训练框架 Slime,在数万个异构交互环境中并行采集训练信号,实现了长时序推理能力的质变。
编码与网络安全基准横向表现
根据官方公布的评测数据,GLM-5.3 在长程终端交互、软件工程修复与漏洞挖掘领域均展现出显著的技术突破。特别是在网络安全测试中,模型自发涌现出多步侦察与漏洞利用链推导能力。
核心基准测试表现
-
28.3
Terminal Bench 3.0 得分,相比前代 4.6 实现显著跃升。
-
84.5%
CyberGym 真实漏洞挖掘基准准确率,处于当前评测榜首。
-
66.9
DeepSWE v1.1 软件工程基准得分,相比前代 46.2 明显提高。
在官方披露的跨模型横向对比中,GLM-5.3 在编程、网络安全与智能体三大维度的 16 项评测基准上实现了全方位提升,展现出 开源模型领先的综合工程能力:
| 评测分类与基准 | GLM-5.3 | GLM-5.2 | Kimi K3 | DeepSeek-V4 Pro-0813 | Qwen3.8-Max | Opus 4.8 | Fable 5 (w/ fallback) | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 88.2 | 81.0 | 88.3 | 87.9 | 86.6 | 85.0 | 88.0 | 88.8 |
| Terminal Bench 3.0 | 28.3 | 4.6 | 17.4 | - | - | 21.1 | 33.7 | 34.6 |
| DeepSWE v1.1 | 66.9 | 46.2 | 67.5 | 62.7 | 56.6 | 58.0 | 69.7 | 72.7 |
| NL2Repo | 58.0 | 48.9 | 58.0 | 61.1 | 55.9 | 69.7 | - | - |
| ProgramBench Almost Solved | 19.0 | 9.5 | 17.5 | - | 10.5 | 15.5 | 33.0 | 23.0 |
| FrontierSWE | 78.1 | 67.5 | - | - | - | 66.5 | 88.2 | - |
| SWE-Marathon v1.1 | 42.5 | 19.4 | 48.1 | - | - | 48.8 | 33.1 | 42.5 |
| PostTrainBench | 39.8 | 31.7 | 32.0 | - | - | 32.9 | 41.8 | 36.2 |
| CyberGym | 84.5 | 77.2 | 80.0 | 83.3 | 78.5 | 78.1 | 83.8 | 83.6 |
| ExploitGym 2h / 6h | 105 / 130 | 29 / 39 | 36 / 70 | - | 14 / 26 | 80 / 120 | 181 / 247 | 216 / 293 |
| ExploitBench | 54.4 | 24.4 | 32.2 | - | 28.8 | 40.0 | 78.0 | 76.5 |
| Toolathlon Verified | 73.0 | 59.9 | 76.5 | 74.1 | 72.5 | 76.2 | 74.7 | 74.9 |
| AutomationBench v1.0.6 | 48.2 | 26.2 | 46.7 | 43.2 | 39.8 | 41.0 | 46.2 | 45.8 |
| Agents' Last Exam (ALE-CLI) | 28.5 | 23.8 | 27.6 | 25.7 | 27.0 | 25.7 | 23.8 | 28.6 |
| HLE w/ Tools | 62.5 | 54.7 | 59.8 | 60.0 | 56.2 | 57.9 | 63.9 | 64.5 |
| GDPval-AA v2 | 1769 | 1508 | 1682 | 1590 | 1739 | 1588 | 1743 | 1730 |
在三大分类的具体表现上,GLM-5.3 在网络安全基准 CyberGym(84.5%)、工作流自动化基准 AutomationBench(48.2%)以及长程评测基准 GDPval-AA v2(1769)上均以 优异成绩位居榜单首位,超越同期的开源与闭源前沿模型。
强制开启思考与推理强度分级
在调用接口方面,GLM-5.3 调整了推理交互逻辑,取消了纯直接输出模式,强制开启思考推理。开发者可通过参数调节模型在单次任务中的计算投入。
系统提供三种推理强度档位:low 适合轻量格式转换与简单问答,high 兼顾速度与代码产出效率,max 则为默认档位,用于高难度算法设计与多步长程调试。
获取方式与开源计划
GLM-5.3 目前已通过官方 API 以及编程订阅计划向开发者全量开放。针对开源社区关注的权重开放问题,官方明确表示将在完成安全评估与加固流程后,两周内向社区开源权重。