资讯 · 高影响返回资讯

智谱发布 GLM-5.3:强化后训练强化学习与网络安全能力,两周内开源权重

智谱 AI 正式发布基于 743B 基础模型深度后训练的新一代旗舰模型 GLM-5.3。借助 IndexShare、SAO 强化学习算法与 Slime 异步训练框架,该模型在 CyberGym 漏洞挖掘(84.5%)、AutomationBench(48.2%)与 GDPval-AA v2(1769)多项榜单取得第一,并在 Terminal Bench 3.0 达到 28.3 分,官方计划于两周内开源模型权重。

架构基座与后训练技术栈

智谱 AI(Zhipu AI / Z.ai)正式发布新一代旗舰大模型 GLM-5.3。该模型在架构上完全沿用前代 743B 参数基座,全部性能跃升均来自 后训练强化学习的大规模扩展

在底层技术栈方面,GLM-5.3 依托长上下文处理技术 IndexShare、面向长程任务的强化学习算法 SAO,以及开源大规模异步分布式训练框架 Slime,在数万个异构交互环境中并行采集训练信号,实现了长时序推理能力的质变。

编码与网络安全基准横向表现

根据官方公布的评测数据,GLM-5.3 在长程终端交互、软件工程修复与漏洞挖掘领域均展现出显著的技术突破。特别是在网络安全测试中,模型自发涌现出多步侦察与漏洞利用链推导能力。

核心基准测试表现

  • 28.3

    Terminal Bench 3.0 得分,相比前代 4.6 实现显著跃升。

  • 84.5%

    CyberGym 真实漏洞挖掘基准准确率,处于当前评测榜首。

  • 66.9

    DeepSWE v1.1 软件工程基准得分,相比前代 46.2 明显提高。

在官方披露的跨模型横向对比中,GLM-5.3 在编程、网络安全与智能体三大维度的 16 项评测基准上实现了全方位提升,展现出 开源模型领先的综合工程能力

评测分类与基准GLM-5.3GLM-5.2Kimi K3DeepSeek-V4 Pro-0813Qwen3.8-MaxOpus 4.8Fable 5 (w/ fallback)GPT-5.6 Sol
Terminal Bench 2.188.281.088.387.986.685.088.088.8
Terminal Bench 3.028.34.617.4--21.133.734.6
DeepSWE v1.166.946.267.562.756.658.069.772.7
NL2Repo58.048.958.061.155.969.7--
ProgramBench Almost Solved19.09.517.5-10.515.533.023.0
FrontierSWE78.167.5---66.588.2-
SWE-Marathon v1.142.519.448.1--48.833.142.5
PostTrainBench39.831.732.0--32.941.836.2
CyberGym84.577.280.083.378.578.183.883.6
ExploitGym 2h / 6h105 / 13029 / 3936 / 70-14 / 2680 / 120181 / 247216 / 293
ExploitBench54.424.432.2-28.840.078.076.5
Toolathlon Verified73.059.976.574.172.576.274.774.9
AutomationBench v1.0.648.226.246.743.239.841.046.245.8
Agents' Last Exam (ALE-CLI)28.523.827.625.727.025.723.828.6
HLE w/ Tools62.554.759.860.056.257.963.964.5
GDPval-AA v217691508168215901739158817431730

在三大分类的具体表现上,GLM-5.3 在网络安全基准 CyberGym(84.5%)、工作流自动化基准 AutomationBench(48.2%)以及长程评测基准 GDPval-AA v2(1769)上均以 优异成绩位居榜单首位,超越同期的开源与闭源前沿模型。

强制开启思考与推理强度分级

在调用接口方面,GLM-5.3 调整了推理交互逻辑,取消了纯直接输出模式,强制开启思考推理。开发者可通过参数调节模型在单次任务中的计算投入。

系统提供三种推理强度档位:low 适合轻量格式转换与简单问答,high 兼顾速度与代码产出效率,max 则为默认档位,用于高难度算法设计与多步长程调试。

获取方式与开源计划

GLM-5.3 目前已通过官方 API 以及编程订阅计划向开发者全量开放。针对开源社区关注的权重开放问题,官方明确表示将在完成安全评估与加固流程后,两周内向社区开源权重

下一步

继续追踪 GLM-5.3

沿着同一主题继续阅读。

打开实体档案