GLM-5.3 深度评测:后训练 Scaling 的极致演绎与涌现的安全能力
一句话结论:GLM-5.3 用一份"基座不变、后训练拉满"的成绩单,验证了后训练 Scaling 可独立驱动智能上限突破的范式价值——Terminal-Bench 3.0 从 4.6 跃升至 28.3、DeepSWE 提升 20.7 分、CyberGym 白盒漏洞发现以 84.5% 登顶对比集第一。它用 Token 效率重塑了开源编程模型的经济性,同时以网络安全能力的涌现给行业提出了新的治理课题。其最终成色,将由 8 月底的开源落地与第三方复现来盖章。
一、发布概况:一次"不换基座"的旗舰升级
2026 年 8 月 14 日,智谱 AI 正式发布新一代旗舰基座模型 GLM-5.3。这是 GLM-5 系列在 2026 年内的第三次迭代:2 月的 GLM-5、6 月的 GLM-5.2,到 8 月的 GLM-5.3,智谱以约两个月一个大版本的节奏推进旗舰线。
GLM-5.3 最值得玩味的地方在于它的"不变":基座模型与 GLM-5.2 完全相同——总参数仍为 7430 亿,沿用 MoE 架构,预训练数据没有增加。智谱官方对此的表述非常直白——"Scaling post-training is all we did for GLM-5.3"(我们为 GLM-5.3 做的全部事情就是扩展后训练)。
"变"集中在后训练阶段的投入强度上:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。换言之,GLM-5.3 是一次纯粹由后训练 Scaling 驱动的升级,其全部性能增益均来自强化学习阶段的环境规模与训练时长扩展。
| 项目 | 内容 |
|---|---|
| 发布日期 | 2026 年 8 月 14 日 |
| 参数规模 | 7430 亿(总参数),与 GLM-5.2 相同 |
| 架构 | MoE 混合专家架构 |
| 性能增益来源 | 后训练 Scaling(数十倍长程任务环境、超长后训练时间) |
| 官方定位 | 编程能力最强的开源模型,接近 Claude Fable 5 |
| 开源计划 | 8 月底开放完整权重,先进行安全评估与加固 |
| 许可证预期 | 参照前代 MIT 许可证惯例,以最终 LICENSE 为准 |
二、技术路线解析:后训练 Scaling 如何撑起全部增益
2.1 slime 框架与四大技术组件
GLM-5.3 的后训练构建在智谱自研的开源后训练框架 slime 之上。该框架把训练、rollout 与数据缓冲置于单一数据流中,使得长程 Agent 环境可以插件化接入,而无需重构训练循环。
在这一底座之上,智谱引入了四项关键组件:
- IndexShare:高效处理长上下文,确保模型在百万级 token 的代码库状态中保持注意力效率。
- SAO(Single-rollout Asynchronous Optimization):针对长程任务优化的异步强化学习策略,缓解长轨迹 rollout 对训练吞吐的拖累。
- Compaction(压缩机制):与 SAO 配合,主动压缩长轨迹中的中间状态,避免上下文窗口溢出。
- 数值对齐优化:引入 top-p 掩码和全词表 OPD 采样,将训练与推理路径的数值误差控制在 1e-7 级别,较旧方案降低 99.99%。
在系统层面,通过局部存储缓存和多教师动态切换,长程编码 RL 训练的端到端吞吐量提升了 2.3 倍。
2.2 环境合成流水线:从手工构造到自动规模化
GLM-5.3 的能力跃升,根源在于一条端到端的环境合成流水线,把长程训练环境的生产从手工构造推进到了自动规模化:
- 任务采集:由 Research Agents 从真实工程工作中收集任务模式。
- 环境生成:转化为具有多步依赖和隐藏状态的可运行长程环境。
- 可解性验证:由 Judge Agents 实际尝试执行,剔除无解任务。
- 奖励信号合成:通过 oracle、no-op 和未解决状态检查,关闭奖励捷径。
最后一步尤为关键:oracle 检查验证"正确答案确实能得分",no-op 检查验证"什么都不做不能得分",未解决状态检查验证"半途而废不能得分"——三道关卡共同保证了奖励信号只发给真正的任务完成行为。
这条流水线与基准表现形成了自洽的因果链:越是考验长时间多步骤执行的基准,GLM-5.3 相对 GLM-5.2 的跳升幅度越大——Terminal-Bench 3.0 提升约 6 倍,DeepSWE 提升 20.7 分。环境规模化投入在哪里,能力增益就出现在哪里,这是 GLM-5.3 技术叙事中最有说服力的证据链。
三、编程能力评测:开源第一,逼近闭源旗舰
3.1 公开基准:跨代跃升与竞品对位
先看智谱官方发布的完整对比表(17 项基准,分 CODING / CYBER / AGENTIC 三组,GLM-5.3 列高亮):
在 Terminal-Bench 3.0 上,GLM-5.3 得分 28.3,而 GLM-5.2 仅为 4.6,提升约 6 倍。4.6 分意味着前代在真实终端复杂任务上几乎无法完成,28.3 分则标志着跨入了"能稳定完成一部分真实任务"的可用区间——这是能力性质的变化。
| 基准测试 | 评测维度 | GLM-5.3 | GLM-5.2 | Kimi K3 | Claude Opus 4.8 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|---|---|
| Terminal-Bench 3.0 | 真实终端复杂任务 | 28.3 | 4.6 | 17.4 | 33.7 | 34.6 | — |
| DeepSWE v1.1 | 长程软件工程 | 66.9 | 46.2 | 67.5 | 58.0 | 69.7 | 72.7 |
| Agents' Last Exam | 跨工具协作长程任务 | 28.5 | 23.8 | 27.6 | 25.7 | 23.8 | 28.6 |
| AutomationBench | 自动化任务执行 | 48.2 | 26.2 | 46.7 | 41.0 | 46.2 | 45.8 |
| GDPval-AA v2 | 高价值知识工作 | 1769 | 1508 | 1682 | 1588 | 1743 | 1730 |
把成绩放入竞品格局中观察:
- 对开源阵营:全面领先 Kimi K3,印证"开源第一编程模型"的定位。
- 对 Claude Opus 4.8:五项基准中四项追平或反超。
- 对闭源顶尖:DeepSWE 上 GPT-5.6 Sol(72.7)与 Fable 5(69.7)仍领先;Terminal-Bench 上 Fable 5 领先约 6 个百分点。
下面是 Z.ai 官方发布的 6 项关键基准柱状图(对比 GLM-5.2 / Kimi K3 / Fable 5 / GPT-5.6 Sol):
综合判断:GLM-5.3 已是开源阵营编程能力无争议的第一名,与 Claude Opus 4.8 同属一档并局部反超,与 Fable 5、GPT-5.6 Sol 的差距集中在最难的长程基准上。
3.2 Z.ai Code Bench:Token 效率成为真正的杀手锏
智谱自研的 Z.ai Code Bench 将模型置于复杂本地开发环境中评估端到端任务完成率。在 High 推理档位下,GLM-5.3 准确率达 31.4%,超过 Claude Opus 4.8 的 29.5%;而两者的平均输出 Token 消耗分别约为 5 万和 12 万——GLM-5.3 的推理轨迹长度只有 Opus 4.8 的约四成。
这意味着完成同等难度的任务,GLM-5.3 用更少的 Token 办成了同样的事。对 API 使用者来说,这直接改善了成本、响应速度和上下文占用三项体验。

在 Max 最高推理档位下,GLM-5.3 完成率为 34.5%(平均约 75K 输出 Token),仍落后于 Fable 5 的 39.5%。差距分布很有规律:推理预算越足、任务链条越长,Fable 5 的领先越明显——短轨迹高效率是 GLM-5.3 的实打实优势,但极限长链任务上其智能上限仍低于 Fable 5。
⚠️ 评测独立性提示:Z.ai Code Bench 为厂商自建基准,其成绩可信度天然低于第三方评测。但其中"准确率略胜 + Token 消耗减半"的结构性结论,与公开基准中 GLM-5.3 在 AutomationBench、Agents' Last Exam 上的领先方向一致,多条证据链相互印证,可信度有所提升。
四、网络安全能力的涌现:意料之外的双刃剑
4.1 安全基准:漏洞发现 SOTA,利用链仍逊于闭源
GLM-5.3 最具话题性的突破,是训练过程中意外涌现的网络安全能力。智谱官方明确表示,随着后训练规模扩大,网络安全表现超出了团队自身的预期。
| 评测基准 | 测试内容 | GLM-5.3 | GLM-5.2 | Mythos 5 | GPT-5.6 Sol |
|---|---|---|---|---|---|
| CyberGym | 白盒源码漏洞识别与验证 | 84.5% | 77.2% | 83.8% | 83.6% |
| ExploitBench | 深层漏洞推理与利用链构造 | 54.4% | 24.4% | 78.0% | 76.5% |
| ExploitGym(2h/6h) | 限时漏洞利用任务完成数 | 105/130 | 29/39 | 181/247 | 216/293 |
在漏洞发现环节,GLM-5.3 已站上 84.5%,位居全部对比模型第一。在漏洞利用环节,呈现"纵向翻倍、横向落后"的双面性——ExploitBench 从 24.4% 跃升至 54.4%,但与闭源模型的 78.0% 仍有明显差距。
智谱官方对这一规律的总结很直白:越往"利用链"上游走,GLM-5.3 相对前代的增益越大,同时与闭源前沿的差距也越宽。后训练 Scaling 对"发现漏洞"这类依赖代码理解的能力增益充分,对"构造完整利用链"这类依赖深度攻防经验的能力增益有限。
4.2 实战成果:2436 个漏洞背后的责任框架
智谱联合多家安全团队对 269 个真实开源项目进行了扫描,共识别出 2436 个历史漏洞,其中中高危漏洞 1097 个。这批漏洞的潜伏时间尤其值得关注:最早的漏洞可追溯至 1981 年(潜伏约 45 年),平均潜伏时长 26.6 年。其中一个代表性案例是潜伏 40 余年的 DNS 协议级风险——攻击者可通过少量特殊请求将服务器压力放大近 8 万倍,影响超 1000 万处公网 DNS 服务。
在治理层面,智谱建立了 Z.ai Security Disclosure Ledger 持续披露漏洞处理进度,并通过协调披露流程提交高危漏洞发现。开源前将进行严格的安全评估与加固——"先加固、后放权重"的顺序安排,是对双刃剑能力给出的工程化回应。
五、商业化与生态:订阅优先,开源倒计时
5.1 API 迁移要点
GLM-5.3 在 API 层面不再支持 thinking.type: disabled,原有禁用思考的业务必须改为 enabled,并通过 reasoning_effort 参数选择 low/high/max 三档。编程任务官方推荐 max 档:
{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}
原 GLM-5.2、GLM-5.1 的 API 请求已自动路由至 GLM-5.3。对多数用户是平滑升级,但对依赖旧版特定行为的业务需重新验证兼容性。
5.2 定价策略:订阅制先行
截至发稿,官方按量计费价目表尚未列出 GLM-5.3 的 Token 单价。当前商业化重心放在 GLM Coding Plan 订阅制上:
| 套餐 | 价格(月付) | 积分额度(每周) | 适用场景 |
|---|---|---|---|
| Lite | $12.6 | 10,000 | 个人小型项目 |
| Pro | $56 | 60,000 | 专业开发者,解锁 MCP 工具 |
| Max | $117.6 | 140,000 | 大型仓库,高峰期专属资源 |
成本优化路径有两条:非高峰折扣(工作日 14:00–18:00 为高峰,其余时间消耗 50% 积分)和客户端缓存(官方 ZCode 缓存命中率超 98%)。两项叠加后实际可用额度可提升至标准的 180%。
5.3 开源时间表与许可证
智谱承诺 8 月底开放完整权重,在此之前先完成安全评估与加固。许可证方面,前代 GLM-5/5.2 均以 MIT 许可证发布,社区普遍预期 GLM-5.3 将保持宽松开源策略——但最终以开源仓库中的 LICENSE 文件为准。
六、客观评估:局限、风险与选型建议
三大待验证项
第一,基准成绩的独立性。 全部基准数据均来自智谱官方,Z.ai Code Bench 为自建评测。在第三方独立复现之前,所有"领先""超越"结论的置信度都应相应打折。
第二,API 定价的完整性。 按量计费价目表尚未列出 GLM-5.3 条目,当前只能通过订阅制估算成本,对需要精确成本建模的企业构成决策盲区。
第三,开源承诺的落地细节。 权重开放时间、许可证类型、安全加固形式,三项均停留在"承诺与预期"层面。尤其是安全加固——对一个 CyberGym 84.5% 的模型做权重开放,加固到什么程度、如何验证效果,官方尚未给出技术细节。
选型建议
| 用户类型 | 建议 |
|---|---|
| 个人开发者/小型团队 | 直接接入,Lite 档 $12.6/月成本可控,High 档位超越 Opus 4.8 且 Token 消耗减半 |
| 专业团队/中型企业 | 观察 8 月底权重开源与第三方复现结果;迁移时注意强制思考模式的参数变更 |
| 极限长程任务场景 | 当前 GLM-5.3 在最长推理链上仍有约 5 个百分点差距,闭源顶尖模型仍是更稳妥的选择 |
总评:GLM-5.3 是 2026 年开源模型阵营迄今最重要的一次发布。它用"基座不变、后训练拉满"的成绩单,证明了后训练 Scaling 的范式价值,以 Token 效率重塑了开源编程模型的经济性,同时用网络安全能力的涌现给行业提出了新的治理课题。其成绩的最终成色,将由 8 月底的开源落地与随后的第三方复现来盖章。
内容由 Qific2.1flash 模型辅助生成
Qific2.1flash 模型是千策人工智能研究院开发的旗舰多模态推理模型。基于 217B 总参数 / 23B 激活参数的稀疏 MoE 架构,原生支持图片和视频理解。
图片源自于网络