
GLM-5.3 的网络安全能力:官方跑分到底说明什么
「Built to Code. Ready for Cyber Defense.」——Z.ai 在主张什么
| 基准 | GLM-5.3(厂商自报) | GLM-5.2 | 需要注意 |
|---|---|---|---|
| CyberGym | 84.5 | 77.2 | Z.ai 中文文档正文写 83.5%——两个官方数字并存 |
| ExploitBench | 54.4 | 24.4 | Z.ai 自家表格显示 Mythos 5 = 78;Z.ai 承认闭源模型领先 |
读这些数字时,有三点要抓牢:
- 按其自家基线看,跃升是真实的。 两个共享同一基座网络的模型之间,ExploitBench 从 24.4 涨到 54.4,是 GLM-5.3 整份公告里相对涨幅最大的一项。
- 厂商自己并没有宣称登顶。 Z.ai 的表格把闭源模型排在这个漏洞利用向基准的前面。任何把 GLM-5.3 称作「领先的安全模型」的标题,说的都比 Z.ai 自己更多。
- CyberGym 的口径差异是被披露的,不是被解决的。 84.5(公告)与 83.5(中文文档正文)都是官方数字。在 Z.ai 统一口径之前,引用时应两者并列。
为什么这次发布不是「首日开源」
GLM-5.2 发布当天即开放权重,GLM-5.3 刻意没有——Z.ai 表示,原因正是网络安全能力。按公告,分阶段计划如下:
- 开源权重推迟约两周(2026 年 8 月 28 日前后),需先通过一轮安全评估与加固。License 尚未公布——不要假设 GLM-5.2 的条款会自动沿用。
- 按 Token 计费的 API 同样分阶段开放。 发布当天唯一的付费路径是 GLM Coding Plan 订阅;Z.ai 国际版价格页没有 GLM-5.3 条目,BigModel(中国)API 标注「即将上线」。
- 随模型一同上线的还有一个 Security Disclosure Ledger(安全披露台账)——按 Z.ai 的说法,这是一份公开台账,记录模型发现的漏洞,让发现流向协同披露而非被悄悄利用。
为什么安全开发者在密切关注
一套防御方的评估框架
- 带公开条款的按 Token 计费 API 端点——Z.ai 价格页新增
glm-5.3条目,或 BigModel API 从「即将上线」变为可调用。 - 开源权重,以及最关键的 License(按 Z.ai 自己的时间线约为 8 月 28 日)。对安全团队而言,License 比平时更重要:它决定你到底能不能把模型跑在隔离实验室里。
- 分诊准确率与误报率。 把你真实积压的安全报告和静态分析结果喂给它。一个跑分翻倍、却把你的队列灌满误报的模型,是净成本。
- 用于修复验证的漏洞复现。 漏洞利用能力在防御上的正当用途:确认一个被报告的漏洞真实存在、确认一个补丁真的把它堵上了。在你拥有或获授权测试的系统上,衡量模型的复现是否忠实。
- 报告质量。 它能产出披露级别的报告——受影响版本、根因、严重性论证、修复建议——还是只给一个发现?对多数团队,工时都花在写报告上。
- 长时程行为。 Z.ai 的 ExploitGym 主张正是「表现随时间预算提升」。在为 6 小时的 Agent 运行付费之前,先在你自己的任务上验证这一点。
- 授权范围的责任在你,不在模型。 渗透测试与漏洞研究需要覆盖具体受测系统的明确授权;模型的「网络防御」定位不能替代授权本身。
- 数据驻留与跨境问题需要你自行评估。 GLM-5.3 来自一家中国厂商;把安全敏感代码或漏洞数据路由到任何一个端点是否符合你的合规姿态,是你自己的法务与安全评审要回答的问题。权重开放后自托管会改变这套计算——这也是 License 值得盯住的又一个原因。
网络安全的提升和编程的提升是同一个故事
一个少有人注意的细节:GLM-5.3 与 GLM-5.2 共享基座模型,Z.ai 明确表示「所有提升都来自后训练」。网络安全的跃升和编程的跃升(Terminal Bench 3.0:4.6 → 28.3,厂商自报)来自同一张网络上的同一轮后训练——Z.ai 的解释是,漏洞利用分析归根结底是对抗性的代码推理,所以一次以编程为核心的投入「涌现」出了网络安全能力。
reasoning_effort 控制项)。HN 讨论串里也出现了怀疑派的读法:重度后训练容易招致基准过拟合;这场争论唯一的解药是独立评估,而它目前还不存在。今天你实际能做什么
发布当天,付费入口只有一个、没有可集成的 API、也没有经验证的 EvoLink 路由——下面逐条说清各自意味着什么。
- 订阅通道现在就有。 GLM Coding Plan($18/月起,积分制)在各档位均包含 GLM-5.3——这是发布日唯一的付费路径。适合上手体验;不是按 Token 计费的生产通道。
- 还没有可集成的 API。 没有公开的按 Token 价格、没有承诺的 API 日期,截至 8 月 14 日也没有任何主要聚合商能提供它。如果你今天就要构建,GLM-5.2 仍是这个家族里已上线、已定价的成员——记得把模型 ID 做成可配置。
- EvoLink 尚未验证 GLM-5.3 路由。 我们的立场:一个模型在身份、请求行为、计费和故障转移于真实路由上验证通过之前,不算「可用」。GLM-5.3 已在验证轨道上;GLM-5.3 状态页是可用性最先翻转的地方,那里也写明了「已验证」对我们意味着什么。
FAQ
GLM-5.3 的网络安全跑分究竟主张了什么?
按 Z.ai 自报口径:CyberGym 84.5(中文文档正文出现 83.5%——两个数字都是官方的),对比 GLM-5.2 的 77.2;ExploitBench 54.4 对比 24.4。Z.ai 还报告 GLM-5.3 在 2 小时内解出 105 道、6 小时内解出 130 道 ExploitGym 挑战。截至发布日,以上数字均为厂商自报,无独立复现。
GLM-5.3 是不是安全研究方向的最佳模型?
今天得不出这种结论。目前没有任何对 GLM-5.3 的独立安全评估,而且 Z.ai 自家表格显示闭源模型在 ExploitBench 上领先(Mythos 5 = 78)。能说的是:按厂商数据,它相对 GLM-5.2 提升巨大;计划中的开源权重也让它成为需要自托管评估的团队的候选——前提是 License 落地。
GLM-5.3 能用来搞黑客攻击吗?
GLM-5.3 的权重为什么延迟发布?
Z.ai 表示权重将在发布约两周后(2026 年 8 月 28 日前后)、完成安全评估与加固后放出——这是相对 GLM-5.2 发布日即开源的刻意改变,动因正是模型的网络安全能力。License 尚未公布。
今天能通过 API 用 GLM-5.3 做安全工作吗?
不能。发布当天没有带公开定价的按 Token 计费 API——只有 GLM Coding Plan 订阅和 ZCode。Z.ai 价格页没有 GLM-5.3 条目,BigModel API 标注「即将上线」,也没有任何主要聚合商在提供它。
Security Disclosure Ledger 是什么?
按公告所述,这是 Z.ai 随 GLM-5.3 一同推出的公开台账,用于记录模型发现的漏洞——目的在于让模型发现的缺陷进入协同披露流程,而不是留在私下。对防御方来说,它还兼作证据流:真实的条目会比任何跑分都更能证明能力。
为什么 GLM-5.3 的 CyberGym 分数同时有 84.5 和 83.5 两个版本?
两个都来自 Z.ai:84.5 出现在公告的基准表里,83.5% 出现在中文文档正文中。截至发稿,这一口径差异没有得到解释。我们两者并报,若 Z.ai 统一口径将更新。
网络安全能力会不会牺牲编程能力?
GLM-5.3 上 EvoLink 了吗?
Sources
- Z.ai——GLM-5.3 官方公告:「Frontier Coding with Emergent Cyber Capabilities」
- BigModel——GLM-5.3 模型文档
- Hacker News——发布日讨论串
- Unite.AI——发布报道
- EvoLink——GLM-5.3 发布追踪、GLM-5.3 对比 GLM-5.2、GLM-5.3 状态页


