Seedance 2.5 已上线 EvoLink立即体验
抽象透镜照出六边形表面上的薄弱点,象征以防御为目的的 AI 辅助漏洞发现
model-analysis

GLM-5.3 的网络安全能力:官方跑分到底说明什么

Jessie
Jessie
COO
2026年8月14日
19 分钟阅读
网络安全跑分是 GLM-5.3 这次发布中幅度最大的单项能力跃升——而其中每一个数字都是 Z.ai 的自报口径。 按厂商数据,GLM-5.3 在 CyberGym 得 84.5,对比 GLM-5.2 的 77.2(注意:Z.ai 中文文档正文写的是 83.5%——两个官方数字并存,我们两者都如实报出);ExploitBench 54.4 对比 24.4——比前代翻了一倍还多。Z.ai 同样坦承这并未领先前沿:其自家对比表显示 Mythos 5 在 ExploitBench 上为 78,公告也承认闭源模型仍然领先。还有两个事实框定下文的一切:发布当天,这些数字没有任何独立复现;而且今天你无法通过按 Token 计费的 API 调用 GLM-5.3——访问被有意分阶段放在一轮安全评审之后。本文拆解这些主张究竟说了什么、分阶段发布为何重要,以及等真实访问开放后,防御方应该怎么评估这款模型。
先说一个适用范围的前提:本文面向防御性、经授权的安全工作——以修复为目的的漏洞发现、获得明确授权的渗透测试、问题分诊与代码审计。这也正是 Z.ai 自己给这款模型的定位。

「Built to Code. Ready for Cyber Defense.」——Z.ai 在主张什么

Z.ai 给 GLM-5.3 的发布口号是 "Built to Code. Ready for Cyber Defense."——立意是防御,不是进攻;公告标题本身就把网络安全成绩称作「涌现」(emergent):「GLM-5.3: Frontier Coding with Emergent Cyber Capabilities」。以下主张数字全部来自 Z.ai 自家基准表:
基准GLM-5.3(厂商自报)GLM-5.2需要注意
CyberGym84.577.2Z.ai 中文文档正文写 83.5%——两个官方数字并存
ExploitBench54.424.4Z.ai 自家表格显示 Mythos 5 = 78;Z.ai 承认闭源模型领先
Z.ai 还报告了一项 ExploitGym 上的时间扩展结果:按其自述,GLM-5.3 在 2 小时预算内解出 105 道挑战,6 小时内解出 130 道——用来佐证模型的漏洞分析表现会随可用时间增加而持续提升。和上表一样,这是厂商自报数据,截至发布日没有第三方复现。

读这些数字时,有三点要抓牢:

  1. 按其自家基线看,跃升是真实的。 两个共享同一基座网络的模型之间,ExploitBench 从 24.4 涨到 54.4,是 GLM-5.3 整份公告里相对涨幅最大的一项。
  2. 厂商自己并没有宣称登顶。 Z.ai 的表格把闭源模型排在这个漏洞利用向基准的前面。任何把 GLM-5.3 称作「领先的安全模型」的标题,说的都比 Z.ai 自己更多。
  3. CyberGym 的口径差异是被披露的,不是被解决的。 84.5(公告)与 83.5(中文文档正文)都是官方数字。在 Z.ai 统一口径之前,引用时应两者并列。
完整的发布图景——访问通道、API 契约变更以及网络安全之外的一切——见 GLM-5.3 发布追踪

为什么这次发布不是「首日开源」

GLM-5.2 发布当天即开放权重,GLM-5.3 刻意没有——Z.ai 表示,原因正是网络安全能力。按公告,分阶段计划如下:

  • 开源权重推迟约两周(2026 年 8 月 28 日前后),需先通过一轮安全评估与加固。License 尚未公布——不要假设 GLM-5.2 的条款会自动沿用。
  • 按 Token 计费的 API 同样分阶段开放。 发布当天唯一的付费路径是 GLM Coding Plan 订阅;Z.ai 国际版价格页没有 GLM-5.3 条目,BigModel(中国)API 标注「即将上线」。
  • 随模型一同上线的还有一个 Security Disclosure Ledger(安全披露台账)——按 Z.ai 的说法,这是一份公开台账,记录模型发现的漏洞,让发现流向协同披露而非被悄悄利用。
不管你怎么看这些跑分,更有分量的信号是这个:一个上一版直接发上 Hugging Face 的实验室,因为模型在漏洞利用基准上的成绩,选择把这一版关在安全评审之后。对安全团队来说,这份台账值得独立于模型本身持续关注——如果 GLM-5.3 真的在发现真实漏洞,证据会最先出现在那里。

为什么安全开发者在密切关注

这里有真实的需求背景,在发布日的 Hacker News 讨论串里清晰可见。讨论中反复出现的主题,是对美国主要模型厂商限制安全用例的不满。一位 HN 评论者说得很直白:"American vendors won't let the peasantry use their best models for security work."(美国厂商不让平民用他们最好的模型做安全工作。)同一讨论串里另一位写道:"It's not like you will be allowed to use Fable...for anything cybersecurity-related."(你反正也不会被允许用 Fable……做任何网络安全相关的事。)
如何解读这些声音,有两条限定必须先说。第一,这些是社区评论——是情绪,不是关于任何厂商实际政策的核实事实;个体对使用政策的体验各不相同,实际执行也远比一句论坛引语微妙。第二,情绪本身仍是市场信号:它解释了为什么一款宣传网络安全能力的开放权重模型,会立刻吸引那些觉得被怠慢的安全从业者。如果 GLM-5.3 的权重如期落地且 License 可用,它将成为当前世代中少数几个防御性安全团队可以在受控环境中自行运行、无需与托管 API 厂商先谈一轮使用政策的模型——前提是 Z.ai 的 License 实际写了什么,而这在今天仍是未知数。

一套防御方的评估框架

今天你无法为安全工作评估 GLM-5.3,因为你根本调不到它。你能做的,是先决定等什么、以及访问开放后测什么
该等什么:
  • 带公开条款的按 Token 计费 API 端点——Z.ai 价格页新增 glm-5.3 条目,或 BigModel API 从「即将上线」变为可调用。
  • 开源权重,以及最关键的 License(按 Z.ai 自己的时间线约为 8 月 28 日)。对安全团队而言,License 比平时更重要:它决定你到底能不能把模型跑在隔离实验室里。
该测什么——仅限经授权的环境:
  • 分诊准确率与误报率。 把你真实积压的安全报告和静态分析结果喂给它。一个跑分翻倍、却把你的队列灌满误报的模型,是净成本。
  • 用于修复验证的漏洞复现。 漏洞利用能力在防御上的正当用途:确认一个被报告的漏洞真实存在、确认一个补丁真的把它堵上了。在你拥有或获授权测试的系统上,衡量模型的复现是否忠实。
  • 报告质量。 它能产出披露级别的报告——受影响版本、根因、严重性论证、修复建议——还是只给一个发现?对多数团队,工时都花在写报告上。
  • 长时程行为。 Z.ai 的 ExploitGym 主张正是「表现随时间预算提升」。在为 6 小时的 Agent 运行付费之前,先在你自己的任务上验证这一点。
合规注意事项——只做提示,不做结论,因为它们高度依赖司法辖区与组织自身:
  • 授权范围的责任在你,不在模型。 渗透测试与漏洞研究需要覆盖具体受测系统的明确授权;模型的「网络防御」定位不能替代授权本身。
  • 数据驻留与跨境问题需要你自行评估。 GLM-5.3 来自一家中国厂商;把安全敏感代码或漏洞数据路由到任何一个端点是否符合你的合规姿态,是你自己的法务与安全评审要回答的问题。权重开放后自托管会改变这套计算——这也是 License 值得盯住的又一个原因。

网络安全的提升和编程的提升是同一个故事

一个少有人注意的细节:GLM-5.3 与 GLM-5.2 共享基座模型,Z.ai 明确表示「所有提升都来自后训练」。网络安全的跃升和编程的跃升(Terminal Bench 3.0:4.6 → 28.3,厂商自报)来自同一张网络上的同一轮后训练——Z.ai 的解释是,漏洞利用分析归根结底是对抗性的代码推理,所以一次以编程为核心的投入「涌现」出了网络安全能力。

对评估的实际含义是:这里的网络安全能力不是一个可以单独采用的独立微调 SKU。你拿到的——也应该测试的——是整个后训练后的模型,包括它相对 GLM-5.2 的破坏性 API 变更(思考常开、新的 reasoning_effort 控制项)。HN 讨论串里也出现了怀疑派的读法:重度后训练容易招致基准过拟合;这场争论唯一的解药是独立评估,而它目前还不存在。

今天你实际能做什么

发布当天,付费入口只有一个、没有可集成的 API、也没有经验证的 EvoLink 路由——下面逐条说清各自意味着什么。

  • 订阅通道现在就有。 GLM Coding Plan($18/月起,积分制)在各档位均包含 GLM-5.3——这是发布日唯一的付费路径。适合上手体验;不是按 Token 计费的生产通道。
  • 还没有可集成的 API。 没有公开的按 Token 价格、没有承诺的 API 日期,截至 8 月 14 日也没有任何主要聚合商能提供它。如果你今天就要构建,GLM-5.2 仍是这个家族里已上线、已定价的成员——记得把模型 ID 做成可配置。
  • EvoLink 尚未验证 GLM-5.3 路由。 我们的立场:一个模型在身份、请求行为、计费和故障转移于真实路由上验证通过之前,不算「可用」。GLM-5.3 已在验证轨道上;GLM-5.3 状态页是可用性最先翻转的地方,那里也写明了「已验证」对我们意味着什么。

FAQ

GLM-5.3 的网络安全跑分究竟主张了什么?

按 Z.ai 自报口径:CyberGym 84.5(中文文档正文出现 83.5%——两个数字都是官方的),对比 GLM-5.2 的 77.2;ExploitBench 54.4 对比 24.4。Z.ai 还报告 GLM-5.3 在 2 小时内解出 105 道、6 小时内解出 130 道 ExploitGym 挑战。截至发布日,以上数字均为厂商自报,无独立复现。

GLM-5.3 是不是安全研究方向的最佳模型?

今天得不出这种结论。目前没有任何对 GLM-5.3 的独立安全评估,而且 Z.ai 自家表格显示闭源模型在 ExploitBench 上领先(Mythos 5 = 78)。能说的是:按厂商数据,它相对 GLM-5.2 提升巨大;计划中的开源权重也让它成为需要自托管评估的团队的候选——前提是 License 落地。

GLM-5.3 能用来搞黑客攻击吗?

Z.ai 把 GLM-5.3 定位于网络防御,并按此设计了发布结构:API 和权重都关在安全评审之后,同时上线了公开的 Security Disclosure Ledger,把模型的发现引向协同披露。但这不改变使用者自身的义务——漏洞研究与渗透测试只有在对相关系统取得明确授权时才合法,滥用的责任在操作者,不在工具。本文只讨论经授权的防御性用途。

GLM-5.3 的权重为什么延迟发布?

Z.ai 表示权重将在发布约两周后(2026 年 8 月 28 日前后)、完成安全评估与加固后放出——这是相对 GLM-5.2 发布日即开源的刻意改变,动因正是模型的网络安全能力。License 尚未公布。

今天能通过 API 用 GLM-5.3 做安全工作吗?

不能。发布当天没有带公开定价的按 Token 计费 API——只有 GLM Coding Plan 订阅和 ZCode。Z.ai 价格页没有 GLM-5.3 条目,BigModel API 标注「即将上线」,也没有任何主要聚合商在提供它。

Security Disclosure Ledger 是什么?

按公告所述,这是 Z.ai 随 GLM-5.3 一同推出的公开台账,用于记录模型发现的漏洞——目的在于让模型发现的缺陷进入协同披露流程,而不是留在私下。对防御方来说,它还兼作证据流:真实的条目会比任何跑分都更能证明能力。

为什么 GLM-5.3 的 CyberGym 分数同时有 84.5 和 83.5 两个版本?

两个都来自 Z.ai:84.5 出现在公告的基准表里,83.5% 出现在中文文档正文中。截至发稿,这一口径差异没有得到解释。我们两者并报,若 Z.ai 统一口径将更新。

网络安全能力会不会牺牲编程能力?

按厂商的说法不会——恰恰相反。GLM-5.3 与 GLM-5.2 共享基座,所有提升来自后训练,Z.ai 将网络安全成绩表述为以编程为核心的投入中涌现。在其表格中,编程和网络安全的数字是一起上涨的。两者在基准之外是否都站得住,要等独立测试;编程侧的细节见 GLM-5.3 对比 GLM-5.2
还没有。GLM-5.3 尚未通过 EvoLink 的路由验证(身份、计费请求、流式与工具测试),而验证要等 Z.ai 开放按 Token 计费的 API 才能开始。请关注 GLM-5.3 状态页——可用性变化会最先落在那里。在此期间,GLM-5.2 是这个家族已上线、已定价的选项。

Sources


披露:封面图由 Nano Banana Pro 生成,仅作示意,并非 GLM-5.3 的模型输出。本文所有基准数字均为厂商(Z.ai)自报,截至 2026 年 8 月 14 日无独立复现;社区引语为注明出处的 Hacker News 用户评论,反映情绪而非经核实的事实。本文仅讨论经授权的防御性安全用途,不含任何漏洞利用教学内容。

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。