Seedance 2.5 已上线 EvoLink立即体验
GLM-5.3 与 GLM-5.2:同一基座模型的两个阶段对比
model-comparison

GLM-5.3 对比 GLM-5.2:改了什么、现在要不要切换?

Jacey
Jacey
2026年8月14日
15 分钟阅读
先给结论。截至 2026 年 8 月 14 日(GLM-5.3 发布日):大多数 API 用户还切不了,而 Coding Plan 用户已经在不知情的情况下被切换了。
这个割裂本身就是整篇对比的缩影。GLM-5.3 是订阅优先发布——在 GLM Coding Plan 内部,发给 GLM-5.2 和 GLM-5.1 的请求现在会自动路由到 GLM-5.3。与此同时,按 Token 计费的 API 没有公布价格,也没有确认的开放日期,所以按 Token 计费的生产集成目前根本没有可以迁移过去的东西。本文覆盖三件事:哪些差异是可核验的、唯一确认的破坏性变更是什么、以及真实的 GLM-5.3 路由出现时该跑哪套评估——这样等价格落地那天,你的决策已经就位。

事实核查:到底确认了什么

两个模型来自同一个基座网络。Z.ai 表示 GLM-5.3 的所有提升都来自后训练——没有新的预训练,也没有新的参数量。这让升级决策变得很特别:架构、上下文窗口、模态都没变;变的是行为。
维度GLM-5.2GLM-5.3状态
基座模型与 GLM-5.2 相同官方确认
上下文 / 最大输出1M / 128K1M / 128K官方确认
模态纯文本纯文本(不支持视觉)官方确认
模型 IDglm-5.2glm-5.3(据官方示例)官方确认
关闭 thinking(disabled支持已移除官方确认——破坏性变更
reasoning_effortlow / high / max官方确认——新控制项
按 Token 价格每百万 Token $1.40 / 缓存 $0.26 / $4.40未公布待公布
开源权重已发布(MIT 式许可)承诺约 8 月 28 日;许可证未说明分阶段
API 可用性已上线(Z.ai、BigModel、聚合平台、EvoLink)分阶段开放;发布日无法按 Token 调用分阶段
完整的发布背景——各通道状态、时间线、「分阶段」在实践中意味着什么——见 GLM-5.3 发布追踪。本页只负责一个问题:要不要切、什么时候切。

官方宣称的提升——用买家的眼光看,不要用粉丝的眼光看

发布日所有数字都出自 Z.ai 自己(官方口径 / vendor-claimed;尚无独立复现)。模式很一致:后训练的功夫下在了 Agent 化的长程编程上。

基准GLM-5.2GLM-5.3如果成立,说明什么
Terminal Bench 3.04.628.3终端 / CLI Agent 行为大幅改善
SWE-Marathon v1.119.442.5长程任务的坚持能力大约翻倍
DeepSWE v1.146.266.9仓库级修复质量
FrontierSWE67.578.1按 Z.ai 自己的表格,仍落后于 Claude Fable 5(88.2)
ExploitBench24.454.4新增的网络安全能力;闭源模型仍然领先
这张表旁边要放两句实话。第一,Z.ai 标题里那个「提升 50%」来自其内部私有的 Code Bench——设计上就无法核验。第二,发布日开发者提出的那个问题(「后训练魔法是不是只是在过拟合基准?」)问得完全正确:同一基座上涨幅这么大时,「基准形状的提升」和「你的工作负载形状的提升」可能是两回事。能给出裁决的基准只有一个:你自己的回归测试集。

唯一确认的破坏性变更

GLM-5.3 移除了关闭 thinking 的能力。 GLM-5.2 接受 thinking.type: "disabled",用于快速、便宜、不带推理的调用;GLM-5.3 不再接受。
{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

如果你的集成在延迟敏感路径上用非思考调用(分类、抽取、短改写),这些路径不能干净地平移。在 GLM-5.3 路由上你有三个选项:

  1. 流量重新分层——非推理调用留给更便宜 / 更快的模型(GLM-5.2 或其他路由),只把 Agent 类工作发给 GLM-5.3。
  2. reasoning_effort: "low" 作为最接近的替代,并实测延迟和 Token 开销是否可接受。
  3. 按任务而不是按 Token 重算成本——永远开启的 thinking 会改变输出 Token 量,所以即使最终价格与 GLM-5.2 相同(如果真是这样),账单也不会相同。

这也是 Coding Plan 静默自动路由值得警惕的原因:如果你订阅了,你的 GLM-5.2 请求已经在跑一个每次都思考的模型。8 月 14 日之后你察觉到的任何行为漂移,都多了一个合理解释。

GLM-5.2 已经证明的 vs GLM-5.3 还需要证明的

这组不对称就是决策本身:GLM-5.2 的价值在于所有运维未知数都已在真实路由上有了答案,而 GLM-5.3 尽管基座相同,却把其中几个答案重置了。

GLM-5.2 已经证明(在真实路由上)GLM-5.3 还需要证明(在一条还不存在的路由上)
已知的价格和计费行为有没有价格都还不知道
稳定的请求契约,含关闭 thinking新契约:永远思考、按档位控制
工具调用、缓存、结构化输出经过生产验证同样的能力,需要逐路由重新验证
真实负载下的延迟和 429 行为一套全新部署的容量
MIT 式权重可自部署权重(约 8 月 28 日)与未说明的许可证
你积累的 Prompt / Agent 调优你的调优能否在行为变化后幸存

一句话:GLM-5.2 的价值不在跑分那一行——在于运维确定性;切换意味着交出一部分确定性,直到 GLM-5.3 在真实路由上重新挣回来。

行为变化测试清单

等到可调用的 GLM-5.3 路由出现时,测的是变化,不是整个模型。同基座意味着你可以精准打增量:
  • 思考路径回归: 把原来的非思考工作负载放在 reasoning_effort: "low" 上跑;和 GLM-5.2 关闭 thinking 的版本对比延迟、输出 Token 和答案稳定性。
  • 档位扫描: 固定一组 Agent 任务,分别在 low / high / max 下跑;记录每档质量对 Token 成本。Z.ai 推荐编程用 max——验证它在你的任务上配得上那些 Token。
  • 长程坚持: 回放你最长的多步 Agent 会话;统计半途放弃、无效工具调用和人工干预次数(官方宣称的提升就在这里)。
  • 工具调用保真度: 核验 Schema、重试和错误恢复——后训练对工具行为的影响比多数表层都大。
  • 单个合格任务成本: 总 Token(含思考)除以通过复核的任务数,与你的 GLM-5.2 基线对比。
  • 自动路由审计(Coding Plan 用户): 先确认最近的请求实际由哪个模型服务,再把质量变化归因于你自己的 Prompt 改动。

哪些情况不该切换

五种情况支持暂时留在 GLM-5.2——第一条今天适用于所有按 Token 计费的集成:

  • 你还没法按 Token 计费——没有公开的按 Token 路由;在订阅之外,「切换」目前根本不是一个你能做的选择。
  • 你的工作负载依赖关闭 thinking 的行为,而按你的任务组合,重新分层换来的收益不值得。
  • 你的 GLM-5.2 集成正处在交付中——一条稳定、有价格的路由,永远胜过一个经济性未公布的「宣称改进」。
  • 你自部署——约 8 月 28 日前没有权重,且许可证(不同于 GLM-5.2)还是未知数。不要围绕尚未公布的条款做架构。
  • 你需要视觉能力——两个模型都没有;这次升级不改变这一点。

四步评估计划(现在就位,价格公布日开跑)

  1. 冻结基线。 本周就把 GLM-5.2 指标存档:质量通过率、延迟分位、单个合格任务成本、工具失败率。路由开放之后,「之前」就再也采不干净了。
  2. 回放,不要即兴。 固定 20–50 个代表性任务(包括你最常见的失败案例)作为测试套件。路由可调用当天在 GLM-5.3 上跑。
  3. 开一条挑战者通道。 把一小片低风险真实流量路由到 GLM-5.3,与 GLM-5.2 并行,走同一套 OpenAI 兼容契约,让切换只是一次配置变更——现任通道跑在 EvoLink 已上线的 GLM-5.2 路由上。
  4. 设晋升门槛和回滚闸。 定好数值化的晋升条件(例如单个合格任务成本改善 ≥10%、工具保真度无回归),在 GLM-5.3 连续两周达标之前,GLM-5.2 保持为经过测试的回退。

常见问题

现在该从 GLM-5.2 切到 GLM-5.3 吗?

如果你按 Token 调 API:还切不了——没有公开路由和价格。如果你在 GLM Coding Plan 上:你已经被切换了,GLM-5.2 请求会自动路由到 GLM-5.3。真正的问题是「要不要现在就把评估准备好」,这个问题的答案是要。

GLM-5.3 比 GLM-5.2 更大吗?

不是——它使用同一个基座模型。Z.ai 把全部提升归因于后训练,也没有单独公布参数量。

GLM-5.2 和 GLM-5.3 之间的破坏性变更是什么?

Thinking 不能再关闭。thinking.type: "disabled" 在 GLM-5.2 上可用,在 GLM-5.3 上不再支持;新的控制项是 reasoning_effortlow / high / max)。

GLM-5.3 会和 GLM-5.2 一个价吗?

未知。GLM-5.2 的标价是每百万 Token $1.40 / $0.26 / $4.40;GLM-5.3 没有公布价格。同基座让价格相近显得合理,但永远开启的 thinking 仍可能通过更高的输出 Token 量抬高真实账单。

基准提升是真的吗?

它们是官方口径,发布日没有独立复现——不过 Z.ai 自己的表格也显示它在多个项目上仍落后于 Claude Fable 5,这一点体现了坦诚。请把它们当作待你的回归测试集检验的假设,而不是定论。

GLM-5.3 能像 GLM-5.2 一样自部署吗?

还不能。权重承诺在发布约两周后(约 2026 年 8 月 28 日)放出,许可证尚未说明。GLM-5.2 的 MIT 式条款不会自动沿用。

GLM-5.3 加了视觉吗?

没有。两个模型都是纯文本;多模态工作仍在智谱独立的 GLM-V 产品线。

那 GLM 5.5 对比 GLM-5.2 呢?

GLM 5.5 是一个独立的、仍未官宣的模型——可能是 GLM-5.3 之后的那次发布。我们的 GLM 5.5 对比 GLM-5.2 指南保留了那套「等还是先上」的决策框架,等它真正出现时适用;本页覆盖的是实际发布的这一代。

参考来源

封面配图由 Nano Banana Pro(Gemini 图像模型)生成,并非本文对比的模型。本文所有结论基于官方 API 契约与文档,与图像输出无关。
事实最后核验于 2026 年 8 月 14 日。GLM-5.3 的价格、API 可用性或权重状态变化时,本对比随即更新。

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。