Seedance 2.5 已上线 EvoLink立即体验
GLM-5.3 与 GLM-5.2:同一基座模型的两个阶段对比
model-comparison

GLM-5.3 对比 GLM-5.2:改了什么、现在要不要切换?

Jacey
Jacey
2026年8月14日
更新于 2026年8月26日
14 分钟阅读
先给结论。截至 2026 年 8 月 26 日API 用户现在可以切换,但不应把 GLM-5.2 一刀切地全部替换掉。 GLM-5.3 保留相同的 100 万上下文与官方 Token 单价,却改变了推理行为,既可能让旧请求直接失败,也会改变真实任务成本。
GLM-5.3 首发时是订阅优先,Coding Plan 内的 GLM-5.2/5.1 请求已自动路由到 5.3。按 Token 的情况随后发生了变化:Z.ai 现已公布输入 $1.40、缓存 $0.26、输出 $4.40/百万 Token,EvoLink 也提供 glm-5.3 路由。本文集中回答已确认的行为变化,以及正式提升流量前应该怎样验证。

事实核查:到底确认了什么

两个模型来自同一个基座网络。Z.ai 表示 GLM-5.3 的所有提升都来自后训练——没有新的预训练,也没有新的参数量。这让升级决策变得很特别:架构、上下文窗口、模态都没变;变的是行为。
维度GLM-5.2GLM-5.3状态
基座模型与 GLM-5.2 相同官方确认
上下文 / 最大输出1M / 128K1M / 128K官方确认
模态纯文本纯文本(不支持视觉)官方确认
模型 IDglm-5.2glm-5.3(据官方示例)官方确认
关闭 thinking(disabled支持已移除官方确认——破坏性变更
reasoning_effortlow / high / max官方确认——新控制项
官方按 Token 价格每百万 Token $1.40 / 缓存 $0.26 / $4.40每百万 Token $1.40 / 缓存 $0.26 / $4.40官方牌价相同
开源权重已发布(MIT 式许可)承诺约 8 月 28 日;许可证未说明分阶段
EvoLink API 可用性已上线已以 glm-5.3 上线两个独立可路由 ID
完整的发布背景——各通道状态、时间线、「分阶段」在实践中意味着什么——见 GLM-5.3 发布追踪。本页只负责一个问题:要不要切、什么时候切。

官方宣称的提升——用买家的眼光看,不要用粉丝的眼光看

发布日所有数字都出自 Z.ai 自己(官方口径 / vendor-claimed;尚无独立复现)。模式很一致:后训练的功夫下在了 Agent 化的长程编程上。

基准GLM-5.2GLM-5.3如果成立,说明什么
Terminal Bench 3.04.628.3终端 / CLI Agent 行为大幅改善
SWE-Marathon v1.119.442.5长程任务的坚持能力大约翻倍
DeepSWE v1.146.266.9仓库级修复质量
FrontierSWE67.578.1按 Z.ai 自己的表格,仍落后于 Claude Fable 5(88.2)
ExploitBench24.454.4新增的网络安全能力;闭源模型仍然领先
这张表旁边要放两句实话。第一,Z.ai 标题里那个「提升 50%」来自其内部私有的 Code Bench——设计上就无法核验。第二,发布日开发者提出的那个问题(「后训练魔法是不是只是在过拟合基准?」)问得完全正确:同一基座上涨幅这么大时,「基准形状的提升」和「你的工作负载形状的提升」可能是两回事。能给出裁决的基准只有一个:你自己的回归测试集。

唯一确认的破坏性变更

GLM-5.3 移除了关闭 thinking 的能力。 GLM-5.2 接受 thinking.type: "disabled",用于快速、便宜、不带推理的调用;GLM-5.3 不再接受。
{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

如果你的集成在延迟敏感路径上用非思考调用(分类、抽取、短改写),这些路径不能干净地平移。在 GLM-5.3 路由上你有三个选项:

  1. 流量重新分层——非推理调用留给更便宜 / 更快的模型(GLM-5.2 或其他路由),只把 Agent 类工作发给 GLM-5.3。
  2. reasoning_effort: "low" 作为最接近的替代,并实测延迟和 Token 开销是否可接受。
  3. 按任务而不是按 Token 重算成本——永远开启的 thinking 会改变输出 Token 量,所以即使最终价格与 GLM-5.2 相同(如果真是这样),账单也不会相同。

这也是 Coding Plan 静默自动路由值得警惕的原因:如果你订阅了,你的 GLM-5.2 请求已经在跑一个每次都思考的模型。8 月 14 日之后你察觉到的任何行为漂移,都多了一个合理解释。

GLM-5.2 已经证明的 vs GLM-5.3 还需要证明的

这组不对称就是决策本身:GLM-5.2 的价值在于所有运维未知数都已在真实路由上有了答案,而 GLM-5.3 尽管基座相同,却把其中几个答案重置了。

GLM-5.2 已在你的业务上证明什么GLM-5.3 必须在挑战者通道证明什么
已知的价格和计费行为相同牌价下的任务总成本仍能过线
稳定的请求契约,含关闭 thinking新契约:永远思考、按档位控制
工具调用、缓存、结构化输出经过生产验证同样的能力,需要逐路由重新验证
真实负载下的延迟和 429 行为一套全新部署的容量
MIT 式权重可自部署权重(约 8 月 28 日)与未说明的许可证
你积累的 Prompt / Agent 调优你的调优能否在行为变化后幸存

一句话:GLM-5.2 的价值不在跑分那一行——在于运维确定性;切换意味着交出一部分确定性,直到 GLM-5.3 在真实路由上重新挣回来。

行为变化测试清单

测的是变化,不是整个模型。同基座意味着你可以精准打增量:
  • 思考路径回归: 把原来的非思考工作负载放在 reasoning_effort: "low" 上跑;和 GLM-5.2 关闭 thinking 的版本对比延迟、输出 Token 和答案稳定性。
  • 档位扫描: 固定一组 Agent 任务,分别在 low / high / max 下跑;记录每档质量对 Token 成本。Z.ai 推荐编程用 max——验证它在你的任务上配得上那些 Token。
  • 长程坚持: 回放你最长的多步 Agent 会话;统计半途放弃、无效工具调用和人工干预次数(官方宣称的提升就在这里)。
  • 工具调用保真度: 核验 Schema、重试和错误恢复——后训练对工具行为的影响比多数表层都大。
  • 单个合格任务成本: 总 Token(含思考)除以通过复核的任务数,与你的 GLM-5.2 基线对比。
  • 自动路由审计(Coding Plan 用户): 先确认最近的请求实际由哪个模型服务,再把质量变化归因于你自己的 Prompt 改动。

哪些情况不该切换

四种情况仍然支持留在 GLM-5.2:

  • 你的工作负载依赖关闭 thinking 的行为,而按你的任务组合,重新分层换来的收益不值得。
  • 你的 GLM-5.2 集成正处在交付中——稳定路由永远胜过一个尚未通过回归门槛的迁移。
  • 你自部署——约 8 月 28 日前没有权重,且许可证(不同于 GLM-5.2)还是未知数。不要围绕尚未公布的条款做架构。
  • 你需要视觉能力——两个模型都没有;这次升级不改变这一点。

现在就能执行的四步评估计划

GLM-5.3 对比 GLM-5.2 的迁移流程:通过同一个 EvoLink 网关建立可度量的挑战者通道与回退路径
GLM-5.3 对比 GLM-5.2 的迁移流程:通过同一个 EvoLink 网关建立可度量的挑战者通道与回退路径
  1. 冻结基线。 先记录 GLM-5.2 的质量通过率、延迟分位、单个合格任务成本与工具失败率。
  2. 回放,不要即兴。 固定 20–50 个代表性任务,包括最常见失败样本;在 glm-5.3 的 low/high/max 三档上跑同一套任务。
  3. 开一条挑战者通道。 在同一把 EvoLink Key 后,让 GLM-5.3GLM-5.2 并行,只放一小片低风险真实流量。
  4. 设晋升门槛和回滚闸。 定好数值化的晋升条件(例如单个合格任务成本改善 ≥10%、工具保真度无回归),在 GLM-5.3 连续两周达标之前,GLM-5.2 保持为经过测试的回退。

常见问题

现在该从 GLM-5.2 切到 GLM-5.3 吗?

可以,但先做挑战者通道,不要全量替换。移除 thinking.type: "disabled",对同一批任务测试不同推理档位,只有每个可用任务成本和工具调用可靠性都过门槛才晋升。Coding Plan 用户可能已经被自动路由。

GLM-5.3 比 GLM-5.2 更大吗?

不是——它使用同一个基座模型。Z.ai 把全部提升归因于后训练,也没有单独公布参数量。

GLM-5.2 和 GLM-5.3 之间的破坏性变更是什么?

Thinking 不能再关闭。thinking.type: "disabled" 在 GLM-5.2 上可用,在 GLM-5.3 上不再支持;新的控制项是 reasoning_effortlow / high / max)。

GLM-5.3 会和 GLM-5.2 一个价吗?

两者当前官方牌价相同:每百万 Token 输入 $1.40、缓存输入 $0.26、输出 $4.40。但 GLM-5.3 始终思考,推理 Token 计入输出,实际账单仍可能不同;应比较每个被接受任务的总成本。

基准提升是真的吗?

它们是官方口径,发布日没有独立复现——不过 Z.ai 自己的表格也显示它在多个项目上仍落后于 Claude Fable 5,这一点体现了坦诚。请把它们当作待你的回归测试集检验的假设,而不是定论。

GLM-5.3 能像 GLM-5.2 一样自部署吗?

还不能。权重承诺在发布约两周后(约 2026 年 8 月 28 日)放出,许可证尚未说明。GLM-5.2 的 MIT 式条款不会自动沿用。

GLM-5.3 加了视觉吗?

没有。两个模型都是纯文本;多模态工作仍在智谱独立的 GLM-V 产品线。

那 GLM 5.5 对比 GLM-5.2 呢?

GLM 5.5 是一个独立的、仍未官宣的模型——可能是 GLM-5.3 之后的那次发布。我们的 GLM 5.5 对比 GLM-5.2 指南保留了那套「等还是先上」的决策框架,等它真正出现时适用;本页覆盖的是实际发布的这一代。

参考来源

封面配图由 Nano Banana Pro(Gemini 图像模型)生成,并非本文对比的模型。本文所有结论基于官方 API 契约与文档,与图像输出无关。
事实最后核验于 2026 年 8 月 26 日。价格、API 行为、权重或独立评测变化时,本对比随即更新。

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。