
GLM-5.3 对比 GLM-5.2:改了什么、现在要不要切换?
glm-5.3 路由。本文集中回答已确认的行为变化,以及正式提升流量前应该怎样验证。事实核查:到底确认了什么
| 维度 | GLM-5.2 | GLM-5.3 | 状态 |
|---|---|---|---|
| 基座模型 | — | 与 GLM-5.2 相同 | 官方确认 |
| 上下文 / 最大输出 | 1M / 128K | 1M / 128K | 官方确认 |
| 模态 | 纯文本 | 纯文本(不支持视觉) | 官方确认 |
| 模型 ID | glm-5.2 | glm-5.3(据官方示例) | 官方确认 |
关闭 thinking(disabled) | 支持 | 已移除 | 官方确认——破坏性变更 |
reasoning_effort | — | low / high / max | 官方确认——新控制项 |
| 官方按 Token 价格 | 每百万 Token $1.40 / 缓存 $0.26 / $4.40 | 每百万 Token $1.40 / 缓存 $0.26 / $4.40 | 官方牌价相同 |
| 开源权重 | 已发布(MIT 式许可) | 承诺约 8 月 28 日;许可证未说明 | 分阶段 |
| EvoLink API 可用性 | 已上线 | 已以 glm-5.3 上线 | 两个独立可路由 ID |
官方宣称的提升——用买家的眼光看,不要用粉丝的眼光看
发布日所有数字都出自 Z.ai 自己(官方口径 / vendor-claimed;尚无独立复现)。模式很一致:后训练的功夫下在了 Agent 化的长程编程上。
| 基准 | GLM-5.2 | GLM-5.3 | 如果成立,说明什么 |
|---|---|---|---|
| Terminal Bench 3.0 | 4.6 | 28.3 | 终端 / CLI Agent 行为大幅改善 |
| SWE-Marathon v1.1 | 19.4 | 42.5 | 长程任务的坚持能力大约翻倍 |
| DeepSWE v1.1 | 46.2 | 66.9 | 仓库级修复质量 |
| FrontierSWE | 67.5 | 78.1 | 按 Z.ai 自己的表格,仍落后于 Claude Fable 5(88.2) |
| ExploitBench | 24.4 | 54.4 | 新增的网络安全能力;闭源模型仍然领先 |
唯一确认的破坏性变更
thinking.type: "disabled",用于快速、便宜、不带推理的调用;GLM-5.3 不再接受。{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}如果你的集成在延迟敏感路径上用非思考调用(分类、抽取、短改写),这些路径不能干净地平移。在 GLM-5.3 路由上你有三个选项:
- 流量重新分层——非推理调用留给更便宜 / 更快的模型(GLM-5.2 或其他路由),只把 Agent 类工作发给 GLM-5.3。
- 用
reasoning_effort: "low"作为最接近的替代,并实测延迟和 Token 开销是否可接受。 - 按任务而不是按 Token 重算成本——永远开启的 thinking 会改变输出 Token 量,所以即使最终价格与 GLM-5.2 相同(如果真是这样),账单也不会相同。
这也是 Coding Plan 静默自动路由值得警惕的原因:如果你订阅了,你的 GLM-5.2 请求已经在跑一个每次都思考的模型。8 月 14 日之后你察觉到的任何行为漂移,都多了一个合理解释。
GLM-5.2 已经证明的 vs GLM-5.3 还需要证明的
这组不对称就是决策本身:GLM-5.2 的价值在于所有运维未知数都已在真实路由上有了答案,而 GLM-5.3 尽管基座相同,却把其中几个答案重置了。
| GLM-5.2 已在你的业务上证明什么 | GLM-5.3 必须在挑战者通道证明什么 |
|---|---|
| 已知的价格和计费行为 | 相同牌价下的任务总成本仍能过线 |
| 稳定的请求契约,含关闭 thinking | 新契约:永远思考、按档位控制 |
| 工具调用、缓存、结构化输出经过生产验证 | 同样的能力,需要逐路由重新验证 |
| 真实负载下的延迟和 429 行为 | 一套全新部署的容量 |
| MIT 式权重可自部署 | 权重(约 8 月 28 日)与未说明的许可证 |
| 你积累的 Prompt / Agent 调优 | 你的调优能否在行为变化后幸存 |
一句话:GLM-5.2 的价值不在跑分那一行——在于运维确定性;切换意味着交出一部分确定性,直到 GLM-5.3 在真实路由上重新挣回来。
行为变化测试清单
- 思考路径回归: 把原来的非思考工作负载放在
reasoning_effort: "low"上跑;和 GLM-5.2 关闭 thinking 的版本对比延迟、输出 Token 和答案稳定性。 - 档位扫描: 固定一组 Agent 任务,分别在
low/high/max下跑;记录每档质量对 Token 成本。Z.ai 推荐编程用max——验证它在你的任务上配得上那些 Token。 - 长程坚持: 回放你最长的多步 Agent 会话;统计半途放弃、无效工具调用和人工干预次数(官方宣称的提升就在这里)。
- 工具调用保真度: 核验 Schema、重试和错误恢复——后训练对工具行为的影响比多数表层都大。
- 单个合格任务成本: 总 Token(含思考)除以通过复核的任务数,与你的 GLM-5.2 基线对比。
- 自动路由审计(Coding Plan 用户): 先确认最近的请求实际由哪个模型服务,再把质量变化归因于你自己的 Prompt 改动。
哪些情况不该切换
四种情况仍然支持留在 GLM-5.2:
- 你的工作负载依赖关闭 thinking 的行为,而按你的任务组合,重新分层换来的收益不值得。
- 你的 GLM-5.2 集成正处在交付中——稳定路由永远胜过一个尚未通过回归门槛的迁移。
- 你自部署——约 8 月 28 日前没有权重,且许可证(不同于 GLM-5.2)还是未知数。不要围绕尚未公布的条款做架构。
- 你需要视觉能力——两个模型都没有;这次升级不改变这一点。
现在就能执行的四步评估计划

- 冻结基线。 先记录 GLM-5.2 的质量通过率、延迟分位、单个合格任务成本与工具失败率。
- 回放,不要即兴。 固定 20–50 个代表性任务,包括最常见失败样本;在
glm-5.3的 low/high/max 三档上跑同一套任务。 - 开一条挑战者通道。 在同一把 EvoLink Key 后,让 GLM-5.3 与 GLM-5.2 并行,只放一小片低风险真实流量。
- 设晋升门槛和回滚闸。 定好数值化的晋升条件(例如单个合格任务成本改善 ≥10%、工具保真度无回归),在 GLM-5.3 连续两周达标之前,GLM-5.2 保持为经过测试的回退。
常见问题
现在该从 GLM-5.2 切到 GLM-5.3 吗?
thinking.type: "disabled",对同一批任务测试不同推理档位,只有每个可用任务成本和工具调用可靠性都过门槛才晋升。Coding Plan 用户可能已经被自动路由。GLM-5.3 比 GLM-5.2 更大吗?
不是——它使用同一个基座模型。Z.ai 把全部提升归因于后训练,也没有单独公布参数量。
GLM-5.2 和 GLM-5.3 之间的破坏性变更是什么?
thinking.type: "disabled" 在 GLM-5.2 上可用,在 GLM-5.3 上不再支持;新的控制项是 reasoning_effort(low / high / max)。GLM-5.3 会和 GLM-5.2 一个价吗?
两者当前官方牌价相同:每百万 Token 输入 $1.40、缓存输入 $0.26、输出 $4.40。但 GLM-5.3 始终思考,推理 Token 计入输出,实际账单仍可能不同;应比较每个被接受任务的总成本。
基准提升是真的吗?
它们是官方口径,发布日没有独立复现——不过 Z.ai 自己的表格也显示它在多个项目上仍落后于 Claude Fable 5,这一点体现了坦诚。请把它们当作待你的回归测试集检验的假设,而不是定论。
GLM-5.3 能像 GLM-5.2 一样自部署吗?
还不能。权重承诺在发布约两周后(约 2026 年 8 月 28 日)放出,许可证尚未说明。GLM-5.2 的 MIT 式条款不会自动沿用。
GLM-5.3 加了视觉吗?
没有。两个模型都是纯文本;多模态工作仍在智谱独立的 GLM-V 产品线。
那 GLM 5.5 对比 GLM-5.2 呢?
参考来源
- Z.ai——GLM-5.3 官方公告(基座模型、thinking 变更、
reasoning_effort、基准表、权重时间表) - BigModel——GLM-5.3 文档(1M / 128K 与功能支持)
- Z.ai——价格页(当前 GLM-5.2 与 GLM-5.3 价格)
- Z.ai——GLM Coding Plan 文档(自动路由、点数倍率)
- EvoLink——GLM-5.3 发布追踪(逐通道可用性、更新记录)


