
GLM-5.3 对比 GLM-5.2:改了什么、现在要不要切换?
事实核查:到底确认了什么
| 维度 | GLM-5.2 | GLM-5.3 | 状态 |
|---|---|---|---|
| 基座模型 | — | 与 GLM-5.2 相同 | 官方确认 |
| 上下文 / 最大输出 | 1M / 128K | 1M / 128K | 官方确认 |
| 模态 | 纯文本 | 纯文本(不支持视觉) | 官方确认 |
| 模型 ID | glm-5.2 | glm-5.3(据官方示例) | 官方确认 |
关闭 thinking(disabled) | 支持 | 已移除 | 官方确认——破坏性变更 |
reasoning_effort | — | low / high / max | 官方确认——新控制项 |
| 按 Token 价格 | 每百万 Token $1.40 / 缓存 $0.26 / $4.40 | 未公布 | 待公布 |
| 开源权重 | 已发布(MIT 式许可) | 承诺约 8 月 28 日;许可证未说明 | 分阶段 |
| API 可用性 | 已上线(Z.ai、BigModel、聚合平台、EvoLink) | 分阶段开放;发布日无法按 Token 调用 | 分阶段 |
官方宣称的提升——用买家的眼光看,不要用粉丝的眼光看
发布日所有数字都出自 Z.ai 自己(官方口径 / vendor-claimed;尚无独立复现)。模式很一致:后训练的功夫下在了 Agent 化的长程编程上。
| 基准 | GLM-5.2 | GLM-5.3 | 如果成立,说明什么 |
|---|---|---|---|
| Terminal Bench 3.0 | 4.6 | 28.3 | 终端 / CLI Agent 行为大幅改善 |
| SWE-Marathon v1.1 | 19.4 | 42.5 | 长程任务的坚持能力大约翻倍 |
| DeepSWE v1.1 | 46.2 | 66.9 | 仓库级修复质量 |
| FrontierSWE | 67.5 | 78.1 | 按 Z.ai 自己的表格,仍落后于 Claude Fable 5(88.2) |
| ExploitBench | 24.4 | 54.4 | 新增的网络安全能力;闭源模型仍然领先 |
唯一确认的破坏性变更
thinking.type: "disabled",用于快速、便宜、不带推理的调用;GLM-5.3 不再接受。{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}如果你的集成在延迟敏感路径上用非思考调用(分类、抽取、短改写),这些路径不能干净地平移。在 GLM-5.3 路由上你有三个选项:
- 流量重新分层——非推理调用留给更便宜 / 更快的模型(GLM-5.2 或其他路由),只把 Agent 类工作发给 GLM-5.3。
- 用
reasoning_effort: "low"作为最接近的替代,并实测延迟和 Token 开销是否可接受。 - 按任务而不是按 Token 重算成本——永远开启的 thinking 会改变输出 Token 量,所以即使最终价格与 GLM-5.2 相同(如果真是这样),账单也不会相同。
这也是 Coding Plan 静默自动路由值得警惕的原因:如果你订阅了,你的 GLM-5.2 请求已经在跑一个每次都思考的模型。8 月 14 日之后你察觉到的任何行为漂移,都多了一个合理解释。
GLM-5.2 已经证明的 vs GLM-5.3 还需要证明的
这组不对称就是决策本身:GLM-5.2 的价值在于所有运维未知数都已在真实路由上有了答案,而 GLM-5.3 尽管基座相同,却把其中几个答案重置了。
| GLM-5.2 已经证明(在真实路由上) | GLM-5.3 还需要证明(在一条还不存在的路由上) |
|---|---|
| 已知的价格和计费行为 | 有没有价格都还不知道 |
| 稳定的请求契约,含关闭 thinking | 新契约:永远思考、按档位控制 |
| 工具调用、缓存、结构化输出经过生产验证 | 同样的能力,需要逐路由重新验证 |
| 真实负载下的延迟和 429 行为 | 一套全新部署的容量 |
| MIT 式权重可自部署 | 权重(约 8 月 28 日)与未说明的许可证 |
| 你积累的 Prompt / Agent 调优 | 你的调优能否在行为变化后幸存 |
一句话:GLM-5.2 的价值不在跑分那一行——在于运维确定性;切换意味着交出一部分确定性,直到 GLM-5.3 在真实路由上重新挣回来。
行为变化测试清单
- 思考路径回归: 把原来的非思考工作负载放在
reasoning_effort: "low"上跑;和 GLM-5.2 关闭 thinking 的版本对比延迟、输出 Token 和答案稳定性。 - 档位扫描: 固定一组 Agent 任务,分别在
low/high/max下跑;记录每档质量对 Token 成本。Z.ai 推荐编程用max——验证它在你的任务上配得上那些 Token。 - 长程坚持: 回放你最长的多步 Agent 会话;统计半途放弃、无效工具调用和人工干预次数(官方宣称的提升就在这里)。
- 工具调用保真度: 核验 Schema、重试和错误恢复——后训练对工具行为的影响比多数表层都大。
- 单个合格任务成本: 总 Token(含思考)除以通过复核的任务数,与你的 GLM-5.2 基线对比。
- 自动路由审计(Coding Plan 用户): 先确认最近的请求实际由哪个模型服务,再把质量变化归因于你自己的 Prompt 改动。
哪些情况不该切换
五种情况支持暂时留在 GLM-5.2——第一条今天适用于所有按 Token 计费的集成:
- 你还没法按 Token 计费——没有公开的按 Token 路由;在订阅之外,「切换」目前根本不是一个你能做的选择。
- 你的工作负载依赖关闭 thinking 的行为,而按你的任务组合,重新分层换来的收益不值得。
- 你的 GLM-5.2 集成正处在交付中——一条稳定、有价格的路由,永远胜过一个经济性未公布的「宣称改进」。
- 你自部署——约 8 月 28 日前没有权重,且许可证(不同于 GLM-5.2)还是未知数。不要围绕尚未公布的条款做架构。
- 你需要视觉能力——两个模型都没有;这次升级不改变这一点。
四步评估计划(现在就位,价格公布日开跑)
- 冻结基线。 本周就把 GLM-5.2 指标存档:质量通过率、延迟分位、单个合格任务成本、工具失败率。路由开放之后,「之前」就再也采不干净了。
- 回放,不要即兴。 固定 20–50 个代表性任务(包括你最常见的失败案例)作为测试套件。路由可调用当天在 GLM-5.3 上跑。
- 开一条挑战者通道。 把一小片低风险真实流量路由到 GLM-5.3,与 GLM-5.2 并行,走同一套 OpenAI 兼容契约,让切换只是一次配置变更——现任通道跑在 EvoLink 已上线的 GLM-5.2 路由上。
- 设晋升门槛和回滚闸。 定好数值化的晋升条件(例如单个合格任务成本改善 ≥10%、工具保真度无回归),在 GLM-5.3 连续两周达标之前,GLM-5.2 保持为经过测试的回退。
常见问题
现在该从 GLM-5.2 切到 GLM-5.3 吗?
如果你按 Token 调 API:还切不了——没有公开路由和价格。如果你在 GLM Coding Plan 上:你已经被切换了,GLM-5.2 请求会自动路由到 GLM-5.3。真正的问题是「要不要现在就把评估准备好」,这个问题的答案是要。
GLM-5.3 比 GLM-5.2 更大吗?
不是——它使用同一个基座模型。Z.ai 把全部提升归因于后训练,也没有单独公布参数量。
GLM-5.2 和 GLM-5.3 之间的破坏性变更是什么?
thinking.type: "disabled" 在 GLM-5.2 上可用,在 GLM-5.3 上不再支持;新的控制项是 reasoning_effort(low / high / max)。GLM-5.3 会和 GLM-5.2 一个价吗?
未知。GLM-5.2 的标价是每百万 Token $1.40 / $0.26 / $4.40;GLM-5.3 没有公布价格。同基座让价格相近显得合理,但永远开启的 thinking 仍可能通过更高的输出 Token 量抬高真实账单。
基准提升是真的吗?
它们是官方口径,发布日没有独立复现——不过 Z.ai 自己的表格也显示它在多个项目上仍落后于 Claude Fable 5,这一点体现了坦诚。请把它们当作待你的回归测试集检验的假设,而不是定论。
GLM-5.3 能像 GLM-5.2 一样自部署吗?
还不能。权重承诺在发布约两周后(约 2026 年 8 月 28 日)放出,许可证尚未说明。GLM-5.2 的 MIT 式条款不会自动沿用。
GLM-5.3 加了视觉吗?
没有。两个模型都是纯文本;多模态工作仍在智谱独立的 GLM-V 产品线。
那 GLM 5.5 对比 GLM-5.2 呢?
参考来源
- Z.ai——GLM-5.3 官方公告(基座模型、thinking 变更、
reasoning_effort、基准表、权重时间表) - BigModel——GLM-5.3 文档(1M / 128K、功能支持、API「即将上线」)
- Z.ai——价格页(GLM-5.2 价格;截至 2026-08-14 无 GLM-5.3 条目)
- Z.ai——GLM Coding Plan 文档(自动路由、点数倍率)
- EvoLink——GLM-5.3 发布追踪(逐通道可用性、更新记录)


