
GLM-5.3 对比 Claude:编码 Agent 该交给谁跑?
今天可以核实的事实
下表 GLM-5.3 一列的每一项都能追溯到 Z.ai 的发布博客和 BigModel 官方文档。Claude 一列只停留在 Anthropic 公开文档的层面——凡是没有文档依据或未经验证的地方,都会如实注明。
| 维度 | GLM-5.3 | Claude(Fable 5 / Opus 4.8) |
|---|---|---|
| 发布日期 | 2026 年 8 月 14 日(官方) | 均已发布并正式可用——见在线模型页 |
| 官方模型 ID | glm-5.3(来自 Z.ai 博客的 API 示例) | claude-fable-5 / claude-opus-4-8——以在线模型页为准 |
| 上下文 / 最大输出 | 1M / 128K(官方文档) | Anthropic 文档有载;路由后的具体数值见在线模型页 |
| 模态 | 纯文本——无视觉输入 | Anthropic 文档载明现役 Claude 模型支持图像输入 |
| Thinking 控制 | 仅 enabled——无法关闭;reasoning_effort 分 low/high/max | 自适应思考并配 effort 控制,依据 Anthropic 文档 |
| 按 token 计费 API | 分阶段开放——发布日不可调用 | 生产级 API 在线;Claude 路由今天即可经 EvoLink 调用 |
| 按 token 价格 | 未公布 | Anthropic 已公布;EvoLink 路由价格见在线模型页 |
| 开放权重 | 承诺发布后约两周(约 8 月 28 日);许可证未说明 | 不适用(闭源模型) |
| EvoLink 路由 | 未上线——待官方 API 开放并通过验证 | Claude Opus 4.8 已在 EvoLink 上线 |
Z.ai 发布的基准表——要仔细读
| 基准(Z.ai 的表) | GLM-5.3 | 对比模型 | 差距 |
|---|---|---|---|
| Terminal Bench 3.0 | 28.3 | Claude Fable 5:33.7 | 落后,但在追近(GLM-5.2 为 4.6) |
| FrontierSWE | 78.1 | Claude Fable 5:88.2 | 落后约 10 分 |
| ExploitBench | 54.4 | Mythos 5:78 | 明显落后于闭源模型 |
| ALE-CLI | 28.5 | GPT-5.6 Sol:28.6 | 接近持平(自称开源第一) |
作为买家该怎么读这张表:
- 坦诚本身是一个真实信号。 一家厂商敢发布一张自己输给 Claude Fable 5 的表,比只展示胜绩的厂商更可信。这说明数字没有被挑选到失去意义的程度。
- 但它仍然是厂商的一面之词。 基准由 Z.ai 挑选、评测由 Z.ai 执行、对手分数由 Z.ai 报告。表中没有任何一行经过第三方复现。每个单元格都应当作主张,而非测量结果。
- 趋势比快照更重要。 GLM-5.3 相对 GLM-5.2 的跃升(Terminal Bench 3.0 上 4.6 → 28.3;FrontierSWE 上 67.5 → 78.1)才是 Z.ai 想讲的故事:与 Claude 的差距在快速缩小。基准型的提升能否转化到你的工作负载上,正是配对评估要回答的问题——同基座后训练提升为何值得审视,见我们的 GLM-5.3 对比 GLM-5.2 迁移分析。
影响 Agent 框架的 API 契约差异
抛开基准不谈,两个模型暴露的请求契约有实质差异,而编码 Agent 框架恰恰对这些细节最敏感。
- Thinking 仅支持
enabled。GLM-5.2 接受的disabled已被移除。每一次调用都会推理;不存在快速的非思考路径。 - 深度由
reasoning_effort控制,分三档:low、high、max。Z.ai 建议编码场景使用max。 - BigModel 文档声明支持 function calling、MCP、流式输出、上下文缓存和结构化输出——这是文档层面的声明,尚未在公开路由上得到独立验证。
- Anthropic 描述现役模型具备自适应思考——模型自行校准何时推理、推理多少——并配有控制深度与 token 开销的 effort 档位。
- 工具调用、流式输出、缓存和结构化输出都是有文档、已投产的 API 能力,行为公开可查。
这对 Agent 框架意味着什么:
- 按延迟分层的流量无法平移。 如果你的 Agent 把廉价的非推理调用(分类、短改写、路由决策)和重型 Agent 调用混在一起发,GLM-5.3 会把 thinking 强加到所有调用上。
reasoning_effort: "low"是最接近的替代,其延迟与 token 开销是否可接受,是一个实证问题。 - 成本必须按任务算,不能按 token 算。 常开的 thinking 会改变输出 token 量。即便 GLM-5.3 的价格公布了,一张按 token 的价目表也回答不了「哪个模型把你的任务做完更便宜」。
- Effort 语义不可互换。 GLM-5.3 的三档
reasoning_effort和 Claude 的 effort 控制是两个模型上的两套旋钮。假设「high 就是 high」可以跨厂商通用的框架,必然会调错其中一个——应按提供商分别记录设置,而不是一一映射。
决策框架:切换、按兵不动,还是先备好赛道
今天这个决策有三个诚实的出口:继续路由到 Claude(可调用、已验证的选项);把 GLM-5.3 列为待评估的候选者;或者提前准备好挑战者赛道,让「切换」在经过验证的路由出现那天变成一次配置变更。选哪个,取决于下面这些信号。
GLM-5.3 值得一个评估位的信号
- 成本敏感的批量执行。 如果你的 Agent 流量中有大量边界清晰、可重复的编码执行任务,一个可信的低成本挑战者值得一条赛道——前提是它的价格存在。今天它不存在,所以这个信号指向筹备评估,而不是执行评估。
- 供应商多元化。 生产级 Agent 需要一条在单一厂商之外经过测试的后备通道。GLM-5.3 承诺的开放权重(约 8 月 28 日)带来了闭源模型给不了的自托管选项——但许可证尚未说明,先别围绕它做架构设计。
- 分阶段的准入逐一放开。 API 开放、价格公布、聚合平台接入。每一项落地,都让 GLM-5.3 从一则公告变成一条可测试的路由。
Claude 仍是默认选项的情形
- 最难的规划与长程任务。 Z.ai 自己的表就把 Claude Fable 5 排在前沿编码基准的前面。在独立的配对测试给出相反结论之前,举证责任在挑战者一方。
- 生产成熟度。 Claude 的 API 契约、限流行为和故障模式有文档、经实战;GLM-5.3 的公开路由尚不存在,其一切运维特性都无从得知。
- 已验证的路由不动。 如果你的 Claude 通道已经调优、有监控、验收门全绿,一个没有价格、无法调用的替代品不构成扰动它的理由。
混合模式:在位者赛道加挑战者赛道
现实中的第一步不是切换,而是分流。让 Claude 继续担任在位者,承接规划、评审和最难的任务;等经过验证的 GLM-5.3 路由出现后,在同一套 OpenAI 兼容契约后面喂给它一小片低风险真实流量,对照在位者度量每接受任务成本、工具调用合法率和延迟。
什么时候该重跑这组对比
三个触发条件,每一个都会实质改变这个决策:
- GLM-5.3 的按 token API 开放且价格公布。 这是任何成本论证的闸门。在此之前,「GLM-5.3 更便宜」是一句没有人有资格说的话。
- 开放权重落地(约 2026 年 8 月 28 日)。 权重加上宽松许可证会打开自托管和第三方推理服务的大门——那是另一套经济学和治理话题。Z.ai 承诺在安全审查后、发布约两周内放出权重;许可证尚未说明。
- 独立评测出现。 第一批第三方、同框架的 GLM-5.3 对 Claude 结果,会用证据取代厂商证词。那才是任何工作负载上「谁赢」的说法最早成为可能的时点。
在至少一个触发条件成真之前,正确的姿态是:Claude 流量原地不动,你的 GLM-5.3 评估方案随时待命——基线冻结、回放集固定、晋级阈值白纸黑字写好。
常见问题
编码场景下 GLM-5.3 比 Claude 强吗?
未知——截至 2026 年 8 月 14 日,不存在任何 GLM-5.3 对任何 Claude 模型的独立配对测试。仅有的公开数字来自 Z.ai 自己,而那张表显示 GLM-5.3 在 Terminal Bench 3.0(28.3 对 33.7)和 FrontierSWE(78.1 对 88.2)上落后于 Claude Fable 5。凭厂商自发布的表,做不出任何负责任的胜负判断。
今天能用 GLM-5.3 替代 Claude 吗?
按 token 计费的 API 流量不行。GLM-5.3 仅在 GLM Coding Plan 订阅和 ZCode 内发布;Z.ai 价格页没有 GLM-5.3 条目,BigModel 的 API 标注「即将上线」,截至 2026 年 8 月 14 日主流聚合平台也无法调用。Claude 路由今天即可调用。
GLM-5.3 比 Claude 便宜多少?
这个比较目前无法成立:GLM-5.3 没有公布按 token 价格。发布日你看到的任何成本说法都是猜测。等价格落地后,请比较每接受任务成本——GLM-5.3 常开的 thinking 会改变 token 量,单看 token 单价定不了胜负。
GLM-5.3 与 Claude Fable 5 的基准对比如何?
依据 Z.ai 自己的发布表(厂商自报):Terminal Bench 3.0 上 GLM-5.3 得 28.3、Claude Fable 5 得 33.7;FrontierSWE 上为 78.1 对 88.2。Z.ai 自己承认整体落后于 Claude Fable 5,同时宣称在若干条目上开源领先。目前尚无独立复现。
那 GLM-5.3 对 Claude Opus 4.8 呢?
Z.ai 的表里没有 Claude Opus 4.8 的行,所以这组配对完全没有已发布数字。考虑到 Opus 档位模型支撑着大量生产级编码 Agent,这个空白值得留意:这组对比只能等 GLM-5.3 路由可调用后,由你自己的配对评估来解决。
GLM-5.3 和 Claude 支持的 API 功能一样吗?
reasoning_effort。Anthropic 文档载明现役 Claude 模型为自适应思考配 effort 控制。框架设置无法一一平移。GLM-5.3 的 API 和价格什么时候可用?
未确认。BigModel 文档称 API「即将上线」,截至 2026 年 8 月 14 日,Z.ai 国际版价格页没有 GLM-5.3 条目。开放权重承诺在发布约两周后(约 8 月 28 日)放出,以安全审查为前提,许可证尚未说明。
EvoLink 能在 GLM-5.3 和 Claude 之间路由吗?
参考来源
- Z.ai——GLM-5.3: Frontier Coding with Emergent Cyber Capabilities(发布信息、基准表、thinking 行为、
reasoning_effort、权重时间表) - BigModel——GLM-5.3 文档(1M / 128K、纯文本模态、功能支持、API「即将上线」)
- Z.ai——价格页(截至 2026 年 8 月 14 日无 GLM-5.3 条目)
- Z.ai——GLM Coding Plan 文档(订阅优先的准入、自动路由)
- Anthropic——Claude 模型文档(Claude 模型可用性、thinking 与 effort 行为)
- EvoLink——GLM-5.3 发布追踪(逐通道可用性、更新记录)


