GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验

GLM-5.3 API

通过 EvoLink 统一对话 API 接入 Z.ai 的 GLM-5.3(也常被搜索为 Zhipu GLM-5.3 / GLM 5.3)。集成前可先测试长上下文编程、多步 Agent、提示缓存。

Z.ai文本生成可用
$1.059 / 100 万输入 Token 起$1.177 官方价-10%
API 文档
常开推理提示缓存工具调用Chat + Messages
生产路由已上线
上下文
1M 上下文 · 最大输出 131K
适用场景
编程 Agent、长链路任务、重工具调用流程
可输入
文本
输出形态
文本 · JSON(结构化输出)· 工具调用

选择 GLM-5.3

智谱面向编程 Agent 与长周期工程任务的旗舰推理模型:100 万 Token 上下文、思考常开、工具调用、提示缓存,同时支持 Chat Completions 与 Anthropic Messages 两个端点。

GLM-5.3

智谱旗舰推理模型

已选择
模型 ID
glm-5.3
适合

仓库级编程 Agent、长链路任务、重工具调用流程,以及前缀稳定、输入量主要由缓存读取承担的 Agent 循环。

输入
$1.059 / 1M-10%
72 cr / 1M$1.177官方价
缓存读取
$0.265 / 1M-10%
18 cr / 1M$0.295官方价
输出
$3.706 / 1M-10%
252 cr / 1M$4.118官方价

所有费率按每百万 Token 计,同时显示美元与 Credits,以你账户当前的价格为准。

GLM-5.3 价格

集成前先估算一次 GLM-5.3 请求的费用。计算器按你账户的当前费率计算,官方价格仅作对照。

请求费用计算器

输入一次请求的 Token 组合和成功的工具调用次数。

单次请求预估

GLM-5.3
USD$0.0023
Credits0.1512

官方价预估 $0.0025 · 省 $0.0003(10%)

输入 Token0.072 cr
缓存读取 Token0.0036 cr
输出 Token0.0756 cr

最低计费:每次请求 0.01 Credits。

预算指南

按当前 Token 组合估算可发起的请求数。
充值 Credits
$10
约 4497 次请求

快速测试

$50
约 22486 次请求

日常开发

$100
约 44973 次请求

生产评估

服务端工具费率

只有成功的服务端调用按次计费;失败的尝试不收工具费,但 Token 照常计费。
  • 网页搜索$0.010/ 次0.68 cr / 次

面向编程 Agent 与长周期工程任务的 GLM-5.3 API

通过 EvoLink 统一 API 调用智谱旗舰推理模型:输入 $1.06、输出 $3.71/百万 Token,模型 ID 为 glm-5.3,并支持 100 万 Token 上下文、low/high/max 三档常开推理、工具调用与提示缓存。

GLM-5.3 在 EvoLink 上以模型 ID glm-5.3 提供,支持 Chat Completions · Responses · Anthropic Messages,和其他模型共用同一把 API 密钥与余额。它提供 1M 上下文窗口,最大输出 131K Token,并支持长上下文编程、多步 Agent、提示缓存。

GLM-5.3

GLM-5.3 规格与能力

数字取自 EvoLink 路由配置;能力以 API 当前实际提供为准。

上下文窗口
1M Token
最大输出
131K Token
输入
文本
输出
文本 · JSON(结构化输出)· 工具调用
推理
常开推理
工具调用
函数调用,支持多步工具序列
提示缓存
自动缓存读取,享较低费率
服务端工具
网页搜索,按成功调用次数计费
协议
Chat Completions · Responses · Anthropic Messages
模型 ID
glm-5.3

为什么 GLM-5.3 能处理这些复杂任务

主要靠三个特性。每一个特性同时也暗示着一种用错的方式,所以在切生产流量之前值得先弄明白。

100 万 Token 工作上下文,全程单一费率

没有长上下文阶梯价——第 90 万个 Token 的单价和第 1000 个完全一样。这消除了激进截断的一个常见理由,但并不意味着把窗口填满是免费的,或者是准确的。

请求体字节保真透传

除模型名外,请求体原封不动送到上游,所以 GLM 私有字段、提示缓存前缀哈希和思考签名在两个端点上都能保住。

推理 Token 计入输出计费

推理不单列一项,而是算在 completion tokens 里,所以 131,072 的输出上限是推理和最终答案共用的。设置输出预算要按任务难度来,不要按上限来。

GLM-5.3 适合放在生产模型栈的哪一层

GLM-5.3 比 GLM-5.2 贵,比 Flash 贵得多,所以不该仅仅因为"它最新"就变成默认路由。它真正的优势场景,是更深的推理能实际省掉一次重试或一轮人工返工的任务。

仓库级编程任务

把相互关联的模块、测试和项目约定放进同一个 100 万 Token 上下文,而不是让编程 Agent 一次只看一个文件。收益体现在跨文件改动不再互相打架,而不是单文件补全变好看了。

长链路任务

「规划—执行—验证」这种要跑很多步的循环受益最大,因为早期一个推理错误会沿整条链放大。评估时要看整链完成率,而不是单步质量。

重工具调用的 Agent

庞大的工具定义和长指令块都待在被缓存的前缀里,所以多跑一步的边际成本接近缓存读取价,而不是完整输入价。

Anthropic 协议客户端直连

发往 /v1/messages 的请求按字节原样透传,提示缓存前缀和思考签名都完整保留。走 Claude 协议的编程 CLI 可以直接指向 EvoLink 并选择 glm-5.3,中间不需要任何转换层。

GLM-5.3 改变了什么——又打破了什么

GLM-5.3 不是 GLM-5.2 的无痛替换。有一个参数变更属于硬性断裂,价格也变了。把生产路由切过去之前,先看完这四条。

断裂变更:不能再关闭思考

GLM-5.3 始终思考,会直接拒绝 thinking.type: "disabled"。任何从 GLM-5.2 迁过来、仍在发送 disabled 模式的客户端都会直接失败。官方替代方案是 thinking.type: "enabled" 配合 reasoning_effort: "low"。

三档推理强度,默认是 max

reasoning_effort 接受 low、high、max 三个值,默认 max。由于输出 Token 包含推理 Token,这个档位会直接改变花费——在大批量常规调用上原样保留默认值,是 5.3 上最常见的超支方式。

缓存读取是这一页里最省钱的开关

缓存读取按新输入的四分之一计费。在系统提示和工具定义占据大部分输入的长 Agent 循环里,保持这段前缀逐字节稳定,对账单的影响比选哪个模型还大。

定价高于 GLM-5.2

输入、输出和缓存读取都比当前 GLM-5.2 高 12.5%:5.3 按官方价 9 折售卖,而 5.2 的折扣更深(8 折)。只在多出来的推理确实值这个价的任务上切 5.3,其余留在 5.2 或 Flash。

两种方式使用 GLM-5.3:EvoLink API 或 Agent

产品后端与批量任务走 EvoLink API;编码与分析类工作可直接在 Codex、Claude、Gemini 里调用 GLM-5.3。两条路径共用同一把 EvoLink API 密钥、余额、模型 ID 与请求记录。

方式一

用 EvoLink API 接入

适合:产品后端、批量任务、自动化流水线

向 EvoLink 发送 OpenAI 兼容的 Chat Completions(或 Anthropic Messages)请求,自行控制模型 ID、系统提示、输出预算、工具与结构化输出。

  1. 1在控制台创建 EvoLink API 密钥
  2. 2把 OpenAI 或 Anthropic SDK 的 base URL 指向 EvoLink,并选择上方显示的模型 ID
  3. 3先发一条有代表性的请求,从 usage 字段读取输入、缓存与输出 token
  4. 4按任务设置 max_tokens 与重试;多轮时保留 tool-call ID 与工具结果
方式二

用 Agent 调用

适合:在 Codex、Claude、Gemini 里做编码、评审与分析

把任务、要带入的材料和验收标准交给 Agent,由它组装请求、通过 EvoLink 调用 GLM-5.3,并把回答连同 token 用量一起返回。

  1. 1在本地环境变量里配置 EVOLINK_API_KEY,不要写进代码或提示词
  2. 2描述任务、要带入的材料和期望的输出格式
  3. 3让 Agent 通过 EvoLink 调用 GLM-5.3,并在发送前先展示请求
  4. 4让 Agent 汇报回答、token 用量和任何错误信息

GLM-5.3 API 代码示例与错误处理

这个示例是最短可运行的请求:一条 OpenAI 兼容的 Chat Completions 调用,带系统提示、用户消息和输出预算。完整参数与响应说明见 API 标签页。

查看完整 API 文档
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      { "role": "system", "content": "You are a senior engineer. Answer in JSON when asked." },
      { "role": "user", "content": "Review this diff and list risky changes as a JSON array:\n<diff>" }
    ],
    "reasoning_effort": "low",
    "max_tokens": 2048,
    "stream": true
  }'

# Reasoning is always on: reasoning_effort accepts low / high / max
# (default max) and thinking.type "disabled" is rejected.
# The same model ID works on /v1/messages (Anthropic Messages).
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens; completion tokens include reasoning).

请求无效或参数不支持

对照 API 文档检查模型 ID、messages 数组和参数范围,去掉该路由不支持的字段。

鉴权或余额问题

检查 Authorization bearer token,并在控制台确认可用余额。

超出上下文长度

提示词 token 超过了 GLM-5.3 的上下文窗口。裁剪或只检索相关材料,并复用缓存前缀。

触发限流(429)

退避并带抖动重试;用批处理或队列代替并发突发。

内容或工具调用被拒

重试前检查敏感内容、格式错误的 tool-call 参数和 JSON schema 不匹配。

正式接入 GLM-5.3 API 前必须确认的四件事

这四项检查能拦下我们在这个模型上见到的绝大多数迁移问题。前两项是硬性失败,后两项是不会报错的成本问题。

01

模型 ID 用 glm-5.3

Chat Completions 和 Anthropic Messages 用的是同一个 ID,与上游名称完全一致,没有别名需要转换。

必做
02

移除所有 thinking.type: "disabled"

这是相对 GLM-5.2 唯一的硬性断裂。改成 thinking.type: "enabled" 加 reasoning_effort: "low",然后把回归用的提示词重跑一遍。

断裂变更
03

主动设置 reasoning_effort

默认是 max。把常规调用和对延迟敏感的调用降到 low,确认通过率没掉,再把省下的钱落袋。

成本
04

确认缓存真的命中了

检查返回的 usage 里有没有出现缓存 Token。如果前缀在两次调用之间变了,每次请求都会按完整输入价计费,而响应本身完全看不出异常。

成本

缓存读取只要新输入的四分之一

命中缓存的输入走单独的低费率,所以稳定的系统提示、仓库规则和工具定义在长 Agent 循环里始终便宜。没有单独的缓存写入费用——上游不返回缓存创建 Token,我们也就不设这项 SKU。

100 万 Token 上下文,13.1 万输出上限

把相关代码、规范和 Agent 状态放在同一个上下文里。上限是容量不是目标:只检索真正需要的内容,保持前缀稳定以便命中缓存,并按任务难度设置输出预算。

比较 GLM-5.3 完成任务的总成本,不要只看 Token 单价

GLM-5.3 的单价比 GLM-5.2 和 Flash 都高。这件事只有和「每个模型多久能产出一个你真的敢发布的结果」放在一起看才有意义。切换路由之前,先在自己的任务上跟踪这些指标一周。

首次通过率被采纳的产出每个任务的重试次数推理 Token 占输出比例缓存命中率有效工具调用拿到可用结果的耗时回退率

单价贵 12.5% 但能三次里少返工一次的路由,实际更便宜;单价贵 12.5% 而什么都没改变的路由,只是个更贵的默认值。想分清这两者,唯一的办法是在同一批任务上把它们都测一遍。

切换之前,先和 GLM-5.2、Kimi K3 比一遍

EvoLink

GLM-5.3 的定价高于 GLM-5.2,所以真正要回答的问题是:在你自己的任务上,减少的重试和人工返工能不能盖住差价。先测量,再决定生产路由。

GLM-5.3
输入 / 输出$1.059 / $3.706
上下文1M
缓存缓存读取
最适合仓库级编程 Agent、长链路任务、重工具调用流程,以及前缀稳定、输入量主要由缓存读取承担的 Agent 循环。
GLM-5.2
输入 / 输出$0.942 / $3.295
上下文1M
缓存缓存读取
最适合上一代 GLM 旗舰,单价仍然更低。在 5.3 拿不出可测收益的任务上继续用它,依赖"关闭思考"的客户端也只能留在这一代。
Kimi K3
输入 / 输出$2.85 / $14.25
上下文1.05M
缓存自动缓存读取
最适合Moonshot 的 100 万上下文推理模型。做长上下文编程与 Agent 任务时,适合当跨厂商对照基线。

GLM 模型家族

同一把 API 密钥、同一份余额,换档位不用改接入。

GLM-5.2

GLM-5.2

上一代 GLM 旗舰,单价仍然更低。在 5.3 拿不出可测收益的任务上继续用它,依赖"关闭思考"的客户端也只能留在这一代。

查看模型
GLM-5.3 Flash

GLM-5.3 Flash

同代模型,价格约为 GLM-5.3 的十分之一,并且原生支持图片、视频、文件输入。大批量和多模态任务应该默认用它。

查看模型
GLM-5.3 FlashX

GLM-5.3 FlashX

智谱注重推理速度的多模态模型

查看模型

GLM-5.3 之外的其他文本模型

Kimi K3

Kimi K3

Moonshot 的 100 万上下文推理模型。做长上下文编程与 Agent 任务时,适合当跨厂商对照基线。

查看模型
DeepSeek V4 Pro

DeepSeek V4 Pro

成本敏感的长上下文基线,适合单价主导路由决策的批量推理场景。

查看模型
GPT-5.6

GPT-5.6

OpenAI 的分档前沿系列(Sol / Terra / Luna),按能力、延迟与成本灵活路由。

查看模型
Claude Opus 4.8

Claude Opus 4.8

Anthropic 的高端路由,适合长时间运行的智能体、复杂审阅与重判断工作。

查看模型

GLM-5.3 延伸阅读

GLM-5.3 Flash 对比 GLM-5.3

GLM-5.3 Flash 对比 GLM-5.3

按输入模态、任务难度和每个可接受结果的成本选择路由,并建立 Flash 优先、失败升级的策略。

阅读文章
GLM-5.3 发布了:哪些已上线

GLM-5.3 发布了:哪些已上线

8 月 14 日的发布究竟敲定了哪些规格、模型 ID 和开放节奏,发布时又还留着哪些空白。

阅读文章
GLM-5.3 对比 GLM-5.2

GLM-5.3 对比 GLM-5.2

同一个基座,提升全部来自后训练——外加"不能再关闭思考"这个断裂变更。什么情况下该留在 5.2。

阅读文章
GLM-5.3 对比 Claude

GLM-5.3 对比 Claude

把编程 Agent 切给任何一方之前,先比一遍基准测试、API 契约和实际可用性。

阅读文章
GLM-5.3 网络安全基准

GLM-5.3 网络安全基准

CyberGym 和 ExploitBench 的数字(按智谱自己的口径)到底说明了什么,防守方该怎么读。

阅读文章
一个网关接三个编程 CLI

一个网关接三个编程 CLI

配置文件路径、环境变量,以及把编程 CLI 全部接到同一个端点的排障清单。

阅读文章

GLM-5.3 API 常见问题

EvoLink 上可以调用 GLM-5.3 API 吗?

可以。GLM-5.3 已是正式模型,Chat Completions 和 Anthropic Messages 两个端点都能用。

GLM-5.3 API 应该使用哪个模型 ID?

两个端点都用 glm-5.3。EvoLink 的对外模型名与上游模型名完全一致,不需要做名称映射。

可以继续用 OpenAI SDK 或 Anthropic Messages 吗?

可以。把客户端指向 EvoLink,用同一个 API Key,模型填 glm-5.3 即可。请求体除模型名外按字节原样透传,提示缓存前缀和思考签名都不会被破坏。

还能像 GLM-5.2 那样关闭思考吗?

不能。GLM-5.3 始终启用思考,会直接拒绝 thinking.type: "disabled"。从 GLM-5.2 迁移时请改成 thinking.type: "enabled" 配合 reasoning_effort: "low",这是官方给出的替代方案。

reasoning_effort 该怎么选?

默认是 max。日常改动、分类和对延迟敏感的调用用 low;架构设计、调试和长链路任务用 high 或 max。输出 Token 包含推理 Token,所以这个档位会直接改变花费。

为什么 GLM-5.3 比 GLM-5.2 贵?

GLM-5.3 按官方价 9 折售卖,而 GLM-5.2 的折扣更深(8 折),所以输入、输出和缓存读取都高 12.5%。在多出来的推理确实能减少重试的任务上切 5.3,否则留在 5.2 或改用 GLM-5.3 Flash。

提示缓存怎么计费?

缓存读取有独立费率,是新输入的四分之一。没有缓存写入费用,因为上游不返回缓存创建 Token。想持续命中,就要保持提示前缀逐字节稳定。

上下文窗口和输出上限是多少?

上下文 1,000,000 Token,输出最多 131,072 Token,全程单一费率,没有长上下文阶梯价。

该用 GLM-5.3 还是 GLM-5.3 Flash?

Flash 的输入和输出价都是十分之一,还能接收图片、视频和文件。大批量、多模态和常规任务先用 Flash;当任务确实需要更深的推理,且通过率能盖住差价时再换 GLM-5.3。

GLM-5.3 能识别图片吗?

不能,GLM-5.3 是纯文本模型。需要图片、视频、文件输入请用 GLM-5.3 Flash。

怎么和 Claude、GPT、Kimi 对比?

用「每个通过验收的任务花多少钱」来评估 GLM-5.3 在编程 Agent 和长链路任务上的表现;Claude 和 GPT 当作能力上限基线;Kimi K3 当作跨厂商的长上下文对照。

生产评估应该测哪些指标?

首次通过率、被采纳的产出、重试次数、推理 Token 占输出的比例、缓存命中率、有效工具调用、拿到可用结果的耗时,以及回退率。