GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验

GLM-5.3 Flash API

通过 EvoLink 统一对话 API 接入 Z.ai 的 GLM-5.3 Flash(也常被搜索为 GLM 5.3 Flash / Zhipu GLM-5.3 Flash)。集成前可先测试图像输入、长文档分析、多步 Agent。

Z.ai文本生成可用
$0.106 / 100 万输入 Token 起$0.118 官方价-10%
API 文档
多模态输入图片 · 视频 · 文件输入思考常开Chat + Messages
生产路由已上线
上下文
1M 上下文 · 最大输出 131K
适用场景
大批量分类抽取、截图与文档理解、常规 Agent 步骤
可输入
文本 + 图像
输出形态
文本 · JSON(结构化输出)· 工具调用

选择 GLM-5.3 Flash

5.3 这一代里原生支持多模态的成员:文本、图片、视频、文件都能输入,价格约为 GLM-5.3 的十分之一,同样是 100 万 Token 上下文、思考常开、工具调用与提示缓存。

GLM-5.3 Flash

智谱多模态大批量模型

已选择
模型 ID
glm-5.3-flash
适合

大批量分类与信息抽取、截图与文档理解、视频与文件分析,以及单价直接决定路由的常规 Agent 步骤。

输入
$0.106 / 1M-10%
7.2 cr / 1M$0.118官方价
缓存读取
$0.031 / 1M-9%
2.1 cr / 1M$0.034官方价
输出
$0.371 / 1M-10%
25.2 cr / 1M$0.412官方价

所有费率按每百万 Token 计,同时显示美元与 Credits,以你账户当前的价格为准。

GLM-5.3 Flash 价格

集成前先估算一次 GLM-5.3 Flash 请求的费用。计算器按你账户的当前费率计算,官方价格仅作对照。

请求费用计算器

输入一次请求的 Token 组合和成功的工具调用次数。

单次请求预估

GLM-5.3 Flash
USD$0.0003
Credits0.0153

官方价预估 $0.0003 · 省 $0.0001(9%)

输入 Token0.0072 cr
缓存读取 Token0.0005 cr
输出 Token0.0076 cr

最低计费:每次请求 0.01 Credits。

预算指南

按当前 Token 组合估算可发起的请求数。
充值 Credits
$10
约 42483 次请求

快速测试

$50
约 222222 次请求

日常开发

$100
约 444444 次请求

生产评估

服务端工具费率

只有成功的服务端调用按次计费;失败的尝试不收工具费,但 Token 照常计费。
  • 网页搜索$0.010/ 次0.68 cr / 次

面向多模态与大批量任务的 GLM-5.3 Flash API

5.3 这一代的走量档,接在 EvoLink 的统一 API 上:文本、图片、视频、文件都能输入,价格约为 GLM-5.3 的十分之一,上下文同样是 100 万 Token,同样思考常开、支持工具调用与提示缓存。

GLM-5.3 Flash 在 EvoLink 上以模型 ID glm-5.3-flash 提供,支持 Chat Completions · Responses · Anthropic Messages,和其他模型共用同一把 API 密钥与余额。它提供 1M 上下文窗口,最大输出 131K Token,并支持图像输入、长文档分析、多步 Agent。

GLM-5.3 Flash

GLM-5.3 Flash 规格与能力

数字取自 EvoLink 路由配置;能力以 API 当前实际提供为准。

上下文窗口
1M Token
最大输出
131K Token
输入
文本 + 图像
输出
文本 · JSON(结构化输出)· 工具调用
推理
常开推理
工具调用
函数调用,支持多步工具序列
提示缓存
自动缓存读取,享较低费率
服务端工具
网页搜索,按成功调用次数计费
协议
Chat Completions · Responses · Anthropic Messages
模型 ID
glm-5.3-flash

为什么 GLM-5.3 Flash 扛得住这么大的量

Flash 保留了 5.3 这一代的平台特性,只改变了价格和输入模态。正是这个组合让它可以当默认值,而不只是当兜底。

一次请求里混合文本与多媒体

一条消息可以同时带指令、若干张图片和一个文件,所以服务于同一个判断的材料能留在同一次调用里,而不必跨流水线拼接。

同样的 100 万上下文,同样的单一费率

Flash 不是短上下文模型。完整的 100 万窗口按单一费率提供,没有长上下文阶梯价——这正是大批量文档处理在这个价位上可行的原因。

缓存读取只是输入价的一小部分

稳定的系统提示和工具定义在整个长循环里都按缓存读取价计费。在一个本来就便宜的模型上,这会把多跑一步的边际成本压到接近于零。

GLM-5.3 Flash 适合放在生产模型栈的哪一层

Flash 的定价就是为走量设计的,所以问题很少是"用不用得起",而是"能不能过准确率门槛"。先用它跑,只把没过的升级上去,和旗舰之间的价差就开始为你干活了。

大批量分类与信息抽取

工单路由、打标签、结构化抽取、内容分拣——在这个价位上,整批重跑一遍的成本低于为了避免重跑而投入的工程时间。批量大小不再是约束。

截图与文档理解

把界面截图、扫描件、图表作为 image_url 块发过去,拿回结构化输出。这是 GLM-5.3 完全不具备的能力——旗舰是纯文本模型。

视频与文件分析

视频和文件是原生接收的,不需要走单独的转写流水线,所以一次请求就能带上混合材料,而不必拆成"先转写、再推理"两步。

大 Agent 里的常规步骤

总结工具返回、决定走哪个分支、重排输出格式——这些步骤占据了调用量的大头,但难度并不高。把旗舰留给推理深度真正决定结果的那些步骤。

GLM-5.3 Flash 给了你什么,又要求你确认什么

Flash 不是"窗口更小的阉割版 5.3"——上下文、协议、缓存机制完全一致。真正不同的有两点,其中一点还需要你自己实测。

原生多模态输入,这是旗舰没有的

文本、图片、视频、文件都通过标准的 messages 结构传入。图片放在 image_url 块里,url 填公网地址(官方推荐)或 Base64 Data URL,一张图一个块。

价格约为旗舰的十分之一

输入和输出都正好是 GLM-5.3 的十分之一,缓存读取更便宜。这个差距大到足以改变一个工作流的形态,而不只是改变它的账单数字。

推理约束和 5.3 这一代其余成员一致

这里同样思考常开,同样拒绝 thinking.type: "disabled"。智谱另外建议 Flash 使用 clear_thinking: false,这个参数会原样透传,不做改写。

多媒体 Token 的计量口径值得自己核一遍

图片和视频会计入 prompt_tokens 并按输入价计费,但上游没有公布每张图的 Token 换算公式。请用有代表性的样本跑一遍、读返回的 usage,按实测值而不是估算值来规划批量规模。

两种方式使用 GLM-5.3 Flash:EvoLink API 或 Agent

产品后端与批量任务走 EvoLink API;编码与分析类工作可直接在 Codex、Claude、Gemini 里调用 GLM-5.3 Flash。两条路径共用同一把 EvoLink API 密钥、余额、模型 ID 与请求记录。

方式一

用 EvoLink API 接入

适合:产品后端、批量任务、自动化流水线

向 EvoLink 发送 OpenAI 兼容的 Chat Completions(或 Anthropic Messages)请求,自行控制模型 ID、系统提示、输出预算、工具与结构化输出。

  1. 1在控制台创建 EvoLink API 密钥
  2. 2把 OpenAI 或 Anthropic SDK 的 base URL 指向 EvoLink,并选择上方显示的模型 ID
  3. 3先发一条有代表性的请求,从 usage 字段读取输入、缓存与输出 token
  4. 4按任务设置 max_tokens 与重试;多轮时保留 tool-call ID 与工具结果
方式二

用 Agent 调用

适合:在 Codex、Claude、Gemini 里做编码、评审与分析

把任务、要带入的材料和验收标准交给 Agent,由它组装请求、通过 EvoLink 调用 GLM-5.3 Flash,并把回答连同 token 用量一起返回。

  1. 1在本地环境变量里配置 EVOLINK_API_KEY,不要写进代码或提示词
  2. 2描述任务、要带入的材料和期望的输出格式
  3. 3让 Agent 通过 EvoLink 调用 GLM-5.3 Flash,并在发送前先展示请求
  4. 4让 Agent 汇报回答、token 用量和任何错误信息

GLM-5.3 Flash API 代码示例与错误处理

这个示例是最短可运行的请求:一条 OpenAI 兼容的 Chat Completions 调用,带系统提示、用户消息和输出预算。完整参数与响应说明见 API 标签页。

查看完整 API 文档
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [
      { "role": "system", "content": "You extract structured data. Answer in JSON only." },
      { "role": "user", "content": [
        { "type": "text", "text": "List every line item on this receipt as JSON." },
        { "type": "image_url", "image_url": { "url": "https://example.com/receipt.jpg" } }
      ] }
    ],
    "max_tokens": 1024,
    "temperature": 0.1
  }'

# Reasoning is always on for the 5.3 generation: do not send
# thinking.type "disabled". The same model ID works on /v1/messages
# (Anthropic Messages). The response includes choices[0].message and
# a usage object; image and video input is counted in prompt_tokens.

请求无效或参数不支持

对照 API 文档检查模型 ID、messages 数组和参数范围,去掉该路由不支持的字段。

鉴权或余额问题

检查 Authorization bearer token,并在控制台确认可用余额。

超出上下文长度

提示词 token 超过了 GLM-5.3 Flash 的上下文窗口。裁剪或只检索相关材料,并复用缓存前缀。

触发限流(429)

退避并带抖动重试;用批处理或队列代替并发突发。

内容或工具调用被拒

重试前检查敏感内容、格式错误的 tool-call 参数和 JSON schema 不匹配。

把量切给 GLM-5.3 Flash 之前必须确认的四件事

其中两项是正确性检查,两项是成本检查。多媒体 Token 那一项是最多团队跳过、事后在大批量上后悔的一项。

01

模型 ID 用 glm-5.3-flash

Chat Completions 和 Anthropic Messages 用同一个 ID,与上游名称完全一致。

必做
02

移除所有 thinking.type: "disabled"

5.3 这一整代都会拒绝它。想要最省最快的路径,请用 thinking.type: "enabled" 配合 reasoning_effort: "low"。

断裂变更
03

用真实样本测一遍多媒体 Token

发几张有代表性的图片或视频,从响应里读 prompt_tokens,自己算出每条的成本,再决定批量规模。

成本
04

定好升级到 GLM-5.3 的规则

提前定义什么算 Flash 失败、失败后触发什么。没有规则的团队,要么什么都不升级、把错误直接发出去,要么什么都升级、把价格优势全丢掉。

路由

缓存读取不到新输入的三分之一

命中缓存的输入走单独的低费率,稳定的系统提示和工具定义在长 Agent 循环里始终便宜。没有单独的缓存写入费用——上游不返回缓存创建 Token。

原生支持图片、视频、文件输入

图片放在 messages[].content[] 里的 image_url 块,url 传公网地址(官方推荐)或 Base64 Data URL,多图就放多个块。多媒体内容会计入 prompt_tokens,按输入价计费——正式跑大批量之前,先用有代表性的样本实测一遍。

先测出 GLM-5.3 Flash 的准确率差距,再给这个差距定价

有用的比较不是"Flash 对某个基准测试",而是"Flash 对 GLM-5.3,在你自己的任务上"。如果十次里有九次 Flash 和旗舰打平,那么"两个都用、只升级那一次"远比"十次都走旗舰"便宜。

首次通过率被采纳的产出升级到 GLM-5.3 的比例每次请求的多媒体 Token缓存命中率推理 Token 占输出比例拿到可用结果的耗时每个通过任务的成本

给准确率差距定价,而不是假设它。一个成本只有十分之一的模型,只要大部分时候是对的,"先跑再升级"就能胜过把所有请求都发给旗舰——但"大部分时候"是个需要你在自己的任务上测出来的数字,不能从基准测试里继承。

和 GLM-5.3、DeepSeek V4 Flash 比一比

EvoLink

Flash 是 5.3 这一代的走量档。先确认它能不能过你的准确率门槛;能过的话,和旗舰之间的价差大到足以改变所有常规任务的路由方式。

GLM-5.3 Flash
输入 / 输出$0.106 / $0.371
上下文1M
缓存缓存读取
最适合大批量分类与信息抽取、截图与文档理解、视频与文件分析,以及单价直接决定路由的常规 Agent 步骤。
GLM-5.3
输入 / 输出$1.059 / $3.706
上下文1M
缓存缓存读取
最适合5.3 旗舰:纯文本,Flash 的价格只有它的十分之一。当 Flash 在困难推理上过不了准确率门槛时,它是正确的升级目标。
DeepSeek V4 Flash
输入 / 输出$0.398 / $1.192
上下文1M
缓存缓存读取
最适合DeepSeek 的走量模型,100 万上下文,缓存读取价极低。做大批量文本任务时,是最直接的成本对照。

GLM 模型家族

同一把 API 密钥、同一份余额,换档位不用改接入。

GLM-5.3

GLM-5.3

智谱旗舰推理模型

查看模型
GLM-5.2

GLM-5.2

上一代 GLM 旗舰。5.3 这一代不再允许关闭思考,依赖这个能力的客户端仍然需要它。

查看模型
GLM-5.3 FlashX

GLM-5.3 FlashX

智谱注重推理速度的多模态模型

查看模型

GLM-5.3 Flash 之外的其他文本模型

DeepSeek V4 Flash

DeepSeek V4 Flash

DeepSeek 的走量模型,100 万上下文,缓存读取价极低。做大批量文本任务时,是最直接的成本对照。

查看模型
Gemini 3.7 Flash

Gemini 3.7 Flash

谷歌的低成本多模态模型——当图片和文档理解是决策关键时,适合当跨厂商对照。

查看模型
Kimi K3

Kimi K3

Moonshot 的长上下文推理路由,适合仓库级编码与多文档工作。

查看模型
GPT-5.6

GPT-5.6

OpenAI 的分档前沿系列(Sol / Terra / Luna),按能力、延迟与成本灵活路由。

查看模型

GLM-5.3 Flash 延伸阅读

GLM-5.3 Flash 对比 GLM-5.3

GLM-5.3 Flash 对比 GLM-5.3

按输入模态、任务难度和每个可接受结果的成本选择路由,并建立 Flash 优先、失败升级的策略。

阅读文章
GLM-5.3 发布了:哪些已上线

GLM-5.3 发布了:哪些已上线

8 月 14 日的发布就 5.3 这一代敲定了哪些规格、模型 ID 和开放节奏,当时又还留着哪些空白。

阅读文章
GLM-5.3 对比 GLM-5.2

GLM-5.3 对比 GLM-5.2

同一个基座,提升全部来自后训练,外加整代都不能再关闭思考这个断裂变更。

阅读文章
GLM-5.3 对比 Claude

GLM-5.3 对比 Claude

把 Agent 切给任何一个系列之前,先比一遍基准测试、API 契约和实际可用性。

阅读文章
GLM-5.3 网络安全基准

GLM-5.3 网络安全基准

CyberGym 和 ExploitBench 的数字(按智谱自己的口径)到底说明了什么,防守方该怎么读。

阅读文章
一个网关接三个编程 CLI

一个网关接三个编程 CLI

配置文件路径、环境变量,以及把编程 CLI 全部接到同一个端点的排障清单。

阅读文章

GLM-5.3 Flash API 常见问题

EvoLink 上可以调用 GLM-5.3 Flash API 吗?

可以。GLM-5.3 Flash 已是正式模型,Chat Completions 和 Anthropic Messages 两个端点都能用。

应该使用哪个模型 ID?

两个端点都用 glm-5.3-flash。EvoLink 的对外模型名与上游模型名完全一致。

Flash 支持哪些输入类型?

文本、图片、视频和文件。这是它和 GLM-5.3 最主要的区别——GLM-5.3 是纯文本模型。

图片怎么传?

在 messages[].content[] 里放 image_url 块,url 填公网地址(官方推荐)或 Base64 Data URL。多张图片就放多个 image_url 块。

图片和视频输入怎么计费?

多媒体内容会计入 prompt_tokens,按输入价计费,没有单独的多媒体 SKU。上游没有公布图片的 Token 换算公式,所以正式跑大批量之前,请先用有代表性的样本跑一遍,看返回的 usage 实际是多少。

能关闭思考吗?

不能。5.3 这一整代都始终启用思考,会拒绝 thinking.type: "disabled"。想要最省最快的路径,请用 thinking.type: "enabled" 配合 reasoning_effort: "low"。

clear_thinking 是什么,要设置吗?

它控制多轮之间是否清除此前的思考内容。智谱对 Flash 的官方建议是 clear_thinking: false。这个参数会原样透传,EvoLink 不做改写。

Flash 比 GLM-5.3 便宜多少?

输入和输出都是十分之一。这个差距通常大到足以支撑「先用 Flash 跑,只把没通过验收的请求升级到旗舰」这种做法。

提示缓存怎么计费?

缓存读取有独立费率,不到新输入的三分之一。没有缓存写入费用,因为上游不返回缓存创建 Token。想持续命中,就要保持提示前缀逐字节稳定。

上下文窗口和输出上限是多少?

上下文 1,000,000 Token,输出最多 131,072 Token,全程单一费率,没有长上下文阶梯价。

Flash 适合当大批量任务的默认模型吗?

适合,它的定价就是为走量设计的。分类、抽取、常规 Agent 步骤、文档与截图理解都很合适。只在更深的推理确实能改变结果时,才升级到 GLM-5.3。

生产评估应该测哪些指标?

首次通过率、被采纳的产出、重试次数、推理 Token 占输出的比例、缓存命中率、每次请求的多媒体 Token 量、拿到可用结果的耗时,以及升级到 GLM-5.3 的比例。