GLM-5.3 Flash API
选择 GLM-5.3 Flash
5.3 这一代里原生支持多模态的成员:文本、图片、视频、文件都能输入,价格约为 GLM-5.3 的九分之一,同样是 100 万 Token 上下文、思考常开、工具调用与提示缓存。
GLM-5.3 Flash
智谱多模态大批量模型
glm-5.3-flash大批量分类与信息抽取、截图与文档理解、视频与文件分析,以及单价直接决定路由的常规 Agent 步骤。
GLM-5.3 Flash 价格
把流量切过来之前先估一遍成本。所有用户组同价,输出 Token 已经包含推理 Token。
Token 计算器
填入单次请求的 Token 构成。预估请求成本
GLM-5.3 Flash最低消费:每次请求 0.01 积分。图片、视频、文件输入按输入 Token 计费。
预算参考
按当前用量组合估算可调用次数。快速测试
日常开发
生产评估
模型价格
| 模型 | 上下文 | 输入 Token | 缓存读取 Token | 输出 Token |
|---|---|---|---|---|
GLM-5.3 Flashglm-5.3-flash | 所有上下文长度 | $0.150 / 1M10.2 cr / 1M | $0.031 / 1M2.1 cr / 1M | $0.500 / 1M34 cr / 1M |
GLM-5.3 Flash
所有上下文长度美元与积分均按每 100 万 Token 计,全程 100 万上下文单一费率。
网络搜索按次单独计费:每次 0.68 积分。
面向多模态与大批量任务的 GLM-5.3 Flash API
5.3 这一代的走量档,接在 EvoLink 的统一 API 上:文本、图片、视频、文件都能输入,价格约为 GLM-5.3 的九分之一,上下文同样是 100 万 Token,同样思考常开、支持工具调用与提示缓存。

GLM-5.3 Flash 适合放在生产模型栈的哪一层
Flash 的定价就是为走量设计的,所以问题很少是"用不用得起",而是"能不能过准确率门槛"。先用它跑,只把没过的升级上去,和旗舰之间的价差就开始为你干活了。
大批量分类与信息抽取
工单路由、打标签、结构化抽取、内容分拣——在这个价位上,整批重跑一遍的成本低于为了避免重跑而投入的工程时间。批量大小不再是约束。
截图与文档理解
把界面截图、扫描件、图表作为 image_url 块发过去,拿回结构化输出。这是 GLM-5.3 完全不具备的能力——旗舰是纯文本模型。
视频与文件分析
视频和文件是原生接收的,不需要走单独的转写流水线,所以一次请求就能带上混合材料,而不必拆成"先转写、再推理"两步。
大 Agent 里的常规步骤
总结工具返回、决定走哪个分支、重排输出格式——这些步骤占据了调用量的大头,但难度并不高。把旗舰留给推理深度真正决定结果的那些步骤。
Flash 给了你什么,又要求你确认什么
Flash 不是"窗口更小的阉割版 5.3"——上下文、协议、缓存机制完全一致。真正不同的有两点,其中一点还需要你自己实测。
原生多模态输入,这是旗舰没有的
文本、图片、视频、文件都通过标准的 messages 结构传入。图片放在 image_url 块里,url 填公网地址(官方推荐)或 Base64 Data URL,一张图一个块。
价格约为旗舰的九分之一
输入和输出都接近 GLM-5.3 的九分之一,缓存读取更便宜。这个差距大到足以改变一个工作流的形态,而不只是改变它的账单数字。
推理约束和 5.3 这一代其余成员一致
这里同样思考常开,同样拒绝 thinking.type: "disabled"。智谱另外建议 Flash 使用 clear_thinking: false,这个参数会原样透传,不做改写。
多媒体 Token 的计量口径值得自己核一遍
图片和视频会计入 prompt_tokens 并按输入价计费,但上游没有公布每张图的 Token 换算公式。请用有代表性的样本跑一遍、读返回的 usage,按实测值而不是估算值来规划批量规模。
为什么 Flash 扛得住这么大的量
Flash 保留了 5.3 这一代的平台特性,只改变了价格和输入模态。正是这个组合让它可以当默认值,而不只是当兜底。
一次请求里混合文本与多媒体
一条消息可以同时带指令、若干张图片和一个文件,所以服务于同一个判断的材料能留在同一次调用里,而不必跨流水线拼接。
同样的 100 万上下文,同样的单一费率
Flash 不是短上下文模型。完整的 100 万窗口按单一费率提供,没有长上下文阶梯价——这正是大批量文档处理在这个价位上可行的原因。
缓存读取只是输入价的一小部分
稳定的系统提示和工具定义在整个长循环里都按缓存读取价计费。在一个本来就便宜的模型上,这会把多跑一步的边际成本压到接近于零。
把量切给 Flash 之前必须确认的四件事
其中两项是正确性检查,两项是成本检查。多媒体 Token 那一项是最多团队跳过、事后在大批量上后悔的一项。
模型 ID 用 glm-5.3-flash
Chat Completions 和 Anthropic Messages 用同一个 ID,与上游名称完全一致。
移除所有 thinking.type: "disabled"
5.3 这一整代都会拒绝它。想要最省最快的路径,请用 thinking.type: "enabled" 配合 reasoning_effort: "low"。
用真实样本测一遍多媒体 Token
发几张有代表性的图片或视频,从响应里读 prompt_tokens,自己算出每条的成本,再决定批量规模。
定好升级到 GLM-5.3 的规则
提前定义什么算 Flash 失败、失败后触发什么。没有规则的团队,要么什么都不升级、把错误直接发出去,要么什么都升级、把价格优势全丢掉。
先测出准确率差距,再给这个差距定价
有用的比较不是"Flash 对某个基准测试",而是"Flash 对 GLM-5.3,在你自己的任务上"。如果十次里有九次 Flash 和旗舰打平,那么"两个都用、只升级那一次"远比"十次都走旗舰"便宜。
给准确率差距定价,而不是假设它。一个成本只有九分之一的模型,只要大部分时候是对的,"先跑再升级"就能胜过把所有请求都发给旗舰——但"大部分时候"是个需要你在自己的任务上测出来的数字,不能从基准测试里继承。
和 GLM-5.3、DeepSeek V4 Flash 比一比
EvoLinkFlash 是 5.3 这一代的走量档。先确认它能不能过你的准确率门槛;能过的话,和旗舰之间的价差大到足以改变所有常规任务的路由方式。
| 模型 | GLM-5.3 Flash | GLM-5.3 | DeepSeek V4 Flash |
|---|---|---|---|
| 输入 / 输出 | $0.15 / $0.5 | $1.4 / $4.4 | $0.442 / $1.324 |
| 上下文 | 1M | 1M | 1M |
| 缓存 | 缓存读取 | 缓存读取 | 缓存读取 |
| 最适合 | 大批量分类与信息抽取、截图与文档理解、视频与文件分析,以及单价直接决定路由的常规 Agent 步骤。 | 5.3 旗舰:纯文本,价格约为九倍。当 Flash 在困难推理上过不了准确率门槛时,它是正确的升级目标。 | DeepSeek 的走量模型,100 万上下文,缓存读取价极低。做大批量文本任务时,是最直接的成本对照。 |
相关模型




相关阅读






GLM-5.3 Flash API 常见问题
EvoLink 上可以调用 GLM-5.3 Flash API 吗?
可以。GLM-5.3 Flash 已是正式模型,Chat Completions 和 Anthropic Messages 两个端点都能用。
应该使用哪个模型 ID?
两个端点都用 glm-5.3-flash。EvoLink 的对外模型名与上游模型名完全一致。
Flash 支持哪些输入类型?
文本、图片、视频和文件。这是它和 GLM-5.3 最主要的区别——GLM-5.3 是纯文本模型。
图片怎么传?
在 messages[].content[] 里放 image_url 块,url 填公网地址(官方推荐)或 Base64 Data URL。多张图片就放多个 image_url 块。
图片和视频输入怎么计费?
多媒体内容会计入 prompt_tokens,按输入价计费,没有单独的多媒体 SKU。上游没有公布图片的 Token 换算公式,所以正式跑大批量之前,请先用有代表性的样本跑一遍,看返回的 usage 实际是多少。
能关闭思考吗?
不能。5.3 这一整代都始终启用思考,会拒绝 thinking.type: "disabled"。想要最省最快的路径,请用 thinking.type: "enabled" 配合 reasoning_effort: "low"。
clear_thinking 是什么,要设置吗?
它控制多轮之间是否清除此前的思考内容。智谱对 Flash 的官方建议是 clear_thinking: false。这个参数会原样透传,EvoLink 不做改写。
Flash 比 GLM-5.3 便宜多少?
输入和输出都约为九分之一。这个差距通常大到足以支撑「先用 Flash 跑,只把没通过验收的请求升级到旗舰」这种做法。
提示缓存怎么计费?
缓存读取有独立费率,约为新输入的五分之一。没有缓存写入费用,因为上游不返回缓存创建 Token。想持续命中,就要保持提示前缀逐字节稳定。
上下文窗口和输出上限是多少?
上下文 1,000,000 Token,输出最多 131,072 Token,全程单一费率,没有长上下文阶梯价。
Flash 适合当大批量任务的默认模型吗?
适合,它的定价就是为走量设计的。分类、抽取、常规 Agent 步骤、文档与截图理解都很合适。只在更深的推理确实能改变结果时,才升级到 GLM-5.3。
生产评估应该测哪些指标?
首次通过率、被采纳的产出、重试次数、推理 Token 占输出的比例、缓存命中率、每次请求的多媒体 Token 量、拿到可用结果的耗时,以及升级到 GLM-5.3 的比例。