GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验

GLM-5.3 FlashX API

GLM-5.3 FlashX 是智谱面向交互式编程与 Agent 工作流的高速多模态模型。在 EvoLink 对比它与 Flash 的调用成本,通过统一 API 接入。

Z.ai文本生成可用
$0.371 / 100 万输入 Token 起
API 文档
多模态输入图片 · 视频 · 文件输入思考常开Chat + Messages
生产路由已上线
上下文
1M 上下文 · 最大输出 131K
适用场景
交互式编码 Agent、截图分析、文档工作流
可输入
文本 + 图像 + 视频 + 文件
输出形态
文本 · JSON(结构化输出)· 工具调用

选择 GLM-5.3 FlashX

GLM-5.3 FlashX 是智谱面向交互式编程与 Agent 工作流的高速多模态模型。在 EvoLink 对比它与 Flash 的调用成本,通过统一 API 接入。

GLM-5.3 FlashX

智谱注重推理速度的多模态模型

已选择
模型 ID
glm-5.3-flashx
适合

交互式编码 Agent、截图分析、文档工作流

输入
$0.371 / 1M25.2 cr / 1M
缓存读取
$0.075 / 1M5.1 cr / 1M
输出
$1.250 / 1M85 cr / 1M

所有费率按每百万 Token 计,同时显示美元与 Credits,以你账户当前的价格为准。

GLM-5.3 FlashX 价格

集成前先估算一次 GLM-5.3 FlashX 请求的费用。计算器按你账户的当前费率计算,官方价格仅作对照。

请求费用计算器

输入一次请求的 Token 组合和成功的工具调用次数。

单次请求预估

GLM-5.3 FlashX
USD$0.0008
Credits0.0518
输入 Token0.0252 cr
缓存读取 Token0.0011 cr
输出 Token0.0255 cr

最低计费:每次请求 0.01 Credits。

预算指南

按当前 Token 组合估算可发起的请求数。
充值 Credits
$10
约 13127 次请求

快速测试

$50
约 65637 次请求

日常开发

$100
约 131274 次请求

生产评估

服务端工具费率

只有成功的服务端调用按次计费;失败的尝试不收工具费,但 Token 照常计费。
  • 网页搜索$0.010/ 次0.68 cr / 次

面向交互式多模态工作流的 GLM-5.3 FlashX

当等待模型输出拖慢编程或 Agent 工作流时,可以评估 FlashX。Flash 的 Token 单价更低;是否值得选择 FlashX,要看它在你的任务中节省的时间能否抵消价差。

GLM-5.3 FlashX 在 EvoLink 上以模型 ID glm-5.3-flashx 提供,支持 Chat Completions · Responses · Anthropic Messages,和其他模型共用同一把 API 密钥与余额。它提供 1M 上下文窗口,最大输出 131K Token,并支持图像输入、长文档分析、多步 Agent。

GLM-5.3 FlashX

GLM-5.3 FlashX 规格与能力

数字取自 EvoLink 路由配置;能力以 API 当前实际提供为准。

上下文窗口
1M Token
最大输出
131K Token
输入
文本 + 图像 + 视频 + 文件
输出
文本 · JSON(结构化输出)· 工具调用
推理
常开推理
工具调用
函数调用,支持多步工具序列
提示缓存
自动缓存读取,享较低费率
服务端工具
网页搜索,按成功调用次数计费
协议
Chat Completions · Responses · Anthropic Messages
模型 ID
glm-5.3-flashx

选择 FlashX 时真正需要比较什么

把速度定位与输入要求、任务质量、拿到可用结果的成本放在一起判断。

与 Flash 并列的速度优先选项

智谱将 FlashX 定位为推理提速选项。这不能证明它比 Flash 更准确,也不代表 EvoLink 的延迟保证。对比时应使用相同提示词、思考设置和输出上限。

长上下文中的多模态信息

智谱文档列出文本、图像、视频和文件输入,以及 100 万 Token 上下文。请求格式以 API 文档为准;模型返回文本,文件生成或实际操作由 Agent 的工具完成。

通过一个网关选择模型

通过 EvoLink 比较模型成本,并在统一 API 网关内接入。能以更低成本满足质量要求的任务可以保留在 Flash;响应时间影响体验时,再评估 FlashX。

哪些任务适合评估 GLM-5.3 FlashX

优先选择有人或其他工具正在等待模型下一步响应的任务。

交互式编码 Agent

在同一 Agent 循环中评估代码实现、调试和工具结果解读。测量拿到可用结果的完整耗时,包括工具执行和重试,不只看每秒输出多少 Token。

基于截图的开发

用界面截图帮助修改代码或解释视觉缺陷。检查结果是否符合参考图,同时确认所选 API 路由接受对应的图片格式。

需要即时反馈的文档工作流

围绕包含文字与视觉信息的文档,评估信息抽取和追问。对于可以等待的离线分类或批量处理,先对比单价更低的 Flash。

FlashX、Flash 与 GLM-5.3 怎么选

EvoLink

先对比下表的当前费率。FlashX 注重速度,Flash 的 Token 单价更低;更换模型前,应同时测量任务成功率和完整耗时。

GLM-5.3 FlashX
输入 / 输出$0.371 / $1.25
上下文1M
缓存缓存读取
最适合交互式编码 Agent、截图分析、文档工作流
GLM-5.3
输入 / 输出$1.4 / $4.4
上下文1M
缓存缓存读取
最适合可针对高难度推理评估这款纯文本旗舰。多模态请求不能原样转给只接受文本的模型。
GLM-5.3 Flash
输入 / 输出$0.15 / $0.5
上下文1M
缓存缓存读取
最适合适合离线处理和成本敏感任务的较低价多模态选项。等待响应成为瓶颈时再对比 FlashX,不应预设准确率会提高。

两种方式使用 GLM-5.3 FlashX:EvoLink API 或 Agent

产品后端与批量任务走 EvoLink API;编码与分析类工作可直接在 Codex、Claude、Gemini 里调用 GLM-5.3 FlashX。两条路径共用同一把 EvoLink API 密钥、余额、模型 ID 与请求记录。

方式一

用 EvoLink API 接入

适合:产品后端、批量任务、自动化流水线

向 EvoLink 发送 OpenAI 兼容的 Chat Completions(或 Anthropic Messages)请求,自行控制模型 ID、系统提示、输出预算、工具与结构化输出。

  1. 1在控制台创建 EvoLink API 密钥
  2. 2把 OpenAI 或 Anthropic SDK 的 base URL 指向 EvoLink,并选择上方显示的模型 ID
  3. 3先发一条有代表性的请求,从 usage 字段读取输入、缓存与输出 token
  4. 4按任务设置 max_tokens 与重试;多轮时保留 tool-call ID 与工具结果
方式二

用 Agent 调用

适合:在 Codex、Claude、Gemini 里做编码、评审与分析

把任务、要带入的材料和验收标准交给 Agent,由它组装请求、通过 EvoLink 调用 GLM-5.3 FlashX,并把回答连同 token 用量一起返回。

  1. 1在本地环境变量里配置 EVOLINK_API_KEY,不要写进代码或提示词
  2. 2描述任务、要带入的材料和期望的输出格式
  3. 3让 Agent 通过 EvoLink 调用 GLM-5.3 FlashX,并在发送前先展示请求
  4. 4让 Agent 汇报回答、token 用量和任何错误信息

GLM-5.3 FlashX API 代码示例与错误处理

这个示例是最短可运行的请求:一条 OpenAI 兼容的 Chat Completions 调用,带系统提示、用户消息和输出预算。完整参数与响应说明见 API 标签页。

查看完整 API 文档
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flashx",
    "messages": [
      { "role": "system", "content": "You extract structured data. Answer in JSON only." },
      { "role": "user", "content": "Extract the product, quantity, and unit price: 2 notebooks at $4.50 each." }
    ],
    "thinking": { "type": "enabled", "clear_thinking": false },
    "reasoning_effort": "low",
    "max_tokens": 4096,
    "temperature": 0.1
  }'

# Reasoning is always on for the 5.3 generation: do not send
# thinking.type "disabled". The same model ID works on /v1/messages
# (Anthropic Messages). The response includes choices[0].message and
# a usage object; image and video input is counted in prompt_tokens.

请求无效或参数不支持

对照 API 文档检查模型 ID、messages 数组和参数范围,去掉该路由不支持的字段。

鉴权或余额问题

检查 Authorization bearer token,并在控制台确认可用余额。

超出上下文长度

提示词 token 超过了 GLM-5.3 FlashX 的上下文窗口。裁剪或只检索相关材料,并复用缓存前缀。

触发限流(429)

退避并带抖动重试;用批处理或队列代替并发突发。

内容或工具调用被拒

重试前检查敏感内容、格式错误的 tool-call 参数和 JSON schema 不匹配。

分别估算输入、输出和缓存费用

使用本页对应模型 ID 的当前费率和计算器。用代表性请求核对返回的 usage 与实际账单;重复发送提示词,并不意味着一定命中缓存。

测量完整请求,而不只看生成速度

分别记录首 Token 延迟、输出速度、任务总耗时、重试和每个可用结果的成本。供应商公布的每秒 Token 数,不包含应用中的所有执行步骤。

GLM 模型家族

同一把 API 密钥、同一份余额,换档位不用改接入。

GLM-5.3

GLM-5.3

智谱旗舰推理模型

查看模型
GLM-5.2

GLM-5.2

上一代 GLM 旗舰。5.3 这一代不再允许关闭思考,依赖这个能力的客户端仍然需要它。

查看模型
GLM-5.3 Flash

GLM-5.3 Flash

智谱多模态大批量模型

查看模型

GLM-5.3 FlashX 之外的其他文本模型

DeepSeek V4 Flash

DeepSeek V4 Flash

DeepSeek 的走量模型,100 万上下文,缓存读取价极低。做大批量文本任务时,是最直接的成本对照。

查看模型
Gemini 3.7 Flash

Gemini 3.7 Flash

谷歌的低成本多模态模型——当图片和文档理解是决策关键时,适合当跨厂商对照。

查看模型
Kimi K3

Kimi K3

Moonshot 的长上下文推理路由,适合仓库级编码与多文档工作。

查看模型
GPT-5.6

GPT-5.6

OpenAI 的分档前沿系列(Sol / Terra / Luna),按能力、延迟与成本灵活路由。

查看模型

GLM-5.3 FlashX 延伸阅读

GLM-5.3 Flash 对比 GLM-5.3

GLM-5.3 Flash 对比 GLM-5.3

按输入模态、任务难度和每个可接受结果的成本选择路由,并建立 Flash 优先、失败升级的策略。

阅读文章
一个网关接三个编程 CLI

一个网关接三个编程 CLI

配置文件路径、环境变量,以及把编程 CLI 全部接到同一个端点的排障清单。

阅读文章

GLM-5.3 FlashX API 常见问题

GLM-5.3 FlashX 是什么?

FlashX 是智谱在 GLM-5.3 Flash 家族中注重速度的选项,面向交互式编程和多模态 Agent 工作流。Token 单价更高,并不能证明回答质量更高。

EvoLink 这个页面对应哪个模型 ID?

模型 ID 是 glm-5.3-flashx。各端点的请求格式和支持参数,请查看本页链接的 API 文档。

GLM-5.3 FlashX API 怎么收费?

价格区显示本模型的输入、输出和缓存读取费率。可用计算器按实际 Token 组合估算,并核对真实 usage 与账单;不要套用其他平台的价格或促销。

什么时候选 FlashX,什么时候选 Flash?

当响应时间限制交互体验时,可以评估 FlashX。Flash 的 Token 单价更低,离线批处理可能更适合它。请在相同设置下比较任务成功率、总耗时、重试和费用。

EvoLink 保证每秒 200 Token 吗?

本页不作速度保证。智谱公布的 FlashX 速度为 200 tokens/s,这是供应商声明,不是 EvoLink 实测结果或 SLA。请在自己的任务上分别测量首 Token 延迟与完整请求耗时。

FlashX 支持哪些输入和输出?

智谱列出的输入包括文本、图像、视频和文件,输出为文本。具体路由支持的格式请查阅所链接的 API 文档。支持视频或文件输入,不代表 API 会直接生成视频或 Office 文件。

能关闭思考吗?

智谱文档规定 FlashX 的 thinking.type 只支持 enabled;降低 reasoning_effort 不等于关闭思考。智谱建议 thinking.clear_thinking: false,clear_thinking 应放在 thinking 对象内;路由是否支持该参数请核对 API 文档。

媒体输入和缓存费用怎么估算?

用有代表性的请求核对 usage 和账单,再按价格区的对应费率计算。不要假设每张图片有固定 Token 数,也不要把每次重复提示都当作缓存命中。

FlashX 的上下文窗口有多大?

智谱文档列出 100 万 Token 上下文和最多 128K Token 输出。设置输出上限前,请核对规格表与 API 文档;输入上下文和输出额度是不同的限制。

可以把 GLM-5.3 当作备用模型吗?

对于没通过验收且兼容纯文本输入的任务,可以评估 GLM-5.3。它不接受相同的多模态输入,因此不能原样转发图像、视频或文件请求。应先定义输入处理、成本和重试规则。