Skip to main content
POST
BaseURL 说明:默认 BaseURL 为 https://direct.evolink.ai,对文本模型支持更好,支持长连接;https://api.evolink.ai 是多模态主力地址,对文本模型作为备用地址使用。
能否关闭思考因模型而异:只有 glm-5.2 支持 thinking.type: "disabled"glm-5.3glm-5.3-flash 始终思考,传 disabled 会报错。从 glm-5.2 迁移时,请先移除写死的 disabled 再切换模型。
图像输入只有 glm-5.3-flash 支持,且传给其他模型不会报错。glm-5.3glm-5.2 传入图像内容块时,请求正常返回 200,但模型无法读取图片内容,只会依据文字部分作答,给出看似正常、实际与图片无关的回复,且多次请求结果并不一致。这类静默失败在生产环境中难以排查,需要图像理解时请选择 glm-5.3-flash

授权

Authorization
string
header
必填

##所有接口均需要使用 Bearer Token 进行认证##

获取 API Key

访问 API Key 管理页面 获取您的 API Key

使用时在请求头中添加

备注:EvoLink 对 /v1/messages 统一采用 Bearer Token 鉴权。

请求体

application/json
model
enum<string>
默认值:glm-5.3
必填

要调用的模型:

可用选项:
glm-5.3,
glm-5.3-flash,
glm-5.2
示例:

"glm-5.3"

messages
object[]
必填

对话消息列表,按轮次 user / assistant 交替

说明

  • 至少包含 1 条消息
  • 最后一条消息通常为 role=user
  • 支持多轮上下文,模型会引用历史消息

图像输入:只有 glm-5.3-flash 支持,通过 content 数组里的 {"type":"image","source":{...}} 块传入。

glm-5.3glm-5.2 传入图像内容块不会报错,但模型无法读取图片内容。请求正常返回 200,模型仅依据文字部分作答,给出看似正常、实际与图片无关的回复,且多次请求结果并不一致。

这类静默失败在生产环境中难以排查,需要图像理解时请选择 glm-5.3-flash

Minimum array length: 1
max_tokens
integer

指定生成内容长度的上限(Token 数)

说明

  • GLM 系列最大支持 131,072 tokens(128K)输出长度,建议设置不小于 1024
  • thinking 产生的 token 也计入该上限
  • 达到上限时内容会被截断,响应 stop_reason=max_tokens
必填范围: 1 <= x <= 131072
示例:

1024

system

系统提示词,用于设定 AI 角色与行为

说明

  • 支持字符串或内容块数组
  • 通过顶层 system 字段传入(不要放进 messages)
  • 模型会遵循 system 约束
  • 过长的 system 可能被截断:需要长上下文请放入 messages,不要全部堆在 system
示例:

"You are a helpful assistant."

temperature
number

采样温度

说明

  • 值越高输出越发散,越低越确定
  • 建议范围 [0, 1]
必填范围: 0 <= x <= 1
示例:

1

top_p
number

核采样阈值

说明

  • 范围 [0, 1]
  • 建议不要同时调整 temperature 与 top_p
必填范围: 0 <= x <= 1
示例:

0.9

top_k
integer

仅从概率最高的 K 个 token 中采样(Anthropic 特有参数)

说明

  • 值越小输出越确定,越大候选越多样
必填范围: x >= 0
示例:

10

stop_sequences
string[]

自定义停止序列:生成命中其中任一字符串时停止

说明

  • 命中即截断,命中处之前的内容正常返回
  • 注意:命中停止序列时,GLM 系列的 stop_reason 返回 end_turn(而非 Anthropic 标准的 stop_sequence),响应也不含 stop_sequence 字段。若客户端依赖 stop_reason=="stop_sequence" 判断命中,需特殊处理
示例:
stream
boolean
默认值:false

是否以 SSE 流式返回

  • true:Server-Sent Events 流式返回(标准 Anthropic 事件序列:message_start / content_block_start / content_block_delta / message_delta / message_stop)
  • false:完整响应后一次性返回(默认)
示例:

false

thinking
object

控制深度思考

说明

  • GLM 系列均为推理模型,不传该字段时默认开启思考
  • 开启时响应 content 数组中会出现 type="thinking" 的推理过程 block(按 output token 计费,signature 可能为空串)
  • type 二元开关有效budget_tokenseffort 等思考预算/等级参数不生效(会被忽略)

能否关闭因模型而异

  • glm-5.2:传 {"type":"disabled"} 可关闭思考,显著减少 output token
  • glm-5.3 / glm-5.3-flash始终思考,不可关闭。传 disabled 会报错

由此带来的结果:glm-5.3 系列在本端点无法降低思考开销。 关不掉(disabled 报错), 也调不小(budget_tokenseffort 均不生效,顶层 reasoning_effort 是 OpenAI 协议字段、本端点忽略)。 思考内容按 output token 计费,这部分开销在本端点是刚性的。

需要控制思考成本,请改用 Chat Completions 接口 —— 那边的 reasoning_effortlow / high / max 三档真实生效。glm-5.2 不受此限,它在本端点可以直接关闭思考。

glm-5.2 迁移:现有代码若写死 thinking.type=disabled,切换到 glm-5.3 前必须移除该字段,否则请求直接失败。 迁移后若原本依赖关闭思考来控制成本,本端点没有等效替代,需要一并考虑换用 Chat Completions 接口。

tools
object[]

工具定义列表

说明

  • 遵循 Anthropic tool 定义规范
  • input_schema 使用 JSON Schema 对象
  • 模型会返回标准 tool_use block,stop_reason=tool_use
tool_choice
object

工具选择策略

metadata
object

请求元数据

响应

消息对象

Anthropic 风格的消息响应

id
string

消息唯一 ID(格式形如 msg_<uuid>

type
enum<string>

响应对象类型

可用选项:
message
role
enum<string>
可用选项:
assistant
model
string

实际使用的模型

示例:

"glm-5.3"

content
object[]

响应内容块列表

可能包含的 block type

  • thinking:推理过程(思考开启时,默认开启)
  • text:最终回答文本
  • tool_use:模型发起的工具调用
stop_reason
enum<string>

停止原因

  • end_turn:自然结束(命中 stop_sequences 时也返回此值)
  • max_tokens:达到 max_tokens 上限
  • tool_use:模型触发工具调用
可用选项:
end_turn,
max_tokens,
tool_use
usage
object

Token 使用统计(Anthropic 规范)