curl --request POST \
--url https://direct.evolink.ai/v1/messages \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"max_tokens": 1024,
"messages": [
{
"role": "user",
"content": "你好,世界"
}
]
}
'{
"id": "msg_0842a705-9d0b-4eaa-b12d-09a4106326c5",
"type": "message",
"role": "assistant",
"model": "glm-5.3",
"content": [
{
"type": "thinking",
"thinking": "用户要求用一个词打招呼,回答 \"Hi\" 即可。",
"signature": ""
},
{
"type": "text",
"text": "Hi."
}
],
"stop_reason": "end_turn",
"usage": {
"input_tokens": 18,
"output_tokens": 101,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"prompt_tokens_details": {
"cached_tokens": 0
}
}
}GLM 全模型接口 - Messages 完整参数
- 使用 Anthropic Messages 协议调用 GLM 系列模型,通过
model参数选择具体型号 - 请求 / 响应结构与 Anthropic API 对齐
- 系统提示词:通过顶层
system传入 - 思考模式:全系列默认开启思考,思考内容通过
content[type=thinking]block 返回;只有glm-5.2可传thinking.type=disabled关闭 - 流式输出:SSE 事件流
- 工具调用:兼容 Anthropic
tool_use/tool_result流程 - 图像输入:仅
glm-5.3-flash与glm-5.3-flashx真正支持,详见messages字段说明
curl --request POST \
--url https://direct.evolink.ai/v1/messages \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"max_tokens": 1024,
"messages": [
{
"role": "user",
"content": "你好,世界"
}
]
}
'{
"id": "msg_0842a705-9d0b-4eaa-b12d-09a4106326c5",
"type": "message",
"role": "assistant",
"model": "glm-5.3",
"content": [
{
"type": "thinking",
"thinking": "用户要求用一个词打招呼,回答 \"Hi\" 即可。",
"signature": ""
},
{
"type": "text",
"text": "Hi."
}
],
"stop_reason": "end_turn",
"usage": {
"input_tokens": 18,
"output_tokens": 101,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"prompt_tokens_details": {
"cached_tokens": 0
}
}
}https://direct.evolink.ai,对文本模型支持更好,支持长连接;https://api.evolink.ai 是多模态主力地址,对文本模型作为备用地址使用。glm-5.2 支持通过 thinking.type: "disabled" 关闭思考;glm-5.3、glm-5.3-flash 与 glm-5.3-flashx 始终思考,传入 disabled 会继续使用默认思考模式,思考 token 仍按输出计费。顶层 reasoning_effort 作为兼容参数接收:5.3 系列将 xhigh 对应为 max、medium 对应为 high、minimal / none 对应为 low,low / high / max 保持原值。此字段在 Messages 接口不保证控制实际思考强度,minimal 与 none 也不会关闭思考。需要明确调节思考强度时,请使用 Chat Completions 的 reasoning_effort 或 Responses 的 reasoning.effort。glm-5.3-flash 与 glm-5.3-flashx。 向 glm-5.3 或 glm-5.2 传入图像内容块可能返回 200,但模型无法读取图片内容。需要图像理解时,请选择支持图像输入的型号。授权
##所有接口均需要使用 Bearer Token 进行认证##
获取 API Key:
访问 API Key 管理页面 获取您的 API Key
使用时在请求头中添加:
Authorization: Bearer YOUR_API_KEY
备注:EvoLink 对 /v1/messages 统一采用 Bearer Token 鉴权。
请求体
要调用的模型:
| 模型 ID | 定位 | 能否关闭思考 | 图像输入 |
|---|---|---|---|
glm-5.3 | 旗舰模型,复杂软件工程与 Agent 任务能力全面进阶;1M 上下文 | 不可关闭 | 不支持 |
glm-5.3-flash | 轻量多模态模型,成本极低且原生支持视觉;1M 上下文 | 不可关闭 | 支持 |
glm-5.3-flashx | 多模态模型,支持图像输入;1M 上下文 | 不可关闭 | 支持 |
glm-5.2 | 上一代旗舰,复杂推理与超长上下文;1M 上下文 | 可关闭(thinking.type=disabled) | 不支持 |
glm-5.3, glm-5.3-flash, glm-5.3-flashx, glm-5.2 "glm-5.3"
对话消息列表,按轮次 user / assistant 交替。
- 至少包含 1 条消息。
- 最后一条消息通常为 role=user。
- 支持多轮上下文,模型会引用历史消息。
图像输入:仅 glm-5.3-flash 与 glm-5.3-flashx 支持,通过 content 数组里的 image 内容块传入。glm-5.3 与 glm-5.2 请使用纯文本;传入图片即使返回 200,也不表示模型读取了图片。
1Show child attributes
Show child attributes
指定生成内容长度的上限(Token 数)
说明:
- GLM 系列最大支持 131,072 tokens(128K)输出长度,建议设置不小于
1024 - thinking 产生的 token 也计入该上限
- 达到上限时内容会被截断,响应
stop_reason=max_tokens
1 <= x <= 1310721024
系统提示词,用于设定 AI 角色与行为
说明:
- 支持字符串或内容块数组
- 通过顶层
system字段传入(不要放进 messages) - 模型会遵循 system 约束
- 过长的 system 可能被截断:需要长上下文请放入
messages,不要全部堆在system
"You are a helpful assistant."
采样温度
说明:
- 值越高输出越发散,越低越确定
- 建议范围
[0, 1]
0 <= x <= 11
核采样阈值
说明:
- 范围
[0, 1] - 建议不要同时调整 temperature 与 top_p
0 <= x <= 10.9
仅从概率最高的 K 个 token 中采样(Anthropic 特有参数)
说明:
- 值越小输出越确定,越大候选越多样
x >= 010
自定义停止序列:生成命中其中任一字符串时停止
说明:
- 命中即截断,命中处之前的内容正常返回
- 注意:命中停止序列时,GLM 系列的
stop_reason返回end_turn(而非 Anthropic 标准的stop_sequence),响应也不含stop_sequence字段。若客户端依赖stop_reason=="stop_sequence"判断命中,需特殊处理
["\n\n"]
是否以 SSE 流式返回
true:Server-Sent Events 流式返回(标准 Anthropic 事件序列:message_start / content_block_start / content_block_delta / message_delta / message_stop)false:完整响应后一次性返回(默认)
false
思考模式设置。所有模型默认开启思考,响应中的 thinking 内容块按输出 token 计费,signature 可能为空字符串。
glm-5.2:使用thinking.type: "disabled"可关闭思考。glm-5.3/glm-5.3-flash/glm-5.3-flashx:始终思考。传入disabled会继续使用默认思考模式,不会关闭思考,思考 token 仍按输出计费。
thinking.budget_tokens 和 thinking.effort 不用于设置 GLM 的思考档位。顶层 reasoning_effort 的兼容取值见对应字段说明。
从 glm-5.2 切换到 5.3 系列后,原有的关闭思考设置不会继续产生关闭效果。
Show child attributes
Show child attributes
GLM 推理档位兼容字段,位于请求顶层,不属于 thinking 对象。本接口接收该字段,但不保证它能控制实际思考强度。
glm-5.3 / glm-5.3-flash / glm-5.3-flashx 的兼容规则:
| 传入值 | 兼容取值 |
|---|---|
low / high / max | 保持对应档位 |
xhigh | max |
medium | high |
minimal / none | low,仍会思考 |
minimal 与 none 不会关闭 5.3 系列的思考,思考 token 仍按输出计费。未识别的值保持原值,不提供兼容映射;请使用表中列出的值。glm-5.2 不适用上述兼容规则。
需要明确调节思考强度时,请使用 Chat Completions 的 reasoning_effort 或 Responses 的 reasoning.effort。
max, xhigh, high, medium, low, minimal, none 工具定义列表
说明:
- 遵循 Anthropic tool 定义规范
input_schema使用 JSON Schema 对象- 模型会返回标准
tool_useblock,stop_reason=tool_use
Show child attributes
Show child attributes
工具选择策略
Show child attributes
Show child attributes
请求元数据
Show child attributes
Show child attributes
响应
消息对象
Anthropic 风格的消息响应
消息唯一 ID(格式形如 msg_<uuid>)
响应对象类型
message assistant 实际使用的模型
"glm-5.3"
响应内容块列表
可能包含的 block type:
thinking:推理过程(思考开启时,默认开启)text:最终回答文本tool_use:模型发起的工具调用
Show child attributes
Show child attributes
停止原因
end_turn:自然结束(命中 stop_sequences 时也返回此值)max_tokens:达到 max_tokens 上限tool_use:模型触发工具调用
end_turn, max_tokens, tool_use Token 使用统计(Anthropic 规范)
Show child attributes
Show child attributes