GLM 全模型接口 - Messages 完整参数
- 使用 Anthropic Messages 协议调用 GLM 系列模型,通过
model参数选择具体型号 - 请求 / 响应结构与 Anthropic API 对齐
- 系统提示词:通过顶层
system传入 - 思考模式:全系列默认开启思考,思考内容通过
content[type=thinking]block 返回;只有glm-5.2可传thinking.type=disabled关闭 - 流式输出:SSE 事件流
- 工具调用:兼容 Anthropic
tool_use/tool_result流程 - 图像输入:仅
glm-5.3-flash真正支持,详见messages字段说明
https://direct.evolink.ai,对文本模型支持更好,支持长连接;https://api.evolink.ai 是多模态主力地址,对文本模型作为备用地址使用。glm-5.2 支持 thinking.type: "disabled";glm-5.3 与 glm-5.3-flash 始终思考,传 disabled 会报错。从 glm-5.2 迁移时,请先移除写死的 disabled 再切换模型。授权
##所有接口均需要使用 Bearer Token 进行认证##
获取 API Key:
访问 API Key 管理页面 获取您的 API Key
使用时在请求头中添加:
备注:EvoLink 对 /v1/messages 统一采用 Bearer Token 鉴权。
请求体
要调用的模型:
glm-5.3, glm-5.3-flash, glm-5.2 "glm-5.3"
对话消息列表,按轮次 user / assistant 交替
说明:
- 至少包含 1 条消息
- 最后一条消息通常为
role=user - 支持多轮上下文,模型会引用历史消息
图像输入:只有 glm-5.3-flash 支持,通过 content 数组里的 {"type":"image","source":{...}} 块传入。
向 glm-5.3 或 glm-5.2 传入图像内容块不会报错,但模型无法读取图片内容。请求正常返回 200,模型仅依据文字部分作答,给出看似正常、实际与图片无关的回复,且多次请求结果并不一致。
这类静默失败在生产环境中难以排查,需要图像理解时请选择 glm-5.3-flash。
1指定生成内容长度的上限(Token 数)
说明:
- GLM 系列最大支持 131,072 tokens(128K)输出长度,建议设置不小于
1024 - thinking 产生的 token 也计入该上限
- 达到上限时内容会被截断,响应
stop_reason=max_tokens
1 <= x <= 1310721024
系统提示词,用于设定 AI 角色与行为
说明:
- 支持字符串或内容块数组
- 通过顶层
system字段传入(不要放进 messages) - 模型会遵循 system 约束
- 过长的 system 可能被截断:需要长上下文请放入
messages,不要全部堆在system
"You are a helpful assistant."
采样温度
说明:
- 值越高输出越发散,越低越确定
- 建议范围
[0, 1]
0 <= x <= 11
核采样阈值
说明:
- 范围
[0, 1] - 建议不要同时调整 temperature 与 top_p
0 <= x <= 10.9
仅从概率最高的 K 个 token 中采样(Anthropic 特有参数)
说明:
- 值越小输出越确定,越大候选越多样
x >= 010
自定义停止序列:生成命中其中任一字符串时停止
说明:
- 命中即截断,命中处之前的内容正常返回
- 注意:命中停止序列时,GLM 系列的
stop_reason返回end_turn(而非 Anthropic 标准的stop_sequence),响应也不含stop_sequence字段。若客户端依赖stop_reason=="stop_sequence"判断命中,需特殊处理
是否以 SSE 流式返回
true:Server-Sent Events 流式返回(标准 Anthropic 事件序列:message_start / content_block_start / content_block_delta / message_delta / message_stop)false:完整响应后一次性返回(默认)
false
控制深度思考
说明:
- GLM 系列均为推理模型,不传该字段时默认开启思考
- 开启时响应
content数组中会出现type="thinking"的推理过程 block(按 output token 计费,signature可能为空串) - 仅
type二元开关有效:budget_tokens、effort等思考预算/等级参数不生效(会被忽略)
能否关闭因模型而异:
glm-5.2:传{"type":"disabled"}可关闭思考,显著减少 output tokenglm-5.3/glm-5.3-flash:始终思考,不可关闭。传disabled会报错
由此带来的结果:glm-5.3 系列在本端点无法降低思考开销。 关不掉(disabled 报错),
也调不小(budget_tokens 与 effort 均不生效,顶层 reasoning_effort 是 OpenAI 协议字段、本端点忽略)。
思考内容按 output token 计费,这部分开销在本端点是刚性的。
需要控制思考成本,请改用 Chat Completions 接口 ——
那边的 reasoning_effort 有 low / high / max 三档真实生效。glm-5.2 不受此限,它在本端点可以直接关闭思考。
从 glm-5.2 迁移:现有代码若写死 thinking.type=disabled,切换到 glm-5.3 前必须移除该字段,否则请求直接失败。
迁移后若原本依赖关闭思考来控制成本,本端点没有等效替代,需要一并考虑换用 Chat Completions 接口。
工具定义列表
说明:
- 遵循 Anthropic tool 定义规范
input_schema使用 JSON Schema 对象- 模型会返回标准
tool_useblock,stop_reason=tool_use
工具选择策略
请求元数据
响应
消息对象
Anthropic 风格的消息响应
消息唯一 ID(格式形如 msg_<uuid>)
响应对象类型
message assistant 实际使用的模型
"glm-5.3"
响应内容块列表
可能包含的 block type:
thinking:推理过程(思考开启时,默认开启)text:最终回答文本tool_use:模型发起的工具调用
停止原因
end_turn:自然结束(命中 stop_sequences 时也返回此值)max_tokens:达到 max_tokens 上限tool_use:模型触发工具调用
end_turn, max_tokens, tool_use Token 使用统计(Anthropic 规范)