curl --request POST \
--url https://direct.evolink.ai/v1/messages \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"max_tokens": 1024,
"messages": [
{
"role": "user",
"content": "Hola, mundo"
}
]
}
'{
"id": "msg_0842a705-9d0b-4eaa-b12d-09a4106326c5",
"type": "message",
"role": "assistant",
"model": "glm-5.3",
"content": [
{
"type": "thinking",
"thinking": "El usuario pide saludar con una sola palabra, basta con responder \"Hi\".",
"signature": ""
},
{
"type": "text",
"text": "Hi."
}
],
"stop_reason": "end_turn",
"usage": {
"input_tokens": 18,
"output_tokens": 101,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"prompt_tokens_details": {
"cached_tokens": 0
}
}
}Interfaz de todos los modelos GLM - Referencia completa de Messages
- Llama a los modelos de la serie GLM mediante el protocolo Anthropic Messages, eligiendo el modelo concreto con el parámetro
model - Las estructuras de solicitud y respuesta coinciden con la API de Anthropic
- Indicación del sistema: se envía por el campo
systemde nivel superior - Modo de pensamiento: el pensamiento viene activado por defecto en toda la serie y se devuelve en bloques
content[type=thinking]; sologlm-5.2puede desactivarlo conthinking.type=disabled - Streaming: flujo de eventos SSE
- Llamadas a herramientas: compatible con el flujo
tool_use/tool_resultde Anthropic - Entrada de imagen: compatible solo con
glm-5.3-flashyglm-5.3-flashx; consulta el campomessagespara más detalle
curl --request POST \
--url https://direct.evolink.ai/v1/messages \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"max_tokens": 1024,
"messages": [
{
"role": "user",
"content": "Hola, mundo"
}
]
}
'{
"id": "msg_0842a705-9d0b-4eaa-b12d-09a4106326c5",
"type": "message",
"role": "assistant",
"model": "glm-5.3",
"content": [
{
"type": "thinking",
"thinking": "El usuario pide saludar con una sola palabra, basta con responder \"Hi\".",
"signature": ""
},
{
"type": "text",
"text": "Hi."
}
],
"stop_reason": "end_turn",
"usage": {
"input_tokens": 18,
"output_tokens": 101,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"prompt_tokens_details": {
"cached_tokens": 0
}
}
}https://direct.evolink.ai, que ofrece mejor compatibilidad con los modelos de texto y las conexiones de larga duración. https://api.evolink.ai es el endpoint principal para los servicios multimodales y sirve como dirección de respaldo para los modelos de texto.thinking de la respuesta se facturan como tokens de salida; signature puede estar vacío.glm-5.2:thinking.type=disableddesactiva el razonamiento.glm-5.3/glm-5.3-flash/glm-5.3-flashx: el razonamiento siempre está activo.disabledmantiene el modo predeterminado y la facturación de sus tokens como salida.
thinking.budget_tokens y thinking.effort no definen el nivel de razonamiento de GLM. Consulta los valores compatibles en reasoning_effort, en el nivel superior. Un ajuste que desactiva el razonamiento en glm-5.2 deja de hacerlo al cambiar a la serie 5.3.reasoning_effort: Campo de compatibilidad de niveles GLM en el nivel superior de la solicitud, fuera de thinking. El endpoint lo acepta, pero no garantiza que controle la intensidad real del razonamiento.
Reglas de compatibilidad de glm-5.3 / glm-5.3-flash / glm-5.3-flashx
| Valor enviado | Valor compatible |
|---|---|
low / high / max | Sin cambios |
xhigh | max |
medium | high |
minimal / none | low; el razonamiento sigue activo |
minimal y none no desactivan el razonamiento de la serie 5.3. Sus tokens se facturan como salida. Los valores desconocidos se mantienen sin conversión de compatibilidad; usa los valores indicados. Estas reglas no se aplican a glm-5.2.
Para controlar la intensidad, usa reasoning_effort en Chat Completions o reasoning.effort en Responses.
glm-5.3-flash y glm-5.3-flashx admiten imágenes. Los bloques enviados a glm-5.3 o glm-5.2 pueden devolver 200 aunque el modelo no pueda leerlos. Elige un modelo compatible para comprender imágenes.Autorizaciones
##Todas las API requieren autenticación con Bearer Token##
Obtener la API Key:
Visita la Página de gestión de API Keys para obtener tu API Key
Añadir al encabezado de la solicitud al usarla:
Authorization: Bearer YOUR_API_KEY
Nota: EvoLink usa de forma unificada la autenticación con Bearer Token para /v1/messages.
Cuerpo
Modelo a invocar:
| ID del modelo | Posicionamiento | Pensamiento desactivable | Entrada de imagen |
|---|---|---|---|
glm-5.3 | Modelo insignia, con avances generalizados en ingeniería de software compleja y tareas de agente; contexto de 1M | No se puede desactivar | No compatible |
glm-5.3-flash | Modelo multimodal ligero, coste muy bajo y visión nativa; contexto de 1M | No se puede desactivar | Compatible |
glm-5.3-flashx | Modelo multimodal con entrada de imagen; contexto de 1M | No se puede desactivar | Compatible |
glm-5.2 | Insignia de la generación anterior, razonamiento complejo y contexto muy largo; contexto de 1M | Se puede desactivar (thinking.type=disabled) | No compatible |
glm-5.3, glm-5.3-flash, glm-5.3-flashx, glm-5.2 "glm-5.3"
Mensajes de conversación que alternan entre user y assistant. Incluye al menos un mensaje; el último suele tener role=user. Los mensajes anteriores aportan contexto para varios turnos.
Imágenes: solo glm-5.3-flash y glm-5.3-flashx admiten bloques image en el array content. Usa solo texto con glm-5.3 y glm-5.2. Una respuesta HTTP 200 no significa que un modelo sin soporte de imágenes las haya leído.
1Show child attributes
Show child attributes
Límite superior de la longitud del contenido generado (en tokens)
Nota:
- La serie GLM admite hasta 131.072 tokens (128K) de longitud de salida; se recomienda no bajar de
1024 - Los tokens producidos por thinking también cuentan para este límite
- Al alcanzar el límite, el contenido se trunca y la respuesta incluye
stop_reason=max_tokens
1 <= x <= 1310721024
Indicación de sistema, usada para definir el rol y el comportamiento de la IA
Notas:
- Admite una cadena o un array de bloques de contenido
- Se transfiere mediante el campo
systemde nivel superior (no lo incluyas en messages) - El modelo respetará las restricciones de system
- Un system demasiado largo puede truncarse: si necesitas un contexto largo, colócalo en
messages, no lo amontones todo ensystem
"You are a helpful assistant."
Temperatura de muestreo
Notas:
- Cuanto más alto el valor, más diversa la salida; cuanto más bajo, más determinista
- Rango recomendado
[0, 1]
0 <= x <= 11
Umbral de muestreo por núcleo
Notas:
- Rango
[0, 1] - Se recomienda no ajustar temperature y top_p simultáneamente
0 <= x <= 10.9
Muestrea solo entre los K tokens de mayor probabilidad (parámetro exclusivo de Anthropic)
Notas:
- Cuanto más pequeño el valor, más determinista la salida; cuanto más grande, más diversos los candidatos
x >= 010
Secuencias de parada personalizadas: la generación se detiene cuando se encuentra cualquiera de estas cadenas
Notas:
- Al encontrarla se trunca, el contenido anterior al punto de coincidencia se devuelve con normalidad
- Atención: al encontrar una secuencia de parada, el
stop_reasonde la serie GLM devuelveend_turn(en lugar delstop_sequenceestándar de Anthropic), y la respuesta tampoco incluye el campostop_sequence. Si el cliente se basa enstop_reason=="stop_sequence"para detectar la coincidencia, necesitarás un manejo especial
["\n\n"]
Si se devuelve en streaming mediante SSE
true: devolución en streaming mediante Server-Sent Events (secuencia de eventos estándar de Anthropic: message_start / content_block_start / content_block_delta / message_delta / message_stop)false: devuelve la respuesta completa de una sola vez (predeterminado)
false
Configuración del razonamiento. Todos los modelos lo activan por defecto. Los bloques thinking de la respuesta se facturan como tokens de salida; signature puede estar vacío.
- glm-5.2: thinking.type=disabled desactiva el razonamiento.
- glm-5.3 / glm-5.3-flash / glm-5.3-flashx: el razonamiento siempre está activo. disabled mantiene el modo predeterminado y la facturación de sus tokens como salida.
thinking.budget_tokens y thinking.effort no definen el nivel de razonamiento de GLM. Consulta los valores compatibles en reasoning_effort, en el nivel superior. Un ajuste que desactiva el razonamiento en glm-5.2 deja de hacerlo al cambiar a la serie 5.3.
Show child attributes
Show child attributes
Campo de compatibilidad de niveles GLM en el nivel superior de la solicitud, fuera de thinking. El endpoint lo acepta, pero no garantiza que controle la intensidad real del razonamiento.
Reglas de compatibilidad de glm-5.3 / glm-5.3-flash / glm-5.3-flashx
| Valor enviado | Valor compatible |
|---|---|
low / high / max | Sin cambios |
xhigh | max |
medium | high |
minimal / none | low; el razonamiento sigue activo |
minimal y none no desactivan el razonamiento de la serie 5.3. Sus tokens se facturan como salida. Los valores desconocidos se mantienen sin conversión de compatibilidad; usa los valores indicados. Estas reglas no se aplican a glm-5.2.
Para controlar la intensidad, usa reasoning_effort en Chat Completions o reasoning.effort en Responses.
max, xhigh, high, medium, low, minimal, none Lista de definiciones de herramientas
Notas:
- Sigue la especificación de definición de tool de Anthropic
input_schemausa un objeto JSON Schema- El modelo devuelve un bloque
tool_useestándar, constop_reason=tool_use
Show child attributes
Show child attributes
Estrategia de selección de herramientas
Show child attributes
Show child attributes
Metadatos de la solicitud
Show child attributes
Show child attributes
Respuesta
Objeto de mensaje
Respuesta de mensaje al estilo de Anthropic
ID único del mensaje (formato: msg_<uuid>)
Tipo de objeto de respuesta
message assistant Modelo realmente utilizado
"glm-5.3"
Lista de bloques de contenido de la respuesta
Posibles block type:
thinking: proceso de razonamiento (cuando el pensamiento está activado, activado de forma predeterminada)text: texto de la respuesta finaltool_use: llamada a herramienta iniciada por el modelo
Show child attributes
Show child attributes
Motivo de la parada
end_turn: finalización natural (también devuelve este valor al encontrar stop_sequences)max_tokens: se alcanzó el límite de max_tokenstool_use: el modelo activó una llamada a herramienta
end_turn, max_tokens, tool_use Estadísticas de uso de tokens (especificación de Anthropic)
Show child attributes
Show child attributes