Interfaz de todos los modelos GLM - Referencia completa de Messages
- Llama a los modelos de la serie GLM mediante el protocolo Anthropic Messages, eligiendo el modelo concreto con el parámetro
model - Las estructuras de solicitud y respuesta coinciden con la API de Anthropic
- Indicación del sistema: se envía por el campo
systemde nivel superior - Modo de pensamiento: el pensamiento viene activado por defecto en toda la serie y se devuelve en bloques
content[type=thinking]; sologlm-5.2puede desactivarlo conthinking.type=disabled - Streaming: flujo de eventos SSE
- Llamadas a herramientas: compatible con el flujo
tool_use/tool_resultde Anthropic - Entrada de imagen: realmente compatible solo con
glm-5.3-flash; consulta el campomessagespara más detalle
https://direct.evolink.ai, que ofrece mejor compatibilidad con los modelos de texto y las conexiones de larga duración. https://api.evolink.ai es el endpoint principal para los servicios multimodales y sirve como dirección de respaldo para los modelos de texto.glm-5.2 admite thinking.type: "disabled"; glm-5.3 y glm-5.3-flash piensan siempre y devuelven un error si se envía disabled. Al migrar desde glm-5.2, elimina el disabled fijado en el código antes de cambiar de modelo.Autorizaciones
##Todas las API requieren autenticación con Bearer Token##
Obtener la API Key:
Visita la Página de gestión de API Keys para obtener tu API Key
Añadir al encabezado de la solicitud al usarla:
Nota: EvoLink usa de forma unificada la autenticación con Bearer Token para /v1/messages.
Cuerpo
Modelo a invocar:
glm-5.3, glm-5.3-flash, glm-5.2 "glm-5.3"
Lista de mensajes de la conversación, alternando turnos user / assistant
Nota:
- Se requiere al menos un mensaje
- El último mensaje suele ser
role=user - Se admite contexto de varios turnos y el modelo se apoya en el historial
Entrada de imagen: solo glm-5.3-flash la admite, mediante un bloque {"type":"image","source":{...}} dentro de la matriz content.
Enviar bloques de contenido de imagen a glm-5.3 o glm-5.2 no devuelve un error, pero el modelo no puede leer la imagen. La solicitud responde con 200 con normalidad y el modelo contesta solo a partir del texto: la respuesta parece plausible pero no guarda relación con la imagen, y el resultado no es consistente entre solicitudes.
Este tipo de fallo silencioso es difícil de diagnosticar en producción, así que elige glm-5.3-flash cuando necesites comprensión de imágenes.
1Límite superior de la longitud del contenido generado (en tokens)
Nota:
- La serie GLM admite hasta 131.072 tokens (128K) de longitud de salida; se recomienda no bajar de
1024 - Los tokens producidos por thinking también cuentan para este límite
- Al alcanzar el límite, el contenido se trunca y la respuesta incluye
stop_reason=max_tokens
1 <= x <= 1310721024
Indicación de sistema, usada para definir el rol y el comportamiento de la IA
Notas:
- Admite una cadena o un array de bloques de contenido
- Se transfiere mediante el campo
systemde nivel superior (no lo incluyas en messages) - El modelo respetará las restricciones de system
- Un system demasiado largo puede truncarse: si necesitas un contexto largo, colócalo en
messages, no lo amontones todo ensystem
"You are a helpful assistant."
Temperatura de muestreo
Notas:
- Cuanto más alto el valor, más diversa la salida; cuanto más bajo, más determinista
- Rango recomendado
[0, 1]
0 <= x <= 11
Umbral de muestreo por núcleo
Notas:
- Rango
[0, 1] - Se recomienda no ajustar temperature y top_p simultáneamente
0 <= x <= 10.9
Muestrea solo entre los K tokens de mayor probabilidad (parámetro exclusivo de Anthropic)
Notas:
- Cuanto más pequeño el valor, más determinista la salida; cuanto más grande, más diversos los candidatos
x >= 010
Secuencias de parada personalizadas: la generación se detiene cuando se encuentra cualquiera de estas cadenas
Notas:
- Al encontrarla se trunca, el contenido anterior al punto de coincidencia se devuelve con normalidad
- Atención: al encontrar una secuencia de parada, el
stop_reasonde la serie GLM devuelveend_turn(en lugar delstop_sequenceestándar de Anthropic), y la respuesta tampoco incluye el campostop_sequence. Si el cliente se basa enstop_reason=="stop_sequence"para detectar la coincidencia, necesitarás un manejo especial
Si se devuelve en streaming mediante SSE
true: devolución en streaming mediante Server-Sent Events (secuencia de eventos estándar de Anthropic: message_start / content_block_start / content_block_delta / message_delta / message_stop)false: devuelve la respuesta completa de una sola vez (predeterminado)
false
Controla el pensamiento profundo
Nota:
- Todos los modelos de la serie GLM son modelos de razonamiento y, si se omite este campo, el pensamiento viene activado por defecto
- Cuando está activo, la matriz
contentde la respuesta incluye un bloque de razonamientotype="thinking"(se factura como tokens de salida;signaturepuede ser una cadena vacía) - Solo actúa el interruptor binario
type: los parámetros de presupuesto o nivel de pensamiento comobudget_tokensyeffortno surten efecto (se ignoran)
Que se pueda desactivar depende del modelo:
glm-5.2: enviar{"type":"disabled"}desactiva el pensamiento y reduce notablemente los tokens de salidaglm-5.3/glm-5.3-flash: piensan siempre y no se pueden desactivar. Enviardisableddevuelve un error
La consecuencia: la serie glm-5.3 no puede reducir el coste de pensamiento en este endpoint. No se puede desactivar (disabled da error)
ni tampoco bajar (budget_tokens y effort no surten efecto, y el reasoning_effort de nivel superior es un campo del protocolo OpenAI que este endpoint ignora).
El contenido de pensamiento se factura como tokens de salida, así que en este endpoint ese coste es inevitable.
Para controlar el coste de pensamiento, cambia a la API Chat Completions —
allí reasoning_effort tiene tres niveles que sí surten efecto: low / high / max. glm-5.2 no está sujeto a este límite: puede desactivar el pensamiento directamente en este endpoint.
Migración desde glm-5.2: si tu código fija thinking.type=disabled, debes eliminar ese campo antes de cambiar a glm-5.3; de lo contrario, la solicitud falla directamente.
Y si dependías de desactivar el pensamiento para controlar el coste, este endpoint no ofrece un equivalente: contempla también el cambio a la API Chat Completions.
Lista de definiciones de herramientas
Notas:
- Sigue la especificación de definición de tool de Anthropic
input_schemausa un objeto JSON Schema- El modelo devuelve un bloque
tool_useestándar, constop_reason=tool_use
Estrategia de selección de herramientas
Metadatos de la solicitud
Respuesta
Objeto de mensaje
Respuesta de mensaje al estilo de Anthropic
ID único del mensaje (formato: msg_<uuid>)
Tipo de objeto de respuesta
message assistant Modelo realmente utilizado
"glm-5.3"
Lista de bloques de contenido de la respuesta
Posibles block type:
thinking: proceso de razonamiento (cuando el pensamiento está activado, activado de forma predeterminada)text: texto de la respuesta finaltool_use: llamada a herramienta iniciada por el modelo
Motivo de la parada
end_turn: finalización natural (también devuelve este valor al encontrar stop_sequences)max_tokens: se alcanzó el límite de max_tokenstool_use: el modelo activó una llamada a herramienta
end_turn, max_tokens, tool_use Estadísticas de uso de tokens (especificación de Anthropic)