Skip to main content
POST
BaseURL: La BaseURL predeterminada es https://direct.evolink.ai, que ofrece mejor compatibilidad con los modelos de texto y las conexiones de larga duración. https://api.evolink.ai es el endpoint principal para los servicios multimodales y sirve como dirección de respaldo para los modelos de texto.
Configuración del razonamiento. Todos los modelos lo activan por defecto. Los bloques thinking de la respuesta se facturan como tokens de salida; signature puede estar vacío.
  • glm-5.2: thinking.type=disabled desactiva el razonamiento.
  • glm-5.3 / glm-5.3-flash / glm-5.3-flashx: el razonamiento siempre está activo. disabled mantiene el modo predeterminado y la facturación de sus tokens como salida.
thinking.budget_tokens y thinking.effort no definen el nivel de razonamiento de GLM. Consulta los valores compatibles en reasoning_effort, en el nivel superior. Un ajuste que desactiva el razonamiento en glm-5.2 deja de hacerlo al cambiar a la serie 5.3.
reasoning_effort: Campo de compatibilidad de niveles GLM en el nivel superior de la solicitud, fuera de thinking. El endpoint lo acepta, pero no garantiza que controle la intensidad real del razonamiento. Reglas de compatibilidad de glm-5.3 / glm-5.3-flash / glm-5.3-flashx minimal y none no desactivan el razonamiento de la serie 5.3. Sus tokens se facturan como salida. Los valores desconocidos se mantienen sin conversión de compatibilidad; usa los valores indicados. Estas reglas no se aplican a glm-5.2. Para controlar la intensidad, usa reasoning_effort en Chat Completions o reasoning.effort en Responses.
Solo glm-5.3-flash y glm-5.3-flashx admiten imágenes. Los bloques enviados a glm-5.3 o glm-5.2 pueden devolver 200 aunque el modelo no pueda leerlos. Elige un modelo compatible para comprender imágenes.

Autorizaciones

Authorization
string
header
requerido

##Todas las API requieren autenticación con Bearer Token##

Obtener la API Key:

Visita la Página de gestión de API Keys para obtener tu API Key

Añadir al encabezado de la solicitud al usarla:

Nota: EvoLink usa de forma unificada la autenticación con Bearer Token para /v1/messages.

Cuerpo

application/json
model
enum<string>
predeterminado:glm-5.3
requerido

Modelo a invocar:

Opciones disponibles:
glm-5.3,
glm-5.3-flash,
glm-5.3-flashx,
glm-5.2
Ejemplo:

"glm-5.3"

messages
object[]
requerido

Mensajes de conversación que alternan entre user y assistant. Incluye al menos un mensaje; el último suele tener role=user. Los mensajes anteriores aportan contexto para varios turnos.

Imágenes: solo glm-5.3-flash y glm-5.3-flashx admiten bloques image en el array content. Usa solo texto con glm-5.3 y glm-5.2. Una respuesta HTTP 200 no significa que un modelo sin soporte de imágenes las haya leído.

Minimum array length: 1
max_tokens
integer

Límite superior de la longitud del contenido generado (en tokens)

Nota:

  • La serie GLM admite hasta 131.072 tokens (128K) de longitud de salida; se recomienda no bajar de 1024
  • Los tokens producidos por thinking también cuentan para este límite
  • Al alcanzar el límite, el contenido se trunca y la respuesta incluye stop_reason=max_tokens
Rango requerido: 1 <= x <= 131072
Ejemplo:

1024

system

Indicación de sistema, usada para definir el rol y el comportamiento de la IA

Notas:

  • Admite una cadena o un array de bloques de contenido
  • Se transfiere mediante el campo system de nivel superior (no lo incluyas en messages)
  • El modelo respetará las restricciones de system
  • Un system demasiado largo puede truncarse: si necesitas un contexto largo, colócalo en messages, no lo amontones todo en system
Ejemplo:

"You are a helpful assistant."

temperature
number

Temperatura de muestreo

Notas:

  • Cuanto más alto el valor, más diversa la salida; cuanto más bajo, más determinista
  • Rango recomendado [0, 1]
Rango requerido: 0 <= x <= 1
Ejemplo:

1

top_p
number

Umbral de muestreo por núcleo

Notas:

  • Rango [0, 1]
  • Se recomienda no ajustar temperature y top_p simultáneamente
Rango requerido: 0 <= x <= 1
Ejemplo:

0.9

top_k
integer

Muestrea solo entre los K tokens de mayor probabilidad (parámetro exclusivo de Anthropic)

Notas:

  • Cuanto más pequeño el valor, más determinista la salida; cuanto más grande, más diversos los candidatos
Rango requerido: x >= 0
Ejemplo:

10

stop_sequences
string[]

Secuencias de parada personalizadas: la generación se detiene cuando se encuentra cualquiera de estas cadenas

Notas:

  • Al encontrarla se trunca, el contenido anterior al punto de coincidencia se devuelve con normalidad
  • Atención: al encontrar una secuencia de parada, el stop_reason de la serie GLM devuelve end_turn (en lugar del stop_sequence estándar de Anthropic), y la respuesta tampoco incluye el campo stop_sequence. Si el cliente se basa en stop_reason=="stop_sequence" para detectar la coincidencia, necesitarás un manejo especial
Ejemplo:
stream
boolean
predeterminado:false

Si se devuelve en streaming mediante SSE

  • true: devolución en streaming mediante Server-Sent Events (secuencia de eventos estándar de Anthropic: message_start / content_block_start / content_block_delta / message_delta / message_stop)
  • false: devuelve la respuesta completa de una sola vez (predeterminado)
Ejemplo:

false

thinking
object

Configuración del razonamiento. Todos los modelos lo activan por defecto. Los bloques thinking de la respuesta se facturan como tokens de salida; signature puede estar vacío.

  • glm-5.2: thinking.type=disabled desactiva el razonamiento.
  • glm-5.3 / glm-5.3-flash / glm-5.3-flashx: el razonamiento siempre está activo. disabled mantiene el modo predeterminado y la facturación de sus tokens como salida.

thinking.budget_tokens y thinking.effort no definen el nivel de razonamiento de GLM. Consulta los valores compatibles en reasoning_effort, en el nivel superior. Un ajuste que desactiva el razonamiento en glm-5.2 deja de hacerlo al cambiar a la serie 5.3.

reasoning_effort
enum<string>

Campo de compatibilidad de niveles GLM en el nivel superior de la solicitud, fuera de thinking. El endpoint lo acepta, pero no garantiza que controle la intensidad real del razonamiento.

Reglas de compatibilidad de glm-5.3 / glm-5.3-flash / glm-5.3-flashx

minimal y none no desactivan el razonamiento de la serie 5.3. Sus tokens se facturan como salida. Los valores desconocidos se mantienen sin conversión de compatibilidad; usa los valores indicados. Estas reglas no se aplican a glm-5.2.

Para controlar la intensidad, usa reasoning_effort en Chat Completions o reasoning.effort en Responses.

Opciones disponibles:
max,
xhigh,
high,
medium,
low,
minimal,
none
tools
object[]

Lista de definiciones de herramientas

Notas:

  • Sigue la especificación de definición de tool de Anthropic
  • input_schema usa un objeto JSON Schema
  • El modelo devuelve un bloque tool_use estándar, con stop_reason=tool_use
tool_choice
object

Estrategia de selección de herramientas

metadata
object

Metadatos de la solicitud

Respuesta

Objeto de mensaje

Respuesta de mensaje al estilo de Anthropic

id
string

ID único del mensaje (formato: msg_<uuid>)

type
enum<string>

Tipo de objeto de respuesta

Opciones disponibles:
message
role
enum<string>
Opciones disponibles:
assistant
model
string

Modelo realmente utilizado

Ejemplo:

"glm-5.3"

content
object[]

Lista de bloques de contenido de la respuesta

Posibles block type:

  • thinking: proceso de razonamiento (cuando el pensamiento está activado, activado de forma predeterminada)
  • text: texto de la respuesta final
  • tool_use: llamada a herramienta iniciada por el modelo
stop_reason
enum<string>

Motivo de la parada

  • end_turn: finalización natural (también devuelve este valor al encontrar stop_sequences)
  • max_tokens: se alcanzó el límite de max_tokens
  • tool_use: el modelo activó una llamada a herramienta
Opciones disponibles:
end_turn,
max_tokens,
tool_use
usage
object

Estadísticas de uso de tokens (especificación de Anthropic)