curl --request POST \
--url https://direct.evolink.ai/v1/chat/completions \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Preséntate, por favor"
}
]
}
'{
"id": "chatcmpl-a6613b56-c61c-94ba-9a9f-43d4cdc7d77a",
"object": "chat.completion",
"request_id": "req-7f3a2c1e8b9d4f0a",
"created": 1777021417,
"model": "glm-5.3",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "¡Hola! Soy GLM-5.3 y puedo ayudarte con conversación, razonamiento, redacción, código y muchas otras tareas.",
"reasoning_content": "Primero déjame analizar este problema...",
"tool_calls": [
{
"id": "<string>",
"type": "function",
"function": {
"name": "<string>",
"arguments": "<string>"
}
}
]
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 24,
"completion_tokens": 346,
"total_tokens": 370,
"prompt_tokens_details": {
"cached_tokens": 0
},
"completion_tokens_details": {
"reasoning_tokens": 321
}
},
"web_search": [
{
"icon": "<string>",
"title": "<string>",
"link": "<string>",
"media": "<string>",
"publish_date": "<string>",
"content": "<string>",
"refer": "<string>"
}
],
"content_filter": [
{
"role": "assistant",
"level": 1
}
]
}{
"error": {
"code": 400,
"message": "Invalid request parameters",
"type": "invalid_request_error"
}
}{
"error": {
"code": 401,
"message": "Invalid or expired token",
"type": "authentication_error"
}
}{
"error": {
"code": 402,
"message": "Insufficient quota",
"type": "insufficient_quota_error",
"fallback_suggestion": "https://evolink.ai/dashboard/billing"
}
}{
"error": {
"code": 403,
"message": "Access denied for this model",
"type": "permission_error",
"param": "model"
}
}{
"error": {
"code": 404,
"message": "Specified model not found",
"type": "not_found_error",
"param": "model",
"fallback_suggestion": "glm-5.3"
}
}{
"error": {
"code": 429,
"message": "Rate limit exceeded",
"type": "rate_limit_error",
"fallback_suggestion": "retry after 60 seconds"
}
}{
"error": {
"code": 500,
"message": "Internal server error",
"type": "internal_server_error",
"fallback_suggestion": "try again later"
}
}{
"error": {
"code": 502,
"message": "Upstream AI service unavailable",
"type": "upstream_error",
"fallback_suggestion": "try different model"
}
}{
"error": {
"code": 503,
"message": "Service temporarily unavailable",
"type": "service_unavailable_error",
"fallback_suggestion": "retry after 30 seconds"
}
}Interfaz de todos los modelos GLM - Referencia completa de Chat Completions
- Llama a los modelos de la serie GLM mediante el protocolo OpenAI Chat Completions, eligiendo el modelo concreto con el parámetro
model - Procesamiento síncrono que devuelve el contenido de la conversación en tiempo real
- Conversación de texto: conversación contextual de uno o varios turnos;
glm-5.3-flashadmite además entrada de imagen - Indicación del sistema: personaliza el rol y el comportamiento de la IA mediante un mensaje
role=system - Pensamiento profundo:
thinking.typecontrola la cadena de pensamiento yreasoning_effortajusta la intensidad del razonamiento; el razonamiento se devuelve enreasoning_content - Streaming: se admiten respuestas en flujo SSE (
stream=true) - Llamadas a herramientas: se admiten Function Calling y búsqueda web (
web_search, hasta 128 herramientas) - Salida estructurada: activa el modo JSON mediante
response_format
Sobre las respuestas en streaming: con stream=true, los resultados llegan por Server-Sent Events, con cada mensaje en el formato data: {JSON} y el flujo terminando con data: [DONE]. Cada fragmento (ChatCompletionChunk) incluye id, created, model, choices y, opcionalmente, usage y content_filter; dentro, choices[].delta devuelve de forma incremental role / content / reasoning_content / tool_calls, y choices[].finish_reason indica el motivo de finalización en el último fragmento.
curl --request POST \
--url https://direct.evolink.ai/v1/chat/completions \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Preséntate, por favor"
}
]
}
'{
"id": "chatcmpl-a6613b56-c61c-94ba-9a9f-43d4cdc7d77a",
"object": "chat.completion",
"request_id": "req-7f3a2c1e8b9d4f0a",
"created": 1777021417,
"model": "glm-5.3",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "¡Hola! Soy GLM-5.3 y puedo ayudarte con conversación, razonamiento, redacción, código y muchas otras tareas.",
"reasoning_content": "Primero déjame analizar este problema...",
"tool_calls": [
{
"id": "<string>",
"type": "function",
"function": {
"name": "<string>",
"arguments": "<string>"
}
}
]
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 24,
"completion_tokens": 346,
"total_tokens": 370,
"prompt_tokens_details": {
"cached_tokens": 0
},
"completion_tokens_details": {
"reasoning_tokens": 321
}
},
"web_search": [
{
"icon": "<string>",
"title": "<string>",
"link": "<string>",
"media": "<string>",
"publish_date": "<string>",
"content": "<string>",
"refer": "<string>"
}
],
"content_filter": [
{
"role": "assistant",
"level": 1
}
]
}{
"error": {
"code": 400,
"message": "Invalid request parameters",
"type": "invalid_request_error"
}
}{
"error": {
"code": 401,
"message": "Invalid or expired token",
"type": "authentication_error"
}
}{
"error": {
"code": 402,
"message": "Insufficient quota",
"type": "insufficient_quota_error",
"fallback_suggestion": "https://evolink.ai/dashboard/billing"
}
}{
"error": {
"code": 403,
"message": "Access denied for this model",
"type": "permission_error",
"param": "model"
}
}{
"error": {
"code": 404,
"message": "Specified model not found",
"type": "not_found_error",
"param": "model",
"fallback_suggestion": "glm-5.3"
}
}{
"error": {
"code": 429,
"message": "Rate limit exceeded",
"type": "rate_limit_error",
"fallback_suggestion": "retry after 60 seconds"
}
}{
"error": {
"code": 500,
"message": "Internal server error",
"type": "internal_server_error",
"fallback_suggestion": "try again later"
}
}{
"error": {
"code": 502,
"message": "Upstream AI service unavailable",
"type": "upstream_error",
"fallback_suggestion": "try different model"
}
}{
"error": {
"code": 503,
"message": "Service temporarily unavailable",
"type": "service_unavailable_error",
"fallback_suggestion": "retry after 30 seconds"
}
}https://direct.evolink.ai, que ofrece mejor compatibilidad con los modelos de texto y las conexiones de larga duración. https://api.evolink.ai es el endpoint principal para los servicios multimodales y sirve como dirección de respaldo para los modelos de texto.glm-5.3 y glm-5.3-flash piensan siempre y no se pueden desactivar; en reasoning_effort surten efecto los tres niveles low / high / max y los demás se degradan automáticamente al nivel disponible más cercano (xhigh → max, medium → high, minimal / none → low, que sigue pensando y se factura como salida). glm-5.2 puede desactivar el pensamiento con thinking.type: "disabled" y admite más niveles de razonamiento. Consulta las descripciones de los campos thinking y reasoning_effort para más detalle.glm-5.3-flash, mediante bloques de contenido image_url dentro de messages[].content[]. Enviar bloques de imagen a otro modelo devuelve un error.Autorizaciones
##Todas las API requieren autenticación con Bearer Token##
Obtener la API Key:
Visita la página de gestión de API Keys para obtener tu API Key
Añadir al encabezado de la solicitud:
Authorization: Bearer YOUR_API_KEY
Cuerpo
Modelo a invocar:
| ID del modelo | Posicionamiento | Control del pensamiento | Entrada de imagen |
|---|---|---|---|
glm-5.3 | Modelo insignia, con avances generalizados en ingeniería de software compleja y tareas de agente y una mejora notable en programación frente a la generación anterior; contexto de 1M | Piensa siempre y no se puede desactivar; en reasoning_effort solo surten efecto low / high / max, los demás niveles se degradan automáticamente | No compatible |
glm-5.3-flash | Modelo multimodal ligero con arquitectura híbrida de atención dispersa y lineal, coste muy bajo y visión nativa; contexto de 1M | Igual que glm-5.3 | Compatible, consulta el campo messages |
glm-5.2 | Insignia de la generación anterior, razonamiento complejo y contexto muy largo; contexto de 1M | Se puede desactivar con thinking.type: "disabled"; reasoning_effort admite los 7 niveles | No compatible |
glm-5.3, glm-5.3-flash, glm-5.2 "glm-5.3"
Lista de mensajes de la conversación, contiene la información de contexto completa de la conversación actual
Admite cuatro roles: system, user, assistant, tool. Los mensajes con diferentes roles tienen distintas estructuras de campos; selecciona el rol correspondiente para verlas. Debe contener al menos 1 mensaje y no puede contener únicamente mensajes de sistema o del asistente.
1- System Message
- User Message
- Assistant Message
- Tool Message
Show child attributes
Show child attributes
Si se debe activar el modo de salida en streaming
false: el modelo genera la respuesta completa y la devuelve de una sola vez (predeterminado), adecuado para textos cortos y procesamiento por lotestrue: devuelve la respuesta en fragmentos en tiempo real mediante Server-Sent Events (SSE), adecuado para chat y textos largos; al finalizar el stream se devuelvedata: [DONE]
false
Controla si se activa la cadena de pensamiento (Chain of Thought)
Show child attributes
Show child attributes
Controla la intensidad de razonamiento del modelo; solo surte efecto con thinking activado y su valor predeterminado es max
Los valores admitidos varían según el modelo:
| Valor | glm-5.3 / glm-5.3-flash | glm-5.2 |
|---|---|---|
max | Razonamiento profundo (predeterminado) | Razonamiento profundo |
high | Razonamiento reforzado | Razonamiento reforzado |
low | Razonamiento ligero | Equivale a high |
xhigh | Degradado a max | Equivale a max |
medium | Degradado a high | Equivale a high |
minimal | Degradado a low (sigue pensando) | Renuncia a pensar |
none | Degradado a low (sigue pensando) | Renuncia a pensar |
La serie glm-5.3 piensa siempre y solo surten efecto realmente los tres niveles low / high / max; los otros cuatro no dan error, sino que se degradan automáticamente al nivel disponible más cercano (xhigh → max, medium → high, minimal / none → low).
La serie glm-5.3 no puede desactivar el pensamiento. Enviar minimal o none solo lo baja al nivel mínimo low: el modelo sigue generando tokens de pensamiento, facturados a la tarifa de salida. Si envías estos dos niveles para ahorrar, ten en cuenta que esto difiere de glm-5.2: en glm-5.2 sí se renuncia realmente a pensar.
Para tareas complejas como la programación se recomienda max.
max, xhigh, high, medium, low, minimal, none "max"
Si se debe activar la estrategia de muestreo
true(predeterminado): usatemperature/top_ppara el muestreo aleatorio, con una salida más variadafalse: siempre selecciona la palabra de mayor probabilidad (decodificación voraz), con una salida más determinista; en este caso,temperatureytop_pse ignoran
Para tareas que requieren coherencia y reproducibilidad (como la generación de código o la traducción), se recomienda establecerlo en false
true
Temperatura de muestreo, controla la aleatoriedad y la creatividad de la salida
Notas:
- Rango:
[0.0, 1.0], limitado a dos decimales - Valores más altos (p. ej. 0.8): más aleatorio y creativo, adecuado para la escritura creativa
- Valores más bajos (p. ej. 0.2): más estable y determinista, adecuado para preguntas factuales y generación de código
- Valor predeterminado:
1.0
Recomendación: no ajustes temperature y top_p simultáneamente
0 <= x <= 11
Parámetro de muestreo por núcleo (Nucleus Sampling), es una alternativa al muestreo por temperature
Notas:
- Rango:
[0.01, 1.0], limitado a dos decimales - El modelo solo considera los tokens candidatos cuya probabilidad acumulada alcanza
top_p; por ejemplo, 0.1 significa considerar solo los tokens del primer 10 % de probabilidad - Los valores más pequeños producen una salida más enfocada y coherente; los valores más grandes aumentan la diversidad
- Valor predeterminado:
0.95
Recomendación: no ajustes temperature y top_p simultáneamente
0.01 <= x <= 10.95
Límite máximo de tokens de salida del modelo
Nota:
- La serie GLM admite hasta 131.072 tokens (128K) de longitud de salida; se recomienda no bajar de
1024 - Con
thinkingactivado, los tokens de la cadena de pensamiento también cuentan para este límite - Si la generación se trunca por
length, prueba a subir este valor
1 <= x <= 1310721024
Lista de herramientas que el modelo puede invocar
Nota:
- Se admiten la llamada a funciones (
function) y la búsqueda web (web_search) - Hasta 128 funciones
- De ellas,
web_searchse factura aparte por llamada cuando la búsqueda ocurre realmente; las demás herramientas no tienen coste adicional
128- Herramienta Function
- Herramienta Web Search (búsqueda web)
Show child attributes
Show child attributes
Controla la forma en que el modelo elige qué función invocar
Notas: solo tiene efecto cuando el tipo de herramienta es function, y de forma predeterminada solo admite auto (el modelo decide automáticamente si invoca una herramienta)
auto "auto"
Lista de palabras de parada
Notas:
- Cuando el texto generado por el modelo encuentra la cadena especificada, detiene la generación de inmediato (la palabra de parada en sí no se incluye en el texto devuelto)
- Actualmente solo se admite una única palabra de parada, con el formato
["stop_word1"], por ejemplo["Human:"]
4["Human:"]
Especifica el formato de salida de la respuesta del modelo, predeterminado text
Notas:
{ "type": "json_object" }activa el modo JSON, y el modelo devuelve datos en formato JSON válido, adecuado para escenarios como la extracción de datos estructurados- Al usar el modo JSON, se recomienda solicitar explícitamente la salida en JSON en el mensaje
systemouser
Show child attributes
Show child attributes
Identificador único de la solicitud
Notas:
- Lo transfiere el cliente, con una longitud de 6 a 64 caracteres; se recomienda usar el formato UUID para garantizar la unicidad
- Si no se proporciona, la plataforma lo genera automáticamente
6 - 64"req-7f3a2c1e8b9d4f0a"
Identificador único del usuario final
Notas: longitud de 6 a 128 caracteres; se recomienda usar un identificador único que no contenga información sensible, lo que ayuda a la plataforma a supervisar y detectar comportamientos abusivos
6 - 128"user-abc123456"
Respuesta
Completado de chat generado exitosamente
ID de la tarea
"chatcmpl-a6613b56-c61c-94ba-9a9f-43d4cdc7d77a"
Tipo de respuesta
chat.completion "chat.completion"
ID de la solicitud (se devuelve cuando se proporciona request_id en la solicitud)
"req-7f3a2c1e8b9d4f0a"
Hora de creación de la solicitud, marca de tiempo Unix (segundos)
1777021417
Nombre del modelo
"glm-5.3"
Lista de respuestas del modelo
Show child attributes
Show child attributes
Estadísticas de uso de tokens devueltas al finalizar la llamada
Show child attributes
Show child attributes
Información relacionada con la búsqueda web, se devuelve al usar la herramienta web_search y obtener resultados de búsqueda
Show child attributes
Show child attributes
Información relacionada con la seguridad del contenido
Show child attributes
Show child attributes