GPT Image 2.5 Flare & Sunburst ya están disponibles en EvoLinkProbar GPT Image 2.5

GLM-5.3 API

Accede a GLM-5.3 de Z.ai —también buscado como Zhipu GLM-5.3 / GLM 5.3— a través de la API de chat unificada de EvoLink. Prueba la programación con contexto largo, los agentes de varios pasos, la caché de prompts antes de integrar.

Z.aiGeneración de textoDisponible
desde $1.400 / 1M tokens de entrada
Razonamiento siempre activoCaché de promptsLlamadas a herramientasChat + Messages
Ruta de producciónLive
Contexto
1M de contexto · 131K de salida máx.
Ideal para
Agentes de programación, cadenas de tareas largas, flujos con muchas herramientas
Entrada
Texto
Salida
Texto · JSON (salida estructurada) · llamadas a herramientas

Elegir GLM-5.3

El modelo de razonamiento insignia de Z.ai para agentes de programación y trabajo de ingeniería de largo recorrido: 1M de tokens de contexto, razonamiento siempre activo, llamada a herramientas y caché de prompts sobre Chat Completions y Anthropic Messages.

GLM-5.3

Modelo de razonamiento insignia de Z.ai

Seleccionado
ID del modelo
glm-5.3
Ideal para

Agentes de programación a escala de repositorio, cadenas de tareas largas, flujos intensivos en herramientas y bucles de agente con prefijo estable donde las lecturas de caché soportan la mayor parte de la entrada.

Entrada
$1.400 / 1M95.2 cr / 1M
Lectura de caché
$0.261 / 1M17.7 cr / 1M
Salida
$4.400 / 1M299.2 cr / 1M

Todas las tarifas son por 1M de tokens, en USD y créditos, y reflejan los precios actuales de tu cuenta.

Precios de GLM-5.3

Estima el coste de una solicitud de GLM-5.3 antes de integrar. La calculadora usa las tarifas actuales de tu cuenta; los precios oficiales sirven de referencia.

Calculadora de solicitud

Introduce la combinación de tokens de una solicitud y el número de llamadas a herramientas exitosas.

Coste estimado por solicitud

GLM-5.3
USD$0.0028
Créditos0.1886
Tokens de entrada0.0952 cr
Tokens de lectura de caché0.0036 cr
Tokens de salida0.0898 cr

Cargo mínimo: 0.01 créditos por solicitud.

Guía de presupuesto

Solicitudes aproximadas con la combinación actual de tokens.
Añadir créditos
$10
Unas 3605 solicitudes

Para pruebas rápidas

$50
Unas 18027 solicitudes

Para el desarrollo habitual

$100
Unas 36055 solicitudes

Para la evaluación en producción

Tarifas de herramientas del servidor

Solo las llamadas exitosas del lado del servidor se facturan por llamada; los intentos fallidos no tienen tarifa de herramienta, pero los tokens sí se cobran.
  • Búsqueda web$0.010/ llamada0.68 cr / llamada

API de GLM-5.3 para agentes de programación e ingeniería de largo recorrido

Llama al modelo de razonamiento insignia de Z.ai por 1,40 $ de entrada y 4,40 $ de salida por millón de tokens mediante la API unificada de EvoLink. Usa el ID glm-5.3 con contexto de 1M, razonamiento low/high/max siempre activo, herramientas y caché de prompts.

GLM-5.3 se sirve en EvoLink con el ID de modelo glm-5.3 mediante Chat Completions · Responses · Anthropic Messages, con la misma clave API y saldo que usas para cualquier otro modelo. Ofrece una ventana de contexto de 1M y hasta 131K tokens de salida, además de la programación con contexto largo, los agentes de varios pasos, la caché de prompts.

GLM-5.3

Especificaciones y capacidades de GLM-5.3

Las cifras proceden de la configuración de ruta de EvoLink; las capacidades son las que la API expone hoy.

Ventana de contexto
1M tokens
Salida máx.
131K tokens
Entrada
Texto
Salida
Texto · JSON (salida estructurada) · llamadas a herramientas
Razonamiento
Razonamiento siempre activo
Uso de herramientas
Llamadas a funciones con secuencias de herramientas de varios pasos
Caché de prompts
Lecturas de caché automáticas a tarifa reducida
Herramientas del servidor
Búsqueda web, facturadas por llamada exitosa
Protocolos
Chat Completions · Responses · Anthropic Messages
ID del modelo
glm-5.3

Por qué GLM-5.3 puede con estas cargas de trabajo

Tres propiedades hacen casi todo el trabajo. Cada una implica también una forma de usar mal el modelo, así que conviene entenderlas antes de enrutar tráfico de producción.

Contexto de trabajo de 1M de tokens a tarifa única

No hay escalón de precio por contexto largo: la tarifa en el token 900.000 es igual que en el token 1.000. Eso elimina un motivo habitual para truncar de forma agresiva, pero no hace que llenar la ventana sea gratis ni preciso.

Transmisión del request fiel byte a byte

Salvo el nombre del modelo, el cuerpo de la petición llega intacto al proveedor, de modo que los campos propios de GLM, los hashes de prefijo de caché y las firmas de razonamiento se conservan en ambos endpoints.

Tokens de razonamiento incluidos en la facturación de salida

El razonamiento se factura dentro de los tokens de completado, no como línea aparte, así que el techo de 131.072 tokens de salida cubre razonamiento y respuesta final juntos. Ajusta los presupuestos de salida por tarea, no por el techo.

Dónde encaja GLM-5.3 en un stack de modelos en producción

GLM-5.3 cuesta más que GLM-5.2 y mucho más que Flash, así que no debería convertirse en la ruta por defecto solo por ser lo más nuevo. Encaja mejor donde un razonamiento más profundo elimina un reintento o una ronda de corrección humana.

GLM-5.3 para programación a escala de repositorio

Mantén módulos relacionados, pruebas y convenciones en un contexto de 1M de tokens en lugar de alimentar al agente archivo a archivo. La mejora aparece como menos ediciones rotas entre archivos, no como una mejor completado de un solo archivo.

GLM-5.3 para cadenas de tareas largas

Los bucles planificar-ejecutar-verificar de muchos pasos son los que más ganan, porque un error de razonamiento temprano se propaga por toda la cadena. Mide la tasa de cadenas completadas, no la calidad por paso.

GLM-5.3 para agentes intensivos en herramientas

Los esquemas de herramientas grandes y los bloques largos de instrucciones viven en el prefijo cacheado, así que el coste marginal de un paso más se acerca a la tarifa de lectura de caché en lugar de a la de entrada completa.

GLM-5.3 desde clientes con protocolo Anthropic

Las peticiones a /v1/messages se transmiten byte a byte, conservando prefijos de caché y firmas de razonamiento. Las CLI de programación con protocolo Claude pueden apuntar a EvoLink y elegir glm-5.3 sin capa de traducción.

Qué cambia GLM-5.3 y qué rompe

GLM-5.3 no es un reemplazo directo de GLM-5.2. Un cambio de parámetro es una ruptura dura y el precio se ha movido. Lee estos cuatro puntos antes de mover una ruta de producción.

Ruptura: ya no se puede desactivar el razonamiento

GLM-5.3 razona siempre y rechaza thinking.type: "disabled". Cualquier cliente migrado desde GLM-5.2 que siga enviando el modo desactivado fallará directamente. El reemplazo oficial es thinking.type: "enabled" con reasoning_effort: "low".

Tres niveles de esfuerzo de razonamiento, con max por defecto

reasoning_effort acepta low, high y max, con max por defecto. Como los tokens de salida incluyen los de razonamiento, el nivel mueve el coste directamente: dejar el valor por defecto en llamadas rutinarias de alto volumen es la forma más común de gastar de más en 5.3.

Las lecturas de caché son la palanca más barata de esta página

Los tokens de lectura de caché se facturan a cerca de una quinta parte de la entrada nueva. En bucles de agente largos donde el prompt de sistema y los esquemas de herramientas dominan la entrada, mantener ese prefijo estable byte a byte pesa más en la factura que la propia elección de modelo.

Más caro que GLM-5.2, sin descuento

La entrada sale un 40% por encima de la tarifa actual de GLM-5.2 porque 5.3 se factura a precio de proveedor sin descuento promocional. Enruta a 5.3 donde el razonamiento extra lo valga de forma medible y deja el resto en 5.2 o Flash.

Dos formas de usar GLM-5.3: API de EvoLink o Agente

Usa la API de EvoLink para backends de producto y trabajos por lotes, o llama a GLM-5.3 desde Codex, Claude o Gemini para flujos de código y análisis. Ambas vías comparten la misma clave API de EvoLink, saldo, ID de modelo e historial de solicitudes.

Opción 1

Integrar con la API de EvoLink

Ideal para: backends de producto, trabajos por lotes, pipelines automatizados

Envía a EvoLink solicitudes Chat Completions compatibles con OpenAI (o Anthropic Messages) y controla el ID de modelo, el prompt de sistema, el presupuesto de salida, las herramientas y la salida estructurada.

  1. 1Crea una clave API de EvoLink en la consola
  2. 2Apunta tu SDK de OpenAI o Anthropic a la URL base de EvoLink y selecciona el ID de modelo mostrado arriba
  3. 3Envía una solicitud representativa y lee el campo usage para tokens de entrada, en caché y de salida
  4. 4Define max_tokens y reintentos por tarea; conserva los ID y resultados de llamadas a herramientas entre turnos
Opción 2

Llamarlo con un Agente

Ideal para: tareas de código, revisión y análisis en Codex, Claude y Gemini

Dale al Agente la tarea, las entradas a incluir y los criterios de aceptación. Él arma la solicitud, llama a GLM-5.3 a través de EvoLink y devuelve la respuesta con el uso de tokens.

  1. 1Define EVOLINK_API_KEY en tu entorno local; nunca en código ni en un prompt
  2. 2Describe la tarea, las entradas a incluir y el formato de salida esperado
  3. 3Pide al Agente que llame a GLM-5.3 a través de EvoLink y muestre la solicitud antes de enviarla
  4. 4Deja que el Agente informe la respuesta, el uso de tokens y cualquier cuerpo de error

Ejemplo de código de la API de GLM-5.3 y manejo de errores

Este ejemplo muestra la solicitud ejecutable más corta: una llamada Chat Completions compatible con OpenAI con prompt de sistema, mensaje de usuario y presupuesto de salida. Abre la pestaña API para la referencia completa de parámetros y respuestas.

Ver documentación completa de la API
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      { "role": "system", "content": "You are a senior engineer. Answer in JSON when asked." },
      { "role": "user", "content": "Review this diff and list risky changes as a JSON array:\n<diff>" }
    ],
    "reasoning_effort": "low",
    "max_tokens": 2048,
    "stream": true
  }'

# Reasoning is always on: reasoning_effort accepts low / high / max
# (default max) and thinking.type "disabled" is rejected.
# The same model ID works on /v1/messages (Anthropic Messages).
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens; completion tokens include reasoning).

Solicitud inválida o parámetro no admitido

Comprueba el ID de modelo, el array messages y los rangos de parámetros en la referencia de la API; elimina los campos que esta ruta no admite.

Problema de autenticación o saldo

Comprueba el token Bearer de Authorization y confirma el saldo disponible en la consola.

Longitud de contexto excedida

Los tokens del prompt superan la ventana de contexto de GLM-5.3. Recorta o recupera solo la evidencia relevante y reutiliza prefijos en caché.

Límite de tasa (429)

Espera y reintenta con jitter; agrupa o encola las solicitudes en lugar de ráfagas paralelas.

Contenido o llamada a herramienta rechazados

Revisa contenido sensible, argumentos de llamada a herramienta mal formados y desajustes del esquema JSON antes de reintentar.

Qué verificar antes de enrutar tráfico de producción a GLM-5.3

Cuatro comprobaciones cubren casi todos los problemas de migración que vemos en este modelo. Las dos primeras son fallos duros; las dos últimas, problemas de coste silenciosos.

01

Usa glm-5.3 como ID de modelo

El mismo ID funciona en Chat Completions y Anthropic Messages y coincide exactamente con el nombre del proveedor: no hay alias que traducir.

Obligatorio
02

Elimina cualquier thinking.type: "disabled"

Es la única ruptura dura respecto a GLM-5.2. Sustitúyelo por thinking.type: "enabled" más reasoning_effort: "low" y vuelve a pasar tus prompts de regresión.

Ruptura
03

Configura reasoning_effort a conciencia

El valor por defecto es max. Baja a low las llamadas rutinarias y sensibles a la latencia y confirma que la tasa de aceptación aguanta antes de dar el ahorro por bueno.

Coste
04

Confirma que la caché realmente acierta

Revisa que aparezcan tokens cacheados en el usage devuelto. Si el prefijo cambia entre llamadas, cada petición se factura a entrada completa y la respuesta no lo delata.

Coste

La lectura de caché cuesta una quinta parte de la entrada nueva

La entrada cacheada se factura con su propia tarifa reducida, así que un prompt de sistema estable, las reglas del repositorio y los esquemas de herramientas siguen siendo baratos en bucles de agente largos. No hay cargo por escritura de caché: el proveedor no reporta tokens de creación de caché.

1M de tokens de contexto con un techo de salida de 131K

Mantén código relacionado, especificaciones y estado del agente en un mismo contexto de trabajo. El techo es capacidad, no objetivo: recupera lo relevante, mantén el prefijo estable para que cachee y ajusta el presupuesto de salida a cada tarea.

Compara el coste por tarea aceptada de GLM-5.3, no solo el precio por token

GLM-5.3 cuesta más por token que GLM-5.2 y que Flash. Eso solo importa junto a la frecuencia con la que cada modelo produce un resultado que realmente publicas. Sigue estas señales en tus propias cargas durante una semana antes de fijar una ruta.

Tasa de éxito a la primeraEntregables aceptadosReintentos por tareaProporción de razonamiento en la salidaTasa de acierto de cachéLlamadas a herramientas válidasTiempo hasta el resultado aceptadoTasa de fallback

Una ruta que cuesta un 40% más por token pero elimina un reintento de cada tres sale más barata en la práctica. Una que cuesta un 40% más y no cambia nada es solo un valor por defecto más caro. La única manera de distinguirlas es medir ambas sobre las mismas tareas.

Compara con GLM-5.2 y Kimi K3 antes de cambiar

EvoLink

GLM-5.3 tiene un precio superior a GLM-5.2, así que la pregunta real es si menos reintentos y menos corrección manual cubren la diferencia en tus cargas de trabajo. Mide primero y luego decide la ruta de producción.

GLM-5.3
Entrada / Salida$1.4 / $4.4
Contexto1M
CachéLecturas de caché
Ideal paraAgentes de programación a escala de repositorio, cadenas de tareas largas, flujos intensivos en herramientas y bucles de agente con prefijo estable donde las lecturas de caché soportan la mayor parte de la entrada.
GLM-5.2
Entrada / Salida$1 / $3.5
Contexto1M
CachéLecturas de caché
Ideal paraEl anterior buque insignia de GLM, todavía más barato por token. Mantenlo donde 5.3 no aporte una mejora medible y para clientes que dependen de desactivar el razonamiento.
Kimi K3
Entrada / Salida$3 / $15
Contexto1.05M
CachéLecturas de caché automáticas
Ideal paraLa ruta de razonamiento de Moonshot con 1M de contexto. Buena referencia entre proveedores para programación de contexto largo y agentes.

Familia de modelos GLM

Misma clave API y saldo: cambia de nivel sin tocar la integración.

GLM-5.3

GLM-5.3

Modelo actual

Modelo de razonamiento insignia de Z.ai

GLM-5.2

GLM-5.2

El anterior buque insignia de GLM, todavía más barato por token. Mantenlo donde 5.3 no aporte una mejora medible y para clientes que dependen de desactivar el razonamiento.

Ver modelo
GLM-5.3 Flash

GLM-5.3 Flash

Misma generación 5.3 a cerca de una novena parte del precio, con entrada nativa de imagen, vídeo y archivos. La opción por defecto para alto volumen y trabajo multimodal.

Ver modelo

Otros modelos de texto en EvoLink además de GLM-5.3

Kimi K3

Kimi K3

La ruta de razonamiento de Moonshot con 1M de contexto. Buena referencia entre proveedores para programación de contexto largo y agentes.

Ver modelo
DeepSeek V4 Pro

DeepSeek V4 Pro

Base de contexto largo sensible al coste para razonamiento masivo donde el precio por token domina la decisión de enrutado.

Ver modelo
GPT-5.6

GPT-5.6

La familia frontier de OpenAI por niveles (Sol/Terra/Luna) para equilibrar capacidad, latencia y coste.

Ver modelo
Claude Opus 4.8

Claude Opus 4.8

La ruta premium de Anthropic para agentes de larga duración, revisiones complejas y trabajo que exige criterio.

Ver modelo

Lecturas relacionadas sobre GLM-5.3

GLM-5.3 Flash frente a GLM-5.3

GLM-5.3 Flash frente a GLM-5.3

Elige la ruta por modalidad, dificultad y coste por resultado aceptado, con una política Flash-first y escalado selectivo.

Leer artículo
GLM-5.3 ya está aquí: qué se lanzó

GLM-5.3 ya está aquí: qué se lanzó

Qué confirmó realmente el lanzamiento del 14 de agosto sobre especificaciones, IDs de modelo y acceso por fases, y qué quedó abierto.

Leer artículo
GLM-5.3 frente a GLM-5.2

GLM-5.3 frente a GLM-5.2

Mismo modelo base, todas las mejoras del post-entrenamiento, más la ruptura de no poder desactivar el razonamiento. Cuándo quedarse en 5.2.

Leer artículo
GLM-5.3 frente a Claude

GLM-5.3 frente a Claude

Benchmarks, contratos de API y disponibilidad real comparados antes de enrutar agentes de programación a cualquiera de los dos.

Leer artículo
Benchmarks de ciberseguridad de GLM-5.3

Benchmarks de ciberseguridad de GLM-5.3

Qué afirman las cifras de CyberGym y ExploitBench según el propio Z.ai y cómo debería leerlas un defensor.

Leer artículo
Un gateway para 3 CLI de programación

Un gateway para 3 CLI de programación

Rutas de configuración, variables de entorno y una lista de diagnóstico para ejecutar varias CLI a través de un solo endpoint.

Leer artículo

Preguntas frecuentes sobre la API de GLM-5.3

¿Está disponible la API de GLM-5.3 en EvoLink?

Sí. GLM-5.3 está disponible como modelo de producción, servido por Chat Completions y Anthropic Messages.

¿Qué ID de modelo debo usar?

glm-5.3 en ambos endpoints. El nombre en EvoLink coincide exactamente con el del proveedor.

¿Puedo seguir usando el SDK de OpenAI o Anthropic Messages?

Sí. Apunta cualquiera de los dos clientes a EvoLink con la misma API key y selecciona glm-5.3. La petición se transmite byte a byte salvo el nombre del modelo, por lo que se conservan los prefijos de caché y las firmas de razonamiento.

¿Puedo desactivar el razonamiento como en GLM-5.2?

No. GLM-5.3 razona siempre y rechaza thinking.type: "disabled". Al migrar desde GLM-5.2, cambia a thinking.type: "enabled" con reasoning_effort: "low", el reemplazo oficial.

¿Cómo elijo el nivel de reasoning_effort?

El valor por defecto es max. Usa low para cambios rutinarios, clasificación y llamadas sensibles a la latencia; high o max para arquitectura, depuración y cadenas largas. Los tokens de salida incluyen los de razonamiento, así que el nivel mueve el coste directamente.

¿Por qué GLM-5.3 es más caro que GLM-5.2?

GLM-5.3 se cobra a tarifa del proveedor sin descuento, mientras que GLM-5.2 mantiene un precio promocional: la entrada sale un 40% más cara. Enruta a 5.3 donde el razonamiento extra elimine reintentos y quédate en 5.2 o GLM-5.3 Flash donde no.

¿Cómo se factura la caché de prompts?

Las lecturas de caché tienen su propia tarifa, alrededor de una quinta parte de la entrada nueva. No hay cargo por escritura porque el proveedor no reporta tokens de creación. Mantén el prefijo estable byte a byte para seguir acertando.

¿Cuál es la ventana de contexto y el límite de salida?

1.000.000 de tokens de contexto y hasta 131.072 tokens de salida, con tarifa única en toda la ventana: no hay escalón de precio por contexto largo.

¿GLM-5.3 o GLM-5.3 Flash?

Flash cuesta cerca de una novena parte y acepta imagen, vídeo y archivos. Empieza con Flash para volumen alto, multimodal y rutina; pasa a GLM-5.3 cuando la tarea exija más razonamiento y la tasa de aceptación lo justifique.

¿GLM-5.3 acepta imágenes?

No, GLM-5.3 es solo texto. Usa GLM-5.3 Flash para entrada de imagen, vídeo y archivos.

¿Cómo lo comparo con Claude, GPT o Kimi?

Evalúa GLM-5.3 por coste por tarea aceptada en agentes de programación y cadenas largas, toma Claude y GPT como referencia de capacidad frontera y usa Kimi K3 como comparación de contexto largo entre proveedores.

¿Qué debe medir una evaluación en producción?

Éxito a la primera, entregables aceptados, reintentos, proporción de tokens de razonamiento en la salida, tasa de acierto de caché, llamadas a herramientas válidas, tiempo hasta el resultado aceptado y tasa de fallback.