GPT Image 2.5 Flare & Sunburst ya están disponibles en EvoLinkProbar GPT Image 2.5

GLM-5.3 FlashX API

GLM-5.3 FlashX es el modelo multimodal de Z.ai centrado en la velocidad para programación interactiva y agentes. Compara su coste en tokens con Flash e intégralo mediante la API unificada de EvoLink.

Z.aiGeneración de textoDisponible
desde $0.371 / 1M tokens de entrada
Entrada multimodalImagen · vídeo · archivoRazonamiento siempre activoChat + Messages
Ruta de producciónLive
Contexto
1M de contexto · 131K de salida máx.
Ideal para
Agentes de programación interactivos, análisis de capturas y documentos
Entrada
Texto + imágenes + vídeo + archivos
Salida
Texto · JSON (salida estructurada) · llamadas a herramientas

Elegir GLM-5.3 FlashX

GLM-5.3 FlashX es el modelo multimodal de Z.ai centrado en la velocidad para programación interactiva y agentes. Compara su coste en tokens con Flash e intégralo mediante la API unificada de EvoLink.

GLM-5.3 FlashX

Modelo multimodal de Z.ai centrado en la velocidad

Seleccionado
ID del modelo
glm-5.3-flashx
Ideal para

Agentes de programación interactivos, análisis de capturas y documentos

Entrada
$0.371 / 1M25.2 cr / 1M
Lectura de caché
$0.075 / 1M5.1 cr / 1M
Salida
$1.250 / 1M85 cr / 1M

Todas las tarifas son por 1M de tokens, en USD y créditos, y reflejan los precios actuales de tu cuenta.

Precios de GLM-5.3 FlashX

Estima el coste de una solicitud de GLM-5.3 FlashX antes de integrar. La calculadora usa las tarifas actuales de tu cuenta; los precios oficiales sirven de referencia.

Calculadora de solicitud

Introduce la combinación de tokens de una solicitud y el número de llamadas a herramientas exitosas.

Coste estimado por solicitud

GLM-5.3 FlashX
USD$0.0008
Créditos0.0518
Tokens de entrada0.0252 cr
Tokens de lectura de caché0.0011 cr
Tokens de salida0.0255 cr

Cargo mínimo: 0.01 créditos por solicitud.

Guía de presupuesto

Solicitudes aproximadas con la combinación actual de tokens.
Añadir créditos
$10
Unas 13127 solicitudes

Para pruebas rápidas

$50
Unas 65637 solicitudes

Para el desarrollo habitual

$100
Unas 131274 solicitudes

Para la evaluación en producción

Tarifas de herramientas del servidor

Solo las llamadas exitosas del lado del servidor se facturan por llamada; los intentos fallidos no tienen tarifa de herramienta, pero los tokens sí se cobran.
  • Búsqueda web$0.010/ llamada0.68 cr / llamada

GLM-5.3 FlashX para flujos multimodales interactivos

Evalúa FlashX cuando esperar la salida del modelo ralentice tu programación o tu agente. Flash tiene precios por token más bajos; mide si el tiempo que ahorra FlashX en tus tareas justifica la diferencia.

GLM-5.3 FlashX se sirve en EvoLink con el ID de modelo glm-5.3-flashx mediante Chat Completions · Responses · Anthropic Messages, con la misma clave API y saldo que usas para cualquier otro modelo. Ofrece una ventana de contexto de 1M y hasta 131K tokens de salida, además de la entrada de imágenes, el análisis de documentos largos, los agentes de varios pasos.

GLM-5.3 FlashX

Especificaciones y capacidades de GLM-5.3 FlashX

Las cifras proceden de la configuración de ruta de EvoLink; las capacidades son las que la API expone hoy.

Ventana de contexto
1M tokens
Salida máx.
131K tokens
Entrada
Texto + imágenes + vídeo + archivos
Salida
Texto · JSON (salida estructurada) · llamadas a herramientas
Razonamiento
Razonamiento siempre activo
Uso de herramientas
Llamadas a funciones con secuencias de herramientas de varios pasos
Caché de prompts
Lecturas de caché automáticas a tarifa reducida
Herramientas del servidor
Búsqueda web, facturadas por llamada exitosa
Protocolos
Chat Completions · Responses · Anthropic Messages
ID del modelo
glm-5.3-flashx

Qué determina la elección de FlashX

Sopesa su enfoque en la velocidad frente a las entradas necesarias, la calidad y el coste de un resultado útil.

Una opción centrada en la velocidad junto a Flash

Z.ai presenta FlashX como una opción de inferencia más rápida. Eso no demuestra mayor calidad que Flash ni garantiza la latencia de EvoLink. Compara con los mismos prompts, ajustes de razonamiento y límites de salida.

Información multimodal en un contexto largo

Z.ai documenta entradas de texto, imagen, vídeo y archivos con un contexto de 1M de tokens. Consulta los formatos aceptados en la documentación API. El modelo devuelve texto; las herramientas del agente crean archivos o ejecutan acciones.

Elegir modelos desde una sola pasarela

Compara costes con EvoLink y mantén la integración en una pasarela API unificada. Usa Flash para las tareas que cumplen tu objetivo de calidad por menos y evalúa FlashX cuando importe el tiempo de respuesta.

En qué tareas evaluar GLM-5.3 FlashX

Empieza por tareas en las que una persona u otra herramienta espera la siguiente respuesta del modelo.

Agentes de programación interactivos

Evalúa implementación, depuración e interpretación de resultados de herramientas en el mismo ciclo del agente. Mide el tiempo hasta obtener un resultado funcional, incluyendo herramientas y reintentos, no solo la velocidad por token.

Desarrollo basado en capturas

Usa capturas de interfaces para orientar cambios de código o explicar defectos visuales. Comprueba que el resultado coincide con la referencia y que la ruta API elegida acepta el formato de imagen.

Documentos con respuesta inmediata

Evalúa extracción y preguntas de seguimiento sobre documentos con texto e información visual. Para clasificación no interactiva o lotes que pueden esperar, compara primero Flash, de menor precio.

Elegir entre FlashX, Flash y GLM-5.3

EvoLink

Compara las tarifas actuales de la tabla. FlashX prioriza la velocidad; Flash tiene menor precio por token. Mide el éxito y el tiempo total de las tareas antes de cambiar de modelo.

GLM-5.3 FlashX
Entrada / Salida$0.371 / $1.25
Contexto1M
CachéLecturas de caché
Ideal paraAgentes de programación interactivos, análisis de capturas y documentos
GLM-5.3
Entrada / Salida$1.4 / $4.4
Contexto1M
CachéLecturas de caché
Ideal paraEvalúa el modelo insignia solo de texto para razonamiento exigente. Una petición multimodal no puede reenviarse sin cambios a un modelo que solo acepta texto.
GLM-5.3 Flash
Entrada / Salida$0.15 / $0.5
Contexto1M
CachéLecturas de caché
Ideal paraOpción multimodal de menor precio para procesamiento por lotes sin urgencia y tareas sensibles al coste. Compara FlashX cuando la espera sea un cuello de botella, sin dar por hecha una mejora de precisión.

Dos formas de usar GLM-5.3 FlashX: API de EvoLink o Agente

Usa la API de EvoLink para backends de producto y trabajos por lotes, o llama a GLM-5.3 FlashX desde Codex, Claude o Gemini para flujos de código y análisis. Ambas vías comparten la misma clave API de EvoLink, saldo, ID de modelo e historial de solicitudes.

Opción 1

Integrar con la API de EvoLink

Ideal para: backends de producto, trabajos por lotes, pipelines automatizados

Envía a EvoLink solicitudes Chat Completions compatibles con OpenAI (o Anthropic Messages) y controla el ID de modelo, el prompt de sistema, el presupuesto de salida, las herramientas y la salida estructurada.

  1. 1Crea una clave API de EvoLink en la consola
  2. 2Apunta tu SDK de OpenAI o Anthropic a la URL base de EvoLink y selecciona el ID de modelo mostrado arriba
  3. 3Envía una solicitud representativa y lee el campo usage para tokens de entrada, en caché y de salida
  4. 4Define max_tokens y reintentos por tarea; conserva los ID y resultados de llamadas a herramientas entre turnos
Opción 2

Llamarlo con un Agente

Ideal para: tareas de código, revisión y análisis en Codex, Claude y Gemini

Dale al Agente la tarea, las entradas a incluir y los criterios de aceptación. Él arma la solicitud, llama a GLM-5.3 FlashX a través de EvoLink y devuelve la respuesta con el uso de tokens.

  1. 1Define EVOLINK_API_KEY en tu entorno local; nunca en código ni en un prompt
  2. 2Describe la tarea, las entradas a incluir y el formato de salida esperado
  3. 3Pide al Agente que llame a GLM-5.3 FlashX a través de EvoLink y muestre la solicitud antes de enviarla
  4. 4Deja que el Agente informe la respuesta, el uso de tokens y cualquier cuerpo de error

Ejemplo de código de la API de GLM-5.3 FlashX y manejo de errores

Este ejemplo muestra la solicitud ejecutable más corta: una llamada Chat Completions compatible con OpenAI con prompt de sistema, mensaje de usuario y presupuesto de salida. Abre la pestaña API para la referencia completa de parámetros y respuestas.

Ver documentación completa de la API
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flashx",
    "messages": [
      { "role": "system", "content": "You extract structured data. Answer in JSON only." },
      { "role": "user", "content": "Extract the product, quantity, and unit price: 2 notebooks at $4.50 each." }
    ],
    "thinking": { "type": "enabled", "clear_thinking": false },
    "reasoning_effort": "low",
    "max_tokens": 4096,
    "temperature": 0.1
  }'

# Reasoning is always on for the 5.3 generation: do not send
# thinking.type "disabled". The same model ID works on /v1/messages
# (Anthropic Messages). The response includes choices[0].message and
# a usage object; image and video input is counted in prompt_tokens.

Solicitud inválida o parámetro no admitido

Comprueba el ID de modelo, el array messages y los rangos de parámetros en la referencia de la API; elimina los campos que esta ruta no admite.

Problema de autenticación o saldo

Comprueba el token Bearer de Authorization y confirma el saldo disponible en la consola.

Longitud de contexto excedida

Los tokens del prompt superan la ventana de contexto de GLM-5.3 FlashX. Recorta o recupera solo la evidencia relevante y reutiliza prefijos en caché.

Límite de tasa (429)

Espera y reintenta con jitter; agrupa o encola las solicitudes en lugar de ráfagas paralelas.

Contenido o llamada a herramienta rechazados

Revisa contenido sensible, argumentos de llamada a herramienta mal formados y desajustes del esquema JSON antes de reintentar.

Estima entrada, salida y caché por separado

Usa las tarifas actuales y el calculador de esta página para el mismo ID de modelo. Revisa el uso devuelto y la facturación con peticiones representativas; repetir un prompt no demuestra por sí solo un acierto de caché.

Mide la petición completa

Registra por separado el tiempo al primer token, la velocidad de salida, el tiempo total, los reintentos y el coste por resultado aceptado. La cifra de tokens por segundo del proveedor no incluye todos los pasos de tu aplicación.

Familia de modelos GLM

Misma clave API y saldo: cambia de nivel sin tocar la integración.

GLM-5.3

GLM-5.3

Modelo de razonamiento insignia de Z.ai

Ver modelo
GLM-5.2

GLM-5.2

El anterior buque insignia de GLM. Sigue siendo relevante para clientes que dependen de desactivar el razonamiento, algo que la generación 5.3 ya no permite.

Ver modelo
GLM-5.3 Flash

GLM-5.3 Flash

Modelo multimodal de alto volumen de Z.ai

Ver modelo

Otros modelos de texto en EvoLink además de GLM-5.3 FlashX

DeepSeek V4 Flash

DeepSeek V4 Flash

La ruta de alto volumen de DeepSeek con 1M de contexto y lectura de caché muy barata. La comparación de coste más directa para trabajo masivo de texto.

Ver modelo
Gemini 3.7 Flash

Gemini 3.7 Flash

La ruta multimodal económica de Google: buena referencia entre proveedores cuando la comprensión de imágenes y documentos decide la elección.

Ver modelo
Kimi K3

Kimi K3

La ruta de razonamiento de contexto largo de Moonshot para código a escala de repositorio y trabajo multidocumento.

Ver modelo
GPT-5.6

GPT-5.6

La familia frontier de OpenAI por niveles (Sol/Terra/Luna) para equilibrar capacidad, latencia y coste.

Ver modelo

Lecturas relacionadas sobre GLM-5.3 FlashX

GLM-5.3 Flash frente a GLM-5.3

GLM-5.3 Flash frente a GLM-5.3

Elige la ruta por modalidad, dificultad y coste por resultado aceptado, con una política Flash-first y escalado selectivo.

Leer artículo
Un gateway para 3 CLI de programación

Un gateway para 3 CLI de programación

Rutas de configuración, variables de entorno y una lista de diagnóstico para ejecutar varias CLI a través de un solo endpoint.

Leer artículo

Preguntas frecuentes sobre la API de GLM-5.3 FlashX

¿Qué es GLM-5.3 FlashX?

FlashX es la opción de Z.ai centrada en la velocidad dentro de GLM-5.3 Flash, orientada a programación interactiva y agentes multimodales. Un precio por token más alto no demuestra mayor calidad de respuesta.

¿Qué ID de modelo usa esta página de EvoLink?

El ID es glm-5.3-flashx. Consulta la documentación API enlazada en esta página para los formatos de petición y parámetros admitidos por cada endpoint.

¿Cuánto cuesta la API de GLM-5.3 FlashX?

La sección de precios muestra las tarifas de entrada, salida y lectura de caché del modelo. Usa el calculador para tu combinación de tokens y comprueba el uso y los cargos reales, sin aplicar precios ni promociones de otro proveedor.

¿Cuándo elegir FlashX en lugar de Flash?

Evalúa FlashX cuando el tiempo de respuesta limite un flujo interactivo. Flash cuesta menos por token y puede ser preferible para lotes sin urgencia. Compara éxito, tiempo total, reintentos y coste con los mismos ajustes.

¿EvoLink garantiza 200 tokens/s?

Esta página no garantiza ninguna velocidad. Z.ai anuncia 200 tokens/s para FlashX; es una afirmación del proveedor, no una prueba de EvoLink ni un SLA. Mide por separado la latencia del primer token y el tiempo total de la petición.

¿Qué entradas y salidas admite FlashX?

Z.ai indica texto, imágenes, vídeo y archivos como entrada, con salida de texto. Consulta los formatos de tu ruta en la documentación API enlazada. Admitir vídeo o archivos no significa generar directamente vídeos o archivos de Office.

¿Se puede desactivar el razonamiento?

Z.ai documenta únicamente thinking.type: enabled para FlashX. Reducir reasoning_effort no desactiva el razonamiento. Z.ai recomienda thinking.clear_thinking: false dentro del objeto thinking; verifica el soporte de la ruta en la documentación API.

¿Cómo presupuestar las entradas multimedia y en caché?

Revisa el uso y la facturación de peticiones representativas y aplica sus tarifas correspondientes. No supongas un número fijo de tokens por imagen ni un acierto de caché para cada prompt repetido.

¿Qué ventana de contexto ofrece FlashX?

Z.ai documenta 1M de tokens de contexto y hasta 128K tokens de salida. Consulta las especificaciones y la documentación API antes de elegir el límite de salida: contexto de entrada y capacidad de salida son límites distintos.

¿Puedo usar GLM-5.3 como alternativa de respaldo?

Evalúalo para tareas compatibles de solo texto que no superen tus criterios de aceptación. GLM-5.3 no admite las mismas entradas multimodales: no reenvíes sin cambios imágenes, vídeos o archivos. Define primero cómo gestionar entradas, costes y reintentos.