GPT Image 2.5 Flare & Sunburst ya están disponibles en EvoLinkProbar GPT Image 2.5

GLM-5.3 Flash API

Accede a GLM-5.3 Flash de Z.ai —también buscado como GLM 5.3 Flash / Zhipu GLM-5.3 Flash— a través de la API de chat unificada de EvoLink. Prueba la entrada de imágenes, el análisis de documentos largos, los agentes de varios pasos antes de integrar.

Z.aiGeneración de textoDisponible
desde $0.150 / 1M tokens de entrada
Entrada multimodalImagen · vídeo · archivoRazonamiento siempre activoChat + Messages
Ruta de producciónLive
Contexto
1M de contexto · 131K de salida máx.
Ideal para
Clasificación a gran volumen, comprensión de capturas y documentos, pasos de agente rutinarios
Entrada
Texto + imágenes
Salida
Texto · JSON (salida estructurada) · llamadas a herramientas

Elegir GLM-5.3 Flash

El miembro nativamente multimodal de la generación 5.3: entrada de texto, imagen, vídeo y archivos por cerca de una novena parte del precio de GLM-5.3, con el mismo contexto de 1M de tokens, razonamiento siempre activo, llamada a herramientas y caché de prompts.

GLM-5.3 Flash

Modelo multimodal de alto volumen de Z.ai

Seleccionado
ID del modelo
glm-5.3-flash
Ideal para

Clasificación y extracción a gran volumen, comprensión de capturas y documentos, análisis de vídeo y archivos, y pasos de agente rutinarios donde el precio por token decide el enrutado.

Entrada
$0.150 / 1M10.2 cr / 1M
Lectura de caché
$0.031 / 1M2.1 cr / 1M
Salida
$0.500 / 1M34 cr / 1M

Todas las tarifas son por 1M de tokens, en USD y créditos, y reflejan los precios actuales de tu cuenta.

Precios de GLM-5.3 Flash

Estima el coste de una solicitud de GLM-5.3 Flash antes de integrar. La calculadora usa las tarifas actuales de tu cuenta; los precios oficiales sirven de referencia.

Calculadora de solicitud

Introduce la combinación de tokens de una solicitud y el número de llamadas a herramientas exitosas.

Coste estimado por solicitud

GLM-5.3 Flash
USD$0.0004
Créditos0.0209
Tokens de entrada0.0102 cr
Tokens de lectura de caché0.0005 cr
Tokens de salida0.0102 cr

Cargo mínimo: 0.01 créditos por solicitud.

Guía de presupuesto

Solicitudes aproximadas con la combinación actual de tokens.
Añadir créditos
$10
Unas 32535 solicitudes

Para pruebas rápidas

$50
Unas 162679 solicitudes

Para el desarrollo habitual

$100
Unas 325358 solicitudes

Para la evaluación en producción

Tarifas de herramientas del servidor

Solo las llamadas exitosas del lado del servidor se facturan por llamada; los intentos fallidos no tienen tarifa de herramienta, pero los tokens sí se cobran.
  • Búsqueda web$0.010/ llamada0.68 cr / llamada

API de GLM-5.3 Flash para trabajo multimodal y de alto volumen

El nivel de volumen de la generación 5.3 sobre la API unificada de EvoLink. Entrada de texto, imagen, vídeo y archivos por cerca de una novena parte del precio de GLM-5.3, con el mismo contexto de 1M de tokens, razonamiento siempre activo, llamada a herramientas y caché de prompts.

GLM-5.3 Flash se sirve en EvoLink con el ID de modelo glm-5.3-flash mediante Chat Completions · Responses · Anthropic Messages, con la misma clave API y saldo que usas para cualquier otro modelo. Ofrece una ventana de contexto de 1M y hasta 131K tokens de salida, además de la entrada de imágenes, el análisis de documentos largos, los agentes de varios pasos.

GLM-5.3 Flash

Especificaciones y capacidades de GLM-5.3 Flash

Las cifras proceden de la configuración de ruta de EvoLink; las capacidades son las que la API expone hoy.

Ventana de contexto
1M tokens
Salida máx.
131K tokens
Entrada
Texto + imágenes
Salida
Texto · JSON (salida estructurada) · llamadas a herramientas
Razonamiento
Razonamiento siempre activo
Uso de herramientas
Llamadas a funciones con secuencias de herramientas de varios pasos
Caché de prompts
Lecturas de caché automáticas a tarifa reducida
Herramientas del servidor
Búsqueda web, facturadas por llamada exitosa
Protocolos
Chat Completions · Responses · Anthropic Messages
ID del modelo
glm-5.3-flash

Por qué GLM-5.3 Flash puede con tanto volumen

Flash conserva las propiedades de plataforma de la generación 5.3 y solo cambia el precio y las modalidades de entrada. Esa combinación es lo que lo convierte en opción por defecto y no en último recurso.

Texto y multimedia mezclados en una petición

Un mensaje puede llevar instrucciones, varias imágenes y un archivo a la vez, de modo que el material que pertenece a una misma decisión permanece en una sola llamada en lugar de repartirse por una tubería.

El mismo contexto de 1M a tarifa única

Flash no es un modelo de contexto corto. La ventana completa de 1M está disponible a tarifa única sin escalón por contexto largo, y eso es lo que hace viable el trabajo documental masivo a este precio.

Lecturas de caché a una fracción de la entrada

Un prompt de sistema estable y los esquemas de herramientas se facturan a tarifa de lectura de caché durante todo el bucle. En un modelo ya barato, eso deja el coste marginal de un paso extra casi en nada.

Dónde encaja GLM-5.3 Flash en un stack de producción

Flash está tarifado para volumen, así que la pregunta rara vez es si puedes permitírtelo, sino si supera tu umbral de precisión. Ejecútalo primero, escala solo lo que falle, y la diferencia de precio con el buque insignia empieza a trabajar a tu favor.

Clasificación y extracción a gran volumen

Enrutado de tickets, etiquetado, extracción estructurada y triaje de contenido se ejecutan a un precio en el que volver a lanzar todo cuesta menos que el tiempo de ingeniería para evitarlo. El tamaño del lote deja de ser la restricción.

Comprensión de capturas y documentos

Envía capturas de interfaz, páginas escaneadas o diagramas como bloques image_url y recibe salida estructurada. Es la capacidad que GLM-5.3 no tiene en absoluto: el buque insignia es solo texto.

Análisis de vídeo y archivos

La entrada de vídeo y archivos se acepta de forma nativa en lugar de mediante una tubería aparte, así que una petición puede llevar material mixto en vez de dividirse en un paso de transcripción y otro de razonamiento.

Pasos rutinarios dentro de un agente mayor

Resumir el resultado de una herramienta, decidir una rama, reformatear salida: los pasos que dominan el volumen de llamadas pero no la dificultad. Reserva el buque insignia para los pasos donde la profundidad de razonamiento decide el resultado.

Qué te da GLM-5.3 Flash y qué te pide a cambio

Flash no es un 5.3 recortado con ventana más pequeña: el contexto, los protocolos y la caché son idénticos. Difieren dos cosas, y una de ellas conviene que la midas tú mismo.

Entrada multimodal nativa, que el buque insignia no tiene

Texto, imagen, vídeo y archivos funcionan a través de la estructura estándar de messages. Las imágenes entran como bloques image_url con URL pública (recomendado oficialmente) o data URL en Base64, un bloque por imagen.

Cerca de una novena parte del precio del buque insignia

Entrada y salida se sitúan cerca de un noveno de la tarifa de GLM-5.3, y las lecturas de caché son aún más baratas. Esa diferencia cambia la forma de una carga de trabajo, no solo su factura.

La misma restricción de razonamiento que el resto de 5.3

Aquí también el razonamiento está siempre activo y se rechaza thinking.type: "disabled". Z.ai recomienda además clear_thinking: false para Flash; el parámetro se transmite sin cambios.

El recuento de tokens de multimedia conviene verificarlo

Imágenes y vídeo cuentan en prompt_tokens y se facturan a tarifa de entrada, pero el proveedor no publica una fórmula de tokens por imagen. Lanza una muestra representativa, lee el usage devuelto y dimensiona el lote a partir de ahí, no de una estimación.

Dos formas de usar GLM-5.3 Flash: API de EvoLink o Agente

Usa la API de EvoLink para backends de producto y trabajos por lotes, o llama a GLM-5.3 Flash desde Codex, Claude o Gemini para flujos de código y análisis. Ambas vías comparten la misma clave API de EvoLink, saldo, ID de modelo e historial de solicitudes.

Opción 1

Integrar con la API de EvoLink

Ideal para: backends de producto, trabajos por lotes, pipelines automatizados

Envía a EvoLink solicitudes Chat Completions compatibles con OpenAI (o Anthropic Messages) y controla el ID de modelo, el prompt de sistema, el presupuesto de salida, las herramientas y la salida estructurada.

  1. 1Crea una clave API de EvoLink en la consola
  2. 2Apunta tu SDK de OpenAI o Anthropic a la URL base de EvoLink y selecciona el ID de modelo mostrado arriba
  3. 3Envía una solicitud representativa y lee el campo usage para tokens de entrada, en caché y de salida
  4. 4Define max_tokens y reintentos por tarea; conserva los ID y resultados de llamadas a herramientas entre turnos
Opción 2

Llamarlo con un Agente

Ideal para: tareas de código, revisión y análisis en Codex, Claude y Gemini

Dale al Agente la tarea, las entradas a incluir y los criterios de aceptación. Él arma la solicitud, llama a GLM-5.3 Flash a través de EvoLink y devuelve la respuesta con el uso de tokens.

  1. 1Define EVOLINK_API_KEY en tu entorno local; nunca en código ni en un prompt
  2. 2Describe la tarea, las entradas a incluir y el formato de salida esperado
  3. 3Pide al Agente que llame a GLM-5.3 Flash a través de EvoLink y muestre la solicitud antes de enviarla
  4. 4Deja que el Agente informe la respuesta, el uso de tokens y cualquier cuerpo de error

Ejemplo de código de la API de GLM-5.3 Flash y manejo de errores

Este ejemplo muestra la solicitud ejecutable más corta: una llamada Chat Completions compatible con OpenAI con prompt de sistema, mensaje de usuario y presupuesto de salida. Abre la pestaña API para la referencia completa de parámetros y respuestas.

Ver documentación completa de la API
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [
      { "role": "system", "content": "You extract structured data. Answer in JSON only." },
      { "role": "user", "content": [
        { "type": "text", "text": "List every line item on this receipt as JSON." },
        { "type": "image_url", "image_url": { "url": "https://example.com/receipt.jpg" } }
      ] }
    ],
    "max_tokens": 1024,
    "temperature": 0.1
  }'

# Reasoning is always on for the 5.3 generation: do not send
# thinking.type "disabled". The same model ID works on /v1/messages
# (Anthropic Messages). The response includes choices[0].message and
# a usage object; image and video input is counted in prompt_tokens.

Solicitud inválida o parámetro no admitido

Comprueba el ID de modelo, el array messages y los rangos de parámetros en la referencia de la API; elimina los campos que esta ruta no admite.

Problema de autenticación o saldo

Comprueba el token Bearer de Authorization y confirma el saldo disponible en la consola.

Longitud de contexto excedida

Los tokens del prompt superan la ventana de contexto de GLM-5.3 Flash. Recorta o recupera solo la evidencia relevante y reutiliza prefijos en caché.

Límite de tasa (429)

Espera y reintenta con jitter; agrupa o encola las solicitudes en lugar de ráfagas paralelas.

Contenido o llamada a herramienta rechazados

Revisa contenido sensible, argumentos de llamada a herramienta mal formados y desajustes del esquema JSON antes de reintentar.

Qué verificar antes de mover volumen a GLM-5.3 Flash

Dos son comprobaciones de corrección y dos de coste. La de tokens de multimedia es la que más equipos se saltan y luego lamentan en un lote grande.

01

Usa glm-5.3-flash como ID de modelo

El mismo ID funciona en Chat Completions y Anthropic Messages y coincide exactamente con el nombre del proveedor.

Obligatorio
02

Elimina cualquier thinking.type: "disabled"

Toda la generación 5.3 lo rechaza. Usa thinking.type: "enabled" con reasoning_effort: "low" para la ruta más barata y rápida.

Ruptura
03

Mide tokens de multimedia con una muestra real

Envía imágenes o vídeos representativos, lee prompt_tokens en la respuesta y calcula tu propio coste unitario antes de fijar un tamaño de lote.

Coste
04

Define la regla de escalado a GLM-5.3

Decide de antemano qué cuenta como fallo de Flash y qué desencadena. Sin regla, los equipos o no escalan nada y publican errores, o escalan todo y pierden la ventaja de precio.

Enrutado

La lectura de caché cuesta una quinta parte de la entrada nueva

La entrada cacheada se factura con su propia tarifa reducida, así que un prompt de sistema estable y los esquemas de herramientas siguen siendo baratos en bucles de agente largos. No hay cargo por escritura de caché: el proveedor no reporta tokens de creación.

Entrada nativa de imagen, vídeo y archivos

Envía imágenes como bloques image_url dentro de messages[].content[], con URL pública (recomendado) o data URL en Base64, y añade un bloque por imagen. Los medios cuentan en prompt_tokens y se cobran a tarifa de entrada: mide con una muestra representativa antes de dimensionar un lote grande.

Mide la brecha de precisión de GLM-5.3 Flash y luego ponle precio

La comparación útil no es Flash contra un benchmark, sino Flash contra GLM-5.3 en tus propias tareas. Si Flash iguala al buque insignia en nueve de cada diez peticiones, ejecutar ambos y escalar la décima sale mucho más barato que enviar las diez al buque insignia.

Tasa de éxito a la primeraEntregables aceptadosTasa de escalado a GLM-5.3Tokens de multimedia por peticiónTasa de acierto de cachéProporción de razonamiento en la salidaTiempo hasta el resultado aceptadoCoste por tarea aceptada

Ponle precio a la brecha de precisión en lugar de suponerla. Un modelo a una novena parte del coste solo tiene que acertar la mayoría de las veces para que ejecutar-y-escalar gane a enviarlo todo al buque insignia, pero «la mayoría de las veces» es un número que debes medir en tu propia carga de trabajo, no heredarlo de un benchmark.

Compara con GLM-5.3 y DeepSeek V4 Flash

EvoLink

Flash es el nivel de volumen de la generación 5.3. Comprueba primero si supera tu umbral de precisión; si lo hace, la diferencia de precio con el buque insignia basta para cambiar cómo enrutas todo lo rutinario.

GLM-5.3 Flash
Entrada / Salida$0.15 / $0.5
Contexto1M
CachéLecturas de caché
Ideal paraClasificación y extracción a gran volumen, comprensión de capturas y documentos, análisis de vídeo y archivos, y pasos de agente rutinarios donde el precio por token decide el enrutado.
GLM-5.3
Entrada / Salida$1.4 / $4.4
Contexto1M
CachéLecturas de caché
Ideal paraEl buque insignia 5.3: solo texto, unas nueve veces el precio, y el objetivo de escalado correcto cuando Flash no alcanza el umbral en razonamiento difícil.
DeepSeek V4 Flash
Entrada / Salida$0.442 / $1.324
Contexto1M
CachéLecturas de caché
Ideal paraLa ruta de alto volumen de DeepSeek con 1M de contexto y lectura de caché muy barata. La comparación de coste más directa para trabajo masivo de texto.

Familia de modelos GLM

Misma clave API y saldo: cambia de nivel sin tocar la integración.

GLM-5.3

GLM-5.3

Modelo de razonamiento insignia de Z.ai

Ver modelo
GLM-5.2

GLM-5.2

El anterior buque insignia de GLM. Sigue siendo relevante para clientes que dependen de desactivar el razonamiento, algo que la generación 5.3 ya no permite.

Ver modelo
GLM-5.5

GLM-5.5

El próximo buque insignia de GLM en la lista de seguimiento de EvoLink. Apúntate a la alerta para recibir ID de modelo, precio y verificación de ruta el día del lanzamiento.

Ver modelo

Otros modelos de texto en EvoLink además de GLM-5.3 Flash

DeepSeek V4 Flash

DeepSeek V4 Flash

La ruta de alto volumen de DeepSeek con 1M de contexto y lectura de caché muy barata. La comparación de coste más directa para trabajo masivo de texto.

Ver modelo
Gemini 3.7 Flash

Gemini 3.7 Flash

La ruta multimodal económica de Google: buena referencia entre proveedores cuando la comprensión de imágenes y documentos decide la elección.

Ver modelo
Kimi K3

Kimi K3

La ruta de razonamiento de contexto largo de Moonshot para código a escala de repositorio y trabajo multidocumento.

Ver modelo
GPT-5.6

GPT-5.6

La familia frontier de OpenAI por niveles (Sol/Terra/Luna) para equilibrar capacidad, latencia y coste.

Ver modelo

Lecturas relacionadas sobre GLM-5.3 Flash

GLM-5.3 Flash frente a GLM-5.3

GLM-5.3 Flash frente a GLM-5.3

Elige la ruta por modalidad, dificultad y coste por resultado aceptado, con una política Flash-first y escalado selectivo.

Leer artículo
GLM-5.3 ya está aquí: qué se lanzó

GLM-5.3 ya está aquí: qué se lanzó

Qué confirmó el lanzamiento del 14 de agosto sobre la generación 5.3 — especificaciones, IDs y acceso por fases — y qué quedó abierto.

Leer artículo
GLM-5.3 frente a GLM-5.2

GLM-5.3 frente a GLM-5.2

Mismo modelo base, todas las mejoras del post-entrenamiento, más la ruptura de no poder desactivar el razonamiento en toda la generación.

Leer artículo
GLM-5.3 frente a Claude

GLM-5.3 frente a Claude

Benchmarks, contratos de API y disponibilidad real comparados antes de enrutar agentes a cualquiera de las dos familias.

Leer artículo
Benchmarks de ciberseguridad de GLM-5.3

Benchmarks de ciberseguridad de GLM-5.3

Qué afirman las cifras de CyberGym y ExploitBench según el propio Z.ai y cómo debería leerlas un defensor.

Leer artículo
Un gateway para 3 CLI de programación

Un gateway para 3 CLI de programación

Rutas de configuración, variables de entorno y una lista de diagnóstico para ejecutar varias CLI a través de un solo endpoint.

Leer artículo

Preguntas frecuentes sobre la API de GLM-5.3 Flash

¿Está disponible la API de GLM-5.3 Flash en EvoLink?

Sí. GLM-5.3 Flash está disponible como modelo de producción, servido por Chat Completions y Anthropic Messages.

¿Qué ID de modelo debo usar?

glm-5.3-flash en ambos endpoints. El nombre en EvoLink coincide exactamente con el del proveedor.

¿Qué tipos de entrada acepta Flash?

Texto, imágenes, vídeo y archivos. Es la diferencia principal con GLM-5.3, que es solo texto.

¿Cómo envío una imagen?

Coloca un bloque image_url en messages[].content[] y pasa una URL pública (la forma recomendada oficialmente) o una data URL en Base64. Para varias imágenes, añade un bloque image_url por imagen.

¿Cómo se factura la entrada de imagen y vídeo?

Los medios cuentan en prompt_tokens y se cobran a tarifa de entrada; no hay SKU separada para multimedia. El proveedor no publica una fórmula de conversión a tokens para imágenes, así que ejecuta una muestra representativa y revisa el usage devuelto antes de dimensionar un lote grande.

¿Puedo desactivar el razonamiento?

No. Toda la generación 5.3 razona siempre y rechaza thinking.type: "disabled". Para la ruta más barata y rápida, usa thinking.type: "enabled" con reasoning_effort: "low".

¿Qué es clear_thinking y debo configurarlo?

Controla si el razonamiento previo se descarta entre turnos. Z.ai recomienda clear_thinking: false para Flash. El parámetro se transmite tal cual; EvoLink no lo reescribe.

¿Cuánto más barato es Flash que GLM-5.3?

Alrededor de una novena parte en entrada y salida. Esa diferencia suele justificar ejecutar Flash primero y escalar solo las peticiones que no superen tu verificación de aceptación.

¿Cómo se factura la caché de prompts?

Las lecturas de caché tienen su propia tarifa, alrededor de una quinta parte de la entrada nueva. No hay cargo por escritura porque el proveedor no reporta tokens de creación. Mantén el prefijo estable byte a byte para seguir acertando.

¿Cuál es la ventana de contexto y el límite de salida?

1.000.000 de tokens de contexto y hasta 131.072 tokens de salida, con tarifa única en toda la ventana: no hay escalón por contexto largo.

¿Es Flash una buena opción por defecto para alto volumen?

Sí, su precio está pensado para eso. Clasificación, extracción, pasos de agente rutinarios y comprensión de documentos o capturas encajan de forma natural. Escala a GLM-5.3 solo donde un razonamiento más profundo cambie el resultado de forma medible.

¿Qué debe medir una evaluación en producción?

Éxito a la primera, entregables aceptados, reintentos, proporción de tokens de razonamiento en la salida, tasa de acierto de caché, tokens de multimedia por petición, tiempo hasta el resultado aceptado y la tasa de escalado a GLM-5.3.