GLM-5.3 Flash API
Elegir GLM-5.3 Flash
El miembro nativamente multimodal de la generación 5.3: entrada de texto, imagen, vídeo y archivos por cerca de una novena parte del precio de GLM-5.3, con el mismo contexto de 1M de tokens, razonamiento siempre activo, llamada a herramientas y caché de prompts.
GLM-5.3 Flash
Modelo multimodal de alto volumen de Z.ai
glm-5.3-flashClasificación y extracción a gran volumen, comprensión de capturas y documentos, análisis de vídeo y archivos, y pasos de agente rutinarios donde el precio por token decide el enrutado.
Precios de GLM-5.3 Flash
Calcula una petición antes de enrutar tráfico. Todos los grupos pagan la misma tarifa y los tokens de salida ya incluyen los de razonamiento.
Calculadora de tokens
Introduce la mezcla de tokens de una petición.Coste estimado por petición
GLM-5.3 FlashCargo mínimo: 0,01 créditos por petición. La entrada de imagen, vídeo y archivos se factura como tokens de entrada.
Guía de presupuesto
Peticiones aproximadas con la mezcla actual.Pruebas rápidas
Desarrollo habitual
Evaluación en producción
Precios del modelo
| Modelo | Contexto | Tokens de entrada | Tokens de lectura de caché | Tokens de salida |
|---|---|---|---|---|
GLM-5.3 Flashglm-5.3-flash | Todos los tamaños de contexto | $0.150 / 1M10.2 cr / 1M | $0.031 / 1M2.1 cr / 1M | $0.500 / 1M34 cr / 1M |
GLM-5.3 Flash
Todos los tamaños de contextoUSD y créditos por 1M de tokens, tarifa única en toda la ventana de 1M.
La búsqueda web se factura por separado: 0.68 créditos por llamada.
API de GLM-5.3 Flash para trabajo multimodal y de alto volumen
El nivel de volumen de la generación 5.3 sobre la API unificada de EvoLink. Entrada de texto, imagen, vídeo y archivos por cerca de una novena parte del precio de GLM-5.3, con el mismo contexto de 1M de tokens, razonamiento siempre activo, llamada a herramientas y caché de prompts.

Dónde encaja GLM-5.3 Flash en un stack de producción
Flash está tarifado para volumen, así que la pregunta rara vez es si puedes permitírtelo, sino si supera tu umbral de precisión. Ejecútalo primero, escala solo lo que falle, y la diferencia de precio con el buque insignia empieza a trabajar a tu favor.
Clasificación y extracción a gran volumen
Enrutado de tickets, etiquetado, extracción estructurada y triaje de contenido se ejecutan a un precio en el que volver a lanzar todo cuesta menos que el tiempo de ingeniería para evitarlo. El tamaño del lote deja de ser la restricción.
Comprensión de capturas y documentos
Envía capturas de interfaz, páginas escaneadas o diagramas como bloques image_url y recibe salida estructurada. Es la capacidad que GLM-5.3 no tiene en absoluto: el buque insignia es solo texto.
Análisis de vídeo y archivos
La entrada de vídeo y archivos se acepta de forma nativa en lugar de mediante una tubería aparte, así que una petición puede llevar material mixto en vez de dividirse en un paso de transcripción y otro de razonamiento.
Pasos rutinarios dentro de un agente mayor
Resumir el resultado de una herramienta, decidir una rama, reformatear salida: los pasos que dominan el volumen de llamadas pero no la dificultad. Reserva el buque insignia para los pasos donde la profundidad de razonamiento decide el resultado.
Qué te da Flash y qué te pide a cambio
Flash no es un 5.3 recortado con ventana más pequeña: el contexto, los protocolos y la caché son idénticos. Difieren dos cosas, y una de ellas conviene que la midas tú mismo.
Entrada multimodal nativa, que el buque insignia no tiene
Texto, imagen, vídeo y archivos funcionan a través de la estructura estándar de messages. Las imágenes entran como bloques image_url con URL pública (recomendado oficialmente) o data URL en Base64, un bloque por imagen.
Cerca de una novena parte del precio del buque insignia
Entrada y salida se sitúan cerca de un noveno de la tarifa de GLM-5.3, y las lecturas de caché son aún más baratas. Esa diferencia cambia la forma de una carga de trabajo, no solo su factura.
La misma restricción de razonamiento que el resto de 5.3
Aquí también el razonamiento está siempre activo y se rechaza thinking.type: "disabled". Z.ai recomienda además clear_thinking: false para Flash; el parámetro se transmite sin cambios.
El recuento de tokens de multimedia conviene verificarlo
Imágenes y vídeo cuentan en prompt_tokens y se facturan a tarifa de entrada, pero el proveedor no publica una fórmula de tokens por imagen. Lanza una muestra representativa, lee el usage devuelto y dimensiona el lote a partir de ahí, no de una estimación.
Por qué Flash puede con tanto volumen
Flash conserva las propiedades de plataforma de la generación 5.3 y solo cambia el precio y las modalidades de entrada. Esa combinación es lo que lo convierte en opción por defecto y no en último recurso.
Texto y multimedia mezclados en una petición
Un mensaje puede llevar instrucciones, varias imágenes y un archivo a la vez, de modo que el material que pertenece a una misma decisión permanece en una sola llamada en lugar de repartirse por una tubería.
El mismo contexto de 1M a tarifa única
Flash no es un modelo de contexto corto. La ventana completa de 1M está disponible a tarifa única sin escalón por contexto largo, y eso es lo que hace viable el trabajo documental masivo a este precio.
Lecturas de caché a una fracción de la entrada
Un prompt de sistema estable y los esquemas de herramientas se facturan a tarifa de lectura de caché durante todo el bucle. En un modelo ya barato, eso deja el coste marginal de un paso extra casi en nada.
Qué verificar antes de mover volumen a Flash
Dos son comprobaciones de corrección y dos de coste. La de tokens de multimedia es la que más equipos se saltan y luego lamentan en un lote grande.
Usa glm-5.3-flash como ID de modelo
El mismo ID funciona en Chat Completions y Anthropic Messages y coincide exactamente con el nombre del proveedor.
Elimina cualquier thinking.type: "disabled"
Toda la generación 5.3 lo rechaza. Usa thinking.type: "enabled" con reasoning_effort: "low" para la ruta más barata y rápida.
Mide tokens de multimedia con una muestra real
Envía imágenes o vídeos representativos, lee prompt_tokens en la respuesta y calcula tu propio coste unitario antes de fijar un tamaño de lote.
Define la regla de escalado a GLM-5.3
Decide de antemano qué cuenta como fallo de Flash y qué desencadena. Sin regla, los equipos o no escalan nada y publican errores, o escalan todo y pierden la ventaja de precio.
Mide la brecha de precisión y luego ponle precio
La comparación útil no es Flash contra un benchmark, sino Flash contra GLM-5.3 en tus propias tareas. Si Flash iguala al buque insignia en nueve de cada diez peticiones, ejecutar ambos y escalar la décima sale mucho más barato que enviar las diez al buque insignia.
Ponle precio a la brecha de precisión en lugar de suponerla. Un modelo a una novena parte del coste solo tiene que acertar la mayoría de las veces para que ejecutar-y-escalar gane a enviarlo todo al buque insignia, pero «la mayoría de las veces» es un número que debes medir en tu propia carga de trabajo, no heredarlo de un benchmark.
Compara con GLM-5.3 y DeepSeek V4 Flash
EvoLinkFlash es el nivel de volumen de la generación 5.3. Comprueba primero si supera tu umbral de precisión; si lo hace, la diferencia de precio con el buque insignia basta para cambiar cómo enrutas todo lo rutinario.
| Modelo | GLM-5.3 Flash | GLM-5.3 | DeepSeek V4 Flash |
|---|---|---|---|
| Entrada / Salida | $0.15 / $0.5 | $1.4 / $4.4 | $0.442 / $1.324 |
| Contexto | 1M | 1M | 1M |
| Caché | Lecturas de caché | Lecturas de caché | Lecturas de caché |
| Ideal para | Clasificación y extracción a gran volumen, comprensión de capturas y documentos, análisis de vídeo y archivos, y pasos de agente rutinarios donde el precio por token decide el enrutado. | El buque insignia 5.3: solo texto, unas nueve veces el precio, y el objetivo de escalado correcto cuando Flash no alcanza el umbral en razonamiento difícil. | La ruta de alto volumen de DeepSeek con 1M de contexto y lectura de caché muy barata. La comparación de coste más directa para trabajo masivo de texto. |
Modelos relacionados

GLM-5.3
El buque insignia 5.3: solo texto, unas nueve veces el precio, y el objetivo de escalado correcto cuando Flash no alcanza el umbral en razonamiento difícil.
Ver modelo
DeepSeek V4 Flash
La ruta de alto volumen de DeepSeek con 1M de contexto y lectura de caché muy barata. La comparación de coste más directa para trabajo masivo de texto.
Ver modelo
GLM-5.2
El anterior buque insignia de GLM. Sigue siendo relevante para clientes que dependen de desactivar el razonamiento, algo que la generación 5.3 ya no permite.
Ver modelo
Gemini 3.7 Flash
La ruta multimodal económica de Google: buena referencia entre proveedores cuando la comprensión de imágenes y documentos decide la elección.
Ver modeloLecturas relacionadas

GLM-5.3 Flash frente a GLM-5.3
Elige la ruta por modalidad, dificultad y coste por resultado aceptado, con una política Flash-first y escalado selectivo.
Leer artículo
GLM-5.3 ya está aquí: qué se lanzó
Qué confirmó el lanzamiento del 14 de agosto sobre la generación 5.3 — especificaciones, IDs y acceso por fases — y qué quedó abierto.
Leer artículo
GLM-5.3 frente a GLM-5.2
Mismo modelo base, todas las mejoras del post-entrenamiento, más la ruptura de no poder desactivar el razonamiento en toda la generación.
Leer artículo
GLM-5.3 frente a Claude
Benchmarks, contratos de API y disponibilidad real comparados antes de enrutar agentes a cualquiera de las dos familias.
Leer artículo
Benchmarks de ciberseguridad de GLM-5.3
Qué afirman las cifras de CyberGym y ExploitBench según el propio Z.ai y cómo debería leerlas un defensor.
Leer artículo
Un gateway para 3 CLI de programación
Rutas de configuración, variables de entorno y una lista de diagnóstico para ejecutar varias CLI a través de un solo endpoint.
Leer artículoPreguntas frecuentes sobre la API de GLM-5.3 Flash
¿Está disponible la API de GLM-5.3 Flash en EvoLink?
Sí. GLM-5.3 Flash está disponible como modelo de producción, servido por Chat Completions y Anthropic Messages.
¿Qué ID de modelo debo usar?
glm-5.3-flash en ambos endpoints. El nombre en EvoLink coincide exactamente con el del proveedor.
¿Qué tipos de entrada acepta Flash?
Texto, imágenes, vídeo y archivos. Es la diferencia principal con GLM-5.3, que es solo texto.
¿Cómo envío una imagen?
Coloca un bloque image_url en messages[].content[] y pasa una URL pública (la forma recomendada oficialmente) o una data URL en Base64. Para varias imágenes, añade un bloque image_url por imagen.
¿Cómo se factura la entrada de imagen y vídeo?
Los medios cuentan en prompt_tokens y se cobran a tarifa de entrada; no hay SKU separada para multimedia. El proveedor no publica una fórmula de conversión a tokens para imágenes, así que ejecuta una muestra representativa y revisa el usage devuelto antes de dimensionar un lote grande.
¿Puedo desactivar el razonamiento?
No. Toda la generación 5.3 razona siempre y rechaza thinking.type: "disabled". Para la ruta más barata y rápida, usa thinking.type: "enabled" con reasoning_effort: "low".
¿Qué es clear_thinking y debo configurarlo?
Controla si el razonamiento previo se descarta entre turnos. Z.ai recomienda clear_thinking: false para Flash. El parámetro se transmite tal cual; EvoLink no lo reescribe.
¿Cuánto más barato es Flash que GLM-5.3?
Alrededor de una novena parte en entrada y salida. Esa diferencia suele justificar ejecutar Flash primero y escalar solo las peticiones que no superen tu verificación de aceptación.
¿Cómo se factura la caché de prompts?
Las lecturas de caché tienen su propia tarifa, alrededor de una quinta parte de la entrada nueva. No hay cargo por escritura porque el proveedor no reporta tokens de creación. Mantén el prefijo estable byte a byte para seguir acertando.
¿Cuál es la ventana de contexto y el límite de salida?
1.000.000 de tokens de contexto y hasta 131.072 tokens de salida, con tarifa única en toda la ventana: no hay escalón por contexto largo.
¿Es Flash una buena opción por defecto para alto volumen?
Sí, su precio está pensado para eso. Clasificación, extracción, pasos de agente rutinarios y comprensión de documentos o capturas encajan de forma natural. Escala a GLM-5.3 solo donde un razonamiento más profundo cambie el resultado de forma medible.
¿Qué debe medir una evaluación en producción?
Éxito a la primera, entregables aceptados, reintentos, proporción de tokens de razonamiento en la salida, tasa de acierto de caché, tokens de multimedia por petición, tiempo hasta el resultado aceptado y la tasa de escalado a GLM-5.3.