Seedance 2.5 ya está disponible en EvoLinkProbar Seedance 2.5

GLM-5.3 Flash API

Z.ai-Generación de texto multimodal-desde $0.150 / 1M tokens de entrada-Disponible
1M de contextoImagen · vídeo · archivoRazonamiento siempre activoChat + Messages
Production routeLive
Proveedor
Z.ai / Zhipu
Modelo
glm-5.3-flash
Ventana de contexto
1.000.000 tokens
Entrada
Texto · imagen · vídeo · archivo

Elegir GLM-5.3 Flash

El miembro nativamente multimodal de la generación 5.3: entrada de texto, imagen, vídeo y archivos por cerca de una novena parte del precio de GLM-5.3, con el mismo contexto de 1M de tokens, razonamiento siempre activo, llamada a herramientas y caché de prompts.

GLM-5.3 Flash

Modelo multimodal de alto volumen de Z.ai

Seleccionado
Desde $0.150 / 1M tokens de entradaglm-5.3-flash
Ideal para

Clasificación y extracción a gran volumen, comprensión de capturas y documentos, análisis de vídeo y archivos, y pasos de agente rutinarios donde el precio por token decide el enrutado.

Entrada
$0.150 / 1M10.2 cr / 1M
Lectura de caché
$0.031 / 1M2.1 cr / 1M
Salida
$0.500 / 1M34 cr / 1M

Precios de GLM-5.3 Flash

Calcula una petición antes de enrutar tráfico. Todos los grupos pagan la misma tarifa y los tokens de salida ya incluyen los de razonamiento.

Flash

Calculadora de tokens

Introduce la mezcla de tokens de una petición.

Coste estimado por petición

GLM-5.3 Flash
Tarifa plana
USD$0.0004
Credits0.0209
Tokens de entrada0.0102 cr
Tokens de lectura de caché0.0005 cr
Tokens de salida0.0102 cr

Cargo mínimo: 0,01 créditos por petición. La entrada de imagen, vídeo y archivos se factura como tokens de entrada.

Guía de presupuesto

Peticiones aproximadas con la mezcla actual.
Añadir créditos
$10
Unas 32535 peticiones

Pruebas rápidas

$50
Unas 162679 peticiones

Desarrollo habitual

$100
Unas 325358 peticiones

Evaluación en producción

Precios del modelo

GLM-5.3 Flash

Todos los tamaños de contexto
Tokens de entrada
$0.150 / 1M10.2 cr / 1M
Tokens de lectura de caché
$0.031 / 1M2.1 cr / 1M
Tokens de salida
$0.500 / 1M34 cr / 1M

USD y créditos por 1M de tokens, tarifa única en toda la ventana de 1M.

La búsqueda web se factura por separado: 0.68 créditos por llamada.

API de GLM-5.3 Flash para trabajo multimodal y de alto volumen

El nivel de volumen de la generación 5.3 sobre la API unificada de EvoLink. Entrada de texto, imagen, vídeo y archivos por cerca de una novena parte del precio de GLM-5.3, con el mismo contexto de 1M de tokens, razonamiento siempre activo, llamada a herramientas y caché de prompts.

GLM-5.3 Flash
Casos de uso de GLM-5.3 Flash

Dónde encaja GLM-5.3 Flash en un stack de producción

Flash está tarifado para volumen, así que la pregunta rara vez es si puedes permitírtelo, sino si supera tu umbral de precisión. Ejecútalo primero, escala solo lo que falle, y la diferencia de precio con el buque insignia empieza a trabajar a tu favor.

Clasificación y extracción a gran volumen

Enrutado de tickets, etiquetado, extracción estructurada y triaje de contenido se ejecutan a un precio en el que volver a lanzar todo cuesta menos que el tiempo de ingeniería para evitarlo. El tamaño del lote deja de ser la restricción.

Comprensión de capturas y documentos

Envía capturas de interfaz, páginas escaneadas o diagramas como bloques image_url y recibe salida estructurada. Es la capacidad que GLM-5.3 no tiene en absoluto: el buque insignia es solo texto.

Análisis de vídeo y archivos

La entrada de vídeo y archivos se acepta de forma nativa en lugar de mediante una tubería aparte, así que una petición puede llevar material mixto en vez de dividirse en un paso de transcripción y otro de razonamiento.

Pasos rutinarios dentro de un agente mayor

Resumir el resultado de una herramienta, decidir una rama, reformatear salida: los pasos que dominan el volumen de llamadas pero no la dificultad. Reserva el buque insignia para los pasos donde la profundidad de razonamiento decide el resultado.

En qué se diferencia Flash

Qué te da Flash y qué te pide a cambio

Flash no es un 5.3 recortado con ventana más pequeña: el contexto, los protocolos y la caché son idénticos. Difieren dos cosas, y una de ellas conviene que la midas tú mismo.

Entrada multimodal nativa, que el buque insignia no tiene

Texto, imagen, vídeo y archivos funcionan a través de la estructura estándar de messages. Las imágenes entran como bloques image_url con URL pública (recomendado oficialmente) o data URL en Base64, un bloque por imagen.

Cerca de una novena parte del precio del buque insignia

Entrada y salida se sitúan cerca de un noveno de la tarifa de GLM-5.3, y las lecturas de caché son aún más baratas. Esa diferencia cambia la forma de una carga de trabajo, no solo su factura.

La misma restricción de razonamiento que el resto de 5.3

Aquí también el razonamiento está siempre activo y se rechaza thinking.type: "disabled". Z.ai recomienda además clear_thinking: false para Flash; el parámetro se transmite sin cambios.

El recuento de tokens de multimedia conviene verificarlo

Imágenes y vídeo cuentan en prompt_tokens y se facturan a tarifa de entrada, pero el proveedor no publica una fórmula de tokens por imagen. Lanza una muestra representativa, lee el usage devuelto y dimensiona el lote a partir de ahí, no de una estimación.

Capacidades de GLM-5.3 Flash

Por qué Flash puede con tanto volumen

Flash conserva las propiedades de plataforma de la generación 5.3 y solo cambia el precio y las modalidades de entrada. Esa combinación es lo que lo convierte en opción por defecto y no en último recurso.

Texto y multimedia mezclados en una petición

Un mensaje puede llevar instrucciones, varias imágenes y un archivo a la vez, de modo que el material que pertenece a una misma decisión permanece en una sola llamada en lugar de repartirse por una tubería.

El mismo contexto de 1M a tarifa única

Flash no es un modelo de contexto corto. La ventana completa de 1M está disponible a tarifa única sin escalón por contexto largo, y eso es lo que hace viable el trabajo documental masivo a este precio.

Lecturas de caché a una fracción de la entrada

Un prompt de sistema estable y los esquemas de herramientas se facturan a tarifa de lectura de caché durante todo el bucle. En un modelo ya barato, eso deja el coste marginal de un paso extra casi en nada.

Comprobaciones de producción de Flash

Qué verificar antes de mover volumen a Flash

Dos son comprobaciones de corrección y dos de coste. La de tokens de multimedia es la que más equipos se saltan y luego lamentan en un lote grande.

01

Usa glm-5.3-flash como ID de modelo

El mismo ID funciona en Chat Completions y Anthropic Messages y coincide exactamente con el nombre del proveedor.

Obligatorio
02

Elimina cualquier thinking.type: "disabled"

Toda la generación 5.3 lo rechaza. Usa thinking.type: "enabled" con reasoning_effort: "low" para la ruta más barata y rápida.

Ruptura
03

Mide tokens de multimedia con una muestra real

Envía imágenes o vídeos representativos, lee prompt_tokens en la respuesta y calcula tu propio coste unitario antes de fijar un tamaño de lote.

Coste
04

Define la regla de escalado a GLM-5.3

Decide de antemano qué cuenta como fallo de Flash y qué desencadena. Sin regla, los equipos o no escalan nada y publican errores, o escalan todo y pierden la ventaja de precio.

Enrutado
Evaluación de GLM-5.3 Flash

Mide la brecha de precisión y luego ponle precio

La comparación útil no es Flash contra un benchmark, sino Flash contra GLM-5.3 en tus propias tareas. Si Flash iguala al buque insignia en nueve de cada diez peticiones, ejecutar ambos y escalar la décima sale mucho más barato que enviar las diez al buque insignia.

Tasa de éxito a la primeraEntregables aceptadosTasa de escalado a GLM-5.3Tokens de multimedia por peticiónTasa de acierto de cachéProporción de razonamiento en la salidaTiempo hasta el resultado aceptadoCoste por tarea aceptada

Ponle precio a la brecha de precisión en lugar de suponerla. Un modelo a una novena parte del coste solo tiene que acertar la mayoría de las veces para que ejecutar-y-escalar gane a enviarlo todo al buque insignia, pero «la mayoría de las veces» es un número que debes medir en tu propia carga de trabajo, no heredarlo de un benchmark.

Compara con GLM-5.3 y DeepSeek V4 Flash

EvoLink

Flash es el nivel de volumen de la generación 5.3. Comprueba primero si supera tu umbral de precisión; si lo hace, la diferencia de precio con el buque insignia basta para cambiar cómo enrutas todo lo rutinario.

GLM-5.3 Flash
Entrada / Salida$0.15 / $0.5
Contexto1M
CachéLecturas de caché
Ideal paraClasificación y extracción a gran volumen, comprensión de capturas y documentos, análisis de vídeo y archivos, y pasos de agente rutinarios donde el precio por token decide el enrutado.
GLM-5.3
Entrada / Salida$1.4 / $4.4
Contexto1M
CachéLecturas de caché
Ideal paraEl buque insignia 5.3: solo texto, unas nueve veces el precio, y el objetivo de escalado correcto cuando Flash no alcanza el umbral en razonamiento difícil.
DeepSeek V4 Flash
Entrada / Salida$0.442 / $1.324
Contexto1M
CachéLecturas de caché
Ideal paraLa ruta de alto volumen de DeepSeek con 1M de contexto y lectura de caché muy barata. La comparación de coste más directa para trabajo masivo de texto.

Modelos relacionados

GLM-5.3

GLM-5.3

El buque insignia 5.3: solo texto, unas nueve veces el precio, y el objetivo de escalado correcto cuando Flash no alcanza el umbral en razonamiento difícil.

Ver modelo
DeepSeek V4 Flash

DeepSeek V4 Flash

La ruta de alto volumen de DeepSeek con 1M de contexto y lectura de caché muy barata. La comparación de coste más directa para trabajo masivo de texto.

Ver modelo
GLM-5.2

GLM-5.2

El anterior buque insignia de GLM. Sigue siendo relevante para clientes que dependen de desactivar el razonamiento, algo que la generación 5.3 ya no permite.

Ver modelo
Gemini 3.7 Flash

Gemini 3.7 Flash

La ruta multimodal económica de Google: buena referencia entre proveedores cuando la comprensión de imágenes y documentos decide la elección.

Ver modelo

Lecturas relacionadas

GLM-5.3 Flash frente a GLM-5.3

GLM-5.3 Flash frente a GLM-5.3

Elige la ruta por modalidad, dificultad y coste por resultado aceptado, con una política Flash-first y escalado selectivo.

Leer artículo
GLM-5.3 ya está aquí: qué se lanzó

GLM-5.3 ya está aquí: qué se lanzó

Qué confirmó el lanzamiento del 14 de agosto sobre la generación 5.3 — especificaciones, IDs y acceso por fases — y qué quedó abierto.

Leer artículo
GLM-5.3 frente a GLM-5.2

GLM-5.3 frente a GLM-5.2

Mismo modelo base, todas las mejoras del post-entrenamiento, más la ruptura de no poder desactivar el razonamiento en toda la generación.

Leer artículo
GLM-5.3 frente a Claude

GLM-5.3 frente a Claude

Benchmarks, contratos de API y disponibilidad real comparados antes de enrutar agentes a cualquiera de las dos familias.

Leer artículo
Benchmarks de ciberseguridad de GLM-5.3

Benchmarks de ciberseguridad de GLM-5.3

Qué afirman las cifras de CyberGym y ExploitBench según el propio Z.ai y cómo debería leerlas un defensor.

Leer artículo
Un gateway para 3 CLI de programación

Un gateway para 3 CLI de programación

Rutas de configuración, variables de entorno y una lista de diagnóstico para ejecutar varias CLI a través de un solo endpoint.

Leer artículo

Preguntas frecuentes sobre la API de GLM-5.3 Flash

¿Está disponible la API de GLM-5.3 Flash en EvoLink?

Sí. GLM-5.3 Flash está disponible como modelo de producción, servido por Chat Completions y Anthropic Messages.

¿Qué ID de modelo debo usar?

glm-5.3-flash en ambos endpoints. El nombre en EvoLink coincide exactamente con el del proveedor.

¿Qué tipos de entrada acepta Flash?

Texto, imágenes, vídeo y archivos. Es la diferencia principal con GLM-5.3, que es solo texto.

¿Cómo envío una imagen?

Coloca un bloque image_url en messages[].content[] y pasa una URL pública (la forma recomendada oficialmente) o una data URL en Base64. Para varias imágenes, añade un bloque image_url por imagen.

¿Cómo se factura la entrada de imagen y vídeo?

Los medios cuentan en prompt_tokens y se cobran a tarifa de entrada; no hay SKU separada para multimedia. El proveedor no publica una fórmula de conversión a tokens para imágenes, así que ejecuta una muestra representativa y revisa el usage devuelto antes de dimensionar un lote grande.

¿Puedo desactivar el razonamiento?

No. Toda la generación 5.3 razona siempre y rechaza thinking.type: "disabled". Para la ruta más barata y rápida, usa thinking.type: "enabled" con reasoning_effort: "low".

¿Qué es clear_thinking y debo configurarlo?

Controla si el razonamiento previo se descarta entre turnos. Z.ai recomienda clear_thinking: false para Flash. El parámetro se transmite tal cual; EvoLink no lo reescribe.

¿Cuánto más barato es Flash que GLM-5.3?

Alrededor de una novena parte en entrada y salida. Esa diferencia suele justificar ejecutar Flash primero y escalar solo las peticiones que no superen tu verificación de aceptación.

¿Cómo se factura la caché de prompts?

Las lecturas de caché tienen su propia tarifa, alrededor de una quinta parte de la entrada nueva. No hay cargo por escritura porque el proveedor no reporta tokens de creación. Mantén el prefijo estable byte a byte para seguir acertando.

¿Cuál es la ventana de contexto y el límite de salida?

1.000.000 de tokens de contexto y hasta 131.072 tokens de salida, con tarifa única en toda la ventana: no hay escalón por contexto largo.

¿Es Flash una buena opción por defecto para alto volumen?

Sí, su precio está pensado para eso. Clasificación, extracción, pasos de agente rutinarios y comprensión de documentos o capturas encajan de forma natural. Escala a GLM-5.3 solo donde un razonamiento más profundo cambie el resultado de forma medible.

¿Qué debe medir una evaluación en producción?

Éxito a la primera, entregables aceptados, reintentos, proporción de tokens de razonamiento en la salida, tasa de acierto de caché, tokens de multimedia por petición, tiempo hasta el resultado aceptado y la tasa de escalado a GLM-5.3.