
GLM-5.3 vs GLM-5.2: qué cambia de verdad y si merece la pena migrar
Verificación de hechos: qué está realmente confirmado
| Dimensión | GLM-5.2 | GLM-5.3 | Estado |
|---|---|---|---|
| Modelo base | — | El mismo que GLM-5.2 | Oficial |
| Contexto / salida máxima | 1M / 128K | 1M / 128K | Oficial |
| Modalidad | Solo texto | Solo texto (sin visión) | Oficial |
| ID de modelo | glm-5.2 | glm-5.3 (del ejemplo oficial) | Oficial |
Thinking desactivado (disabled) | Soportado | Eliminado | Oficial — breaking change |
reasoning_effort | — | low / high / max | Oficial — nuevo control |
| Precio por token | 1,40 $ / 0,26 $ en caché / 4,40 $ por 1M | Sin publicar | Pregunta abierta |
| Pesos abiertos | Publicados (estilo MIT) | Prometidos ~28 de agosto; licencia sin indicar | Por fases |
| Disponibilidad de la API | Activa (Z.ai, BigModel, agregadores, EvoLink) | Por fases; no invocable por token el día del lanzamiento | Por fases |
Las mejoras reclamadas — leídas como comprador, no como fan
Todos los números del día del lanzamiento son de la propia Z.ai (declarados por el proveedor; aún sin réplica independiente). El patrón es consistente: el trabajo de post-entrenamiento se concentró en el código agéntico de largo recorrido.
| Benchmark | GLM-5.2 | GLM-5.3 | Qué sugiere (si se sostiene) |
|---|---|---|---|
| Terminal Bench 3.0 | 4,6 | 28,3 | Comportamiento de agente en terminal/CLI muy superior |
| SWE-Marathon v1.1 | 19,4 | 42,5 | Persistencia en tareas largas aproximadamente duplicada |
| DeepSWE v1.1 | 46,2 | 66,9 | Calidad de correcciones a escala de repositorio |
| FrontierSWE | 67,5 | 78,1 | Sigue por detrás de Claude Fable 5 (88,2), según la propia tabla de Z.ai |
| ExploitBench | 24,4 | 54,4 | La nueva capacidad ciber; los modelos cerrados siguen por delante |
El único breaking change confirmado
thinking.type: "disabled" para llamadas rápidas, baratas y sin razonamiento; GLM-5.3 no.{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}Si tu integración usa llamadas sin thinking para rutas sensibles a la latencia (clasificación, extracción, reescrituras cortas), esas rutas no se portan limpiamente. Tus opciones en una ruta de GLM-5.3:
- Reestratifica el tráfico: mantén un modelo más barato/rápido (GLM-5.2 u otra ruta) para las llamadas sin razonamiento y envía solo el trabajo agéntico a GLM-5.3.
- Usa
reasoning_effort: "low"como el sustituto más cercano y mide si la latencia y el sobrecoste de tokens son aceptables. - Vuelve a medir el coste por tarea, no por token: el thinking siempre activo cambia el volumen de tokens de salida, así que incluso un precio por token idéntico (si es lo que acaba saliendo) no significaría facturas idénticas.
Por eso importa también la redirección silenciosa del Coding Plan: si estás suscrito, tus peticiones a GLM-5.2 ya pasan por un modelo que razona en cada llamada. Cualquier deriva de comportamiento que hayas notado desde el 14 de agosto tiene una explicación probable.
Qué demuestra ya GLM-5.2 y qué debe demostrar GLM-5.3
La asimetría es la decisión: el valor de GLM-5.2 es que cada incógnita operativa ya se respondió en una ruta activa, mientras que GLM-5.3 reinicia varias de esas respuestas aunque el modelo base sea idéntico.
| GLM-5.2 ya lo ha demostrado (en una ruta activa) | GLM-5.3 debe demostrarlo (en una ruta que aún no existe) |
|---|---|
| Precio y comportamiento de facturación conocidos | Que exista algún precio |
| Contrato de peticiones estable, incluido el thinking desactivado | Contrato nuevo: thinking siempre activo, niveles de esfuerzo |
| Llamadas a herramientas, caché y salida estructurada en producción | Las mismas capacidades, con verificación por ruta |
| Latencia y comportamiento de 429 bajo carga real | La capacidad de un despliegue recién estrenado |
| Pesos estilo MIT para autoalojamiento | Pesos (~28 de agosto) y una licencia sin indicar |
| Tu ajuste acumulado de prompts y agentes | Que tu ajuste sobreviva a un cambio de comportamiento |
En resumen: el valor de GLM-5.2 no es su línea de benchmark, sino la certeza operativa, y cambiar renuncia a parte de esa certeza hasta que GLM-5.3 se la vuelva a ganar en una ruta real.
Lista de pruebas del cambio de comportamiento
- Regresión de la ruta con thinking: ejecuta tus antiguas cargas sin razonamiento con
reasoning_effort: "low"; compara latencia, tokens de salida y estabilidad de las respuestas contra GLM-5.2 con el thinking desactivado. - Barrido de niveles de esfuerzo: ejecuta un conjunto fijo de tareas agénticas en
low/high/max; registra calidad frente a coste en tokens por nivel. Z.ai recomiendamaxpara código: verifica que se gana sus tokens en tus tareas. - Persistencia de largo recorrido: repite tus sesiones de agente multipaso más largas; cuenta ejecuciones abandonadas, llamadas a herramientas inválidas e intervenciones humanas (aquí es donde viven las mejoras reclamadas).
- Fidelidad de las llamadas a herramientas: verifica esquemas, reintentos y recuperación de errores; el post-entrenamiento cambia el comportamiento con herramientas más que casi cualquier otra superficie.
- Coste por tarea aceptada: tokens totales (thinking incluido) divididos por las tareas que pasan revisión, comparados con tu línea base de GLM-5.2.
- Auditoría de la redirección automática (usuarios del Coding Plan): confirma qué modelo sirvió realmente tus peticiones recientes antes de atribuir los cambios de calidad a tus propias ediciones de prompts.
Cuándo no deberías cambiar
Cinco situaciones aconsejan quedarse en GLM-5.2 por ahora; la primera aplica hoy a toda integración facturada por token:
- Todavía no puedes facturar por token: no hay ruta pública por token; "cambiar" no es actualmente una elección posible fuera de las suscripciones.
- Tu carga depende del comportamiento sin thinking y una reestratificación no compensa las mejoras en tu mezcla de tareas.
- Tu integración de GLM-5.2 está en mitad de una entrega: una ruta estable y con precio gana siempre a una mejora reclamada con economía sin publicar.
- Te autoalojas: sin pesos hasta ~el 28 de agosto, y la licencia (a diferencia de la de GLM-5.2) aún no se conoce. No diseñes la arquitectura alrededor de términos que no se han publicado.
- Necesitas visión: ninguno de los dos modelos la tiene; esta actualización no cambia eso.
Un plan de evaluación en cuatro pasos (prepáralo ya, ejecútalo el día del precio)
- Congela la línea base. Captura esta semana las métricas de GLM-5.2: tasa de aprobación de calidad, percentiles de latencia, coste por tarea aceptada, tasa de fallos de herramientas. Cuando la ruta se abra, ya no podrás recuperar limpiamente el "antes".
- Reproduce, no improvises. Mantén 20–50 tareas representativas (incluidos tus peores fallos recurrentes) como suite fija. Ejecútalas sobre GLM-5.3 el día en que una ruta sea invocable.
- Monta un carril aspirante. Enruta una porción pequeña y de bajo riesgo del tráfico real hacia GLM-5.3 junto a GLM-5.2, tras el mismo contrato compatible con OpenAI, de modo que cambiar sea un cambio de configuración; ejecuta el carril titular en la ruta activa de GLM-5.2 de EvoLink.
- Promociona con puerta de rollback. Define umbrales numéricos de promoción (por ejemplo, ≥10 % de mejora en coste por tarea aceptada, sin regresión en la fidelidad de herramientas) y mantén GLM-5.2 como fallback probado hasta que GLM-5.3 los sostenga durante dos semanas.
Preguntas frecuentes
¿Debería cambiar de GLM-5.2 a GLM-5.3 ahora?
¿Es GLM-5.3 un modelo más grande que GLM-5.2?
No: usa el mismo modelo base. Z.ai atribuye todas las mejoras al post-entrenamiento y no ha publicado una cifra de parámetros separada.
¿Cuál es el breaking change entre GLM-5.2 y GLM-5.3?
thinking.type: "disabled" funcionaba en GLM-5.2 y no está soportado en GLM-5.3; reasoning_effort (low/high/max) es el nuevo control.¿Costará GLM-5.3 lo mismo que GLM-5.2?
Se desconoce. GLM-5.2 lista 1,40 $/0,26 $/4,40 $ por millón de tokens; GLM-5.3 no tiene precio publicado. La misma base hace plausible un precio similar, pero el thinking siempre activo puede subir igualmente la factura real por el mayor volumen de tokens de salida.
¿Son reales las mejoras de benchmark?
Son declaradas por el proveedor, sin réplica independiente el día del lanzamiento, y la propia tabla de Z.ai lo muestra aún por detrás de Claude Fable 5 en varias líneas, lo que aporta franqueza. Trátalas como una hipótesis que tu suite de regresión pone a prueba, no como un hecho zanjado.
¿Puedo autoalojar GLM-5.3 como GLM-5.2?
Todavía no. Los pesos se prometen unas dos semanas después del lanzamiento (~28 de agosto de 2026) y la licencia no se ha indicado. Los términos estilo MIT de GLM-5.2 no se trasladan automáticamente.
¿Añade visión GLM-5.3?
No. Ambos modelos son de solo texto; el trabajo multimodal sigue en la línea aparte GLM-V de Z.ai.
¿Y qué hay de GLM 5.5 vs GLM-5.2?
Fuentes
- Z.ai — anuncio de GLM-5.3 (modelo base, cambio del thinking,
reasoning_effort, tabla de benchmarks, calendario de pesos) - BigModel — documentación de GLM-5.3 (1M/128K, capacidades soportadas, API "próximamente")
- Z.ai — precios (tarifas de GLM-5.2; sin entrada de GLM-5.3 a 14 de agosto de 2026)
- Z.ai — documentación del GLM Coding Plan (redirección automática, multiplicadores de puntos)
- EvoLink — seguimiento del lanzamiento de GLM-5.3 (disponibilidad canal por canal, registro de cambios)


