
GLM-5.3 vs GLM-5.2: qué cambia de verdad y si merece la pena migrar
glm-5.3. Esta guía cubre el delta de comportamiento verificado y el plan de evaluación que ejecutar antes de promover la nueva ruta.Verificación de hechos: qué está realmente confirmado
| Dimensión | GLM-5.2 | GLM-5.3 | Estado |
|---|---|---|---|
| Modelo base | — | El mismo que GLM-5.2 | Oficial |
| Contexto / salida máxima | 1M / 128K | 1M / 128K | Oficial |
| Modalidad | Solo texto | Solo texto (sin visión) | Oficial |
| ID de modelo | glm-5.2 | glm-5.3 (del ejemplo oficial) | Oficial |
Thinking desactivado (disabled) | Soportado | Eliminado | Oficial — breaking change |
reasoning_effort | — | low / high / max | Oficial — nuevo control |
| Precio oficial por token | 1,40 $ / 0,26 $ en caché / 4,40 $ por 1M | 1,40 $ / 0,26 $ en caché / 4,40 $ por 1M | Mismas tarifas de catálogo |
| Pesos abiertos | Publicados (estilo MIT) | Prometidos ~28 de agosto; licencia sin indicar | Por fases |
| Disponibilidad de la API en EvoLink | Activa | Activa como glm-5.3 | IDs enrutables independientes |
Las mejoras reclamadas — leídas como comprador, no como fan
Todos los números del día del lanzamiento son de la propia Z.ai (declarados por el proveedor; aún sin réplica independiente). El patrón es consistente: el trabajo de post-entrenamiento se concentró en el código agéntico de largo recorrido.
| Benchmark | GLM-5.2 | GLM-5.3 | Qué sugiere (si se sostiene) |
|---|---|---|---|
| Terminal Bench 3.0 | 4,6 | 28,3 | Comportamiento de agente en terminal/CLI muy superior |
| SWE-Marathon v1.1 | 19,4 | 42,5 | Persistencia en tareas largas aproximadamente duplicada |
| DeepSWE v1.1 | 46,2 | 66,9 | Calidad de correcciones a escala de repositorio |
| FrontierSWE | 67,5 | 78,1 | Sigue por detrás de Claude Fable 5 (88,2), según la propia tabla de Z.ai |
| ExploitBench | 24,4 | 54,4 | La nueva capacidad ciber; los modelos cerrados siguen por delante |
El único breaking change confirmado
thinking.type: "disabled" para llamadas rápidas, baratas y sin razonamiento; GLM-5.3 no.{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}Si tu integración usa llamadas sin thinking para rutas sensibles a la latencia (clasificación, extracción, reescrituras cortas), esas rutas no se portan limpiamente. Tus opciones en una ruta de GLM-5.3:
- Reestratifica el tráfico: mantén un modelo más barato/rápido (GLM-5.2 u otra ruta) para las llamadas sin razonamiento y envía solo el trabajo agéntico a GLM-5.3.
- Usa
reasoning_effort: "low"como el sustituto más cercano y mide si la latencia y el sobrecoste de tokens son aceptables. - Vuelve a medir el coste por tarea, no por token: el thinking siempre activo cambia el volumen de tokens de salida, así que incluso un precio por token idéntico (si es lo que acaba saliendo) no significaría facturas idénticas.
Por eso importa también la redirección silenciosa del Coding Plan: si estás suscrito, tus peticiones a GLM-5.2 ya pasan por un modelo que razona en cada llamada. Cualquier deriva de comportamiento que hayas notado desde el 14 de agosto tiene una explicación probable.
Qué demuestra ya GLM-5.2 y qué debe demostrar GLM-5.3
La asimetría es la decisión: el valor de GLM-5.2 es que cada incógnita operativa ya se respondió en una ruta activa, mientras que GLM-5.3 reinicia varias de esas respuestas aunque el modelo base sea idéntico.
| GLM-5.2 ya lo ha demostrado en tu carga de trabajo | GLM-5.3 debe demostrarlo en un carril aspirante |
|---|---|
| Precio y comportamiento de facturación conocidos | Que unas tarifas de catálogo iguales den un coste por tarea aceptable |
| Contrato de peticiones estable, incluido el thinking desactivado | Contrato nuevo: thinking siempre activo, niveles de esfuerzo |
| Llamadas a herramientas, caché y salida estructurada en producción | Las mismas capacidades, con verificación por ruta |
| Latencia y comportamiento de 429 bajo carga real | La capacidad de un despliegue recién estrenado |
| Pesos estilo MIT para autoalojamiento | Pesos (~28 de agosto) y una licencia sin indicar |
| Tu ajuste acumulado de prompts y agentes | Que tu ajuste sobreviva a un cambio de comportamiento |
En resumen: el valor de GLM-5.2 no es su línea de benchmark, sino la certeza operativa, y cambiar renuncia a parte de esa certeza hasta que GLM-5.3 se la vuelva a ganar en una ruta real.
Lista de pruebas del cambio de comportamiento
- Regresión de la ruta con thinking: ejecuta tus antiguas cargas sin razonamiento con
reasoning_effort: "low"; compara latencia, tokens de salida y estabilidad de las respuestas contra GLM-5.2 con el thinking desactivado. - Barrido de niveles de esfuerzo: ejecuta un conjunto fijo de tareas agénticas en
low/high/max; registra calidad frente a coste en tokens por nivel. Z.ai recomiendamaxpara código: verifica que se gana sus tokens en tus tareas. - Persistencia de largo recorrido: repite tus sesiones de agente multipaso más largas; cuenta ejecuciones abandonadas, llamadas a herramientas inválidas e intervenciones humanas (aquí es donde viven las mejoras reclamadas).
- Fidelidad de las llamadas a herramientas: verifica esquemas, reintentos y recuperación de errores; el post-entrenamiento cambia el comportamiento con herramientas más que casi cualquier otra superficie.
- Coste por tarea aceptada: tokens totales (thinking incluido) divididos por las tareas que pasan revisión, comparados con tu línea base de GLM-5.2.
- Auditoría de la redirección automática (usuarios del Coding Plan): confirma qué modelo sirvió realmente tus peticiones recientes antes de atribuir los cambios de calidad a tus propias ediciones de prompts.
Cuándo no deberías cambiar
Cuatro situaciones siguen aconsejando quedarse en GLM-5.2:
- Tu carga depende del comportamiento sin thinking y una reestratificación no compensa las mejoras en tu mezcla de tareas.
- Tu integración de GLM-5.2 está en mitad de una entrega: una ruta estable gana a una migración cuyo comportamiento aún no ha pasado tus puertas de regresión.
- Te autoalojas: sin pesos hasta ~el 28 de agosto, y la licencia (a diferencia de la de GLM-5.2) aún no se conoce. No diseñes la arquitectura alrededor de términos que no se han publicado.
- Necesitas visión: ninguno de los dos modelos la tiene; esta actualización no cambia eso.
Un plan de evaluación en cuatro pasos que puedes ejecutar ya
- Congela la línea base. Captura la tasa de aprobación de calidad, los percentiles de latencia, el coste por tarea aceptada y la tasa de fallos de herramientas de GLM-5.2 antes de mover tráfico.
- Reproduce, no improvises. Mantén 20–50 tareas representativas, incluidos tus fallos recurrentes, como suite fija. Ejecuta la misma suite sobre
glm-5.3con esfuerzo low/high/max. - Monta un carril aspirante. Enruta una porción pequeña y de bajo riesgo hacia GLM-5.3 junto a GLM-5.2, tras la misma clave y el mismo contrato de EvoLink.
- Promociona con puerta de rollback. Define umbrales numéricos de promoción (por ejemplo, ≥10 % de mejora en coste por tarea aceptada, sin regresión en la fidelidad de herramientas) y mantén GLM-5.2 como fallback probado hasta que GLM-5.3 los sostenga durante dos semanas.
Preguntas frecuentes
¿Debería cambiar de GLM-5.2 a GLM-5.3 ahora?
thinking.type: "disabled", ejecuta tareas emparejadas en cada nivel de esfuerzo y promociona solo si el coste por tarea aceptada y la fidelidad de herramientas pasan tus puertas. A los usuarios del Coding Plan puede que ya los hayan redirigido automáticamente.¿Es GLM-5.3 un modelo más grande que GLM-5.2?
No: usa el mismo modelo base. Z.ai atribuye todas las mejoras al post-entrenamiento y no ha publicado una cifra de parámetros separada.
¿Cuál es el breaking change entre GLM-5.2 y GLM-5.3?
thinking.type: "disabled" funcionaba en GLM-5.2 y no está soportado en GLM-5.3; reasoning_effort (low/high/max) es el nuevo control.¿Costará GLM-5.3 lo mismo que GLM-5.2?
Sus tarifas oficiales de catálogo son ahora mismo iguales: 1,40 $ de entrada, 0,26 $ de entrada en caché y 4,40 $ de salida por millón de tokens. Las facturas pueden diferir igualmente, porque GLM-5.3 siempre razona y los tokens de razonamiento cuentan como salida; compara coste por tarea aceptada.
¿Son reales las mejoras de benchmark?
Son declaradas por el proveedor, sin réplica independiente el día del lanzamiento, y la propia tabla de Z.ai lo muestra aún por detrás de Claude Fable 5 en varias líneas, lo que aporta franqueza. Trátalas como una hipótesis que tu suite de regresión pone a prueba, no como un hecho zanjado.
¿Puedo autoalojar GLM-5.3 como GLM-5.2?
Todavía no. Los pesos se prometen unas dos semanas después del lanzamiento (~28 de agosto de 2026) y la licencia no se ha indicado. Los términos estilo MIT de GLM-5.2 no se trasladan automáticamente.
¿Añade visión GLM-5.3?
No. Ambos modelos son de solo texto; el trabajo multimodal sigue en la línea aparte GLM-V de Z.ai.
¿Y qué hay de GLM 5.5 vs GLM-5.2?
Fuentes
- Z.ai — anuncio de GLM-5.3 (modelo base, cambio del thinking,
reasoning_effort, tabla de benchmarks, calendario de pesos) - BigModel — documentación de GLM-5.3 (1M/128K y capacidades soportadas)
- Z.ai — precios (tarifas vigentes de GLM-5.2 y GLM-5.3)
- Z.ai — documentación del GLM Coding Plan (redirección automática, multiplicadores de puntos)
- EvoLink — seguimiento del lanzamiento de GLM-5.3 (disponibilidad canal por canal, registro de cambios)


