Seedance 2.5 ya está disponible en EvoLinkProbar Seedance 2.5
Lente abstracta que revela puntos débiles en una superficie hexagonal, en representación del descubrimiento de vulnerabilidades asistido por IA con fines defensivos
model-analysis

GLM-5.3 y ciberseguridad: qué afirman los benchmarks

Jessie
Jessie
COO
14 de agosto de 2026
Actualizado el 27 de agosto de 2026
13 min de lectura
Las cifras de ciberseguridad son el mayor salto de capacidad de todo el lanzamiento de GLM-5.3, y cada una de ellas es una afirmación del propio Z.ai. Según las cifras del proveedor, GLM-5.3 obtiene 84,5 en CyberGym frente al 77,2 de GLM-5.2 (nota: la documentación china de Z.ai indica 83,5 % en su cuerpo de texto; circulan dos cifras oficiales y reportamos ambas), y 54,4 en ExploitBench frente a 24,4, más del doble que su predecesor. Z.ai también es franco en que esto no lo pone por delante de la frontera: su propia tabla comparativa muestra a Mythos 5 con 78 en ExploitBench, y el anuncio reconoce que los modelos cerrados siguen en cabeza. Desde el día del lanzamiento, el acceso por token se ha abierto: GLM-5.3 figura ahora a 1,40 $ de entrada y 4,40 $ de salida por millón de tokens, y está disponible como glm-5.3 a través de EvoLink. Eso hace posible una evaluación defensiva controlada; no convierte las afirmaciones del proveedor en evidencia independiente. Este artículo desgrana qué dicen realmente las afirmaciones, por qué importa el lanzamiento por fases y cómo debería evaluar el modelo un defensor.
Una nota de alcance antes de nada: este artículo está escrito para trabajo de seguridad defensivo y autorizado: descubrimiento de vulnerabilidades con el fin de corregirlas, pruebas de penetración con autorización explícita, triaje de incidencias y auditoría de código. Así es también como el propio Z.ai posiciona el modelo.

«Built to Code. Ready for Cyber Defense.»: qué está afirmando Z.ai

El eslogan de lanzamiento de Z.ai para GLM-5.3 es "Built to Code. Ready for Cyber Defense.": el encuadre es defensa, no ataque, y el propio título del anuncio califica los resultados cíber de «emergentes»: «GLM-5.3: Frontier Coding with Emergent Cyber Capabilities». Las cifras declaradas, todas de la propia tabla de benchmarks de Z.ai:
BenchmarkGLM-5.3 (declarado por el proveedor)GLM-5.2Salvedad
CyberGym84,577,2La doc china de Z.ai indica 83,5 % en su cuerpo de texto: existen dos cifras oficiales
ExploitBench54,424,4La propia tabla de Z.ai muestra Mythos 5 = 78; Z.ai reconoce que los modelos cerrados van en cabeza
Z.ai también reporta un resultado de escalado temporal en ExploitGym: según su propio relato, GLM-5.3 resolvió 105 retos con un presupuesto de 2 horas y 130 en 6 horas, ofrecido como evidencia de que el rendimiento del modelo en análisis de vulnerabilidades sigue mejorando cuando se le da más tiempo de trabajo. Como la tabla anterior, es una cifra declarada por el proveedor sin réplica de terceros a día del lanzamiento.

Tres cosas que conviene retener al leer estas cifras:

  1. El salto es real respecto a su propia línea base. Pasar de 24,4 a 54,4 en ExploitBench entre dos modelos que comparten la misma red base es la mayor ganancia relativa de todo el anuncio de GLM-5.3.
  2. El propio proveedor no reclama el primer puesto. La tabla de Z.ai sitúa a los modelos cerrados por delante en el benchmark orientado a exploits. Cualquier titular que llame a GLM-5.3 el modelo de seguridad líder está diciendo más de lo que dice Z.ai.
  3. La discrepancia de CyberGym está divulgada, no resuelta. 84,5 (anuncio) frente a 83,5 (cuerpo de texto de la doc china) son ambas cifras oficiales. Hasta que Z.ai las concilie, cite el par.
Para el panorama completo del lanzamiento —canales de acceso, cambios en el contrato de la API y todo lo que queda fuera del ámbito cíber— consulte el seguimiento del lanzamiento de GLM-5.3.

Por qué este lanzamiento no es open source desde el primer día

GLM-5.2 salió con pesos abiertos el día del lanzamiento. GLM-5.3, deliberadamente, no, y Z.ai afirma que las capacidades cíber son la razón. El plan por fases, según el anuncio:

  • Los pesos abiertos se retrasan unas dos semanas (en torno al 28 de agosto de 2026), pendientes de una evaluación de seguridad y una pasada de endurecimiento. La licencia no se ha comunicado: no asuma que se mantienen los términos de GLM-5.2.
  • El acceso API por token también llegó por fases en el lanzamiento. Ya tiene precio y es invocable, mientras que el calendario y la licencia de los pesos abiertos siguen siendo una cuestión aparte.
  • Junto al modelo se lanzó un Security Disclosure Ledger: un registro público, según Z.ai, para las vulnerabilidades que encuentre el modelo, de modo que los hallazgos alimenten la divulgación coordinada en lugar de la explotación silenciosa.
Piense lo que piense de las cifras de benchmark, esta es la señal de mayor calado: un laboratorio cuyo lanzamiento anterior fue directo a Hugging Face decidió poner este tras una revisión de seguridad precisamente por lo que el modelo puntuó en benchmarks de exploits. Para los equipos de seguridad, el registro merece seguimiento con independencia del modelo: si GLM-5.3 está encontrando de verdad vulnerabilidades reales, ahí es donde aparecería primero la evidencia.

Por qué los desarrolladores de seguridad están prestando atención

Aquí hay un trasfondo real de demanda, visible en el hilo de Hacker News del día del lanzamiento. Un tema recurrente en la discusión: la frustración porque los grandes proveedores de modelos de EE. UU. restringen los casos de uso de seguridad. Un comentarista de HN lo expresó sin rodeos: "American vendors won't let the peasantry use their best models for security work." Otro, en el mismo hilo: "It's not like you will be allowed to use Fable...for anything cybersecurity-related."
Dos salvedades sobre cómo leer esto. Primera: son comentarios de la comunidad —sentimiento, no hechos verificados— sobre la política real de ningún proveedor; las experiencias individuales con las políticas de uso varían y su aplicación es más matizada que una cita de foro. Segunda: el sentimiento sigue siendo una señal de mercado: explica por qué un modelo de pesos abiertos que anuncia capacidad cíber despierta interés inmediato entre profesionales de seguridad que se sienten desatendidos. Si los pesos de GLM-5.3 llegan según lo previsto con una licencia utilizable, sería uno de los pocos modelos de la generación actual que un equipo de seguridad defensiva podría ejecutar en un entorno controlado sin una conversación previa sobre políticas de uso con un proveedor de API alojada, siempre supeditado a lo que la licencia de Z.ai establezca realmente, algo hoy desconocido.

Un marco de evaluación para defensores

Ya se puede evaluar GLM-5.3 a través de una API. La distinción importante es entre lo que todavía exige evidencia externa y lo que puedes probar con seguridad sobre tu propia carga de trabajo autorizada.
Qué esperar:
  • Los pesos abiertos y, sobre todo, la licencia (~28 de agosto según el propio calendario de Z.ai). Para los equipos de seguridad, la licencia importa más que de costumbre: determina si siquiera se puede ejecutar el modelo dentro de un laboratorio aislado.
  • Evaluaciones independientes con un arnés equivalente. Las cifras del proveedor son una hipótesis hasta que un tercero reproduzca el arnés, el conjunto de datos y los controles.
Qué probar, solo en entornos autorizados:
  • Precisión del triaje y tasa de falsos positivos. Aliméntelo con su backlog real de informes de seguridad y hallazgos de análisis estático. Un modelo que duplica una puntuación de benchmark pero inunda su cola de falsos positivos es un coste neto.
  • Reproducción de exploits para verificar correcciones. El uso defensivamente legítimo de la capacidad de exploit: confirmar que una vulnerabilidad reportada es real y que un parche de verdad la cierra. Mida si las reproducciones del modelo son fieles, en sistemas que posea o esté autorizado a probar.
  • Calidad de los informes. ¿Puede producir un informe de nivel de divulgación —versiones afectadas, causa raíz, razonamiento de severidad, remediación— o solo un hallazgo? Para la mayoría de los equipos, las horas se van en la redacción.
  • Comportamiento de largo recorrido. La afirmación de Z.ai sobre ExploitGym trata precisamente de que el rendimiento mejora con el presupuesto de tiempo. Verifíquelo en sus propias tareas antes de pagar ejecuciones de agente de 6 horas.
Notas de cumplimiento —señaladas, no resueltas, porque dependen de la jurisdicción y de cada organización:
  • El alcance de la autorización recae en usted, no en el modelo. Las pruebas de penetración y la investigación de vulnerabilidades requieren autorización explícita que cubra los sistemas concretos probados; el posicionamiento de «ciberdefensa» de un modelo no la sustituye.
  • La residencia de datos y las consideraciones transfronterizas requieren su propia evaluación. GLM-5.3 es un modelo de un proveedor con sede en China; si enrutar código sensible o datos de vulnerabilidades por un endpoint dado encaja con su postura de cumplimiento es una cuestión para su propia revisión legal y de seguridad. Los pesos autoalojados, una vez publicados, cambian ese cálculo: otra razón por la que la licencia es el dato a vigilar.

Las ganancias cíber y las de código son la misma historia

Un detalle poco comentado: GLM-5.3 comparte su modelo base con GLM-5.2, y Z.ai declara que «cada ganancia procede del post-entrenamiento». El salto cíber y el salto en código (Terminal Bench 3.0: 4,6 → 28,3, declarado por el proveedor) proceden del mismo empujón de post-entrenamiento sobre la misma red: el encuadre de Z.ai es que el análisis de exploits es, en el fondo, razonamiento adversarial sobre código, de ahí una capacidad cíber «emergente» surgida de un esfuerzo centrado en el código.

La implicación práctica para la evaluación: la capacidad cíber no es aquí una SKU afinada por separado que se pueda adoptar de forma aislada. Lo que recibe —y debe probar— es el modelo post-entrenado completo, incluidos sus cambios de API incompatibles respecto a GLM-5.2 (thinking siempre activo, el nuevo control reasoning_effort). La lectura escéptica, también aireada en el hilo de HN, es que un post-entrenamiento intensivo invita al sobreajuste a los benchmarks; la única cura para ese debate es la evaluación independiente, que aún no existe.

Qué puede hacer hoy mediante la API

El estado actual de la API permite una evaluación real, no solo un plan de espera:

  • Use un conjunto de datos acotado y autorizado. Empiece con hallazgos históricos u objetivos de laboratorio aislados que pertenezcan a su equipo y estén expresamente autorizados para pruebas.
  • Llame al ID de modelo glm-5.3. La página de GLM-5.3 en EvoLink ofrece precios actuales, código, detalles del contexto de un millón de tokens y los dos protocolos de API compatibles.
  • Registre todo el recorrido de decisión. Guarde la versión del prompt, el nivel de razonamiento, los tokens, las llamadas a herramientas, los falsos positivos, el resultado de la revisión y la utilidad de la corrección.
  • Mantenga una aprobación humana. No permita que las acciones de seguridad generadas salgan del límite autorizado; use los resultados bajo revisión para triaje, reproducción y verificación de correcciones.

FAQ

¿Qué afirman realmente los benchmarks de ciberseguridad de GLM-5.3?

Según las propias cifras de Z.ai: CyberGym 84,5 (con 83,5 % apareciendo en el cuerpo de texto de la doc china; ambas cifras son oficiales), frente a 77,2 de GLM-5.2; y ExploitBench 54,4 frente a 24,4. Z.ai también reporta que GLM-5.3 resolvió 105 retos de ExploitGym en 2 horas y 130 en 6 horas. Todas las cifras son declaradas por el proveedor, sin réplica independiente a día del lanzamiento.

¿Es GLM-5.3 el mejor modelo para investigación de seguridad?

Hoy no puede extraerse esa conclusión. Aún no hay evaluaciones de seguridad independientes de GLM-5.3, y la propia tabla de Z.ai muestra a los modelos cerrados por delante en ExploitBench (Mythos 5 = 78). Lo que sí puede decirse: según las cifras del proveedor es un gran salto sobre GLM-5.2, y sus pesos abiertos previstos lo convierten en candidato para equipos que necesiten evaluación autoalojada, a expensas de la licencia.

¿Se puede usar GLM-5.3 para hackear?

Z.ai posiciona GLM-5.3 para la ciberdefensa, y estructuró el lanzamiento en consecuencia: el acceso llegó por fases, y junto al modelo se lanzó un Security Disclosure Ledger público para canalizar los hallazgos hacia la divulgación coordinada. Nada de eso cambia las obligaciones del usuario: la investigación de vulnerabilidades y las pruebas de penetración exigen autorización explícita sobre los sistemas implicados. Este artículo aborda únicamente el uso autorizado y defensivo.

¿Por qué se retrasan los pesos de GLM-5.3?

Z.ai dice que los pesos saldrán unas dos semanas después del lanzamiento (en torno al 28 de agosto de 2026), tras una evaluación de seguridad y una pasada de endurecimiento: un cambio deliberado respecto al open source del día del lanzamiento de GLM-5.2, motivado por las capacidades cíber del modelo. La licencia no se ha anunciado.

¿Puedo usar GLM-5.3 para trabajo de seguridad a través de una API hoy?

Sí, para evaluación defensiva autorizada. Usa el ID de modelo glm-5.3; las tarifas oficiales son 1,40 $ de entrada, 0,26 $ de entrada en caché y 4,40 $ de salida por millón de tokens. La página de modelo de EvoLink tiene el precio de ruta vigente y el código.

¿Qué es el Security Disclosure Ledger?

Un registro público que Z.ai lanzó junto a GLM-5.3 para las vulnerabilidades que descubra el modelo, según el anuncio, con la intención de que los fallos hallados por el modelo fluyan hacia la divulgación coordinada en lugar de quedar en privado. Para los defensores funciona además como flujo de evidencia: entradas reales serían una prueba de capacidad más sólida que cualquier puntuación de benchmark.

¿Por qué veo tanto 84,5 como 83,5 para la puntuación de CyberGym de GLM-5.3?

Ambas proceden de Z.ai: 84,5 aparece en la tabla de benchmarks del anuncio, mientras que la documentación china indica 83,5 % en su cuerpo de texto. La discrepancia sigue sin explicación a fecha de publicación. Citamos ambas y actualizaremos si Z.ai las concilia.

¿La capacidad cíber va en detrimento de la capacidad de código?

No según el relato del proveedor; al contrario. GLM-5.3 comparte la base de GLM-5.2, todas las ganancias vienen del post-entrenamiento, y Z.ai presenta los resultados cíber como emergentes del esfuerzo centrado en el código. Las cifras de código y cíber subieron juntas en su tabla. Si ambas aguantan fuera de los benchmarks es algo que espera pruebas independientes; la comparativa GLM-5.3 vs GLM-5.2 cubre en detalle la vertiente de código.
Sí. EvoLink ofrece GLM-5.3 con el ID de modelo glm-5.3 mediante su API unificada. Consulte la página del modelo GLM-5.3 para ver los precios actuales, los protocolos y las comprobaciones de migración; la disponibilidad de la ruta no sustituye sus propios controles de autorización y aceptación.

Sources


Divulgación: la imagen de portada se generó con Nano Banana Pro y es ilustrativa, no una salida del modelo GLM-5.3. Todas las cifras de benchmark de este artículo son declaradas por Z.ai; las citas de la comunidad reflejan el sentimiento en Hacker News, no afirmaciones de hecho verificadas. Hechos revisados por última vez el 26 de agosto de 2026. Este artículo aborda únicamente el uso de seguridad autorizado y defensivo y no contiene instrucciones de explotación.

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.