
GLM-5.3 vs GLM-5.2 : ce qui a vraiment changé et faut-il migrer ?
glm-5.3. Ce guide couvre l'écart de comportement vérifié et le plan d'évaluation à dérouler avant de promouvoir la nouvelle route.Vérification des faits : ce qui est réellement confirmé
| Dimension | GLM-5.2 | GLM-5.3 | Statut |
|---|---|---|---|
| Modèle de base | — | Identique à GLM-5.2 | Officiel |
| Contexte / sortie max | 1M / 128K | 1M / 128K | Officiel |
| Modalités | Texte uniquement | Texte uniquement (pas de vision) | Officiel |
| ID de modèle | glm-5.2 | glm-5.3 (selon l'exemple officiel) | Officiel |
Thinking désactivable (disabled) | Pris en charge | Supprimé | Officiel — changement cassant |
reasoning_effort | — | low / high / max | Officiel — nouveau contrôle |
| Prix officiel par token | 1,40 $ / 0,26 $ en cache / 4,40 $ par 1M | 1,40 $ / 0,26 $ en cache / 4,40 $ par 1M | Tarifs catalogue identiques |
| Poids ouverts | Publiés (type MIT) | Promis ~28 août, licence non précisée | Échelonné |
| Disponibilité API sur EvoLink | Active | Active sous glm-5.3 | Identifiants routables distincts |
Les gains annoncés — à lire en acheteur, pas en supporter
Tous les chiffres du jour de la sortie sont ceux de Z.ai (selon Z.ai ; aucune réplication indépendante pour l'instant). Le motif est cohérent : c'est le codage agentique de longue haleine qui a reçu le travail de post-entraînement.
| Benchmark | GLM-5.2 | GLM-5.3 | Ce que cela suggère (si cela tient) |
|---|---|---|---|
| Terminal Bench 3.0 | 4,6 | 28,3 | Comportement d'agent terminal/CLI bien meilleur |
| SWE-Marathon v1.1 | 19,4 | 42,5 | Persévérance sur tâches longues à peu près doublée |
| DeepSWE v1.1 | 46,2 | 66,9 | Qualité des correctifs à l'échelle du dépôt |
| FrontierSWE | 67,5 | 78,1 | Toujours derrière Claude Fable 5 (88,2), selon le tableau de Z.ai lui-même |
| ExploitBench | 24,4 | 54,4 | La nouvelle capacité cyber ; les modèles fermés restent devant |
L'unique changement cassant confirmé
thinking.type: "disabled" pour des appels rapides, bon marché et sans raisonnement ; GLM-5.3 non.{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}Si votre intégration utilise des appels sans raisonnement pour des chemins sensibles à la latence (classification, extraction, réécritures courtes), ces chemins ne se portent pas tels quels. Vos options sur une route GLM-5.3 :
- Re-segmenter le trafic — garder un modèle moins cher/plus rapide (GLM-5.2 ou une autre route) pour les appels sans raisonnement, et n'envoyer à GLM-5.3 que le travail agentique.
- Utiliser
reasoning_effort: "low"comme substitut le plus proche, et mesurer si la latence et le surcoût en tokens restent acceptables. - Re-tester le coût par tâche, pas par token — le thinking toujours actif change le volume de tokens de sortie : même un prix par token identique (si c'est ce qui arrive) ne signifierait pas des factures identiques.
C'est aussi pourquoi l'auto-routage silencieux du Coding Plan compte : si vous êtes abonné, vos requêtes GLM-5.2 passent déjà par un modèle qui raisonne à chaque appel. Toute dérive de comportement observée depuis le 14 août a une explication probable.
Ce que GLM-5.2 prouve déjà vs ce que GLM-5.3 doit prouver
L'asymétrie, c'est la décision : la valeur de GLM-5.2 est que chaque inconnue opérationnelle a déjà trouvé sa réponse sur une route active, tandis que GLM-5.3 remet plusieurs de ces réponses à zéro alors même que le modèle de base est identique.
| GLM-5.2 a déjà prouvé sur votre charge de travail | GLM-5.3 doit prouver dans une voie challenger |
|---|---|
| Prix connu et comportement de facturation | Que des tarifs catalogue identiques donnent un coût par tâche acceptable |
| Contrat de requête stable, thinking désactivable inclus | Nouveau contrat : thinking toujours actif, niveaux d'effort |
| Appels d'outils, cache, sortie structurée en production | Les mêmes fonctions, vérifiées route par route |
| Latence et comportement 429 sous charge réelle | La capacité d'un déploiement tout neuf |
| Poids de type MIT pour l'auto-hébergement | Des poids (~28 août) et une licence non précisée |
| Votre réglage accumulé de prompts et d'agents | Que ce réglage survive à un changement de comportement |
En bref : la valeur de GLM-5.2 n'est pas sa ligne de benchmark — c'est la certitude opérationnelle, et basculer revient à en céder une partie jusqu'à ce que GLM-5.3 la regagne sur une route réelle.
Liste de tests des changements de comportement
- Régression du chemin de thinking : exécutez vos anciennes charges sans raisonnement à
reasoning_effort: "low"; comparez latence, tokens de sortie et stabilité des réponses face à GLM-5.2 avec thinking désactivé. - Balayage des niveaux d'effort : exécutez un jeu de tâches agentiques fixe à
low/high/max; consignez la qualité contre le coût en tokens par niveau. Z.ai recommandemaxpour le code — vérifiez qu'il mérite ses tokens sur vos tâches. - Persévérance à long horizon : rejouez vos plus longues sessions d'agents multi-étapes ; comptez les exécutions abandonnées, les appels d'outils invalides et les reprises humaines (c'est là que vivent les gains annoncés).
- Fidélité des appels d'outils : vérifiez schémas, reprises et récupération d'erreurs — le post-entraînement modifie le comportement des outils plus que la plupart des surfaces.
- Coût par tâche acceptée : total des tokens (thinking inclus) divisé par les tâches qui passent la relecture, comparé à votre référence GLM-5.2.
- Audit d'auto-routage (abonnés du Coding Plan) : confirmez quel modèle a réellement servi vos requêtes récentes avant d'attribuer les changements de qualité à vos propres modifications de prompts.
Quand ne pas basculer
Quatre situations plaident encore pour rester sur GLM-5.2 :
- Votre charge dépend du comportement sans thinking et une re-segmentation ne vaut pas les gains sur votre mix de tâches.
- Votre intégration GLM-5.2 est en cours de livraison — une route stable bat une migration dont le comportement n'a pas encore passé vos portes de non-régression.
- Vous auto-hébergez — pas de poids avant ~le 28 août, et la licence (contrairement à celle de GLM-5.2) n'est pas encore connue. N'architecturez pas autour de conditions non publiées.
- Vous avez besoin de vision — aucun des deux modèles ne l'a ; cette mise à niveau n'y change rien.
Un plan d'évaluation en quatre étapes, exécutable dès maintenant
- Figez la référence. Capturez le taux d'acceptation qualité, les percentiles de latence, le coût par tâche acceptée et le taux d'échec d'outils de GLM-5.2 avant de déplacer du trafic.
- Rejouez, n'improvisez pas. Conservez 20 à 50 tâches représentatives, y compris vos échecs récurrents, comme suite fixe. Exécutez la même suite sur
glm-5.3aux niveaux d'effort low/high/max. - Ouvrez une voie challenger. Routez une petite tranche à faible risque vers GLM-5.3 à côté de GLM-5.2, derrière la même clé et le même contrat EvoLink.
- Promouvez avec une porte de retour arrière. Définissez des seuils de promotion chiffrés (par ex. ≥10 % d'amélioration du coût par tâche acceptée, aucune régression de fidélité des outils) et gardez GLM-5.2 comme repli testé jusqu'à ce que GLM-5.3 les tienne pendant deux semaines.
FAQ
Dois-je basculer de GLM-5.2 vers GLM-5.3 maintenant ?
thinking.type: "disabled", exécutez des tâches appariées à chaque niveau d'effort, et ne promouvez que si le coût par tâche acceptée et la fidélité des outils passent vos portes. Les abonnés du Coding Plan ont peut-être déjà été auto-routés.GLM-5.3 est-il un modèle plus grand que GLM-5.2 ?
Non — il utilise le même modèle de base. Z.ai attribue tous les gains au post-entraînement et n'a publié aucun nombre de paramètres distinct.
Quel est le changement cassant entre GLM-5.2 et GLM-5.3 ?
thinking.type: "disabled" fonctionnait sur GLM-5.2 et n'est pas pris en charge sur GLM-5.3 ; reasoning_effort (low/high/max) est le nouveau contrôle.GLM-5.3 coûtera-t-il le même prix que GLM-5.2 ?
Leurs tarifs catalogue officiels sont pour l'instant identiques : 1,40 $ en entrée, 0,26 $ en entrée mise en cache et 4,40 $ en sortie par million de tokens. Les factures peuvent malgré tout différer, car GLM-5.3 raisonne toujours et les tokens de raisonnement comptent comme sortie ; comparez le coût par tâche acceptée.
Les améliorations de benchmark sont-elles réelles ?
Elles sont rapportées par le fournisseur, sans réplication indépendante le jour de la sortie — et le propre tableau de Z.ai le montre encore derrière Claude Fable 5 sur plusieurs lignes, ce qui plaide pour sa franchise. Traitez-les comme une hypothèse que votre suite de régression teste, pas comme un fait acquis.
Puis-je auto-héberger GLM-5.3 comme GLM-5.2 ?
Pas encore. Les poids sont promis environ deux semaines après le lancement (~28 août 2026), et la licence n'a pas été précisée. Les conditions de type MIT de GLM-5.2 ne se transmettent pas automatiquement.
GLM-5.3 ajoute-t-il la vision ?
Non. Les deux modèles sont texte uniquement ; les travaux multimodaux restent dans la ligne GLM-V distincte de Z.ai.
Et GLM 5.5 vs GLM-5.2 ?
Sources
- Z.ai — annonce de GLM-5.3 (modèle de base, changement du thinking,
reasoning_effort, tableau de benchmarks, calendrier des poids) - BigModel — documentation GLM-5.3 (1M/128K et fonctions prises en charge)
- Z.ai — tarifs (tarifs GLM-5.2 et GLM-5.3 en vigueur)
- Z.ai — documentation GLM Coding Plan (auto-routage, multiplicateurs de points)
- EvoLink — suivi de sortie GLM-5.3 (disponibilité canal par canal, journal des mises à jour)


