
GLM-5.3 vs GLM-5.2 : ce qui a vraiment changé et faut-il migrer ?
Vérification des faits : ce qui est réellement confirmé
| Dimension | GLM-5.2 | GLM-5.3 | Statut |
|---|---|---|---|
| Modèle de base | — | Identique à GLM-5.2 | Officiel |
| Contexte / sortie max | 1M / 128K | 1M / 128K | Officiel |
| Modalités | Texte uniquement | Texte uniquement (pas de vision) | Officiel |
| ID de modèle | glm-5.2 | glm-5.3 (selon l'exemple officiel) | Officiel |
Thinking désactivable (disabled) | Pris en charge | Supprimé | Officiel — changement cassant |
reasoning_effort | — | low / high / max | Officiel — nouveau contrôle |
| Prix par token | 1,40 $ / 0,26 $ en cache / 4,40 $ par 1M | Non publié | Question ouverte |
| Poids ouverts | Publiés (type MIT) | Promis ~28 août, licence non précisée | Échelonné |
| Disponibilité API | Active (Z.ai, BigModel, agrégateurs, EvoLink) | Échelonnée ; non appelable au token le jour de la sortie | Échelonné |
Les gains annoncés — à lire en acheteur, pas en supporter
Tous les chiffres du jour de la sortie sont ceux de Z.ai (selon Z.ai ; aucune réplication indépendante pour l'instant). Le motif est cohérent : c'est le codage agentique de longue haleine qui a reçu le travail de post-entraînement.
| Benchmark | GLM-5.2 | GLM-5.3 | Ce que cela suggère (si cela tient) |
|---|---|---|---|
| Terminal Bench 3.0 | 4,6 | 28,3 | Comportement d'agent terminal/CLI bien meilleur |
| SWE-Marathon v1.1 | 19,4 | 42,5 | Persévérance sur tâches longues à peu près doublée |
| DeepSWE v1.1 | 46,2 | 66,9 | Qualité des correctifs à l'échelle du dépôt |
| FrontierSWE | 67,5 | 78,1 | Toujours derrière Claude Fable 5 (88,2), selon le tableau de Z.ai lui-même |
| ExploitBench | 24,4 | 54,4 | La nouvelle capacité cyber ; les modèles fermés restent devant |
L'unique changement cassant confirmé
thinking.type: "disabled" pour des appels rapides, bon marché et sans raisonnement ; GLM-5.3 non.{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}Si votre intégration utilise des appels sans raisonnement pour des chemins sensibles à la latence (classification, extraction, réécritures courtes), ces chemins ne se portent pas tels quels. Vos options sur une route GLM-5.3 :
- Re-segmenter le trafic — garder un modèle moins cher/plus rapide (GLM-5.2 ou une autre route) pour les appels sans raisonnement, et n'envoyer à GLM-5.3 que le travail agentique.
- Utiliser
reasoning_effort: "low"comme substitut le plus proche, et mesurer si la latence et le surcoût en tokens restent acceptables. - Re-tester le coût par tâche, pas par token — le thinking toujours actif change le volume de tokens de sortie : même un prix par token identique (si c'est ce qui arrive) ne signifierait pas des factures identiques.
C'est aussi pourquoi l'auto-routage silencieux du Coding Plan compte : si vous êtes abonné, vos requêtes GLM-5.2 passent déjà par un modèle qui raisonne à chaque appel. Toute dérive de comportement observée depuis le 14 août a une explication probable.
Ce que GLM-5.2 prouve déjà vs ce que GLM-5.3 doit prouver
L'asymétrie, c'est la décision : la valeur de GLM-5.2 est que chaque inconnue opérationnelle a déjà trouvé sa réponse sur une route active, tandis que GLM-5.3 remet plusieurs de ces réponses à zéro alors même que le modèle de base est identique.
| GLM-5.2 a déjà prouvé (sur une route active) | GLM-5.3 doit prouver (sur une route qui n'existe pas encore) |
|---|---|
| Prix connu et comportement de facturation | Un prix, tout court |
| Contrat de requête stable, thinking désactivable inclus | Nouveau contrat : thinking toujours actif, niveaux d'effort |
| Appels d'outils, cache, sortie structurée en production | Les mêmes fonctions, vérifiées route par route |
| Latence et comportement 429 sous charge réelle | La capacité d'un déploiement tout neuf |
| Poids de type MIT pour l'auto-hébergement | Des poids (~28 août) et une licence non précisée |
| Votre réglage accumulé de prompts et d'agents | Que ce réglage survive à un changement de comportement |
En bref : la valeur de GLM-5.2 n'est pas sa ligne de benchmark — c'est la certitude opérationnelle, et basculer revient à en céder une partie jusqu'à ce que GLM-5.3 la regagne sur une route réelle.
Liste de tests des changements de comportement
- Régression du chemin de thinking : exécutez vos anciennes charges sans raisonnement à
reasoning_effort: "low"; comparez latence, tokens de sortie et stabilité des réponses face à GLM-5.2 avec thinking désactivé. - Balayage des niveaux d'effort : exécutez un jeu de tâches agentiques fixe à
low/high/max; consignez la qualité contre le coût en tokens par niveau. Z.ai recommandemaxpour le code — vérifiez qu'il mérite ses tokens sur vos tâches. - Persévérance à long horizon : rejouez vos plus longues sessions d'agents multi-étapes ; comptez les exécutions abandonnées, les appels d'outils invalides et les reprises humaines (c'est là que vivent les gains annoncés).
- Fidélité des appels d'outils : vérifiez schémas, reprises et récupération d'erreurs — le post-entraînement modifie le comportement des outils plus que la plupart des surfaces.
- Coût par tâche acceptée : total des tokens (thinking inclus) divisé par les tâches qui passent la relecture, comparé à votre référence GLM-5.2.
- Audit d'auto-routage (abonnés du Coding Plan) : confirmez quel modèle a réellement servi vos requêtes récentes avant d'attribuer les changements de qualité à vos propres modifications de prompts.
Quand ne pas basculer
Cinq situations plaident pour rester sur GLM-5.2 pour l'instant — la première s'applique aujourd'hui à toute intégration facturée au token :
- Vous ne pouvez pas encore facturer au token — il n'existe aucune route publique par token ; « basculer » n'est pas actuellement un choix possible hors abonnement.
- Votre charge dépend du comportement sans thinking et une re-segmentation ne vaut pas les gains sur votre mix de tâches.
- Votre intégration GLM-5.2 est en cours de livraison — une route stable et tarifée bat à chaque fois une amélioration revendiquée à l'économie non publiée.
- Vous auto-hébergez — pas de poids avant ~le 28 août, et la licence (contrairement à celle de GLM-5.2) n'est pas encore connue. N'architecturez pas autour de conditions non publiées.
- Vous avez besoin de vision — aucun des deux modèles ne l'a ; cette mise à niveau n'y change rien.
Un plan d'évaluation en quatre étapes (préparez-le maintenant, lancez-le le jour du prix)
- Figez la référence. Capturez cette semaine les métriques GLM-5.2 : taux d'acceptation qualité, percentiles de latence, coût par tâche acceptée, taux d'échec d'outils. Une fois la route ouverte, vous ne pourrez plus reconstituer proprement l'« avant ».
- Rejouez, n'improvisez pas. Conservez 20 à 50 tâches représentatives (y compris vos pires échecs récurrents) comme suite fixe. Exécutez-les sur GLM-5.3 le jour où une route est appelable.
- Ouvrez une voie challenger. Routez une petite tranche de trafic réel à faible risque vers GLM-5.3 à côté de GLM-5.2, derrière le même contrat compatible OpenAI, pour que la bascule soit un changement de configuration — en faisant tourner la voie titulaire sur la route GLM-5.2 active d'EvoLink.
- Promouvez avec une porte de retour arrière. Définissez des seuils de promotion chiffrés (par ex. ≥10 % d'amélioration du coût par tâche acceptée, aucune régression de fidélité des outils) et gardez GLM-5.2 comme repli testé jusqu'à ce que GLM-5.3 les tienne pendant deux semaines.
FAQ
Dois-je basculer de GLM-5.2 vers GLM-5.3 maintenant ?
GLM-5.3 est-il un modèle plus grand que GLM-5.2 ?
Non — il utilise le même modèle de base. Z.ai attribue tous les gains au post-entraînement et n'a publié aucun nombre de paramètres distinct.
Quel est le changement cassant entre GLM-5.2 et GLM-5.3 ?
thinking.type: "disabled" fonctionnait sur GLM-5.2 et n'est pas pris en charge sur GLM-5.3 ; reasoning_effort (low/high/max) est le nouveau contrôle.GLM-5.3 coûtera-t-il le même prix que GLM-5.2 ?
Inconnu. GLM-5.2 affiche 1,40 $/0,26 $/4,40 $ par million de tokens ; GLM-5.3 n'a aucun prix publié. La base commune rend un prix similaire plausible, mais le thinking toujours actif peut quand même alourdir les factures réelles via un volume de tokens de sortie plus élevé.
Les améliorations de benchmark sont-elles réelles ?
Elles sont rapportées par le fournisseur, sans réplication indépendante le jour de la sortie — et le propre tableau de Z.ai le montre encore derrière Claude Fable 5 sur plusieurs lignes, ce qui plaide pour sa franchise. Traitez-les comme une hypothèse que votre suite de régression teste, pas comme un fait acquis.
Puis-je auto-héberger GLM-5.3 comme GLM-5.2 ?
Pas encore. Les poids sont promis environ deux semaines après le lancement (~28 août 2026), et la licence n'a pas été précisée. Les conditions de type MIT de GLM-5.2 ne se transmettent pas automatiquement.
GLM-5.3 ajoute-t-il la vision ?
Non. Les deux modèles sont texte uniquement ; les travaux multimodaux restent dans la ligne GLM-V distincte de Z.ai.
Et GLM 5.5 vs GLM-5.2 ?
Sources
- Z.ai — annonce de GLM-5.3 (modèle de base, changement du thinking,
reasoning_effort, tableau de benchmarks, calendrier des poids) - BigModel — documentation GLM-5.3 (1M/128K, fonctions prises en charge, API « coming soon »)
- Z.ai — tarifs (tarifs GLM-5.2 ; aucune entrée GLM-5.3 au 14 août 2026)
- Z.ai — documentation GLM Coding Plan (auto-routage, multiplicateurs de points)
- EvoLink — suivi de sortie GLM-5.3 (disponibilité canal par canal, journal des mises à jour)


