Seedance 2.5 est disponible sur EvoLinkEssayer Seedance 2.5
GLM-5.3 et GLM-5.2 comparés comme deux étapes du même modèle de base
model-comparison

GLM-5.3 vs GLM-5.2 : ce qui a vraiment changé et faut-il migrer ?

Jacey
Jacey
Founder
14 août 2026
Mis à jour le 27 août 2026
11 min de lecture
La réponse courte, au 26 août 2026 : les utilisateurs de l'API peuvent désormais basculer, mais ne doivent pas remplacer GLM-5.2 à l'aveugle. GLM-5.3 conserve le même contexte de 1M et les mêmes tarifs officiels au token, tout en modifiant le comportement de raisonnement d'une manière qui peut casser des requêtes et déplacer le coût par tâche.
GLM-5.3 est sorti abonnement d'abord, et les requêtes GLM-5.2/5.1 du Coding Plan ont été auto-routées. Le tableau par token a changé depuis : Z.ai publie désormais 1,40 $ en entrée, 0,26 $ en entrée mise en cache et 4,40 $ en sortie par million de tokens, et EvoLink expose l'identifiant de modèle glm-5.3. Ce guide couvre l'écart de comportement vérifié et le plan d'évaluation à dérouler avant de promouvoir la nouvelle route.

Vérification des faits : ce qui est réellement confirmé

Les deux modèles proviennent du même réseau de base. Z.ai affirme que chaque gain de GLM-5.3 vient du post-entraînement — pas de nouveau pré-entraînement, pas de nouveau nombre de paramètres. Cela rend la décision de mise à niveau inhabituelle : architecture, fenêtre de contexte et modalités sont inchangées ; c'est le comportement qui a changé.
DimensionGLM-5.2GLM-5.3Statut
Modèle de baseIdentique à GLM-5.2Officiel
Contexte / sortie max1M / 128K1M / 128KOfficiel
ModalitésTexte uniquementTexte uniquement (pas de vision)Officiel
ID de modèleglm-5.2glm-5.3 (selon l'exemple officiel)Officiel
Thinking désactivable (disabled)Pris en chargeSuppriméOfficiel — changement cassant
reasoning_effortlow / high / maxOfficiel — nouveau contrôle
Prix officiel par token1,40 $ / 0,26 $ en cache / 4,40 $ par 1M1,40 $ / 0,26 $ en cache / 4,40 $ par 1MTarifs catalogue identiques
Poids ouvertsPubliés (type MIT)Promis ~28 août, licence non préciséeÉchelonné
Disponibilité API sur EvoLinkActiveActive sous glm-5.3Identifiants routables distincts
Le contexte complet de la sortie — canaux, calendriers et ce que « échelonné » signifie en pratique — vit dans le suivi de sortie GLM-5.3. Cette page ne porte qu'une seule question : faut-il basculer, et quand.

Les gains annoncés — à lire en acheteur, pas en supporter

Tous les chiffres du jour de la sortie sont ceux de Z.ai (selon Z.ai ; aucune réplication indépendante pour l'instant). Le motif est cohérent : c'est le codage agentique de longue haleine qui a reçu le travail de post-entraînement.

BenchmarkGLM-5.2GLM-5.3Ce que cela suggère (si cela tient)
Terminal Bench 3.04,628,3Comportement d'agent terminal/CLI bien meilleur
SWE-Marathon v1.119,442,5Persévérance sur tâches longues à peu près doublée
DeepSWE v1.146,266,9Qualité des correctifs à l'échelle du dépôt
FrontierSWE67,578,1Toujours derrière Claude Fable 5 (88,2), selon le tableau de Z.ai lui-même
ExploitBench24,454,4La nouvelle capacité cyber ; les modèles fermés restent devant
Deux réserves honnêtes doivent accompagner ce tableau. D'abord, l'« amélioration de 50 % » mise en avant par Z.ai provient de son Code Bench interne et privé — invérifiable par construction. Ensuite, la question posée par les développeurs dès le premier jour (« la magie du post-entraînement n'est-elle pas juste du surapprentissage des benchmarks ? ») est exactement la bonne : quand un modèle progresse autant sur la même base, gains en forme de benchmark et gains en forme de charge réelle peuvent diverger. Votre propre suite de régression est le seul benchmark qui tranche.

L'unique changement cassant confirmé

GLM-5.3 supprime la possibilité de désactiver le thinking. GLM-5.2 acceptait thinking.type: "disabled" pour des appels rapides, bon marché et sans raisonnement ; GLM-5.3 non.
{
  "model": "glm-5.3",
  "thinking": { "type": "enabled" },
  "reasoning_effort": "max"
}

Si votre intégration utilise des appels sans raisonnement pour des chemins sensibles à la latence (classification, extraction, réécritures courtes), ces chemins ne se portent pas tels quels. Vos options sur une route GLM-5.3 :

  1. Re-segmenter le trafic — garder un modèle moins cher/plus rapide (GLM-5.2 ou une autre route) pour les appels sans raisonnement, et n'envoyer à GLM-5.3 que le travail agentique.
  2. Utiliser reasoning_effort: "low" comme substitut le plus proche, et mesurer si la latence et le surcoût en tokens restent acceptables.
  3. Re-tester le coût par tâche, pas par token — le thinking toujours actif change le volume de tokens de sortie : même un prix par token identique (si c'est ce qui arrive) ne signifierait pas des factures identiques.

C'est aussi pourquoi l'auto-routage silencieux du Coding Plan compte : si vous êtes abonné, vos requêtes GLM-5.2 passent déjà par un modèle qui raisonne à chaque appel. Toute dérive de comportement observée depuis le 14 août a une explication probable.

Ce que GLM-5.2 prouve déjà vs ce que GLM-5.3 doit prouver

L'asymétrie, c'est la décision : la valeur de GLM-5.2 est que chaque inconnue opérationnelle a déjà trouvé sa réponse sur une route active, tandis que GLM-5.3 remet plusieurs de ces réponses à zéro alors même que le modèle de base est identique.

GLM-5.2 a déjà prouvé sur votre charge de travailGLM-5.3 doit prouver dans une voie challenger
Prix connu et comportement de facturationQue des tarifs catalogue identiques donnent un coût par tâche acceptable
Contrat de requête stable, thinking désactivable inclusNouveau contrat : thinking toujours actif, niveaux d'effort
Appels d'outils, cache, sortie structurée en productionLes mêmes fonctions, vérifiées route par route
Latence et comportement 429 sous charge réelleLa capacité d'un déploiement tout neuf
Poids de type MIT pour l'auto-hébergementDes poids (~28 août) et une licence non précisée
Votre réglage accumulé de prompts et d'agentsQue ce réglage survive à un changement de comportement

En bref : la valeur de GLM-5.2 n'est pas sa ligne de benchmark — c'est la certitude opérationnelle, et basculer revient à en céder une partie jusqu'à ce que GLM-5.3 la regagne sur une route réelle.

Liste de tests des changements de comportement

Testez les changements, pas tout le modèle. La base commune permet de cibler le delta :
  • Régression du chemin de thinking : exécutez vos anciennes charges sans raisonnement à reasoning_effort: "low" ; comparez latence, tokens de sortie et stabilité des réponses face à GLM-5.2 avec thinking désactivé.
  • Balayage des niveaux d'effort : exécutez un jeu de tâches agentiques fixe à low / high / max ; consignez la qualité contre le coût en tokens par niveau. Z.ai recommande max pour le code — vérifiez qu'il mérite ses tokens sur vos tâches.
  • Persévérance à long horizon : rejouez vos plus longues sessions d'agents multi-étapes ; comptez les exécutions abandonnées, les appels d'outils invalides et les reprises humaines (c'est là que vivent les gains annoncés).
  • Fidélité des appels d'outils : vérifiez schémas, reprises et récupération d'erreurs — le post-entraînement modifie le comportement des outils plus que la plupart des surfaces.
  • Coût par tâche acceptée : total des tokens (thinking inclus) divisé par les tâches qui passent la relecture, comparé à votre référence GLM-5.2.
  • Audit d'auto-routage (abonnés du Coding Plan) : confirmez quel modèle a réellement servi vos requêtes récentes avant d'attribuer les changements de qualité à vos propres modifications de prompts.

Quand ne pas basculer

Quatre situations plaident encore pour rester sur GLM-5.2 :

  • Votre charge dépend du comportement sans thinking et une re-segmentation ne vaut pas les gains sur votre mix de tâches.
  • Votre intégration GLM-5.2 est en cours de livraison — une route stable bat une migration dont le comportement n'a pas encore passé vos portes de non-régression.
  • Vous auto-hébergez — pas de poids avant ~le 28 août, et la licence (contrairement à celle de GLM-5.2) n'est pas encore connue. N'architecturez pas autour de conditions non publiées.
  • Vous avez besoin de vision — aucun des deux modèles ne l'a ; cette mise à niveau n'y change rien.

Un plan d'évaluation en quatre étapes, exécutable dès maintenant

  1. Figez la référence. Capturez le taux d'acceptation qualité, les percentiles de latence, le coût par tâche acceptée et le taux d'échec d'outils de GLM-5.2 avant de déplacer du trafic.
  2. Rejouez, n'improvisez pas. Conservez 20 à 50 tâches représentatives, y compris vos échecs récurrents, comme suite fixe. Exécutez la même suite sur glm-5.3 aux niveaux d'effort low/high/max.
  3. Ouvrez une voie challenger. Routez une petite tranche à faible risque vers GLM-5.3 à côté de GLM-5.2, derrière la même clé et le même contrat EvoLink.
  4. Promouvez avec une porte de retour arrière. Définissez des seuils de promotion chiffrés (par ex. ≥10 % d'amélioration du coût par tâche acceptée, aucune régression de fidélité des outils) et gardez GLM-5.2 comme repli testé jusqu'à ce que GLM-5.3 les tienne pendant deux semaines.

FAQ

Dois-je basculer de GLM-5.2 vers GLM-5.3 maintenant ?

Oui, mais commencez par une voie challenger plutôt qu'un remplacement global. Retirez thinking.type: "disabled", exécutez des tâches appariées à chaque niveau d'effort, et ne promouvez que si le coût par tâche acceptée et la fidélité des outils passent vos portes. Les abonnés du Coding Plan ont peut-être déjà été auto-routés.

GLM-5.3 est-il un modèle plus grand que GLM-5.2 ?

Non — il utilise le même modèle de base. Z.ai attribue tous les gains au post-entraînement et n'a publié aucun nombre de paramètres distinct.

Quel est le changement cassant entre GLM-5.2 et GLM-5.3 ?

Le thinking ne peut plus être désactivé. thinking.type: "disabled" fonctionnait sur GLM-5.2 et n'est pas pris en charge sur GLM-5.3 ; reasoning_effort (low/high/max) est le nouveau contrôle.

GLM-5.3 coûtera-t-il le même prix que GLM-5.2 ?

Leurs tarifs catalogue officiels sont pour l'instant identiques : 1,40 $ en entrée, 0,26 $ en entrée mise en cache et 4,40 $ en sortie par million de tokens. Les factures peuvent malgré tout différer, car GLM-5.3 raisonne toujours et les tokens de raisonnement comptent comme sortie ; comparez le coût par tâche acceptée.

Les améliorations de benchmark sont-elles réelles ?

Elles sont rapportées par le fournisseur, sans réplication indépendante le jour de la sortie — et le propre tableau de Z.ai le montre encore derrière Claude Fable 5 sur plusieurs lignes, ce qui plaide pour sa franchise. Traitez-les comme une hypothèse que votre suite de régression teste, pas comme un fait acquis.

Puis-je auto-héberger GLM-5.3 comme GLM-5.2 ?

Pas encore. Les poids sont promis environ deux semaines après le lancement (~28 août 2026), et la licence n'a pas été précisée. Les conditions de type MIT de GLM-5.2 ne se transmettent pas automatiquement.

GLM-5.3 ajoute-t-il la vision ?

Non. Les deux modèles sont texte uniquement ; les travaux multimodaux restent dans la ligne GLM-V distincte de Z.ai.

Et GLM 5.5 vs GLM-5.2 ?

GLM 5.5 est un modèle distinct, toujours non annoncé — possiblement la sortie qui suivra après GLM-5.3. Notre guide GLM 5.5 vs GLM-5.2 conserve ce cadre attendre-ou-livrer pour le jour où il se matérialisera ; cette page couvre la génération réellement sortie.

Sources

Illustration de couverture générée avec Nano Banana Pro (modèle d'image Gemini) — pas avec les modèles comparés ici. Toutes les conclusions de cet article reposent sur le contrat d'API et la documentation officiels, pas sur une sortie d'image.
Faits vérifiés pour la dernière fois le 26 août 2026. Ce comparatif est mis à jour quand le prix, le comportement de l'API, les poids ou les évaluations indépendantes changent.

Prêt à réduire vos coûts IA de 89 % ?

Commencez avec EvoLink dès aujourd'hui et découvrez la puissance du routage intelligent des API.