Accédez à GLM-5.3 de Z.ai — aussi recherché sous Zhipu GLM-5.3 / GLM 5.3 — via l'API de chat unifiée d'EvoLink. Testez le codage à long contexte, les agents multi-étapes, le cache de prompt avant d'intégrer.
Raisonnement toujours actifCache de promptsAppels d’outilsChat + Messages
Route productionCe taux reflète la disponibilité côté plateforme — seules les erreurs serveur confirmées (HTTP 500 / réponse vide) comptent comme échecs. Les problèmes côté utilisateur (modération de contenu, paramètres invalides, annulation) ainsi que les limites de débit, timeouts et erreurs d'authentification sont exclus. Avant l'arrivée de trafic réel, les intervalles vides peuvent apparaître comme disponibles.Live
Live
Contexte
1M de contexte · 131K de sortie max.
Idéal pour
Agents de codage, longues chaînes de tâches, workflows riches en outils
Le modèle de raisonnement phare de Z.ai pour les agents de code et les travaux d’ingénierie au long cours : 1M de tokens de contexte, raisonnement toujours actif, appel d’outils et cache de prompts, via Chat Completions et Anthropic Messages.
GLM-5.3
Modèle de raisonnement phare de Z.ai
Sélectionné
ID du modèle
glm-5.3
Idéal pour
Agents de code à l’échelle du dépôt, longues chaînes de tâches, workflows riches en outils et boucles d’agent à préfixe stable où les lectures de cache portent l’essentiel de l’entrée.
Entrée
$1.400 / 1M95.2 cr / 1M
Lecture cache
$0.261 / 1M17.7 cr / 1M
Sortie
$4.400 / 1M299.2 cr / 1M
Tous les tarifs sont par 1M de tokens, en USD et en crédits, et reflètent la tarification actuelle de votre compte.
Tarifs GLM-5.3
Estimez le coût d'une requête GLM-5.3 avant l'intégration. Le calculateur utilise les tarifs actuels de votre compte ; les prix officiels servent de référence.
Calculateur de requête
Saisissez la répartition des tokens d'une requête et le nombre d'appels d'outils réussis.
Coût estimé par requête
GLM-5.3
USD$0.0028
Crédits0.1886
Tokens d'entrée0.0952 cr
Tokens lus en cache0.0036 cr
Tokens de sortie0.0898 cr
Facturation minimale : 0.01 crédit par requête.
Guide budgétaire
Nombre approximatif de requêtes avec la répartition actuelle.
Seuls les appels côté serveur réussis sont facturés à l'appel ; les tentatives échouées n'ont pas de frais d'outil, mais les tokens restent facturés.
Recherche web$0.010/ appel·0.68 cr / appel
API GLM-5.3 pour les agents de code et l’ingénierie au long cours
Appelez le modèle de raisonnement phare de Z.ai à 1,40 $ en entrée et 4,40 $ en sortie par million de tokens via l’API unifiée d’EvoLink. Utilisez l’ID glm-5.3 avec un contexte de 1M, un raisonnement low/high/max toujours actif, les outils et le cache de prompts.
GLM-5.3 est servi sur EvoLink sous l'ID de modèle glm-5.3 via Chat Completions · Responses · Anthropic Messages, avec la même clé API et le même solde que tous les autres modèles. Il offre une fenêtre de contexte de 1M et jusqu'à 131K tokens de sortie, ainsi que le codage à long contexte, les agents multi-étapes, le cache de prompt.
Spécifications et capacités de GLM-5.3
Les chiffres proviennent de la configuration de route EvoLink ; les capacités sont celles que l'API expose aujourd'hui.
Appels de fonctions avec séquences d'outils multi-étapes
Cache de prompt
Lectures de cache automatiques à tarif réduit
Outils côté serveur
Recherche web, facturés par appel réussi
Protocoles
Chat Completions · Responses · Anthropic Messages
ID du modèle
glm-5.3
Pourquoi GLM-5.3 peut absorber ces charges
Trois propriétés font l’essentiel du travail. Chacune implique aussi une manière de mal utiliser le modèle : mieux vaut les comprendre avant de router du trafic de production.
Un contexte de travail de 1M de tokens à tarif unique
Il n’y a pas de palier tarifaire long contexte — le tarif au token 900 000 est celui du token 1 000. Cela supprime une raison courante de tronquer agressivement, sans rendre le remplissage de la fenêtre gratuit ni exact.
Transmission fidèle de la requête, octet par octet
Hormis le nom du modèle, le corps de la requête parvient inchangé au fournisseur : champs spécifiques à GLM, empreintes de préfixe de cache et signatures de raisonnement sont préservés sur les deux endpoints.
Tokens de raisonnement inclus dans la facturation de sortie
Le raisonnement est facturé au sein des tokens de complétion, pas en ligne séparée : le plafond de 131 072 tokens de sortie couvre donc raisonnement et réponse finale ensemble. Calibrez les budgets de sortie par tâche, pas sur le plafond.
Où GLM-5.3 a sa place dans une pile de modèles en production
GLM-5.3 coûte plus cher que GLM-5.2 et bien plus que Flash : il ne devrait pas devenir la route par défaut du simple fait qu’il est le plus récent. Son terrain le plus solide, ce sont les tâches où un raisonnement plus poussé supprime une reprise ou une passe de correction humaine.
GLM-5.3 pour le code à l’échelle du dépôt
Gardez modules liés, tests et conventions dans un contexte de 1M de tokens au lieu d’alimenter l’agent fichier par fichier. Le gain se voit sur les modifications inter-fichiers qui ne cassent plus, pas sur une meilleure complétion d’un fichier isolé.
GLM-5.3 pour les longues chaînes de tâches
Les boucles planifier-exécuter-vérifier sur de nombreuses étapes en profitent le plus, car une erreur de raisonnement précoce se propage sur toute la chaîne. Mesurez le taux de chaînes achevées, pas la qualité par étape.
GLM-5.3 pour les agents riches en outils
Les gros schémas d’outils et les longs blocs d’instructions résident dans le préfixe mis en cache : le coût marginal d’une étape supplémentaire reste proche du tarif de lecture de cache plutôt que du tarif d’entrée plein.
GLM-5.3 depuis les clients au protocole Anthropic
Les requêtes vers /v1/messages sont transmises octet par octet, préservant préfixes de cache et signatures de raisonnement. Les CLI de code en protocole Claude peuvent pointer vers EvoLink et choisir glm-5.3 sans couche de traduction.
Ce que GLM-5.3 change — et ce qu’il casse
GLM-5.3 n’est pas un remplacement transparent de GLM-5.2. Un changement de paramètre constitue une rupture nette, et le prix a bougé. Lisez ces quatre points avant de basculer une route de production.
Rupture : le raisonnement ne peut plus être désactivé
GLM-5.3 raisonne toujours et rejette thinking.type: "disabled". Tout client migré depuis GLM-5.2 qui envoie encore le mode désactivé échouera purement et simplement. Le remplacement officiel est thinking.type: "enabled" avec reasoning_effort: "low".
Trois niveaux d’effort de raisonnement, max par défaut
reasoning_effort accepte low, high et max, avec max par défaut. Les tokens de sortie incluant le raisonnement, le niveau agit directement sur le coût : laisser la valeur par défaut sur des appels de routine en volume est la façon la plus courante de trop dépenser sur 5.3.
Les lectures de cache sont le levier le moins cher de cette page
Les tokens de lecture de cache sont facturés environ un cinquième de l’entrée fraîche. Dans une longue boucle d’agent où le prompt système et les schémas d’outils dominent l’entrée, garder ce préfixe stable octet par octet pèse plus sur la facture que le choix du modèle.
Plus cher que GLM-5.2, sans remise
L’entrée dépasse d’environ 40% le tarif actuel de GLM-5.2, car 5.3 est facturé au prix fournisseur sans remise promotionnelle. Routez vers 5.3 là où le raisonnement supplémentaire le vaut de façon mesurable, et laissez le reste sur 5.2 ou Flash.
Deux façons d'utiliser GLM-5.3 : API EvoLink ou Agent
Utilisez l'API EvoLink pour les backends produit et les traitements par lots, ou appelez GLM-5.3 depuis Codex, Claude ou Gemini pour vos workflows de code et d'analyse. Les deux voies partagent la même clé API EvoLink, le même solde, le même ID de modèle et le même historique de requêtes.
Option 1
Intégrer avec l'API EvoLink
Idéal pour : backends produit, traitements par lots, pipelines automatisés
Envoyez à EvoLink des requêtes Chat Completions compatibles OpenAI (ou Anthropic Messages) et contrôlez l'ID de modèle, le prompt système, le budget de sortie, les outils et la sortie structurée.
1Créez une clé API EvoLink dans la console
2Pointez votre SDK OpenAI ou Anthropic vers l'URL de base EvoLink et sélectionnez l'ID de modèle affiché ci-dessus
3Envoyez une requête représentative et lisez le champ usage pour les tokens d'entrée, en cache et de sortie
4Définissez max_tokens et les réessais par tâche ; conservez les ID et résultats des appels d'outils entre les tours
Idéal pour : tâches de code, de revue et d'analyse dans Codex, Claude et Gemini
Donnez à l'Agent la tâche, les entrées à inclure et les critères d'acceptation. Il assemble la requête, appelle GLM-5.3 via EvoLink et renvoie la réponse avec la consommation de tokens.
1Définissez EVOLINK_API_KEY dans votre environnement local ; jamais dans le code ni dans un prompt
2Décrivez la tâche, les entrées à inclure et le format de sortie attendu
3Demandez à l'Agent d'appeler GLM-5.3 via EvoLink et d'afficher la requête avant l'envoi
4Laissez l'Agent rapporter la réponse, la consommation de tokens et tout corps d'erreur
Exemple de code API GLM-5.3 et gestion des erreurs
Cet exemple montre la requête exécutable la plus courte : un appel Chat Completions compatible OpenAI avec un prompt système, un message utilisateur et un budget de sortie. Ouvrez l'onglet API pour la référence complète des paramètres et réponses.
curl -X POST https://api.evolink.ai/v1/chat/completions \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{ "role": "system", "content": "You are a senior engineer. Answer in JSON when asked." },
{ "role": "user", "content": "Review this diff and list risky changes as a JSON array:\n<diff>" }
],
"reasoning_effort": "low",
"max_tokens": 2048,
"stream": true
}'
# Reasoning is always on: reasoning_effort accepts low / high / max
# (default max) and thinking.type "disabled" is rejected.
# The same model ID works on /v1/messages (Anthropic Messages).
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens; completion tokens include reasoning).
Requête invalide ou paramètre non pris en charge
Vérifiez l'ID de modèle, le tableau messages et les plages de paramètres dans la référence API ; retirez les champs que cette route ne prend pas en charge.
Problème d'authentification ou de solde
Vérifiez le jeton Bearer Authorization et confirmez le solde disponible dans la console.
Longueur de contexte dépassée
Les tokens du prompt dépassent la fenêtre de contexte de GLM-5.3. Réduisez ou ne récupérez que les éléments pertinents et réutilisez les préfixes en cache.
Limite de débit (429)
Attendez et réessayez avec un délai aléatoire ; regroupez ou mettez en file d'attente les requêtes au lieu de rafales parallèles.
Contenu ou appel d'outil rejeté
Vérifiez le contenu sensible, les arguments d'appel d'outil mal formés et les écarts de schéma JSON avant de réessayer.
À vérifier avant de router du trafic de production vers GLM-5.3
Quatre contrôles couvrent la quasi-totalité des problèmes de migration constatés sur ce modèle. Les deux premiers sont des échecs francs, les deux suivants des dérives de coût silencieuses.
01
Utiliser glm-5.3 comme identifiant
Le même identifiant fonctionne sur Chat Completions et Anthropic Messages et correspond exactement au nom fournisseur : aucun alias à traduire.
Requis
02
Supprimer tout thinking.type: "disabled"
C’est la seule rupture nette par rapport à GLM-5.2. Remplacez-le par thinking.type: "enabled" plus reasoning_effort: "low" et rejouez vos prompts de régression.
Rupture
03
Régler reasoning_effort volontairement
La valeur par défaut est max. Passez les appels de routine et sensibles à la latence en low, puis vérifiez que le taux d’acceptation tient avant de compter l’économie.
Coût
04
Vérifier que le cache est réellement touché
Contrôlez la présence de tokens mis en cache dans l’usage renvoyé. Si le préfixe change entre deux appels, chaque requête est facturée au tarif d’entrée plein, et la réponse elle-même ne le montre pas.
Coût
La lecture de cache coûte environ un cinquième de l’entrée fraîche
L’entrée mise en cache est facturée à son propre tarif réduit : un prompt système stable, les règles du dépôt et les schémas d’outils restent bon marché sur une longue boucle d’agent. Aucun frais d’écriture de cache — le fournisseur ne remonte pas de tokens de création de cache.
1M de tokens de contexte, plafond de sortie à 131K
Gardez le code lié, les spécifications et l’état de l’agent dans un même contexte de travail. Le plafond est une capacité, pas un objectif : récupérez l’utile, gardez le préfixe stable pour qu’il soit mis en cache et calibrez le budget de sortie selon la tâche.
Comparez le coût par tâche acceptée de GLM-5.3, pas seulement le prix du token
GLM-5.3 coûte plus cher au token que GLM-5.2 et que Flash. Cela ne compte qu’avec la fréquence à laquelle chaque modèle produit un résultat que vous livrez vraiment. Suivez ces signaux sur vos propres charges pendant une semaine avant de figer une route.
Taux de réussite au premier essaiLivrables acceptésReprises par tâchePart du raisonnement dans la sortieTaux de succès du cacheAppels d’outils validesDélai jusqu’au résultat acceptéTaux de repli
Une route 40% plus chère au token mais qui supprime une reprise sur trois revient moins cher en pratique. Une route 40% plus chère qui ne change rien n’est qu’un défaut plus onéreux. Le seul moyen de les distinguer est de mesurer les deux sur les mêmes tâches.
Comparez à GLM-5.2 et Kimi K3 avant de basculer
EvoLink
GLM-5.3 est plus cher que GLM-5.2 : la vraie question est de savoir si moins de reprises et moins de correction humaine couvrent l’écart sur vos charges. Mesurez d’abord, choisissez la route de production ensuite.
Agents de code à l’échelle du dépôt, longues chaînes de tâches, workflows riches en outils et boucles d’agent à préfixe stable où les lectures de cache portent l’essentiel de l’entrée.
L’ancien vaisseau amiral GLM, toujours moins cher au token. À conserver là où 5.3 n’apporte aucun gain mesurable, et pour les clients qui dépendent de la désactivation du raisonnement.
La route de raisonnement 1M de Moonshot. Base de comparaison inter-fournisseurs utile pour le code à long contexte et les agents.
GLM-5.3
Entrée / Sortie$1.4 / $4.4
Contexte1M
CacheLectures de cache
Idéal pourAgents de code à l’échelle du dépôt, longues chaînes de tâches, workflows riches en outils et boucles d’agent à préfixe stable où les lectures de cache portent l’essentiel de l’entrée.
Idéal pourL’ancien vaisseau amiral GLM, toujours moins cher au token. À conserver là où 5.3 n’apporte aucun gain mesurable, et pour les clients qui dépendent de la désactivation du raisonnement.
Idéal pourLa route de raisonnement 1M de Moonshot. Base de comparaison inter-fournisseurs utile pour le code à long contexte et les agents.
Famille de modèles GLM
Même clé API, même solde : changez de palier sans toucher à l’intégration.
GLM-5.3
Modèle actuel
Modèle de raisonnement phare de Z.ai
GLM-5.2
L’ancien vaisseau amiral GLM, toujours moins cher au token. À conserver là où 5.3 n’apporte aucun gain mesurable, et pour les clients qui dépendent de la désactivation du raisonnement.
Même génération 5.3 à environ un neuvième du prix, avec entrée native image, vidéo et fichiers. Le choix par défaut pour les gros volumes et le multimodal.
Même modèle de base, tous les gains venant du post-entraînement, plus la rupture de l’impossibilité de désactiver le raisonnement. Quand rester en 5.2.
Oui. GLM-5.3 est disponible comme modèle de production, servi via Chat Completions et Anthropic Messages.
Quel identifiant de modèle utiliser ?
glm-5.3 sur les deux endpoints. Le nom EvoLink correspond exactement au nom du fournisseur.
Puis-je garder le SDK OpenAI ou Anthropic Messages ?
Oui. Pointez l’un ou l’autre client vers EvoLink avec la même clé API et sélectionnez glm-5.3. La requête est transmise octet par octet hormis le nom du modèle : préfixes de cache et signatures de raisonnement sont préservés.
Puis-je désactiver le raisonnement comme sur GLM-5.2 ?
Non. GLM-5.3 raisonne toujours et rejette thinking.type: "disabled". Lors d’une migration depuis GLM-5.2, passez à thinking.type: "enabled" avec reasoning_effort: "low", le remplacement officiel.
Comment choisir reasoning_effort ?
La valeur par défaut est max. Utilisez low pour les modifications courantes, la classification et les appels sensibles à la latence ; high ou max pour l’architecture, le débogage et les longues chaînes. Les tokens de sortie incluent le raisonnement : le niveau agit directement sur le coût.
Pourquoi GLM-5.3 coûte-t-il plus cher que GLM-5.2 ?
GLM-5.3 est facturé au tarif fournisseur sans remise, alors que GLM-5.2 bénéficie d’un prix promotionnel : l’entrée est environ 40% plus chère. Routez vers 5.3 là où le raisonnement supplémentaire supprime des reprises, restez sur 5.2 ou GLM-5.3 Flash sinon.
Comment le cache de prompts est-il facturé ?
Les lectures de cache ont leur propre tarif, environ un cinquième de l’entrée fraîche. Aucun frais d’écriture, le fournisseur ne remontant pas de tokens de création. Gardez le préfixe stable octet par octet pour continuer à toucher le cache.
Quelles sont la fenêtre de contexte et la limite de sortie ?
1 000 000 de tokens de contexte et jusqu’à 131 072 tokens de sortie, à tarif unique sur toute la fenêtre — pas de palier long contexte.
GLM-5.3 ou GLM-5.3 Flash ?
Flash coûte environ un neuvième et accepte image, vidéo et fichiers. Commencez par Flash pour le volume, le multimodal et la routine ; passez à GLM-5.3 quand la tâche exige un raisonnement plus poussé et que le taux d’acceptation le justifie.
GLM-5.3 accepte-t-il les images ?
Non, GLM-5.3 est un modèle texte uniquement. Utilisez GLM-5.3 Flash pour l’entrée image, vidéo et fichiers.
Comment le comparer à Claude, GPT ou Kimi ?
Évaluez GLM-5.3 au coût par tâche acceptée sur les agents de code et les longues chaînes, prenez Claude et GPT comme références de capacité, et Kimi K3 comme comparaison long contexte inter-fournisseurs.
Que doit mesurer une évaluation en production ?
Réussite au premier essai, livrables acceptés, reprises, part de tokens de raisonnement dans la sortie, taux de cache, appels d’outils valides, délai jusqu’au résultat accepté et taux de repli.