GPT Image 2.5 Flare & Sunburst sont disponibles sur EvoLinkEssayer GPT Image 2.5

GLM-5.3 Flash API

Accédez à GLM-5.3 Flash de Z.ai — aussi recherché sous GLM 5.3 Flash / Zhipu GLM-5.3 Flash — via l'API de chat unifiée d'EvoLink. Testez l'entrée d'images, l'analyse de longs documents, les agents multi-étapes avant d'intégrer.

Z.aiGénération de texteDisponible
à partir de $0.150 / 1M tokens d’entrée
Documentation API
Entrée multimodaleImage · vidéo · fichierRaisonnement toujours actifChat + Messages
Route productionLive
Contexte
1M de contexte · 131K de sortie max.
Idéal pour
Classification en volume, compréhension de captures et de documents, étapes d’agent routinières
Entrée
Texte + images
Sortie
Texte · JSON (sortie structurée) · appels d'outils

Choisir GLM-5.3 Flash

Le membre nativement multimodal de la génération 5.3 : entrée texte, image, vidéo et fichiers pour environ un neuvième du prix de GLM-5.3, avec le même contexte de 1M de tokens, un raisonnement toujours actif, l’appel d’outils et le cache de prompts.

GLM-5.3 Flash

Modèle multimodal haut volume de Z.ai

Sélectionné
ID du modèle
glm-5.3-flash
Idéal pour

Classification et extraction en volume, compréhension de captures et de documents, analyse de vidéos et de fichiers, et étapes d’agent routinières où le prix au token décide du routage.

Entrée
$0.150 / 1M10.2 cr / 1M
Lecture cache
$0.031 / 1M2.1 cr / 1M
Sortie
$0.500 / 1M34 cr / 1M

Tous les tarifs sont par 1M de tokens, en USD et en crédits, et reflètent la tarification actuelle de votre compte.

Tarifs GLM-5.3 Flash

Estimez le coût d'une requête GLM-5.3 Flash avant l'intégration. Le calculateur utilise les tarifs actuels de votre compte ; les prix officiels servent de référence.

Calculateur de requête

Saisissez la répartition des tokens d'une requête et le nombre d'appels d'outils réussis.

Coût estimé par requête

GLM-5.3 Flash
USD$0.0004
Crédits0.0209
Tokens d'entrée0.0102 cr
Tokens lus en cache0.0005 cr
Tokens de sortie0.0102 cr

Facturation minimale : 0.01 crédit par requête.

Guide budgétaire

Nombre approximatif de requêtes avec la répartition actuelle.
Ajouter des crédits
$10
Environ 32535 requêtes

Pour des tests rapides

$50
Environ 162679 requêtes

Pour le développement courant

$100
Environ 325358 requêtes

Pour l'évaluation en production

Tarifs des outils côté serveur

Seuls les appels côté serveur réussis sont facturés à l'appel ; les tentatives échouées n'ont pas de frais d'outil, mais les tokens restent facturés.
  • Recherche web$0.010/ appel0.68 cr / appel

API GLM-5.3 Flash pour le multimodal et les gros volumes

Le palier volume de la génération 5.3 sur l’API unifiée d’EvoLink. Entrée texte, image, vidéo et fichiers pour environ un neuvième du prix de GLM-5.3, avec le même contexte de 1M de tokens, un raisonnement toujours actif, l’appel d’outils et le cache de prompts.

GLM-5.3 Flash est servi sur EvoLink sous l'ID de modèle glm-5.3-flash via Chat Completions · Responses · Anthropic Messages, avec la même clé API et le même solde que tous les autres modèles. Il offre une fenêtre de contexte de 1M et jusqu'à 131K tokens de sortie, ainsi que l'entrée d'images, l'analyse de longs documents, les agents multi-étapes.

GLM-5.3 Flash

Spécifications et capacités de GLM-5.3 Flash

Les chiffres proviennent de la configuration de route EvoLink ; les capacités sont celles que l'API expose aujourd'hui.

Fenêtre de contexte
1M tokens
Sortie max.
131K tokens
Entrée
Texte + images
Sortie
Texte · JSON (sortie structurée) · appels d'outils
Raisonnement
Raisonnement toujours actif
Usage d'outils
Appels de fonctions avec séquences d'outils multi-étapes
Cache de prompt
Lectures de cache automatiques à tarif réduit
Outils côté serveur
Recherche web, facturés par appel réussi
Protocoles
Chat Completions · Responses · Anthropic Messages
ID du modèle
glm-5.3-flash

Pourquoi GLM-5.3 Flash encaisse autant de volume

Flash conserve les propriétés de plateforme de la génération 5.3 et ne change que le prix et les modalités d’entrée. C’est cette combinaison qui en fait un choix par défaut plutôt qu’un recours.

Texte et médias mélangés dans une requête

Un message peut porter à la fois des instructions, plusieurs images et un fichier : les éléments relevant d’une même décision restent dans un seul appel au lieu d’être répartis dans une chaîne.

Le même contexte de 1M à tarif unique

Flash n’est pas un modèle à contexte court. La fenêtre complète de 1M est disponible à un tarif unique sans palier long contexte — c’est ce qui rend le traitement documentaire de masse viable à ce prix.

Des lectures de cache à une fraction de l’entrée

Un prompt système stable et les schémas d’outils sont facturés au tarif de lecture de cache sur toute la boucle. Sur un modèle déjà bon marché, cela ramène le coût marginal d’une étape supplémentaire quasiment à zéro.

La place de GLM-5.3 Flash dans une pile de production

Flash est tarifé pour le volume : la question est rarement de savoir si vous pouvez vous le permettre, mais s’il franchit votre seuil de précision. Lancez-le d’abord, n’escaladez que les échecs, et l’écart de prix avec le modèle phare se met à travailler pour vous.

Classification et extraction en gros volumes

Routage de tickets, étiquetage, extraction structurée et tri de contenu tournent à un prix où relancer tout coûte moins cher que le temps d’ingénierie pour l’éviter. La taille du lot cesse d’être la contrainte.

Compréhension de captures et de documents

Envoyez captures d’interface, pages scannées ou schémas sous forme de blocs image_url et récupérez une sortie structurée. C’est précisément ce que GLM-5.3 ne sait pas faire : le modèle phare est texte uniquement.

Analyse de vidéos et de fichiers

Vidéo et fichiers sont acceptés nativement plutôt que via une chaîne séparée : une requête peut porter des éléments mixtes au lieu d’être scindée entre une étape de transcription et une étape de raisonnement.

Étapes routinières dans un agent plus large

Résumer un résultat d’outil, choisir une branche, reformater une sortie — les étapes qui dominent le volume d’appels sans dominer la difficulté. Gardez le modèle phare pour celles où la profondeur de raisonnement décide vraiment.

Ce que GLM-5.3 Flash apporte, et ce qu’il demande en retour

Flash n’est pas un 5.3 bridé à fenêtre réduite : contexte, protocoles et cache sont identiques. Deux choses diffèrent, et l’une mérite que vous la mesuriez vous-même.

Entrée multimodale native, absente du modèle phare

Texte, image, vidéo et fichiers passent tous par la structure messages standard. Les images arrivent en blocs image_url avec une URL publique (recommandée officiellement) ou une data URL Base64, un bloc par image.

Environ un neuvième du prix du modèle phare

Entrée et sortie se situent près d’un neuvième du tarif GLM-5.3, et les lectures de cache sont encore moins chères. Cet écart change la forme d’une charge de travail, pas seulement sa facture.

La même contrainte de raisonnement que le reste de 5.3

Ici aussi le raisonnement est toujours actif et thinking.type: "disabled" est rejeté. Z.ai recommande en outre clear_thinking: false pour Flash ; le paramètre est transmis tel quel.

Le décompte des tokens médias mérite votre propre vérification

Images et vidéos comptent dans prompt_tokens et sont facturées au tarif d’entrée, mais le fournisseur ne publie pas de formule de tokens par image. Lancez un échantillon représentatif, lisez l’usage renvoyé et dimensionnez votre lot à partir de là, pas d’une estimation.

Deux façons d'utiliser GLM-5.3 Flash : API EvoLink ou Agent

Utilisez l'API EvoLink pour les backends produit et les traitements par lots, ou appelez GLM-5.3 Flash depuis Codex, Claude ou Gemini pour vos workflows de code et d'analyse. Les deux voies partagent la même clé API EvoLink, le même solde, le même ID de modèle et le même historique de requêtes.

Option 1

Intégrer avec l'API EvoLink

Idéal pour : backends produit, traitements par lots, pipelines automatisés

Envoyez à EvoLink des requêtes Chat Completions compatibles OpenAI (ou Anthropic Messages) et contrôlez l'ID de modèle, le prompt système, le budget de sortie, les outils et la sortie structurée.

  1. 1Créez une clé API EvoLink dans la console
  2. 2Pointez votre SDK OpenAI ou Anthropic vers l'URL de base EvoLink et sélectionnez l'ID de modèle affiché ci-dessus
  3. 3Envoyez une requête représentative et lisez le champ usage pour les tokens d'entrée, en cache et de sortie
  4. 4Définissez max_tokens et les réessais par tâche ; conservez les ID et résultats des appels d'outils entre les tours
Option 2

L'appeler avec un Agent

Idéal pour : tâches de code, de revue et d'analyse dans Codex, Claude et Gemini

Donnez à l'Agent la tâche, les entrées à inclure et les critères d'acceptation. Il assemble la requête, appelle GLM-5.3 Flash via EvoLink et renvoie la réponse avec la consommation de tokens.

  1. 1Définissez EVOLINK_API_KEY dans votre environnement local ; jamais dans le code ni dans un prompt
  2. 2Décrivez la tâche, les entrées à inclure et le format de sortie attendu
  3. 3Demandez à l'Agent d'appeler GLM-5.3 Flash via EvoLink et d'afficher la requête avant l'envoi
  4. 4Laissez l'Agent rapporter la réponse, la consommation de tokens et tout corps d'erreur

Exemple de code API GLM-5.3 Flash et gestion des erreurs

Cet exemple montre la requête exécutable la plus courte : un appel Chat Completions compatible OpenAI avec un prompt système, un message utilisateur et un budget de sortie. Ouvrez l'onglet API pour la référence complète des paramètres et réponses.

Voir la documentation API complète
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [
      { "role": "system", "content": "You extract structured data. Answer in JSON only." },
      { "role": "user", "content": [
        { "type": "text", "text": "List every line item on this receipt as JSON." },
        { "type": "image_url", "image_url": { "url": "https://example.com/receipt.jpg" } }
      ] }
    ],
    "max_tokens": 1024,
    "temperature": 0.1
  }'

# Reasoning is always on for the 5.3 generation: do not send
# thinking.type "disabled". The same model ID works on /v1/messages
# (Anthropic Messages). The response includes choices[0].message and
# a usage object; image and video input is counted in prompt_tokens.

Requête invalide ou paramètre non pris en charge

Vérifiez l'ID de modèle, le tableau messages et les plages de paramètres dans la référence API ; retirez les champs que cette route ne prend pas en charge.

Problème d'authentification ou de solde

Vérifiez le jeton Bearer Authorization et confirmez le solde disponible dans la console.

Longueur de contexte dépassée

Les tokens du prompt dépassent la fenêtre de contexte de GLM-5.3 Flash. Réduisez ou ne récupérez que les éléments pertinents et réutilisez les préfixes en cache.

Limite de débit (429)

Attendez et réessayez avec un délai aléatoire ; regroupez ou mettez en file d'attente les requêtes au lieu de rafales parallèles.

Contenu ou appel d'outil rejeté

Vérifiez le contenu sensible, les arguments d'appel d'outil mal formés et les écarts de schéma JSON avant de réessayer.

À vérifier avant de basculer du volume sur GLM-5.3 Flash

Deux contrôles portent sur la justesse, deux sur le coût. Celui des tokens médias est celui que la plupart des équipes sautent — et regrettent ensuite sur un gros lot.

01

Utiliser glm-5.3-flash comme identifiant

Le même identifiant fonctionne sur Chat Completions et Anthropic Messages et correspond exactement au nom fournisseur.

Requis
02

Supprimer tout thinking.type: "disabled"

Toute la génération 5.3 le rejette. Pour le chemin le plus économique et rapide, utilisez thinking.type: "enabled" avec reasoning_effort: "low".

Rupture
03

Mesurer les tokens médias sur un échantillon réel

Envoyez des images ou vidéos représentatives, lisez prompt_tokens dans la réponse et déduisez votre coût unitaire avant de fixer une taille de lot.

Coût
04

Définir la règle d’escalade vers GLM-5.3

Décidez à l’avance ce qui constitue un échec de Flash et ce qu’il déclenche. Sans règle, les équipes n’escaladent rien et livrent des erreurs, ou escaladent tout et perdent l’avantage tarifaire.

Routage

La lecture de cache coûte environ un cinquième de l’entrée fraîche

L’entrée mise en cache est facturée à son propre tarif réduit : un prompt système stable et les schémas d’outils restent bon marché sur une longue boucle d’agent. Aucun frais d’écriture de cache — le fournisseur ne remonte pas de tokens de création.

Entrée native image, vidéo et fichiers

Envoyez les images sous forme de blocs image_url dans messages[].content[], avec une URL publique (recommandé) ou une data URL Base64, un bloc par image. Les médias sont comptés dans prompt_tokens et facturés au tarif d’entrée — mesurez sur un échantillon représentatif avant de dimensionner un gros lot.

Mesurez l’écart de précision de GLM-5.3 Flash, puis chiffrez-le

La comparaison utile n’est pas Flash contre un benchmark, mais Flash contre GLM-5.3 sur vos propres tâches. Si Flash égale le modèle phare sur neuf requêtes sur dix, faire tourner les deux et escalader la dixième revient bien moins cher que d’envoyer les dix au modèle phare.

Taux de réussite au premier essaiLivrables acceptésTaux d’escalade vers GLM-5.3Tokens médias par requêteTaux de succès du cachePart du raisonnement dans la sortieDélai jusqu’au résultat acceptéCoût par tâche acceptée

Chiffrez l’écart de précision au lieu de le supposer. Un modèle à un neuvième du coût n’a besoin d’avoir raison que la plupart du temps pour que « lancer puis escalader » batte l’envoi systématique au modèle phare — mais « la plupart du temps » est un nombre à mesurer sur votre charge de travail, pas à hériter d’un benchmark.

Comparez à GLM-5.3 et DeepSeek V4 Flash

EvoLink

Flash est le palier volume de la génération 5.3. Vérifiez d’abord s’il franchit votre seuil de précision ; si oui, l’écart de prix avec le modèle phare suffit à changer la façon dont vous routez tout le travail routinier.

GLM-5.3 Flash
Entrée / Sortie$0.15 / $0.5
Contexte1M
CacheLectures de cache
Idéal pourClassification et extraction en volume, compréhension de captures et de documents, analyse de vidéos et de fichiers, et étapes d’agent routinières où le prix au token décide du routage.
GLM-5.3
Entrée / Sortie$1.4 / $4.4
Contexte1M
CacheLectures de cache
Idéal pourLe modèle phare 5.3 : texte uniquement, environ neuf fois le prix, et la bonne cible d’escalade quand Flash n’atteint pas le seuil sur du raisonnement difficile.
DeepSeek V4 Flash
Entrée / Sortie$0.442 / $1.324
Contexte1M
CacheLectures de cache
Idéal pourLa route haut volume de DeepSeek, contexte 1M et lecture de cache très bon marché. La comparaison de coût la plus directe pour le texte en masse.

Famille de modèles GLM

Même clé API, même solde : changez de palier sans toucher à l’intégration.

GLM-5.3

GLM-5.3

Modèle de raisonnement phare de Z.ai

Voir le modèle
GLM-5.2

GLM-5.2

L’ancien vaisseau amiral GLM. Toujours pertinent pour les clients qui dépendent de la désactivation du raisonnement, que la génération 5.3 n’autorise plus.

Voir le modèle
GLM-5.5

GLM-5.5

Le prochain modèle phare GLM sur la liste de veille d’EvoLink. Inscrivez-vous à l’alerte pour recevoir l’ID de modèle, le prix et la vérification de route dès la mise en service.

Voir le modèle

Autres modèles texte sur EvoLink en plus de GLM-5.3 Flash

DeepSeek V4 Flash

DeepSeek V4 Flash

La route haut volume de DeepSeek, contexte 1M et lecture de cache très bon marché. La comparaison de coût la plus directe pour le texte en masse.

Voir le modèle
Gemini 3.7 Flash

Gemini 3.7 Flash

La route multimodale économique de Google — référence inter-fournisseurs utile quand la compréhension d’images et de documents dicte le choix.

Voir le modèle
Kimi K3

Kimi K3

La route de raisonnement à long contexte de Moonshot pour le code à l’échelle d’un dépôt et le multi-document.

Voir le modèle
GPT-5.6

GPT-5.6

La famille frontière d’OpenAI par paliers (Sol/Terra/Luna) pour arbitrer capacité, latence et coût.

Voir le modèle

Pour aller plus loin avec GLM-5.3 Flash

GLM-5.3 Flash face à GLM-5.3

GLM-5.3 Flash face à GLM-5.3

Choisir la route selon la modalité, la difficulté et le coût par résultat accepté, avec une politique Flash-first et une escalade sélective.

Lire l’article
GLM-5.3 est sorti : ce qui a été livré

GLM-5.3 est sorti : ce qui a été livré

Ce que la sortie du 14 août a confirmé sur la génération 5.3 — spécifications, identifiants, ouverture par étapes — et ce qui restait en suspens.

Lire l’article
GLM-5.3 face à GLM-5.2

GLM-5.3 face à GLM-5.2

Même modèle de base, tous les gains venant du post-entraînement, plus la rupture de l’impossibilité de désactiver le raisonnement sur toute la génération.

Lire l’article
GLM-5.3 face à Claude

GLM-5.3 face à Claude

Benchmarks, contrats d’API et disponibilité réelle comparés avant de router des agents vers l’une ou l’autre famille.

Lire l’article
Benchmarks cybersécurité de GLM-5.3

Benchmarks cybersécurité de GLM-5.3

Ce que les chiffres CyberGym et ExploitBench affirment, selon Z.ai, et comment un défenseur devrait les lire.

Lire l’article
Une passerelle pour 3 CLI de code

Une passerelle pour 3 CLI de code

Chemins de configuration, variables d’environnement et check-list de dépannage pour faire passer plusieurs CLI par un seul endpoint.

Lire l’article

FAQ API GLM-5.3 Flash

L’API GLM-5.3 Flash est-elle disponible via EvoLink ?

Oui. GLM-5.3 Flash est disponible comme modèle de production, servi via Chat Completions et Anthropic Messages.

Quel identifiant de modèle utiliser ?

glm-5.3-flash sur les deux endpoints. Le nom EvoLink correspond exactement au nom du fournisseur.

Quels types d’entrée Flash accepte-t-il ?

Texte, images, vidéo et fichiers. C’est la différence principale avec GLM-5.3, qui est un modèle texte uniquement.

Comment envoyer une image ?

Placez un bloc image_url dans messages[].content[] et passez une URL publique (forme officiellement recommandée) ou une data URL Base64. Pour plusieurs images, ajoutez un bloc image_url par image.

Comment les entrées image et vidéo sont-elles facturées ?

Les médias sont comptés dans prompt_tokens et facturés au tarif d’entrée ; il n’y a pas de SKU média distincte. Le fournisseur ne publie pas de formule de conversion en tokens pour les images : lancez un échantillon représentatif et lisez l’usage renvoyé avant de dimensionner un gros lot.

Puis-je désactiver le raisonnement ?

Non. Toute la génération 5.3 raisonne en permanence et rejette thinking.type: "disabled". Pour le chemin le plus économique et le plus rapide, utilisez thinking.type: "enabled" avec reasoning_effort: "low".

Qu’est-ce que clear_thinking et faut-il le régler ?

Il contrôle si le raisonnement précédent est effacé entre les tours. Z.ai recommande clear_thinking: false pour Flash. Le paramètre est transmis tel quel ; EvoLink ne le réécrit pas.

Flash est-il combien moins cher que GLM-5.3 ?

Environ un neuvième en entrée comme en sortie. Cet écart justifie généralement de faire tourner Flash d’abord et de n’escalader que les requêtes qui échouent à votre contrôle d’acceptation.

Comment le cache de prompts est-il facturé ?

Les lectures de cache ont leur propre tarif, environ un cinquième de l’entrée fraîche. Aucun frais d’écriture, le fournisseur ne remontant pas de tokens de création. Gardez le préfixe stable octet par octet pour continuer à toucher le cache.

Quelles sont la fenêtre de contexte et la limite de sortie ?

1 000 000 de tokens de contexte et jusqu’à 131 072 tokens de sortie, à tarif unique sur toute la fenêtre — pas de palier long contexte.

Flash est-il un bon choix par défaut pour le volume ?

Oui, son prix est conçu pour cela. Classification, extraction, étapes d’agent routinières et compréhension de documents ou de captures y trouvent naturellement leur place. N’escaladez vers GLM-5.3 que là où un raisonnement plus poussé change mesurablement le résultat.

Que doit mesurer une évaluation en production ?

Réussite au premier essai, livrables acceptés, reprises, part de tokens de raisonnement dans la sortie, taux de cache, tokens médias par requête, délai jusqu’au résultat accepté et taux d’escalade vers GLM-5.3.