Seedance 2.5 est disponible sur EvoLinkEssayer Seedance 2.5

GLM-5.3 Flash API

Z.ai-Génération de texte multimodale-à partir de $0.150 / 1M tokens d’entrée-Disponible
1M de contexteImage · vidéo · fichierRaisonnement toujours actifChat + Messages
Documentation API
Production routeLive
Fournisseur
Z.ai / Zhipu
Modèle
glm-5.3-flash
Fenêtre de contexte
1 000 000 tokens
Entrée
Texte · image · vidéo · fichier

Choisir GLM-5.3 Flash

Le membre nativement multimodal de la génération 5.3 : entrée texte, image, vidéo et fichiers pour environ un neuvième du prix de GLM-5.3, avec le même contexte de 1M de tokens, un raisonnement toujours actif, l’appel d’outils et le cache de prompts.

GLM-5.3 Flash

Modèle multimodal haut volume de Z.ai

Sélectionné
À partir de $0.150 / 1M tokens d’entréeglm-5.3-flash
Idéal pour

Classification et extraction en volume, compréhension de captures et de documents, analyse de vidéos et de fichiers, et étapes d’agent routinières où le prix au token décide du routage.

Entrée
$0.150 / 1M10.2 cr / 1M
Lecture de cache
$0.031 / 1M2.1 cr / 1M
Sortie
$0.500 / 1M34 cr / 1M

Tarifs GLM-5.3 Flash

Estimez une requête avant de router du trafic. Tous les groupes paient le même tarif, et les tokens de sortie incluent déjà les tokens de raisonnement.

Flash

Calculateur de tokens

Saisissez la composition en tokens d’une requête.

Coût estimé par requête

GLM-5.3 Flash
Tarif unique
USD$0.0004
Credits0.0209
Tokens d’entrée0.0102 cr
Tokens de lecture de cache0.0005 cr
Tokens de sortie0.0102 cr

Facturation minimale : 0,01 crédit par requête. Les entrées image, vidéo et fichier sont facturées comme des tokens d’entrée.

Repère budgétaire

Nombre approximatif de requêtes avec la composition actuelle.
Ajouter des crédits
$10
Environ 32535 requêtes

Tests rapides

$50
Environ 162679 requêtes

Développement courant

$100
Environ 325358 requêtes

Évaluation en production

Tarifs du modèle

GLM-5.3 Flash

Toutes tailles de contexte
Tokens d’entrée
$0.150 / 1M10.2 cr / 1M
Tokens de lecture de cache
$0.031 / 1M2.1 cr / 1M
Tokens de sortie
$0.500 / 1M34 cr / 1M

USD et crédits pour 1M de tokens, tarif unique sur toute la fenêtre de 1M.

La recherche web est facturée séparément : 0.68 crédits par appel.

API GLM-5.3 Flash pour le multimodal et les gros volumes

Le palier volume de la génération 5.3 sur l’API unifiée d’EvoLink. Entrée texte, image, vidéo et fichiers pour environ un neuvième du prix de GLM-5.3, avec le même contexte de 1M de tokens, un raisonnement toujours actif, l’appel d’outils et le cache de prompts.

GLM-5.3 Flash
Cas d’usage GLM-5.3 Flash

La place de GLM-5.3 Flash dans une pile de production

Flash est tarifé pour le volume : la question est rarement de savoir si vous pouvez vous le permettre, mais s’il franchit votre seuil de précision. Lancez-le d’abord, n’escaladez que les échecs, et l’écart de prix avec le modèle phare se met à travailler pour vous.

Classification et extraction en gros volumes

Routage de tickets, étiquetage, extraction structurée et tri de contenu tournent à un prix où relancer tout coûte moins cher que le temps d’ingénierie pour l’éviter. La taille du lot cesse d’être la contrainte.

Compréhension de captures et de documents

Envoyez captures d’interface, pages scannées ou schémas sous forme de blocs image_url et récupérez une sortie structurée. C’est précisément ce que GLM-5.3 ne sait pas faire : le modèle phare est texte uniquement.

Analyse de vidéos et de fichiers

Vidéo et fichiers sont acceptés nativement plutôt que via une chaîne séparée : une requête peut porter des éléments mixtes au lieu d’être scindée entre une étape de transcription et une étape de raisonnement.

Étapes routinières dans un agent plus large

Résumer un résultat d’outil, choisir une branche, reformater une sortie — les étapes qui dominent le volume d’appels sans dominer la difficulté. Gardez le modèle phare pour celles où la profondeur de raisonnement décide vraiment.

En quoi Flash diffère

Ce que Flash apporte, et ce qu’il demande en retour

Flash n’est pas un 5.3 bridé à fenêtre réduite : contexte, protocoles et cache sont identiques. Deux choses diffèrent, et l’une mérite que vous la mesuriez vous-même.

Entrée multimodale native, absente du modèle phare

Texte, image, vidéo et fichiers passent tous par la structure messages standard. Les images arrivent en blocs image_url avec une URL publique (recommandée officiellement) ou une data URL Base64, un bloc par image.

Environ un neuvième du prix du modèle phare

Entrée et sortie se situent près d’un neuvième du tarif GLM-5.3, et les lectures de cache sont encore moins chères. Cet écart change la forme d’une charge de travail, pas seulement sa facture.

La même contrainte de raisonnement que le reste de 5.3

Ici aussi le raisonnement est toujours actif et thinking.type: "disabled" est rejeté. Z.ai recommande en outre clear_thinking: false pour Flash ; le paramètre est transmis tel quel.

Le décompte des tokens médias mérite votre propre vérification

Images et vidéos comptent dans prompt_tokens et sont facturées au tarif d’entrée, mais le fournisseur ne publie pas de formule de tokens par image. Lancez un échantillon représentatif, lisez l’usage renvoyé et dimensionnez votre lot à partir de là, pas d’une estimation.

Capacités de GLM-5.3 Flash

Pourquoi Flash encaisse autant de volume

Flash conserve les propriétés de plateforme de la génération 5.3 et ne change que le prix et les modalités d’entrée. C’est cette combinaison qui en fait un choix par défaut plutôt qu’un recours.

Texte et médias mélangés dans une requête

Un message peut porter à la fois des instructions, plusieurs images et un fichier : les éléments relevant d’une même décision restent dans un seul appel au lieu d’être répartis dans une chaîne.

Le même contexte de 1M à tarif unique

Flash n’est pas un modèle à contexte court. La fenêtre complète de 1M est disponible à un tarif unique sans palier long contexte — c’est ce qui rend le traitement documentaire de masse viable à ce prix.

Des lectures de cache à une fraction de l’entrée

Un prompt système stable et les schémas d’outils sont facturés au tarif de lecture de cache sur toute la boucle. Sur un modèle déjà bon marché, cela ramène le coût marginal d’une étape supplémentaire quasiment à zéro.

Contrôles de production Flash

À vérifier avant de basculer du volume sur Flash

Deux contrôles portent sur la justesse, deux sur le coût. Celui des tokens médias est celui que la plupart des équipes sautent — et regrettent ensuite sur un gros lot.

01

Utiliser glm-5.3-flash comme identifiant

Le même identifiant fonctionne sur Chat Completions et Anthropic Messages et correspond exactement au nom fournisseur.

Requis
02

Supprimer tout thinking.type: "disabled"

Toute la génération 5.3 le rejette. Pour le chemin le plus économique et rapide, utilisez thinking.type: "enabled" avec reasoning_effort: "low".

Rupture
03

Mesurer les tokens médias sur un échantillon réel

Envoyez des images ou vidéos représentatives, lisez prompt_tokens dans la réponse et déduisez votre coût unitaire avant de fixer une taille de lot.

Coût
04

Définir la règle d’escalade vers GLM-5.3

Décidez à l’avance ce qui constitue un échec de Flash et ce qu’il déclenche. Sans règle, les équipes n’escaladent rien et livrent des erreurs, ou escaladent tout et perdent l’avantage tarifaire.

Routage
Évaluation de GLM-5.3 Flash

Mesurez l’écart de précision, puis chiffrez-le

La comparaison utile n’est pas Flash contre un benchmark, mais Flash contre GLM-5.3 sur vos propres tâches. Si Flash égale le modèle phare sur neuf requêtes sur dix, faire tourner les deux et escalader la dixième revient bien moins cher que d’envoyer les dix au modèle phare.

Taux de réussite au premier essaiLivrables acceptésTaux d’escalade vers GLM-5.3Tokens médias par requêteTaux de succès du cachePart du raisonnement dans la sortieDélai jusqu’au résultat acceptéCoût par tâche acceptée

Chiffrez l’écart de précision au lieu de le supposer. Un modèle à un neuvième du coût n’a besoin d’avoir raison que la plupart du temps pour que « lancer puis escalader » batte l’envoi systématique au modèle phare — mais « la plupart du temps » est un nombre à mesurer sur votre charge de travail, pas à hériter d’un benchmark.

Comparez à GLM-5.3 et DeepSeek V4 Flash

EvoLink

Flash est le palier volume de la génération 5.3. Vérifiez d’abord s’il franchit votre seuil de précision ; si oui, l’écart de prix avec le modèle phare suffit à changer la façon dont vous routez tout le travail routinier.

GLM-5.3 Flash
Entrée / Sortie$0.15 / $0.5
Contexte1M
CacheLectures de cache
Idéal pourClassification et extraction en volume, compréhension de captures et de documents, analyse de vidéos et de fichiers, et étapes d’agent routinières où le prix au token décide du routage.
GLM-5.3
Entrée / Sortie$1.4 / $4.4
Contexte1M
CacheLectures de cache
Idéal pourLe modèle phare 5.3 : texte uniquement, environ neuf fois le prix, et la bonne cible d’escalade quand Flash n’atteint pas le seuil sur du raisonnement difficile.
DeepSeek V4 Flash
Entrée / Sortie$0.442 / $1.324
Contexte1M
CacheLectures de cache
Idéal pourLa route haut volume de DeepSeek, contexte 1M et lecture de cache très bon marché. La comparaison de coût la plus directe pour le texte en masse.

Modèles associés

GLM-5.3

GLM-5.3

Le modèle phare 5.3 : texte uniquement, environ neuf fois le prix, et la bonne cible d’escalade quand Flash n’atteint pas le seuil sur du raisonnement difficile.

Voir le modèle
DeepSeek V4 Flash

DeepSeek V4 Flash

La route haut volume de DeepSeek, contexte 1M et lecture de cache très bon marché. La comparaison de coût la plus directe pour le texte en masse.

Voir le modèle
GLM-5.2

GLM-5.2

L’ancien vaisseau amiral GLM. Toujours pertinent pour les clients qui dépendent de la désactivation du raisonnement, que la génération 5.3 n’autorise plus.

Voir le modèle
Gemini 3.7 Flash

Gemini 3.7 Flash

La route multimodale économique de Google — référence inter-fournisseurs utile quand la compréhension d’images et de documents dicte le choix.

Voir le modèle

À lire également

GLM-5.3 Flash face à GLM-5.3

GLM-5.3 Flash face à GLM-5.3

Choisir la route selon la modalité, la difficulté et le coût par résultat accepté, avec une politique Flash-first et une escalade sélective.

Lire l’article
GLM-5.3 est sorti : ce qui a été livré

GLM-5.3 est sorti : ce qui a été livré

Ce que la sortie du 14 août a confirmé sur la génération 5.3 — spécifications, identifiants, ouverture par étapes — et ce qui restait en suspens.

Lire l’article
GLM-5.3 face à GLM-5.2

GLM-5.3 face à GLM-5.2

Même modèle de base, tous les gains venant du post-entraînement, plus la rupture de l’impossibilité de désactiver le raisonnement sur toute la génération.

Lire l’article
GLM-5.3 face à Claude

GLM-5.3 face à Claude

Benchmarks, contrats d’API et disponibilité réelle comparés avant de router des agents vers l’une ou l’autre famille.

Lire l’article
Benchmarks cybersécurité de GLM-5.3

Benchmarks cybersécurité de GLM-5.3

Ce que les chiffres CyberGym et ExploitBench affirment, selon Z.ai, et comment un défenseur devrait les lire.

Lire l’article
Une passerelle pour 3 CLI de code

Une passerelle pour 3 CLI de code

Chemins de configuration, variables d’environnement et check-list de dépannage pour faire passer plusieurs CLI par un seul endpoint.

Lire l’article

FAQ API GLM-5.3 Flash

L’API GLM-5.3 Flash est-elle disponible via EvoLink ?

Oui. GLM-5.3 Flash est disponible comme modèle de production, servi via Chat Completions et Anthropic Messages.

Quel identifiant de modèle utiliser ?

glm-5.3-flash sur les deux endpoints. Le nom EvoLink correspond exactement au nom du fournisseur.

Quels types d’entrée Flash accepte-t-il ?

Texte, images, vidéo et fichiers. C’est la différence principale avec GLM-5.3, qui est un modèle texte uniquement.

Comment envoyer une image ?

Placez un bloc image_url dans messages[].content[] et passez une URL publique (forme officiellement recommandée) ou une data URL Base64. Pour plusieurs images, ajoutez un bloc image_url par image.

Comment les entrées image et vidéo sont-elles facturées ?

Les médias sont comptés dans prompt_tokens et facturés au tarif d’entrée ; il n’y a pas de SKU média distincte. Le fournisseur ne publie pas de formule de conversion en tokens pour les images : lancez un échantillon représentatif et lisez l’usage renvoyé avant de dimensionner un gros lot.

Puis-je désactiver le raisonnement ?

Non. Toute la génération 5.3 raisonne en permanence et rejette thinking.type: "disabled". Pour le chemin le plus économique et le plus rapide, utilisez thinking.type: "enabled" avec reasoning_effort: "low".

Qu’est-ce que clear_thinking et faut-il le régler ?

Il contrôle si le raisonnement précédent est effacé entre les tours. Z.ai recommande clear_thinking: false pour Flash. Le paramètre est transmis tel quel ; EvoLink ne le réécrit pas.

Flash est-il combien moins cher que GLM-5.3 ?

Environ un neuvième en entrée comme en sortie. Cet écart justifie généralement de faire tourner Flash d’abord et de n’escalader que les requêtes qui échouent à votre contrôle d’acceptation.

Comment le cache de prompts est-il facturé ?

Les lectures de cache ont leur propre tarif, environ un cinquième de l’entrée fraîche. Aucun frais d’écriture, le fournisseur ne remontant pas de tokens de création. Gardez le préfixe stable octet par octet pour continuer à toucher le cache.

Quelles sont la fenêtre de contexte et la limite de sortie ?

1 000 000 de tokens de contexte et jusqu’à 131 072 tokens de sortie, à tarif unique sur toute la fenêtre — pas de palier long contexte.

Flash est-il un bon choix par défaut pour le volume ?

Oui, son prix est conçu pour cela. Classification, extraction, étapes d’agent routinières et compréhension de documents ou de captures y trouvent naturellement leur place. N’escaladez vers GLM-5.3 que là où un raisonnement plus poussé change mesurablement le résultat.

Que doit mesurer une évaluation en production ?

Réussite au premier essai, livrables acceptés, reprises, part de tokens de raisonnement dans la sortie, taux de cache, tokens médias par requête, délai jusqu’au résultat accepté et taux d’escalade vers GLM-5.3.