GPT Image 2.5 Flare & Sunburst sont disponibles sur EvoLinkEssayer GPT Image 2.5

GLM-5.3 FlashX API

GLM-5.3 FlashX est le modèle multimodal de Z.ai axé sur la vitesse pour la programmation interactive et les agents. Comparez son coût en tokens à Flash et intégrez-le via l’API unifiée EvoLink.

Z.aiGénération de texteDisponible
à partir de $0.371 / 1M tokens d’entrée
Documentation API
Entrée multimodaleImage · vidéo · fichierRaisonnement toujours actifChat + Messages
Route productionLive
Contexte
1M de contexte · 131K de sortie max.
Idéal pour
Agents de programmation interactifs, analyse de captures, traitement de documents
Entrée
Texte + images + vidéo + fichiers
Sortie
Texte · JSON (sortie structurée) · appels d'outils

Choisir GLM-5.3 FlashX

GLM-5.3 FlashX est le modèle multimodal de Z.ai axé sur la vitesse pour la programmation interactive et les agents. Comparez son coût en tokens à Flash et intégrez-le via l’API unifiée EvoLink.

GLM-5.3 FlashX

Modèle multimodal de Z.ai axé sur la vitesse

Sélectionné
ID du modèle
glm-5.3-flashx
Idéal pour

Agents de programmation interactifs, analyse de captures, traitement de documents

Entrée
$0.371 / 1M25.2 cr / 1M
Lecture cache
$0.075 / 1M5.1 cr / 1M
Sortie
$1.250 / 1M85 cr / 1M

Tous les tarifs sont par 1M de tokens, en USD et en crédits, et reflètent la tarification actuelle de votre compte.

Tarifs GLM-5.3 FlashX

Estimez le coût d'une requête GLM-5.3 FlashX avant l'intégration. Le calculateur utilise les tarifs actuels de votre compte ; les prix officiels servent de référence.

Calculateur de requête

Saisissez la répartition des tokens d'une requête et le nombre d'appels d'outils réussis.

Coût estimé par requête

GLM-5.3 FlashX
USD$0.0008
Crédits0.0518
Tokens d'entrée0.0252 cr
Tokens lus en cache0.0011 cr
Tokens de sortie0.0255 cr

Facturation minimale : 0.01 crédit par requête.

Guide budgétaire

Nombre approximatif de requêtes avec la répartition actuelle.
Ajouter des crédits
$10
Environ 13127 requêtes

Pour des tests rapides

$50
Environ 65637 requêtes

Pour le développement courant

$100
Environ 131274 requêtes

Pour l'évaluation en production

Tarifs des outils côté serveur

Seuls les appels côté serveur réussis sont facturés à l'appel ; les tentatives échouées n'ont pas de frais d'outil, mais les tokens restent facturés.
  • Recherche web$0.010/ appel0.68 cr / appel

GLM-5.3 FlashX pour les workflows multimodaux interactifs

Évaluez FlashX lorsque l’attente des réponses ralentit votre programmation ou votre agent. Flash propose des tokens moins chers ; mesurez si le temps gagné avec FlashX sur vos tâches justifie l’écart.

GLM-5.3 FlashX est servi sur EvoLink sous l'ID de modèle glm-5.3-flashx via Chat Completions · Responses · Anthropic Messages, avec la même clé API et le même solde que tous les autres modèles. Il offre une fenêtre de contexte de 1M et jusqu'à 131K tokens de sortie, ainsi que l'entrée d'images, l'analyse de longs documents, les agents multi-étapes.

GLM-5.3 FlashX

Spécifications et capacités de GLM-5.3 FlashX

Les chiffres proviennent de la configuration de route EvoLink ; les capacités sont celles que l'API expose aujourd'hui.

Fenêtre de contexte
1M tokens
Sortie max.
131K tokens
Entrée
Texte + images + vidéo + fichiers
Sortie
Texte · JSON (sortie structurée) · appels d'outils
Raisonnement
Raisonnement toujours actif
Usage d'outils
Appels de fonctions avec séquences d'outils multi-étapes
Cache de prompt
Lectures de cache automatiques à tarif réduit
Outils côté serveur
Recherche web, facturés par appel réussi
Protocoles
Chat Completions · Responses · Anthropic Messages
ID du modèle
glm-5.3-flashx

Les critères qui orientent le choix de FlashX

Mettez la vitesse en regard des entrées requises, de la qualité et du coût d’un résultat exploitable.

Une option axée sur la vitesse aux côtés de Flash

Z.ai positionne FlashX pour une inférence plus rapide. Cela ne prouve pas une meilleure qualité que Flash et ne garantit pas la latence d’EvoLink. Comparez avec les mêmes prompts, réglages de raisonnement et limites de sortie.

Des données multimodales dans un contexte long

Z.ai documente les entrées texte, image, vidéo et fichier avec un contexte de 1M de tokens. Consultez la documentation API pour les formats acceptés. Le modèle renvoie du texte ; les outils de l’agent créent les fichiers ou exécutent les actions.

Choisir ses modèles via une seule passerelle

Comparez les coûts avec EvoLink et conservez une intégration sur une passerelle API unifiée. Gardez Flash pour les tâches qui atteignent votre objectif qualité à moindre coût ; évaluez FlashX lorsque le délai de réponse compte.

Dans quels cas évaluer GLM-5.3 FlashX

Commencez par les tâches où une personne ou un autre outil attend la prochaine réponse du modèle.

Agents de programmation interactifs

Évaluez l’implémentation, le débogage et l’interprétation des résultats d’outils dans la même boucle d’agent. Mesurez le délai jusqu’à un résultat fonctionnel, exécution des outils et nouvelles tentatives comprises, plutôt que la seule vitesse de génération.

Développement à partir de captures

Utilisez des captures d’interface pour guider une modification de code ou expliquer un défaut visuel. Vérifiez la conformité à la référence et la prise en charge du format d’image par la route API choisie.

Documents nécessitant un retour immédiat

Évaluez l’extraction et les questions de suivi sur des documents associant texte et éléments visuels. Pour une classification hors ligne ou un traitement par lots sans urgence, comparez d’abord Flash, moins cher.

Choisir entre FlashX, Flash et GLM-5.3

EvoLink

Comparez les tarifs actuels ci-dessous. FlashX privilégie la vitesse ; Flash coûte moins par token. Mesurez la réussite des tâches et leur durée totale avant de changer de modèle.

GLM-5.3 FlashX
Entrée / Sortie$0.371 / $1.25
Contexte1M
CacheLectures de cache
Idéal pourAgents de programmation interactifs, analyse de captures, traitement de documents
GLM-5.3
Entrée / Sortie$1.4 / $4.4
Contexte1M
CacheLectures de cache
Idéal pourÉvaluez le modèle phare textuel pour les raisonnements exigeants. Une requête multimodale ne peut pas être transmise telle quelle à un modèle uniquement textuel.
GLM-5.3 Flash
Entrée / Sortie$0.15 / $0.5
Contexte1M
CacheLectures de cache
Idéal pourOption multimodale moins chère pour le traitement hors ligne et les tâches sensibles au coût. Comparez FlashX quand l’attente devient un frein, sans présumer d’un gain de précision.

Deux façons d'utiliser GLM-5.3 FlashX : API EvoLink ou Agent

Utilisez l'API EvoLink pour les backends produit et les traitements par lots, ou appelez GLM-5.3 FlashX depuis Codex, Claude ou Gemini pour vos workflows de code et d'analyse. Les deux voies partagent la même clé API EvoLink, le même solde, le même ID de modèle et le même historique de requêtes.

Option 1

Intégrer avec l'API EvoLink

Idéal pour : backends produit, traitements par lots, pipelines automatisés

Envoyez à EvoLink des requêtes Chat Completions compatibles OpenAI (ou Anthropic Messages) et contrôlez l'ID de modèle, le prompt système, le budget de sortie, les outils et la sortie structurée.

  1. 1Créez une clé API EvoLink dans la console
  2. 2Pointez votre SDK OpenAI ou Anthropic vers l'URL de base EvoLink et sélectionnez l'ID de modèle affiché ci-dessus
  3. 3Envoyez une requête représentative et lisez le champ usage pour les tokens d'entrée, en cache et de sortie
  4. 4Définissez max_tokens et les réessais par tâche ; conservez les ID et résultats des appels d'outils entre les tours
Option 2

L'appeler avec un Agent

Idéal pour : tâches de code, de revue et d'analyse dans Codex, Claude et Gemini

Donnez à l'Agent la tâche, les entrées à inclure et les critères d'acceptation. Il assemble la requête, appelle GLM-5.3 FlashX via EvoLink et renvoie la réponse avec la consommation de tokens.

  1. 1Définissez EVOLINK_API_KEY dans votre environnement local ; jamais dans le code ni dans un prompt
  2. 2Décrivez la tâche, les entrées à inclure et le format de sortie attendu
  3. 3Demandez à l'Agent d'appeler GLM-5.3 FlashX via EvoLink et d'afficher la requête avant l'envoi
  4. 4Laissez l'Agent rapporter la réponse, la consommation de tokens et tout corps d'erreur

Exemple de code API GLM-5.3 FlashX et gestion des erreurs

Cet exemple montre la requête exécutable la plus courte : un appel Chat Completions compatible OpenAI avec un prompt système, un message utilisateur et un budget de sortie. Ouvrez l'onglet API pour la référence complète des paramètres et réponses.

Voir la documentation API complète
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flashx",
    "messages": [
      { "role": "system", "content": "You extract structured data. Answer in JSON only." },
      { "role": "user", "content": "Extract the product, quantity, and unit price: 2 notebooks at $4.50 each." }
    ],
    "thinking": { "type": "enabled", "clear_thinking": false },
    "reasoning_effort": "low",
    "max_tokens": 4096,
    "temperature": 0.1
  }'

# Reasoning is always on for the 5.3 generation: do not send
# thinking.type "disabled". The same model ID works on /v1/messages
# (Anthropic Messages). The response includes choices[0].message and
# a usage object; image and video input is counted in prompt_tokens.

Requête invalide ou paramètre non pris en charge

Vérifiez l'ID de modèle, le tableau messages et les plages de paramètres dans la référence API ; retirez les champs que cette route ne prend pas en charge.

Problème d'authentification ou de solde

Vérifiez le jeton Bearer Authorization et confirmez le solde disponible dans la console.

Longueur de contexte dépassée

Les tokens du prompt dépassent la fenêtre de contexte de GLM-5.3 FlashX. Réduisez ou ne récupérez que les éléments pertinents et réutilisez les préfixes en cache.

Limite de débit (429)

Attendez et réessayez avec un délai aléatoire ; regroupez ou mettez en file d'attente les requêtes au lieu de rafales parallèles.

Contenu ou appel d'outil rejeté

Vérifiez le contenu sensible, les arguments d'appel d'outil mal formés et les écarts de schéma JSON avant de réessayer.

Estimer séparément les entrées, les sorties et le cache

Utilisez les tarifs actuels et le calculateur de cette page pour le même identifiant de modèle. Vérifiez l’usage renvoyé et la facturation sur des requêtes représentatives ; répéter un prompt ne garantit pas qu’un résultat soit trouvé dans le cache.

Mesurer la requête complète

Distinguez le délai du premier token, la vitesse de sortie, la durée totale, les nouvelles tentatives et le coût par résultat accepté. Le nombre de tokens par seconde annoncé par un fournisseur ne couvre pas toutes les étapes de votre application.

Famille de modèles GLM

Même clé API, même solde : changez de palier sans toucher à l’intégration.

GLM-5.3

GLM-5.3

Modèle de raisonnement phare de Z.ai

Voir le modèle
GLM-5.2

GLM-5.2

L’ancien vaisseau amiral GLM. Toujours pertinent pour les clients qui dépendent de la désactivation du raisonnement, que la génération 5.3 n’autorise plus.

Voir le modèle
GLM-5.3 Flash

GLM-5.3 Flash

Modèle multimodal haut volume de Z.ai

Voir le modèle

Autres modèles texte sur EvoLink en plus de GLM-5.3 FlashX

DeepSeek V4 Flash

DeepSeek V4 Flash

La route haut volume de DeepSeek, contexte 1M et lecture de cache très bon marché. La comparaison de coût la plus directe pour le texte en masse.

Voir le modèle
Gemini 3.7 Flash

Gemini 3.7 Flash

La route multimodale économique de Google — référence inter-fournisseurs utile quand la compréhension d’images et de documents dicte le choix.

Voir le modèle
Kimi K3

Kimi K3

La route de raisonnement à long contexte de Moonshot pour le code à l’échelle d’un dépôt et le multi-document.

Voir le modèle
GPT-5.6

GPT-5.6

La famille frontière d’OpenAI par paliers (Sol/Terra/Luna) pour arbitrer capacité, latence et coût.

Voir le modèle

Pour aller plus loin avec GLM-5.3 FlashX

GLM-5.3 Flash face à GLM-5.3

GLM-5.3 Flash face à GLM-5.3

Choisir la route selon la modalité, la difficulté et le coût par résultat accepté, avec une politique Flash-first et une escalade sélective.

Lire l’article
Une passerelle pour 3 CLI de code

Une passerelle pour 3 CLI de code

Chemins de configuration, variables d’environnement et check-list de dépannage pour faire passer plusieurs CLI par un seul endpoint.

Lire l’article

FAQ API GLM-5.3 FlashX

Qu’est-ce que GLM-5.3 FlashX ?

FlashX est l’option de Z.ai axée sur la vitesse dans la famille GLM-5.3 Flash, pour la programmation interactive et les agents multimodaux. Un prix par token plus élevé ne prouve pas une meilleure qualité de réponse.

Quel identifiant utilise cette page EvoLink ?

L’identifiant est glm-5.3-flashx. Consultez la documentation API liée sur cette page pour les formats de requête et paramètres propres à chaque endpoint.

Combien coûte l’API GLM-5.3 FlashX ?

La section tarifaire affiche les prix des entrées, sorties et lectures du cache de ce modèle. Estimez votre combinaison de tokens avec le calculateur puis vérifiez l’usage et la facture réels, sans appliquer les prix ou promotions d’un autre fournisseur.

Quand choisir FlashX plutôt que Flash ?

Évaluez FlashX si le délai de réponse limite un workflow interactif. Flash coûte moins par token et peut mieux convenir aux lots hors ligne. Comparez réussite, durée totale, nouvelles tentatives et coût avec les mêmes réglages.

EvoLink garantit-il 200 tokens/s ?

Cette page ne garantit aucune vitesse. Z.ai annonce 200 tokens/s pour FlashX : c’est une déclaration du fournisseur, pas un benchmark EvoLink ni un SLA. Mesurez séparément le délai du premier token et la durée complète de la requête.

Quelles entrées et sorties FlashX prend-il en charge ?

Z.ai indique des entrées texte, image, vidéo et fichier, avec une sortie textuelle. Vérifiez les formats de votre route dans la documentation API liée. Accepter des vidéos ou fichiers ne signifie pas que l’API génère directement des vidéos ou fichiers Office.

Peut-on désactiver le raisonnement ?

Z.ai documente uniquement thinking.type: enabled pour FlashX. Réduire reasoning_effort ne désactive pas le raisonnement. Z.ai recommande thinking.clear_thinking: false à l’intérieur de l’objet thinking ; vérifiez la prise en charge par votre route dans la documentation API.

Comment prévoir les coûts des médias et du cache ?

Vérifiez l’usage et la facturation de requêtes représentatives et appliquez les tarifs correspondants. Ne supposez ni un nombre fixe de tokens par image ni qu’un résultat soit trouvé dans le cache pour chaque prompt répété.

Quelle est la fenêtre de contexte de FlashX ?

Z.ai documente un contexte de 1M de tokens et une sortie maximale de 128K tokens. Consultez les spécifications et la documentation API avant de choisir une limite de sortie : contexte d’entrée et volume de sortie sont deux limites distinctes.

GLM-5.3 peut-il servir de modèle de secours ?

Évaluez-le pour les tâches textuelles compatibles qui échouent à vos critères d’acceptation. GLM-5.3 n’accepte pas les mêmes entrées multimodales : ne lui transmettez pas telles quelles des requêtes avec images, vidéos ou fichiers. Définissez d’abord le traitement des entrées, les coûts et les nouvelles tentatives.