API tous modèles GLM - Référence complète Messages
- Appelez les modèles de la série GLM via le protocole Anthropic Messages, le modèle précis étant choisi avec le paramètre
model - Les structures de requête et de réponse sont alignées sur l’API Anthropic
- Invite système : transmise via le champ
systemde premier niveau - Mode réflexion : la réflexion est active par défaut sur toute la série et renvoyée dans des blocs
content[type=thinking]; seulglm-5.2peut la désactiver avecthinking.type=disabled - Streaming : flux d’événements SSE
- Appels d’outils : compatible avec le flux
tool_use/tool_resultd’Anthropic - Entrée image : réellement prise en charge uniquement par
glm-5.3-flash, voir le champmessagespour le détail
https://direct.evolink.ai, qui offre une meilleure prise en charge des modèles textuels et des connexions de longue durée. https://api.evolink.ai est le point de terminaison principal pour les services multimodaux et sert d’adresse de repli pour les modèles textuels.glm-5.2 prend en charge thinking.type: "disabled" ; glm-5.3 et glm-5.3-flash réfléchissent toujours et renvoient une erreur si disabled est transmis. Lors d’une migration depuis glm-5.2, retirez le disabled codé en dur avant de changer de modèle.Autorisations
##Toutes les API nécessitent une authentification par Bearer Token##
Obtenir une clé API :
Visitez la page de gestion des clés API pour obtenir votre clé API
Ajouter à l'en-tête de requête :
Remarque : EvoLink applique une authentification unifiée par Bearer Token pour /v1/messages.
Corps
Modèle à appeler :
glm-5.3, glm-5.3-flash, glm-5.2 "glm-5.3"
Liste des messages de la conversation, en alternance user / assistant
Remarque :
- Au moins un message est requis
- Le dernier message est normalement
role=user - Le contexte multi-tours est pris en charge et le modèle s'appuie sur l'historique
Entrée image : seul glm-5.3-flash la prend en charge, via un bloc {"type":"image","source":{...}} dans le tableau content.
Envoyer des blocs de contenu image à glm-5.3 ou glm-5.2 ne renvoie pas d'erreur, mais le modèle ne peut pas lire l'image. La requête retourne un 200 normal et le modèle répond à partir du seul texte : la réponse paraît plausible mais n'a aucun rapport avec l'image, et le résultat varie d'une requête à l'autre.
Ce type d'échec silencieux est difficile à diagnostiquer en production ; choisissez glm-5.3-flash lorsque vous avez besoin de compréhension d'image.
1Limite supérieure de la longueur du contenu généré (en tokens)
Remarque :
- La série GLM prend en charge jusqu'à 131 072 tokens (128K) en sortie ; il est conseillé de ne pas descendre sous
1024 - Les tokens produits par thinking comptent également dans cette limite
- Une fois la limite atteinte, le contenu est tronqué et la réponse porte
stop_reason=max_tokens
1 <= x <= 1310721024
Invite système, utilisée pour définir le rôle et le comportement de l'IA
Remarques :
- Prend en charge une chaîne ou un tableau de blocs de contenu
- Transmise via le champ
systemde premier niveau (ne pas la placer dans messages) - Le modèle respecte les contraintes du system
- Un system trop long peut être tronqué : pour un long contexte, placez-le dans
messages, n'entassez pas tout danssystem
"You are a helpful assistant."
Température d'échantillonnage
Remarques :
- Plus la valeur est élevée, plus la sortie est variée ; plus elle est basse, plus elle est déterministe
- Plage recommandée
[0, 1]
0 <= x <= 11
Seuil d'échantillonnage par noyau
Remarques :
- Plage
[0, 1] - Il est recommandé de ne pas ajuster simultanément temperature et top_p
0 <= x <= 10.9
N'échantillonne que parmi les K tokens les plus probables (paramètre propre à Anthropic)
Remarques :
- Plus la valeur est petite, plus la sortie est déterministe ; plus elle est grande, plus les candidats sont diversifiés
x >= 010
Séquences d'arrêt personnalisées : la génération s'arrête lorsque l'une de ces chaînes est rencontrée
Remarques :
- L'arrêt intervient dès la rencontre, le contenu situé avant est renvoyé normalement
- Attention : lorsqu'une séquence d'arrêt est rencontrée, le
stop_reasonde la série GLM renvoieend_turn(et non la valeur standard Anthropicstop_sequence), et la réponse ne contient pas non plus de champstop_sequence. Si le client se fie àstop_reason=="stop_sequence"pour détecter la rencontre, un traitement particulier est nécessaire
Indique s'il faut renvoyer en streaming SSE
true: renvoi en streaming via Server-Sent Events (séquence d'événements Anthropic standard : message_start / content_block_start / content_block_delta / message_delta / message_stop)false: renvoi en une seule fois après la réponse complète (par défaut)
false
Contrôle la réflexion approfondie
Remarque :
- Tous les modèles de la série GLM sont des modèles de raisonnement et, si ce champ est omis, la réflexion est active par défaut
- Lorsqu'elle est active, le tableau
contentde la réponse contient un bloc de raisonnementtype="thinking"(facturé en tokens de sortie ;signaturepeut être une chaîne vide) - Seul l'interrupteur binaire
typeagit : les paramètres de budget ou de niveau de réflexion tels quebudget_tokenseteffortsont sans effet (ils sont ignorés)
La possibilité de la désactiver dépend du modèle :
glm-5.2: envoyer{"type":"disabled"}désactive la réflexion et réduit nettement les tokens de sortieglm-5.3/glm-5.3-flash: réfléchissent toujours, non désactivable. Envoyerdisabledrenvoie une erreur
Conséquence : la série glm-5.3 ne peut pas réduire le coût de réflexion sur ce point de terminaison. Elle ne peut être ni désactivée (disabled renvoie une erreur),
ni réduite (budget_tokens et effort sont tous deux sans effet, et le reasoning_effort de premier niveau est un champ du protocole OpenAI que ce point de terminaison ignore).
Le contenu de réflexion étant facturé en tokens de sortie, ce coût est incompressible sur ce point de terminaison.
Pour maîtriser le coût de réflexion, passez à l'API Chat Completions —
là-bas, reasoning_effort dispose de trois niveaux réellement effectifs : low / high / max. glm-5.2 n'est pas concerné par cette limite : il peut désactiver la réflexion directement sur ce point de terminaison.
Migration depuis glm-5.2 : si votre code fixe thinking.type=disabled, vous devez retirer ce champ avant de passer à glm-5.3, sans quoi la requête échoue immédiatement.
Et si vous comptiez sur la désactivation de la réflexion pour maîtriser les coûts, ce point de terminaison n'offre aucun équivalent — prévoyez de basculer aussi vers l'API Chat Completions.
Liste des définitions d'outils
Remarques :
- Respecte les spécifications de définition d'outil Anthropic
input_schemautilise un objet JSON Schema- Le modèle renvoie un bloc
tool_usestandard, avecstop_reason=tool_use
Stratégie de sélection d'outil
Métadonnées de la requête
Réponse
Objet message
Réponse de message au style Anthropic
ID unique du message (format : msg_<uuid>)
Type d'objet de réponse
message assistant Modèle réellement utilisé
"glm-5.3"
Liste des blocs de contenu de la réponse
Types de blocs possibles :
thinking: processus de raisonnement (lorsque la réflexion est activée, par défaut)text: texte de la réponse finaletool_use: appel d'outil initié par le modèle
Raison de l'arrêt
end_turn: fin naturelle (renvoyé également lorsqu'une séquence stop_sequences est rencontrée)max_tokens: limite max_tokens atteintetool_use: le modèle a déclenché un appel d'outil
end_turn, max_tokens, tool_use Statistiques d'utilisation des tokens (spécification Anthropic)