API tous modèles GLM - Référence complète Chat Completions
- Appelez les modèles de la série GLM via le protocole OpenAI Chat Completions, le modèle précis étant choisi avec le paramètre
model - Traitement synchrone qui renvoie le contenu de la conversation en temps réel
- Conversation textuelle : conversation contextuelle à un ou plusieurs tours ;
glm-5.3-flashprend en plus en charge l’entrée image - Invite système : personnalisez le rôle et le comportement de l’IA via un message
role=system - Réflexion approfondie :
thinking.typecontrôle la chaîne de pensée etreasoning_effortrègle l’intensité du raisonnement ; le raisonnement est renvoyé dansreasoning_content - Streaming : les réponses en flux SSE sont prises en charge (
stream=true) - Appels d’outils : Function Calling et recherche web pris en charge (
web_search, jusqu’à 128 outils) - Sortie structurée : activez le mode JSON via
response_format
À propos des réponses en streaming : avec stream=true, les résultats arrivent par Server-Sent Events, chaque message ayant le format data: {JSON}, le flux se terminant par data: [DONE]. Chaque bloc de données (ChatCompletionChunk) contient id, created, model, choices et, en option, usage et content_filter ; à l’intérieur, choices[].delta renvoie de façon incrémentale role / content / reasoning_content / tool_calls, et choices[].finish_reason indique le motif d’arrêt dans le dernier bloc.
https://direct.evolink.ai, qui offre une meilleure prise en charge des modèles textuels et des connexions de longue durée. https://api.evolink.ai est le point de terminaison principal pour les services multimodaux et sert d’adresse de repli pour les modèles textuels.glm-5.3 et glm-5.3-flash réfléchissent toujours et ne peuvent pas être désactivés ; pour reasoning_effort, les trois niveaux low / high / max prennent effet et les autres sont rétrogradés automatiquement vers le niveau disponible le plus proche (xhigh → max, medium → high, minimal / none → low, la réflexion se poursuit et est facturée en sortie). glm-5.2 peut désactiver la réflexion via thinking.type: "disabled" et prend en charge davantage de niveaux de raisonnement. Voir les descriptions des champs thinking et reasoning_effort pour le détail.glm-5.3-flash, via des blocs de contenu image_url dans messages[].content[]. Envoyer des blocs image à un autre modèle renvoie une erreur.Autorisations
##Toutes les API nécessitent une authentification par Bearer Token##
Obtenir une clé API :
Visitez la page de gestion des clés API pour obtenir votre clé API
Ajouter à l'en-tête de requête :
Corps
Modèle à appeler :
glm-5.3, glm-5.3-flash, glm-5.2 "glm-5.3"
Liste des messages de la conversation, contenant l'intégralité du contexte de la conversation en cours
Prend en charge quatre rôles : system, user, assistant, tool. Les messages de rôles différents ont des structures de champs différentes ; sélectionnez le rôle correspondant pour le consulter. Doit contenir au moins 1 message, et ne peut pas contenir uniquement des messages système ou des messages de l'assistant.
1- System Message
- User Message
- Assistant Message
- Tool Message
Indique s'il faut activer le mode de sortie en streaming
false: le modèle génère la réponse complète puis la renvoie en une seule fois (par défaut), adapté aux textes courts et au traitement par lotstrue: renvoie le contenu en temps réel bloc par bloc via Server-Sent Events (SSE), adapté au chat et aux textes longs ;data: [DONE]est renvoyé à la fin du flux
false
Contrôle l'activation de la chaîne de pensée (Chain of Thought)
Contrôle l'intensité du raisonnement du modèle ; n'agit que lorsque thinking est actif, max par défaut
Les valeurs prises en charge diffèrent selon le modèle :
La série glm-5.3 réfléchit toujours et seuls les trois niveaux low / high / max prennent réellement effet ; les quatre autres ne provoquent pas d'erreur mais sont rétrogradés automatiquement vers le niveau disponible le plus proche (xhigh → max, medium → high, minimal / none → low).
La série glm-5.3 ne peut pas désactiver la réflexion. Transmettre minimal ou none ne fait que descendre au niveau le plus bas, low : le modèle continue de produire des tokens de réflexion, facturés au tarif de sortie. Si vous utilisez ces deux niveaux pour réduire les coûts, notez la différence avec glm-5.2 : sur glm-5.2, ils suppriment réellement la réflexion.
Pour les tâches complexes comme la programmation, max est recommandé.
max, xhigh, high, medium, low, minimal, none "max"
Indique s'il faut activer la stratégie d'échantillonnage
true(par défaut) : utilisetemperature/top_ppour un échantillonnage aléatoire, sortie plus variéefalse: sélectionne toujours le mot le plus probable (décodage glouton), sortie plus déterministe ; dans ce cas,temperatureettop_psont ignorés
Pour les tâches nécessitant cohérence et reproductibilité (comme la génération de code, la traduction), il est recommandé de définir cette valeur sur false
true
Température d'échantillonnage, contrôle le caractère aléatoire et la créativité de la sortie
Remarques :
- Plage :
[0.0, 1.0], limitée à deux décimales - Valeurs plus élevées (par ex. 0.8) : plus aléatoire et plus créatif, adapté à l'écriture créative
- Valeurs plus basses (par ex. 0.2) : plus stable et plus déterministe, adapté aux questions factuelles et à la génération de code
- Valeur par défaut :
1.0
Recommandation : n'ajustez pas simultanément temperature et top_p
0 <= x <= 11
Paramètre d'échantillonnage par noyau (Nucleus Sampling), une méthode alternative à l'échantillonnage par temperature
Remarques :
- Plage :
[0.01, 1.0], limitée à deux décimales - Le modèle ne considère que les mots candidats dont la probabilité cumulée atteint
top_p; par exemple, 0.1 signifie ne considérer que les 10 % de mots les plus probables - Des valeurs plus petites produisent une sortie plus ciblée et plus cohérente ; des valeurs plus grandes augmentent la diversité
- Valeur par défaut :
0.95
Recommandation : n'ajustez pas simultanément temperature et top_p
0.01 <= x <= 10.95
Limite maximale du nombre de tokens de sortie du modèle
Remarque :
- La série GLM prend en charge jusqu'à 131 072 tokens (128K) en sortie ; il est conseillé de ne pas descendre sous
1024 - Lorsque
thinkingest actif, les tokens de la chaîne de pensée comptent aussi dans cette limite - Si la génération est tronquée pour cause de
length, essayez d'augmenter cette valeur
1 <= x <= 1310721024
Liste des outils que le modèle peut appeler
Remarque :
- L'appel de fonctions (
function) et la recherche web (web_search) sont pris en charge - Jusqu'à 128 fonctions
- Parmi eux,
web_searchest facturé séparément à l'appel lorsqu'une recherche a effectivement lieu ; les autres outils n'entraînent pas de frais supplémentaires
128- Outil Function
- Outil Web Search (recherche web)
Contrôle la manière dont le modèle choisit quelle fonction appeler
Remarques : n'a d'effet que lorsque le type d'outil est function, par défaut et uniquement auto est pris en charge (le modèle décide automatiquement s'il faut appeler un outil)
auto "auto"
Liste des mots d'arrêt
Remarques :
- Lorsque le texte généré par le modèle rencontre la chaîne spécifiée, la génération s'arrête immédiatement (le mot d'arrêt lui-même n'est pas inclus dans le texte renvoyé)
- Actuellement, un seul mot d'arrêt est pris en charge, au format
["stop_word1"], par exemple["Human:"]
4Spécifie le format de sortie de la réponse du modèle, par défaut text
Remarques :
{ "type": "json_object" }active le mode JSON, le modèle renvoie des données au format JSON valide, adapté aux scénarios d'extraction de données structurées, etc.- Lors de l'utilisation du mode JSON, il est recommandé de demander explicitement une sortie JSON dans le message
systemouuser
Identifiant unique de la requête
Remarques :
- Transmis par le client, longueur de 6 à 64 caractères, il est recommandé d'utiliser le format UUID pour garantir l'unicité
- S'il n'est pas fourni, la plateforme le génère automatiquement
6 - 64"req-7f3a2c1e8b9d4f0a"
Identifiant unique de l'utilisateur final
Remarques : longueur de 6 à 128 caractères, il est recommandé d'utiliser un identifiant unique ne contenant pas d'informations sensibles ; cela peut aider la plateforme à surveiller et détecter les comportements abusifs
6 - 128"user-abc123456"
Réponse
Génération de conversation réussie
ID de la tâche
"chatcmpl-a6613b56-c61c-94ba-9a9f-43d4cdc7d77a"
Type de réponse
chat.completion "chat.completion"
ID de la requête (retransmis lorsque request_id est fourni dans la requête)
"req-7f3a2c1e8b9d4f0a"
Heure de création de la requête, horodatage Unix (secondes)
1777021417
Nom du modèle
"glm-5.3"
Liste des réponses du modèle
Statistiques d'utilisation des tokens renvoyées à la fin de l'appel
Informations relatives à la recherche web, renvoyées lors de l'utilisation de l'outil web_search et qu'une recherche est effectuée
Informations relatives à la sécurité du contenu