Skip to main content
POST
BaseURL : la BaseURL par défaut est https://direct.evolink.ai, qui offre une meilleure prise en charge des modèles textuels et des connexions de longue durée. https://api.evolink.ai est le point de terminaison principal pour les services multimodaux et sert d’adresse de repli pour les modèles textuels.
Activation de la réflexion. enabled l’active et constitue la valeur par défaut de tous les modèles. disabled ne la désactive que sur glm-5.2.glm-5.3, glm-5.3-flash et glm-5.3-flashx réfléchissent toujours. disabled conserve le mode par défaut : il ne désactive pas la réflexion et ne définit pas l’effort sur low. Utilisez reasoning_effort=low pour réduire l’effort. Après le passage de glm-5.2 à la série 5.3, la réflexion reste active et ses tokens sont facturés en sortie, même si thinking.type=disabled est conservé.
reasoning_effort: Effort de raisonnement, max par défaut. Règles de compatibilité de glm-5.3 / glm-5.3-flash / glm-5.3-flashx minimal et none ne désactivent pas la réflexion de la série 5.3. Les tokens de réflexion sont facturés en sortie. Les valeurs inconnues restent inchangées, sans correspondance de compatibilité ; utilisez les valeurs indiquées. Ces correspondances ne s’appliquent pas à glm-5.2. glm-5.2 accepte max, xhigh, high, medium, low, minimal et none. xhigh équivaut à max ; medium / low équivalent à high ; minimal / none peuvent désactiver la réflexion. thinking.type=disabled permet aussi de la désactiver. Utilisez max pour les tâches complexes comme la programmation.
Contenu du message utilisateur.
  • Chaîne : texte brut, pris en charge par tous les modèles
  • Tableau de blocs de contenu : texte et images mélangés, pris en charge uniquement par glm-5.3-flash et glm-5.3-flashx
Envoyer des blocs de contenu image à glm-5.3 ou glm-5.2 renvoie une erreur.

Autorisations

Authorization
string
header
requis

##Toutes les API nécessitent une authentification par Bearer Token##

Obtenir une clé API :

Visitez la page de gestion des clés API pour obtenir votre clé API

Ajouter à l'en-tête de requête :

Corps

application/json
model
enum<string>
défaut:glm-5.3
requis

Modèle à appeler :

Options disponibles:
glm-5.3,
glm-5.3-flash,
glm-5.3-flashx,
glm-5.2
Exemple:

"glm-5.3"

messages
(System Message · object | User Message · object | Assistant Message · object | Tool Message · object)[]
requis

Liste des messages de la conversation, contenant l'intégralité du contexte de la conversation en cours

Prend en charge quatre rôles : system, user, assistant, tool. Les messages de rôles différents ont des structures de champs différentes ; sélectionnez le rôle correspondant pour le consulter. Doit contenir au moins 1 message, et ne peut pas contenir uniquement des messages système ou des messages de l'assistant.

Minimum array length: 1
stream
boolean
défaut:false

Indique s'il faut activer le mode de sortie en streaming

  • false : le modèle génère la réponse complète puis la renvoie en une seule fois (par défaut), adapté aux textes courts et au traitement par lots
  • true : renvoie le contenu en temps réel bloc par bloc via Server-Sent Events (SSE), adapté au chat et aux textes longs ; data: [DONE] est renvoyé à la fin du flux
Exemple:

false

thinking
object

Contrôle l'activation de la chaîne de pensée (Chain of Thought)

reasoning_effort
enum<string>
défaut:max

Effort de raisonnement, max par défaut.

Règles de compatibilité de glm-5.3 / glm-5.3-flash / glm-5.3-flashx

minimal et none ne désactivent pas la réflexion de la série 5.3. Les tokens de réflexion sont facturés en sortie. Les valeurs inconnues restent inchangées, sans correspondance de compatibilité ; utilisez les valeurs indiquées. Ces correspondances ne s’appliquent pas à glm-5.2.

glm-5.2 accepte max, xhigh, high, medium, low, minimal et none. xhigh équivaut à max ; medium / low équivalent à high ; minimal / none peuvent désactiver la réflexion. thinking.type=disabled permet aussi de la désactiver. Utilisez max pour les tâches complexes comme la programmation.

Options disponibles:
max,
xhigh,
high,
medium,
low,
minimal,
none
Exemple:

"max"

do_sample
boolean
défaut:true

Indique s'il faut activer la stratégie d'échantillonnage

  • true (par défaut) : utilise temperature / top_p pour un échantillonnage aléatoire, sortie plus variée
  • false : sélectionne toujours le mot le plus probable (décodage glouton), sortie plus déterministe ; dans ce cas, temperature et top_p sont ignorés

Pour les tâches nécessitant cohérence et reproductibilité (comme la génération de code, la traduction), il est recommandé de définir cette valeur sur false

Exemple:

true

temperature
number<float>
défaut:1

Température d'échantillonnage, contrôle le caractère aléatoire et la créativité de la sortie

Remarques :

  • Plage : [0.0, 1.0], limitée à deux décimales
  • Valeurs plus élevées (par ex. 0.8) : plus aléatoire et plus créatif, adapté à l'écriture créative
  • Valeurs plus basses (par ex. 0.2) : plus stable et plus déterministe, adapté aux questions factuelles et à la génération de code
  • Valeur par défaut : 1.0

Recommandation : n'ajustez pas simultanément temperature et top_p

Plage requise: 0 <= x <= 1
Exemple:

1

top_p
number<float>
défaut:0.95

Paramètre d'échantillonnage par noyau (Nucleus Sampling), une méthode alternative à l'échantillonnage par temperature

Remarques :

  • Plage : [0.01, 1.0], limitée à deux décimales
  • Le modèle ne considère que les mots candidats dont la probabilité cumulée atteint top_p ; par exemple, 0.1 signifie ne considérer que les 10 % de mots les plus probables
  • Des valeurs plus petites produisent une sortie plus ciblée et plus cohérente ; des valeurs plus grandes augmentent la diversité
  • Valeur par défaut : 0.95

Recommandation : n'ajustez pas simultanément temperature et top_p

Plage requise: 0.01 <= x <= 1
Exemple:

0.95

max_tokens
integer

Limite maximale du nombre de tokens de sortie du modèle

Remarque :

  • La série GLM prend en charge jusqu'à 131 072 tokens (128K) en sortie ; il est conseillé de ne pas descendre sous 1024
  • Lorsque thinking est actif, les tokens de la chaîne de pensée comptent aussi dans cette limite
  • Si la génération est tronquée pour cause de length, essayez d'augmenter cette valeur
Plage requise: 1 <= x <= 131072
Exemple:

1024

tools
(Outil Function · object | Outil Web Search (recherche web) · object)[]

Liste des outils que le modèle peut appeler

Remarque :

  • L'appel de fonctions (function) et la recherche web (web_search) sont pris en charge
  • Jusqu'à 128 fonctions
  • Parmi eux, web_search est facturé séparément à l'appel lorsqu'une recherche a effectivement lieu ; les autres outils n'entraînent pas de frais supplémentaires
Maximum array length: 128
tool_choice
enum<string>
défaut:auto

Contrôle la manière dont le modèle choisit quelle fonction appeler

Remarques : n'a d'effet que lorsque le type d'outil est function, par défaut et uniquement auto est pris en charge (le modèle décide automatiquement s'il faut appeler un outil)

Options disponibles:
auto
Exemple:

"auto"

stop
string[]

Liste des mots d'arrêt

Remarques :

  • Lorsque le texte généré par le modèle rencontre la chaîne spécifiée, la génération s'arrête immédiatement (le mot d'arrêt lui-même n'est pas inclus dans le texte renvoyé)
  • Actuellement, un seul mot d'arrêt est pris en charge, au format ["stop_word1"], par exemple ["Human:"]
Maximum array length: 4
Exemple:
response_format
object

Spécifie le format de sortie de la réponse du modèle, par défaut text

Remarques :

  • { "type": "json_object" } active le mode JSON, le modèle renvoie des données au format JSON valide, adapté aux scénarios d'extraction de données structurées, etc.
  • Lors de l'utilisation du mode JSON, il est recommandé de demander explicitement une sortie JSON dans le message system ou user
request_id
string

Identifiant unique de la requête

Remarques :

  • Transmis par le client, longueur de 6 à 64 caractères, il est recommandé d'utiliser le format UUID pour garantir l'unicité
  • S'il n'est pas fourni, la plateforme le génère automatiquement
Required string length: 6 - 64
Exemple:

"req-7f3a2c1e8b9d4f0a"

user_id
string

Identifiant unique de l'utilisateur final

Remarques : longueur de 6 à 128 caractères, il est recommandé d'utiliser un identifiant unique ne contenant pas d'informations sensibles ; cela peut aider la plateforme à surveiller et détecter les comportements abusifs

Required string length: 6 - 128
Exemple:

"user-abc123456"

Réponse

Génération de conversation réussie

id
string

ID de la tâche

Exemple:

"chatcmpl-a6613b56-c61c-94ba-9a9f-43d4cdc7d77a"

object
enum<string>

Type de réponse

Options disponibles:
chat.completion
Exemple:

"chat.completion"

request_id
string

ID de la requête (retransmis lorsque request_id est fourni dans la requête)

Exemple:

"req-7f3a2c1e8b9d4f0a"

created
integer

Heure de création de la requête, horodatage Unix (secondes)

Exemple:

1777021417

model
string

Nom du modèle

Exemple:

"glm-5.3"

choices
object[]

Liste des réponses du modèle

usage
object

Statistiques d'utilisation des tokens renvoyées à la fin de l'appel

Informations relatives à la recherche web, renvoyées lors de l'utilisation de l'outil web_search et qu'une recherche est effectuée

content_filter
object[]

Informations relatives à la sécurité du contenu