Skip to main content
POST
BaseURL : la BaseURL par défaut est https://direct.evolink.ai, qui offre une meilleure prise en charge des modèles textuels et des connexions de longue durée. https://api.evolink.ai est le point de terminaison principal pour les services multimodaux et sert d’adresse de repli pour les modèles textuels.
La possibilité de désactiver la réflexion varie selon le modèle : seul glm-5.2 prend en charge thinking.type: "disabled" ; glm-5.3 et glm-5.3-flash réfléchissent toujours et renvoient une erreur si disabled est transmis. Lors d’une migration depuis glm-5.2, retirez le disabled codé en dur avant de changer de modèle.
L’entrée image n’est prise en charge que par glm-5.3-flash, et l’envoyer aux autres modèles ne déclenche aucune erreur. Lorsque des blocs de contenu image sont transmis à glm-5.3 ou glm-5.2, la requête retourne un 200 normal, mais le modèle ne peut pas lire l’image et répond à partir du seul texte : une réponse plausible en apparence, sans rapport avec l’image, et qui varie d’une requête à l’autre. Ce type d’échec silencieux est difficile à diagnostiquer en production ; choisissez glm-5.3-flash lorsque vous avez besoin de compréhension d’image.

Autorisations

Authorization
string
header
requis

##Toutes les API nécessitent une authentification par Bearer Token##

Obtenir une clé API :

Visitez la page de gestion des clés API pour obtenir votre clé API

Ajouter à l'en-tête de requête :

Remarque : EvoLink applique une authentification unifiée par Bearer Token pour /v1/messages.

Corps

application/json
model
enum<string>
défaut:glm-5.3
requis

Modèle à appeler :

Options disponibles:
glm-5.3,
glm-5.3-flash,
glm-5.2
Exemple:

"glm-5.3"

messages
object[]
requis

Liste des messages de la conversation, en alternance user / assistant

Remarque :

  • Au moins un message est requis
  • Le dernier message est normalement role=user
  • Le contexte multi-tours est pris en charge et le modèle s'appuie sur l'historique

Entrée image : seul glm-5.3-flash la prend en charge, via un bloc {"type":"image","source":{...}} dans le tableau content.

Envoyer des blocs de contenu image à glm-5.3 ou glm-5.2 ne renvoie pas d'erreur, mais le modèle ne peut pas lire l'image. La requête retourne un 200 normal et le modèle répond à partir du seul texte : la réponse paraît plausible mais n'a aucun rapport avec l'image, et le résultat varie d'une requête à l'autre.

Ce type d'échec silencieux est difficile à diagnostiquer en production ; choisissez glm-5.3-flash lorsque vous avez besoin de compréhension d'image.

Minimum array length: 1
max_tokens
integer

Limite supérieure de la longueur du contenu généré (en tokens)

Remarque :

  • La série GLM prend en charge jusqu'à 131 072 tokens (128K) en sortie ; il est conseillé de ne pas descendre sous 1024
  • Les tokens produits par thinking comptent également dans cette limite
  • Une fois la limite atteinte, le contenu est tronqué et la réponse porte stop_reason=max_tokens
Plage requise: 1 <= x <= 131072
Exemple:

1024

system

Invite système, utilisée pour définir le rôle et le comportement de l'IA

Remarques :

  • Prend en charge une chaîne ou un tableau de blocs de contenu
  • Transmise via le champ system de premier niveau (ne pas la placer dans messages)
  • Le modèle respecte les contraintes du system
  • Un system trop long peut être tronqué : pour un long contexte, placez-le dans messages, n'entassez pas tout dans system
Exemple:

"You are a helpful assistant."

temperature
number

Température d'échantillonnage

Remarques :

  • Plus la valeur est élevée, plus la sortie est variée ; plus elle est basse, plus elle est déterministe
  • Plage recommandée [0, 1]
Plage requise: 0 <= x <= 1
Exemple:

1

top_p
number

Seuil d'échantillonnage par noyau

Remarques :

  • Plage [0, 1]
  • Il est recommandé de ne pas ajuster simultanément temperature et top_p
Plage requise: 0 <= x <= 1
Exemple:

0.9

top_k
integer

N'échantillonne que parmi les K tokens les plus probables (paramètre propre à Anthropic)

Remarques :

  • Plus la valeur est petite, plus la sortie est déterministe ; plus elle est grande, plus les candidats sont diversifiés
Plage requise: x >= 0
Exemple:

10

stop_sequences
string[]

Séquences d'arrêt personnalisées : la génération s'arrête lorsque l'une de ces chaînes est rencontrée

Remarques :

  • L'arrêt intervient dès la rencontre, le contenu situé avant est renvoyé normalement
  • Attention : lorsqu'une séquence d'arrêt est rencontrée, le stop_reason de la série GLM renvoie end_turn (et non la valeur standard Anthropic stop_sequence), et la réponse ne contient pas non plus de champ stop_sequence. Si le client se fie à stop_reason=="stop_sequence" pour détecter la rencontre, un traitement particulier est nécessaire
Exemple:
stream
boolean
défaut:false

Indique s'il faut renvoyer en streaming SSE

  • true : renvoi en streaming via Server-Sent Events (séquence d'événements Anthropic standard : message_start / content_block_start / content_block_delta / message_delta / message_stop)
  • false : renvoi en une seule fois après la réponse complète (par défaut)
Exemple:

false

thinking
object

Contrôle la réflexion approfondie

Remarque :

  • Tous les modèles de la série GLM sont des modèles de raisonnement et, si ce champ est omis, la réflexion est active par défaut
  • Lorsqu'elle est active, le tableau content de la réponse contient un bloc de raisonnement type="thinking" (facturé en tokens de sortie ; signature peut être une chaîne vide)
  • Seul l'interrupteur binaire type agit : les paramètres de budget ou de niveau de réflexion tels que budget_tokens et effort sont sans effet (ils sont ignorés)

La possibilité de la désactiver dépend du modèle :

  • glm-5.2 : envoyer {"type":"disabled"} désactive la réflexion et réduit nettement les tokens de sortie
  • glm-5.3 / glm-5.3-flash : réfléchissent toujours, non désactivable. Envoyer disabled renvoie une erreur

Conséquence : la série glm-5.3 ne peut pas réduire le coût de réflexion sur ce point de terminaison. Elle ne peut être ni désactivée (disabled renvoie une erreur), ni réduite (budget_tokens et effort sont tous deux sans effet, et le reasoning_effort de premier niveau est un champ du protocole OpenAI que ce point de terminaison ignore). Le contenu de réflexion étant facturé en tokens de sortie, ce coût est incompressible sur ce point de terminaison.

Pour maîtriser le coût de réflexion, passez à l'API Chat Completions — là-bas, reasoning_effort dispose de trois niveaux réellement effectifs : low / high / max. glm-5.2 n'est pas concerné par cette limite : il peut désactiver la réflexion directement sur ce point de terminaison.

Migration depuis glm-5.2 : si votre code fixe thinking.type=disabled, vous devez retirer ce champ avant de passer à glm-5.3, sans quoi la requête échoue immédiatement. Et si vous comptiez sur la désactivation de la réflexion pour maîtriser les coûts, ce point de terminaison n'offre aucun équivalent — prévoyez de basculer aussi vers l'API Chat Completions.

tools
object[]

Liste des définitions d'outils

Remarques :

  • Respecte les spécifications de définition d'outil Anthropic
  • input_schema utilise un objet JSON Schema
  • Le modèle renvoie un bloc tool_use standard, avec stop_reason=tool_use
tool_choice
object

Stratégie de sélection d'outil

metadata
object

Métadonnées de la requête

Réponse

Objet message

Réponse de message au style Anthropic

id
string

ID unique du message (format : msg_<uuid>)

type
enum<string>

Type d'objet de réponse

Options disponibles:
message
role
enum<string>
Options disponibles:
assistant
model
string

Modèle réellement utilisé

Exemple:

"glm-5.3"

content
object[]

Liste des blocs de contenu de la réponse

Types de blocs possibles :

  • thinking : processus de raisonnement (lorsque la réflexion est activée, par défaut)
  • text : texte de la réponse finale
  • tool_use : appel d'outil initié par le modèle
stop_reason
enum<string>

Raison de l'arrêt

  • end_turn : fin naturelle (renvoyé également lorsqu'une séquence stop_sequences est rencontrée)
  • max_tokens : limite max_tokens atteinte
  • tool_use : le modèle a déclenché un appel d'outil
Options disponibles:
end_turn,
max_tokens,
tool_use
usage
object

Statistiques d'utilisation des tokens (spécification Anthropic)