Skip to main content
POST
BaseURL : la BaseURL par défaut est https://direct.evolink.ai, qui offre une meilleure prise en charge des modèles textuels et des connexions de longue durée. https://api.evolink.ai est le point de terminaison principal pour les services multimodaux et sert d’adresse de repli pour les modèles textuels.
Paramètres de réflexion. Tous les modèles réfléchissent par défaut. Les blocs thinking de la réponse sont facturés comme tokens de sortie ; signature peut être vide.
  • glm-5.2 : thinking.type=disabled désactive la réflexion.
  • glm-5.3 / glm-5.3-flash / glm-5.3-flashx : la réflexion reste active. disabled conserve le mode par défaut et la facturation des tokens de réflexion en sortie.
thinking.budget_tokens et thinking.effort ne définissent pas le niveau de réflexion de GLM. Consultez reasoning_effort à la racine pour les valeurs compatibles. Un réglage qui désactive la réflexion sur glm-5.2 ne la désactive plus après le passage à la série 5.3.
reasoning_effort: Champ de compatibilité des niveaux GLM à la racine de la requête, hors de thinking. L’endpoint l’accepte, mais ne garantit pas qu’il contrôle l’effort réel de réflexion. Règles de compatibilité de glm-5.3 / glm-5.3-flash / glm-5.3-flashx minimal et none ne désactivent pas la réflexion de la série 5.3. Les tokens de réflexion sont facturés en sortie. Les valeurs inconnues restent inchangées, sans correspondance de compatibilité ; utilisez les valeurs indiquées. Ces correspondances ne s’appliquent pas à glm-5.2. Pour contrôler l’effort, utilisez reasoning_effort dans Chat Completions ou reasoning.effort dans Responses.
Seuls glm-5.3-flash et glm-5.3-flashx acceptent les images. Des blocs image envoyés à glm-5.3 ou glm-5.2 peuvent renvoyer 200 alors que le modèle ne les lit pas. Pour la compréhension d’image, choisissez un modèle compatible.

Autorisations

Authorization
string
header
requis

##Toutes les API nécessitent une authentification par Bearer Token##

Obtenir une clé API :

Visitez la page de gestion des clés API pour obtenir votre clé API

Ajouter à l'en-tête de requête :

Remarque : EvoLink applique une authentification unifiée par Bearer Token pour /v1/messages.

Corps

application/json
model
enum<string>
défaut:glm-5.3
requis

Modèle à appeler :

Options disponibles:
glm-5.3,
glm-5.3-flash,
glm-5.3-flashx,
glm-5.2
Exemple:

"glm-5.3"

messages
object[]
requis

Messages de conversation alternant entre user et assistant. Incluez au moins un message ; le dernier a généralement role=user. Les messages précédents fournissent le contexte des échanges suivants.

Images : seuls glm-5.3-flash et glm-5.3-flashx acceptent des blocs image dans le tableau content. Utilisez uniquement du texte avec glm-5.3 et glm-5.2. Une réponse HTTP 200 ne signifie pas que ces modèles ont lu l’image.

Minimum array length: 1
max_tokens
integer

Limite supérieure de la longueur du contenu généré (en tokens)

Remarque :

  • La série GLM prend en charge jusqu'à 131 072 tokens (128K) en sortie ; il est conseillé de ne pas descendre sous 1024
  • Les tokens produits par thinking comptent également dans cette limite
  • Une fois la limite atteinte, le contenu est tronqué et la réponse porte stop_reason=max_tokens
Plage requise: 1 <= x <= 131072
Exemple:

1024

system

Invite système, utilisée pour définir le rôle et le comportement de l'IA

Remarques :

  • Prend en charge une chaîne ou un tableau de blocs de contenu
  • Transmise via le champ system de premier niveau (ne pas la placer dans messages)
  • Le modèle respecte les contraintes du system
  • Un system trop long peut être tronqué : pour un long contexte, placez-le dans messages, n'entassez pas tout dans system
Exemple:

"You are a helpful assistant."

temperature
number

Température d'échantillonnage

Remarques :

  • Plus la valeur est élevée, plus la sortie est variée ; plus elle est basse, plus elle est déterministe
  • Plage recommandée [0, 1]
Plage requise: 0 <= x <= 1
Exemple:

1

top_p
number

Seuil d'échantillonnage par noyau

Remarques :

  • Plage [0, 1]
  • Il est recommandé de ne pas ajuster simultanément temperature et top_p
Plage requise: 0 <= x <= 1
Exemple:

0.9

top_k
integer

N'échantillonne que parmi les K tokens les plus probables (paramètre propre à Anthropic)

Remarques :

  • Plus la valeur est petite, plus la sortie est déterministe ; plus elle est grande, plus les candidats sont diversifiés
Plage requise: x >= 0
Exemple:

10

stop_sequences
string[]

Séquences d'arrêt personnalisées : la génération s'arrête lorsque l'une de ces chaînes est rencontrée

Remarques :

  • L'arrêt intervient dès la rencontre, le contenu situé avant est renvoyé normalement
  • Attention : lorsqu'une séquence d'arrêt est rencontrée, le stop_reason de la série GLM renvoie end_turn (et non la valeur standard Anthropic stop_sequence), et la réponse ne contient pas non plus de champ stop_sequence. Si le client se fie à stop_reason=="stop_sequence" pour détecter la rencontre, un traitement particulier est nécessaire
Exemple:
stream
boolean
défaut:false

Indique s'il faut renvoyer en streaming SSE

  • true : renvoi en streaming via Server-Sent Events (séquence d'événements Anthropic standard : message_start / content_block_start / content_block_delta / message_delta / message_stop)
  • false : renvoi en une seule fois après la réponse complète (par défaut)
Exemple:

false

thinking
object

Paramètres de réflexion. Tous les modèles réfléchissent par défaut. Les blocs thinking de la réponse sont facturés comme tokens de sortie ; signature peut être vide.

  • glm-5.2 : thinking.type=disabled désactive la réflexion.
  • glm-5.3 / glm-5.3-flash / glm-5.3-flashx : la réflexion reste active. disabled conserve le mode par défaut et la facturation des tokens de réflexion en sortie.

thinking.budget_tokens et thinking.effort ne définissent pas le niveau de réflexion de GLM. Consultez reasoning_effort à la racine pour les valeurs compatibles. Un réglage qui désactive la réflexion sur glm-5.2 ne la désactive plus après le passage à la série 5.3.

reasoning_effort
enum<string>

Champ de compatibilité des niveaux GLM à la racine de la requête, hors de thinking. L’endpoint l’accepte, mais ne garantit pas qu’il contrôle l’effort réel de réflexion.

Règles de compatibilité de glm-5.3 / glm-5.3-flash / glm-5.3-flashx

minimal et none ne désactivent pas la réflexion de la série 5.3. Les tokens de réflexion sont facturés en sortie. Les valeurs inconnues restent inchangées, sans correspondance de compatibilité ; utilisez les valeurs indiquées. Ces correspondances ne s’appliquent pas à glm-5.2.

Pour contrôler l’effort, utilisez reasoning_effort dans Chat Completions ou reasoning.effort dans Responses.

Options disponibles:
max,
xhigh,
high,
medium,
low,
minimal,
none
tools
object[]

Liste des définitions d'outils

Remarques :

  • Respecte les spécifications de définition d'outil Anthropic
  • input_schema utilise un objet JSON Schema
  • Le modèle renvoie un bloc tool_use standard, avec stop_reason=tool_use
tool_choice
object

Stratégie de sélection d'outil

metadata
object

Métadonnées de la requête

Réponse

Objet message

Réponse de message au style Anthropic

id
string

ID unique du message (format : msg_<uuid>)

type
enum<string>

Type d'objet de réponse

Options disponibles:
message
role
enum<string>
Options disponibles:
assistant
model
string

Modèle réellement utilisé

Exemple:

"glm-5.3"

content
object[]

Liste des blocs de contenu de la réponse

Types de blocs possibles :

  • thinking : processus de raisonnement (lorsque la réflexion est activée, par défaut)
  • text : texte de la réponse finale
  • tool_use : appel d'outil initié par le modèle
stop_reason
enum<string>

Raison de l'arrêt

  • end_turn : fin naturelle (renvoyé également lorsqu'une séquence stop_sequences est rencontrée)
  • max_tokens : limite max_tokens atteinte
  • tool_use : le modèle a déclenché un appel d'outil
Options disponibles:
end_turn,
max_tokens,
tool_use
usage
object

Statistiques d'utilisation des tokens (spécification Anthropic)