curl --request POST \
--url https://direct.evolink.ai/v1/messages \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"max_tokens": 1024,
"messages": [
{
"role": "user",
"content": "Bonjour, le monde"
}
]
}
'{
"id": "msg_0842a705-9d0b-4eaa-b12d-09a4106326c5",
"type": "message",
"role": "assistant",
"model": "glm-5.3",
"content": [
{
"type": "thinking",
"thinking": "L'utilisateur demande de saluer en un seul mot, il suffit de répondre « Hi ».",
"signature": ""
},
{
"type": "text",
"text": "Hi."
}
],
"stop_reason": "end_turn",
"usage": {
"input_tokens": 18,
"output_tokens": 101,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"prompt_tokens_details": {
"cached_tokens": 0
}
}
}API tous modèles GLM - Référence complète Messages
- Appelez les modèles de la série GLM via le protocole Anthropic Messages, le modèle précis étant choisi avec le paramètre
model - Les structures de requête et de réponse sont alignées sur l’API Anthropic
- Invite système : transmise via le champ
systemde premier niveau - Mode réflexion : la réflexion est active par défaut sur toute la série et renvoyée dans des blocs
content[type=thinking]; seulglm-5.2peut la désactiver avecthinking.type=disabled - Streaming : flux d’événements SSE
- Appels d’outils : compatible avec le flux
tool_use/tool_resultd’Anthropic - Entrée image : prise en charge uniquement par
glm-5.3-flashetglm-5.3-flashx, voir le champmessagespour le détail
curl --request POST \
--url https://direct.evolink.ai/v1/messages \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"max_tokens": 1024,
"messages": [
{
"role": "user",
"content": "Bonjour, le monde"
}
]
}
'{
"id": "msg_0842a705-9d0b-4eaa-b12d-09a4106326c5",
"type": "message",
"role": "assistant",
"model": "glm-5.3",
"content": [
{
"type": "thinking",
"thinking": "L'utilisateur demande de saluer en un seul mot, il suffit de répondre « Hi ».",
"signature": ""
},
{
"type": "text",
"text": "Hi."
}
],
"stop_reason": "end_turn",
"usage": {
"input_tokens": 18,
"output_tokens": 101,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"prompt_tokens_details": {
"cached_tokens": 0
}
}
}https://direct.evolink.ai, qui offre une meilleure prise en charge des modèles textuels et des connexions de longue durée. https://api.evolink.ai est le point de terminaison principal pour les services multimodaux et sert d’adresse de repli pour les modèles textuels.thinking de la réponse sont facturés comme tokens de sortie ; signature peut être vide.glm-5.2:thinking.type=disableddésactive la réflexion.glm-5.3/glm-5.3-flash/glm-5.3-flashx: la réflexion reste active.disabledconserve le mode par défaut et la facturation des tokens de réflexion en sortie.
thinking.budget_tokens et thinking.effort ne définissent pas le niveau de réflexion de GLM. Consultez reasoning_effort à la racine pour les valeurs compatibles. Un réglage qui désactive la réflexion sur glm-5.2 ne la désactive plus après le passage à la série 5.3.reasoning_effort: Champ de compatibilité des niveaux GLM à la racine de la requête, hors de thinking. L’endpoint l’accepte, mais ne garantit pas qu’il contrôle l’effort réel de réflexion.
Règles de compatibilité de glm-5.3 / glm-5.3-flash / glm-5.3-flashx
| Valeur fournie | Valeur compatible |
|---|---|
low / high / max | Inchangé |
xhigh | max |
medium | high |
minimal / none | low ; réflexion toujours active |
minimal et none ne désactivent pas la réflexion de la série 5.3. Les tokens de réflexion sont facturés en sortie. Les valeurs inconnues restent inchangées, sans correspondance de compatibilité ; utilisez les valeurs indiquées. Ces correspondances ne s’appliquent pas à glm-5.2.
Pour contrôler l’effort, utilisez reasoning_effort dans Chat Completions ou reasoning.effort dans Responses.
glm-5.3-flash et glm-5.3-flashx acceptent les images. Des blocs image envoyés à glm-5.3 ou glm-5.2 peuvent renvoyer 200 alors que le modèle ne les lit pas. Pour la compréhension d’image, choisissez un modèle compatible.Autorisations
##Toutes les API nécessitent une authentification par Bearer Token##
Obtenir une clé API :
Visitez la page de gestion des clés API pour obtenir votre clé API
Ajouter à l'en-tête de requête :
Authorization: Bearer YOUR_API_KEY
Remarque : EvoLink applique une authentification unifiée par Bearer Token pour /v1/messages.
Corps
Modèle à appeler :
| ID du modèle | Positionnement | Réflexion désactivable | Entrée image |
|---|---|---|---|
glm-5.3 | Modèle phare, progression générale sur l'ingénierie logicielle complexe et les tâches d'agent ; contexte de 1M | Non désactivable | Non prise en charge |
glm-5.3-flash | Modèle multimodal léger, coût très faible et vision native ; contexte de 1M | Non désactivable | Prise en charge |
glm-5.3-flashx | Modèle multimodal avec entrée image ; contexte de 1M | Non désactivable | Prise en charge |
glm-5.2 | Modèle phare de la génération précédente, raisonnement complexe et contexte très long ; contexte de 1M | Désactivable (thinking.type=disabled) | Non prise en charge |
glm-5.3, glm-5.3-flash, glm-5.3-flashx, glm-5.2 "glm-5.3"
Messages de conversation alternant entre user et assistant. Incluez au moins un message ; le dernier a généralement role=user. Les messages précédents fournissent le contexte des échanges suivants.
Images : seuls glm-5.3-flash et glm-5.3-flashx acceptent des blocs image dans le tableau content. Utilisez uniquement du texte avec glm-5.3 et glm-5.2. Une réponse HTTP 200 ne signifie pas que ces modèles ont lu l’image.
1Show child attributes
Show child attributes
Limite supérieure de la longueur du contenu généré (en tokens)
Remarque :
- La série GLM prend en charge jusqu'à 131 072 tokens (128K) en sortie ; il est conseillé de ne pas descendre sous
1024 - Les tokens produits par thinking comptent également dans cette limite
- Une fois la limite atteinte, le contenu est tronqué et la réponse porte
stop_reason=max_tokens
1 <= x <= 1310721024
Invite système, utilisée pour définir le rôle et le comportement de l'IA
Remarques :
- Prend en charge une chaîne ou un tableau de blocs de contenu
- Transmise via le champ
systemde premier niveau (ne pas la placer dans messages) - Le modèle respecte les contraintes du system
- Un system trop long peut être tronqué : pour un long contexte, placez-le dans
messages, n'entassez pas tout danssystem
"You are a helpful assistant."
Température d'échantillonnage
Remarques :
- Plus la valeur est élevée, plus la sortie est variée ; plus elle est basse, plus elle est déterministe
- Plage recommandée
[0, 1]
0 <= x <= 11
Seuil d'échantillonnage par noyau
Remarques :
- Plage
[0, 1] - Il est recommandé de ne pas ajuster simultanément temperature et top_p
0 <= x <= 10.9
N'échantillonne que parmi les K tokens les plus probables (paramètre propre à Anthropic)
Remarques :
- Plus la valeur est petite, plus la sortie est déterministe ; plus elle est grande, plus les candidats sont diversifiés
x >= 010
Séquences d'arrêt personnalisées : la génération s'arrête lorsque l'une de ces chaînes est rencontrée
Remarques :
- L'arrêt intervient dès la rencontre, le contenu situé avant est renvoyé normalement
- Attention : lorsqu'une séquence d'arrêt est rencontrée, le
stop_reasonde la série GLM renvoieend_turn(et non la valeur standard Anthropicstop_sequence), et la réponse ne contient pas non plus de champstop_sequence. Si le client se fie àstop_reason=="stop_sequence"pour détecter la rencontre, un traitement particulier est nécessaire
["\n\n"]
Indique s'il faut renvoyer en streaming SSE
true: renvoi en streaming via Server-Sent Events (séquence d'événements Anthropic standard : message_start / content_block_start / content_block_delta / message_delta / message_stop)false: renvoi en une seule fois après la réponse complète (par défaut)
false
Paramètres de réflexion. Tous les modèles réfléchissent par défaut. Les blocs thinking de la réponse sont facturés comme tokens de sortie ; signature peut être vide.
- glm-5.2 : thinking.type=disabled désactive la réflexion.
- glm-5.3 / glm-5.3-flash / glm-5.3-flashx : la réflexion reste active. disabled conserve le mode par défaut et la facturation des tokens de réflexion en sortie.
thinking.budget_tokens et thinking.effort ne définissent pas le niveau de réflexion de GLM. Consultez reasoning_effort à la racine pour les valeurs compatibles. Un réglage qui désactive la réflexion sur glm-5.2 ne la désactive plus après le passage à la série 5.3.
Show child attributes
Show child attributes
Champ de compatibilité des niveaux GLM à la racine de la requête, hors de thinking. L’endpoint l’accepte, mais ne garantit pas qu’il contrôle l’effort réel de réflexion.
Règles de compatibilité de glm-5.3 / glm-5.3-flash / glm-5.3-flashx
| Valeur fournie | Valeur compatible |
|---|---|
low / high / max | Inchangé |
xhigh | max |
medium | high |
minimal / none | low ; réflexion toujours active |
minimal et none ne désactivent pas la réflexion de la série 5.3. Les tokens de réflexion sont facturés en sortie. Les valeurs inconnues restent inchangées, sans correspondance de compatibilité ; utilisez les valeurs indiquées. Ces correspondances ne s’appliquent pas à glm-5.2.
Pour contrôler l’effort, utilisez reasoning_effort dans Chat Completions ou reasoning.effort dans Responses.
max, xhigh, high, medium, low, minimal, none Liste des définitions d'outils
Remarques :
- Respecte les spécifications de définition d'outil Anthropic
input_schemautilise un objet JSON Schema- Le modèle renvoie un bloc
tool_usestandard, avecstop_reason=tool_use
Show child attributes
Show child attributes
Stratégie de sélection d'outil
Show child attributes
Show child attributes
Métadonnées de la requête
Show child attributes
Show child attributes
Réponse
Objet message
Réponse de message au style Anthropic
ID unique du message (format : msg_<uuid>)
Type d'objet de réponse
message assistant Modèle réellement utilisé
"glm-5.3"
Liste des blocs de contenu de la réponse
Types de blocs possibles :
thinking: processus de raisonnement (lorsque la réflexion est activée, par défaut)text: texte de la réponse finaletool_use: appel d'outil initié par le modèle
Show child attributes
Show child attributes
Raison de l'arrêt
end_turn: fin naturelle (renvoyé également lorsqu'une séquence stop_sequences est rencontrée)max_tokens: limite max_tokens atteintetool_use: le modèle a déclenché un appel d'outil
end_turn, max_tokens, tool_use Statistiques d'utilisation des tokens (spécification Anthropic)
Show child attributes
Show child attributes