Skip to main content
POST
BaseURL : la BaseURL par défaut est https://direct.evolink.ai, qui offre une meilleure prise en charge des modèles textuels et des connexions de longue durée. https://api.evolink.ai est le point de terminaison principal pour les services multimodaux et sert d’adresse de repli pour les modèles textuels.
Utilisez POST /v1/responses et choisissez le modèle avec model. Seuls model et input sont obligatoires. Les exemples définissent aussi un budget de sortie et un effort de raisonnement pour faciliter la prise en main.
Responses utilise reasoning.effort imbriqué, au lieu de reasoning_effort ou thinking à la racine. Les tokens de réflexion sont inclus dans output_tokens. Une tâche simple peut renvoyer reasoning_tokens=0 ; cela ne signifie pas que la réflexion peut être désactivée.Effort de raisonnement ; low est recommandé.Règles de compatibilité de glm-5.3 / glm-5.3-flash / glm-5.3-flashxminimal et none ne désactivent pas la réflexion de la série 5.3. Les tokens de réflexion sont facturés en sortie. Les valeurs inconnues restent inchangées, sans correspondance de compatibilité ; utilisez les valeurs indiquées. Ces correspondances ne s’appliquent pas à glm-5.2.Sur cet endpoint, glm-5.2 peut encore produire des tokens de réflexion avec none. Cette valeur ne garantit pas la désactivation de la réflexion.

Lire la réponse

Éléments de sortie ordonnés. Extrayez text des entrées content de type output_text dans les éléments type=message. reasoning peut précéder la réponse ; un tour function_call peut n’avoir aucun texte de réponse. Ne lisez pas systématiquement output[0]. Après avoir analysé la réponse JSON dans response, extrayez le texte ainsi :
Nombre maximal de tokens de sortie de cette génération, réflexion comprise. Commencez à 1024 et adaptez à la tâche. Un budget trop faible peut être épuisé pendant la réflexion et produire uniquement des éléments reasoning, sans réponse. Vérifiez status et incomplete_details. Le paramètre s’appelle max_output_tokens, pas max_tokens.
Consultez la référence complète pour les outils, les images, SSE et les conversations à plusieurs tours.

Autorisations

Authorization
string
header
requis

Transmettez Bearer YOUR_API_KEY dans l’en-tête Authorization.

Corps

application/json
model
enum<string>
défaut:glm-5.3-flash
requis

Choisissez un modèle GLM. Les quatre acceptent du texte sur cet endpoint. Les fonctions optionnelles varient selon le modèle.

Options disponibles:
glm-5.3,
glm-5.3-flash,
glm-5.3-flashx,
glm-5.2
Exemple:

"glm-5.3-flash"

input
requis

Obligatoire. Chaîne de texte ou tableau d’éléments d’entrée Responses. Le tableau accepte des messages, des éléments de sortie du modèle renvoyés tels quels et function_call_output. Pour plusieurs échanges, incluez l’historique complet à chaque requête. Placez le prompt système en premier avec role=system. Les images utilisent input_image, uniquement avec glm-5.3-flash et glm-5.3-flashx. N’utilisez pas le format de blocs messages / image_url de Chat Completions.

Exemple:

"Présente-toi en une phrase."

max_output_tokens
integer

Nombre maximal de tokens de sortie de cette génération, réflexion comprise. Commencez à 1024 et adaptez à la tâche. Un budget trop faible peut être épuisé pendant la réflexion et produire uniquement des éléments reasoning, sans réponse. Vérifiez status et incomplete_details. Le paramètre s’appelle max_output_tokens, pas max_tokens.

Plage requise: x >= 1
Exemple:

1024

stream
boolean
défaut:false

Active le streaming SSE. Lisez le texte dans delta des événements response.output_text.delta. L’événement final de réussite est response.completed. Terminez aussi le tour et traitez response.incomplete, response.failed ou error. N’attendez pas uniquement [DONE] ou la fermeture de la connexion.

reasoning
object

Responses utilise reasoning.effort imbriqué, au lieu de reasoning_effort ou thinking à la racine. Les tokens de réflexion sont inclus dans output_tokens. Une tâche simple peut renvoyer reasoning_tokens=0 ; cela ne signifie pas que la réflexion peut être désactivée.

Réponse

Génération terminée ou résultat incomplet ; vérifiez status. Le streaming renvoie text/event-stream.

id
string

Identifiant de cette réponse. À transmettre sans modification dans previous_response_id.

Exemple:

"response_demo"

object
string
Allowed value: "response"
created_at
integer

Date de création en secondes Unix.

model
string
Exemple:

"glm-5.3-flash"

status
enum<string>

completed indique la fin de génération du tour, éventuellement avec uniquement des appels d’outils. incomplete indique une sortie incomplète. Vérifiez output et error.

Options disponibles:
completed,
incomplete,
failed,
in_progress,
queued
output
object[]

Éléments de sortie ordonnés. Extrayez text des entrées content de type output_text dans les éléments type=message. reasoning peut précéder la réponse ; un tour function_call peut n’avoir aucun texte de réponse. Ne lisez pas systématiquement output[0].

output_text
string

Texte de réponse agrégé facultatif ; il peut être absent. Les clients génériques doivent parcourir output.

usage
object
error
object | null

Erreur de réponse, généralement null en cas de réussite.

incomplete_details
object
metadata
object | null