curl --request POST \
--url https://direct.evolink.ai/v1/responses \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3-flash",
"input": "Présente-toi en une phrase.",
"max_output_tokens": 1024,
"reasoning": {
"effort": "low"
}
}
'{
"id": "response_demo",
"object": "response",
"created_at": 1789971757,
"model": "glm-5.3-flash",
"status": "completed",
"output": [
{
"type": "message",
"id": "message_demo",
"status": "completed",
"role": "assistant",
"content": [
{
"type": "output_text",
"text": "Bonjour, je suis GLM. Je peux vous aider à discuter, rédiger et programmer.",
"annotations": []
}
]
}
],
"usage": {
"input_tokens": 17,
"output_tokens": 24,
"total_tokens": 41,
"input_tokens_details": {
"cached_tokens": 0
},
"output_tokens_details": {
"reasoning_tokens": 0
}
},
"error": null
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}API tous modèles GLM - Démarrage rapide Responses
Appelez GLM avec model et input. Modèles disponibles : glm-5.3, glm-5.3-flash, glm-5.3-flashx et glm-5.2. Fixez max_output_tokens à 1024 ou plus pour réserver de la place à la réflexion et à la réponse.
Consultez la référence complète pour les autres exemples et les différences entre modèles.
curl --request POST \
--url https://direct.evolink.ai/v1/responses \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3-flash",
"input": "Présente-toi en une phrase.",
"max_output_tokens": 1024,
"reasoning": {
"effort": "low"
}
}
'{
"id": "response_demo",
"object": "response",
"created_at": 1789971757,
"model": "glm-5.3-flash",
"status": "completed",
"output": [
{
"type": "message",
"id": "message_demo",
"status": "completed",
"role": "assistant",
"content": [
{
"type": "output_text",
"text": "Bonjour, je suis GLM. Je peux vous aider à discuter, rédiger et programmer.",
"annotations": []
}
]
}
],
"usage": {
"input_tokens": 17,
"output_tokens": 24,
"total_tokens": 41,
"input_tokens_details": {
"cached_tokens": 0
},
"output_tokens_details": {
"reasoning_tokens": 0
}
},
"error": null
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}https://direct.evolink.ai, qui offre une meilleure prise en charge des modèles textuels et des connexions de longue durée. https://api.evolink.ai est le point de terminaison principal pour les services multimodaux et sert d’adresse de repli pour les modèles textuels.reasoning.effort imbriqué, au lieu de reasoning_effort ou thinking à la racine. Les tokens de réflexion sont inclus dans output_tokens. Une tâche simple peut renvoyer reasoning_tokens=0 ; cela ne signifie pas que la réflexion peut être désactivée.Effort de raisonnement ; low est recommandé.Règles de compatibilité de glm-5.3 / glm-5.3-flash / glm-5.3-flashx| Valeur fournie | Niveau de réflexion effectif |
|---|---|
low / high / max | Inchangé |
xhigh | max |
medium | high |
minimal / none | low ; réflexion toujours active |
minimal et none ne désactivent pas la réflexion de la série 5.3. Les tokens de réflexion sont facturés en sortie. Les valeurs inconnues restent inchangées, sans correspondance de compatibilité ; utilisez les valeurs indiquées. Ces correspondances ne s’appliquent pas à glm-5.2.Sur cet endpoint, glm-5.2 peut encore produire des tokens de réflexion avec none. Cette valeur ne garantit pas la désactivation de la réflexion.Lire la réponse
Éléments de sortie ordonnés. Extrayez text des entrées content de typeoutput_text dans les éléments type=message. reasoning peut précéder la réponse ; un tour function_call peut n’avoir aucun texte de réponse. Ne lisez pas systématiquement output[0].
Après avoir analysé la réponse JSON dans response, extrayez le texte ainsi :
text = "".join(
part["text"]
for item in response.get("output", [])
if item.get("type") == "message"
for part in item.get("content", [])
if part.get("type") == "output_text"
)
print(text)
max_output_tokens, pas max_tokens.Autorisations
Transmettez Bearer YOUR_API_KEY dans l’en-tête Authorization.
Corps
Choisissez un modèle GLM. Les quatre acceptent du texte sur cet endpoint. Les fonctions optionnelles varient selon le modèle.
| ID du modèle | Entrée | Remarques sur la réflexion |
|---|---|---|
glm-5.3 | Texte | Niveaux effectifs : low / high / max ; valeurs compatibles dans reasoning. La réflexion ne peut pas être désactivée. |
glm-5.3-flash | Texte, images | Comme glm-5.3 ; utilisez input_image pour les images. |
glm-5.3-flashx | Texte, images | Comme glm-5.3 ; utilisez input_image pour les images. |
glm-5.2 | Texte | none peut encore produire des tokens de réflexion et ne garantit pas sa désactivation. |
glm-5.3, glm-5.3-flash, glm-5.3-flashx, glm-5.2 "glm-5.3-flash"
Obligatoire. Chaîne de texte ou tableau d’éléments d’entrée Responses. Le tableau accepte des messages, des éléments de sortie du modèle renvoyés tels quels et function_call_output. Pour plusieurs échanges, incluez l’historique complet à chaque requête. Placez le prompt système en premier avec role=system. Les images utilisent input_image, uniquement avec glm-5.3-flash et glm-5.3-flashx. N’utilisez pas le format de blocs messages / image_url de Chat Completions.
"Présente-toi en une phrase."
Nombre maximal de tokens de sortie de cette génération, réflexion comprise. Commencez à 1024 et adaptez à la tâche. Un budget trop faible peut être épuisé pendant la réflexion et produire uniquement des éléments reasoning, sans réponse. Vérifiez status et incomplete_details. Le paramètre s’appelle max_output_tokens, pas max_tokens.
x >= 11024
Active le streaming SSE. Lisez le texte dans delta des événements response.output_text.delta. L’événement final de réussite est response.completed. Terminez aussi le tour et traitez response.incomplete, response.failed ou error. N’attendez pas uniquement [DONE] ou la fermeture de la connexion.
Responses utilise reasoning.effort imbriqué, au lieu de reasoning_effort ou thinking à la racine. Les tokens de réflexion sont inclus dans output_tokens. Une tâche simple peut renvoyer reasoning_tokens=0 ; cela ne signifie pas que la réflexion peut être désactivée.
Show child attributes
Show child attributes
Réponse
Génération terminée ou résultat incomplet ; vérifiez status. Le streaming renvoie text/event-stream.
Identifiant de cette réponse. À transmettre sans modification dans previous_response_id.
"response_demo"
"response"Date de création en secondes Unix.
"glm-5.3-flash"
completed indique la fin de génération du tour, éventuellement avec uniquement des appels d’outils. incomplete indique une sortie incomplète. Vérifiez output et error.
completed, incomplete, failed, in_progress, queued Éléments de sortie ordonnés. Extrayez text des entrées content de type output_text dans les éléments type=message. reasoning peut précéder la réponse ; un tour function_call peut n’avoir aucun texte de réponse. Ne lisez pas systématiquement output[0].
Show child attributes
Show child attributes
Texte de réponse agrégé facultatif ; il peut être absent. Les clients génériques doivent parcourir output.
Show child attributes
Show child attributes
Erreur de réponse, généralement null en cas de réussite.
Show child attributes
Show child attributes
Show child attributes
Show child attributes