{
"id": "response_demo",
"object": "response",
"created_at": 1789971757,
"model": "glm-5.3-flash",
"status": "completed",
"output": [
{
"type": "message",
"id": "message_demo",
"status": "completed",
"role": "assistant",
"content": [
{
"type": "output_text",
"text": "Hallo, ich bin GLM und helfe bei Gesprächen, Texten und Programmieraufgaben.",
"annotations": []
}
]
}
],
"usage": {
"input_tokens": 17,
"output_tokens": 24,
"total_tokens": 41,
"input_tokens_details": {
"cached_tokens": 0
},
"output_tokens_details": {
"reasoning_tokens": 0
}
},
"error": null
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}GLM Schnittstelle für alle Modelle - Schnellstart Responses
Rufen Sie GLM mit model und input auf. Unterstützte Modelle: glm-5.3, glm-5.3-flash, glm-5.3-flashx und glm-5.2. Setzen Sie max_output_tokens auf mindestens 1024, um Platz für Denken und Antwort zu lassen.
Weitere Beispiele und Modellunterschiede finden Sie in der vollständigen Referenz.
{
"id": "response_demo",
"object": "response",
"created_at": 1789971757,
"model": "glm-5.3-flash",
"status": "completed",
"output": [
{
"type": "message",
"id": "message_demo",
"status": "completed",
"role": "assistant",
"content": [
{
"type": "output_text",
"text": "Hallo, ich bin GLM und helfe bei Gesprächen, Texten und Programmieraufgaben.",
"annotations": []
}
]
}
],
"usage": {
"input_tokens": 17,
"output_tokens": 24,
"total_tokens": 41,
"input_tokens_details": {
"cached_tokens": 0
},
"output_tokens_details": {
"reasoning_tokens": 0
}
},
"error": null
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}https://direct.evolink.ai, die Textmodelle und langlebige Verbindungen besser unterstützt. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste und dient als Ausweichadresse für Textmodelle.reasoning.effort als verschachteltes Feld statt reasoning_effort oder thinking auf oberster Ebene. Denk-Tokens sind in output_tokens enthalten. Einfache Aufgaben können reasoning_tokens=0 zurückgeben; daraus folgt nicht, dass Denken deaktivierbar ist.Denkintensität; low wird empfohlen.Kompatibilitätsregeln für glm-5.3 / glm-5.3-flash / glm-5.3-flashx| Übergebener Wert | Effektive Denkstufe |
|---|---|
low / high / max | Unverändert |
xhigh | max |
medium | high |
minimal / none | low; Denken bleibt aktiv |
minimal und none deaktivieren das Denken der 5.3-Serie nicht. Denk-Tokens werden als Ausgabe berechnet. Unbekannte Werte bleiben ohne Kompatibilitätszuordnung unverändert; verwenden Sie die aufgeführten Werte. Diese Zuordnungen gelten nicht für glm-5.2.Bei diesem Endpunkt kann glm-5.2 auch mit none Denk-Tokens erzeugen. Der Wert garantiert keine Deaktivierung des Denkens.Antworttext lesen
Geordnete Ausgabeelemente. Lesen Sie text aus content-Einträgen mittype=output_text innerhalb von Elementen mit type=message. reasoning kann vor dem Antworttext stehen; function_call-Runden können ohne Antworttext enden. Lesen Sie nicht immer output[0].
Wenn das Antwort-JSON als response vorliegt, lässt sich der Text so auslesen:
text = "".join(
part["text"]
for item in response.get("output", [])
if item.get("type") == "message"
for part in item.get("content", [])
if part.get("type") == "output_text"
)
print(text)
max_output_tokens, nicht max_tokens.Autorisierungen
Übergeben Sie Bearer YOUR_API_KEY im Authorization-Header.
Body
Wählen Sie ein GLM-Modell. Alle vier unterstützen Text an diesem Endpunkt. Optionale Funktionen sind modellabhängig.
| Modell-ID | Eingabe | Hinweise zum Denken |
|---|---|---|
glm-5.3 | Text | Effektive Stufen: low / high / max; kompatible Werte unter reasoning. Denken ist nicht deaktivierbar. |
glm-5.3-flash | Text, Bilder | Wie glm-5.3; Bilder mit input_image übergeben. |
glm-5.3-flashx | Text, Bilder | Wie glm-5.3; Bilder mit input_image übergeben. |
glm-5.2 | Text | none kann weiterhin Denk-Tokens erzeugen und garantiert keine Deaktivierung des Denkens. |
glm-5.3, glm-5.3-flash, glm-5.3-flashx, glm-5.2 "glm-5.3-flash"
Erforderlich. Textstring oder Array von Responses-Eingabeelementen. Arrays unterstützen Nachrichten, zurückgesendete Modellausgaben und function_call_output. Senden Sie für mehrere Gesprächsrunden jeweils den vollständigen Verlauf. Setzen Sie den System-Prompt an den Anfang als Nachricht mit role=system. Bilder verwenden input_image, nur mit glm-5.3-flash und glm-5.3-flashx. Verwenden Sie nicht das messages-/image_url-Blockformat von Chat Completions.
"Stelle dich in einem Satz vor."
Maximale Ausgabe-Tokens dieser Generierung einschließlich Denk-Tokens. Beginnen Sie bei 1024 und passen Sie den Wert an die Aufgabe an. Ein zu kleines Budget kann bereits beim Denken aufgebraucht werden, sodass nur reasoning-Elemente ohne Antworttext entstehen. Prüfen Sie status und incomplete_details. Der Parameter heißt max_output_tokens, nicht max_tokens.
x >= 11024
Aktiviert SSE-Streaming. Lesen Sie den Antworttext aus delta in response.output_text.delta. Der erfolgreiche Abschluss ist response.completed. Beenden und behandeln Sie die Runde auch bei response.incomplete, response.failed oder error. Warten Sie nicht ausschließlich auf [DONE] oder das Schließen der Verbindung.
Responses verwendet reasoning.effort als verschachteltes Feld statt reasoning_effort oder thinking auf oberster Ebene. Denk-Tokens sind in output_tokens enthalten. Einfache Aufgaben können reasoning_tokens=0 zurückgeben; daraus folgt nicht, dass Denken deaktivierbar ist.
Show child attributes
Show child attributes
Antwort
Generierung abgeschlossen oder Ergebnis unvollständig; status prüfen. Streaming liefert text/event-stream.
ID dieser Antwort. Unverändert als previous_response_id übergeben.
"response_demo"
"response"Erstellungszeit in Unix-Sekunden.
"glm-5.3-flash"
completed beendet die Generierung dieser Runde, gegebenenfalls nur mit Werkzeugaufrufen. incomplete kennzeichnet eine unvollständige Ausgabe. Prüfen Sie output und error.
completed, incomplete, failed, in_progress, queued Geordnete Ausgabeelemente. Lesen Sie text aus content-Einträgen mit type=output_text innerhalb von Elementen mit type=message. reasoning kann vor dem Antworttext stehen; function_call-Runden können ohne Antworttext enden. Lesen Sie nicht immer output[0].
Show child attributes
Show child attributes
Optional zusammengefasster Antworttext; das Feld kann fehlen. Allgemeine Clients sollten output durchlaufen.
Show child attributes
Show child attributes
Antwortfehler; bei Erfolg normalerweise null.
Show child attributes
Show child attributes
Show child attributes
Show child attributes