Skip to main content
POST
BaseURL: Die Standard-BaseURL ist https://direct.evolink.ai, die Textmodelle und langlebige Verbindungen besser unterstützt. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste und dient als Ausweichadresse für Textmodelle.
Verwenden Sie POST /v1/responses und wählen Sie das Modell über model. Erforderlich sind mindestens model und input. Die Beispiele setzen zusätzlich ein Ausgabebudget und die Denkintensität für einen einfachen Einstieg.
Responses verwendet reasoning.effort als verschachteltes Feld statt reasoning_effort oder thinking auf oberster Ebene. Denk-Tokens sind in output_tokens enthalten. Einfache Aufgaben können reasoning_tokens=0 zurückgeben; daraus folgt nicht, dass Denken deaktivierbar ist.Denkintensität; low wird empfohlen.Kompatibilitätsregeln für glm-5.3 / glm-5.3-flash / glm-5.3-flashxminimal und none deaktivieren das Denken der 5.3-Serie nicht. Denk-Tokens werden als Ausgabe berechnet. Unbekannte Werte bleiben ohne Kompatibilitätszuordnung unverändert; verwenden Sie die aufgeführten Werte. Diese Zuordnungen gelten nicht für glm-5.2.Bei diesem Endpunkt kann glm-5.2 auch mit none Denk-Tokens erzeugen. Der Wert garantiert keine Deaktivierung des Denkens.

Antworttext lesen

Geordnete Ausgabeelemente. Lesen Sie text aus content-Einträgen mit type=output_text innerhalb von Elementen mit type=message. reasoning kann vor dem Antworttext stehen; function_call-Runden können ohne Antworttext enden. Lesen Sie nicht immer output[0]. Wenn das Antwort-JSON als response vorliegt, lässt sich der Text so auslesen:
Maximale Ausgabe-Tokens dieser Generierung einschließlich Denk-Tokens. Beginnen Sie bei 1024 und passen Sie den Wert an die Aufgabe an. Ein zu kleines Budget kann bereits beim Denken aufgebraucht werden, sodass nur reasoning-Elemente ohne Antworttext entstehen. Prüfen Sie status und incomplete_details. Der Parameter heißt max_output_tokens, nicht max_tokens.
Werkzeugaufrufe, Bilder, SSE-Verarbeitung und Gesprächsverläufe finden Sie in der vollständigen Referenz.

Autorisierungen

Authorization
string
header
erforderlich

Übergeben Sie Bearer YOUR_API_KEY im Authorization-Header.

Body

application/json
model
enum<string>
Standard:glm-5.3-flash
erforderlich

Wählen Sie ein GLM-Modell. Alle vier unterstützen Text an diesem Endpunkt. Optionale Funktionen sind modellabhängig.

Verfügbare Optionen:
glm-5.3,
glm-5.3-flash,
glm-5.3-flashx,
glm-5.2
Beispiel:

"glm-5.3-flash"

input
erforderlich

Erforderlich. Textstring oder Array von Responses-Eingabeelementen. Arrays unterstützen Nachrichten, zurückgesendete Modellausgaben und function_call_output. Senden Sie für mehrere Gesprächsrunden jeweils den vollständigen Verlauf. Setzen Sie den System-Prompt an den Anfang als Nachricht mit role=system. Bilder verwenden input_image, nur mit glm-5.3-flash und glm-5.3-flashx. Verwenden Sie nicht das messages-/image_url-Blockformat von Chat Completions.

Beispiel:

"Stelle dich in einem Satz vor."

max_output_tokens
integer

Maximale Ausgabe-Tokens dieser Generierung einschließlich Denk-Tokens. Beginnen Sie bei 1024 und passen Sie den Wert an die Aufgabe an. Ein zu kleines Budget kann bereits beim Denken aufgebraucht werden, sodass nur reasoning-Elemente ohne Antworttext entstehen. Prüfen Sie status und incomplete_details. Der Parameter heißt max_output_tokens, nicht max_tokens.

Erforderlicher Bereich: x >= 1
Beispiel:

1024

stream
boolean
Standard:false

Aktiviert SSE-Streaming. Lesen Sie den Antworttext aus delta in response.output_text.delta. Der erfolgreiche Abschluss ist response.completed. Beenden und behandeln Sie die Runde auch bei response.incomplete, response.failed oder error. Warten Sie nicht ausschließlich auf [DONE] oder das Schließen der Verbindung.

reasoning
object

Responses verwendet reasoning.effort als verschachteltes Feld statt reasoning_effort oder thinking auf oberster Ebene. Denk-Tokens sind in output_tokens enthalten. Einfache Aufgaben können reasoning_tokens=0 zurückgeben; daraus folgt nicht, dass Denken deaktivierbar ist.

Antwort

Generierung abgeschlossen oder Ergebnis unvollständig; status prüfen. Streaming liefert text/event-stream.

id
string

ID dieser Antwort. Unverändert als previous_response_id übergeben.

Beispiel:

"response_demo"

object
string
Allowed value: "response"
created_at
integer

Erstellungszeit in Unix-Sekunden.

model
string
Beispiel:

"glm-5.3-flash"

status
enum<string>

completed beendet die Generierung dieser Runde, gegebenenfalls nur mit Werkzeugaufrufen. incomplete kennzeichnet eine unvollständige Ausgabe. Prüfen Sie output und error.

Verfügbare Optionen:
completed,
incomplete,
failed,
in_progress,
queued
output
object[]

Geordnete Ausgabeelemente. Lesen Sie text aus content-Einträgen mit type=output_text innerhalb von Elementen mit type=message. reasoning kann vor dem Antworttext stehen; function_call-Runden können ohne Antworttext enden. Lesen Sie nicht immer output[0].

output_text
string

Optional zusammengefasster Antworttext; das Feld kann fehlen. Allgemeine Clients sollten output durchlaufen.

usage
object
error
object | null

Antwortfehler; bei Erfolg normalerweise null.

incomplete_details
object
metadata
object | null