Skip to main content
POST
BaseURL: Die Standard-BaseURL ist https://direct.evolink.ai, die Textmodelle und langlebige Verbindungen besser unterstützt. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste und dient als Ausweichadresse für Textmodelle.
Denkschalter. enabled aktiviert das Denken und ist bei allen Modellen Standard. disabled deaktiviert es nur bei glm-5.2.glm-5.3, glm-5.3-flash und glm-5.3-flashx denken immer. disabled behält den Standard-Denkmodus bei: Es deaktiviert weder das Denken noch setzt es die Intensität auf low. Verwenden Sie dafür reasoning_effort=low. Nach dem Wechsel von glm-5.2 zur 5.3-Serie bleibt Denken auch mit thinking.type=disabled aktiv; Denk-Tokens werden als Ausgabe berechnet.
reasoning_effort: Denkintensität, Standard max. Kompatibilitätsregeln für glm-5.3 / glm-5.3-flash / glm-5.3-flashx minimal und none deaktivieren das Denken der 5.3-Serie nicht. Denk-Tokens werden als Ausgabe berechnet. Unbekannte Werte bleiben ohne Kompatibilitätszuordnung unverändert; verwenden Sie die aufgeführten Werte. Diese Zuordnungen gelten nicht für glm-5.2. glm-5.2 unterstützt max, xhigh, high, medium, low, minimal und none. xhigh entspricht max; medium / low entsprechen high; minimal / none können das Denken deaktivieren. Auch thinking.type=disabled schaltet es aus. Für komplexe Aufgaben wie Programmieren ist max geeignet.
Inhalt der Benutzernachricht.
  • Zeichenkette: reiner Text, von allen Modellen unterstützt
  • Array von Inhaltsblöcken: Text und Bilder gemischt, nur von glm-5.3-flash und glm-5.3-flashx unterstützt
Werden Bildinhaltsblöcke an glm-5.3 oder glm-5.2 gesendet, gibt es einen Fehler.

Autorisierungen

Authorization
string
header
erforderlich

##Alle APIs erfordern eine Bearer-Token-Authentifizierung##

API-Schlüssel abrufen:

Besuchen Sie die API-Schlüsselverwaltung, um Ihren API-Schlüssel abzurufen

Zum Anfrage-Header hinzufügen:

Body

application/json
model
enum<string>
Standard:glm-5.3
erforderlich

Aufzurufendes Modell:

Verfügbare Optionen:
glm-5.3,
glm-5.3-flash,
glm-5.3-flashx,
glm-5.2
Beispiel:

"glm-5.3"

messages
(System Message · object | User Message · object | Assistant Message · object | Tool Message · object)[]
erforderlich

Liste der Konversationsnachrichten, enthält die vollständigen Kontextinformationen des aktuellen Gesprächs

Unterstützt vier Rollen: system, user, assistant, tool. Nachrichten mit unterschiedlichen Rollen haben unterschiedliche Feldstrukturen; wählen Sie die entsprechende Rolle zur Ansicht aus. Mindestens 1 Nachricht erforderlich, und es dürfen nicht ausschließlich System- oder Assistentennachrichten enthalten sein.

Minimum array length: 1
stream
boolean
Standard:false

Ob der Streaming-Ausgabemodus aktiviert wird

  • false: Das Modell gibt die vollständige Antwort nach der Generierung auf einmal zurück (Standard), geeignet für kurze Texte und Stapelverarbeitung
  • true: Gibt über Server-Sent Events (SSE) in Echtzeit blockweise zurück, geeignet für Chat und lange Texte; am Ende des Streams wird data: [DONE] zurückgegeben
Beispiel:

false

thinking
object

Steuert, ob die Gedankenkette (Chain of Thought) aktiviert wird

reasoning_effort
enum<string>
Standard:max

Denkintensität, Standard max.

Kompatibilitätsregeln für glm-5.3 / glm-5.3-flash / glm-5.3-flashx

minimal und none deaktivieren das Denken der 5.3-Serie nicht. Denk-Tokens werden als Ausgabe berechnet. Unbekannte Werte bleiben ohne Kompatibilitätszuordnung unverändert; verwenden Sie die aufgeführten Werte. Diese Zuordnungen gelten nicht für glm-5.2.

glm-5.2 unterstützt max, xhigh, high, medium, low, minimal und none. xhigh entspricht max; medium / low entsprechen high; minimal / none können das Denken deaktivieren. Auch thinking.type=disabled schaltet es aus. Für komplexe Aufgaben wie Programmieren ist max geeignet.

Verfügbare Optionen:
max,
xhigh,
high,
medium,
low,
minimal,
none
Beispiel:

"max"

do_sample
boolean
Standard:true

Ob eine Sampling-Strategie aktiviert wird

  • true (Standard): Verwendet temperature / top_p für zufälliges Sampling, vielfältigere Ausgabe
  • false: Wählt stets das Wort mit der höchsten Wahrscheinlichkeit (Greedy Decoding), deterministischere Ausgabe; in diesem Fall werden temperature und top_p ignoriert

Für Aufgaben, die Konsistenz und Reproduzierbarkeit erfordern (z. B. Codegenerierung, Übersetzung), wird false empfohlen

Beispiel:

true

temperature
number<float>
Standard:1

Sampling-Temperatur, steuert Zufälligkeit und Kreativität der Ausgabe

Hinweise:

  • Wertebereich: [0.0, 1.0], auf zwei Dezimalstellen begrenzt
  • Höhere Werte (z. B. 0,8): Zufälliger und kreativer, geeignet für kreatives Schreiben
  • Niedrigere Werte (z. B. 0,2): Stabiler und deterministischer, geeignet für faktenbasierte Fragen und Codegenerierung
  • Standardwert: 1.0

Empfehlung: Passen Sie temperature und top_p nicht gleichzeitig an

Erforderlicher Bereich: 0 <= x <= 1
Beispiel:

1

top_p
number<float>
Standard:0.95

Nucleus-Sampling-Parameter, eine Alternative zum temperature-Sampling

Hinweise:

  • Wertebereich: [0.01, 1.0], auf zwei Dezimalstellen begrenzt
  • Das Modell berücksichtigt nur Kandidatenwörter, deren kumulative Wahrscheinlichkeit top_p erreicht; z. B. bedeutet 0,1, dass nur die wahrscheinlichsten 10 % der Wörter berücksichtigt werden
  • Kleinere Werte erzeugen fokussiertere, konsistentere Ausgabe; größere Werte erhöhen die Vielfalt
  • Standardwert: 0.95

Empfehlung: Passen Sie temperature und top_p nicht gleichzeitig an

Erforderlicher Bereich: 0.01 <= x <= 1
Beispiel:

0.95

max_tokens
integer

Obergrenze für die Anzahl der Ausgabe-Token des Modells

Hinweis:

  • Die GLM-Serie unterstützt bis zu 131.072 Tokens (128K) Ausgabelänge; empfohlen wird ein Wert von mindestens 1024
  • Ist thinking aktiv, zählen auch die Token der Gedankenkette zu dieser Grenze
  • Wird die Generierung mit length abgeschnitten, erhöhen Sie diesen Wert
Erforderlicher Bereich: 1 <= x <= 131072
Beispiel:

1024

tools
(Function-Werkzeug · object | Web-Search-Werkzeug (Websuche) · object)[]

Liste der Werkzeuge, die das Modell aufrufen kann

Hinweis:

  • Unterstützt werden Funktionsaufrufe (function) und Websuche (web_search)
  • Maximal 128 Funktionen
  • Davon wird web_search pro Aufruf separat abgerechnet, wenn tatsächlich gesucht wird; für die übrigen Werkzeuge fallen keine zusätzlichen Kosten an
Maximum array length: 128
tool_choice
enum<string>
Standard:auto

Steuert, wie das Modell auswählt, welche Funktion aufgerufen wird

Hinweise: Nur wirksam, wenn der Werkzeugtyp function ist; standardmäßig und ausschließlich wird auto unterstützt (das Modell entscheidet automatisch, ob ein Werkzeug aufgerufen wird)

Verfügbare Optionen:
auto
Beispiel:

"auto"

stop
string[]

Liste der Stoppwörter

Hinweise:

  • Wenn der generierte Text auf eine angegebene Zeichenkette trifft, wird die Generierung sofort gestoppt (das Stoppwort selbst ist im zurückgegebenen Text nicht enthalten)
  • Derzeit wird nur ein einzelnes Stoppwort unterstützt, im Format ["stop_word1"], z. B. ["Human:"]
Maximum array length: 4
Beispiel:
response_format
object

Gibt das Ausgabeformat der Modellantwort an, Standard ist text

Hinweise:

  • { "type": "json_object" } aktiviert den JSON-Modus, das Modell gibt gültige Daten im JSON-Format zurück, geeignet für Szenarien wie strukturierte Datenextraktion
  • Bei Verwendung des JSON-Modus wird empfohlen, in der system- oder user-Nachricht ausdrücklich JSON-Ausgabe zu verlangen
request_id
string

Eindeutige Kennung der Anfrage

Hinweise:

  • Wird von der Clientseite übergeben, Länge 6-64 Zeichen, zur Sicherstellung der Eindeutigkeit wird das UUID-Format empfohlen
  • Wird sie nicht angegeben, generiert die Plattform sie automatisch
Required string length: 6 - 64
Beispiel:

"req-7f3a2c1e8b9d4f0a"

user_id
string

Eindeutige Kennung des Endbenutzers

Hinweise: Länge 6-128 Zeichen, empfohlen wird eine eindeutige Kennung ohne sensible Informationen; sie hilft der Plattform, Missbrauch zu überwachen und zu erkennen

Required string length: 6 - 128
Beispiel:

"user-abc123456"

Antwort

Chat-Vervollständigung erfolgreich generiert

id
string

Aufgaben-ID

Beispiel:

"chatcmpl-a6613b56-c61c-94ba-9a9f-43d4cdc7d77a"

object
enum<string>

Antworttyp

Verfügbare Optionen:
chat.completion
Beispiel:

"chat.completion"

request_id
string

Anfrage-ID (wird zurückgegeben, wenn in der Anfrage request_id angegeben wurde)

Beispiel:

"req-7f3a2c1e8b9d4f0a"

created
integer

Erstellungszeit der Anfrage, Unix-Zeitstempel (Sekunden)

Beispiel:

1777021417

model
string

Modellname

Beispiel:

"glm-5.3"

choices
object[]

Liste der Modellantworten

usage
object

Token-Nutzungsstatistik, die bei Abschluss des Aufrufs zurückgegeben wird

Informationen zur Websuche, werden zurückgegeben, wenn das web_search-Werkzeug verwendet wird und eine Suche getroffen wird

content_filter
object[]

Informationen zur Inhaltssicherheit