Skip to main content
POST
BaseURL: Die Standard-BaseURL ist https://direct.evolink.ai, die Textmodelle und langlebige Verbindungen besser unterstützt. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste und dient als Ausweichadresse für Textmodelle.
Die Denksteuerung unterscheidet sich je Modell: glm-5.3 und glm-5.3-flash denken immer und sind nicht abschaltbar; bei reasoning_effort wirken die drei Stufen low / high / max, die übrigen werden automatisch auf die nächstgelegene verfügbare Stufe herabgestuft (xhighmax, mediumhigh, minimal / nonelow — es wird weiterhin gedacht und als Ausgabe abgerechnet). glm-5.2 kann das Denken mit thinking.type: "disabled" abschalten und unterstützt mehr Reasoning-Stufen. Einzelheiten finden Sie in den Beschreibungen der Felder thinking und reasoning_effort.
Bildeingabe: Nur von glm-5.3-flash unterstützt, über image_url-Inhaltsblöcke innerhalb von messages[].content[]. Werden Bildblöcke an ein anderes Modell gesendet, gibt es einen Fehler.

Autorisierungen

Authorization
string
header
erforderlich

##Alle APIs erfordern eine Bearer-Token-Authentifizierung##

API-Schlüssel abrufen:

Besuchen Sie die API-Schlüsselverwaltung, um Ihren API-Schlüssel abzurufen

Zum Anfrage-Header hinzufügen:

Body

application/json
model
enum<string>
Standard:glm-5.3
erforderlich

Aufzurufendes Modell:

Verfügbare Optionen:
glm-5.3,
glm-5.3-flash,
glm-5.2
Beispiel:

"glm-5.3"

messages
(System Message · object | User Message · object | Assistant Message · object | Tool Message · object)[]
erforderlich

Liste der Konversationsnachrichten, enthält die vollständigen Kontextinformationen des aktuellen Gesprächs

Unterstützt vier Rollen: system, user, assistant, tool. Nachrichten mit unterschiedlichen Rollen haben unterschiedliche Feldstrukturen; wählen Sie die entsprechende Rolle zur Ansicht aus. Mindestens 1 Nachricht erforderlich, und es dürfen nicht ausschließlich System- oder Assistentennachrichten enthalten sein.

Minimum array length: 1
stream
boolean
Standard:false

Ob der Streaming-Ausgabemodus aktiviert wird

  • false: Das Modell gibt die vollständige Antwort nach der Generierung auf einmal zurück (Standard), geeignet für kurze Texte und Stapelverarbeitung
  • true: Gibt über Server-Sent Events (SSE) in Echtzeit blockweise zurück, geeignet für Chat und lange Texte; am Ende des Streams wird data: [DONE] zurückgegeben
Beispiel:

false

thinking
object

Steuert, ob die Gedankenkette (Chain of Thought) aktiviert wird

reasoning_effort
enum<string>
Standard:max

Steuert, wie stark das Modell schlussfolgert; wirkt nur bei aktivem thinking, Standard max

Die unterstützten Werte unterscheiden sich je Modell:

Die glm-5.3-Serie denkt immer, und wirklich wirksam sind nur die drei Stufen low / high / max; die übrigen vier führen nicht zu einem Fehler, sondern werden automatisch auf die nächstgelegene verfügbare Stufe herabgestuft (xhighmax, mediumhigh, minimal / nonelow).

Die glm-5.3-Serie kann das Denken nicht abschalten. minimal oder none senken es lediglich auf die unterste Stufe low; das Modell erzeugt weiterhin Denk-Token, die zum Ausgabetarif abgerechnet werden. Wenn Sie diese beiden Stufen zum Sparen verwenden, beachten Sie den Unterschied zu glm-5.2 — bei glm-5.2 wird tatsächlich auf das Denken verzichtet.

Für komplexe Aufgaben wie das Programmieren wird max empfohlen.

Verfügbare Optionen:
max,
xhigh,
high,
medium,
low,
minimal,
none
Beispiel:

"max"

do_sample
boolean
Standard:true

Ob eine Sampling-Strategie aktiviert wird

  • true (Standard): Verwendet temperature / top_p für zufälliges Sampling, vielfältigere Ausgabe
  • false: Wählt stets das Wort mit der höchsten Wahrscheinlichkeit (Greedy Decoding), deterministischere Ausgabe; in diesem Fall werden temperature und top_p ignoriert

Für Aufgaben, die Konsistenz und Reproduzierbarkeit erfordern (z. B. Codegenerierung, Übersetzung), wird false empfohlen

Beispiel:

true

temperature
number<float>
Standard:1

Sampling-Temperatur, steuert Zufälligkeit und Kreativität der Ausgabe

Hinweise:

  • Wertebereich: [0.0, 1.0], auf zwei Dezimalstellen begrenzt
  • Höhere Werte (z. B. 0,8): Zufälliger und kreativer, geeignet für kreatives Schreiben
  • Niedrigere Werte (z. B. 0,2): Stabiler und deterministischer, geeignet für faktenbasierte Fragen und Codegenerierung
  • Standardwert: 1.0

Empfehlung: Passen Sie temperature und top_p nicht gleichzeitig an

Erforderlicher Bereich: 0 <= x <= 1
Beispiel:

1

top_p
number<float>
Standard:0.95

Nucleus-Sampling-Parameter, eine Alternative zum temperature-Sampling

Hinweise:

  • Wertebereich: [0.01, 1.0], auf zwei Dezimalstellen begrenzt
  • Das Modell berücksichtigt nur Kandidatenwörter, deren kumulative Wahrscheinlichkeit top_p erreicht; z. B. bedeutet 0,1, dass nur die wahrscheinlichsten 10 % der Wörter berücksichtigt werden
  • Kleinere Werte erzeugen fokussiertere, konsistentere Ausgabe; größere Werte erhöhen die Vielfalt
  • Standardwert: 0.95

Empfehlung: Passen Sie temperature und top_p nicht gleichzeitig an

Erforderlicher Bereich: 0.01 <= x <= 1
Beispiel:

0.95

max_tokens
integer

Obergrenze für die Anzahl der Ausgabe-Token des Modells

Hinweis:

  • Die GLM-Serie unterstützt bis zu 131.072 Tokens (128K) Ausgabelänge; empfohlen wird ein Wert von mindestens 1024
  • Ist thinking aktiv, zählen auch die Token der Gedankenkette zu dieser Grenze
  • Wird die Generierung mit length abgeschnitten, erhöhen Sie diesen Wert
Erforderlicher Bereich: 1 <= x <= 131072
Beispiel:

1024

tools
(Function-Werkzeug · object | Web-Search-Werkzeug (Websuche) · object)[]

Liste der Werkzeuge, die das Modell aufrufen kann

Hinweis:

  • Unterstützt werden Funktionsaufrufe (function) und Websuche (web_search)
  • Maximal 128 Funktionen
  • Davon wird web_search pro Aufruf separat abgerechnet, wenn tatsächlich gesucht wird; für die übrigen Werkzeuge fallen keine zusätzlichen Kosten an
Maximum array length: 128
tool_choice
enum<string>
Standard:auto

Steuert, wie das Modell auswählt, welche Funktion aufgerufen wird

Hinweise: Nur wirksam, wenn der Werkzeugtyp function ist; standardmäßig und ausschließlich wird auto unterstützt (das Modell entscheidet automatisch, ob ein Werkzeug aufgerufen wird)

Verfügbare Optionen:
auto
Beispiel:

"auto"

stop
string[]

Liste der Stoppwörter

Hinweise:

  • Wenn der generierte Text auf eine angegebene Zeichenkette trifft, wird die Generierung sofort gestoppt (das Stoppwort selbst ist im zurückgegebenen Text nicht enthalten)
  • Derzeit wird nur ein einzelnes Stoppwort unterstützt, im Format ["stop_word1"], z. B. ["Human:"]
Maximum array length: 4
Beispiel:
response_format
object

Gibt das Ausgabeformat der Modellantwort an, Standard ist text

Hinweise:

  • { "type": "json_object" } aktiviert den JSON-Modus, das Modell gibt gültige Daten im JSON-Format zurück, geeignet für Szenarien wie strukturierte Datenextraktion
  • Bei Verwendung des JSON-Modus wird empfohlen, in der system- oder user-Nachricht ausdrücklich JSON-Ausgabe zu verlangen
request_id
string

Eindeutige Kennung der Anfrage

Hinweise:

  • Wird von der Clientseite übergeben, Länge 6-64 Zeichen, zur Sicherstellung der Eindeutigkeit wird das UUID-Format empfohlen
  • Wird sie nicht angegeben, generiert die Plattform sie automatisch
Required string length: 6 - 64
Beispiel:

"req-7f3a2c1e8b9d4f0a"

user_id
string

Eindeutige Kennung des Endbenutzers

Hinweise: Länge 6-128 Zeichen, empfohlen wird eine eindeutige Kennung ohne sensible Informationen; sie hilft der Plattform, Missbrauch zu überwachen und zu erkennen

Required string length: 6 - 128
Beispiel:

"user-abc123456"

Antwort

Chat-Vervollständigung erfolgreich generiert

id
string

Aufgaben-ID

Beispiel:

"chatcmpl-a6613b56-c61c-94ba-9a9f-43d4cdc7d77a"

object
enum<string>

Antworttyp

Verfügbare Optionen:
chat.completion
Beispiel:

"chat.completion"

request_id
string

Anfrage-ID (wird zurückgegeben, wenn in der Anfrage request_id angegeben wurde)

Beispiel:

"req-7f3a2c1e8b9d4f0a"

created
integer

Erstellungszeit der Anfrage, Unix-Zeitstempel (Sekunden)

Beispiel:

1777021417

model
string

Modellname

Beispiel:

"glm-5.3"

choices
object[]

Liste der Modellantworten

usage
object

Token-Nutzungsstatistik, die bei Abschluss des Aufrufs zurückgegeben wird

Informationen zur Websuche, werden zurückgegeben, wenn das web_search-Werkzeug verwendet wird und eine Suche getroffen wird

content_filter
object[]

Informationen zur Inhaltssicherheit