Skip to main content
POST
BaseURL: Die Standard-BaseURL ist https://direct.evolink.ai, die Textmodelle und langlebige Verbindungen besser unterstützt. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste und dient als Ausweichadresse für Textmodelle.
Einstellungen für das Denken. Alle Modelle aktivieren es standardmäßig. thinking-Blöcke der Antwort werden als Ausgabe-Tokens berechnet; signature kann leer sein.
  • glm-5.2: thinking.type=disabled deaktiviert das Denken.
  • glm-5.3 / glm-5.3-flash / glm-5.3-flashx: Denken bleibt immer aktiv. disabled behält den Standardmodus und die Berechnung als Ausgabe bei.
thinking.budget_tokens und thinking.effort legen keine GLM-Denkstufe fest. Kompatible Werte stehen beim Feld reasoning_effort auf oberster Ebene. Eine Einstellung, die das Denken bei glm-5.2 deaktiviert, hat diesen Effekt nach dem Wechsel zur 5.3-Serie nicht mehr.
reasoning_effort: Kompatibilitätsfeld für GLM-Denkstufen auf oberster Anfrageebene, außerhalb von thinking. Der Endpunkt akzeptiert es, garantiert jedoch keine Steuerung der tatsächlichen Denkintensität. Kompatibilitätsregeln für glm-5.3 / glm-5.3-flash / glm-5.3-flashx minimal und none deaktivieren das Denken der 5.3-Serie nicht. Denk-Tokens werden als Ausgabe berechnet. Unbekannte Werte bleiben ohne Kompatibilitätszuordnung unverändert; verwenden Sie die aufgeführten Werte. Diese Zuordnungen gelten nicht für glm-5.2. Zur Steuerung der Denkintensität verwenden Sie reasoning_effort in Chat Completions oder reasoning.effort in Responses.
Nur glm-5.3-flash und glm-5.3-flashx unterstützen Bildeingabe. Bildblöcke an glm-5.3 oder glm-5.2 können 200 zurückgeben, obwohl das Modell das Bild nicht lesen kann. Wählen Sie für Bildverständnis ein bildfähiges Modell.

Autorisierungen

Authorization
string
header
erforderlich

##Alle APIs erfordern eine Bearer-Token-Authentifizierung##

API-Key erhalten:

Besuchen Sie die API-Key-Verwaltungsseite, um Ihren API-Key zu erhalten

Zum Anfrage-Header hinzufügen:

Anmerkung: EvoLink verwendet für /v1/messages einheitlich die Bearer-Token-Authentifizierung.

Body

application/json
model
enum<string>
Standard:glm-5.3
erforderlich

Aufzurufendes Modell:

Verfügbare Optionen:
glm-5.3,
glm-5.3-flash,
glm-5.3-flashx,
glm-5.2
Beispiel:

"glm-5.3"

messages
object[]
erforderlich

Gesprächsnachrichten im Wechsel zwischen user und assistant. Mindestens eine Nachricht ist erforderlich; die letzte hat normalerweise role=user. Frühere Nachrichten liefern den Kontext für weitere Gesprächsrunden.

Bildeingabe: Nur glm-5.3-flash und glm-5.3-flashx unterstützen image-Blöcke im content-Array. Verwenden Sie für glm-5.3 und glm-5.2 nur Text. HTTP 200 bedeutet bei diesen Modellen nicht, dass das Bild gelesen wurde.

Minimum array length: 1
max_tokens
integer

Obergrenze für die Länge des erzeugten Inhalts (in Token)

Hinweis:

  • Die GLM-Serie unterstützt bis zu 131.072 Tokens (128K) Ausgabelänge; empfohlen wird ein Wert von mindestens 1024
  • Auch die durch thinking erzeugten Token zählen zu dieser Grenze
  • Wird die Grenze erreicht, wird der Inhalt abgeschnitten und die Antwort enthält stop_reason=max_tokens
Erforderlicher Bereich: 1 <= x <= 131072
Beispiel:

1024

system

System-Prompt, dient zum Festlegen von Rolle und Verhalten der KI

Hinweise:

  • Unterstützt eine Zeichenkette oder ein Array von Inhaltsblöcken
  • Wird über das Top-Level-Feld system übergeben (nicht in messages legen)
  • Das Modell folgt den system-Vorgaben
  • Ein zu langer system kann abgeschnitten werden: Für langen Kontext legen Sie diesen in messages, häufen Sie nicht alles im system an
Beispiel:

"You are a helpful assistant."

temperature
number

Sampling-Temperatur

Hinweise:

  • Je höher der Wert, desto vielfältiger die Ausgabe; je niedriger, desto deterministischer
  • Empfohlener Bereich [0, 1]
Erforderlicher Bereich: 0 <= x <= 1
Beispiel:

1

top_p
number

Nucleus-Sampling-Schwelle

Hinweise:

  • Bereich [0, 1]
  • Es wird empfohlen, temperature und top_p nicht gleichzeitig anzupassen
Erforderlicher Bereich: 0 <= x <= 1
Beispiel:

0.9

top_k
integer

Sampling nur aus den K Tokens mit der höchsten Wahrscheinlichkeit (Anthropic-spezifischer Parameter)

Hinweise:

  • Je kleiner der Wert, desto deterministischer die Ausgabe; je größer, desto vielfältiger die Kandidaten
Erforderlicher Bereich: x >= 0
Beispiel:

10

stop_sequences
string[]

Benutzerdefinierte Stoppsequenzen: Die Generierung stoppt, sobald eine der Zeichenketten getroffen wird

Hinweise:

  • Bei einem Treffer wird abgeschnitten, der Inhalt vor der Trefferstelle wird normal zurückgegeben
  • Achtung: Beim Treffen einer Stoppsequenz liefert die GLM-Serie für stop_reason den Wert end_turn (statt des Anthropic-Standardwerts stop_sequence), und die Antwort enthält auch kein stop_sequence-Feld. Wenn ein Client zur Trefferbestimmung auf stop_reason=="stop_sequence" angewiesen ist, ist eine Sonderbehandlung nötig
Beispiel:
stream
boolean
Standard:false

Ob als SSE-Stream zurückgegeben wird

  • true: Streaming-Rückgabe über Server-Sent Events (Standard-Anthropic-Ereignissequenz: message_start / content_block_start / content_block_delta / message_delta / message_stop)
  • false: Gibt nach vollständiger Antwort alles auf einmal zurück (Standard)
Beispiel:

false

thinking
object

Einstellungen für das Denken. Alle Modelle aktivieren es standardmäßig. thinking-Blöcke der Antwort werden als Ausgabe-Tokens berechnet; signature kann leer sein.

  • glm-5.2: thinking.type=disabled deaktiviert das Denken.
  • glm-5.3 / glm-5.3-flash / glm-5.3-flashx: Denken bleibt immer aktiv. disabled behält den Standardmodus und die Berechnung als Ausgabe bei.

thinking.budget_tokens und thinking.effort legen keine GLM-Denkstufe fest. Kompatible Werte stehen beim Feld reasoning_effort auf oberster Ebene. Eine Einstellung, die das Denken bei glm-5.2 deaktiviert, hat diesen Effekt nach dem Wechsel zur 5.3-Serie nicht mehr.

reasoning_effort
enum<string>

Kompatibilitätsfeld für GLM-Denkstufen auf oberster Anfrageebene, außerhalb von thinking. Der Endpunkt akzeptiert es, garantiert jedoch keine Steuerung der tatsächlichen Denkintensität.

Kompatibilitätsregeln für glm-5.3 / glm-5.3-flash / glm-5.3-flashx

minimal und none deaktivieren das Denken der 5.3-Serie nicht. Denk-Tokens werden als Ausgabe berechnet. Unbekannte Werte bleiben ohne Kompatibilitätszuordnung unverändert; verwenden Sie die aufgeführten Werte. Diese Zuordnungen gelten nicht für glm-5.2.

Zur Steuerung der Denkintensität verwenden Sie reasoning_effort in Chat Completions oder reasoning.effort in Responses.

Verfügbare Optionen:
max,
xhigh,
high,
medium,
low,
minimal,
none
tools
object[]

Liste der Werkzeugdefinitionen

Hinweise:

  • Folgt der Anthropic-Werkzeugdefinitionsspezifikation
  • input_schema verwendet ein JSON-Schema-Objekt
  • Das Modell gibt einen Standard-tool_use-Block zurück, stop_reason=tool_use
tool_choice
object

Strategie der Werkzeugauswahl

metadata
object

Anfrage-Metadaten

Antwort

Nachrichtenobjekt

Nachrichtenantwort im Anthropic-Stil

id
string

Eindeutige Nachrichten-ID (Format: msg_<uuid>)

type
enum<string>

Typ des Antwortobjekts

Verfügbare Optionen:
message
role
enum<string>
Verfügbare Optionen:
assistant
model
string

Tatsächlich verwendetes Modell

Beispiel:

"glm-5.3"

content
object[]

Liste der Antwortinhaltsblöcke

Mögliche block type:

  • thinking: Denkprozess (wenn das Nachdenken aktiviert ist, standardmäßig aktiviert)
  • text: finaler Antworttext
  • tool_use: vom Modell ausgelöster Werkzeugaufruf
stop_reason
enum<string>

Stoppgrund

  • end_turn: natürliches Ende (wird auch beim Treffen von stop_sequences zurückgegeben)
  • max_tokens: max_tokens-Obergrenze erreicht
  • tool_use: Das Modell löst einen Werkzeugaufruf aus
Verfügbare Optionen:
end_turn,
max_tokens,
tool_use
usage
object

Token-Nutzungsstatistik (Anthropic-Spezifikation)