Skip to main content
POST
BaseURL: Die Standard-BaseURL ist https://direct.evolink.ai, die Textmodelle und langlebige Verbindungen besser unterstützt. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste und dient als Ausweichadresse für Textmodelle.
Ob das Denken abgeschaltet werden kann, hängt vom Modell ab: Nur glm-5.2 unterstützt thinking.type: "disabled"; glm-5.3 und glm-5.3-flash denken immer und geben bei disabled einen Fehler zurück. Entfernen Sie beim Wechsel von glm-5.2 zuerst das fest verdrahtete disabled, bevor Sie das Modell umstellen.
Bildeingabe wird nur von glm-5.3-flash unterstützt, und das Senden an die anderen Modelle löst keinen Fehler aus. Gehen Bildinhaltsblöcke an glm-5.3 oder glm-5.2, liefert die Anfrage wie gewohnt 200, doch das Modell kann das Bild nicht lesen und antwortet allein anhand des Textes — die Antwort wirkt plausibel, hat mit dem Bild aber nichts zu tun und fällt von Anfrage zu Anfrage unterschiedlich aus. Solche stillen Fehler sind im Produktivbetrieb schwer aufzuspüren; wählen Sie daher glm-5.3-flash, wenn Sie Bildverständnis benötigen.

Autorisierungen

Authorization
string
header
erforderlich

##Alle APIs erfordern eine Bearer-Token-Authentifizierung##

API-Key erhalten:

Besuchen Sie die API-Key-Verwaltungsseite, um Ihren API-Key zu erhalten

Zum Anfrage-Header hinzufügen:

Anmerkung: EvoLink verwendet für /v1/messages einheitlich die Bearer-Token-Authentifizierung.

Body

application/json
model
enum<string>
Standard:glm-5.3
erforderlich

Aufzurufendes Modell:

Verfügbare Optionen:
glm-5.3,
glm-5.3-flash,
glm-5.2
Beispiel:

"glm-5.3"

messages
object[]
erforderlich

Liste der Konversationsnachrichten, abwechselnd user / assistant

Hinweis:

  • Mindestens eine Nachricht ist erforderlich
  • Die letzte Nachricht ist üblicherweise role=user
  • Mehrstufiger Kontext wird unterstützt, das Modell bezieht sich auf den Verlauf

Bildeingabe: Nur glm-5.3-flash unterstützt sie, über einen {"type":"image","source":{...}}-Block im content-Array.

Werden Bildinhaltsblöcke an glm-5.3 oder glm-5.2 gesendet, gibt es keinen Fehler, das Modell kann das Bild jedoch nicht lesen. Die Anfrage liefert wie gewohnt 200, und das Modell antwortet allein anhand des Textes — die Antwort wirkt plausibel, hat mit dem Bild aber nichts zu tun, und das Ergebnis fällt von Anfrage zu Anfrage unterschiedlich aus.

Solche stillen Fehler sind im Produktivbetrieb schwer aufzuspüren; wählen Sie daher glm-5.3-flash, wenn Sie Bildverständnis benötigen.

Minimum array length: 1
max_tokens
integer

Obergrenze für die Länge des erzeugten Inhalts (in Token)

Hinweis:

  • Die GLM-Serie unterstützt bis zu 131.072 Tokens (128K) Ausgabelänge; empfohlen wird ein Wert von mindestens 1024
  • Auch die durch thinking erzeugten Token zählen zu dieser Grenze
  • Wird die Grenze erreicht, wird der Inhalt abgeschnitten und die Antwort enthält stop_reason=max_tokens
Erforderlicher Bereich: 1 <= x <= 131072
Beispiel:

1024

system

System-Prompt, dient zum Festlegen von Rolle und Verhalten der KI

Hinweise:

  • Unterstützt eine Zeichenkette oder ein Array von Inhaltsblöcken
  • Wird über das Top-Level-Feld system übergeben (nicht in messages legen)
  • Das Modell folgt den system-Vorgaben
  • Ein zu langer system kann abgeschnitten werden: Für langen Kontext legen Sie diesen in messages, häufen Sie nicht alles im system an
Beispiel:

"You are a helpful assistant."

temperature
number

Sampling-Temperatur

Hinweise:

  • Je höher der Wert, desto vielfältiger die Ausgabe; je niedriger, desto deterministischer
  • Empfohlener Bereich [0, 1]
Erforderlicher Bereich: 0 <= x <= 1
Beispiel:

1

top_p
number

Nucleus-Sampling-Schwelle

Hinweise:

  • Bereich [0, 1]
  • Es wird empfohlen, temperature und top_p nicht gleichzeitig anzupassen
Erforderlicher Bereich: 0 <= x <= 1
Beispiel:

0.9

top_k
integer

Sampling nur aus den K Tokens mit der höchsten Wahrscheinlichkeit (Anthropic-spezifischer Parameter)

Hinweise:

  • Je kleiner der Wert, desto deterministischer die Ausgabe; je größer, desto vielfältiger die Kandidaten
Erforderlicher Bereich: x >= 0
Beispiel:

10

stop_sequences
string[]

Benutzerdefinierte Stoppsequenzen: Die Generierung stoppt, sobald eine der Zeichenketten getroffen wird

Hinweise:

  • Bei einem Treffer wird abgeschnitten, der Inhalt vor der Trefferstelle wird normal zurückgegeben
  • Achtung: Beim Treffen einer Stoppsequenz liefert die GLM-Serie für stop_reason den Wert end_turn (statt des Anthropic-Standardwerts stop_sequence), und die Antwort enthält auch kein stop_sequence-Feld. Wenn ein Client zur Trefferbestimmung auf stop_reason=="stop_sequence" angewiesen ist, ist eine Sonderbehandlung nötig
Beispiel:
stream
boolean
Standard:false

Ob als SSE-Stream zurückgegeben wird

  • true: Streaming-Rückgabe über Server-Sent Events (Standard-Anthropic-Ereignissequenz: message_start / content_block_start / content_block_delta / message_delta / message_stop)
  • false: Gibt nach vollständiger Antwort alles auf einmal zurück (Standard)
Beispiel:

false

thinking
object

Steuert das tiefe Denken

Hinweis:

  • Alle Modelle der GLM-Serie sind Reasoning-Modelle, und ohne dieses Feld ist das Denken standardmäßig aktiv
  • Ist es aktiv, enthält das content-Array der Antwort einen Reasoning-Block mit type="thinking" (wird als Ausgabe-Token abgerechnet, signature kann eine leere Zeichenkette sein)
  • Nur der binäre Schalter type wirkt: Parameter für Denkbudget oder -stufe wie budget_tokens und effort haben keine Wirkung (sie werden ignoriert)

Ob es abgeschaltet werden kann, hängt vom Modell ab:

  • glm-5.2: Mit {"type":"disabled"} lässt sich das Denken abschalten, was die Ausgabe-Token deutlich reduziert
  • glm-5.3 / glm-5.3-flash: denken immer und sind nicht abschaltbar. Wird disabled gesendet, gibt es einen Fehler

Die Folge: Die glm-5.3-Serie kann den Denkaufwand an diesem Endpunkt nicht senken. Er lässt sich weder abschalten (disabled erzeugt einen Fehler) noch verringern (budget_tokens und effort bleiben beide wirkungslos, und das übergeordnete reasoning_effort ist ein Feld des OpenAI-Protokolls, das dieser Endpunkt ignoriert). Denkinhalte werden als Ausgabe-Token abgerechnet, daher sind diese Kosten an diesem Endpunkt unvermeidbar.

Um die Denkkosten zu steuern, wechseln Sie zur Chat Completions API — dort wirken bei reasoning_effort die drei Stufen low / high / max tatsächlich. glm-5.2 unterliegt dieser Einschränkung nicht und kann das Denken auch an diesem Endpunkt direkt abschalten.

Migration von glm-5.2: Ist thinking.type=disabled im Code fest verdrahtet, muss dieses Feld vor dem Wechsel zu glm-5.3 entfernt werden, sonst schlägt die Anfrage unmittelbar fehl. Und wenn Sie die Kosten bisher über das Abschalten des Denkens gesteuert haben, gibt es an diesem Endpunkt keine gleichwertige Alternative — planen Sie den Umstieg auf die Chat Completions API gleich mit ein.

tools
object[]

Liste der Werkzeugdefinitionen

Hinweise:

  • Folgt der Anthropic-Werkzeugdefinitionsspezifikation
  • input_schema verwendet ein JSON-Schema-Objekt
  • Das Modell gibt einen Standard-tool_use-Block zurück, stop_reason=tool_use
tool_choice
object

Strategie der Werkzeugauswahl

metadata
object

Anfrage-Metadaten

Antwort

Nachrichtenobjekt

Nachrichtenantwort im Anthropic-Stil

id
string

Eindeutige Nachrichten-ID (Format: msg_<uuid>)

type
enum<string>

Typ des Antwortobjekts

Verfügbare Optionen:
message
role
enum<string>
Verfügbare Optionen:
assistant
model
string

Tatsächlich verwendetes Modell

Beispiel:

"glm-5.3"

content
object[]

Liste der Antwortinhaltsblöcke

Mögliche block type:

  • thinking: Denkprozess (wenn das Nachdenken aktiviert ist, standardmäßig aktiviert)
  • text: finaler Antworttext
  • tool_use: vom Modell ausgelöster Werkzeugaufruf
stop_reason
enum<string>

Stoppgrund

  • end_turn: natürliches Ende (wird auch beim Treffen von stop_sequences zurückgegeben)
  • max_tokens: max_tokens-Obergrenze erreicht
  • tool_use: Das Modell löst einen Werkzeugaufruf aus
Verfügbare Optionen:
end_turn,
max_tokens,
tool_use
usage
object

Token-Nutzungsstatistik (Anthropic-Spezifikation)