curl --request POST \
--url https://direct.evolink.ai/v1/messages \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"max_tokens": 1024,
"messages": [
{
"role": "user",
"content": "Hallo, Welt"
}
]
}
'{
"id": "msg_0842a705-9d0b-4eaa-b12d-09a4106326c5",
"type": "message",
"role": "assistant",
"model": "glm-5.3",
"content": [
{
"type": "thinking",
"thinking": "Der Benutzer bittet darum, mit einem Wort zu grüßen; eine Antwort mit \"Hi\" genügt.",
"signature": ""
},
{
"type": "text",
"text": "Hi."
}
],
"stop_reason": "end_turn",
"usage": {
"input_tokens": 18,
"output_tokens": 101,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"prompt_tokens_details": {
"cached_tokens": 0
}
}
}GLM Schnittstelle für alle Modelle - Messages vollständige Parameter
- GLM-Modelle über das Anthropic-Messages-Protokoll aufrufen, das konkrete Modell wird über den Parameter
modelgewählt - Anfrage- und Antwortstruktur entsprechen der Anthropic-API
- System-Prompt: wird über das Feld
systemauf oberster Ebene übergeben - Denkmodus: In der gesamten Serie ist das Denken standardmäßig aktiv und wird in
content[type=thinking]-Blöcken zurückgegeben; nurglm-5.2kann es mitthinking.type=disabledabschalten - Streaming: SSE-Ereignisstrom
- Werkzeugaufrufe: kompatibel mit dem Anthropic-Ablauf
tool_use/tool_result - Bildeingabe: nur von
glm-5.3-flashundglm-5.3-flashxunterstützen, Details siehe Feldmessages
curl --request POST \
--url https://direct.evolink.ai/v1/messages \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"max_tokens": 1024,
"messages": [
{
"role": "user",
"content": "Hallo, Welt"
}
]
}
'{
"id": "msg_0842a705-9d0b-4eaa-b12d-09a4106326c5",
"type": "message",
"role": "assistant",
"model": "glm-5.3",
"content": [
{
"type": "thinking",
"thinking": "Der Benutzer bittet darum, mit einem Wort zu grüßen; eine Antwort mit \"Hi\" genügt.",
"signature": ""
},
{
"type": "text",
"text": "Hi."
}
],
"stop_reason": "end_turn",
"usage": {
"input_tokens": 18,
"output_tokens": 101,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"prompt_tokens_details": {
"cached_tokens": 0
}
}
}https://direct.evolink.ai, die Textmodelle und langlebige Verbindungen besser unterstützt. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste und dient als Ausweichadresse für Textmodelle.signature kann leer sein.glm-5.2:thinking.type=disableddeaktiviert das Denken.glm-5.3/glm-5.3-flash/glm-5.3-flashx: Denken bleibt immer aktiv.disabledbehält den Standardmodus und die Berechnung als Ausgabe bei.
thinking.budget_tokens und thinking.effort legen keine GLM-Denkstufe fest. Kompatible Werte stehen beim Feld reasoning_effort auf oberster Ebene. Eine Einstellung, die das Denken bei glm-5.2 deaktiviert, hat diesen Effekt nach dem Wechsel zur 5.3-Serie nicht mehr.reasoning_effort: Kompatibilitätsfeld für GLM-Denkstufen auf oberster Anfrageebene, außerhalb von thinking. Der Endpunkt akzeptiert es, garantiert jedoch keine Steuerung der tatsächlichen Denkintensität.
Kompatibilitätsregeln für glm-5.3 / glm-5.3-flash / glm-5.3-flashx
| Übergebener Wert | Kompatibler Wert |
|---|---|
low / high / max | Unverändert |
xhigh | max |
medium | high |
minimal / none | low; Denken bleibt aktiv |
minimal und none deaktivieren das Denken der 5.3-Serie nicht. Denk-Tokens werden als Ausgabe berechnet. Unbekannte Werte bleiben ohne Kompatibilitätszuordnung unverändert; verwenden Sie die aufgeführten Werte. Diese Zuordnungen gelten nicht für glm-5.2.
Zur Steuerung der Denkintensität verwenden Sie reasoning_effort in Chat Completions oder reasoning.effort in Responses.
glm-5.3-flash und glm-5.3-flashx unterstützen Bildeingabe. Bildblöcke an glm-5.3 oder glm-5.2 können 200 zurückgeben, obwohl das Modell das Bild nicht lesen kann. Wählen Sie für Bildverständnis ein bildfähiges Modell.Autorisierungen
##Alle APIs erfordern eine Bearer-Token-Authentifizierung##
API-Key erhalten:
Besuchen Sie die API-Key-Verwaltungsseite, um Ihren API-Key zu erhalten
Zum Anfrage-Header hinzufügen:
Authorization: Bearer YOUR_API_KEY
Anmerkung: EvoLink verwendet für /v1/messages einheitlich die Bearer-Token-Authentifizierung.
Body
Aufzurufendes Modell:
| Modell-ID | Positionierung | Denken abschaltbar | Bildeingabe |
|---|---|---|---|
glm-5.3 | Flaggschiffmodell mit durchgängigen Fortschritten bei komplexer Softwareentwicklung und Agentenaufgaben; 1M Kontext | Nicht abschaltbar | Nicht unterstützt |
glm-5.3-flash | Leichtgewichtiges multimodales Modell, äußerst günstig und mit nativer Vision; 1M Kontext | Nicht abschaltbar | Unterstützt |
glm-5.3-flashx | Multimodales Modell mit Bildeingabe; 1M Kontext | Nicht abschaltbar | Unterstützt |
glm-5.2 | Flaggschiff der vorigen Generation, komplexes Reasoning und sehr langer Kontext; 1M Kontext | Abschaltbar (thinking.type=disabled) | Nicht unterstützt |
glm-5.3, glm-5.3-flash, glm-5.3-flashx, glm-5.2 "glm-5.3"
Gesprächsnachrichten im Wechsel zwischen user und assistant. Mindestens eine Nachricht ist erforderlich; die letzte hat normalerweise role=user. Frühere Nachrichten liefern den Kontext für weitere Gesprächsrunden.
Bildeingabe: Nur glm-5.3-flash und glm-5.3-flashx unterstützen image-Blöcke im content-Array. Verwenden Sie für glm-5.3 und glm-5.2 nur Text. HTTP 200 bedeutet bei diesen Modellen nicht, dass das Bild gelesen wurde.
1Show child attributes
Show child attributes
Obergrenze für die Länge des erzeugten Inhalts (in Token)
Hinweis:
- Die GLM-Serie unterstützt bis zu 131.072 Tokens (128K) Ausgabelänge; empfohlen wird ein Wert von mindestens
1024 - Auch die durch thinking erzeugten Token zählen zu dieser Grenze
- Wird die Grenze erreicht, wird der Inhalt abgeschnitten und die Antwort enthält
stop_reason=max_tokens
1 <= x <= 1310721024
System-Prompt, dient zum Festlegen von Rolle und Verhalten der KI
Hinweise:
- Unterstützt eine Zeichenkette oder ein Array von Inhaltsblöcken
- Wird über das Top-Level-Feld
systemübergeben (nicht in messages legen) - Das Modell folgt den system-Vorgaben
- Ein zu langer system kann abgeschnitten werden: Für langen Kontext legen Sie diesen in
messages, häufen Sie nicht alles imsysteman
"You are a helpful assistant."
Sampling-Temperatur
Hinweise:
- Je höher der Wert, desto vielfältiger die Ausgabe; je niedriger, desto deterministischer
- Empfohlener Bereich
[0, 1]
0 <= x <= 11
Nucleus-Sampling-Schwelle
Hinweise:
- Bereich
[0, 1] - Es wird empfohlen, temperature und top_p nicht gleichzeitig anzupassen
0 <= x <= 10.9
Sampling nur aus den K Tokens mit der höchsten Wahrscheinlichkeit (Anthropic-spezifischer Parameter)
Hinweise:
- Je kleiner der Wert, desto deterministischer die Ausgabe; je größer, desto vielfältiger die Kandidaten
x >= 010
Benutzerdefinierte Stoppsequenzen: Die Generierung stoppt, sobald eine der Zeichenketten getroffen wird
Hinweise:
- Bei einem Treffer wird abgeschnitten, der Inhalt vor der Trefferstelle wird normal zurückgegeben
- Achtung: Beim Treffen einer Stoppsequenz liefert die GLM-Serie für
stop_reasonden Wertend_turn(statt des Anthropic-Standardwertsstop_sequence), und die Antwort enthält auch keinstop_sequence-Feld. Wenn ein Client zur Trefferbestimmung aufstop_reason=="stop_sequence"angewiesen ist, ist eine Sonderbehandlung nötig
["\n\n"]
Ob als SSE-Stream zurückgegeben wird
true: Streaming-Rückgabe über Server-Sent Events (Standard-Anthropic-Ereignissequenz: message_start / content_block_start / content_block_delta / message_delta / message_stop)false: Gibt nach vollständiger Antwort alles auf einmal zurück (Standard)
false
Einstellungen für das Denken. Alle Modelle aktivieren es standardmäßig. thinking-Blöcke der Antwort werden als Ausgabe-Tokens berechnet; signature kann leer sein.
- glm-5.2: thinking.type=disabled deaktiviert das Denken.
- glm-5.3 / glm-5.3-flash / glm-5.3-flashx: Denken bleibt immer aktiv. disabled behält den Standardmodus und die Berechnung als Ausgabe bei.
thinking.budget_tokens und thinking.effort legen keine GLM-Denkstufe fest. Kompatible Werte stehen beim Feld reasoning_effort auf oberster Ebene. Eine Einstellung, die das Denken bei glm-5.2 deaktiviert, hat diesen Effekt nach dem Wechsel zur 5.3-Serie nicht mehr.
Show child attributes
Show child attributes
Kompatibilitätsfeld für GLM-Denkstufen auf oberster Anfrageebene, außerhalb von thinking. Der Endpunkt akzeptiert es, garantiert jedoch keine Steuerung der tatsächlichen Denkintensität.
Kompatibilitätsregeln für glm-5.3 / glm-5.3-flash / glm-5.3-flashx
| Übergebener Wert | Kompatibler Wert |
|---|---|
low / high / max | Unverändert |
xhigh | max |
medium | high |
minimal / none | low; Denken bleibt aktiv |
minimal und none deaktivieren das Denken der 5.3-Serie nicht. Denk-Tokens werden als Ausgabe berechnet. Unbekannte Werte bleiben ohne Kompatibilitätszuordnung unverändert; verwenden Sie die aufgeführten Werte. Diese Zuordnungen gelten nicht für glm-5.2.
Zur Steuerung der Denkintensität verwenden Sie reasoning_effort in Chat Completions oder reasoning.effort in Responses.
max, xhigh, high, medium, low, minimal, none Liste der Werkzeugdefinitionen
Hinweise:
- Folgt der Anthropic-Werkzeugdefinitionsspezifikation
input_schemaverwendet ein JSON-Schema-Objekt- Das Modell gibt einen Standard-
tool_use-Block zurück,stop_reason=tool_use
Show child attributes
Show child attributes
Strategie der Werkzeugauswahl
Show child attributes
Show child attributes
Anfrage-Metadaten
Show child attributes
Show child attributes
Antwort
Nachrichtenobjekt
Nachrichtenantwort im Anthropic-Stil
Eindeutige Nachrichten-ID (Format: msg_<uuid>)
Typ des Antwortobjekts
message assistant Tatsächlich verwendetes Modell
"glm-5.3"
Liste der Antwortinhaltsblöcke
Mögliche block type:
thinking: Denkprozess (wenn das Nachdenken aktiviert ist, standardmäßig aktiviert)text: finaler Antworttexttool_use: vom Modell ausgelöster Werkzeugaufruf
Show child attributes
Show child attributes
Stoppgrund
end_turn: natürliches Ende (wird auch beim Treffen von stop_sequences zurückgegeben)max_tokens: max_tokens-Obergrenze erreichttool_use: Das Modell löst einen Werkzeugaufruf aus
end_turn, max_tokens, tool_use Token-Nutzungsstatistik (Anthropic-Spezifikation)
Show child attributes
Show child attributes