curl --request POST \
--url https://direct.evolink.ai/v1/chat/completions \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Bitte stelle dich vor"
}
]
}
'{
"id": "chatcmpl-a6613b56-c61c-94ba-9a9f-43d4cdc7d77a",
"object": "chat.completion",
"request_id": "req-7f3a2c1e8b9d4f0a",
"created": 1777021417,
"model": "glm-5.3",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "Hallo! Ich bin GLM-5.3 und kann dir bei Konversation, Schlussfolgern, Schreiben, Programmieren und vielen weiteren Aufgaben helfen.",
"reasoning_content": "Lass mich dieses Problem zunächst analysieren...",
"tool_calls": [
{
"id": "<string>",
"type": "function",
"function": {
"name": "<string>",
"arguments": "<string>"
}
}
]
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 24,
"completion_tokens": 346,
"total_tokens": 370,
"prompt_tokens_details": {
"cached_tokens": 0
},
"completion_tokens_details": {
"reasoning_tokens": 321
}
},
"web_search": [
{
"icon": "<string>",
"title": "<string>",
"link": "<string>",
"media": "<string>",
"publish_date": "<string>",
"content": "<string>",
"refer": "<string>"
}
],
"content_filter": [
{
"role": "assistant",
"level": 1
}
]
}{
"error": {
"code": 400,
"message": "Invalid request parameters",
"type": "invalid_request_error"
}
}{
"error": {
"code": 401,
"message": "Invalid or expired token",
"type": "authentication_error"
}
}{
"error": {
"code": 402,
"message": "Insufficient quota",
"type": "insufficient_quota_error",
"fallback_suggestion": "https://evolink.ai/dashboard/billing"
}
}{
"error": {
"code": 403,
"message": "Access denied for this model",
"type": "permission_error",
"param": "model"
}
}{
"error": {
"code": 404,
"message": "Specified model not found",
"type": "not_found_error",
"param": "model",
"fallback_suggestion": "glm-5.3"
}
}{
"error": {
"code": 429,
"message": "Rate limit exceeded",
"type": "rate_limit_error",
"fallback_suggestion": "retry after 60 seconds"
}
}{
"error": {
"code": 500,
"message": "Internal server error",
"type": "internal_server_error",
"fallback_suggestion": "try again later"
}
}{
"error": {
"code": 502,
"message": "Upstream AI service unavailable",
"type": "upstream_error",
"fallback_suggestion": "try different model"
}
}{
"error": {
"code": 503,
"message": "Service temporarily unavailable",
"type": "service_unavailable_error",
"fallback_suggestion": "retry after 30 seconds"
}
}GLM Schnittstelle für alle Modelle - Chat Completions vollständige Parameter
- GLM-Modelle über das OpenAI-Chat-Completions-Protokoll aufrufen, das konkrete Modell wird über den Parameter
modelgewählt - Synchrone Verarbeitung, die den Gesprächsinhalt in Echtzeit zurückgibt
- Textgespräch: Kontextgespräche mit einer oder mehreren Runden;
glm-5.3-flashunterstützt zusätzlich Bildeingabe - System-Prompt: Rolle und Verhalten der KI über eine
role=system-Nachricht anpassen - Tiefes Denken:
thinking.typesteuert die Gedankenkette,reasoning_effortregelt die Denktiefe; der Denkprozess wird überreasoning_contentzurückgegeben - Streaming: SSE-Streaming-Antworten werden unterstützt (
stream=true) - Werkzeugaufrufe: Function Calling und Websuche werden unterstützt (
web_search, bis zu 128 Werkzeuge) - Strukturierte Ausgabe: JSON-Modus über
response_formataktivieren
Hinweis zu Streaming-Antworten: Bei stream=true erfolgt die Rückgabe über Server-Sent Events; jede Nachricht hat das Format data: {JSON}, und am Ende wird data: [DONE] gesendet. Jeder Datenblock (ChatCompletionChunk) enthält id, created, model, choices sowie optional usage und content_filter; darin liefert choices[].delta inkrementell role / content / reasoning_content / tool_calls, und choices[].finish_reason gibt im letzten Block den Abbruchgrund an.
curl --request POST \
--url https://direct.evolink.ai/v1/chat/completions \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"messages": [
{
"role": "user",
"content": "Bitte stelle dich vor"
}
]
}
'{
"id": "chatcmpl-a6613b56-c61c-94ba-9a9f-43d4cdc7d77a",
"object": "chat.completion",
"request_id": "req-7f3a2c1e8b9d4f0a",
"created": 1777021417,
"model": "glm-5.3",
"choices": [
{
"index": 0,
"message": {
"role": "assistant",
"content": "Hallo! Ich bin GLM-5.3 und kann dir bei Konversation, Schlussfolgern, Schreiben, Programmieren und vielen weiteren Aufgaben helfen.",
"reasoning_content": "Lass mich dieses Problem zunächst analysieren...",
"tool_calls": [
{
"id": "<string>",
"type": "function",
"function": {
"name": "<string>",
"arguments": "<string>"
}
}
]
},
"finish_reason": "stop"
}
],
"usage": {
"prompt_tokens": 24,
"completion_tokens": 346,
"total_tokens": 370,
"prompt_tokens_details": {
"cached_tokens": 0
},
"completion_tokens_details": {
"reasoning_tokens": 321
}
},
"web_search": [
{
"icon": "<string>",
"title": "<string>",
"link": "<string>",
"media": "<string>",
"publish_date": "<string>",
"content": "<string>",
"refer": "<string>"
}
],
"content_filter": [
{
"role": "assistant",
"level": 1
}
]
}{
"error": {
"code": 400,
"message": "Invalid request parameters",
"type": "invalid_request_error"
}
}{
"error": {
"code": 401,
"message": "Invalid or expired token",
"type": "authentication_error"
}
}{
"error": {
"code": 402,
"message": "Insufficient quota",
"type": "insufficient_quota_error",
"fallback_suggestion": "https://evolink.ai/dashboard/billing"
}
}{
"error": {
"code": 403,
"message": "Access denied for this model",
"type": "permission_error",
"param": "model"
}
}{
"error": {
"code": 404,
"message": "Specified model not found",
"type": "not_found_error",
"param": "model",
"fallback_suggestion": "glm-5.3"
}
}{
"error": {
"code": 429,
"message": "Rate limit exceeded",
"type": "rate_limit_error",
"fallback_suggestion": "retry after 60 seconds"
}
}{
"error": {
"code": 500,
"message": "Internal server error",
"type": "internal_server_error",
"fallback_suggestion": "try again later"
}
}{
"error": {
"code": 502,
"message": "Upstream AI service unavailable",
"type": "upstream_error",
"fallback_suggestion": "try different model"
}
}{
"error": {
"code": 503,
"message": "Service temporarily unavailable",
"type": "service_unavailable_error",
"fallback_suggestion": "retry after 30 seconds"
}
}https://direct.evolink.ai, die Textmodelle und langlebige Verbindungen besser unterstützt. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste und dient als Ausweichadresse für Textmodelle.glm-5.3 und glm-5.3-flash denken immer und sind nicht abschaltbar; bei reasoning_effort wirken die drei Stufen low / high / max, die übrigen werden automatisch auf die nächstgelegene verfügbare Stufe herabgestuft (xhigh → max, medium → high, minimal / none → low — es wird weiterhin gedacht und als Ausgabe abgerechnet). glm-5.2 kann das Denken mit thinking.type: "disabled" abschalten und unterstützt mehr Reasoning-Stufen. Einzelheiten finden Sie in den Beschreibungen der Felder thinking und reasoning_effort.glm-5.3-flash unterstützt, über image_url-Inhaltsblöcke innerhalb von messages[].content[]. Werden Bildblöcke an ein anderes Modell gesendet, gibt es einen Fehler.Autorisierungen
##Alle APIs erfordern eine Bearer-Token-Authentifizierung##
API-Schlüssel abrufen:
Besuchen Sie die API-Schlüsselverwaltung, um Ihren API-Schlüssel abzurufen
Zum Anfrage-Header hinzufügen:
Authorization: Bearer YOUR_API_KEY
Body
Aufzurufendes Modell:
| Modell-ID | Positionierung | Denksteuerung | Bildeingabe |
|---|---|---|---|
glm-5.3 | Flaggschiffmodell mit durchgängigen Fortschritten bei komplexer Softwareentwicklung und Agentenaufgaben sowie deutlich stärkerer Programmierleistung als in der Vorgängergeneration; 1M Kontext | Denkt immer und ist nicht abschaltbar; bei reasoning_effort wirken nur low / high / max, andere Stufen werden automatisch herabgestuft | Nicht unterstützt |
glm-5.3-flash | Leichtgewichtiges multimodales Modell mit hybrider Architektur aus Sparse- und Linear-Attention, äußerst günstig und mit nativer Vision; 1M Kontext | Wie glm-5.3 | Unterstützt, siehe Feld messages |
glm-5.2 | Flaggschiff der vorigen Generation, komplexes Reasoning und sehr langer Kontext; 1M Kontext | Mit thinking.type: "disabled" abschaltbar; reasoning_effort unterstützt alle 7 Stufen | Nicht unterstützt |
glm-5.3, glm-5.3-flash, glm-5.2 "glm-5.3"
Liste der Konversationsnachrichten, enthält die vollständigen Kontextinformationen des aktuellen Gesprächs
Unterstützt vier Rollen: system, user, assistant, tool. Nachrichten mit unterschiedlichen Rollen haben unterschiedliche Feldstrukturen; wählen Sie die entsprechende Rolle zur Ansicht aus. Mindestens 1 Nachricht erforderlich, und es dürfen nicht ausschließlich System- oder Assistentennachrichten enthalten sein.
1- System Message
- User Message
- Assistant Message
- Tool Message
Show child attributes
Show child attributes
Ob der Streaming-Ausgabemodus aktiviert wird
false: Das Modell gibt die vollständige Antwort nach der Generierung auf einmal zurück (Standard), geeignet für kurze Texte und Stapelverarbeitungtrue: Gibt über Server-Sent Events (SSE) in Echtzeit blockweise zurück, geeignet für Chat und lange Texte; am Ende des Streams wirddata: [DONE]zurückgegeben
false
Steuert, ob die Gedankenkette (Chain of Thought) aktiviert wird
Show child attributes
Show child attributes
Steuert, wie stark das Modell schlussfolgert; wirkt nur bei aktivem thinking, Standard max
Die unterstützten Werte unterscheiden sich je Modell:
| Wert | glm-5.3 / glm-5.3-flash | glm-5.2 |
|---|---|---|
max | Tiefes Reasoning (Standard) | Tiefes Reasoning |
high | Verstärktes Reasoning | Verstärktes Reasoning |
low | Leichtes Reasoning | Wie high |
xhigh | Herabgestuft auf max | Wie max |
medium | Herabgestuft auf high | Wie high |
minimal | Herabgestuft auf low (denkt weiterhin) | Verzichtet auf das Denken |
none | Herabgestuft auf low (denkt weiterhin) | Verzichtet auf das Denken |
Die glm-5.3-Serie denkt immer, und wirklich wirksam sind nur die drei Stufen low / high / max; die übrigen vier führen nicht zu einem Fehler, sondern werden automatisch auf die nächstgelegene verfügbare Stufe herabgestuft (xhigh → max, medium → high, minimal / none → low).
Die glm-5.3-Serie kann das Denken nicht abschalten. minimal oder none senken es lediglich auf die unterste Stufe low; das Modell erzeugt weiterhin Denk-Token, die zum Ausgabetarif abgerechnet werden. Wenn Sie diese beiden Stufen zum Sparen verwenden, beachten Sie den Unterschied zu glm-5.2 — bei glm-5.2 wird tatsächlich auf das Denken verzichtet.
Für komplexe Aufgaben wie das Programmieren wird max empfohlen.
max, xhigh, high, medium, low, minimal, none "max"
Ob eine Sampling-Strategie aktiviert wird
true(Standard): Verwendettemperature/top_pfür zufälliges Sampling, vielfältigere Ausgabefalse: Wählt stets das Wort mit der höchsten Wahrscheinlichkeit (Greedy Decoding), deterministischere Ausgabe; in diesem Fall werdentemperatureundtop_pignoriert
Für Aufgaben, die Konsistenz und Reproduzierbarkeit erfordern (z. B. Codegenerierung, Übersetzung), wird false empfohlen
true
Sampling-Temperatur, steuert Zufälligkeit und Kreativität der Ausgabe
Hinweise:
- Wertebereich:
[0.0, 1.0], auf zwei Dezimalstellen begrenzt - Höhere Werte (z. B. 0,8): Zufälliger und kreativer, geeignet für kreatives Schreiben
- Niedrigere Werte (z. B. 0,2): Stabiler und deterministischer, geeignet für faktenbasierte Fragen und Codegenerierung
- Standardwert:
1.0
Empfehlung: Passen Sie temperature und top_p nicht gleichzeitig an
0 <= x <= 11
Nucleus-Sampling-Parameter, eine Alternative zum temperature-Sampling
Hinweise:
- Wertebereich:
[0.01, 1.0], auf zwei Dezimalstellen begrenzt - Das Modell berücksichtigt nur Kandidatenwörter, deren kumulative Wahrscheinlichkeit
top_perreicht; z. B. bedeutet 0,1, dass nur die wahrscheinlichsten 10 % der Wörter berücksichtigt werden - Kleinere Werte erzeugen fokussiertere, konsistentere Ausgabe; größere Werte erhöhen die Vielfalt
- Standardwert:
0.95
Empfehlung: Passen Sie temperature und top_p nicht gleichzeitig an
0.01 <= x <= 10.95
Obergrenze für die Anzahl der Ausgabe-Token des Modells
Hinweis:
- Die GLM-Serie unterstützt bis zu 131.072 Tokens (128K) Ausgabelänge; empfohlen wird ein Wert von mindestens
1024 - Ist
thinkingaktiv, zählen auch die Token der Gedankenkette zu dieser Grenze - Wird die Generierung mit
lengthabgeschnitten, erhöhen Sie diesen Wert
1 <= x <= 1310721024
Liste der Werkzeuge, die das Modell aufrufen kann
Hinweis:
- Unterstützt werden Funktionsaufrufe (
function) und Websuche (web_search) - Maximal 128 Funktionen
- Davon wird
web_searchpro Aufruf separat abgerechnet, wenn tatsächlich gesucht wird; für die übrigen Werkzeuge fallen keine zusätzlichen Kosten an
128- Function-Werkzeug
- Web-Search-Werkzeug (Websuche)
Show child attributes
Show child attributes
Steuert, wie das Modell auswählt, welche Funktion aufgerufen wird
Hinweise: Nur wirksam, wenn der Werkzeugtyp function ist; standardmäßig und ausschließlich wird auto unterstützt (das Modell entscheidet automatisch, ob ein Werkzeug aufgerufen wird)
auto "auto"
Liste der Stoppwörter
Hinweise:
- Wenn der generierte Text auf eine angegebene Zeichenkette trifft, wird die Generierung sofort gestoppt (das Stoppwort selbst ist im zurückgegebenen Text nicht enthalten)
- Derzeit wird nur ein einzelnes Stoppwort unterstützt, im Format
["stop_word1"], z. B.["Human:"]
4["Human:"]
Gibt das Ausgabeformat der Modellantwort an, Standard ist text
Hinweise:
{ "type": "json_object" }aktiviert den JSON-Modus, das Modell gibt gültige Daten im JSON-Format zurück, geeignet für Szenarien wie strukturierte Datenextraktion- Bei Verwendung des JSON-Modus wird empfohlen, in der
system- oderuser-Nachricht ausdrücklich JSON-Ausgabe zu verlangen
Show child attributes
Show child attributes
Eindeutige Kennung der Anfrage
Hinweise:
- Wird von der Clientseite übergeben, Länge 6-64 Zeichen, zur Sicherstellung der Eindeutigkeit wird das UUID-Format empfohlen
- Wird sie nicht angegeben, generiert die Plattform sie automatisch
6 - 64"req-7f3a2c1e8b9d4f0a"
Eindeutige Kennung des Endbenutzers
Hinweise: Länge 6-128 Zeichen, empfohlen wird eine eindeutige Kennung ohne sensible Informationen; sie hilft der Plattform, Missbrauch zu überwachen und zu erkennen
6 - 128"user-abc123456"
Antwort
Chat-Vervollständigung erfolgreich generiert
Aufgaben-ID
"chatcmpl-a6613b56-c61c-94ba-9a9f-43d4cdc7d77a"
Antworttyp
chat.completion "chat.completion"
Anfrage-ID (wird zurückgegeben, wenn in der Anfrage request_id angegeben wurde)
"req-7f3a2c1e8b9d4f0a"
Erstellungszeit der Anfrage, Unix-Zeitstempel (Sekunden)
1777021417
Modellname
"glm-5.3"
Liste der Modellantworten
Show child attributes
Show child attributes
Token-Nutzungsstatistik, die bei Abschluss des Aufrufs zurückgegeben wird
Show child attributes
Show child attributes
Informationen zur Websuche, werden zurückgegeben, wenn das web_search-Werkzeug verwendet wird und eine Suche getroffen wird
Show child attributes
Show child attributes
Informationen zur Inhaltssicherheit
Show child attributes
Show child attributes