GLM Schnittstelle für alle Modelle - Chat Completions vollständige Parameter
- GLM-Modelle über das OpenAI-Chat-Completions-Protokoll aufrufen, das konkrete Modell wird über den Parameter
modelgewählt - Synchrone Verarbeitung, die den Gesprächsinhalt in Echtzeit zurückgibt
- Textgespräch: Kontextgespräche mit einer oder mehreren Runden;
glm-5.3-flashunterstützt zusätzlich Bildeingabe - System-Prompt: Rolle und Verhalten der KI über eine
role=system-Nachricht anpassen - Tiefes Denken:
thinking.typesteuert die Gedankenkette,reasoning_effortregelt die Denktiefe; der Denkprozess wird überreasoning_contentzurückgegeben - Streaming: SSE-Streaming-Antworten werden unterstützt (
stream=true) - Werkzeugaufrufe: Function Calling und Websuche werden unterstützt (
web_search, bis zu 128 Werkzeuge) - Strukturierte Ausgabe: JSON-Modus über
response_formataktivieren
Hinweis zu Streaming-Antworten: Bei stream=true erfolgt die Rückgabe über Server-Sent Events; jede Nachricht hat das Format data: {JSON}, und am Ende wird data: [DONE] gesendet. Jeder Datenblock (ChatCompletionChunk) enthält id, created, model, choices sowie optional usage und content_filter; darin liefert choices[].delta inkrementell role / content / reasoning_content / tool_calls, und choices[].finish_reason gibt im letzten Block den Abbruchgrund an.
https://direct.evolink.ai, die Textmodelle und langlebige Verbindungen besser unterstützt. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste und dient als Ausweichadresse für Textmodelle.glm-5.3 und glm-5.3-flash denken immer und sind nicht abschaltbar; bei reasoning_effort wirken die drei Stufen low / high / max, die übrigen werden automatisch auf die nächstgelegene verfügbare Stufe herabgestuft (xhigh → max, medium → high, minimal / none → low — es wird weiterhin gedacht und als Ausgabe abgerechnet). glm-5.2 kann das Denken mit thinking.type: "disabled" abschalten und unterstützt mehr Reasoning-Stufen. Einzelheiten finden Sie in den Beschreibungen der Felder thinking und reasoning_effort.glm-5.3-flash unterstützt, über image_url-Inhaltsblöcke innerhalb von messages[].content[]. Werden Bildblöcke an ein anderes Modell gesendet, gibt es einen Fehler.Autorisierungen
##Alle APIs erfordern eine Bearer-Token-Authentifizierung##
API-Schlüssel abrufen:
Besuchen Sie die API-Schlüsselverwaltung, um Ihren API-Schlüssel abzurufen
Zum Anfrage-Header hinzufügen:
Body
Aufzurufendes Modell:
glm-5.3, glm-5.3-flash, glm-5.2 "glm-5.3"
Liste der Konversationsnachrichten, enthält die vollständigen Kontextinformationen des aktuellen Gesprächs
Unterstützt vier Rollen: system, user, assistant, tool. Nachrichten mit unterschiedlichen Rollen haben unterschiedliche Feldstrukturen; wählen Sie die entsprechende Rolle zur Ansicht aus. Mindestens 1 Nachricht erforderlich, und es dürfen nicht ausschließlich System- oder Assistentennachrichten enthalten sein.
1- System Message
- User Message
- Assistant Message
- Tool Message
Ob der Streaming-Ausgabemodus aktiviert wird
false: Das Modell gibt die vollständige Antwort nach der Generierung auf einmal zurück (Standard), geeignet für kurze Texte und Stapelverarbeitungtrue: Gibt über Server-Sent Events (SSE) in Echtzeit blockweise zurück, geeignet für Chat und lange Texte; am Ende des Streams wirddata: [DONE]zurückgegeben
false
Steuert, ob die Gedankenkette (Chain of Thought) aktiviert wird
Steuert, wie stark das Modell schlussfolgert; wirkt nur bei aktivem thinking, Standard max
Die unterstützten Werte unterscheiden sich je Modell:
Die glm-5.3-Serie denkt immer, und wirklich wirksam sind nur die drei Stufen low / high / max; die übrigen vier führen nicht zu einem Fehler, sondern werden automatisch auf die nächstgelegene verfügbare Stufe herabgestuft (xhigh → max, medium → high, minimal / none → low).
Die glm-5.3-Serie kann das Denken nicht abschalten. minimal oder none senken es lediglich auf die unterste Stufe low; das Modell erzeugt weiterhin Denk-Token, die zum Ausgabetarif abgerechnet werden. Wenn Sie diese beiden Stufen zum Sparen verwenden, beachten Sie den Unterschied zu glm-5.2 — bei glm-5.2 wird tatsächlich auf das Denken verzichtet.
Für komplexe Aufgaben wie das Programmieren wird max empfohlen.
max, xhigh, high, medium, low, minimal, none "max"
Ob eine Sampling-Strategie aktiviert wird
true(Standard): Verwendettemperature/top_pfür zufälliges Sampling, vielfältigere Ausgabefalse: Wählt stets das Wort mit der höchsten Wahrscheinlichkeit (Greedy Decoding), deterministischere Ausgabe; in diesem Fall werdentemperatureundtop_pignoriert
Für Aufgaben, die Konsistenz und Reproduzierbarkeit erfordern (z. B. Codegenerierung, Übersetzung), wird false empfohlen
true
Sampling-Temperatur, steuert Zufälligkeit und Kreativität der Ausgabe
Hinweise:
- Wertebereich:
[0.0, 1.0], auf zwei Dezimalstellen begrenzt - Höhere Werte (z. B. 0,8): Zufälliger und kreativer, geeignet für kreatives Schreiben
- Niedrigere Werte (z. B. 0,2): Stabiler und deterministischer, geeignet für faktenbasierte Fragen und Codegenerierung
- Standardwert:
1.0
Empfehlung: Passen Sie temperature und top_p nicht gleichzeitig an
0 <= x <= 11
Nucleus-Sampling-Parameter, eine Alternative zum temperature-Sampling
Hinweise:
- Wertebereich:
[0.01, 1.0], auf zwei Dezimalstellen begrenzt - Das Modell berücksichtigt nur Kandidatenwörter, deren kumulative Wahrscheinlichkeit
top_perreicht; z. B. bedeutet 0,1, dass nur die wahrscheinlichsten 10 % der Wörter berücksichtigt werden - Kleinere Werte erzeugen fokussiertere, konsistentere Ausgabe; größere Werte erhöhen die Vielfalt
- Standardwert:
0.95
Empfehlung: Passen Sie temperature und top_p nicht gleichzeitig an
0.01 <= x <= 10.95
Obergrenze für die Anzahl der Ausgabe-Token des Modells
Hinweis:
- Die GLM-Serie unterstützt bis zu 131.072 Tokens (128K) Ausgabelänge; empfohlen wird ein Wert von mindestens
1024 - Ist
thinkingaktiv, zählen auch die Token der Gedankenkette zu dieser Grenze - Wird die Generierung mit
lengthabgeschnitten, erhöhen Sie diesen Wert
1 <= x <= 1310721024
Liste der Werkzeuge, die das Modell aufrufen kann
Hinweis:
- Unterstützt werden Funktionsaufrufe (
function) und Websuche (web_search) - Maximal 128 Funktionen
- Davon wird
web_searchpro Aufruf separat abgerechnet, wenn tatsächlich gesucht wird; für die übrigen Werkzeuge fallen keine zusätzlichen Kosten an
128- Function-Werkzeug
- Web-Search-Werkzeug (Websuche)
Steuert, wie das Modell auswählt, welche Funktion aufgerufen wird
Hinweise: Nur wirksam, wenn der Werkzeugtyp function ist; standardmäßig und ausschließlich wird auto unterstützt (das Modell entscheidet automatisch, ob ein Werkzeug aufgerufen wird)
auto "auto"
Liste der Stoppwörter
Hinweise:
- Wenn der generierte Text auf eine angegebene Zeichenkette trifft, wird die Generierung sofort gestoppt (das Stoppwort selbst ist im zurückgegebenen Text nicht enthalten)
- Derzeit wird nur ein einzelnes Stoppwort unterstützt, im Format
["stop_word1"], z. B.["Human:"]
4Gibt das Ausgabeformat der Modellantwort an, Standard ist text
Hinweise:
{ "type": "json_object" }aktiviert den JSON-Modus, das Modell gibt gültige Daten im JSON-Format zurück, geeignet für Szenarien wie strukturierte Datenextraktion- Bei Verwendung des JSON-Modus wird empfohlen, in der
system- oderuser-Nachricht ausdrücklich JSON-Ausgabe zu verlangen
Eindeutige Kennung der Anfrage
Hinweise:
- Wird von der Clientseite übergeben, Länge 6-64 Zeichen, zur Sicherstellung der Eindeutigkeit wird das UUID-Format empfohlen
- Wird sie nicht angegeben, generiert die Plattform sie automatisch
6 - 64"req-7f3a2c1e8b9d4f0a"
Eindeutige Kennung des Endbenutzers
Hinweise: Länge 6-128 Zeichen, empfohlen wird eine eindeutige Kennung ohne sensible Informationen; sie hilft der Plattform, Missbrauch zu überwachen und zu erkennen
6 - 128"user-abc123456"
Antwort
Chat-Vervollständigung erfolgreich generiert
Aufgaben-ID
"chatcmpl-a6613b56-c61c-94ba-9a9f-43d4cdc7d77a"
Antworttyp
chat.completion "chat.completion"
Anfrage-ID (wird zurückgegeben, wenn in der Anfrage request_id angegeben wurde)
"req-7f3a2c1e8b9d4f0a"
Erstellungszeit der Anfrage, Unix-Zeitstempel (Sekunden)
1777021417
Modellname
"glm-5.3"
Liste der Modellantworten
Token-Nutzungsstatistik, die bei Abschluss des Aufrufs zurückgegeben wird
Informationen zur Websuche, werden zurückgegeben, wenn das web_search-Werkzeug verwendet wird und eine Suche getroffen wird
Informationen zur Inhaltssicherheit