GLM Schnittstelle für alle Modelle - Messages vollständige Parameter
- GLM-Modelle über das Anthropic-Messages-Protokoll aufrufen, das konkrete Modell wird über den Parameter
modelgewählt - Anfrage- und Antwortstruktur entsprechen der Anthropic-API
- System-Prompt: wird über das Feld
systemauf oberster Ebene übergeben - Denkmodus: In der gesamten Serie ist das Denken standardmäßig aktiv und wird in
content[type=thinking]-Blöcken zurückgegeben; nurglm-5.2kann es mitthinking.type=disabledabschalten - Streaming: SSE-Ereignisstrom
- Werkzeugaufrufe: kompatibel mit dem Anthropic-Ablauf
tool_use/tool_result - Bildeingabe: tatsächlich nur von
glm-5.3-flashunterstützt, Details siehe Feldmessages
https://direct.evolink.ai, die Textmodelle und langlebige Verbindungen besser unterstützt. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste und dient als Ausweichadresse für Textmodelle.glm-5.2 unterstützt thinking.type: "disabled"; glm-5.3 und glm-5.3-flash denken immer und geben bei disabled einen Fehler zurück. Entfernen Sie beim Wechsel von glm-5.2 zuerst das fest verdrahtete disabled, bevor Sie das Modell umstellen.Autorisierungen
##Alle APIs erfordern eine Bearer-Token-Authentifizierung##
API-Key erhalten:
Besuchen Sie die API-Key-Verwaltungsseite, um Ihren API-Key zu erhalten
Zum Anfrage-Header hinzufügen:
Anmerkung: EvoLink verwendet für /v1/messages einheitlich die Bearer-Token-Authentifizierung.
Body
Aufzurufendes Modell:
glm-5.3, glm-5.3-flash, glm-5.2 "glm-5.3"
Liste der Konversationsnachrichten, abwechselnd user / assistant
Hinweis:
- Mindestens eine Nachricht ist erforderlich
- Die letzte Nachricht ist üblicherweise
role=user - Mehrstufiger Kontext wird unterstützt, das Modell bezieht sich auf den Verlauf
Bildeingabe: Nur glm-5.3-flash unterstützt sie, über einen {"type":"image","source":{...}}-Block im content-Array.
Werden Bildinhaltsblöcke an glm-5.3 oder glm-5.2 gesendet, gibt es keinen Fehler, das Modell kann das Bild jedoch nicht lesen. Die Anfrage liefert wie gewohnt 200, und das Modell antwortet allein anhand des Textes — die Antwort wirkt plausibel, hat mit dem Bild aber nichts zu tun, und das Ergebnis fällt von Anfrage zu Anfrage unterschiedlich aus.
Solche stillen Fehler sind im Produktivbetrieb schwer aufzuspüren; wählen Sie daher glm-5.3-flash, wenn Sie Bildverständnis benötigen.
1Obergrenze für die Länge des erzeugten Inhalts (in Token)
Hinweis:
- Die GLM-Serie unterstützt bis zu 131.072 Tokens (128K) Ausgabelänge; empfohlen wird ein Wert von mindestens
1024 - Auch die durch thinking erzeugten Token zählen zu dieser Grenze
- Wird die Grenze erreicht, wird der Inhalt abgeschnitten und die Antwort enthält
stop_reason=max_tokens
1 <= x <= 1310721024
System-Prompt, dient zum Festlegen von Rolle und Verhalten der KI
Hinweise:
- Unterstützt eine Zeichenkette oder ein Array von Inhaltsblöcken
- Wird über das Top-Level-Feld
systemübergeben (nicht in messages legen) - Das Modell folgt den system-Vorgaben
- Ein zu langer system kann abgeschnitten werden: Für langen Kontext legen Sie diesen in
messages, häufen Sie nicht alles imsysteman
"You are a helpful assistant."
Sampling-Temperatur
Hinweise:
- Je höher der Wert, desto vielfältiger die Ausgabe; je niedriger, desto deterministischer
- Empfohlener Bereich
[0, 1]
0 <= x <= 11
Nucleus-Sampling-Schwelle
Hinweise:
- Bereich
[0, 1] - Es wird empfohlen, temperature und top_p nicht gleichzeitig anzupassen
0 <= x <= 10.9
Sampling nur aus den K Tokens mit der höchsten Wahrscheinlichkeit (Anthropic-spezifischer Parameter)
Hinweise:
- Je kleiner der Wert, desto deterministischer die Ausgabe; je größer, desto vielfältiger die Kandidaten
x >= 010
Benutzerdefinierte Stoppsequenzen: Die Generierung stoppt, sobald eine der Zeichenketten getroffen wird
Hinweise:
- Bei einem Treffer wird abgeschnitten, der Inhalt vor der Trefferstelle wird normal zurückgegeben
- Achtung: Beim Treffen einer Stoppsequenz liefert die GLM-Serie für
stop_reasonden Wertend_turn(statt des Anthropic-Standardwertsstop_sequence), und die Antwort enthält auch keinstop_sequence-Feld. Wenn ein Client zur Trefferbestimmung aufstop_reason=="stop_sequence"angewiesen ist, ist eine Sonderbehandlung nötig
Ob als SSE-Stream zurückgegeben wird
true: Streaming-Rückgabe über Server-Sent Events (Standard-Anthropic-Ereignissequenz: message_start / content_block_start / content_block_delta / message_delta / message_stop)false: Gibt nach vollständiger Antwort alles auf einmal zurück (Standard)
false
Steuert das tiefe Denken
Hinweis:
- Alle Modelle der GLM-Serie sind Reasoning-Modelle, und ohne dieses Feld ist das Denken standardmäßig aktiv
- Ist es aktiv, enthält das
content-Array der Antwort einen Reasoning-Block mittype="thinking"(wird als Ausgabe-Token abgerechnet,signaturekann eine leere Zeichenkette sein) - Nur der binäre Schalter
typewirkt: Parameter für Denkbudget oder -stufe wiebudget_tokensundefforthaben keine Wirkung (sie werden ignoriert)
Ob es abgeschaltet werden kann, hängt vom Modell ab:
glm-5.2: Mit{"type":"disabled"}lässt sich das Denken abschalten, was die Ausgabe-Token deutlich reduziertglm-5.3/glm-5.3-flash: denken immer und sind nicht abschaltbar. Wirddisabledgesendet, gibt es einen Fehler
Die Folge: Die glm-5.3-Serie kann den Denkaufwand an diesem Endpunkt nicht senken. Er lässt sich weder abschalten (disabled erzeugt einen Fehler)
noch verringern (budget_tokens und effort bleiben beide wirkungslos, und das übergeordnete reasoning_effort ist ein Feld des OpenAI-Protokolls, das dieser Endpunkt ignoriert).
Denkinhalte werden als Ausgabe-Token abgerechnet, daher sind diese Kosten an diesem Endpunkt unvermeidbar.
Um die Denkkosten zu steuern, wechseln Sie zur Chat Completions API —
dort wirken bei reasoning_effort die drei Stufen low / high / max tatsächlich. glm-5.2 unterliegt dieser Einschränkung nicht und kann das Denken auch an diesem Endpunkt direkt abschalten.
Migration von glm-5.2: Ist thinking.type=disabled im Code fest verdrahtet, muss dieses Feld vor dem Wechsel zu glm-5.3 entfernt werden, sonst schlägt die Anfrage unmittelbar fehl.
Und wenn Sie die Kosten bisher über das Abschalten des Denkens gesteuert haben, gibt es an diesem Endpunkt keine gleichwertige Alternative — planen Sie den Umstieg auf die Chat Completions API gleich mit ein.
Liste der Werkzeugdefinitionen
Hinweise:
- Folgt der Anthropic-Werkzeugdefinitionsspezifikation
input_schemaverwendet ein JSON-Schema-Objekt- Das Modell gibt einen Standard-
tool_use-Block zurück,stop_reason=tool_use
Strategie der Werkzeugauswahl
Anfrage-Metadaten
Antwort
Nachrichtenobjekt
Nachrichtenantwort im Anthropic-Stil
Eindeutige Nachrichten-ID (Format: msg_<uuid>)
Typ des Antwortobjekts
message assistant Tatsächlich verwendetes Modell
"glm-5.3"
Liste der Antwortinhaltsblöcke
Mögliche block type:
thinking: Denkprozess (wenn das Nachdenken aktiviert ist, standardmäßig aktiviert)text: finaler Antworttexttool_use: vom Modell ausgelöster Werkzeugaufruf
Stoppgrund
end_turn: natürliches Ende (wird auch beim Treffen von stop_sequences zurückgegeben)max_tokens: max_tokens-Obergrenze erreichttool_use: Das Modell löst einen Werkzeugaufruf aus
end_turn, max_tokens, tool_use Token-Nutzungsstatistik (Anthropic-Spezifikation)