Greifen Sie über die einheitliche Chat-API von EvoLink auf GLM-5.3 von Z.ai zu – auch gesucht als Zhipu GLM-5.3 / GLM 5.3 –. Testen Sie Coding mit langem Kontext, mehrstufige Agents, Prompt-Caching vor der Integration.
Reasoning immer aktivPrompt-CachingTool-AufrufeChat + Messages
ProduktionsrouteDiese Rate zeigt die plattformseitige Verfügbarkeit — nur bestätigte Serverfehler (HTTP 500 / leere Antwort) zählen als Ausfälle. Nutzerseitige Probleme (Inhaltsmoderation, ungültige Parameter, Abbruch) sowie Rate-Limits, Timeouts und Auth-Fehler sind ausgenommen. Vor echtem Traffic können leere Zeitfenster als verfügbar erscheinen.Live
Live
Kontext
1M Kontext · max. 131K Ausgabe
Geeignet für
Coding-Agenten, lange Aufgabenketten, toollastige Workflows
Eingabe
Text
Ausgabe
Text · JSON (strukturierte Ausgabe) · Tool-Aufrufe
Das Flaggschiff-Reasoning-Modell von Z.ai für Coding-Agenten und langlaufende Engineering-Aufgaben: 1 Mio. Tokens Kontext, dauerhaft aktives Reasoning, Tool-Calling und Prompt-Caching über Chat Completions und Anthropic Messages.
GLM-5.3
Z.ai Flaggschiff-Reasoning-Modell
Ausgewählt
Modell-ID
glm-5.3
Geeignet für
Coding-Agenten auf Repository-Ebene, lange Aufgabenketten, tool-intensive Workflows und Agent-Schleifen mit stabilem Prefix, bei denen Cache-Reads den Großteil des Inputs tragen.
Eingabe
$1.400 / 1M95.2 cr / 1M
Cache-Lesen
$0.261 / 1M17.7 cr / 1M
Ausgabe
$4.400 / 1M299.2 cr / 1M
Alle Tarife gelten pro 1M Tokens, in USD und Credits, und entsprechen der aktuellen Preisgestaltung Ihres Kontos.
GLM-5.3 Preise
Schätzen Sie vor der Integration die Kosten einer GLM-5.3-Anfrage. Der Rechner verwendet die aktuellen Tarife Ihres Kontos; offizielle Preise dienen als Vergleich.
Anfragen-Rechner
Geben Sie den Token-Mix einer Anfrage und die Anzahl erfolgreicher Tool-Aufrufe ein.
Nur erfolgreiche serverseitige Aufrufe werden pro Aufruf berechnet; fehlgeschlagene Versuche kosten keine Tool-Gebühr, Tokens werden weiterhin berechnet.
Websuche$0.010/ Aufruf·0.68 cr / Aufruf
GLM-5.3 API für Coding-Agenten und langlaufendes Engineering
Z.ais Flaggschiff-Reasoning-Modell für $1,40 Input und $4,40 Output pro 1 Mio. Token über die einheitliche EvoLink API aufrufen. Modell-ID glm-5.3, 1 Mio. Kontext, dauerhaftes low/high/max Reasoning, Tool-Calling und Prompt-Caching.
GLM-5.3 wird auf EvoLink unter der Modell-ID glm-5.3 über Chat Completions · Responses · Anthropic Messages bereitgestellt – mit demselben API-Key und Guthaben wie jedes andere Modell. Es bietet ein Kontextfenster von 1M und bis zu 131K Ausgabe-Tokens, dazu Coding mit langem Kontext, mehrstufige Agents, Prompt-Caching.
GLM-5.3 Spezifikationen und Fähigkeiten
Die Zahlen stammen aus der EvoLink-Routenkonfiguration; die Fähigkeiten entsprechen dem, was die API heute bereitstellt.
Kontextfenster
1M Tokens
Max. Ausgabe
131K Tokens
Eingabe
Text
Ausgabe
Text · JSON (strukturierte Ausgabe) · Tool-Aufrufe
Reasoning
Dauerhaft aktives Reasoning
Tool-Nutzung
Function Calling mit mehrstufigen Tool-Sequenzen
Prompt-Caching
Automatische Cache-Lesezugriffe zu niedrigerem Tarif
Serverseitige Tools
Websuche, abgerechnet pro erfolgreichem Aufruf
Protokolle
Chat Completions · Responses · Anthropic Messages
Modell-ID
glm-5.3
Warum GLM-5.3 diese Workloads bewältigen kann
Drei Eigenschaften tragen den Großteil. Jede impliziert zugleich eine Art, das Modell falsch zu nutzen — daher lohnt sich das Verständnis, bevor Produktions-Traffic fließt.
1 Mio. Tokens Arbeitskontext zum Einheitspreis
Es gibt keine Long-Context-Preisstufe — der Satz bei Token 900.000 entspricht dem bei Token 1.000. Das nimmt einen häufigen Grund für aggressives Kürzen, macht das Füllen des Fensters aber weder kostenlos noch genauer.
Byte-genaue Weitergabe des Requests
Abgesehen vom Modellnamen erreicht der Request-Body den Upstream unverändert, sodass GLM-spezifische Felder, Prompt-Cache-Prefix-Hashes und Reasoning-Signaturen auf beiden Endpunkten erhalten bleiben.
Reasoning-Tokens in der Output-Abrechnung enthalten
Reasoning wird innerhalb der Completion-Tokens abgerechnet, nicht als eigene Position. Das Limit von 131.072 Output-Tokens umfasst also Reasoning und finale Antwort gemeinsam. Output-Budgets nach Aufgabe setzen, nicht nach dem Limit.
Wo GLM-5.3 im produktiven Modell-Stack sinnvoll ist
GLM-5.3 kostet mehr als GLM-5.2 und deutlich mehr als Flash. Es sollte also nicht allein deshalb zur Standardroute werden, weil es das neueste Modell ist. Am stärksten ist es dort, wo tieferes Reasoning einen Retry oder eine Runde manueller Korrektur einspart.
GLM-5.3 für Coding auf Repository-Ebene
Zusammenhängende Module, Tests und Konventionen liegen in einem 1-Mio.-Token-Kontext, statt einen Coding-Agenten Datei für Datei zu füttern. Der Gewinn zeigt sich in weniger kaputten dateiübergreifenden Änderungen, nicht in schöneren Einzeldatei-Vervollständigungen.
GLM-5.3 für lange Aufgabenketten
Plan-Execute-Verify-Schleifen über viele Schritte profitieren am meisten, weil ein früher Reasoning-Fehler sich über die gesamte Kette fortpflanzt. Messen Sie die Rate abgeschlossener Ketten, nicht die Qualität einzelner Schritte.
GLM-5.3 für tool-intensive Agenten
Große Tool-Schemata und lange Instruktionsblöcke liegen im gecachten Prefix, sodass die Grenzkosten eines weiteren Schritts nahe am Cache-Read-Satz bleiben statt am vollen Input-Satz.
GLM-5.3 über Anthropic-Protokoll-Clients
Anfragen an /v1/messages werden byte-genau durchgereicht, Prompt-Cache-Prefixe und Reasoning-Signaturen bleiben erhalten. Coding-CLIs mit Claude-Protokoll können direkt auf EvoLink zeigen und glm-5.3 wählen — ohne Übersetzungsschicht.
Was GLM-5.3 verändert — und was es bricht
GLM-5.3 ist kein Drop-in-Ersatz für GLM-5.2. Eine Parameteränderung ist ein harter Bruch, und der Preis hat sich bewegt. Diese vier Punkte vor dem Umstellen einer Produktionsroute lesen.
Breaking Change: Reasoning lässt sich nicht mehr abschalten
GLM-5.3 denkt immer und lehnt thinking.type: "disabled" ab. Jeder von GLM-5.2 migrierte Client, der den deaktivierten Modus weiterhin sendet, schlägt schlicht fehl. Offizieller Ersatz: thinking.type: "enabled" mit reasoning_effort: "low".
Drei Reasoning-Stufen, Standard ist max
reasoning_effort akzeptiert low, high und max und steht standardmäßig auf max. Da Output-Tokens die Reasoning-Tokens enthalten, verschiebt die Stufe die Kosten direkt — den Standard bei Routineaufrufen in großer Menge stehen zu lassen, ist der häufigste Weg, bei 5.3 zu viel auszugeben.
Cache-Reads sind der günstigste Hebel auf dieser Seite
Cache-Read-Tokens kosten rund ein Fünftel von frischem Input. In langen Agent-Schleifen, in denen System-Prompt und Tool-Schemata den Input dominieren, wirkt ein byte-stabiles Prefix stärker auf die Rechnung als die Modellwahl selbst.
Teurer als GLM-5.2, ohne Rabatt
Der Input liegt rund 40% über dem aktuellen GLM-5.2-Satz, weil 5.3 ohne Aktionsrabatt zum Upstream-Preis abgerechnet wird. Nur dorthin routen, wo das zusätzliche Reasoning messbar den Preis wert ist; der Rest bleibt auf 5.2 oder Flash.
Zwei Wege, GLM-5.3 zu nutzen: EvoLink API oder Agent
Nutzen Sie die EvoLink API für Produkt-Backends und Batch-Jobs oder rufen Sie GLM-5.3 aus Codex, Claude oder Gemini für Coding- und Analyse-Workflows auf. Beide Wege teilen denselben EvoLink API-Key, das Guthaben, die Modell-ID und die Anfragehistorie.
Senden Sie OpenAI-kompatible Chat-Completions- (oder Anthropic-Messages-) Anfragen an EvoLink und steuern Sie Modell-ID, System-Prompt, Ausgabebudget, Tools und strukturierte Ausgabe.
1Erstellen Sie einen EvoLink API-Key in der Konsole
2Richten Sie Ihr OpenAI- oder Anthropic-SDK auf die EvoLink-Basis-URL und wählen Sie die oben gezeigte Modell-ID
3Senden Sie eine repräsentative Anfrage und lesen Sie im Feld usage Eingabe-, Cache- und Ausgabe-Tokens ab
4Setzen Sie max_tokens und Wiederholungen pro Aufgabe; behalten Sie Tool-Call-IDs und -Ergebnisse über Runden hinweg
Ideal für: Coding-, Review- und Analyseaufgaben in Codex, Claude und Gemini
Geben Sie dem Agenten Aufgabe, Eingaben und Abnahmekriterien. Er baut die Anfrage, ruft GLM-5.3 über EvoLink auf und liefert die Antwort samt Token-Verbrauch.
1Setzen Sie EVOLINK_API_KEY in Ihrer lokalen Umgebung; nie in Code oder Prompt
2Beschreiben Sie Aufgabe, einzubeziehende Eingaben und das erwartete Ausgabeformat
3Lassen Sie den Agenten GLM-5.3 über EvoLink aufrufen und die Anfrage vor dem Senden zeigen
4Lassen Sie den Agenten Antwort, Token-Verbrauch und etwaige Fehlermeldungen berichten
GLM-5.3 API-Codebeispiel und Fehlerbehandlung
Dieses Beispiel zeigt die kürzeste lauffähige Anfrage: ein OpenAI-kompatibler Chat-Completions-Aufruf mit System-Prompt, Nutzernachricht und Ausgabebudget. Die vollständige Parameter- und Antwortreferenz finden Sie im API-Tab.
curl -X POST https://api.evolink.ai/v1/chat/completions \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "glm-5.3",
"messages": [
{ "role": "system", "content": "You are a senior engineer. Answer in JSON when asked." },
{ "role": "user", "content": "Review this diff and list risky changes as a JSON array:\n<diff>" }
],
"reasoning_effort": "low",
"max_tokens": 2048,
"stream": true
}'
# Reasoning is always on: reasoning_effort accepts low / high / max
# (default max) and thinking.type "disabled" is rejected.
# The same model ID works on /v1/messages (Anthropic Messages).
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens; completion tokens include reasoning).
Ungültige Anfrage oder nicht unterstützter Parameter
Prüfen Sie Modell-ID, messages-Array und Parameterbereiche anhand der API-Referenz; entfernen Sie Felder, die diese Route nicht unterstützt.
Authentifizierungs- oder Guthabenproblem
Prüfen Sie das Authorization-Bearer-Token und bestätigen Sie das verfügbare Guthaben in der Konsole.
Kontextlänge überschritten
Die Prompt-Tokens übersteigen das Kontextfenster von GLM-5.3. Kürzen Sie oder rufen Sie nur relevante Belege ab und nutzen Sie gecachte Präfixe wieder.
Ratenlimit (429)
Mit Backoff und Jitter erneut versuchen; Anfragen bündeln oder in eine Warteschlange stellen statt parallel zu senden.
Inhalt oder Tool-Aufruf abgelehnt
Prüfen Sie sensible Inhalte, fehlerhafte Tool-Call-Argumente und JSON-Schema-Abweichungen vor dem erneuten Versuch.
Was vor dem Routing von Produktions-Traffic auf GLM-5.3 zu prüfen ist
Vier Prüfungen fangen fast alle Migrationsprobleme bei diesem Modell ab. Die ersten beiden sind harte Fehler, die letzten beiden stille Kostenprobleme.
01
glm-5.3 als Modell-ID verwenden
Dieselbe ID gilt für Chat Completions und Anthropic Messages und entspricht exakt dem Upstream-Namen — kein Alias zu übersetzen.
Erforderlich
02
Jedes thinking.type: "disabled" entfernen
Der einzige harte Bruch gegenüber GLM-5.2. Durch thinking.type: "enabled" plus reasoning_effort: "low" ersetzen und die Regressions-Prompts erneut ausführen.
Breaking
03
reasoning_effort bewusst setzen
Standard ist max. Routine- und latenzkritische Aufrufe auf low senken und prüfen, ob die Akzeptanzquote hält, bevor die Ersparnis eingeplant wird.
Kosten
04
Prüfen, ob Cache-Reads wirklich greifen
Kontrollieren, ob gecachte Tokens in der zurückgegebenen usage erscheinen. Verschiebt sich das Prefix zwischen Aufrufen, wird jede Anfrage zum vollen Input-Satz abgerechnet — in der Antwort selbst ist das unsichtbar.
Kosten
Cache-Reads kosten rund ein Fünftel von frischem Input
Gecachter Input wird zu einem eigenen, niedrigeren Satz abgerechnet — ein stabiler System-Prompt, Repository-Regeln und Tool-Schemata bleiben über lange Agent-Schleifen hinweg günstig. Eine Gebühr für Cache-Writes gibt es nicht, da der Upstream keine Cache-Creation-Tokens meldet.
1 Mio. Tokens Kontext, 131K Output-Limit
Halten Sie zusammenhängenden Code, Spezifikationen und Agent-State in einem Arbeitskontext. Das Limit ist Kapazität, kein Ziel: gezielt abrufen, das Prefix stabil halten, damit es cacht, und Output-Budgets nach Aufgabe setzen.
Bei GLM-5.3 die Kosten pro akzeptierter Aufgabe vergleichen, nicht nur den Token-Preis
GLM-5.3 ist pro Token teurer als GLM-5.2 und Flash. Das zählt nur zusammen damit, wie oft jedes Modell ein Ergebnis liefert, das Sie tatsächlich ausliefern. Diese Signale eine Woche lang auf eigenen Workloads verfolgen, bevor eine Route festgelegt wird.
First-Pass-ErfolgsquoteAkzeptierte ErgebnisseRetries pro AufgabeReasoning-Anteil an Output-TokensCache-TrefferquoteGültige Tool-CallsZeit bis zum akzeptierten ErgebnisFallback-Rate
Eine Route, die pro Token 40% mehr kostet, aber einen von drei Retries einspart, ist in der Praxis günstiger. Eine Route, die 40% mehr kostet und nichts verändert, ist nur ein teurerer Standard. Unterscheiden lässt sich beides ausschließlich durch Messung an denselben Aufgaben.
Vor dem Wechsel mit GLM-5.2 und Kimi K3 vergleichen
EvoLink
GLM-5.3 liegt preislich über GLM-5.2. Die eigentliche Frage ist, ob weniger Retries und weniger manuelle Korrektur die Differenz auf Ihren Workloads decken. Erst messen, dann die Produktionsroute festlegen.
Coding-Agenten auf Repository-Ebene, lange Aufgabenketten, tool-intensive Workflows und Agent-Schleifen mit stabilem Prefix, bei denen Cache-Reads den Großteil des Inputs tragen.
Das bisherige GLM-Flaggschiff, weiterhin günstiger pro Token. Sinnvoll, wo 5.3 keinen messbaren Vorteil bringt — und für Clients, die auf deaktiviertes Reasoning angewiesen sind.
Moonshots Reasoning-Route mit 1 Mio. Kontext. Nützliche herstellerübergreifende Vergleichsbasis für Long-Context-Coding und Agenten.
GLM-5.3
Input / Output$1.4 / $4.4
Kontext1M
CachingCache-Reads
Am besten fürCoding-Agenten auf Repository-Ebene, lange Aufgabenketten, tool-intensive Workflows und Agent-Schleifen mit stabilem Prefix, bei denen Cache-Reads den Großteil des Inputs tragen.
Am besten fürDas bisherige GLM-Flaggschiff, weiterhin günstiger pro Token. Sinnvoll, wo 5.3 keinen messbaren Vorteil bringt — und für Clients, die auf deaktiviertes Reasoning angewiesen sind.
Am besten fürMoonshots Reasoning-Route mit 1 Mio. Kontext. Nützliche herstellerübergreifende Vergleichsbasis für Long-Context-Coding und Agenten.
GLM-Modellfamilie
Gleicher API-Key, gleiches Guthaben – Stufe wechseln, ohne die Integration zu ändern.
GLM-5.3
Aktuelles Modell
Z.ai Flaggschiff-Reasoning-Modell
GLM-5.2
Das bisherige GLM-Flaggschiff, weiterhin günstiger pro Token. Sinnvoll, wo 5.3 keinen messbaren Vorteil bringt — und für Clients, die auf deaktiviertes Reasoning angewiesen sind.
Gleiche 5.3-Generation zu etwa einem Neuntel des Preises, dazu native Bild-, Video- und Datei-Eingabe. Der richtige Standard für hohe Volumina und multimodale Arbeit.
Gleiches Basismodell, alle Gewinne aus dem Post-Training — plus der Breaking Change, dass Reasoning nicht mehr abschaltbar ist. Wann 5.2 bleiben sollte.
Ja. GLM-5.3 ist als Produktionsmodell verfügbar, erreichbar über Chat Completions und Anthropic Messages.
Welche Modell-ID nutze ich für die GLM-5.3 API?
glm-5.3 für beide Endpunkte. Der EvoLink-Modellname entspricht exakt dem Upstream-Namen.
Kann ich das OpenAI SDK oder Anthropic Messages weiterverwenden?
Ja. Richten Sie den Client mit demselben API-Key auf EvoLink und wählen Sie glm-5.3. Bis auf den Modellnamen wird der Request byte-genau durchgereicht, sodass Prompt-Cache-Prefixe und Reasoning-Signaturen erhalten bleiben.
Kann ich Reasoning wie bei GLM-5.2 deaktivieren?
Nein. GLM-5.3 denkt immer und lehnt thinking.type: "disabled" ab. Bei der Migration von GLM-5.2 auf thinking.type: "enabled" mit reasoning_effort: "low" umstellen — das ist der offizielle Ersatz.
Wie wähle ich reasoning_effort?
Standard ist max. Für Routineänderungen, Klassifikation und latenzkritische Aufrufe low; für Architektur, Debugging und lange Aufgabenketten high oder max. Output-Tokens enthalten Reasoning-Tokens, die Stufe verändert also direkt die Kosten.
Warum ist GLM-5.3 teurer als GLM-5.2?
GLM-5.3 wird zum Upstream-Satz ohne Rabatt abgerechnet, GLM-5.2 läuft auf einem Aktionspreis — der Input liegt rund 40% höher. Auf 5.3 umleiten, wo das zusätzliche Reasoning Retries einspart, sonst bei 5.2 oder GLM-5.3 Flash bleiben.
Wie wird Prompt-Caching abgerechnet?
Cache-Reads haben einen eigenen Satz, etwa ein Fünftel von frischem Input. Cache-Writes werden nicht berechnet, da der Upstream keine Cache-Creation-Tokens meldet. Für dauerhafte Treffer das Prompt-Prefix byte-stabil halten.
Wie groß sind Kontextfenster und Output-Limit?
1.000.000 Tokens Kontext und bis zu 131.072 Output-Tokens, zu einem einheitlichen Satz über das gesamte Fenster — es gibt keine Long-Context-Preisstufe.
GLM-5.3 oder GLM-5.3 Flash?
Flash kostet etwa ein Neuntel und akzeptiert Bild-, Video- und Datei-Eingaben. Für hohe Volumina, Multimodales und Routine mit Flash starten; zu GLM-5.3 wechseln, wenn eine Aufgabe tieferes Reasoning braucht und die Akzeptanzquote den Aufpreis trägt.
Verarbeitet GLM-5.3 Bilder?
Nein, GLM-5.3 ist reines Text-Modell. Für Bild-, Video- und Datei-Eingaben GLM-5.3 Flash verwenden.
Wie vergleiche ich GLM-5.3 mit Claude, GPT oder Kimi?
GLM-5.3 nach Kosten pro akzeptierter Aufgabe für Coding-Agenten und lange Ketten bewerten, Claude und GPT als Frontier-Referenz heranziehen und Kimi K3 als herstellerübergreifenden Long-Context-Vergleich nutzen.
Was sollte eine Produktionsbewertung messen?
First-Pass-Erfolg, akzeptierte Ergebnisse, Retries, Reasoning-Anteil am Output, Cache-Trefferquote, gültige Tool-Calls, Zeit bis zum akzeptierten Ergebnis und Fallback-Rate.