GLM-5.3 Flash API
GLM-5.3 Flash wählen
Das nativ multimodale Mitglied der 5.3-Generation: Text-, Bild-, Video- und Datei-Eingabe zu etwa einem Neuntel des GLM-5.3-Preises, mit demselben 1-Mio.-Kontext, dauerhaft aktivem Reasoning, Tool-Calling und Prompt-Caching.
GLM-5.3 Flash
Multimodales Hochvolumen-Modell von Z.ai
glm-5.3-flashKlassifikation und Extraktion in großen Mengen, Screenshot- und Dokumentverständnis, Video- und Dateianalyse sowie Routine-Agentenschritte, bei denen der Token-Preis das Routing entscheidet.
GLM-5.3 Flash Preise
Kalkulieren Sie eine Anfrage, bevor Sie Traffic umleiten. Alle Nutzergruppen zahlen denselben Satz, Output-Tokens enthalten Reasoning-Tokens bereits.
Token-Rechner
Token-Mix für eine Anfrage eingeben.Geschätzte Kosten pro Anfrage
GLM-5.3 FlashMindestbetrag: 0,01 Credits pro Anfrage. Bild-, Video- und Datei-Eingaben werden als Input-Tokens abgerechnet.
Budget-Orientierung
Ungefähre Anzahl Anfragen beim aktuellen Mix.Schnelltests
Tägliche Entwicklung
Produktionsbewertung
Modellpreise
| Modell | Kontext | Input-Tokens | Cache-Read-Tokens | Output-Tokens |
|---|---|---|---|---|
GLM-5.3 Flashglm-5.3-flash | Alle Kontextgrößen | $0.150 / 1M10.2 cr / 1M | $0.031 / 1M2.1 cr / 1M | $0.500 / 1M34 cr / 1M |
GLM-5.3 Flash
Alle KontextgrößenUSD und Credits je 1 Mio. Tokens, einheitlich über das gesamte 1-Mio.-Kontextfenster.
Die Websuche wird separat abgerechnet: 0.68 Credits pro Aufruf.
GLM-5.3 Flash API für multimodale Arbeit und hohe Volumina
Die Volumenstufe der 5.3-Generation auf der einheitlichen API von EvoLink. Text-, Bild-, Video- und Datei-Eingabe zu etwa einem Neuntel des GLM-5.3-Preises, bei gleichem 1-Mio.-Token-Kontext, dauerhaft aktivem Reasoning, Tool-Calling und Prompt-Caching.

Wo GLM-5.3 Flash im produktiven Modell-Stack hingehört
Flash ist für Volumen bepreist. Die Frage ist selten, ob Sie es sich leisten können — sondern ob es Ihre Genauigkeitsschwelle erreicht. Erst Flash laufen lassen, nur Fehlschläge eskalieren: dann arbeitet der Preisabstand zum Flaggschiff für Sie.
Klassifikation und Extraktion in großen Mengen
Ticket-Routing, Tagging, strukturierte Extraktion und Content-Triage laufen zu einem Preis, bei dem ein kompletter Neulauf weniger kostet als die Entwicklungszeit, ihn zu vermeiden. Die Batch-Größe ist nicht länger die Randbedingung.
Screenshot- und Dokumentverständnis
UI-Screenshots, gescannte Seiten oder Diagramme als image_url-Blöcke senden und strukturierte Ausgabe zurückbekommen. Genau das kann GLM-5.3 gar nicht — das Flaggschiff ist reines Text-Modell.
Video- und Dateianalyse
Video- und Datei-Eingaben werden nativ akzeptiert statt über eine separate Pipeline, sodass eine Anfrage gemischtes Material tragen kann, statt in Transkriptions- und Reasoning-Schritt zerlegt zu werden.
Routineschritte innerhalb eines größeren Agenten
Ein Tool-Ergebnis zusammenfassen, einen Zweig wählen, Ausgaben umformatieren — die Schritte, die das Anrufvolumen dominieren, aber nicht die Schwierigkeit. Das Flaggschiff bleibt für die Schritte, in denen Reasoning-Tiefe das Ergebnis wirklich entscheidet.
Was Flash bietet — und was es dafür verlangt
Flash ist kein abgespecktes 5.3 mit kleinerem Fenster: Kontext, Protokolle und Caching sind identisch. Zwei Dinge unterscheiden sich, und eines davon sollten Sie selbst nachmessen.
Native multimodale Eingabe, die dem Flaggschiff fehlt
Text, Bild, Video und Datei laufen alle über die Standard-messages-Struktur. Bilder kommen als image_url-Blöcke mit öffentlicher URL (offiziell empfohlen) oder Base64-Data-URL, ein Block pro Bild.
Rund ein Neuntel des Flaggschiff-Preises
Input und Output liegen jeweils nahe bei einem Neuntel des GLM-5.3-Satzes, Cache-Reads sind nochmals günstiger. Dieser Abstand verändert die Form eines Workloads, nicht nur dessen Rechnung.
Dieselbe Reasoning-Einschränkung wie im Rest von 5.3
Auch hier ist Reasoning immer aktiv und thinking.type: "disabled" wird abgelehnt. Z.ai empfiehlt für Flash zusätzlich clear_thinking: false; der Parameter wird unverändert durchgereicht.
Die Zählung von Medien-Tokens sollten Sie selbst prüfen
Bilder und Video zählen in prompt_tokens und werden zum Input-Satz abgerechnet, doch der Upstream veröffentlicht keine Token-Formel pro Bild. Repräsentative Stichprobe fahren, die zurückgegebene usage lesen und den Batch danach dimensionieren — nicht nach einer Schätzung.
Warum Flash so viel Volumen tragen kann
Flash behält die Plattform-Eigenschaften der 5.3-Generation und ändert nur Preis und Eingabemodalitäten. Diese Kombination macht es zum Standard statt zum Rückfall.
Text und Medien gemischt in einer Anfrage
Eine Nachricht kann Anweisungen, mehrere Bilder und eine Datei zusammen tragen, sodass Material, das zu einer Entscheidung gehört, in einem Aufruf bleibt statt über eine Pipeline verteilt zu werden.
Derselbe 1-Mio.-Kontext zum Einheitspreis
Flash ist kein Kurzkontext-Modell. Das volle 1-Mio.-Fenster steht zu einem einzigen Satz ohne Long-Context-Stufe bereit — deshalb ist Massen-Dokumentarbeit zu diesem Preis überhaupt praktikabel.
Cache-Reads zu einem Bruchteil des Inputs
Ein stabiler System-Prompt und Tool-Schemata werden über die gesamte Schleife zum Cache-Read-Satz abgerechnet. Bei einem ohnehin günstigen Modell drückt das die Grenzkosten eines weiteren Schritts nahezu auf null.
Was vor dem Umleiten von Volumen auf Flash zu prüfen ist
Zwei davon sind Korrektheits-, zwei Kostenprüfungen. Die Medien-Token-Prüfung überspringen die meisten Teams — und bereuen es später bei einem großen Batch.
glm-5.3-flash als Modell-ID verwenden
Dieselbe ID gilt für Chat Completions und Anthropic Messages und entspricht exakt dem Upstream-Namen.
Jedes thinking.type: "disabled" entfernen
Die gesamte 5.3-Generation lehnt es ab. Für den günstigsten, schnellsten Pfad thinking.type: "enabled" mit reasoning_effort: "low" verwenden.
Medien-Tokens an echten Stichproben messen
Repräsentative Bilder oder Videos senden, prompt_tokens aus der Antwort lesen und die eigenen Stückkosten ableiten, bevor eine Batch-Größe festgelegt wird.
Eskalationsregel zu GLM-5.3 definieren
Vorab festlegen, was als Flash-Fehlschlag gilt und was er auslöst. Ohne Regel eskalieren Teams entweder nichts und liefern Fehler aus, oder alles und verlieren den Preisvorteil.
Die Genauigkeitslücke messen und dann bepreisen
Der nützliche Vergleich ist nicht Flash gegen einen Benchmark, sondern Flash gegen GLM-5.3 auf Ihren eigenen Aufgaben. Wenn Flash bei neun von zehn Anfragen mit dem Flaggschiff gleichzieht, ist beides zu betreiben und die zehnte zu eskalieren deutlich günstiger, als alle zehn über das Flaggschiff zu schicken.
Bepreisen Sie die Genauigkeitslücke, statt sie anzunehmen. Ein Modell zu einem Neuntel der Kosten muss nur meistens richtig liegen, damit Erst-Flash-dann-eskalieren besser abschneidet als alles ans Flaggschiff zu routen — aber „meistens" ist eine Zahl, die Sie am eigenen Workload messen müssen und nicht aus einem Benchmark erben können.
Mit GLM-5.3 und DeepSeek V4 Flash vergleichen
EvoLinkFlash ist die Volumenstufe der 5.3-Generation. Prüfen Sie zuerst, ob sie Ihre Genauigkeitsschwelle erreicht; wenn ja, ist der Preisabstand zum Flaggschiff groß genug, um das Routing aller Routinearbeit zu verändern.
| Modell | GLM-5.3 Flash | GLM-5.3 | DeepSeek V4 Flash |
|---|---|---|---|
| Input / Output | $0.15 / $0.5 | $1.4 / $4.4 | $0.442 / $1.324 |
| Kontext | 1M | 1M | 1M |
| Caching | Cache-Reads | Cache-Reads | Cache-Reads |
| Am besten für | Klassifikation und Extraktion in großen Mengen, Screenshot- und Dokumentverständnis, Video- und Dateianalyse sowie Routine-Agentenschritte, bei denen der Token-Preis das Routing entscheidet. | Das 5.3-Flaggschiff: reiner Text, etwa neunfacher Preis — das richtige Eskalationsziel, wenn Flash bei schwierigem Reasoning die Genauigkeitsschwelle verfehlt. | DeepSeeks Hochvolumen-Route mit 1 Mio. Kontext und sehr günstigen Cache-Reads. Der nächstliegende Kostenvergleich für Massen-Textarbeit. |
Verwandte Modelle

GLM-5.3
Das 5.3-Flaggschiff: reiner Text, etwa neunfacher Preis — das richtige Eskalationsziel, wenn Flash bei schwierigem Reasoning die Genauigkeitsschwelle verfehlt.
Modell ansehen
DeepSeek V4 Flash
DeepSeeks Hochvolumen-Route mit 1 Mio. Kontext und sehr günstigen Cache-Reads. Der nächstliegende Kostenvergleich für Massen-Textarbeit.
Modell ansehen
GLM-5.2
Das bisherige GLM-Flaggschiff. Weiterhin relevant für Clients, die auf deaktiviertes Reasoning angewiesen sind — die 5.3-Generation erlaubt das nicht mehr.
Modell ansehen
Gemini 3.7 Flash
Googles günstige multimodale Route — eine nützliche herstellerübergreifende Referenz, wenn Bild- und Dokumentverständnis die Wahl bestimmen.
Modell ansehenWeiterführende Artikel

GLM-5.3 Flash vs GLM-5.3
Die Familienroute nach Modalität, Schwierigkeit und Kosten pro akzeptiertem Ergebnis wählen — mit einer Flash-first-Eskalationsstrategie.
Artikel lesen
GLM-5.3 ist da: Was ausgeliefert wurde
Was das Release vom 14. August für die 5.3-Generation bestätigt hat — Spezifikationen, Modell-IDs, gestaffelter Zugang — und was offen blieb.
Artikel lesen
GLM-5.3 vs GLM-5.2
Gleiches Basismodell, alle Gewinne aus dem Post-Training, plus der Breaking Change, dass Reasoning generationsweit nicht mehr abschaltbar ist.
Artikel lesen
GLM-5.3 vs Claude
Benchmarks, API-Verträge und reale Verfügbarkeit im Vergleich, bevor Agenten auf eine der beiden Familien geroutet werden.
Artikel lesen
GLM-5.3 Cybersecurity-Benchmarks
Was die CyberGym- und ExploitBench-Zahlen nach Z.ais eigener Darstellung behaupten und wie Verteidiger sie lesen sollten.
Artikel lesen
Ein Gateway für 3 Coding-CLIs
Konfigurationspfade, Umgebungsvariablen und eine Troubleshooting-Checkliste für den Betrieb mehrerer Coding-CLIs über einen Endpunkt.
Artikel lesenGLM-5.3 Flash API — häufige Fragen
Ist die GLM-5.3 Flash API über EvoLink verfügbar?
Ja. GLM-5.3 Flash ist als Produktionsmodell verfügbar, erreichbar über Chat Completions und Anthropic Messages.
Welche Modell-ID nutze ich?
glm-5.3-flash für beide Endpunkte. Der EvoLink-Modellname entspricht exakt dem Upstream-Namen.
Welche Eingabetypen akzeptiert Flash?
Text, Bilder, Video und Dateien. Das ist der Hauptunterschied zu GLM-5.3, das reines Text-Modell ist.
Wie sende ich ein Bild?
Einen image_url-Block in messages[].content[] setzen und eine öffentliche URL (offiziell empfohlen) oder eine Base64-Data-URL übergeben. Für mehrere Bilder je einen Block pro Bild anhängen.
Wie werden Bild- und Video-Eingaben abgerechnet?
Medien zählen in prompt_tokens und werden zum Input-Satz berechnet; es gibt keine separate Medien-SKU. Der Upstream veröffentlicht keine Token-Umrechnungsformel für Bilder — messen Sie an einer repräsentativen Stichprobe die zurückgegebene usage, bevor Sie einen großen Batch planen.
Kann ich Reasoning deaktivieren?
Nein. Die gesamte 5.3-Generation denkt immer und lehnt thinking.type: "disabled" ab. Für den günstigsten, schnellsten Pfad thinking.type: "enabled" mit reasoning_effort: "low" verwenden.
Was ist clear_thinking und sollte ich es setzen?
Es steuert, ob vorheriges Reasoning zwischen Turns verworfen wird. Z.ai empfiehlt für Flash clear_thinking: false. Der Parameter wird unverändert durchgereicht, EvoLink schreibt ihn nicht um.
Wie viel günstiger ist Flash als GLM-5.3?
Etwa ein Neuntel bei Input und Output. Dieser Abstand rechtfertigt in der Regel, zuerst Flash laufen zu lassen und nur die Anfragen zu eskalieren, die Ihre Abnahmeprüfung nicht bestehen.
Wie wird Prompt-Caching abgerechnet?
Cache-Reads haben einen eigenen Satz, etwa ein Fünftel von frischem Input. Cache-Writes werden nicht berechnet, da der Upstream keine Cache-Creation-Tokens meldet. Für dauerhafte Treffer das Prompt-Prefix byte-stabil halten.
Wie groß sind Kontextfenster und Output-Limit?
1.000.000 Tokens Kontext und bis zu 131.072 Output-Tokens, zu einem einheitlichen Satz über das gesamte Fenster — keine Long-Context-Preisstufe.
Eignet sich Flash als Standard für hohe Volumina?
Ja, dafür ist der Preis gemacht. Klassifikation, Extraktion, Routine-Agentenschritte sowie Dokument- und Screenshot-Verständnis passen natürlich. Nur dort auf GLM-5.3 eskalieren, wo tieferes Reasoning das Ergebnis messbar verändert.
Was sollte eine Produktionsbewertung messen?
First-Pass-Erfolg, akzeptierte Ergebnisse, Retries, Reasoning-Anteil am Output, Cache-Trefferquote, Medien-Tokens pro Anfrage, Zeit bis zum akzeptierten Ergebnis und die Eskalationsrate zu GLM-5.3.