Seedance 2.5 ist jetzt auf EvoLink verfügbarSeedance 2.5 testen

GLM-5.3 Flash API

Z.ai-Multimodale Textgenerierung-ab $0.150 / 1 Mio. Input-Tokens-Verfügbar
1 Mio. KontextBild · Video · DateiReasoning immer aktivChat + Messages
API-Doku
Production routeLive
Anbieter
Z.ai / Zhipu
Modell
glm-5.3-flash
Kontextfenster
1.000.000 Tokens
Eingabe
Text · Bild · Video · Datei

GLM-5.3 Flash wählen

Das nativ multimodale Mitglied der 5.3-Generation: Text-, Bild-, Video- und Datei-Eingabe zu etwa einem Neuntel des GLM-5.3-Preises, mit demselben 1-Mio.-Kontext, dauerhaft aktivem Reasoning, Tool-Calling und Prompt-Caching.

GLM-5.3 Flash

Multimodales Hochvolumen-Modell von Z.ai

Ausgewählt
Ab $0.150 / 1 Mio. Input-Tokensglm-5.3-flash
Am besten für

Klassifikation und Extraktion in großen Mengen, Screenshot- und Dokumentverständnis, Video- und Dateianalyse sowie Routine-Agentenschritte, bei denen der Token-Preis das Routing entscheidet.

Input
$0.150 / 1M10.2 cr / 1M
Cache-Read
$0.031 / 1M2.1 cr / 1M
Output
$0.500 / 1M34 cr / 1M

GLM-5.3 Flash Preise

Kalkulieren Sie eine Anfrage, bevor Sie Traffic umleiten. Alle Nutzergruppen zahlen denselben Satz, Output-Tokens enthalten Reasoning-Tokens bereits.

Flash

Token-Rechner

Token-Mix für eine Anfrage eingeben.

Geschätzte Kosten pro Anfrage

GLM-5.3 Flash
Einheitspreis
USD$0.0004
Credits0.0209
Input-Tokens0.0102 cr
Cache-Read-Tokens0.0005 cr
Output-Tokens0.0102 cr

Mindestbetrag: 0,01 Credits pro Anfrage. Bild-, Video- und Datei-Eingaben werden als Input-Tokens abgerechnet.

Budget-Orientierung

Ungefähre Anzahl Anfragen beim aktuellen Mix.
Credits aufladen
$10
Etwa 32535 Anfragen

Schnelltests

$50
Etwa 162679 Anfragen

Tägliche Entwicklung

$100
Etwa 325358 Anfragen

Produktionsbewertung

Modellpreise

GLM-5.3 Flash

Alle Kontextgrößen
Input-Tokens
$0.150 / 1M10.2 cr / 1M
Cache-Read-Tokens
$0.031 / 1M2.1 cr / 1M
Output-Tokens
$0.500 / 1M34 cr / 1M

USD und Credits je 1 Mio. Tokens, einheitlich über das gesamte 1-Mio.-Kontextfenster.

Die Websuche wird separat abgerechnet: 0.68 Credits pro Aufruf.

GLM-5.3 Flash API für multimodale Arbeit und hohe Volumina

Die Volumenstufe der 5.3-Generation auf der einheitlichen API von EvoLink. Text-, Bild-, Video- und Datei-Eingabe zu etwa einem Neuntel des GLM-5.3-Preises, bei gleichem 1-Mio.-Token-Kontext, dauerhaft aktivem Reasoning, Tool-Calling und Prompt-Caching.

GLM-5.3 Flash
GLM-5.3 Flash Anwendungsfälle

Wo GLM-5.3 Flash im produktiven Modell-Stack hingehört

Flash ist für Volumen bepreist. Die Frage ist selten, ob Sie es sich leisten können — sondern ob es Ihre Genauigkeitsschwelle erreicht. Erst Flash laufen lassen, nur Fehlschläge eskalieren: dann arbeitet der Preisabstand zum Flaggschiff für Sie.

Klassifikation und Extraktion in großen Mengen

Ticket-Routing, Tagging, strukturierte Extraktion und Content-Triage laufen zu einem Preis, bei dem ein kompletter Neulauf weniger kostet als die Entwicklungszeit, ihn zu vermeiden. Die Batch-Größe ist nicht länger die Randbedingung.

Screenshot- und Dokumentverständnis

UI-Screenshots, gescannte Seiten oder Diagramme als image_url-Blöcke senden und strukturierte Ausgabe zurückbekommen. Genau das kann GLM-5.3 gar nicht — das Flaggschiff ist reines Text-Modell.

Video- und Dateianalyse

Video- und Datei-Eingaben werden nativ akzeptiert statt über eine separate Pipeline, sodass eine Anfrage gemischtes Material tragen kann, statt in Transkriptions- und Reasoning-Schritt zerlegt zu werden.

Routineschritte innerhalb eines größeren Agenten

Ein Tool-Ergebnis zusammenfassen, einen Zweig wählen, Ausgaben umformatieren — die Schritte, die das Anrufvolumen dominieren, aber nicht die Schwierigkeit. Das Flaggschiff bleibt für die Schritte, in denen Reasoning-Tiefe das Ergebnis wirklich entscheidet.

Wie sich Flash unterscheidet

Was Flash bietet — und was es dafür verlangt

Flash ist kein abgespecktes 5.3 mit kleinerem Fenster: Kontext, Protokolle und Caching sind identisch. Zwei Dinge unterscheiden sich, und eines davon sollten Sie selbst nachmessen.

Native multimodale Eingabe, die dem Flaggschiff fehlt

Text, Bild, Video und Datei laufen alle über die Standard-messages-Struktur. Bilder kommen als image_url-Blöcke mit öffentlicher URL (offiziell empfohlen) oder Base64-Data-URL, ein Block pro Bild.

Rund ein Neuntel des Flaggschiff-Preises

Input und Output liegen jeweils nahe bei einem Neuntel des GLM-5.3-Satzes, Cache-Reads sind nochmals günstiger. Dieser Abstand verändert die Form eines Workloads, nicht nur dessen Rechnung.

Dieselbe Reasoning-Einschränkung wie im Rest von 5.3

Auch hier ist Reasoning immer aktiv und thinking.type: "disabled" wird abgelehnt. Z.ai empfiehlt für Flash zusätzlich clear_thinking: false; der Parameter wird unverändert durchgereicht.

Die Zählung von Medien-Tokens sollten Sie selbst prüfen

Bilder und Video zählen in prompt_tokens und werden zum Input-Satz abgerechnet, doch der Upstream veröffentlicht keine Token-Formel pro Bild. Repräsentative Stichprobe fahren, die zurückgegebene usage lesen und den Batch danach dimensionieren — nicht nach einer Schätzung.

GLM-5.3 Flash Fähigkeiten

Warum Flash so viel Volumen tragen kann

Flash behält die Plattform-Eigenschaften der 5.3-Generation und ändert nur Preis und Eingabemodalitäten. Diese Kombination macht es zum Standard statt zum Rückfall.

Text und Medien gemischt in einer Anfrage

Eine Nachricht kann Anweisungen, mehrere Bilder und eine Datei zusammen tragen, sodass Material, das zu einer Entscheidung gehört, in einem Aufruf bleibt statt über eine Pipeline verteilt zu werden.

Derselbe 1-Mio.-Kontext zum Einheitspreis

Flash ist kein Kurzkontext-Modell. Das volle 1-Mio.-Fenster steht zu einem einzigen Satz ohne Long-Context-Stufe bereit — deshalb ist Massen-Dokumentarbeit zu diesem Preis überhaupt praktikabel.

Cache-Reads zu einem Bruchteil des Inputs

Ein stabiler System-Prompt und Tool-Schemata werden über die gesamte Schleife zum Cache-Read-Satz abgerechnet. Bei einem ohnehin günstigen Modell drückt das die Grenzkosten eines weiteren Schritts nahezu auf null.

GLM-5.3 Flash Produktionsprüfungen

Was vor dem Umleiten von Volumen auf Flash zu prüfen ist

Zwei davon sind Korrektheits-, zwei Kostenprüfungen. Die Medien-Token-Prüfung überspringen die meisten Teams — und bereuen es später bei einem großen Batch.

01

glm-5.3-flash als Modell-ID verwenden

Dieselbe ID gilt für Chat Completions und Anthropic Messages und entspricht exakt dem Upstream-Namen.

Erforderlich
02

Jedes thinking.type: "disabled" entfernen

Die gesamte 5.3-Generation lehnt es ab. Für den günstigsten, schnellsten Pfad thinking.type: "enabled" mit reasoning_effort: "low" verwenden.

Breaking
03

Medien-Tokens an echten Stichproben messen

Repräsentative Bilder oder Videos senden, prompt_tokens aus der Antwort lesen und die eigenen Stückkosten ableiten, bevor eine Batch-Größe festgelegt wird.

Kosten
04

Eskalationsregel zu GLM-5.3 definieren

Vorab festlegen, was als Flash-Fehlschlag gilt und was er auslöst. Ohne Regel eskalieren Teams entweder nichts und liefern Fehler aus, oder alles und verlieren den Preisvorteil.

Routing
GLM-5.3 Flash Bewertung

Die Genauigkeitslücke messen und dann bepreisen

Der nützliche Vergleich ist nicht Flash gegen einen Benchmark, sondern Flash gegen GLM-5.3 auf Ihren eigenen Aufgaben. Wenn Flash bei neun von zehn Anfragen mit dem Flaggschiff gleichzieht, ist beides zu betreiben und die zehnte zu eskalieren deutlich günstiger, als alle zehn über das Flaggschiff zu schicken.

First-Pass-ErfolgsquoteAkzeptierte ErgebnisseEskalationsrate zu GLM-5.3Medien-Tokens pro AnfrageCache-TrefferquoteReasoning-Anteil am OutputZeit bis zum akzeptierten ErgebnisKosten pro akzeptierter Aufgabe

Bepreisen Sie die Genauigkeitslücke, statt sie anzunehmen. Ein Modell zu einem Neuntel der Kosten muss nur meistens richtig liegen, damit Erst-Flash-dann-eskalieren besser abschneidet als alles ans Flaggschiff zu routen — aber „meistens" ist eine Zahl, die Sie am eigenen Workload messen müssen und nicht aus einem Benchmark erben können.

Mit GLM-5.3 und DeepSeek V4 Flash vergleichen

EvoLink

Flash ist die Volumenstufe der 5.3-Generation. Prüfen Sie zuerst, ob sie Ihre Genauigkeitsschwelle erreicht; wenn ja, ist der Preisabstand zum Flaggschiff groß genug, um das Routing aller Routinearbeit zu verändern.

GLM-5.3 Flash
Input / Output$0.15 / $0.5
Kontext1M
CachingCache-Reads
Am besten fürKlassifikation und Extraktion in großen Mengen, Screenshot- und Dokumentverständnis, Video- und Dateianalyse sowie Routine-Agentenschritte, bei denen der Token-Preis das Routing entscheidet.
GLM-5.3
Input / Output$1.4 / $4.4
Kontext1M
CachingCache-Reads
Am besten fürDas 5.3-Flaggschiff: reiner Text, etwa neunfacher Preis — das richtige Eskalationsziel, wenn Flash bei schwierigem Reasoning die Genauigkeitsschwelle verfehlt.
DeepSeek V4 Flash
Input / Output$0.442 / $1.324
Kontext1M
CachingCache-Reads
Am besten fürDeepSeeks Hochvolumen-Route mit 1 Mio. Kontext und sehr günstigen Cache-Reads. Der nächstliegende Kostenvergleich für Massen-Textarbeit.

Verwandte Modelle

GLM-5.3

GLM-5.3

Das 5.3-Flaggschiff: reiner Text, etwa neunfacher Preis — das richtige Eskalationsziel, wenn Flash bei schwierigem Reasoning die Genauigkeitsschwelle verfehlt.

Modell ansehen
DeepSeek V4 Flash

DeepSeek V4 Flash

DeepSeeks Hochvolumen-Route mit 1 Mio. Kontext und sehr günstigen Cache-Reads. Der nächstliegende Kostenvergleich für Massen-Textarbeit.

Modell ansehen
GLM-5.2

GLM-5.2

Das bisherige GLM-Flaggschiff. Weiterhin relevant für Clients, die auf deaktiviertes Reasoning angewiesen sind — die 5.3-Generation erlaubt das nicht mehr.

Modell ansehen
Gemini 3.7 Flash

Gemini 3.7 Flash

Googles günstige multimodale Route — eine nützliche herstellerübergreifende Referenz, wenn Bild- und Dokumentverständnis die Wahl bestimmen.

Modell ansehen

Weiterführende Artikel

GLM-5.3 Flash vs GLM-5.3

GLM-5.3 Flash vs GLM-5.3

Die Familienroute nach Modalität, Schwierigkeit und Kosten pro akzeptiertem Ergebnis wählen — mit einer Flash-first-Eskalationsstrategie.

Artikel lesen
GLM-5.3 ist da: Was ausgeliefert wurde

GLM-5.3 ist da: Was ausgeliefert wurde

Was das Release vom 14. August für die 5.3-Generation bestätigt hat — Spezifikationen, Modell-IDs, gestaffelter Zugang — und was offen blieb.

Artikel lesen
GLM-5.3 vs GLM-5.2

GLM-5.3 vs GLM-5.2

Gleiches Basismodell, alle Gewinne aus dem Post-Training, plus der Breaking Change, dass Reasoning generationsweit nicht mehr abschaltbar ist.

Artikel lesen
GLM-5.3 vs Claude

GLM-5.3 vs Claude

Benchmarks, API-Verträge und reale Verfügbarkeit im Vergleich, bevor Agenten auf eine der beiden Familien geroutet werden.

Artikel lesen
GLM-5.3 Cybersecurity-Benchmarks

GLM-5.3 Cybersecurity-Benchmarks

Was die CyberGym- und ExploitBench-Zahlen nach Z.ais eigener Darstellung behaupten und wie Verteidiger sie lesen sollten.

Artikel lesen
Ein Gateway für 3 Coding-CLIs

Ein Gateway für 3 Coding-CLIs

Konfigurationspfade, Umgebungsvariablen und eine Troubleshooting-Checkliste für den Betrieb mehrerer Coding-CLIs über einen Endpunkt.

Artikel lesen

GLM-5.3 Flash API — häufige Fragen

Ist die GLM-5.3 Flash API über EvoLink verfügbar?

Ja. GLM-5.3 Flash ist als Produktionsmodell verfügbar, erreichbar über Chat Completions und Anthropic Messages.

Welche Modell-ID nutze ich?

glm-5.3-flash für beide Endpunkte. Der EvoLink-Modellname entspricht exakt dem Upstream-Namen.

Welche Eingabetypen akzeptiert Flash?

Text, Bilder, Video und Dateien. Das ist der Hauptunterschied zu GLM-5.3, das reines Text-Modell ist.

Wie sende ich ein Bild?

Einen image_url-Block in messages[].content[] setzen und eine öffentliche URL (offiziell empfohlen) oder eine Base64-Data-URL übergeben. Für mehrere Bilder je einen Block pro Bild anhängen.

Wie werden Bild- und Video-Eingaben abgerechnet?

Medien zählen in prompt_tokens und werden zum Input-Satz berechnet; es gibt keine separate Medien-SKU. Der Upstream veröffentlicht keine Token-Umrechnungsformel für Bilder — messen Sie an einer repräsentativen Stichprobe die zurückgegebene usage, bevor Sie einen großen Batch planen.

Kann ich Reasoning deaktivieren?

Nein. Die gesamte 5.3-Generation denkt immer und lehnt thinking.type: "disabled" ab. Für den günstigsten, schnellsten Pfad thinking.type: "enabled" mit reasoning_effort: "low" verwenden.

Was ist clear_thinking und sollte ich es setzen?

Es steuert, ob vorheriges Reasoning zwischen Turns verworfen wird. Z.ai empfiehlt für Flash clear_thinking: false. Der Parameter wird unverändert durchgereicht, EvoLink schreibt ihn nicht um.

Wie viel günstiger ist Flash als GLM-5.3?

Etwa ein Neuntel bei Input und Output. Dieser Abstand rechtfertigt in der Regel, zuerst Flash laufen zu lassen und nur die Anfragen zu eskalieren, die Ihre Abnahmeprüfung nicht bestehen.

Wie wird Prompt-Caching abgerechnet?

Cache-Reads haben einen eigenen Satz, etwa ein Fünftel von frischem Input. Cache-Writes werden nicht berechnet, da der Upstream keine Cache-Creation-Tokens meldet. Für dauerhafte Treffer das Prompt-Prefix byte-stabil halten.

Wie groß sind Kontextfenster und Output-Limit?

1.000.000 Tokens Kontext und bis zu 131.072 Output-Tokens, zu einem einheitlichen Satz über das gesamte Fenster — keine Long-Context-Preisstufe.

Eignet sich Flash als Standard für hohe Volumina?

Ja, dafür ist der Preis gemacht. Klassifikation, Extraktion, Routine-Agentenschritte sowie Dokument- und Screenshot-Verständnis passen natürlich. Nur dort auf GLM-5.3 eskalieren, wo tieferes Reasoning das Ergebnis messbar verändert.

Was sollte eine Produktionsbewertung messen?

First-Pass-Erfolg, akzeptierte Ergebnisse, Retries, Reasoning-Anteil am Output, Cache-Trefferquote, Medien-Tokens pro Anfrage, Zeit bis zum akzeptierten Ergebnis und die Eskalationsrate zu GLM-5.3.