Gemini 3.5 Flash Lite API
Gemini 3.5 Flash Lite auswählen
Googles günstigstes und schnellstes Modell der 3.5-Klasse für latenzarme Klassifikation, Routing, Extraktion und leichte Agenten-Subagenten – mit vollem 1M-Token-Kontext zu $0.30 / $2.50 pro 1M Token.
Gemini 3.5 Flash Lite
Googles schnellstes und kosteneffizientestes Modell der 3.5-Klasse
gemini-3.5-flash-liteKlassifikation und Extraktion mit hohem Durchsatz, latenzarme Echtzeitaktionen, fokussierte Agenten-Subagenten und kostensensible Workloads, bei denen Geschwindigkeit und Preis wichtiger sind als maximales Reasoning.
Gemini 3.5 Flash Lite pricing
Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.5 Flash Lite rate.
Token calculator
Enter the token mix for one request.Estimated request cost
Gemini 3.5 Flash LiteMinimum charge: 0.01 credits per request.
EvoLink vs Google direct
Same token mix, default group price.Budget guide
Approximate requests using the current token mix.For quick testing
For regular development
For production evaluation
Model pricing
| Model | Context | Input tokens | Cache read tokens | Output tokens |
|---|---|---|---|---|
Gemini 3.5 Flash Litegemini-3.5-flash-lite | All context sizes | $0.271 / 1M-10% 18.4 cr / 1M$0.300official price | $0.028 / 1M-7% 1.9 cr / 1M$0.030official price | $2.250 / 1M-10% 153 cr / 1M$2.500official price |
Gemini 3.5 Flash Lite
All context sizesUSD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.
Gemini 3.5 Flash Lite API für schnelle, günstige Workloads mit hohem Durchsatz
Rufen Sie Googles günstigstes, schnellstes Modell der 3.5-Klasse über die einheitliche EvoLink-API auf. Gemini 3.5 Flash Lite ist auf latenzarme Klassifikation, Routing, Extraktion und leichte Agenten-Subagenten ausgelegt — mit 1.048.576 Token Kontext, Prompt-Caching, strukturierter Ausgabe und Tool-Nutzung — zu $0.30 / $2.50 pro Million Eingabe- / Ausgabe-Token.
Wo Gemini 3.5 Flash Lite seinen Platz im produktiven Modell-Stack verdient
Google positioniert Gemini 3.5 Flash Lite als sein schnellstes, kosteneffizientestes Modell der 3.5-Klasse. Am besten passt es zu Workloads mit hohem Volumen und Latenzanforderungen, bei denen niedriger Preis und Tempo wichtiger sind als maximales Reasoning — und bei denen sich die wenigen schweren Anfragen an ein größeres Modell eskalieren lassen.
Klassifikation und Extraktion mit hohem Durchsatz
Gemini 3.5 Flash Lite ist für Klassifikation, Routing und JSON-Extraktion mit hohem Durchsatz gebaut. Zu $0.30 / $2.50 pro 1M Token verarbeiten Sie große Anfragemengen günstig, wo ein Premium-Modell verschwendet wäre.
Latenzarme, kostensensible Skalierung
Google nennt rund 350 Ausgabe-Token pro Sekunde, was gut zu Echtzeit-UI-Aktionen, Autovervollständigung, Moderation und anderen latenzkritischen Pfaden passt. Messen Sie Kosten und Tempo pro Anfrage, nicht Benchmark-Schlagzeilen.
Leichte, fokussierte Agenten-Subagenten
Es eignet sich für Subagenten, die fokussierte Aufgaben in größeren Multi-Agenten-Systemen ausführen. Standardmäßig nutzt es minimales Thinking für Tempo; bei mehrstufiger Tool-Nutzung sollten Sie vor dem Skalieren prüfen, dass Agenten nicht zu früh abbrechen.
Wann zu einem größeren Modell eskalieren
Tiefes Repository-Refactoring, langes autonomes Coding und schwieriges mehrstufiges Reasoning gehören auf Gemini 3.6 Flash oder ein Modell der Pro-Klasse. Nutzen Sie Flash Lite für die große Mehrheit mit hohem Volumen und leiten Sie nur die schwierige Minderheit nach oben.
Was frühe Reaktionen auf Gemini 3.5 Flash Lite nahelegen — und was noch Beweise braucht
Gemini 3.5 Flash Lite ist am 21.07.2026 als Ersatz für Gemini 2.5 Flash erschienen. Behandeln Sie Launch-Reaktionen als Hypothesen, die Sie an eigenen Aufgaben, Tools, Budgets und Abnahmekriterien überprüfen.
Preis-Leistung ist die Schlagzeile
Bei $0.30 Eingabe / $2.50 Ausgabe pro 1M Token und etwa 350 Token/Sekunde liegt der Reiz im Durchsatz pro Dollar. Bei einfacher Arbeit mit hohem Volumen kann es teurere Modelle bei den Gesamtkosten mit akzeptabler Qualität schlagen.
Es ersetzt Gemini 2.5 Flash und leichtere 3-Flash-Workloads
Google positioniert es als Drop-in für Gemini 2.5 Flash und weniger komplexe Gemini-3-Flash-Aufgaben. Wenn Sie diese heute nutzen, testen Sie Ihre Prompts vor der Migration erneut, damit Qualität und Formatierung im Rahmen bleiben.
Minimales Thinking ist Standard — mehrstufige Agenten validieren
Flash Lite nutzt standardmäßig minimales Thinking für Tempo und Kosten. Google weist darauf hin, dass minimales Thinking bei mehrstufigen Aufgaben zu vorzeitigem Tool-Abbruch führen kann; testen Sie daher den Agentenabschluss vor dem Rollout mit hohem Durchsatz.
Es ist ein geschlossenes, nur per API verfügbares Google-Modell
Gemini 3.5 Flash Lite hat keine offenen Gewichte und lässt sich nicht selbst hosten. Der Zugriff erfolgt über die Gemini-API und Plattformen wie Google AI Studio sowie einheitliche Gateways wie EvoLink — routen Sie nach Kosten und Latenz, nicht nach lokalem Deployment.
Warum Gemini 3.5 Flash Lite diese Workloads bewältigen kann
Gemini 3.5 Flash Lite verbindet niedrigen Preis und hohes Tempo mit vollem 1M-Token-Kontext und Prompt-Caching. Es ist kein Modell für maximales Reasoning; der Wert liegt darin, einfache Arbeit schnell und günstig in großem Maßstab zu erledigen.
1M-Token-Kontext auf der günstigsten Stufe
Das Fenster mit 1.048.576 Token lässt selbst das günstigste Modell der 3.5-Klasse lange Dokumente, Transkripte oder Logs in einem Durchgang verarbeiten. Retrieval und Kontextkomprimierung senken die Kosten weiter, da irrelevante Eingaben trotzdem Token verbrauchen.
Tempo und Durchsatz statt tiefem Reasoning
Mit etwa 350 Ausgabe-Token/Sekunde und minimalem Thinking als Standard optimiert Flash Lite auf schnelle Antworten mit hohem Volumen. Reservieren Sie schwerere Reasoning-Konfigurationen und Modelle für die Anfragen, die sie wirklich brauchen.
Prompt-Caching senkt die Kosten weiter
Stabile System-Prompts, Anweisungen und Tool-Schemas erzeugen Cache-Treffer, die zum eigenen niedrigeren Cache-Preis gelesen werden. Halten Sie die Präfix-Reihenfolge konsistent, damit wiederholte Aufrufe mit hohem Volumen günstig bleiben.
Was vor produktivem Traffic zu Gemini 3.5 Flash Lite zu prüfen ist
Auch ein passender Workload kann scheitern, weil die Integration die falsche Kennung nutzt, nicht unterstützte Parameter sendet oder tiefes Reasoning annimmt, das die Minimal-Thinking-Standards nicht liefern. Prüfen Sie den Request-Vertrag, bevor Sie die Qualität bewerten.
Die exakte Modell-ID gemini-3.5-flash-lite verwenden
Senden Sie model "gemini-3.5-flash-lite" (mit einem Punkt nach 3.5) auf der EvoLink API-Route. Das gemini-3-5-flash-lite mit Bindestrichen ist nur die Seiten-URL, nicht der API-Modellparameter.
OpenAI Chat Completions oder die native Gemini-API nutzen
EvoLink stellt Gemini 3.5 Flash Lite über das OpenAI-kompatible /v1/chat/completions und den nativen Gemini-Endpunkt generateContent bereit. Verwenden Sie für beide Protokolle denselben EvoLink API-Schlüssel.
Auf die inkompatiblen Parameteränderungen achten
Eigene Werte für temperature, top-K und top-P werden ignoriert; eigene frequency- und presence-Penalties geben einen Fehler zurück; und eine Anfrage, deren letzter Turn die Rolle model hat, wird abgelehnt. Passen Sie ältere Gemini-Request-Builder entsprechend an.
Mehrstufige Agenten unter minimalem Thinking validieren
Da Flash Lite standardmäßig minimales Thinking nutzt, prüfen Sie, dass mehrstufige Tool-Calling-Agenten ihre Schritte abschließen und nicht zu früh stoppen. Reservieren Sie schwierigeres Reasoning für ein größeres Modell, statt dieses zu übertunen.
Kosten pro akzeptierter Aufgabe vergleichen, nicht nur den Token-Preis
Gemini 3.5 Flash Lite gewinnt, wenn sein niedriger Preis und sein Tempo Ihre Qualitätsschwelle bei Arbeit mit hohem Volumen erreichen. Bewerten Sie identische Aufgabensätze und eskalieren Sie die Anfragen, die es nicht bewältigt, statt für allen Traffic Premium-Preise zu zahlen.
Wenn Gemini 3.5 Flash Lite bei einfachen Aufgaben mit hohem Volumen Ihre Qualitätsschwelle erreicht, machen sein niedriger Preis und sein Tempo es zum günstigsten Produktionsstandard. Leiten Sie nur die Anfragen, die es nicht schafft, an Gemini 3.6 Flash oder ein Modell der Pro-Klasse.
Führende Long-Context-Modelle nach dem Workload-Test vergleichen
EvoLinkPrüfen Sie zuerst, ob Gemini 3.5 Flash Lite Retries und Review-Aufwand reduziert. Vergleichen Sie anschließend Preis, Kontext, Caching und Workload-Eignung.
| Modell | Gemini 3.5 Flash Lite | Gemini 3.6 Flash | Gemini 3.1 Pro |
|---|---|---|---|
| Eingabe / Ausgabe | $0.271 / $2.25 | $1.5 / $7.5 | $1.68 / $10.08 |
| Kontext | 1M | 1M | 1M |
| Caching | Automatische Cache-Lesezugriffe | Kontext-Cache | Kontext-Cache |
| Geeignet für | Klassifikation und Extraktion mit hohem Durchsatz, latenzarme Echtzeitaktionen, fokussierte Agenten-Subagenten und kostensensible Workloads, bei denen Geschwindigkeit und Preis wichtiger sind als maximales Reasoning. | Größeres Gemini, auf das man eskaliert, wenn eine Aufgabe die Minimal-Thinking-Geschwindigkeit von Flash-Lite übersteigt. | Größeres Gemini, auf das man eskaliert, wenn eine Aufgabe die Minimal-Thinking-Geschwindigkeit von Flash-Lite übersteigt. |
Weitere Gemini-Modelle auf EvoLink

Gemini 3.6 Flash
The workhorse to escalate to when a task needs stronger coding or reasoning than the Lite tier provides.
Modell ansehen
Gemini 3.5 Flash
The mid Flash tier between Flash-Lite and the Pro line, balancing cost and capability.
Modell ansehen
Gemini 3.1 Pro
The Pro-tier step up for the deepest reasoning tasks the Flash line is not built to handle.
Modell ansehen
Gemini 3.1 Flash Lite
The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.
Modell ansehenOther text models

GPT-5.6
OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.
Modell ansehen
Claude Opus 4.8
Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.
Modell ansehen
DeepSeek V4
Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.
Modell ansehen
Kimi K3
Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.
Modell ansehenWeiterführende Leitfäden für Produktionsteams

Gemini 3.6 Flash release date & rollout
What launched, the model ID, official pricing, and where the model is available.
Leitfaden lesenGemini 3.5 Flash Lite API – Häufige Fragen
Ist die Gemini 3.5 Flash Lite API über EvoLink verfügbar?
Ja. Gemini 3.5 Flash Lite ist als Produktionsmodell mit Live-Preisen und offiziellen Fallback-Preisen verfügbar.
Welche Modell-ID sollte ich für die Gemini 3.5 Flash Lite API verwenden?
Senden Sie model "gemini-3.5-flash-lite" (mit Punkt nach 3.5). Die Variante mit Bindestrichen gemini-3-5-flash-lite ist nur die Seiten-URL, nicht der API-Modellparameter.
Welche Protokolle und SDKs funktionieren mit Gemini 3.5 Flash Lite?
Nutzen Sie den OpenAI-kompatiblen Chat-Completions-Endpunkt oder den nativen Gemini-generateContent-Endpunkt mit demselben EvoLink-API-Schlüssel. Für dieses Modell gibt es keine Anthropic-Messages-Route.
Unterstützt die Gemini 3.5 Flash Lite API 1M Kontext oder nur 256K?
Die EvoLink-Route erfasst 1.048.576 Token. Kleinere Limits stammen meist von einer bestimmten Gemini-Produktoberfläche oder Client-Konfiguration, nicht vom API-Modell selbst.
Wie schnell und wie günstig ist Gemini 3.5 Flash Lite?
Es ist Googles schnellstes und kosteneffizientestes Modell der 3.5-Klasse – $0.30 Eingabe / $2.50 Ausgabe pro 1M Token bei rund 350 Ausgabe-Token pro Sekunde. Dieser Durchsatz pro Dollar ist sein Hauptvorteil.
Wofür eignet sich Gemini 3.5 Flash Lite am besten?
Klassifikation mit hohem Durchsatz, Routing, JSON-Extraktion, latenzarme UI-Aktionen und fokussierte Agenten-Subagenten. Für tiefes Coding oder schwieriges Reasoning eskalieren Sie zu Gemini 3.6 Flash oder einem Modell der Pro-Stufe.
Wie unterscheidet sich Gemini 3.5 Flash Lite von 3.5 Flash und 3.6 Flash?
Flash Lite ist die günstigste und schnellste Stufe und nutzt standardmäßig minimales Thinking. 3.5 Flash und 3.6 Flash sind leistungsfähigere, höher bepreiste Arbeitspferde für Coding und Agenten.
Ersetzt Gemini 3.5 Flash Lite Gemini 2.5 Flash?
Google positioniert es als Ersatz für Gemini 2.5 Flash und weniger komplexe Gemini-3-Flash-Workloads. Testen Sie Ihre Prompts vor der Migration neu.
Welche Breaking Changes muss ich bei der Migration beachten?
Benutzerdefinierte temperature, top-K und top-P werden ignoriert; benutzerdefinierte frequency- und presence-Penalty geben einen Fehler zurück; und eine Anfrage, deren letzter Turn die Rolle model hat, wird abgelehnt.
Ist Gemini 3.5 Flash Lite eine gute Standardwahl für Echtzeit oder hohes Volumen?
Ja – genau dafür ist es gebaut. Es nutzt standardmäßig minimales Thinking für Geschwindigkeit, prüfen Sie daher vor einem Rollout mit hohem Durchsatz, dass mehrstufige Agenten ihre Schritte abschließen.
Wie vergleiche ich Gemini 3.5 Flash Lite mit GPT, Claude, GLM oder DeepSeek?
Vergleichen Sie es mit anderen günstigen, schnellen Stufen anhand der Kosten pro 1K Anfragen und der Latenz, nicht mit Premium-Reasoning-Modellen. Eskalieren Sie die Anfragen, die es nicht bewältigt, zu einem größeren Modell.
Was sollte eine Produktionsbewertung von Gemini 3.5 Flash Lite messen?
Erfassen Sie Kosten pro 1K Anfragen, Token pro Sekunde, Erfolg im ersten Versuch, akzeptierte Ergebnisse, Cache-Treffer und wie oft Anfragen zu einem größeren Modell eskalieren müssen.