Kimi K3 ist jetzt verfügbarKimi K3 entdecken

Gemini 3.5 Flash Lite API

Google-Textgenerierung-ab $0.271 / 1M Eingabe-Token$0.300 offizieller Preis-Verfügbar
1M Kontext65K StandardausgabePrompt-CachingChat + Gemini API
API-Dokumentation
Production routeLive
Anbieter
Google
Modell
Flash Lite
Kontextfenster
1.048.576 Token
Protokolle
Chat + Gemini

Gemini 3.5 Flash Lite auswählen

Googles günstigstes und schnellstes Modell der 3.5-Klasse für latenzarme Klassifikation, Routing, Extraktion und leichte Agenten-Subagenten – mit vollem 1M-Token-Kontext zu $0.30 / $2.50 pro 1M Token.

Gemini 3.5 Flash Lite

Googles schnellstes und kosteneffizientestes Modell der 3.5-Klasse

Ausgewählt
Ab $0.271 / 1M Eingabe-Token$0.300 offizieller Preisgemini-3.5-flash-lite
Geeignet für

Klassifikation und Extraktion mit hohem Durchsatz, latenzarme Echtzeitaktionen, fokussierte Agenten-Subagenten und kostensensible Workloads, bei denen Geschwindigkeit und Preis wichtiger sind als maximales Reasoning.

Eingabe
$0.271 / 1M-10%
18.4 cr / 1M$0.300offizieller Preis
Cache-Lesen
$0.028 / 1M-7%
1.9 cr / 1M$0.030offizieller Preis
Ausgabe
$2.250 / 1M-10%
153 cr / 1M$2.500offizieller Preis

Gemini 3.5 Flash Lite pricing

Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.5 Flash Lite rate.

Flash Lite

Token calculator

Enter the token mix for one request.

Estimated request cost

Gemini 3.5 Flash Lite
Official rate
USD$0.0010
Credits0.0647
Input tokens0.0184 cr
Cache read tokens0.0004 cr
Output tokens0.0459 cr

Minimum charge: 0.01 credits per request.

EvoLink vs Google direct

Same token mix, default group price.
-10%
EvoLink estimate$0.0010
Google official$0.0011
You save$0.0002

Budget guide

Approximate requests using the current token mix.
Add credits
$10
About 10510 requests

For quick testing

$50
About 52550 requests

For regular development

$100
About 105100 requests

For production evaluation

Model pricing

Gemini 3.5 Flash Lite

All context sizes
Input tokens
$0.271 / 1M-10%
18.4 cr / 1M$0.300official price
Cache read tokens
$0.028 / 1M-7%
1.9 cr / 1M$0.030official price
Output tokens
$2.250 / 1M-10%
153 cr / 1M$2.500official price

USD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.

Gemini 3.5 Flash Lite API für schnelle, günstige Workloads mit hohem Durchsatz

Rufen Sie Googles günstigstes, schnellstes Modell der 3.5-Klasse über die einheitliche EvoLink-API auf. Gemini 3.5 Flash Lite ist auf latenzarme Klassifikation, Routing, Extraktion und leichte Agenten-Subagenten ausgelegt — mit 1.048.576 Token Kontext, Prompt-Caching, strukturierter Ausgabe und Tool-Nutzung — zu $0.30 / $2.50 pro Million Eingabe- / Ausgabe-Token.

Gemini 3.5 Flash Lite
Gemini 3.5 Flash Lite Einsatzbereiche

Wo Gemini 3.5 Flash Lite seinen Platz im produktiven Modell-Stack verdient

Google positioniert Gemini 3.5 Flash Lite als sein schnellstes, kosteneffizientestes Modell der 3.5-Klasse. Am besten passt es zu Workloads mit hohem Volumen und Latenzanforderungen, bei denen niedriger Preis und Tempo wichtiger sind als maximales Reasoning — und bei denen sich die wenigen schweren Anfragen an ein größeres Modell eskalieren lassen.

Klassifikation und Extraktion mit hohem Durchsatz

Gemini 3.5 Flash Lite ist für Klassifikation, Routing und JSON-Extraktion mit hohem Durchsatz gebaut. Zu $0.30 / $2.50 pro 1M Token verarbeiten Sie große Anfragemengen günstig, wo ein Premium-Modell verschwendet wäre.

Latenzarme, kostensensible Skalierung

Google nennt rund 350 Ausgabe-Token pro Sekunde, was gut zu Echtzeit-UI-Aktionen, Autovervollständigung, Moderation und anderen latenzkritischen Pfaden passt. Messen Sie Kosten und Tempo pro Anfrage, nicht Benchmark-Schlagzeilen.

Leichte, fokussierte Agenten-Subagenten

Es eignet sich für Subagenten, die fokussierte Aufgaben in größeren Multi-Agenten-Systemen ausführen. Standardmäßig nutzt es minimales Thinking für Tempo; bei mehrstufiger Tool-Nutzung sollten Sie vor dem Skalieren prüfen, dass Agenten nicht zu früh abbrechen.

Wann zu einem größeren Modell eskalieren

Tiefes Repository-Refactoring, langes autonomes Coding und schwieriges mehrstufiges Reasoning gehören auf Gemini 3.6 Flash oder ein Modell der Pro-Klasse. Nutzen Sie Flash Lite für die große Mehrheit mit hohem Volumen und leiten Sie nur die schwierige Minderheit nach oben.

Signale zum Launch

Was frühe Reaktionen auf Gemini 3.5 Flash Lite nahelegen — und was noch Beweise braucht

Gemini 3.5 Flash Lite ist am 21.07.2026 als Ersatz für Gemini 2.5 Flash erschienen. Behandeln Sie Launch-Reaktionen als Hypothesen, die Sie an eigenen Aufgaben, Tools, Budgets und Abnahmekriterien überprüfen.

Preis-Leistung ist die Schlagzeile

Bei $0.30 Eingabe / $2.50 Ausgabe pro 1M Token und etwa 350 Token/Sekunde liegt der Reiz im Durchsatz pro Dollar. Bei einfacher Arbeit mit hohem Volumen kann es teurere Modelle bei den Gesamtkosten mit akzeptabler Qualität schlagen.

Es ersetzt Gemini 2.5 Flash und leichtere 3-Flash-Workloads

Google positioniert es als Drop-in für Gemini 2.5 Flash und weniger komplexe Gemini-3-Flash-Aufgaben. Wenn Sie diese heute nutzen, testen Sie Ihre Prompts vor der Migration erneut, damit Qualität und Formatierung im Rahmen bleiben.

Minimales Thinking ist Standard — mehrstufige Agenten validieren

Flash Lite nutzt standardmäßig minimales Thinking für Tempo und Kosten. Google weist darauf hin, dass minimales Thinking bei mehrstufigen Aufgaben zu vorzeitigem Tool-Abbruch führen kann; testen Sie daher den Agentenabschluss vor dem Rollout mit hohem Durchsatz.

Es ist ein geschlossenes, nur per API verfügbares Google-Modell

Gemini 3.5 Flash Lite hat keine offenen Gewichte und lässt sich nicht selbst hosten. Der Zugriff erfolgt über die Gemini-API und Plattformen wie Google AI Studio sowie einheitliche Gateways wie EvoLink — routen Sie nach Kosten und Latenz, nicht nach lokalem Deployment.

Kernfähigkeiten

Warum Gemini 3.5 Flash Lite diese Workloads bewältigen kann

Gemini 3.5 Flash Lite verbindet niedrigen Preis und hohes Tempo mit vollem 1M-Token-Kontext und Prompt-Caching. Es ist kein Modell für maximales Reasoning; der Wert liegt darin, einfache Arbeit schnell und günstig in großem Maßstab zu erledigen.

1M-Token-Kontext auf der günstigsten Stufe

Das Fenster mit 1.048.576 Token lässt selbst das günstigste Modell der 3.5-Klasse lange Dokumente, Transkripte oder Logs in einem Durchgang verarbeiten. Retrieval und Kontextkomprimierung senken die Kosten weiter, da irrelevante Eingaben trotzdem Token verbrauchen.

Tempo und Durchsatz statt tiefem Reasoning

Mit etwa 350 Ausgabe-Token/Sekunde und minimalem Thinking als Standard optimiert Flash Lite auf schnelle Antworten mit hohem Volumen. Reservieren Sie schwerere Reasoning-Konfigurationen und Modelle für die Anfragen, die sie wirklich brauchen.

Prompt-Caching senkt die Kosten weiter

Stabile System-Prompts, Anweisungen und Tool-Schemas erzeugen Cache-Treffer, die zum eigenen niedrigeren Cache-Preis gelesen werden. Halten Sie die Präfix-Reihenfolge konsistent, damit wiederholte Aufrufe mit hohem Volumen günstig bleiben.

Gemini 3.5 Flash Lite API Produktionsprüfung

Was vor produktivem Traffic zu Gemini 3.5 Flash Lite zu prüfen ist

Auch ein passender Workload kann scheitern, weil die Integration die falsche Kennung nutzt, nicht unterstützte Parameter sendet oder tiefes Reasoning annimmt, das die Minimal-Thinking-Standards nicht liefern. Prüfen Sie den Request-Vertrag, bevor Sie die Qualität bewerten.

01

Die exakte Modell-ID gemini-3.5-flash-lite verwenden

Senden Sie model "gemini-3.5-flash-lite" (mit einem Punkt nach 3.5) auf der EvoLink API-Route. Das gemini-3-5-flash-lite mit Bindestrichen ist nur die Seiten-URL, nicht der API-Modellparameter.

Modell-ID
02

OpenAI Chat Completions oder die native Gemini-API nutzen

EvoLink stellt Gemini 3.5 Flash Lite über das OpenAI-kompatible /v1/chat/completions und den nativen Gemini-Endpunkt generateContent bereit. Verwenden Sie für beide Protokolle denselben EvoLink API-Schlüssel.

Protokolle
03

Auf die inkompatiblen Parameteränderungen achten

Eigene Werte für temperature, top-K und top-P werden ignoriert; eigene frequency- und presence-Penalties geben einen Fehler zurück; und eine Anfrage, deren letzter Turn die Rolle model hat, wird abgelehnt. Passen Sie ältere Gemini-Request-Builder entsprechend an.

Migration
04

Mehrstufige Agenten unter minimalem Thinking validieren

Da Flash Lite standardmäßig minimales Thinking nutzt, prüfen Sie, dass mehrstufige Tool-Calling-Agenten ihre Schritte abschließen und nicht zu früh stoppen. Reservieren Sie schwierigeres Reasoning für ein größeres Modell, statt dieses zu übertunen.

Agenten
Produktionsökonomie

Kosten pro akzeptierter Aufgabe vergleichen, nicht nur den Token-Preis

Gemini 3.5 Flash Lite gewinnt, wenn sein niedriger Preis und sein Tempo Ihre Qualitätsschwelle bei Arbeit mit hohem Volumen erreichen. Bewerten Sie identische Aufgabensätze und eskalieren Sie die Anfragen, die es nicht bewältigt, statt für allen Traffic Premium-Preise zu zahlen.

Erfolg im ersten VersuchAkzeptierte ErgebnisseAnzahl der RetriesAusgabe-TokenCache-TrefferrateToken pro SekundeKosten pro 1.000 AnfragenEskalationsrate zu einem größeren Modell

Wenn Gemini 3.5 Flash Lite bei einfachen Aufgaben mit hohem Volumen Ihre Qualitätsschwelle erreicht, machen sein niedriger Preis und sein Tempo es zum günstigsten Produktionsstandard. Leiten Sie nur die Anfragen, die es nicht schafft, an Gemini 3.6 Flash oder ein Modell der Pro-Klasse.

Führende Long-Context-Modelle nach dem Workload-Test vergleichen

EvoLink

Prüfen Sie zuerst, ob Gemini 3.5 Flash Lite Retries und Review-Aufwand reduziert. Vergleichen Sie anschließend Preis, Kontext, Caching und Workload-Eignung.

Gemini 3.5 Flash Lite
Eingabe / Ausgabe$0.271 / $2.25
Kontext1M
CachingAutomatische Cache-Lesezugriffe
Geeignet fürKlassifikation und Extraktion mit hohem Durchsatz, latenzarme Echtzeitaktionen, fokussierte Agenten-Subagenten und kostensensible Workloads, bei denen Geschwindigkeit und Preis wichtiger sind als maximales Reasoning.
Gemini 3.6 Flash
Eingabe / Ausgabe$1.5 / $7.5
Kontext1M
CachingKontext-Cache
Geeignet fürGrößeres Gemini, auf das man eskaliert, wenn eine Aufgabe die Minimal-Thinking-Geschwindigkeit von Flash-Lite übersteigt.
Gemini 3.1 Pro
Eingabe / Ausgabe$1.68 / $10.08
Kontext1M
CachingKontext-Cache
Geeignet fürGrößeres Gemini, auf das man eskaliert, wenn eine Aufgabe die Minimal-Thinking-Geschwindigkeit von Flash-Lite übersteigt.

Weitere Gemini-Modelle auf EvoLink

Gemini 3.6 Flash

Gemini 3.6 Flash

The workhorse to escalate to when a task needs stronger coding or reasoning than the Lite tier provides.

Modell ansehen
Gemini 3.5 Flash

Gemini 3.5 Flash

The mid Flash tier between Flash-Lite and the Pro line, balancing cost and capability.

Modell ansehen
Gemini 3.1 Pro

Gemini 3.1 Pro

The Pro-tier step up for the deepest reasoning tasks the Flash line is not built to handle.

Modell ansehen
Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite

The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.

Modell ansehen

Other text models

GPT-5.6

GPT-5.6

OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.

Modell ansehen
Claude Opus 4.8

Claude Opus 4.8

Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.

Modell ansehen
DeepSeek V4

DeepSeek V4

Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.

Modell ansehen
Kimi K3

Kimi K3

Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.

Modell ansehen

Weiterführende Leitfäden für Produktionsteams

Gemini 3.6 Flash release date & rollout

Gemini 3.6 Flash release date & rollout

What launched, the model ID, official pricing, and where the model is available.

Leitfaden lesen

Gemini 3.5 Flash Lite API – Häufige Fragen

Ist die Gemini 3.5 Flash Lite API über EvoLink verfügbar?

Ja. Gemini 3.5 Flash Lite ist als Produktionsmodell mit Live-Preisen und offiziellen Fallback-Preisen verfügbar.

Welche Modell-ID sollte ich für die Gemini 3.5 Flash Lite API verwenden?

Senden Sie model "gemini-3.5-flash-lite" (mit Punkt nach 3.5). Die Variante mit Bindestrichen gemini-3-5-flash-lite ist nur die Seiten-URL, nicht der API-Modellparameter.

Welche Protokolle und SDKs funktionieren mit Gemini 3.5 Flash Lite?

Nutzen Sie den OpenAI-kompatiblen Chat-Completions-Endpunkt oder den nativen Gemini-generateContent-Endpunkt mit demselben EvoLink-API-Schlüssel. Für dieses Modell gibt es keine Anthropic-Messages-Route.

Unterstützt die Gemini 3.5 Flash Lite API 1M Kontext oder nur 256K?

Die EvoLink-Route erfasst 1.048.576 Token. Kleinere Limits stammen meist von einer bestimmten Gemini-Produktoberfläche oder Client-Konfiguration, nicht vom API-Modell selbst.

Wie schnell und wie günstig ist Gemini 3.5 Flash Lite?

Es ist Googles schnellstes und kosteneffizientestes Modell der 3.5-Klasse – $0.30 Eingabe / $2.50 Ausgabe pro 1M Token bei rund 350 Ausgabe-Token pro Sekunde. Dieser Durchsatz pro Dollar ist sein Hauptvorteil.

Wofür eignet sich Gemini 3.5 Flash Lite am besten?

Klassifikation mit hohem Durchsatz, Routing, JSON-Extraktion, latenzarme UI-Aktionen und fokussierte Agenten-Subagenten. Für tiefes Coding oder schwieriges Reasoning eskalieren Sie zu Gemini 3.6 Flash oder einem Modell der Pro-Stufe.

Wie unterscheidet sich Gemini 3.5 Flash Lite von 3.5 Flash und 3.6 Flash?

Flash Lite ist die günstigste und schnellste Stufe und nutzt standardmäßig minimales Thinking. 3.5 Flash und 3.6 Flash sind leistungsfähigere, höher bepreiste Arbeitspferde für Coding und Agenten.

Ersetzt Gemini 3.5 Flash Lite Gemini 2.5 Flash?

Google positioniert es als Ersatz für Gemini 2.5 Flash und weniger komplexe Gemini-3-Flash-Workloads. Testen Sie Ihre Prompts vor der Migration neu.

Welche Breaking Changes muss ich bei der Migration beachten?

Benutzerdefinierte temperature, top-K und top-P werden ignoriert; benutzerdefinierte frequency- und presence-Penalty geben einen Fehler zurück; und eine Anfrage, deren letzter Turn die Rolle model hat, wird abgelehnt.

Ist Gemini 3.5 Flash Lite eine gute Standardwahl für Echtzeit oder hohes Volumen?

Ja – genau dafür ist es gebaut. Es nutzt standardmäßig minimales Thinking für Geschwindigkeit, prüfen Sie daher vor einem Rollout mit hohem Durchsatz, dass mehrstufige Agenten ihre Schritte abschließen.

Wie vergleiche ich Gemini 3.5 Flash Lite mit GPT, Claude, GLM oder DeepSeek?

Vergleichen Sie es mit anderen günstigen, schnellen Stufen anhand der Kosten pro 1K Anfragen und der Latenz, nicht mit Premium-Reasoning-Modellen. Eskalieren Sie die Anfragen, die es nicht bewältigt, zu einem größeren Modell.

Was sollte eine Produktionsbewertung von Gemini 3.5 Flash Lite messen?

Erfassen Sie Kosten pro 1K Anfragen, Token pro Sekunde, Erfolg im ersten Versuch, akzeptierte Ergebnisse, Cache-Treffer und wie oft Anfragen zu einem größeren Modell eskalieren müssen.