Gemini 3.6 Flash API
Gemini 3.6 Flash auswählen
Googles neuestes Flash-Arbeitspferd für kosteneffizientes Coding, agentische Workflows, Wissensarbeit und multimodales Reasoning – mit besserer Token-Effizienz als Gemini 3.5 Flash und einem Kontextfenster von 1 Mio. Token.
Gemini 3.6 Flash
Googles Arbeitspferd der Flash-Klasse
gemini-3.6-flashProduktions-Coding und Full-Stack-Refactoring, mehrstufige Agenten und Orchestrierung, Dokument- und Diagrammanalyse sowie Workloads mit hohem Volumen, bei denen bessere Token-Effizienz die Kosten pro erledigter Aufgabe senkt.
Gemini 3.6 Flash pricing
Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.6 Flash rate.
Token calculator
Enter the token mix for one request.Estimated request cost
Gemini 3.6 FlashMinimum charge: 0.01 credits per request.
EvoLink vs Google direct
Same token mix, default group price.Budget guide
Approximate requests using the current token mix.For quick testing
For regular development
For production evaluation
Model pricing
| Model | Context | Input tokens | Cache read tokens | Output tokens |
|---|---|---|---|---|
Gemini 3.6 Flashgemini-3.6-flash | All context sizes | $1.350 / 1M-10% 91.8 cr / 1M$1.500official price | $0.136 / 1M-10% 9.2 cr / 1M$0.150official price | $6.750 / 1M-10% 459 cr / 1M$7.500official price |
Gemini 3.6 Flash
All context sizesUSD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.
Gemini 3.6 Flash API für kosteneffizientes Coding und Agenten-Workflows
Googles neuestes Flash-Modell über EvoLinks einheitliche API nutzen. Gemini 3.6 Flash verbessert Coding, Wissensarbeit und multimodales Reasoning mit besserer Token-Effizienz als Gemini 3.5 Flash – plus 1.048.576 Token Kontext, Prompt-Caching, strukturierte Ausgaben und Tool-Nutzung, zu $1,50 / $7,50 pro Million Eingabe- / Ausgabe-Token.

Wo Gemini 3.6 Flash seinen Platz im produktiven Modell-Stack verdient
Google positioniert Gemini 3.6 Flash als effizientes Arbeitstier: besseres Coding, bessere Wissensarbeit und stärkere multimodale Leistung bei deutlich höherer Token-Effizienz als Gemini 3.5 Flash. Am besten passt es zu produktiver Arbeit, bei der ausreichend gutes Reasoning zu geringeren Token-Kosten mehr bringt als eine teure Premium-Stufe.
Kosteneffizientes Coding und Refactoring
Gemini 3.6 Flash zielt auf alltägliches Coding, Prototyping und Full-Stack-Refactoring mit weniger Token und weniger Modellaufrufen als Gemini 3.5 Flash. Es ist Googles Standard-Agentenmodell in Antigravity. Messen Sie akzeptierte Patches und Review-Zeit, nicht die Qualität einzelner Snippets.
Agentische Workflows und Orchestrierung
Es passt zu mehrstufiger Orchestrierung, Tool-Auswahl, strukturierten Ausgaben und Code-Ausführung, wo sich niedrigere Kosten pro Aufruf über lange Agentenläufe summieren. Bewahren Sie vollständige Assistant-Nachrichten, Tool-Call-IDs, Argumente und Tool-Ergebnisse über alle Turns hinweg.
Wissensarbeit und multimodales Reasoning
Nutzen Sie es für Dokumentenanalyse, Diagramm-Interpretation und die Generierung mehrteiliger Web-Layouts über einen 1M-Token-Kontext. Retrieval und Dokumentstruktur bleiben wichtig: Ein 1M-Fenster macht irrelevanten Kontext nicht nützlich.
Wann eine andere Route die bessere Wahl ist
Triviale, latenzkritische oder sehr umfangreiche Klassifikation und Extraktion gehören meist auf das günstigere Gemini 3.5 Flash-Lite. Leiten Sie das härteste Reasoning an ein Pro-Modell. Eskalieren Sie erst dann zu 3.6 Flash, wenn seine Effizienz die Kosten pro akzeptierter Aufgabe tatsächlich senkt.
Was frühe Reaktionen auf Gemini 3.6 Flash nahelegen – und was noch zu belegen ist
Gemini 3.6 Flash wurde am 2026-07-21 veröffentlicht. Behandeln Sie Community-Reaktionen vom Launch-Tag als Hypothesen, die Sie an eigenen Aufgaben, Tools, Budgets und Abnahmekriterien prüfen – nicht als gesicherte Benchmarks.
Token-Effizienz und niedrigere Ausgabekosten sind die Schlagzeile
Google- und Drittanbieter-API-Seiten betonen weniger Token, weniger Modellaufrufe und weniger Absicherungsfloskeln; die Ausgabe kostet $7,50 pro Million gegenüber $9,00 bei Gemini 3.5 Flash. Bei gleichem Workload kann das die Kosten pro erledigter Aufgabe senken, selbst bei vergleichbarer Qualität.
Es ist ein Flash-Arbeitstier, kein Spitzen-Engineering-Modell
Ein Teil der Launch-Diskussion sieht es bei schweren Software-Engineering-Benchmarks hinter größeren Frontier-Modellen. Wenn Ihre Arbeit tiefes Repository-Refactoring oder langes autonomes Coding ist, vergleichen Sie es mit einem Pro- oder Premium-Modell, bevor Sie es zum Standard machen.
Prüfen Sie Ausgabedisziplin und Formatierung an Ihren Prompts
Frühe Nutzer berichten bei manchen Aufgaben von langen oder überformatierten Antworten. Prüfen Sie Antwortlänge, Instruktionstreue und Tool-Call-Disziplin an repräsentativen Prompts, damit Weitschweifigkeit die Ausgabekosten nicht unbemerkt erhöht.
Es ist ein geschlossenes, rein per API verfügbares Google-Modell
Gemini 3.6 Flash hat keine offenen Gewichte und kann nicht selbst gehostet werden. Der Zugang erfolgt über die Gemini API und Plattformen wie Google AI Studio, Antigravity und einheitliche Gateways wie EvoLink – routen Sie also nach Kosten und Zuverlässigkeit, nicht nach lokalem Deployment.
Warum Gemini 3.6 Flash diese Workloads bewältigen kann
Gemini 3.6 Flash ist am nützlichsten, wenn ein großes Kontextfenster, höhere Token-Effizienz und wiederverwendbare Prompt-Präfixe zusammenwirken. Kontextgröße allein verbessert keine Antwort; der Workload braucht weiterhin relevante Evidenz, klare Struktur und ein Ausgabebudget.
1M Token als Arbeitsraum, nicht als Füllziel
Das Fenster von 1.048.576 Token kann zusammengehörigen Code, Spezifikationen und frühere Tool-Ergebnisse ohne übermäßiges Chunking bereithalten. Retrieval und Kontextkomprimierung bleiben wichtig, weil irrelevante Eingaben um Aufmerksamkeit konkurrieren und die Verarbeitungskosten erhöhen.
Höhere Token-Effizienz als 3.5 Flash
Gemini 3.6 Flash will mehrstufige Workflows in weniger Turns und mit weniger Token abschließen. Weniger Modellaufrufe und günstigere Ausgabe sind die Quelle des Kostenvorteils; verfolgen Sie daher die Gesamt-Token pro akzeptierter Aufgabe statt eines einzelnen Anfragepreises.
Prompt-Caching zahlt sich bei stabilen Präfixen aus
Repository-Anweisungen, System-Prompts, Referenzmaterial und Tool-Schemas bieten das größte Cache-Potenzial, wenn ihre Reihenfolge konsistent bleibt. Häufige Modell- oder Prompt-Struktur-Änderungen können eine erneute Verarbeitung des langen Präfixes erzwingen.
Was vor produktivem Traffic zu Gemini 3.6 Flash zu prüfen ist
Ein geeigneter Workload kann trotzdem scheitern, weil die Integration den falschen Bezeichner verwendet, nicht unterstützte Parameter sendet oder den Agentenstatus zwischen Turns verliert. Prüfen Sie Request-Oberfläche und Gesprächsvertrag, bevor Sie die Modellqualität bewerten.
Die exakte Modell-ID gemini-3.6-flash verwenden
Senden Sie model "gemini-3.6-flash" (mit Punkten) auf der EvoLink API-Route. Die Form mit Bindestrichen gemini-3-6-flash ist nur die Seiten-URL, nicht der API-Modellparameter.
OpenAI Chat Completions oder die native Gemini API nutzen
EvoLink stellt Gemini 3.6 Flash über das OpenAI-kompatible /v1/chat/completions und den nativen Gemini-Endpunkt generateContent bereit. Nutzen Sie für beide Protokolle denselben EvoLink API-Schlüssel.
Auf die breaking Parameteränderungen achten
Eigene temperature, top-K und top-P werden ignoriert; eigene frequency- und presence-Penalties geben einen Fehler zurück; und eine Anfrage, deren letzter Turn die Rolle model hat, wird abgelehnt. Passen Sie ältere Gemini-Request-Builder entsprechend an.
Vollständigen Assistant- und Tool-Status erneut senden
Mehrstufige Agenten sollten vollständige Assistant-Nachrichten, Tool-Call-IDs, Argumente und Tool-Ergebnisse behalten. Nur den finalen Text zu behalten unterbricht die Zustandskontinuität und kann spätere Schritte scheitern lassen, selbst wenn das Kontextfenster groß genug ist.
Kosten pro akzeptierter Aufgabe vergleichen, nicht nur den Token-Preis
Gemini 3.6 Flash gewinnt ökonomisch, wenn seine Effizienz Token, Modellaufrufe, Retries oder manuelle Nacharbeit beim selben Workload reduziert. Bewerten Sie identische Aufgabensätze statt isolierter Prompt-Preise.
Liefert Gemini 3.6 Flash nutzbare Ergebnisse mit weniger Token und geringerem Review-Aufwand, summieren sich seine niedrigeren Preise zu einem echten Kostenvorteil. Sinkt die Qualität bei Ihren härtesten Aufgaben, eskalieren Sie diese an ein Pro-Modell und behalten 3.6 Flash für die effiziente Mehrheit.
Führende Long-Context-Modelle nach dem Workload-Test vergleichen
EvoLinkPrüfen Sie zuerst, ob Gemini 3.6 Flash Retries und Review-Aufwand reduziert. Vergleichen Sie anschließend Preis, Kontext, Caching und Workload-Eignung.
| Modell | Gemini 3.6 Flash | Gemini 3.5 Flash Lite | Gemini 3.1 Pro |
|---|---|---|---|
| Eingabe / Ausgabe | $1.35 / $6.75 | $0.3 / $2.5 | $1.68 / $10.08 |
| Kontext | 1M | 1M | 1M |
| Caching | Automatische Cache-Lesezugriffe | Kontext-Cache | Kontext-Cache |
| Geeignet für | Produktions-Coding und Full-Stack-Refactoring, mehrstufige Agenten und Orchestrierung, Dokument- und Diagrammanalyse sowie Workloads mit hohem Volumen, bei denen bessere Token-Effizienz die Kosten pro erledigter Aufgabe senkt. | Gemini der Pro-Klasse für die anspruchsvollsten Reasoning-Aufgaben, für die die Flash-Reihe nicht ausgelegt ist. | Gemini der Pro-Klasse für die anspruchsvollsten Reasoning-Aufgaben, für die die Flash-Reihe nicht ausgelegt ist. |
Weitere Gemini-Modelle auf EvoLink

Gemini 3.5 Flash
The previous-generation Flash workhorse that 3.6 Flash improves on for token efficiency and output cost.
Modell ansehen
Gemini 3.5 Flash Lite
The cheapest, fastest 3.5-class route for classification, extraction, and high-throughput subagents.
Modell ansehen
Gemini 3.1 Pro
The Pro-tier step up when a task needs deeper reasoning than the Flash line can deliver.
Modell ansehen
Gemini 3.1 Flash Lite
The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.
Modell ansehenOther text models

GPT-5.6
OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.
Modell ansehen
Claude Opus 4.8
Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.
Modell ansehen
DeepSeek V4
Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.
Modell ansehen
Kimi K3
Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.
Modell ansehenWeiterführende Leitfäden für Produktionsteams

Gemini 3.6 Flash release date & rollout
What launched, the model ID, official pricing, and where the model is available.
Leitfaden lesenGemini 3.6 Flash API – Häufige Fragen
Ist die Gemini 3.6 Flash API über EvoLink verfügbar?
Ja. Gemini 3.6 Flash ist als Produktionsmodell mit Live-Backend-Preisen und offiziellen Fallback-Tarifen verfügbar.
Welche Modell-ID sollte ich für die Gemini 3.6 Flash API verwenden?
Senden Sie das Modell "gemini-3.6-flash" (mit Punkten). Das Bindestrich-Format gemini-3-6-flash ist nur die Seiten-URL, nicht der API-Modellparameter.
Welche Protokolle und SDKs funktionieren mit Gemini 3.6 Flash?
Nutzen Sie den OpenAI-kompatiblen Chat-Completions-Endpunkt oder den nativen Gemini-Endpunkt generateContent mit demselben EvoLink API-Schlüssel. Für dieses Modell gibt es keine Messages-API-Route von Anthropic.
Unterstützt die Gemini 3.6 Flash API 1M Kontext oder nur 256K?
Die EvoLink-Route verzeichnet 1.048.576 Token. Kleinere Limits stammen meist von einer bestimmten Gemini-Produktoberfläche oder Client-Konfiguration, nicht vom API-Modell selbst.
Wie sollte ich das 1M-Token-Kontextfenster von Gemini 3.6 Flash nutzen?
Halten Sie zusammengehörigen Code, Dokumente und Tool-Ergebnisse zusammen, nutzen Sie aber Retrieval, stabile gecachte Präfixe und Kontextkomprimierung, statt das Fenster standardmäßig zu füllen.
Wie unterscheidet sich Gemini 3.6 Flash von Gemini 3.5 Flash und 3.5 Flash-Lite?
3.6 Flash ist das neuere Arbeitspferd mit besserem Coding und höherer Token-Effizienz als 3.5 Flash (Ausgabe 7,50 $ statt 9,00 $ pro 1M). 3.5 Flash-Lite ist die günstigere, schnellere Route für Klassifikation und Aufgaben mit hohem Durchsatz.
Warum ist Gemini 3.6 Flash im Betrieb günstiger als Gemini 3.5 Flash?
Es zielt auf weniger Token und weniger Modellaufrufe pro Aufgabe ab, und sein Ausgabepreis ist niedriger. Verfolgen Sie die Gesamt-Token pro akzeptierter Aufgabe, nicht nur den Preis pro Anfrage.
Welche Breaking Changes muss ich bei der Migration zu Gemini 3.6 Flash beachten?
Eigene temperature-, top-K- und top-P-Werte werden ignoriert; eigene frequency- und presence-Penalties führen zu einem Fehler; und eine Anfrage, deren letzter Turn die Modellrolle hat, wird abgelehnt.
Wie sollte ich das Ausgabebudget von Gemini 3.6 Flash festlegen?
Begrenzen Sie die Ausgabe je nach Aufgabenkomplexität und überwachen Sie sowohl Reasoning- als auch finale Antwort-Token. Das Limit von 65.536 Token ist Kapazität, kein routinemäßiges Ziel.
Ist Gemini 3.6 Flash eine gute Standardwahl für Echtzeit- oder Anfragen mit hohem Volumen?
Für die günstigste Klassifikation und Extraktion mit geringster Latenz verwenden Sie Gemini 3.5 Flash-Lite. Nutzen Sie 3.6 Flash, wenn seine Coding- und Reasoning-Qualität einen etwas höheren Tarif rechtfertigt.
Wie sollte ich Gemini 3.6 Flash mit GPT, Claude, GLM oder DeepSeek vergleichen?
Bewerten Sie Gemini 3.6 Flash für effizientes Coding und Agenten-Ökonomie, GPT und Claude als Frontier-Fähigkeitsbasislinien sowie GLM oder DeepSeek als kostenorientierte offene Basislinien.
Was sollte eine produktive Bewertung von Gemini 3.6 Flash messen?
Erfassen Sie Erfolg im ersten Versuch, akzeptierte Ergebnisse, Retries, Ausgabe-Token, Cache-Treffer, gültige Tool-Aufrufe, Zeit bis zum akzeptierten Ergebnis, menschliche Korrektur und Fallback-Rate.