Kimi K3 ist jetzt verfügbarKimi K3 entdecken

Gemini 3.6 Flash API

Google-Textgenerierung-ab $1.350 / 1M Eingabe-Token$1.500 offizieller Preis-Verfügbar
1M Kontext65K StandardausgabePrompt-CachingChat + Gemini API
API-Dokumentation
Production routeLive
Anbieter
Google
Modell
3.6 Flash
Kontextfenster
1.048.576 Token
Protokolle
Chat + Gemini

Gemini 3.6 Flash auswählen

Googles neuestes Flash-Arbeitspferd für kosteneffizientes Coding, agentische Workflows, Wissensarbeit und multimodales Reasoning – mit besserer Token-Effizienz als Gemini 3.5 Flash und einem Kontextfenster von 1 Mio. Token.

Gemini 3.6 Flash

Googles Arbeitspferd der Flash-Klasse

Ausgewählt
Ab $1.350 / 1M Eingabe-Token$1.500 offizieller Preisgemini-3.6-flash
Geeignet für

Produktions-Coding und Full-Stack-Refactoring, mehrstufige Agenten und Orchestrierung, Dokument- und Diagrammanalyse sowie Workloads mit hohem Volumen, bei denen bessere Token-Effizienz die Kosten pro erledigter Aufgabe senkt.

Eingabe
$1.350 / 1M-10%
91.8 cr / 1M$1.500offizieller Preis
Cache-Lesen
$0.136 / 1M-10%
9.2 cr / 1M$0.150offizieller Preis
Ausgabe
$6.750 / 1M-10%
459 cr / 1M$7.500offizieller Preis

Gemini 3.6 Flash pricing

Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.6 Flash rate.

3.6 Flash

Token calculator

Enter the token mix for one request.

Estimated request cost

Gemini 3.6 Flash
Official rate
USD$0.0035
Credits0.2314
Input tokens0.0918 cr
Cache read tokens0.0019 cr
Output tokens0.1377 cr

Minimum charge: 0.01 credits per request.

EvoLink vs Google direct

Same token mix, default group price.
-10%
EvoLink estimate$0.0035
Google official$0.0038
You save$0.0004

Budget guide

Approximate requests using the current token mix.
Add credits
$10
About 2938 requests

For quick testing

$50
About 14693 requests

For regular development

$100
About 29386 requests

For production evaluation

Model pricing

Gemini 3.6 Flash

All context sizes
Input tokens
$1.350 / 1M-10%
91.8 cr / 1M$1.500official price
Cache read tokens
$0.136 / 1M-10%
9.2 cr / 1M$0.150official price
Output tokens
$6.750 / 1M-10%
459 cr / 1M$7.500official price

USD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.

Gemini 3.6 Flash API für kosteneffizientes Coding und Agenten-Workflows

Googles neuestes Flash-Modell über EvoLinks einheitliche API nutzen. Gemini 3.6 Flash verbessert Coding, Wissensarbeit und multimodales Reasoning mit besserer Token-Effizienz als Gemini 3.5 Flash – plus 1.048.576 Token Kontext, Prompt-Caching, strukturierte Ausgaben und Tool-Nutzung, zu $1,50 / $7,50 pro Million Eingabe- / Ausgabe-Token.

Gemini 3.6 Flash
Gemini 3.6 Flash Einsatzbereiche

Wo Gemini 3.6 Flash seinen Platz im produktiven Modell-Stack verdient

Google positioniert Gemini 3.6 Flash als effizientes Arbeitstier: besseres Coding, bessere Wissensarbeit und stärkere multimodale Leistung bei deutlich höherer Token-Effizienz als Gemini 3.5 Flash. Am besten passt es zu produktiver Arbeit, bei der ausreichend gutes Reasoning zu geringeren Token-Kosten mehr bringt als eine teure Premium-Stufe.

Kosteneffizientes Coding und Refactoring

Gemini 3.6 Flash zielt auf alltägliches Coding, Prototyping und Full-Stack-Refactoring mit weniger Token und weniger Modellaufrufen als Gemini 3.5 Flash. Es ist Googles Standard-Agentenmodell in Antigravity. Messen Sie akzeptierte Patches und Review-Zeit, nicht die Qualität einzelner Snippets.

Agentische Workflows und Orchestrierung

Es passt zu mehrstufiger Orchestrierung, Tool-Auswahl, strukturierten Ausgaben und Code-Ausführung, wo sich niedrigere Kosten pro Aufruf über lange Agentenläufe summieren. Bewahren Sie vollständige Assistant-Nachrichten, Tool-Call-IDs, Argumente und Tool-Ergebnisse über alle Turns hinweg.

Wissensarbeit und multimodales Reasoning

Nutzen Sie es für Dokumentenanalyse, Diagramm-Interpretation und die Generierung mehrteiliger Web-Layouts über einen 1M-Token-Kontext. Retrieval und Dokumentstruktur bleiben wichtig: Ein 1M-Fenster macht irrelevanten Kontext nicht nützlich.

Wann eine andere Route die bessere Wahl ist

Triviale, latenzkritische oder sehr umfangreiche Klassifikation und Extraktion gehören meist auf das günstigere Gemini 3.5 Flash-Lite. Leiten Sie das härteste Reasoning an ein Pro-Modell. Eskalieren Sie erst dann zu 3.6 Flash, wenn seine Effizienz die Kosten pro akzeptierter Aufgabe tatsächlich senkt.

Signale zum Launch-Tag

Was frühe Reaktionen auf Gemini 3.6 Flash nahelegen – und was noch zu belegen ist

Gemini 3.6 Flash wurde am 2026-07-21 veröffentlicht. Behandeln Sie Community-Reaktionen vom Launch-Tag als Hypothesen, die Sie an eigenen Aufgaben, Tools, Budgets und Abnahmekriterien prüfen – nicht als gesicherte Benchmarks.

Token-Effizienz und niedrigere Ausgabekosten sind die Schlagzeile

Google- und Drittanbieter-API-Seiten betonen weniger Token, weniger Modellaufrufe und weniger Absicherungsfloskeln; die Ausgabe kostet $7,50 pro Million gegenüber $9,00 bei Gemini 3.5 Flash. Bei gleichem Workload kann das die Kosten pro erledigter Aufgabe senken, selbst bei vergleichbarer Qualität.

Es ist ein Flash-Arbeitstier, kein Spitzen-Engineering-Modell

Ein Teil der Launch-Diskussion sieht es bei schweren Software-Engineering-Benchmarks hinter größeren Frontier-Modellen. Wenn Ihre Arbeit tiefes Repository-Refactoring oder langes autonomes Coding ist, vergleichen Sie es mit einem Pro- oder Premium-Modell, bevor Sie es zum Standard machen.

Prüfen Sie Ausgabedisziplin und Formatierung an Ihren Prompts

Frühe Nutzer berichten bei manchen Aufgaben von langen oder überformatierten Antworten. Prüfen Sie Antwortlänge, Instruktionstreue und Tool-Call-Disziplin an repräsentativen Prompts, damit Weitschweifigkeit die Ausgabekosten nicht unbemerkt erhöht.

Es ist ein geschlossenes, rein per API verfügbares Google-Modell

Gemini 3.6 Flash hat keine offenen Gewichte und kann nicht selbst gehostet werden. Der Zugang erfolgt über die Gemini API und Plattformen wie Google AI Studio, Antigravity und einheitliche Gateways wie EvoLink – routen Sie also nach Kosten und Zuverlässigkeit, nicht nach lokalem Deployment.

Kernfähigkeiten

Warum Gemini 3.6 Flash diese Workloads bewältigen kann

Gemini 3.6 Flash ist am nützlichsten, wenn ein großes Kontextfenster, höhere Token-Effizienz und wiederverwendbare Prompt-Präfixe zusammenwirken. Kontextgröße allein verbessert keine Antwort; der Workload braucht weiterhin relevante Evidenz, klare Struktur und ein Ausgabebudget.

1M Token als Arbeitsraum, nicht als Füllziel

Das Fenster von 1.048.576 Token kann zusammengehörigen Code, Spezifikationen und frühere Tool-Ergebnisse ohne übermäßiges Chunking bereithalten. Retrieval und Kontextkomprimierung bleiben wichtig, weil irrelevante Eingaben um Aufmerksamkeit konkurrieren und die Verarbeitungskosten erhöhen.

Höhere Token-Effizienz als 3.5 Flash

Gemini 3.6 Flash will mehrstufige Workflows in weniger Turns und mit weniger Token abschließen. Weniger Modellaufrufe und günstigere Ausgabe sind die Quelle des Kostenvorteils; verfolgen Sie daher die Gesamt-Token pro akzeptierter Aufgabe statt eines einzelnen Anfragepreises.

Prompt-Caching zahlt sich bei stabilen Präfixen aus

Repository-Anweisungen, System-Prompts, Referenzmaterial und Tool-Schemas bieten das größte Cache-Potenzial, wenn ihre Reihenfolge konsistent bleibt. Häufige Modell- oder Prompt-Struktur-Änderungen können eine erneute Verarbeitung des langen Präfixes erzwingen.

Gemini 3.6 Flash API Produktionsprüfung

Was vor produktivem Traffic zu Gemini 3.6 Flash zu prüfen ist

Ein geeigneter Workload kann trotzdem scheitern, weil die Integration den falschen Bezeichner verwendet, nicht unterstützte Parameter sendet oder den Agentenstatus zwischen Turns verliert. Prüfen Sie Request-Oberfläche und Gesprächsvertrag, bevor Sie die Modellqualität bewerten.

01

Die exakte Modell-ID gemini-3.6-flash verwenden

Senden Sie model "gemini-3.6-flash" (mit Punkten) auf der EvoLink API-Route. Die Form mit Bindestrichen gemini-3-6-flash ist nur die Seiten-URL, nicht der API-Modellparameter.

Modell-ID
02

OpenAI Chat Completions oder die native Gemini API nutzen

EvoLink stellt Gemini 3.6 Flash über das OpenAI-kompatible /v1/chat/completions und den nativen Gemini-Endpunkt generateContent bereit. Nutzen Sie für beide Protokolle denselben EvoLink API-Schlüssel.

Protokolle
03

Auf die breaking Parameteränderungen achten

Eigene temperature, top-K und top-P werden ignoriert; eigene frequency- und presence-Penalties geben einen Fehler zurück; und eine Anfrage, deren letzter Turn die Rolle model hat, wird abgelehnt. Passen Sie ältere Gemini-Request-Builder entsprechend an.

Migration
04

Vollständigen Assistant- und Tool-Status erneut senden

Mehrstufige Agenten sollten vollständige Assistant-Nachrichten, Tool-Call-IDs, Argumente und Tool-Ergebnisse behalten. Nur den finalen Text zu behalten unterbricht die Zustandskontinuität und kann spätere Schritte scheitern lassen, selbst wenn das Kontextfenster groß genug ist.

Tool-Status
Produktionsökonomie

Kosten pro akzeptierter Aufgabe vergleichen, nicht nur den Token-Preis

Gemini 3.6 Flash gewinnt ökonomisch, wenn seine Effizienz Token, Modellaufrufe, Retries oder manuelle Nacharbeit beim selben Workload reduziert. Bewerten Sie identische Aufgabensätze statt isolierter Prompt-Preise.

Erfolg im ersten VersuchAkzeptierte ErgebnisseAnzahl der RetriesAusgabe-TokenCache-TrefferrateGültige Tool-AufrufeZeit bis zum nutzbaren ErgebnisKorrektur- und Fallback-Rate

Liefert Gemini 3.6 Flash nutzbare Ergebnisse mit weniger Token und geringerem Review-Aufwand, summieren sich seine niedrigeren Preise zu einem echten Kostenvorteil. Sinkt die Qualität bei Ihren härtesten Aufgaben, eskalieren Sie diese an ein Pro-Modell und behalten 3.6 Flash für die effiziente Mehrheit.

Führende Long-Context-Modelle nach dem Workload-Test vergleichen

EvoLink

Prüfen Sie zuerst, ob Gemini 3.6 Flash Retries und Review-Aufwand reduziert. Vergleichen Sie anschließend Preis, Kontext, Caching und Workload-Eignung.

Gemini 3.6 Flash
Eingabe / Ausgabe$1.35 / $6.75
Kontext1M
CachingAutomatische Cache-Lesezugriffe
Geeignet fürProduktions-Coding und Full-Stack-Refactoring, mehrstufige Agenten und Orchestrierung, Dokument- und Diagrammanalyse sowie Workloads mit hohem Volumen, bei denen bessere Token-Effizienz die Kosten pro erledigter Aufgabe senkt.
Gemini 3.5 Flash Lite
Eingabe / Ausgabe$0.3 / $2.5
Kontext1M
CachingKontext-Cache
Geeignet fürGemini der Pro-Klasse für die anspruchsvollsten Reasoning-Aufgaben, für die die Flash-Reihe nicht ausgelegt ist.
Gemini 3.1 Pro
Eingabe / Ausgabe$1.68 / $10.08
Kontext1M
CachingKontext-Cache
Geeignet fürGemini der Pro-Klasse für die anspruchsvollsten Reasoning-Aufgaben, für die die Flash-Reihe nicht ausgelegt ist.

Weitere Gemini-Modelle auf EvoLink

Gemini 3.5 Flash

Gemini 3.5 Flash

The previous-generation Flash workhorse that 3.6 Flash improves on for token efficiency and output cost.

Modell ansehen
Gemini 3.5 Flash Lite

Gemini 3.5 Flash Lite

The cheapest, fastest 3.5-class route for classification, extraction, and high-throughput subagents.

Modell ansehen
Gemini 3.1 Pro

Gemini 3.1 Pro

The Pro-tier step up when a task needs deeper reasoning than the Flash line can deliver.

Modell ansehen
Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite

The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.

Modell ansehen

Other text models

GPT-5.6

GPT-5.6

OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.

Modell ansehen
Claude Opus 4.8

Claude Opus 4.8

Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.

Modell ansehen
DeepSeek V4

DeepSeek V4

Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.

Modell ansehen
Kimi K3

Kimi K3

Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.

Modell ansehen

Weiterführende Leitfäden für Produktionsteams

Gemini 3.6 Flash release date & rollout

Gemini 3.6 Flash release date & rollout

What launched, the model ID, official pricing, and where the model is available.

Leitfaden lesen

Gemini 3.6 Flash API – Häufige Fragen

Ist die Gemini 3.6 Flash API über EvoLink verfügbar?

Ja. Gemini 3.6 Flash ist als Produktionsmodell mit Live-Backend-Preisen und offiziellen Fallback-Tarifen verfügbar.

Welche Modell-ID sollte ich für die Gemini 3.6 Flash API verwenden?

Senden Sie das Modell "gemini-3.6-flash" (mit Punkten). Das Bindestrich-Format gemini-3-6-flash ist nur die Seiten-URL, nicht der API-Modellparameter.

Welche Protokolle und SDKs funktionieren mit Gemini 3.6 Flash?

Nutzen Sie den OpenAI-kompatiblen Chat-Completions-Endpunkt oder den nativen Gemini-Endpunkt generateContent mit demselben EvoLink API-Schlüssel. Für dieses Modell gibt es keine Messages-API-Route von Anthropic.

Unterstützt die Gemini 3.6 Flash API 1M Kontext oder nur 256K?

Die EvoLink-Route verzeichnet 1.048.576 Token. Kleinere Limits stammen meist von einer bestimmten Gemini-Produktoberfläche oder Client-Konfiguration, nicht vom API-Modell selbst.

Wie sollte ich das 1M-Token-Kontextfenster von Gemini 3.6 Flash nutzen?

Halten Sie zusammengehörigen Code, Dokumente und Tool-Ergebnisse zusammen, nutzen Sie aber Retrieval, stabile gecachte Präfixe und Kontextkomprimierung, statt das Fenster standardmäßig zu füllen.

Wie unterscheidet sich Gemini 3.6 Flash von Gemini 3.5 Flash und 3.5 Flash-Lite?

3.6 Flash ist das neuere Arbeitspferd mit besserem Coding und höherer Token-Effizienz als 3.5 Flash (Ausgabe 7,50 $ statt 9,00 $ pro 1M). 3.5 Flash-Lite ist die günstigere, schnellere Route für Klassifikation und Aufgaben mit hohem Durchsatz.

Warum ist Gemini 3.6 Flash im Betrieb günstiger als Gemini 3.5 Flash?

Es zielt auf weniger Token und weniger Modellaufrufe pro Aufgabe ab, und sein Ausgabepreis ist niedriger. Verfolgen Sie die Gesamt-Token pro akzeptierter Aufgabe, nicht nur den Preis pro Anfrage.

Welche Breaking Changes muss ich bei der Migration zu Gemini 3.6 Flash beachten?

Eigene temperature-, top-K- und top-P-Werte werden ignoriert; eigene frequency- und presence-Penalties führen zu einem Fehler; und eine Anfrage, deren letzter Turn die Modellrolle hat, wird abgelehnt.

Wie sollte ich das Ausgabebudget von Gemini 3.6 Flash festlegen?

Begrenzen Sie die Ausgabe je nach Aufgabenkomplexität und überwachen Sie sowohl Reasoning- als auch finale Antwort-Token. Das Limit von 65.536 Token ist Kapazität, kein routinemäßiges Ziel.

Ist Gemini 3.6 Flash eine gute Standardwahl für Echtzeit- oder Anfragen mit hohem Volumen?

Für die günstigste Klassifikation und Extraktion mit geringster Latenz verwenden Sie Gemini 3.5 Flash-Lite. Nutzen Sie 3.6 Flash, wenn seine Coding- und Reasoning-Qualität einen etwas höheren Tarif rechtfertigt.

Wie sollte ich Gemini 3.6 Flash mit GPT, Claude, GLM oder DeepSeek vergleichen?

Bewerten Sie Gemini 3.6 Flash für effizientes Coding und Agenten-Ökonomie, GPT und Claude als Frontier-Fähigkeitsbasislinien sowie GLM oder DeepSeek als kostenorientierte offene Basislinien.

Was sollte eine produktive Bewertung von Gemini 3.6 Flash messen?

Erfassen Sie Erfolg im ersten Versuch, akzeptierte Ergebnisse, Retries, Ausgabe-Token, Cache-Treffer, gültige Tool-Aufrufe, Zeit bis zum akzeptierten Ergebnis, menschliche Korrektur und Fallback-Rate.