Seedance 2.5 ist jetzt auf EvoLink verfügbarSeedance 2.5 testen
Eine helle KI-Route beschleunigt durch ein dunkles Produktions-Gateway
Release-Beobachtung

Gemini 3.7 Flash Release: Was am 13. August 2026 ausgeliefert wurde

EvoLink Team
EvoLink Team
Product Team
14. August 2026
7 Min. Lesezeit

Die direkte Antwort: Was ist Stand heute bestätigt?

Gemini 3.7 Flash ist allgemein verfügbar (GA). Google hat das Modell am 13. August 2026 veröffentlicht und beschreibt es als "our most intelligent workhorse model yet for coding and agents". Diese Fakten sind mit Stand 14. August 2026 gegen Googles offizielle Dokumentation abgeglichen:
  • Modell-ID: gemini-3.7-flash — ein stabiles Release, ohne Preview-Suffix.
  • Kontextfenster: 1,048,576 Tokens; maximaler Output: 65,536 Tokens.
  • Input: Text, Bild, Video, Audio, PDF. Output: nur Text.
  • Offizieller Einführungspreis: $0.75 Input / $3.75 Output pro 1M Tokens bis zum 31. Dezember 2026, danach $1.50 / $7.50 ab dem 1. Januar 2027. Thinking-Tokens werden zum Output-Preis abgerechnet.
  • Gleicher Preis wie Gemini 3.6 Flash — das Upgrade-Argument sind Fähigkeiten und Token-Effizienz, nicht ein günstigerer Tarif.
  • Es ist kein neu vortrainiertes Modell: Googles Model Card beschreibt es als algorithmische Verbesserungen auf der Reasoning-Basis von Gemini 3.6 Flash, ausgeliefert drei Wochen nach 3.6.
Preise auf EvoLink, Codebeispiele und Hinweise für den Produktionseinsatz finden Sie auf der Gemini 3.7 Flash API-Seite.

Was sich gegenüber Gemini 3.6 Flash geändert hat

Googles veröffentlichte Benchmark-Deltas gegenüber Gemini 3.6 Flash (alle Zahlen stammen von Google selbst, aus der offiziellen Model Card — bis unabhängige Replikationen vorliegen, sollten sie als Herstellerangaben behandelt werden):
BenchmarkGemini 3.7 FlashGemini 3.6 Flash
FrontierCode 1.1 (Produktions-Coding)43.6%34.4%
DeepSWE v1.1 (Long-Horizon SWE)65.3%~49% (Baseline-Werte variieren je nach Quelle)
Terminal-bench 2.1 (Terminal-Ausführung)85.8%78.0%
AutomationBench (agentisch)30.4%17.0%
WebDev Arena1588 Elo1538 Elo
GDM-MRCR v2 128k (langer Kontext)97.0%91.8%
Wenn Sie abwägen, ob ein bestehender 3.6-Workload umziehen soll, finden Sie den Entscheidungsleitfaden hier: Gemini 3.7 Flash vs Gemini 3.6 Flash.
Das Launch-Narrativ dreht sich um agentische Zuverlässigkeit: weniger fehlgeschlagene Agent-Loops, besseres Erholen nach Hindernissen sowie stärkeres Design-to-Code- und Codebase-Auditing-Verhalten. Die unabhängige Berichterstattung zum Launch wiederholt diese Zahlen weitgehend; die bislang einzigen unabhängigen Messungen stammen von Artificial Analysis, die neben einer Output-Geschwindigkeit auf Spitzenniveau eine höhere Halluzinationsrate als bei 3.6 Flash festhielten — das sollte man vor dem Produktionseinsatz auf den eigenen Tasks verifizieren.

Thinking-Level: minimal ist weg

Gemini 3.7 Flash führt einstellbare Thinking-Level ein — low, medium (Standard) und high. Zwei Konsequenzen für bestehende Flash-Nutzer:
  1. minimal existiert nicht mehr. Wer es an die Gemini API sendet, erhält einen Fehler; low ist damit die günstigste Reasoning-Stufe. Klassifikations- und Extraktions-Pipelines mit hohem Volumen, die sich auf minimal verlassen haben, sollten stattdessen Gemini 3.5 Flash-Lite als Low-Cost-Route benchmarken.
  2. Die niedrigste verfügbare Reasoning-Stufe ist low, und Thinking-Tokens werden zum Output-Preis abgerechnet — die Output-Kosten hängen also vom gewählten Thinking-Level ab, nicht nur von der Antwortlänge.
Auf EvoLink werden Requests, die weiterhin reasoning_effort: "none" oder "minimal" senden, automatisch auf low heruntergestuft statt fehlzuschlagen — migrierter Code läuft also weiter, während Sie ihn aktualisieren.

Breaking API Changes und die Migrations-Checkliste

Die Migration von Gemini 3.6 Flash ist ein Modell-ID-Tausch plus Parameter-Hygiene:

  • Modell auf gemini-3.7-flash umstellen (die Variante mit Bindestrichen ist eine Seiten-URL, kein API-Parameter).
  • Eigene Werte für temperature, top_p, top_k und candidate_count entfernen — sie sind auf 3.7 Flash deprecated.
  • Numerische thinking_budget-Werte durch den String-Parameter thinking_level ersetzen.
  • minimal durch low ersetzen oder diesen Traffic auf ein Lite-Modell umleiten.
  • Repräsentative Prompts erneut durchlaufen lassen: gleicher Tarif heißt nicht gleicher Token-Verbrauch, und einige Launch-Day-Berichte beobachteten einen höheren Token-Verbrauch pro Task als bei 3.6.

Release heißt nicht API-Verfügbarkeit überall

Die Gemini-3.7-Flash-Modellroute wird über drei API-Kanäle verifiziert
Die Gemini-3.7-Flash-Modellroute wird über drei API-Kanäle verifiziert

GA bei Google bedeutet nicht, dass das Modell auf jedem Kanal live ist, den Sie nutzen. Stand 14. August 2026:

  • Offizielle Kanäle: Gemini API / AI Studio, Android Studio, Google Antigravity, Gemini Enterprise Agent Platform sowie die Spark-Experience der Gemini-App.
  • Aggregatoren: OpenRouter listete das Modell ab Tag null; kie.ai zog innerhalb eines Tages nach. Die meisten anderen Aggregations-Plattformen konzentrieren sich auf Open-Weight-Modelle und werden es voraussichtlich gar nicht anbieten — es ist ein geschlossenes, reines API-Modell ohne Weights zum Selbst-Hosten.
  • EvoLink: gemini-3.7-flash steht sowohl auf dem OpenAI-kompatiblen Endpoint /v1/chat/completions als auch auf der nativen Gemini API zur Verfügung. Prüfen Sie die Route mit Ihrem eigenen Key, bevor Sie Produktions-Traffic umstellen:
curl -s https://api.evolink.ai/v1/models \
  -H "Authorization: Bearer $EVOLINK_API_KEY" | grep gemini-3.7-flash
gemini-3.6-flash bleibt zum selben Preis auf denselben Endpoints verfügbar — Sie können die Migration also schrittweise ausrollen und bei Regressionen sofort zurückschalten.

Preise: Das Einführungsfenster zählt

Die viel zitierten $0.75 / $3.75 sind ein Einführungspreis mit Ablaufdatum. Googles veröffentlichter Zeitplan:
Bis 31. Dez. 2026Ab 1. Jan. 2027
Input / 1M Tokens$0.75$1.50
Output (inkl. Thinking) / 1M$3.75$7.50
Cache Read / 1M$0.075$0.15

Für Agenten-Workloads ist der Cache Read der entscheidende Hebel: Mit $0,075 pro 1M Token kostet ein Cache-Treffer ein Zehntel frischer Eingabe-Token. Stabile System-Prompts, Repository-Anweisungen und Tool-Schemas rechnen sich also, sobald das Präfix über mehrere Aufrufe hinweg identisch bleibt.

Batch läuft in beiden Zeiträumen zum halben Preis. Wer Kostenmodelle für 2027er-Budgets baut, sollte mit den Standardpreisen rechnen, nicht mit den Launch-Zahlen. Die aktuellen EvoLink-Preise für das Modell werden live im Preisbereich der Gemini-3.7-Flash-Seite angezeigt.

Signale, die man im Blick behalten sollte

  • Unabhängige Benchmark-Replikationen — bisher hat nur ein unabhängiger Tracker Messungen veröffentlicht.
  • Follow-ups zur Halluzinationsrate — das Regressionssignal vom Launch-Tag braucht mehr Daten.
  • Die eigenen Token-pro-Task-Deltas — die Effizienz-Aussage ist workload-abhängig.
  • Aggregator-Rollout — ob über OpenRouter und kie.ai hinaus weitere Plattformen das Modell listen.
  • Ein künftiges Pro-Release — Googles neuestes Modell der Pro-Linie ist weiterhin gemini-3.1-pro-preview.
  • 31. Dezember 2026 — das Ende des Einführungspreises.

FAQ

Wann wurde Gemini 3.7 Flash veröffentlicht?

Am 13. August 2026, als allgemein verfügbares (GA) stabiles Modell — bestätigt in Googles offiziellem API-Changelog und der Model Card.

Wie lautet die Modell-ID von Gemini 3.7 Flash?

gemini-3.7-flash, mit Punkten, sowohl auf der offiziellen Gemini API als auch auf EvoLink. Die Variante mit Bindestrichen taucht nur in Seiten-URLs auf.

Ist Gemini 3.7 Flash ein neues Modell oder ein Update?

Googles Model Card beschreibt es als algorithmische Verbesserungen auf der Reasoning-Basis von Gemini 3.6 Flash, nicht als neu vortrainiertes Modell.

Kostet Gemini 3.7 Flash mehr als 3.6 Flash?

Nein — beide teilen sich denselben Tarif, inklusive des Einführungsfensters bis zum 31. Dezember 2026.

Was ist mit dem Thinking-Level minimal passiert?

Es wurde entfernt. Die Level sind jetzt low, medium und high; wer minimal an die Gemini API sendet, erhält einen Fehler. EvoLink stuft Legacy-Requests mit minimal automatisch auf low herunter.

Welche Parameter brechen bei der Migration von 3.6?

Eigene Werte für temperature, top_p, top_k und candidate_count sind deprecated, und das numerische thinking_budget weicht dem String thinking_level.

Gibt es ein Gemini 3.7 Pro?

Nein. Weder ein 3.5 Pro noch ein 3.7 Pro wurde angekündigt; das neueste Modell der Pro-Linie bleibt gemini-3.1-pro-preview.

Wo kann ich die Gemini 3.7 Flash API heute nutzen?

Über Googles Gemini API / AI Studio, Antigravity und die Enterprise Agent Platform; unter den Aggregatoren über OpenRouter und kie.ai; sowie über EvoLink gemäß dem Rollout-Hinweis oben — prüfen Sie, ob die ID in der /v1/models-Liste Ihres Keys erscheint.

Bereit, Ihre KI-Kosten um 89 % zu senken?

Starten Sie noch heute mit EvoLink und erleben Sie die Vorteile intelligenter API-Routing.