
Gemini 3.6 Flash Thinking Levels: Kosten im Praxistest
minimalkostete bei unseren neun produktionsnahen Aufgaben 73.6 % weniger als dermedium-Standard und erreichte ebenfalls neun von neun Punkten. Wenn Sie bisher nie eine Stufe ausgewählt haben, ist dies Ihr größter Kostenhebel.- Thinking-Tokens machten bei
medium75 % der Gesamtkosten aus, einschließlich der Eingabe-Tokens. Die Antwortlänge veränderte sich über alle vier Stufen kaum; fast der gesamte Kostenunterschied zwischen den Stufen entfällt daher auf das Denken. lownutzt kein festes Budget. Bei allen neun Durchläufen zur strukturierten Extraktion erzeugte die Stufe genau null Thinking-Tokens und kostete dort genauso viel wieminimal, setzte bei Tool-Aufrufen und Codeaufgaben aber weiterhin Thinking-Tokens ein.- Über
lowhinaus führte mehr Denken in unserer schwierigeren Runde nicht zu mehr richtigen Antworten. Die Ergebnisse lagen bei 2, 10, 10 und 8 von 15 fürminimal,low,mediumundhigh. - Die Standardeinstellung ist nicht falsch, sondern lediglich unspezifisch.
mediumist eine vernünftige mittlere Einstellung für noch unbekannte Aufgaben. Sobald Sie die Struktur Ihrer Workloads kennen, sollten Sie die Stufe bewusst festlegen. - Jeder veröffentlichte Benchmark für dieses Modell läuft unter
high, während der API-Standardmediumist. Das sind unterschiedliche Rechnungen und unterschiedliche Latenzen.
Die kurze Antwort nach Level
Die folgende Tabelle zeigt, was jede Stufe bei einem Durchgang durch dieselben neun Aufgaben kostete und für welche Aufgaben sich die jeweilige Ausgabe lohnte.
| Stufe | Kosten pro Durchgang | Gegenüber dem medium-Standard | Geeignet für |
|---|---|---|---|
minimal | $0.0158 | 73.6 % günstiger | Extraktion, Klassifizierung, Routing, Code-Speicherort und Toolketten, die nur dem Skript folgen müssen |
low | $0.0232 | 61.2 % günstiger | Dieselben Aufgaben sowie mehrstufige Tool-Aufrufe, bei denen das Modell nach einem Fehler möglicherweise reagieren und den Ablauf fortsetzen muss |
medium (Standard) | $0.0598 | Grundlinie | Sie kennen die Form Ihres Datenverkehrs noch nicht oder die Arbeit variiert zu stark, um sie genau bestimmen zu können |
high | $0.0653 | 9.3 % teurer | Nur gezielt einsetzen. Bei unseren Aufgaben blieb das zusätzliche Budget größtenteils ungenutzt; in der schwierigen Runde lag die Punktzahl sogar unter medium |
minimal auch für Ihren Workload ausreicht. Für unsere Aufgaben reichte die Stufe aus; wie diese Aufgaben genau aussahen, beschreiben wir weiter unten.Die Zahl, die niemand veröffentlicht: Antwort-Token gegen Denk-Token
Jeder Preisvergleich dieses Modells, den wir am Tag der Markteinführung finden konnten, behandelt die ausgegebenen Token als eine Zahl. Dadurch werden zwei Größen zusammengeführt, die sich nicht gleich verhalten, und wenn man sie erst einmal trennt, löst sich der größte Teil der Verwirrung rund um diese Veröffentlichung auf.
Hier ist ein Durchlauf durch unsere neun Aufgaben, wobei die Ausgabeseite in die Token aufgeteilt ist, die Sie lesen können, und die Token, die Sie nicht lesen können.
| Konfiguration | Antwort-Tokens | Thinking-Tokens | Anteil der Thinking-Tokens am Output | Kosten pro Durchgang | Richtig | Durchschnittliche Latenz |
|---|---|---|---|---|---|---|
3.6 Flash minimal | 1,162 | 0 | 0% | $0.0158 | 9/9 | 2.8s |
3.6 Flash low | 1,056 | 1,095 | 51% | $0.0232 | 9/9 | 3.3s |
3.6 Flash medium (Standard) | 1,080 | 5,944 | 85% | $0.0598 | 9/9 | 5.1s |
3.6 Flash high | 1,092 | 6,679 | 86% | $0.0653 | 9/9 | 5.3s |
3.5 Flash medium | 1,078 | 5,827 | 84% | $0.0692 | 9/9 | 5.1s |
3.5 Flash high | 1,113 | 7,185 | 87% | $0.0818 | 9/9 | 5.7s |
3.5 Flash-Lite minimal (Standard) | 977 | 0 | 0% | $0.0036 | 8/9 | 1.8s |
3.5 Flash-Lite high | 1,097 | 8,288 | 88% | $0.0249 | 9/9 | 4.2s |
Lesen Sie zuerst die Antwort-Token-Spalte. Über acht Konfigurationen, zwei Modelle und vier Denkebenen hinweg bleibt es zwischen 977- und 1,162-Tokens, und die höchste Zahl in der Spalte gehört zur günstigsten Konfiguration. Die Modelle liefern Antworten von ungefähr gleicher Länge, unabhängig davon, wie viel sie zuerst denken.
Lesen Sie jetzt die Spalte der Thinking-Tokens. Sie reicht von null bis 8,288. Das ist die ganze Geschichte Ihrer Rechnung.
Hier sind die gleichen Daten wie Geld, wobei jeder Durchgang in das aufgeteilt wird, was Sie für die Eingabe, für die Antwort und für das Denken bezahlt haben, zu den Standardtarifen von Gemini 3.6 Flash von $1.50 pro Million Eingabe-Tokens und $7.50 pro Million Ausgabe-Tokens.
| Ebene | Eingabe | Antwort | Thinking | Gesamt | Thinking-Anteil an der Gesamtrechnung |
|---|---|---|---|---|---|
minimal | $0.0071 | $0.0087 | $0.0000 | $0.0158 | 0% |
low | $0.0071 | $0.0079 | $0.0082 | $0.0232 | 35% |
medium | $0.0071 | $0.0081 | $0.0446 | $0.0598 | 75% |
high | $0.0071 | $0.0082 | $0.0501 | $0.0653 | 77% |
Auf der Standardstufe sind drei Viertel Ihrer Bezahlung Argumente, die Sie nie sehen, bei Aufgaben, bei denen die Stufe keinen Einfluss darauf hat, ob die Antwort richtig war. Das ist kein Defekt des Modells. Dies geschieht, wenn ein allgemeiner Standard eine bestimmte Arbeitslast erfüllt.
Dies erklärt auch, warum die Frage „Speichert das neue Modell Token?“ in der Öffentlichkeit widersprüchliche Antworten erhält. Bei der Behauptung geht es um Ausgabe-Tokens. Bei Ausgabe-Tokens handelt es sich größtenteils um Denk-Tokens, und die Anzahl der Denk-Tokens hängt von der Denkebene ab, was fast niemand angibt. Eine Messung ohne Angabe des Füllstandes ist nicht reproduzierbar.
Wie wir das gemessen haben
Zwei Runden, ausgeführt am 2026-07-21, dem Tag, an dem beide Modelle veröffentlicht wurden.
minimal, um die Sortierung zu prüfen – weitere 60 Aufrufe. Insgesamt umfasste Runde zwei 190 Aufrufe und kostete $1.34.- Anrufe gingen über OpenRouter, wobei der Anbieter an Google AI Studio angeheftet war, und wurden seriell und nicht gleichzeitig gesendet. Das Gateway gibt nicht an, welche Region die Anfrage bedient hat, daher können wir keine Angabe machen.
- Die Kosten werden anhand der Standardlistenpreise von Google berechnet, nicht anhand der eigenen Abrechnung des Gateways. Die Gateway-Routen werden zu einem ermäßigten Tarif angeboten, und eine Kombination aus beiden würde dazu führen, dass unsere Zahlen nicht mit den von Google veröffentlichten Preisen vergleichbar sind.
- Es wurden keine Probenahmeparameter festgelegt.
temperature,top_pundtop_ksind auf Gemini 3.x veraltet und werden akzeptiert und dann ignoriert. Das Setzen dieser Werte hätte also nichts geändert, während es impliziert, dass wir die Dokumentation nicht gelesen haben. Wenn Sie sie dennoch in der Produktion einrichten, werden die restlichen Schnittstellenänderungen dieser Version in unserem Gemini 3.6 Flash-Release-Leitfaden behandelt. - Die Bewertung erfolgt regelbasiert und nicht menschlich. Korrektheit ist hier eine unterstützende Messgröße, um die Erklärung auszuschließen, dass ein billiges Niveau billig aussieht, weil es in aller Stille weniger Arbeit leistet.
- Antwort-Tokens und Denk-Tokens wurden für jeden einzelnen Anruf separat erfasst, was die obigen Tabellen ermöglicht.
high gab 331, 538 und 347 Denktokens für drei identische Anfragen zurück. Daher ist eine Mittelung über drei Läufe für die Kostenzahlen notwendig und für die Korrektheitszahlen nicht erforderlich. In Runde zwei, in der die Aufgaben am Rande dessen liegen, was die Modelle leisten können, verschwindet diese Stabilität vollständig, was wir eher als Feststellung denn als Fußnote betrachten.Warum die veröffentlichten Benchmarks diese Frage nicht beantworten
Es gibt einen dokumentierten Grund, warum niemand dies nachschlagen kann. Die im Umlauf befindlichen Benchmark-Zahlen werden auf einem Niveau gemessen, das der Großteil des Produktionsverkehrs nicht erreicht, und die Quellen geben dies selten an.
- Artificial Analysis, derzeit die einzige unabhängige Quelle mit einer vollständigen Aufschlüsselung dieses Modells, gemessen am
high-Denken. Der API-Standard istmedium. - Googles eigene Ergebnistabelle für Gemini 3.5 Flash-Lite wurde mit
higherstellt, während der API-Standard dieses Modellsminimalist. Das Ausführen der Standardkonfiguration ist nicht das in der Tabelle beschriebene Experiment. - In der Vergleichstabelle von Google läuft die Zeile DeepSWE unter Gemini 3.5 Flash unter
mediumund unter Gemini 3.6 Flash unterhigh, sodass es sich bei den beiden Zwillingsfiguren in dieser Zeile nicht um einen Vergleich auf gleicher Ebene handelt. - Die Schlagzeile von Google „bis zu 65% auf DeepSWE“ bezieht sich auf eine Reduzierung der Token-Nutzung, nicht auf eine Punktzahl. Der DeepSWE-Score ist 49%.
Nichts davon macht die veröffentlichten Zahlen falsch. Dadurch beantworten sie eine andere Frage als „Was kostet mich das auf dem Niveau, das ich tatsächlich laufe?“.
Runde eins: die Levels für normale Arbeit
Drei Ergebnisse in der Reihenfolge, in der sie wichtig sind.
minimal bedeutet überhaupt kein Denken, nicht weniger Denken. Thinking-Tokens kamen als genau null zurück, nicht als kleine Zahl. Bei allen unseren minimal-Ausführungen auf Gemini 3.6 Flash gaben 101 von 102 Aufrufen genau null Thinking-Tokens zurück. Die einzige Ausnahme ist so seltsam, dass sie unten einen eigenen Abschnitt erhält. Gleichzeitig blieb die Korrektheit unverändert bei neun von neun und die mittlere Latenz sank von 5.1 Sekunden auf 2.8 Sekunden. Bei diesem Aufgabensatz brachte die Standardstufe nichts außer einer 3.8-mal höheren Rechnung und einer doppelt so langsamen Antwort.high kostete hier nur 9.3 % mehr als medium, weil das zusätzliche Budget weitgehend ungenutzt blieb: Denken stieg von 5,944 auf 6,679-Tokens. Das ist eine Tatsache über diese neun Aufgaben, nicht über das Modell. Geben Sie ihm Arbeit, die wirklich mehr Argumentation erfordert, und die Kluft wird größer. Übernehmen Sie dieses Verhältnis nicht in Ihre eigene Prognose.medium und 20.1% unter high. Fast die gesamte Ersparnis resultiert aus der Senkung des Ausgabepreises von $9.00 auf $7.50 pro Million Token und nicht aus der Token-Effizienz: Bei medium stiegen unsere in Rechnung gestellten Ausgabetoken tatsächlich um 1.7 % gegenüber dem älteren Modell, und bei high sanken sie um 6.4 %. Ob das Gleiche auch für Ihren Traffic gilt, hängt von Ihrem Input-Output-Verhältnis ab, da sich der Input-Preis überhaupt nicht geändert hat und unser Gemini 3.5 Flash-Kostenrechner diese Berechnung anhand von Beispielen des älteren Modells durchführt.low ist adaptiv und kein kleineres festes Budget
Dies ist das Ergebnis, das wir nicht erwartet hatten, und es ist das unmittelbar nützlichste auf dieser Seite.
low hat Gemini 3.6 Flash seine Überlegungen unterschiedlich über unsere drei Aufgabentypen verteilt. Denkmarken pro Durchgang:| Aufgabengruppe | minimal | low | medium | high |
|---|---|---|---|---|
| Strukturierte Extraktion | 0 | 0 | 2,673 | 2,916 |
| Aufruf von Multiturn-Werkzeugen | 0 | 549 | 1,797 | 1,914 |
| Codeortung und Reparatur | 0 | 546 | 1,474 | 1,849 |
low genau null Thinking-Tokens. Die Gruppe kostete mit low $0.00490 gegenüber $0.00489 mit minimal – ein Unterschied von zwei Zehntelprozent. Bei Tool-Aufrufen und Code-Reparaturen verbrauchte dieselbe Stufe dagegen zwischen 100 und 440 Thinking-Tokens pro Aufgabe.low beim Extraktionsanteil nahe an minimal, während für die übrigen Aufgaben eine Denkreserve erhalten bleibt. Sie müssen den Traffic nicht auf zwei Konfigurationen aufteilen, um den größten Teil der Ersparnis zu erzielen. In unserem Aufgabensatz kostete diese Kombination 61.2 % weniger als die Standardeinstellung.low bei Extraktionsaufgaben niemals Thinking-Tokens verwendet, ohne dies zuvor mit den eigenen Prompts zu prüfen.Runde zwei: Wo die Qualität tatsächlich bricht
Runde eins konnte die Qualitätsfrage nicht beantworten, da jede Konfiguration neun von neun Punkten erreichte. Neun Aufgaben waren nicht schwer genug, um vier Ebenen zu trennen. Also haben wir sie schwieriger gemacht und die Antwort, die wir erhielten, war nicht die, die die Level implizieren.
minimal 17 in allen drei Versuchen korrekt: Widersprüche zwischen drei Rechnungsbeträgen auflösen und neu berechnen, drei ineinander verschachtelte Anfrageprotokolle zu einer Fehlerkette zusammenführen, die Metaregel „das später unterzeichnete Dokument gilt“ auf widersprüchliche Vertragsklauseln anwenden, mehrere Währungen und Zeiträume umrechnen, einen funktionsübergreifenden Cache-Key-Fehler finden und einen Rate-Limiter-Fehler erkennen, der erst beim dritten Aufruf auftritt. All das gelang ohne einen einzigen Thinking-Token. Bei high verbrauchten dieselben Aufgaben zwischen 1,100 und 6,900 Thinking-Tokens.Die Thinking-Stufe kauft also keine zusätzliche Korrektheit beim Schlussfolgern – zumindest nicht in dem Bereich, den diese Aufgaben abdecken. Ihr Nutzen ist enger begrenzt.
minimal bearbeitet, einschließlich einer acht Schritte langen Kette.Hier sehen Sie, wie die sechs Konfigurationen bei diesen drei Aufgaben abschnitten, jeweils fünf Versuche.
| Konfiguration | Aufgabe 1 | Aufgabe 2 | Aufgabe 3 | Gesamt | Kosten pro Aufruf |
|---|---|---|---|---|---|
3.6 Flash minimal | 1/5 | 0/5 | 1/5 | 2/15 | $0.00175 |
3.6 Flash low | 4/5 | 1/5 | 5/5 | 10/15 | $0.00553 |
3.6 Flash medium (Standard) | 5/5 | 5/5 | 0/5 | 10/15 | $0.00674 |
3.6 Flash high | 5/5 | 2/5 | 1/5 | 8/15 | $0.00739 |
3.5 Flash-Lite minimal (Standard) | 4/5 | 5/5 | 0/5 | 9/15 | $0.00068 |
3.5 Flash-Lite high | 2/5 | 5/5 | 3/5 | 10/15 | $0.00262 |
Die Kosten pro Aufruf schließen eine im nächsten Abschnitt beschriebene anomale Anfrage aus; die Summen einschließlich dieser Anfrage stehen dort.
minimal zu low. Zwei von 15 werden zu zehn von 15. Ab diesem Punkt ist die Linie flach und verläuft dann nach unten: zehn, zehn, acht.medium, um zuverlässig zu sein, und fällt dann bei high auf zwei von fünf zurück. Die Aufgabe 3 läuft völlig andersherum und erzielt fünf von fünf Punkten bei low, null von fünf Punkten bei medium und einen von fünf Punkten bei high. Mehr Nachdenken machte diese Aufgabe über jeweils fünf Versuche hinweg durchweg schlechter.low waren die gemessenen Unterschiede kleiner als die Schwankungen zwischen identischen Durchläufen.minimal wiederholten, bestätigten sich 17 von 20 eindeutig; eine im Einzeldurchlauf als Fehler markierte Aufgabe erreichte jedoch nur eins von drei. Genau diese Schwankung beschreiben wir.Die technische Konsequenz ist nützlicher als eine Stufenempfehlung. Wenn Ihr Agent auf unerwartete Zustände reagieren muss, bauen Sie Wiederholungsversuche und Verifikation in die Anwendung ein. Behandeln Sie die Thinking-Stufe als Kosteneinstellung, nicht als Garantie für eine zuverlässige Wiederherstellung.
Gemini 3.6 Flash low gegen Gemini 3.5 Flash-Lite
Für diesen Vergleich liegen nirgends veröffentlichte Daten vor, die wir finden konnten, und es ist der Vergleich, mit dem sich ein kostenbewusstes Team tatsächlich konfrontiert sieht: Führen Sie für ungefähr das gleiche Geld das stärkere Modell mit ein wenig Nachdenken aus, oder das billigere Modell mit viel Nachdenken?
low war $0.0232 pro Durchgang; Gemini 3.5 Flash-Lite bei high war $0.0249. Beide erzielten neun von neun Punkten. Gemini 3.6 Flash bei low war schneller, bei 3.3 Sekunden im Vergleich zu 4.2 Sekunden durchschnittlicher Latenz, und es erreichte diesen Wert auf 1,095 Thinking Tokens, bei denen Flash-Lite 8,288 benötigte.high kostete $0.00262 pro Anruf gegenüber $0.00553. Bei diesem Aufgabensatz war das billigere Modell, das hart nachdenkt, weniger als die Hälfte des Preises für die gleiche Punktzahl.Welches dieser beiden Bilder auf Sie zutrifft, hängt von Ihrem Aufgabenmix ab, und das ist eher eine ehrliche Antwort als eine Absicherung. Die beiden Konfigurationen liegen bei unseren beiden Runden im gleichen Leistungsband. Das Preisverhältnis zwischen ihnen ist über die Aufgabensätze hinweg nicht stabil.
Zwei weitere Beobachtungen aus denselben Daten, die beide wissenswert sind, bevor Sie standardmäßig Flash-Lite verwenden.
minimal-Ebene auf Flash-Lite ist eine Aufgabe auf eine bestimmte, wiederholbare Weise fehlgeschlagen. In einer dreistufigen Benachrichtigungskette wurden die ersten beiden Tools aufgerufen und dann dreimal von drei ohne Senden der Benachrichtigung angehalten, jedes Mal mit einer identischen Signatur. Das war der einzige Qualitätsunterschied bei allen 216-Aufrufen der ersten Runde. Es reproduziert auch eine Einschränkung, die Google selbst dokumentiert: Die Standardeinstellung minimal wird als ungeeignet für die autonome Verwendung von Subagenten beschrieben, da sie Toolaufrufe vorzeitig beendet. Wenn Sie Flash-Lite als Agent ausführen, erhöhen Sie die Stufe oder rechnen Sie mit einem Fehler.minimal neun von 15 im Vergleich zu zwei von Gemini 3.6 Flash von 15. In der Benachrichtigungskette der ersten Runde kehrte sich diese Beziehung um: Gemini 3.6 Flash bei minimal bestand drei von drei Fällen, während Flash-Lite in drei von drei Fällen fehlschlug. Hier gibt es keine Reihenfolge, nur zwei verschiedene Fehlerformen, und ein Level, das für den Datenverkehr eines Modells sicher ist, ist nicht automatisch auch für den Datenverkehr des anderen Modells sicher.Eine Anomalie, die wir nicht erklären können
minimal 62,916 Denktokens zurück.minimal-Aufruf in unseren Daten ergab genau Null. Dieser verwendete fünf Werkzeugumdrehungen, erzeugte eine Ausgabe nahe der 65,536-token-Ausgabeobergrenze des Modells, benötigte 209 Sekunden und kostete $0.48. Das ist ungefähr das 270-fache der Kosten der anderen Aufrufe auf dieser Ebene und fast den gesamten $0.50, den diese Konfiguration über die gesamte 15-Aufrufrunde ausgegeben hat. Es war auch das einzige Mal, dass minimal diese bestimmte Aufgabe richtig erledigte.minimal budgetiert, von Bedeutung ist. Wir werden keinen Mechanismus anbieten, weil wir keinen haben. In der Modellkarte von Google sind zwar gelegentlich langsame Reaktionen als bekannte Einschränkungen des Modells aufgeführt, wir können diesen Hinweis jedoch nicht mit Sicherheit mit dieser Beobachtung in Verbindung bringen.minimal für Tool-Aufrufe verwenden, setzen Sie ein maximales Ausgabe-Token-Limit und ein Timeout. Eine Stufe, die normalerweise keine Thinking-Tokens erzeugt, ist nicht dasselbe wie eine Stufe, die keine Thinking-Tokens erzeugen kann.Welches Level für welche Aufgabe
Diese Tabelle fasst die praktische Empfehlung zusammen. Jede Zeile stützt sich auf die beiden oben beschriebenen Runden; die Grenzen dieser Evidenz folgen darunter.
| Art der Aufgabe | Stufe | Warum |
|---|---|---|
| Single-Turn-Extraktion, Klassifizierung, Beantwortung von Fragen, Codelokalisierung und Reparatur | minimal | 17 von 20 bewusst schwierigen Aufgaben wurden in allen drei Versuchen bestanden – bei 26 % der Standardkosten |
| Mehrstufige Tool-Aufrufe, die lediglich dem Plan folgen oder eine Aktion ablehnen müssen | minimal reicht aus | Eine achtstufige Kette, bei der die Ausnahme in einem Batch gefunden wurde, eine nicht richtlinienkonforme Anfrage abgelehnt und die maßgebliche Datenquelle ausgewählt wurde, wurde in drei von drei Fällen erfolgreich durchgeführt |
| Mehrstufige Toolaufrufe, bei denen das Modell möglicherweise eine Aktion benötigt, die nicht im Plan vorgesehen war: ein erneuter Versuch, ein Rollback, ein präventives Abfangen | Mindestens low | minimal erzielte bei genau diesen Aufgaben 2/15; low erzielte 10/15 |
| Das Gleiche, aber Sie brauchen es, um zuverlässig zu sein | Kein Level löst dieses Problem | low, medium und high bewerteten 10, 10 und 8 aus 15. Die Unterschiede sind geringer als die Variation von Lauf zu Lauf. Behandeln Sie das Problem mit Wiederholungsversuchen und Überprüfung in Ihrer Anwendung |
| Gemischter Traffic hinter einer Konfiguration | low | Bei unseren Extraktionsaufgaben wurden null Thinking-Tokens verbraucht, während für den Rest eine Reserve blieb – bei 61.2 % niedrigeren Kosten als der Standard |
| Sie kennen Ihren Aufgabenmix noch nicht | medium, dann messen | Die Standardeinstellung ist ein sinnvoller Ausgangspunkt. Teuer wird sie erst, wenn Sie wissen, dass sie nicht benötigt wird |
medium maß der unabhängige Test von aibenchy 66.2 % mehr, wir dagegen 2.0 % mehr. Die 22 kurzen Benchmark-Fragen dort und unsere Extraktions-, Tool-Aufruf- und Codeaufgaben lieferten auf dieselbe Frage entgegengesetzte Antworten. Das ist kein Streit, der entschieden werden muss, sondern der zentrale Befund: Ob eine Stufe Tokens spart, hängt vom Workload ab, nicht allein vom Modell.Messen Sie dies anhand Ihres eigenen Datenverkehrs
Vier Schritte, in der Reihenfolge, in der Sie am schnellsten eine Antwort erhalten.
-
Denktokens heute separat protokollieren, bevor etwas geändert wird. Die API von Google gibt die Anzahl in
total_thought_tokenszusammen mit der von Ihnen festgelegten Ebene zurück. Wenn Sie nur die gesamten ausgegebenen Token verfolgen, können Sie keine sofortige Regression von einem Level erkennen, das beschlossen hat, diese Woche intensiver nachzudenken.from google import genai from google.genai import types client = genai.Client() # reads the API key from the environment response = client.models.generate_content( model="gemini-3.6-flash", contents=prompt, config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig(thinking_level="minimal"), ), ) log.info( "level=minimal thinking_tokens=%s", response.usage_metadata.total_thought_tokens, )
medium festlegen. Ein geerbter Standardwert ist eine Kostenentscheidung, die niemand getroffen hat. Dies bedeutet auch, dass sich Ihre Rechnung ändern kann, wenn sich ein Zahlungsverzug ändert.
3. Wiederholen Sie einen Tag echten Datenverkehrs unter minimal und unter low und vergleichen Sie die Ergebnisse mit Ihren aktuellen und nicht mit einem Benchmark. Bei unseren Aufgaben war dieser Vergleich zwischen 61% und 74% der Rechnung wert, was einen größeren Effekt darstellt als jeder in dieser Stufe verfügbare Modelltausch.
4. Bewerten Sie die Tool-Aufrufpfade getrennt von allem anderen. Dies ist der einzige Ort, an dem wir die Richtigkeit der Ebenenänderung festgestellt haben, und wenn wir sie zusammen mit dem Extraktionsverkehr mitteln, wird sie ausgeblendet.Wenn man diesen Vergleich über mehrere Modelle hinweg durchführt, bedeutet das in der Regel eine separate Integration pro Anbieter, und diese Integrationskosten sind der häufigste Grund dafür, dass Teams die Messung ganz überspringen. Durch die Standardisierung auf einen OpenAI-kompatiblen Endpunkt wird dieser entfernt, sodass die Modellzeichenfolge das Einzige ist, was sich zwischen den Läufen ändert.
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.evolink.ai/v1",
api_key=os.environ["EVOLINK_API_KEY"],
)
for model in ("gemini-3.6-flash", "gemini-3.5-flash-lite"):
response = client.chat.completions.create(model=model, messages=messages)
record(model, response.usage)FAQ
medium. Die auswählbaren Werte sind minimal, low, medium und high. Gemini 3.5 Flash-Lite verwendet stattdessen standardmäßig minimal, sodass sich die beiden Modelle standardmäßig sehr unterschiedlich verhalten.minimal ist die niedrigste verfügbare Einstellung, und in der Dokumentation von Google wird das Denken für dieses Modell als standardmäßig aktiviert und nicht als etwas beschrieben, das Sie ausschalten. In der Praxis hat minimal genau null Denktokens für 101 unserer 102-Aufrufe zurückgegeben, sodass es sich bei den meisten Anfragen aus Abrechnungsgründen als deaktiviert verhält. Die einzige Ausnahme ist oben dokumentiert, weshalb wir sie nicht als Garantie bezeichnen würden.minimal als die Standardversion?
In unserem Satz aus neun Aufgaben war minimal pro Durchgang 73.6 % günstiger, bei derselben Korrektheit von neun aus neun und etwa halbierter Latenz. Ihr Verhältnis hängt davon ab, wie viele Thinking-Tokens Ihr Workload bei medium auslöst. Verwenden Sie den Wert daher als Anlass zum Messen, nicht als Prognosewert.minimal zu low einen klaren Sprung von zwei auf zehn von 15 Punkten. Oberhalb von low lagen die Ergebnisse bei zehn, zehn und acht von 15; eine Aufgabe schnitt bei höheren Stufen über jeweils fünf Versuche sogar schlechter ab. Bei reasoning-intensiven Single-Turn-Aufgaben löste minimal 17 von 20 schwierigen Problemen ganz ohne Thinking-Tokens.high, und die Flash-Lite-Ergebnistabelle von Google wurde ebenfalls unter high erstellt, während der API-Standard dieses Modells minimal ist. Wenn Sie Standardeinstellungen ausführen, führen Sie nicht die Konfiguration aus, die diese Zahlen beschreiben.total_thought_tokens aus der Antwort. Tragen Sie es als eigenes Feld neben den Ausgabe-Tokens ein, anstatt sie zusammenzuzählen, sonst können Sie später keine Kostenänderung mehr zuordnen.Quellen
- Dokumentation zum Gemini-Denken, Google, für
thinking_level-Werte, Standardeinstellungen pro Modell, die Aussage, dass die Antwortpreise Ausgabe- und Denktoken summieren, und das Feldtotal_thought_tokens - Dokumentation zu Gemini-API-Modellen, Google
- Gemini API-Preise, Google
- Wir stellen vor: Gemini 3.6 Flash, 3.5 Flash-Lite und 3.5 Flash Cyber, Google, 2026-07-21
- Gemini 3.6 Flash, Google DeepMind, für die dokumentierten Modellbeschränkungen
- Gemini 3.6 Flash und Gemini 3.5 Flash-Lite: Halbierung der Zeit pro Aufgabe, Artificial Analysis, 2026-07-21
- aibenchy, unabhängiger 22-question Testlauf, 2026-07-21
- EvoLink Erstanbietermessung, 2026-07-21: 406 Anrufe über zwei Runden, wobei die Aufzeichnungen pro Anruf beibehalten werden


