Greifen Sie über die einheitliche Chat-API von EvoLink auf Gemini 3.7 Flash von Google zu – auch gesucht als Gemini 3.7 –. Testen Sie Coding, mehrstufige Agents, Tool-Nutzung vor der Integration.
Google·Textgenerierung·Verfügbar
ab $0.675 / 1M Eingabe-Token$1.500 offizieller PreisBefristet-55%
Coding mit langem KontextKonfigurierbares ThinkingPrompt-CachingChat + Gemini API
ProduktionsrouteDiese Rate zeigt die plattformseitige Verfügbarkeit — nur bestätigte Serverfehler (HTTP 500 / leere Antwort) zählen als Ausfälle. Nutzerseitige Probleme (Inhaltsmoderation, ungültige Parameter, Abbruch) sowie Rate-Limits, Timeouts und Auth-Fehler sind ausgenommen. Vor echtem Traffic können leere Zeitfenster als verfügbar erscheinen.Live
Live
Kontext
1.05M Kontext · max. 65.5K Ausgabe
Geeignet für
Coding, Agent-Orchestrierung, Dokumentanalyse
Eingabe
Text + Bilder
Ausgabe
Text · JSON (strukturierte Ausgabe) · Tool-Aufrufe
Googles neuestes Flash-Arbeitspferd für kosteneffizientes Coding, agentische Workflows, Wissensarbeit und multimodales Reasoning – mit besserer Token-Effizienz als Gemini 3.6 Flash und einem Kontextfenster von 1 Mio. Token.
Gemini 3.7 Flash
Googles Arbeitspferd der Flash-Klasse
Ausgewählt
Modell-ID
gemini-3.7-flash
Geeignet für
Produktions-Coding und Full-Stack-Refactoring, mehrstufige Agenten und Orchestrierung, Dokument- und Diagrammanalyse sowie Workloads mit hohem Volumen, bei denen bessere Token-Effizienz die Kosten pro erledigter Aufgabe senkt.
Eingabe
$0.675 / 1M-55%
45.9 cr / 1M$1.500offizieller Preis
Cache-Lesen
$0.068 / 1M-55%
4.6 cr / 1M$0.150offizieller Preis
Ausgabe
$3.375 / 1M-55%
229.5 cr / 1M$7.500offizieller Preis
Alle Tarife gelten pro 1M Tokens, in USD und Credits, und entsprechen der aktuellen Preisgestaltung Ihres Kontos.
Gemini 3.7 Flash Preise
Schätzen Sie vor der Integration die Kosten einer Gemini 3.7 Flash-Anfrage. Der Rechner verwendet die aktuellen Tarife Ihres Kontos; offizielle Preise dienen als Vergleich.
Zeitlich begrenztes Angebot – die Preise unten enthalten Googles Einführungspreis und gelten bis zum 31. Dezember 2026 (UTC+8). Ab dem 1. Januar 2027 gilt wieder unser regulärer Rabatt auf Googles Standardpreis ($1.500 Eingabe / $7.500 Ausgabe pro Million Token).
Anfragen-Rechner
Geben Sie den Token-Mix einer Anfrage und die Anzahl der Google-Suchanfragen ein.
Gemini 3.x berechnet jede nicht leere Suchanfrage, auch wenn keine Quellen zurückgegeben werden. Ein Request kann mehrere Suchanfragen auslösen. Suchgebühren kommen nach Anwendung der Token-Mindestgebühr hinzu.
Gemini 3.7 Flash API für kosteneffizientes Coding und Agenten-Workflows
Googles neuestes Flash-Modell über EvoLinks einheitliche API nutzen. Gemini 3.7 Flash verbessert Coding, Wissensarbeit und multimodales Reasoning mit besserer Token-Effizienz als Gemini 3.6 Flash – plus 1.048.576 Token Kontext, Prompt-Caching, strukturierte Ausgaben und Tool-Nutzung, zu Googles offiziellem Einführungspreis von $0,75 / $3,75 pro Million Eingabe- / Ausgabe-Token (gültig bis 31. Dezember 2026).
Gemini 3.7 Flash wird auf EvoLink unter der Modell-ID gemini-3.7-flash über Chat Completions · Gemini Native API bereitgestellt – mit demselben API-Key und Guthaben wie jedes andere Modell. Es bietet ein Kontextfenster von 1.05M und bis zu 65.5K Ausgabe-Tokens, dazu Coding, mehrstufige Agents, Tool-Nutzung.
Gemini 3.7 Flash Spezifikationen und Fähigkeiten
Die Zahlen stammen aus der EvoLink-Routenkonfiguration; die Fähigkeiten entsprechen dem, was die API heute bereitstellt.
Kontextfenster
1.05M Tokens
Max. Ausgabe
65.5K Tokens
Eingabe
Text + Bilder
Ausgabe
Text · JSON (strukturierte Ausgabe) · Tool-Aufrufe
Reasoning
Konfigurierbarer Reasoning-Aufwand
Tool-Nutzung
Function Calling mit mehrstufigen Tool-Sequenzen
Prompt-Caching
Automatische Cache-Lesezugriffe zu niedrigerem Tarif
Serverseitige Tools
Google-Suche, abgerechnet pro Suchanfrage
Protokolle
Chat Completions · Gemini Native API
Modell-ID
gemini-3.7-flash
Warum Gemini 3.7 Flash diese Workloads bewältigen kann
Gemini 3.7 Flash ist am nützlichsten, wenn ein großes Kontextfenster, höhere Token-Effizienz und wiederverwendbare Prompt-Präfixe zusammenwirken. Kontextgröße allein verbessert keine Antwort; der Workload braucht weiterhin relevante Evidenz, klare Struktur und ein Ausgabebudget.
1M Token als Arbeitsraum, nicht als Füllziel
Das Fenster von 1.048.576 Token kann zusammengehörigen Code, Spezifikationen und frühere Tool-Ergebnisse ohne übermäßiges Chunking bereithalten. Retrieval und Kontextkomprimierung bleiben wichtig, weil irrelevante Eingaben um Aufmerksamkeit konkurrieren und die Verarbeitungskosten erhöhen.
Höhere Token-Effizienz als 3.6 Flash
Gemini 3.7 Flash will mehrstufige Workflows in weniger Turns und mit weniger Token abschließen. Weniger Modellaufrufe und weniger Gesamt-Token sind die Quelle des Kostenvorteils; verfolgen Sie daher die Gesamt-Token pro akzeptierter Aufgabe statt eines einzelnen Anfragepreises.
Prompt-Caching zahlt sich bei stabilen Präfixen aus
Repository-Anweisungen, System-Prompts, Referenzmaterial und Tool-Schemas bieten das größte Cache-Potenzial, wenn ihre Reihenfolge konsistent bleibt. Häufige Modell- oder Prompt-Struktur-Änderungen können eine erneute Verarbeitung des langen Präfixes erzwingen.
Wo Gemini 3.7 Flash seinen Platz im produktiven Modell-Stack verdient
Google positioniert Gemini 3.7 Flash als effizientes Arbeitstier: besseres Coding, bessere Wissensarbeit und stärkere multimodale Leistung bei deutlich höherer Token-Effizienz als Gemini 3.6 Flash. Am besten passt es zu produktiver Arbeit, bei der ausreichend gutes Reasoning zu geringeren Token-Kosten mehr bringt als eine teure Premium-Stufe.
Kosteneffizientes Coding und Refactoring
Gemini 3.7 Flash zielt auf alltägliches Coding, Prototyping und Full-Stack-Refactoring mit weniger Token und weniger Modellaufrufen als Gemini 3.6 Flash. Es ist in Googles Antigravity-Agentenumgebung verfügbar. Messen Sie akzeptierte Patches und Review-Zeit, nicht die Qualität einzelner Snippets.
Agentische Workflows und Orchestrierung
Es passt zu mehrstufiger Orchestrierung, Tool-Auswahl, strukturierten Ausgaben und Code-Ausführung, wo sich niedrigere Kosten pro Aufruf über lange Agentenläufe summieren. Bewahren Sie vollständige Assistant-Nachrichten, Tool-Call-IDs, Argumente und Tool-Ergebnisse über alle Turns hinweg.
Wissensarbeit und multimodales Reasoning
Nutzen Sie es für Dokumentenanalyse, Diagramm-Interpretation und die Generierung mehrteiliger Web-Layouts über einen 1M-Token-Kontext. Retrieval und Dokumentstruktur bleiben wichtig: Ein 1M-Fenster macht irrelevanten Kontext nicht nützlich.
Wann eine andere Route die bessere Wahl ist
Triviale, latenzkritische oder sehr umfangreiche Klassifikation und Extraktion gehören meist auf das günstigere Gemini 3.5 Flash-Lite. Leiten Sie das härteste Reasoning an ein Pro-Modell. Eskalieren Sie erst dann zu 3.7 Flash, wenn seine Effizienz die Kosten pro akzeptierter Aufgabe tatsächlich senkt.
Was frühe Reaktionen auf Gemini 3.7 Flash nahelegen – und was noch zu belegen ist
Gemini 3.7 Flash wurde am 2026-08-13 veröffentlicht. Behandeln Sie Community-Reaktionen vom Launch-Tag als Hypothesen, die Sie an eigenen Aufgaben, Tools, Budgets und Abnahmekriterien prüfen – nicht als gesicherte Benchmarks.
Gleicher Preis wie 3.6 Flash, stärkere agentische Ausführung
Google positioniert 3.7 Flash als agentisches Arbeitstier der Gemini-3-Familie: Google nennt es sein bislang fähigstes Arbeitstier für Coding und Agenten, mit deutlichen Fortschritten bei Codegenerierung und Terminal-Ausführung – zum exakt gleichen Preis wie Gemini 3.6 Flash. Bei gleichem Workload entsteht der Vorteil durch weniger Wiederholungen und kürzere Agenten-Schleifen, nicht durch einen niedrigeren Token-Preis.
Es ist ein Flash-Arbeitstier, kein Spitzen-Engineering-Modell
Ein Teil der Launch-Diskussion sieht es bei schweren Software-Engineering-Benchmarks hinter größeren Frontier-Modellen. Wenn Ihre Arbeit tiefes Repository-Refactoring oder langes autonomes Coding ist, vergleichen Sie es mit einem Pro- oder Premium-Modell, bevor Sie es zum Standard machen.
Prüfen Sie den Token-Verbrauch pro Aufgabe an Ihren Prompts
Einige Berichte vom Launch-Tag beobachteten einen höheren Token-Verbrauch pro Aufgabe als bei Gemini 3.6 Flash. Prüfen Sie Antwortlänge, Instruktionstreue und Tool-Call-Disziplin an repräsentativen Prompts, damit zusätzliches Reasoning die Ausgabekosten nicht unbemerkt erhöht.
Es ist ein geschlossenes, rein per API verfügbares Google-Modell
Gemini 3.7 Flash hat keine offenen Gewichte und kann nicht selbst gehostet werden. Der Zugang erfolgt über die Gemini API und Plattformen wie Google AI Studio, Antigravity und einheitliche Gateways wie EvoLink – routen Sie also nach Kosten und Zuverlässigkeit, nicht nach lokalem Deployment.
Zwei Wege, Gemini 3.7 Flash zu nutzen: EvoLink API oder Agent
Nutzen Sie die EvoLink API für Produkt-Backends und Batch-Jobs oder rufen Sie Gemini 3.7 Flash aus Codex, Claude oder Gemini für Coding- und Analyse-Workflows auf. Beide Wege teilen denselben EvoLink API-Key, das Guthaben, die Modell-ID und die Anfragehistorie.
Senden Sie OpenAI-kompatible Chat-Completions- (oder Anthropic-Messages-) Anfragen an EvoLink und steuern Sie Modell-ID, System-Prompt, Ausgabebudget, Tools und strukturierte Ausgabe.
1Erstellen Sie einen EvoLink API-Key in der Konsole
2Richten Sie Ihr OpenAI- oder Anthropic-SDK auf die EvoLink-Basis-URL und wählen Sie die oben gezeigte Modell-ID
3Senden Sie eine repräsentative Anfrage und lesen Sie im Feld usage Eingabe-, Cache- und Ausgabe-Tokens ab
4Setzen Sie max_tokens und Wiederholungen pro Aufgabe; behalten Sie Tool-Call-IDs und -Ergebnisse über Runden hinweg
Ideal für: Coding-, Review- und Analyseaufgaben in Codex, Claude und Gemini
Geben Sie dem Agenten Aufgabe, Eingaben und Abnahmekriterien. Er baut die Anfrage, ruft Gemini 3.7 Flash über EvoLink auf und liefert die Antwort samt Token-Verbrauch.
1Setzen Sie EVOLINK_API_KEY in Ihrer lokalen Umgebung; nie in Code oder Prompt
2Beschreiben Sie Aufgabe, einzubeziehende Eingaben und das erwartete Ausgabeformat
3Lassen Sie den Agenten Gemini 3.7 Flash über EvoLink aufrufen und die Anfrage vor dem Senden zeigen
4Lassen Sie den Agenten Antwort, Token-Verbrauch und etwaige Fehlermeldungen berichten
Gemini 3.7 Flash API-Codebeispiel und Fehlerbehandlung
Dieses Beispiel zeigt die kürzeste lauffähige Anfrage: ein OpenAI-kompatibler Chat-Completions-Aufruf mit System-Prompt, Nutzernachricht und Ausgabebudget. Die vollständige Parameter- und Antwortreferenz finden Sie im API-Tab.
curl -X POST https://api.evolink.ai/v1/chat/completions \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [
{ "role": "system", "content": "You are a precise assistant. Answer in JSON when asked." },
{ "role": "user", "content": "Classify the sentiment of each review below and return a JSON array:\n<reviews>" }
],
"max_tokens": 1024,
"temperature": 0.1
}'
# The Gemini native API is available with the same model ID; see the docs
# for the request shape.
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens).
Ungültige Anfrage oder nicht unterstützter Parameter
Prüfen Sie Modell-ID, messages-Array und Parameterbereiche anhand der API-Referenz; entfernen Sie Felder, die diese Route nicht unterstützt.
Authentifizierungs- oder Guthabenproblem
Prüfen Sie das Authorization-Bearer-Token und bestätigen Sie das verfügbare Guthaben in der Konsole.
Kontextlänge überschritten
Die Prompt-Tokens übersteigen das Kontextfenster von Gemini 3.7 Flash. Kürzen Sie oder rufen Sie nur relevante Belege ab und nutzen Sie gecachte Präfixe wieder.
Ratenlimit (429)
Mit Backoff und Jitter erneut versuchen; Anfragen bündeln oder in eine Warteschlange stellen statt parallel zu senden.
Inhalt oder Tool-Aufruf abgelehnt
Prüfen Sie sensible Inhalte, fehlerhafte Tool-Call-Argumente und JSON-Schema-Abweichungen vor dem erneuten Versuch.
Was vor produktivem Traffic zu Gemini 3.7 Flash zu prüfen ist
Ein geeigneter Workload kann trotzdem scheitern, weil die Integration den falschen Bezeichner verwendet, nicht unterstützte Parameter sendet oder den Agentenstatus zwischen Turns verliert. Prüfen Sie Request-Oberfläche und Gesprächsvertrag, bevor Sie die Modellqualität bewerten.
01
Die exakte Modell-ID gemini-3.7-flash verwenden
Senden Sie model "gemini-3.7-flash" (mit Punkten) auf der EvoLink API-Route. Die Form mit Bindestrichen gemini-3-7-flash ist nur die Seiten-URL, nicht der API-Modellparameter.
Modell-ID
02
OpenAI Chat Completions oder die native Gemini API nutzen
EvoLink stellt Gemini 3.7 Flash über das OpenAI-kompatible /v1/chat/completions und den nativen Gemini-Endpunkt generateContent bereit. Nutzen Sie für beide Protokolle denselben EvoLink API-Schlüssel.
Protokolle
03
Auf die breaking Parameteränderungen achten
Gemäß Googles offizieller Migrations-Checkliste: eigene temperature-, top-P-, top-K- und candidate_count-Werte entfernen, das numerische thinking_budget durch den thinking_level-String ersetzen und vorbefüllte model-Turns entfernen. Ältere Gemini-Request-Builder entsprechend anpassen.
Migration
04
Vollständigen Assistant- und Tool-Status erneut senden
Mehrstufige Agenten sollten vollständige Assistant-Nachrichten, Tool-Call-IDs, Argumente und Tool-Ergebnisse behalten. Nur den finalen Text zu behalten unterbricht die Zustandskontinuität und kann spätere Schritte scheitern lassen, selbst wenn das Kontextfenster groß genug ist.
Tool-Status
Prompt caching for repeated long context
Automatic cache reads use a dedicated lower rate when stable repository instructions, reference documents, and tool schemas can be reused.
1M-token context with a 65K max output limit
Keep connected code, specifications, documents, and agent state in one working context. Treat the limit as capacity rather than a target: retrieve relevant evidence and set task-appropriate output budgets.
Bei Gemini 3.7 Flash die Kosten pro akzeptierter Aufgabe vergleichen, nicht nur den Token-Preis
Gemini 3.7 Flash gewinnt ökonomisch, wenn seine Effizienz Token, Modellaufrufe, Retries oder manuelle Nacharbeit beim selben Workload reduziert. Bewerten Sie identische Aufgabensätze statt isolierter Prompt-Preise.
Erfolg im ersten VersuchAkzeptierte ErgebnisseAnzahl der RetriesAusgabe-TokenCache-TrefferrateGültige Tool-AufrufeZeit bis zum nutzbaren ErgebnisKorrektur- und Fallback-Rate
Liefert Gemini 3.7 Flash nutzbare Ergebnisse mit weniger Token und geringerem Review-Aufwand, summiert sich seine Token-Effizienz zu einem echten Kostenvorteil. Sinkt die Qualität bei Ihren härtesten Aufgaben, eskalieren Sie diese an ein Pro-Modell und behalten 3.7 Flash für die effiziente Mehrheit.
Gemini 3.7 Flash nach dem Workload-Test mit führenden Long-Context-Modellen vergleichen
EvoLink
Prüfen Sie zuerst, ob Gemini 3.7 Flash Retries und Review-Aufwand reduziert. Vergleichen Sie anschließend Preis, Kontext, Caching und Workload-Eignung.
Produktions-Coding und Full-Stack-Refactoring, mehrstufige Agenten und Orchestrierung, Dokument- und Diagrammanalyse sowie Workloads mit hohem Volumen, bei denen bessere Token-Effizienz die Kosten pro erledigter Aufgabe senkt.
Die günstigste, schnellste 3.5-Route für Klassifikation, Extraktion und Subagenten mit hohem Durchsatz – schwierige Arbeit zu 3.7 Flash eskalieren.
Wechseln Sie zur Pro-Stufe, wenn eine Aufgabe tieferes Reasoning braucht, als die Flash-Linie liefern kann.
Gemini 3.7 Flash
Eingabe / Ausgabe$0.675 / $3.375
Kontext1.05M
CachingAutomatische Cache-Lesezugriffe
Geeignet fürProduktions-Coding und Full-Stack-Refactoring, mehrstufige Agenten und Orchestrierung, Dokument- und Diagrammanalyse sowie Workloads mit hohem Volumen, bei denen bessere Token-Effizienz die Kosten pro erledigter Aufgabe senkt.
Geeignet fürDie günstigste, schnellste 3.5-Route für Klassifikation, Extraktion und Subagenten mit hohem Durchsatz – schwierige Arbeit zu 3.7 Flash eskalieren.
Ist die Gemini 3.7 Flash API über EvoLink verfügbar?
Ja. Gemini 3.7 Flash ist als Produktionsmodell mit Live-Backend-Preisen und offiziellen Fallback-Tarifen verfügbar.
Welche Modell-ID sollte ich für die Gemini 3.7 Flash API verwenden?
Senden Sie das Modell "gemini-3.7-flash" (mit Punkten). Das Bindestrich-Format gemini-3-7-flash ist nur die Seiten-URL, nicht der API-Modellparameter.
Welche Protokolle und SDKs funktionieren mit Gemini 3.7 Flash?
Nutzen Sie den OpenAI-kompatiblen Chat-Completions-Endpunkt oder den nativen Gemini-Endpunkt generateContent mit demselben EvoLink API-Schlüssel. Für dieses Modell gibt es keine Anthropic-Messages-Route.
Unterstützt die Gemini 3.7 Flash API wirklich den vollen 1M-Kontext?
Ja – die Route verzeichnet laut Googles Dokumentation 1.048.576 Eingabe-Token. Kleinere Limits stammen meist von einer bestimmten Gemini-Produktoberfläche oder Client-Konfiguration, nicht vom API-Modell selbst.
Wie sollte ich das 1M-Token-Kontextfenster von Gemini 3.7 Flash nutzen?
Halten Sie zusammengehörigen Code, Dokumente und Tool-Ergebnisse zusammen, nutzen Sie aber Retrieval, stabile gecachte Präfixe und Kontextkomprimierung, statt das Fenster standardmäßig zu füllen.
Wie unterscheidet sich Gemini 3.7 Flash von Gemini 3.6 Flash und 3.5 Flash-Lite?
3.7 Flash kostet dasselbe wie 3.6 Flash, erzielt laut Google aber höhere offizielle Werte bei Coding- und Agenten-Benchmarks wie FrontierCode und Terminal-bench. 3.5 Flash-Lite bleibt die günstigere, schnellere Route für Klassifikation und Aufgaben mit hohem Durchsatz.
Ist Gemini 3.7 Flash im Betrieb wirklich günstiger, wenn es mehr Token verbraucht?
Die Token-Preise entsprechen denen von Gemini 3.6 Flash. Google positioniert 3.7 Flash so, dass es Aufgaben in weniger Turns abschließt, während einige Berichte vom Launch-Tag einen höheren Token-Verbrauch pro Aufgabe beobachteten. Vergleichen Sie die Gesamt-Token pro akzeptierter Aufgabe auf Ihrem eigenen Workload statt des Preises pro Anfrage.
Welche Breaking Changes muss ich bei der Migration zu Gemini 3.7 Flash beachten?
Entfernen Sie eigene temperature-, top-P-, top-K- und candidate_count-Werte aus den Generierungskonfigurationen, ersetzen Sie das numerische thinking_budget durch den thinking_level-String und entfernen Sie vorbefüllte model-Turns – alles gemäß Googles offizieller Migrations-Checkliste.
Was ist mit dem minimal-Thinking-Level in Gemini 3.7 Flash passiert?
Google hat es entfernt: Verfügbare Stufen sind low, medium (Standard) und high; minimal an die Gemini API zu senden führt zu einem Fehler. EvoLink stuft reasoning_effort none oder minimal auf low herab, damit migrierte Anfragen nicht fehlschlagen. Für Klassifikationspipelines mit hohem Volumen bleibt Gemini 3.5 Flash-Lite die günstigere Untergrenze.
Wie werden die Thinking-Token von Gemini 3.7 Flash abgerechnet?
Thinking-Token werden nach Googles Preisen zum Ausgabetarif abgerechnet; ausführliches Reasoning kann die Rechnung daher deutlich größer machen als die sichtbare Antwort. Setzen Sie aufgabengerechte Thinking-Level und überwachen Sie Reasoning- plus finale Antwort-Token.
Kann Gemini 3.7 Flash Video und Audio analysieren?
Ja. Das Modell akzeptiert Text-, Bild-, Video-, Audio- und PDF-Eingaben und gibt Text aus, was es zu einer verbreiteten Wahl für Video- und Audio-Verständnis macht. Bild-, Audio- und Live-Stream-Generierung werden nicht unterstützt.
Gibt es ein Gemini 3.7 Pro?
Nein. Zum Release von 3.7 Flash bleibt Googles neuestes Pro-Modell gemini-3.1-pro-preview; ein 3.5 oder 3.7 Pro wurde auf offiziellen Kanälen nicht angekündigt.
Wie lange gilt der Einführungspreis von Gemini 3.7 Flash?
Google listet $0.750 Eingabe und $3.750 Ausgabe pro Million Token als Einführungspreis bis zum 31. Dezember 2026, mit Standardpreisen von $1.500 und $7.500 ab dem 1. Januar 2027. Den aktuellen EvoLink-Tarif finden Sie im Preisabschnitt dieser Seite.
Folgt Gemini 3.7 Flash Anweisungen zuverlässiger als 3.6 Flash?
Google berichtet von ähnlicher Sicherheit und Tonalität wie bei 3.6 Flash, während ein unabhängiger Tracker zum Launch eine höhere Halluzinationsrate maß. Prüfen Sie Instruktionstreue und faktische Disziplin an eigenen repräsentativen Aufgaben, bevor Sie das Modell in Produktion nehmen.
Was sollte eine produktive Bewertung von Gemini 3.7 Flash messen?
Erfassen Sie Erfolg im ersten Versuch, akzeptierte Ergebnisse, Retries, Ausgabe-Token, Cache-Treffer, gültige Tool-Aufrufe, Zeit bis zum akzeptierten Ergebnis, menschliche Korrektur und Fallback-Rate.