Seedance 2.5 ist jetzt auf EvoLink verfügbarSeedance 2.5 testen
Ein Entwickler-Request läuft durch ein einheitliches KI-Gateway zu Text-, Bild-, Audio-, Dokument- und Agent-Routen
Tutorial

Gemini 3.8 Flash auf EvoLink nutzen: Anleitung für die Produktion

EvoLink Team
EvoLink Team
Product Team
3. September 2026
10 Min. Lesezeit

Schnellstart

Um Gemini 3.8 Flash auf EvoLink zu nutzen, erstellen Sie einen EvoLink-API-Key, senden einen OpenAI-kompatiblen Chat-Completions-Request an https://direct.evolink.ai/v1/chat/completions und setzen model auf gemini-3.8-flash.
curl https://direct.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [
      {"role": "user", "content": "Return three rollout risks for an AI API migration."}
    ],
    "max_tokens": 500
  }'
Verwenden Sie exakt die Modell-ID mit Punkten: gemini-3.8-flash. Die Variante mit Bindestrichen, gemini-3-8-flash, ist die URL der Modellseite, nicht der API-Modellwert.
Bevor Sie Produktions-Traffic senden, prüfen Sie, ob Route und Live-Preis für Ihr Konto sichtbar sind. EvoLinks Dokumentation zur nativen und zur OpenAI-kompatiblen Gemini-API bestätigt den Host und die unten verwendeten Request-Formen und führt gemini-3.8-flash im Modell-Enum beider Endpunkte. Diese Anleitung behandelt einen Eintrag in der Dokumentation oder den Launch einer Seite trotzdem nicht als Beweis für einen erfolgreichen, abrechenbaren Aufruf in jedem Konto und jeder Region.

Was Sie brauchen

  • Ein EvoLink-Konto und einen API-Key, der in einer Umgebungsvariable liegt und nie in die Versionsverwaltung eingecheckt wird.
  • Einen Client, der HTTPS-JSON-Requests beherrscht, oder ein OpenAI-kompatibles SDK mit eigener base_url.
  • Ein kleines, repräsentatives Evaluationsset und messbare Akzeptanzregeln.
  • Logging für Modell-ID, Status, Latenz, Tokenverbrauch, Retries und Akzeptanz auf Anwendungsebene.
  • Ein Fallback-Modell wie Gemini 3.7 Flash während des Rollouts.

Gemini 3.8 Flash akzeptiert Text, Bild, Video, Audio und PDF als Eingabe und gibt Text zurück. Google dokumentiert einen Input-Kontext von 1.048.576 Token und bis zu 65.536 Output-Token. Betrachten Sie diese Limits als Kapazität, nicht als Grund, jeden Request bis oben zu füllen.

Die API-Schnittstelle wählen

EvoLink bietet für Gemini-Workloads zwei nützliche Request-Stile:

OberflächeEndpunktPasst am besten zu
OpenAI-kompatible Chat Completionshttps://direct.evolink.ai/v1/chat/completionsBestehende OpenAI-Clients, einheitliches Multi-Modell-Routing, Text- und Agent-Anwendungen
Gemini-natives generateContenthttps://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContentGemini-förmige Content-Payloads und native Request-Semantik
Verwenden Sie innerhalb eines Request-Pfads konsequent ein Protokoll. Mischen Sie keine OpenAI-messages mit Gemini-nativen contents in derselben Payload.

OpenAI-kompatibles Python-Beispiel

Installieren Sie das OpenAI-Python-Paket und richten Sie es auf EvoLink aus:

pip install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["EVOLINK_API_KEY"],
    base_url="https://direct.evolink.ai/v1",
)

response = client.chat.completions.create(
    model="gemini-3.8-flash",
    messages=[
        {
            "role": "system",
            "content": "Answer with concise, testable recommendations.",
        },
        {
            "role": "user",
            "content": "Review this deployment plan and identify missing rollback gates.",
        },
    ],
    max_tokens=800,
)

print(response.choices[0].message.content)

Halten Sie den ersten Request einfach. Bestätigen Sie Authentifizierung, Routenzugang, Response-Parsing und Usage-Felder, bevor Sie Tools, langen Kontext oder Streaming hinzufügen.

Gemini-natives Request-Beispiel

Nutzen Sie die native Oberfläche, wenn Ihre Anwendung bereits Gemini-contents- und generationConfig-Objekte baut:
curl "https://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{
      "role": "user",
      "parts": [{"text": "Create a five-step canary checklist for this API release."}]
    }],
    "generationConfig": {
      "maxOutputTokens": 800,
      "thinkingConfig": {"thinkingLevel": "medium"}
    }
  }'
EvoLink dokumentiert https://direct.evolink.ai als Standard-BaseURL für Textmodelle und langlebige Verbindungen. https://api.evolink.ai wird als primärer Endpunkt für multimodale Dienste und als Fallback für Textmodelle beschrieben; das native Standardbeispiel oben verwendet daher direct.evolink.ai.

Thinking Levels und Migrationsregeln

Gemini 3.8 Flash unterstützt die Thinking Levels low, medium und high, mit medium als Default. Laut Google wird minimal nicht unterstützt. EvoLinks native API-Referenz gibt an, dass ein nicht unterstütztes minimal automatisch auf low heruntergestuft wird. Der Request schlägt also nicht fehl, aber das wirksame Level ist dann low und nicht das, was Sie angefordert haben.
Die genaue Feldform hängt vom Protokoll ab. Native Gemini-Requests nutzen thinkingConfig.thinkingLevel. OpenAI-kompatible Clients stellen ein gemapptes Reasoning-Feld nur dann bereit, wenn das Gateway es dokumentiert; Erfinden Sie keine nicht unterstützten Felder und leiten Sie solche auch nicht weiter. Beginnen Sie mit dem Default und ändern Sie dann immer nur eine Steuerung auf einmal.

Wenn Sie einen älteren Gemini-Client migrieren, prüfen Sie diese Punkte:

Altes VerhaltenAktion für Gemini 3.8Warum
Numerisches thinkingBudget aus Gemini 2.5Für Gemini 3.x generationConfig.thinkingConfig.thinkingLevel verwendenEvoLink dokumentiert die beiden Steuerungen als sich gegenseitig ausschließend
Thinking Level minimalAuf getestetes low umstellenminimal wird nicht unterstützt; EvoLink stuft es automatisch auf low herunter, setzen Sie low daher explizit für vorhersehbare Kontrolle
Eigene temperature / topPNicht darauf verlassen, dass die Werte den Output ändern; falls gesendet, im gültigen Bereich haltenLaut EvoLink verändern eigene Werte den Output von Gemini 3.x nicht, und Werte außerhalb des Bereichs liefern 400
Eigenes topKEntfernen, sofern nicht aus Client-Kompatibilität beibehaltenLaut EvoLink wird topK ignoriert
Letzte Nachricht mit Rolle modelDen Request mit einem Nicht-model-Turn beendenLaut EvoLink liefert Gemini 3.5+ sonst einen Fehler
Function ResponsePassende id und name der Funktion zurückspiegelnEvoLink verlangt beides für Gemini 3.x

Ein Request mit HTTP 200 reicht nicht. Validieren Sie strukturierte Outputs, Tool-Argumente, Multi-Turn-Zustand und Refusal-Verhalten nach der Migration erneut.

Multimodale Eingabe ohne Kontextverschwendung

Das Modell versteht Text, Bilder, Video, Audio und PDFs, aber ein Fenster von 1M Token macht nicht jede große Payload nützlich. Bauen Sie den Kontext bewusst auf:

  • Nehmen Sie die Dokumentabschnitte oder Mediensegmente auf, die für die Entscheidung nötig sind.
  • Halten Sie stabile Systemanweisungen, Repository-Hinweise und Tool-Schemas in einem gleichbleibenden Präfix, damit Caching überhaupt greifen kann.
  • Rufen Sie relevante Belege gezielt ab, statt ein komplettes Archiv anzuhängen.
  • Setzen Sie ein zur Aufgabe passendes Output-Budget; das Maximum von 65.536 Token ist eine Obergrenze.
  • Protokollieren Sie Input- und Cache-Read-Token getrennt, damit „großer Kontext“ keine vermeidbaren Ausgaben verdeckt.

Vergleichen Sie bei wiederholt genutzten langen Dokumenten das Cache-Hit-Verhalten auf einem stabilen Prompt-Präfix. Googles Einführungstarif für Cache Reads liegt bis zum 31. Dezember 2026 bei $0.075 pro Million Token, die Abrechnung bei EvoLink sollten Sie aber in Ihrem Live-Konto prüfen.

Produktions-Rollout in fünf Stufen

Ein API-Rollout in fünf Stufen, von Key-Einrichtung und Request-Validierung bis zu Monitoring und Rollback
Ein API-Rollout in fünf Stufen, von Key-Einrichtung und Request-Validierung bis zu Monitoring und Rollback

1. Zugang und Preise prüfen

Erstellen Sie einen eingeschränkten Test-Key, prüfen Sie, ob das Modell in den verfügbaren Routen des Kontos erscheint, senden Sie einen kleinen Request und kontrollieren Sie den resultierenden Usage- oder Abrechnungseintrag. Eine öffentliche Modellseite bestätigt die beabsichtigte Verfügbarkeit, nicht den kontospezifischen Aufrufpfad.

2. Den Request-Vertrag validieren

Testen Sie zuerst synchrone Requests. Testen Sie dann Streaming, strukturierte Outputs, Tools, langen Kontext und multimodale Eingabe als getrennte Fälle. So trennen Sie Protokollfehler von Fehlern der Modellqualität.

3. Ein festes Evaluationsset replayen

Vergleichen Sie 3.8 Flash mit der aktuellen Baseline auf demselben Thinking Level. Messen Sie Erfolg im ersten Durchlauf, akzeptierte Ergebnisse, Output- und Thinking-Token, Cache Hits, gültige Tool Calls, Latenz, manuelle Korrekturen und Fallback-Rate.

4. Beobachtbaren Traffic per Canary umleiten

Beginnen Sie mit einem kleinen Prozentsatz oder einer risikoarmen Workload-Klasse. Hängen Sie die gewählte Modell-ID und die Evaluationskohorte an jeden Trace. Vermeiden Sie automatische Freigaben, die nur auf aggregiertem HTTP-Erfolg beruhen.

5. Freigeben oder zurückrollen nach schriftlichen Gates

Geben Sie nur frei, wenn das Modell die vorab definierten Schwellen für Qualität, Kosten und Latenz erfüllt. Rollen Sie zurück, indem Sie den vorherigen Modellwert wiederherstellen, sobald kritische Fehler, Kosten pro akzeptierter Aufgabe oder Latenz ihre Grenze überschreiten.

Google beschreibt Gemini 3.8 Flash ausdrücklich als Modell mit höherer Genauigkeit bei höherem Tokenverbrauch als 3.7 Flash. Ihr Canary muss deshalb die Kosten pro akzeptierter Aufgabe messen, nicht nur die Tarife pro Token. Den vollständigen Vergleich finden Sie unter Gemini 3.8 Flash vs 3.7 Flash.

Fehlerbehandlung, die in die Produktion gehört

Nutzen Sie begrenzte Retries nur bei vorübergehenden Fehlern wie Rate Limits, Nichtverfügbarkeit des Upstreams oder Transport-Timeouts. Wiederholen Sie fehlerhafte Payloads oder nicht unterstützte Parameter nicht unverändert.

Empfohlenes Verhalten:

  • Vorübergehende Fehler mit exponentiellem Backoff und Jitter wiederholen.
  • Eine maximale Anzahl an Versuchen und eine End-to-End-Deadline festlegen.
  • Eine Idempotenz-Strategie wiederverwenden, wo die Anwendung Seiteneffekte erzeugen kann.
  • Request-IDs und bereinigte Fehlerkörper loggen; niemals API-Keys oder sensible Prompts protokollieren.
  • Auf einen getesteten Fallback routen, wenn die Deadline oder die Fehlerschwelle erreicht ist.
  • Wiederholte Fehler der 400er-Klasse als Vertragsproblem behandeln, das zu beheben ist — nicht als Kapazitätsengpass, den man aussitzt.

Observability-Checkliste

Erfassen Sie für jeden Request:

  • Anwendungsfeature und Evaluationskohorte;
  • angeforderte und bediente Modell-IDs;
  • Protokoll und Endpunktfamilie;
  • Thinking Level und Output-Limit;
  • Input-, Output-, Thinking- und Cache-Read-Token, sofern zurückgegeben;
  • Latenz, Status, Fehlerklasse und Anzahl der Retries;
  • Gültigkeit der Tool Calls oder Ergebnis der Schema-Validierung;
  • Akzeptanz auf Anwendungsebene, Reviewer-Korrektur und Fallback-Ergebnis.

Mit diesen Daten kann ein einheitliches API-Gateway die Modellauswahl unterstützen, statt zu einem undurchsichtigen Proxy zu werden. Sie können mehrere Gemini-Routen hinter einem Client halten und trotzdem wissen, welche Route Wert schafft.

Typische Setup-Fehler

  • gemini-3-8-flash statt gemini-3.8-flash als Modell-ID zu senden.
  • Gemini-native contents auf dem OpenAI-kompatiblen Endpunkt zu verwenden.
  • Sich darauf zu verlassen, dass minimal stillschweigend auf low heruntergestuft wird, thinkingBudget mit thinkingLevel zu kombinieren, sich auf ignorierte Sampling-Parameter zu verlassen oder die Konversation mit der Rolle model zu beenden.
  • Das Kontextfenster ohne Retrieval oder Relevanzfilter zu füllen.
  • Anzunehmen, dass Googles öffentlicher Tarif mit dem Live-Tarif des EvoLink-Kontos identisch ist.
  • Nach einem einzigen HTTP 200 Erfolg zu melden, ohne Response-Form und Abrechnung zu prüfen.
  • Den Produktions-Default ohne gemessenen Fallback-Pfad umzustellen.

FAQ

Wie lautet die Modell-ID von Gemini 3.8 Flash?

Verwenden Sie gemini-3.8-flash. Die Version mit Punkten ist der API-Bezeichner; gemini-3-8-flash ist der Seiten-Slug bei EvoLink.
Verwenden Sie https://direct.evolink.ai/v1/chat/completions für OpenAI-kompatible Chat Completions. Für Gemini-native Payloads verwenden Sie https://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContent. Beide Endpunkte führen gemini-3.8-flash in ihrem dokumentierten Modell-Enum; prüfen Sie trotzdem, ob es für das Zielkonto freigeschaltet ist.

Kann ich das OpenAI-Python-SDK verwenden?

Ja. Setzen Sie die base_url des Clients auf https://direct.evolink.ai/v1, übergeben Sie Ihren EvoLink-Key und wählen Sie gemini-3.8-flash.

Mit welchem Thinking Level sollte ich starten?

Beginnen Sie mit dem dokumentierten Default medium und testen Sie dann low oder high gegen Ihre Gates für Qualität, Token und Latenz. Senden Sie kein minimal; EvoLink würde es auf low herunterstufen, wodurch das tatsächliche Level in Ihren Logs nicht mehr sichtbar ist.

Unterstützt Gemini 3.8 Flash Bilder, Video, Audio und PDFs?

Ja, als Eingabemodalitäten. Es gibt Text zurück und bietet keine Bild-, Audio- oder Livestream-Generierung.

Ist 3.8 Flash günstiger als 3.7 Flash?

Nicht laut Preisliste während Googles Einführungszeitraum: Die Tarife für Input, Output und Cache Read sind identisch. Google sagt, dass 3.8 mehr Token verbraucht; vergleichen Sie deshalb die vollständigen Kosten pro akzeptierter Aufgabe.

Wie stelle ich fest, dass meine Integration produktionsreif ist?

Verifizieren Sie einen erfolgreichen Aufruf und dessen Abrechnungseintrag, testen Sie jedes Protokollfeature, das Sie nutzen, replayen Sie ein festes Evaluationsset, fahren Sie einen Canary mit echtem Traffic und behalten Sie ein explizites Rollback.

Wo kann ich alle Gemini-Routen vergleichen?

Nutzen Sie die Gemini-Modellsammlung, um Rollen in der Familie, Kontext und Preise zu vergleichen, und öffnen Sie dann jede Modellseite für die aktuellen kontobezogenen Details.

Quellen und Verifikationshinweise

Modellfakten, Google-Preise und EvoLinks Request-Formate wurden am 3. September 2026 erneut geprüft. EvoLinks Dokumentation führt gemini-3.8-flash für beide Endpunkte; Endpunktzugang und Abrechnung müssen vor der vollständigen Produktionsfreigabe dennoch mit einem erfolgreichen Aufruf im Zielkonto bestätigt werden.

Bereit, Ihre KI-Kosten um 89 % zu senken?

Starten Sie noch heute mit EvoLink und erleben Sie die Vorteile intelligenter API-Routing.