
Gemini 3.8 Flash auf EvoLink nutzen: Anleitung für die Produktion

Schnellstart
https://direct.evolink.ai/v1/chat/completions und setzen model auf gemini-3.8-flash.curl https://direct.evolink.ai/v1/chat/completions \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"messages": [
{"role": "user", "content": "Return three rollout risks for an AI API migration."}
],
"max_tokens": 500
}'gemini-3.8-flash. Die Variante mit Bindestrichen, gemini-3-8-flash, ist die URL der Modellseite, nicht der API-Modellwert.gemini-3.8-flash im Modell-Enum beider Endpunkte. Diese Anleitung behandelt einen Eintrag in der Dokumentation oder den Launch einer Seite trotzdem nicht als Beweis für einen erfolgreichen, abrechenbaren Aufruf in jedem Konto und jeder Region.Was Sie brauchen
- Ein EvoLink-Konto und einen API-Key, der in einer Umgebungsvariable liegt und nie in die Versionsverwaltung eingecheckt wird.
- Einen Client, der HTTPS-JSON-Requests beherrscht, oder ein OpenAI-kompatibles SDK mit eigener
base_url. - Ein kleines, repräsentatives Evaluationsset und messbare Akzeptanzregeln.
- Logging für Modell-ID, Status, Latenz, Tokenverbrauch, Retries und Akzeptanz auf Anwendungsebene.
- Ein Fallback-Modell wie Gemini 3.7 Flash während des Rollouts.
Gemini 3.8 Flash akzeptiert Text, Bild, Video, Audio und PDF als Eingabe und gibt Text zurück. Google dokumentiert einen Input-Kontext von 1.048.576 Token und bis zu 65.536 Output-Token. Betrachten Sie diese Limits als Kapazität, nicht als Grund, jeden Request bis oben zu füllen.
Die API-Schnittstelle wählen
EvoLink bietet für Gemini-Workloads zwei nützliche Request-Stile:
| Oberfläche | Endpunkt | Passt am besten zu |
|---|---|---|
| OpenAI-kompatible Chat Completions | https://direct.evolink.ai/v1/chat/completions | Bestehende OpenAI-Clients, einheitliches Multi-Modell-Routing, Text- und Agent-Anwendungen |
Gemini-natives generateContent | https://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContent | Gemini-förmige Content-Payloads und native Request-Semantik |
messages mit Gemini-nativen contents in derselben Payload.OpenAI-kompatibles Python-Beispiel
Installieren Sie das OpenAI-Python-Paket und richten Sie es auf EvoLink aus:
pip install openaiimport os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["EVOLINK_API_KEY"],
base_url="https://direct.evolink.ai/v1",
)
response = client.chat.completions.create(
model="gemini-3.8-flash",
messages=[
{
"role": "system",
"content": "Answer with concise, testable recommendations.",
},
{
"role": "user",
"content": "Review this deployment plan and identify missing rollback gates.",
},
],
max_tokens=800,
)
print(response.choices[0].message.content)Halten Sie den ersten Request einfach. Bestätigen Sie Authentifizierung, Routenzugang, Response-Parsing und Usage-Felder, bevor Sie Tools, langen Kontext oder Streaming hinzufügen.
Gemini-natives Request-Beispiel
contents- und generationConfig-Objekte baut:curl "https://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContent" \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"role": "user",
"parts": [{"text": "Create a five-step canary checklist for this API release."}]
}],
"generationConfig": {
"maxOutputTokens": 800,
"thinkingConfig": {"thinkingLevel": "medium"}
}
}'https://direct.evolink.ai als Standard-BaseURL für Textmodelle und langlebige Verbindungen. https://api.evolink.ai wird als primärer Endpunkt für multimodale Dienste und als Fallback für Textmodelle beschrieben; das native Standardbeispiel oben verwendet daher direct.evolink.ai.Thinking Levels und Migrationsregeln
low, medium und high, mit medium als Default. Laut Google wird minimal nicht unterstützt. EvoLinks native API-Referenz gibt an, dass ein nicht unterstütztes minimal automatisch auf low heruntergestuft wird. Der Request schlägt also nicht fehl, aber das wirksame Level ist dann low und nicht das, was Sie angefordert haben.thinkingConfig.thinkingLevel. OpenAI-kompatible Clients stellen ein gemapptes Reasoning-Feld nur dann bereit, wenn das Gateway es dokumentiert; Erfinden Sie keine nicht unterstützten Felder und leiten Sie solche auch nicht weiter. Beginnen Sie mit dem Default und ändern Sie dann immer nur eine Steuerung auf einmal.Wenn Sie einen älteren Gemini-Client migrieren, prüfen Sie diese Punkte:
| Altes Verhalten | Aktion für Gemini 3.8 | Warum |
|---|---|---|
Numerisches thinkingBudget aus Gemini 2.5 | Für Gemini 3.x generationConfig.thinkingConfig.thinkingLevel verwenden | EvoLink dokumentiert die beiden Steuerungen als sich gegenseitig ausschließend |
Thinking Level minimal | Auf getestetes low umstellen | minimal wird nicht unterstützt; EvoLink stuft es automatisch auf low herunter, setzen Sie low daher explizit für vorhersehbare Kontrolle |
Eigene temperature / topP | Nicht darauf verlassen, dass die Werte den Output ändern; falls gesendet, im gültigen Bereich halten | Laut EvoLink verändern eigene Werte den Output von Gemini 3.x nicht, und Werte außerhalb des Bereichs liefern 400 |
Eigenes topK | Entfernen, sofern nicht aus Client-Kompatibilität beibehalten | Laut EvoLink wird topK ignoriert |
Letzte Nachricht mit Rolle model | Den Request mit einem Nicht-model-Turn beenden | Laut EvoLink liefert Gemini 3.5+ sonst einen Fehler |
| Function Response | Passende id und name der Funktion zurückspiegeln | EvoLink verlangt beides für Gemini 3.x |
Ein Request mit HTTP 200 reicht nicht. Validieren Sie strukturierte Outputs, Tool-Argumente, Multi-Turn-Zustand und Refusal-Verhalten nach der Migration erneut.
Multimodale Eingabe ohne Kontextverschwendung
Das Modell versteht Text, Bilder, Video, Audio und PDFs, aber ein Fenster von 1M Token macht nicht jede große Payload nützlich. Bauen Sie den Kontext bewusst auf:
- Nehmen Sie die Dokumentabschnitte oder Mediensegmente auf, die für die Entscheidung nötig sind.
- Halten Sie stabile Systemanweisungen, Repository-Hinweise und Tool-Schemas in einem gleichbleibenden Präfix, damit Caching überhaupt greifen kann.
- Rufen Sie relevante Belege gezielt ab, statt ein komplettes Archiv anzuhängen.
- Setzen Sie ein zur Aufgabe passendes Output-Budget; das Maximum von 65.536 Token ist eine Obergrenze.
- Protokollieren Sie Input- und Cache-Read-Token getrennt, damit „großer Kontext“ keine vermeidbaren Ausgaben verdeckt.
Vergleichen Sie bei wiederholt genutzten langen Dokumenten das Cache-Hit-Verhalten auf einem stabilen Prompt-Präfix. Googles Einführungstarif für Cache Reads liegt bis zum 31. Dezember 2026 bei $0.075 pro Million Token, die Abrechnung bei EvoLink sollten Sie aber in Ihrem Live-Konto prüfen.
Produktions-Rollout in fünf Stufen

1. Zugang und Preise prüfen
Erstellen Sie einen eingeschränkten Test-Key, prüfen Sie, ob das Modell in den verfügbaren Routen des Kontos erscheint, senden Sie einen kleinen Request und kontrollieren Sie den resultierenden Usage- oder Abrechnungseintrag. Eine öffentliche Modellseite bestätigt die beabsichtigte Verfügbarkeit, nicht den kontospezifischen Aufrufpfad.
2. Den Request-Vertrag validieren
Testen Sie zuerst synchrone Requests. Testen Sie dann Streaming, strukturierte Outputs, Tools, langen Kontext und multimodale Eingabe als getrennte Fälle. So trennen Sie Protokollfehler von Fehlern der Modellqualität.
3. Ein festes Evaluationsset replayen
Vergleichen Sie 3.8 Flash mit der aktuellen Baseline auf demselben Thinking Level. Messen Sie Erfolg im ersten Durchlauf, akzeptierte Ergebnisse, Output- und Thinking-Token, Cache Hits, gültige Tool Calls, Latenz, manuelle Korrekturen und Fallback-Rate.
4. Beobachtbaren Traffic per Canary umleiten
Beginnen Sie mit einem kleinen Prozentsatz oder einer risikoarmen Workload-Klasse. Hängen Sie die gewählte Modell-ID und die Evaluationskohorte an jeden Trace. Vermeiden Sie automatische Freigaben, die nur auf aggregiertem HTTP-Erfolg beruhen.
5. Freigeben oder zurückrollen nach schriftlichen Gates
Geben Sie nur frei, wenn das Modell die vorab definierten Schwellen für Qualität, Kosten und Latenz erfüllt. Rollen Sie zurück, indem Sie den vorherigen Modellwert wiederherstellen, sobald kritische Fehler, Kosten pro akzeptierter Aufgabe oder Latenz ihre Grenze überschreiten.
Fehlerbehandlung, die in die Produktion gehört
Nutzen Sie begrenzte Retries nur bei vorübergehenden Fehlern wie Rate Limits, Nichtverfügbarkeit des Upstreams oder Transport-Timeouts. Wiederholen Sie fehlerhafte Payloads oder nicht unterstützte Parameter nicht unverändert.
Empfohlenes Verhalten:
- Vorübergehende Fehler mit exponentiellem Backoff und Jitter wiederholen.
- Eine maximale Anzahl an Versuchen und eine End-to-End-Deadline festlegen.
- Eine Idempotenz-Strategie wiederverwenden, wo die Anwendung Seiteneffekte erzeugen kann.
- Request-IDs und bereinigte Fehlerkörper loggen; niemals API-Keys oder sensible Prompts protokollieren.
- Auf einen getesteten Fallback routen, wenn die Deadline oder die Fehlerschwelle erreicht ist.
- Wiederholte Fehler der 400er-Klasse als Vertragsproblem behandeln, das zu beheben ist — nicht als Kapazitätsengpass, den man aussitzt.
Observability-Checkliste
Erfassen Sie für jeden Request:
- Anwendungsfeature und Evaluationskohorte;
- angeforderte und bediente Modell-IDs;
- Protokoll und Endpunktfamilie;
- Thinking Level und Output-Limit;
- Input-, Output-, Thinking- und Cache-Read-Token, sofern zurückgegeben;
- Latenz, Status, Fehlerklasse und Anzahl der Retries;
- Gültigkeit der Tool Calls oder Ergebnis der Schema-Validierung;
- Akzeptanz auf Anwendungsebene, Reviewer-Korrektur und Fallback-Ergebnis.
Mit diesen Daten kann ein einheitliches API-Gateway die Modellauswahl unterstützen, statt zu einem undurchsichtigen Proxy zu werden. Sie können mehrere Gemini-Routen hinter einem Client halten und trotzdem wissen, welche Route Wert schafft.
Typische Setup-Fehler
gemini-3-8-flashstattgemini-3.8-flashals Modell-ID zu senden.- Gemini-native
contentsauf dem OpenAI-kompatiblen Endpunkt zu verwenden. - Sich darauf zu verlassen, dass
minimalstillschweigend auflowheruntergestuft wird,thinkingBudgetmitthinkingLevelzu kombinieren, sich auf ignorierte Sampling-Parameter zu verlassen oder die Konversation mit der Rollemodelzu beenden. - Das Kontextfenster ohne Retrieval oder Relevanzfilter zu füllen.
- Anzunehmen, dass Googles öffentlicher Tarif mit dem Live-Tarif des EvoLink-Kontos identisch ist.
- Nach einem einzigen HTTP 200 Erfolg zu melden, ohne Response-Form und Abrechnung zu prüfen.
- Den Produktions-Default ohne gemessenen Fallback-Pfad umzustellen.
FAQ
Wie lautet die Modell-ID von Gemini 3.8 Flash?
gemini-3.8-flash. Die Version mit Punkten ist der API-Bezeichner; gemini-3-8-flash ist der Seiten-Slug bei EvoLink.Welchen EvoLink-Endpunkt sollte ich verwenden?
https://direct.evolink.ai/v1/chat/completions für OpenAI-kompatible Chat Completions. Für Gemini-native Payloads verwenden Sie https://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContent. Beide Endpunkte führen gemini-3.8-flash in ihrem dokumentierten Modell-Enum; prüfen Sie trotzdem, ob es für das Zielkonto freigeschaltet ist.Kann ich das OpenAI-Python-SDK verwenden?
base_url des Clients auf https://direct.evolink.ai/v1, übergeben Sie Ihren EvoLink-Key und wählen Sie gemini-3.8-flash.Mit welchem Thinking Level sollte ich starten?
medium und testen Sie dann low oder high gegen Ihre Gates für Qualität, Token und Latenz. Senden Sie kein minimal; EvoLink würde es auf low herunterstufen, wodurch das tatsächliche Level in Ihren Logs nicht mehr sichtbar ist.Unterstützt Gemini 3.8 Flash Bilder, Video, Audio und PDFs?
Ja, als Eingabemodalitäten. Es gibt Text zurück und bietet keine Bild-, Audio- oder Livestream-Generierung.
Ist 3.8 Flash günstiger als 3.7 Flash?
Nicht laut Preisliste während Googles Einführungszeitraum: Die Tarife für Input, Output und Cache Read sind identisch. Google sagt, dass 3.8 mehr Token verbraucht; vergleichen Sie deshalb die vollständigen Kosten pro akzeptierter Aufgabe.
Wie stelle ich fest, dass meine Integration produktionsreif ist?
Verifizieren Sie einen erfolgreichen Aufruf und dessen Abrechnungseintrag, testen Sie jedes Protokollfeature, das Sie nutzen, replayen Sie ein festes Evaluationsset, fahren Sie einen Canary mit echtem Traffic und behalten Sie ein explizites Rollback.
Wo kann ich alle Gemini-Routen vergleichen?
Quellen und Verifikationshinweise
- Google: Launch von Gemini 3.8 Flash
- Google AI for Developers: Modell Gemini 3.8 Flash
- Google AI for Developers: Preise der Gemini API
- Google Cloud: Leitfaden zu Gemini 3.8 Flash
- EvoLink: Native Gemini-API-Schnellstart
- EvoLink: Native Gemini-API-Referenz
- EvoLink: OpenAI-kompatibler Gemini-Schnellstart
gemini-3.8-flash für beide Endpunkte; Endpunktzugang und Abrechnung müssen vor der vollständigen Produktionsfreigabe dennoch mit einem erfolgreichen Aufruf im Zielkonto bestätigt werden.

