
Utiliser Gemini 3.8 Flash sur EvoLink : guide de mise en production

Démarrage rapide
https://direct.evolink.ai/v1/chat/completions et définissez model sur gemini-3.8-flash.curl https://direct.evolink.ai/v1/chat/completions \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.8-flash",
"messages": [
{"role": "user", "content": "Return three rollout risks for an AI API migration."}
],
"max_tokens": 500
}'gemini-3.8-flash. La forme avec tirets, gemini-3-8-flash, est l'URL de la page modèle, pas la valeur de modèle de l'API.gemini-3.8-flash dans l'énumération des modèles des deux endpoints. Ce guide ne considère pas pour autant qu'une mention dans la documentation ou la mise en ligne d'une page prouve un appel facturé réussi dans chaque compte ou chaque région.Ce dont vous avez besoin
- Un compte EvoLink et une clé API stockée dans une variable d'environnement, jamais commitée dans le dépôt.
- Un client capable d'envoyer des requêtes JSON en HTTPS, ou un SDK compatible OpenAI avec une
base_urlpersonnalisée. - Un petit jeu d'évaluation représentatif et des règles d'acceptation mesurables.
- Une journalisation de l'ID du modèle, du statut, de la latence, de l'usage de tokens, des retries et de l'acceptation applicative.
- Un modèle de fallback tel que Gemini 3.7 Flash pendant le déploiement.
Gemini 3.8 Flash accepte du texte, des images, de la vidéo, de l'audio et des PDF en entrée, et renvoie du texte. Google documente un contexte d'entrée de 1 048 576 tokens et jusqu'à 65 536 tokens en sortie. Considérez ces limites comme une capacité, pas comme une raison de remplir chaque requête.
Choisir la surface d'API
EvoLink expose deux styles de requête utiles pour les charges Gemini :
| Surface | Endpoint | Cas d'usage idéal |
|---|---|---|
| Chat Completions compatible OpenAI | https://direct.evolink.ai/v1/chat/completions | Clients OpenAI existants, routage multi-modèles unifié, applications texte et agents |
generateContent natif Gemini | https://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContent | Payloads de contenu au format Gemini et sémantique de requête native |
messages au style OpenAI et des contents natifs Gemini dans le même payload.Exemple Python compatible OpenAI
Installez le package Python OpenAI, puis pointez-le vers EvoLink :
pip install openaiimport os
from openai import OpenAI
client = OpenAI(
api_key=os.environ["EVOLINK_API_KEY"],
base_url="https://direct.evolink.ai/v1",
)
response = client.chat.completions.create(
model="gemini-3.8-flash",
messages=[
{
"role": "system",
"content": "Answer with concise, testable recommendations.",
},
{
"role": "user",
"content": "Review this deployment plan and identify missing rollback gates.",
},
],
max_tokens=800,
)
print(response.choices[0].message.content)Gardez la première requête simple. Confirmez l'authentification, l'accès à la route, le parsing de la réponse et les champs d'usage avant d'ajouter des outils, du contexte long ou du streaming.
Exemple de requête native Gemini
contents et generationConfig :curl "https://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContent" \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"contents": [{
"role": "user",
"parts": [{"text": "Create a five-step canary checklist for this API release."}]
}],
"generationConfig": {
"maxOutputTokens": 800,
"thinkingConfig": {"thinkingLevel": "medium"}
}
}'https://direct.evolink.ai comme BaseURL par défaut pour les modèles texte et les connexions longue durée. Il décrit https://api.evolink.ai comme l'endpoint principal des services multimodaux et comme fallback pour les modèles texte ; l'exemple natif par défaut ci-dessus utilise donc direct.evolink.ai.Niveaux de thinking et règles de migration
low, medium et high, avec medium par défaut. Google indique que minimal n'est pas pris en charge. La référence de l'API native d'EvoLink précise qu'un minimal non pris en charge est automatiquement rétrogradé vers low : la requête n'échoue pas, mais le niveau effectif est alors low, et non celui que vous avez demandé.thinkingConfig.thinkingLevel. Les clients compatibles OpenAI ne peuvent exposer un champ de raisonnement mappé que si le gateway le documente ; n'inventez pas et ne transmettez pas de champs non pris en charge. Commencez par la valeur par défaut, puis ne changez qu'un contrôle à la fois.Quand vous migrez un client Gemini plus ancien, auditez les points suivants :
| Ancien comportement | Action pour Gemini 3.8 | Pourquoi |
|---|---|---|
thinkingBudget numérique de Gemini 2.5 | Utiliser generationConfig.thinkingConfig.thinkingLevel pour Gemini 3.x | EvoLink documente les deux contrôles comme mutuellement exclusifs |
Thinking minimal | Passer à low, testé | minimal n'est pas pris en charge ; EvoLink le rétrograde automatiquement vers low, définissez donc low explicitement pour un contrôle prévisible |
temperature / topP personnalisés | Ne comptez pas sur ces valeurs pour changer la sortie ; gardez-les dans la plage si vous les envoyez | EvoLink indique que les valeurs personnalisées n'affectent pas la sortie de Gemini 3.x et que les valeurs hors plage renvoient 400 |
topK personnalisé | Supprimer, sauf à le conserver pour la compatibilité client | EvoLink indique que topK est ignoré |
Dernier message avec le rôle model | Terminer la requête par un tour dont le rôle n'est pas model | EvoLink indique que Gemini 3.5+ renvoie sinon une erreur |
| Réponse de fonction | Renvoyer l'id et le name de la fonction correspondante | EvoLink exige les deux pour Gemini 3.x |
Une requête qui renvoie HTTP 200 ne suffit pas. Revalidez la sortie structurée, les arguments d'outils, l'état multi-tours et le comportement de refus après la migration.
Entrée multimodale sans gaspiller le contexte
Le modèle comprend le texte, les images, la vidéo, l'audio et les PDF, mais une fenêtre de 1M tokens ne rend pas utile chaque gros payload. Construisez le contexte délibérément :
- Incluez les sections de document ou les segments de média nécessaires à la décision.
- Gardez les instructions système stables, les consignes de dépôt et les schémas d'outils dans un préfixe constant pour que le cache ait une chance d'aider.
- Récupérez les preuves pertinentes avant d'attacher une archive entière.
- Fixez un budget de sortie adapté à la tâche ; le maximum de 65 536 tokens est un plafond.
- Enregistrez séparément les tokens d'entrée et les tokens lus en cache pour que le « contexte long » ne masque pas une dépense évitable.
Pour les longs documents répétés, comparez le comportement des hits de cache sur un préfixe de prompt stable. Le tarif de lancement de Google pour la lecture de cache est de $0.075 par million de tokens jusqu'au 31 décembre 2026, mais la facturation EvoLink doit être vérifiée dans votre compte en direct.
Mise en production en cinq étapes

1. Vérifier l'accès et les tarifs
Créez une clé de test restreinte, confirmez que le modèle apparaît dans les routes disponibles du compte, envoyez une petite requête et vérifiez l'enregistrement d'usage ou de facturation qui en résulte. Une page modèle publique confirme une disponibilité prévue, pas le chemin d'appel propre à votre compte.
2. Valider le contrat de requête
Testez d'abord les requêtes synchrones. Testez ensuite, comme cas séparés, le streaming, la sortie structurée, les outils, le contexte long et l'entrée multimodale. Cela isole les échecs de protocole des échecs de qualité du modèle.
3. Rejouer un jeu d'évaluation figé
Comparez 3.8 Flash à la référence actuelle au même niveau de thinking. Mesurez la réussite au premier passage, les livrables acceptés, les tokens de sortie et de thinking, les hits de cache, les tool calls valides, la latence, les corrections humaines et le taux de fallback.
4. Canary sur du trafic observable
Commencez par un petit pourcentage ou une classe de charge à faible risque. Attachez l'ID du modèle choisi et la cohorte d'évaluation à chaque trace. Évitez toute promotion automatique fondée sur le seul succès HTTP agrégé.
5. Promouvoir ou revenir en arrière selon des seuils écrits
Ne promouvez le modèle que s'il franchit des seuils prédéfinis de qualité, de coût et de latence. Revenez en arrière en restaurant la valeur de modèle précédente dès que les erreurs critiques, le coût par tâche acceptée ou la latence dépassent leur limite.
La gestion des erreurs qui a sa place en production
N'utilisez des retries bornés que pour les échecs transitoires : limites de débit, indisponibilité en amont ou timeouts de transport. Ne réessayez pas à l'identique des payloads mal formés ou des paramètres non pris en charge.
Comportement recommandé :
- Réessayez les échecs transitoires avec backoff exponentiel et jitter.
- Fixez un nombre maximal de tentatives et une échéance de bout en bout.
- Réutilisez une stratégie d'idempotence là où l'application peut produire des effets de bord.
- Journalisez les ID de requête et les corps d'erreur nettoyés ; ne journalisez jamais les clés API ni les prompts sensibles.
- Routez vers un fallback testé quand l'échéance ou le seuil d'erreurs est atteint.
- Traitez les erreurs 4xx répétées comme un problème de contrat à corriger, pas comme un manque de capacité qu’il suffirait d’attendre.
Checklist d'observabilité
Pour chaque requête, capturez :
- la fonctionnalité applicative et la cohorte d'évaluation ;
- l'ID de modèle demandé et l'ID de modèle servi ;
- le protocole et la famille d'endpoint ;
- le niveau de thinking et la limite de sortie ;
- les tokens d'entrée, de sortie, de thinking et de lecture de cache quand ils sont renvoyés ;
- la latence, le statut, la classe d'erreur et le nombre de retries ;
- la validité des tool calls ou le résultat de la validation de schéma ;
- l'acceptation applicative, la correction par un relecteur et l'issue du fallback.
Ces données permettent à un gateway d'API unifié de soutenir la sélection de modèle au lieu de devenir un proxy opaque. Vous pouvez garder plusieurs routes Gemini derrière un seul client tout en sachant laquelle crée de la valeur.
Les erreurs de configuration les plus fréquentes
- Envoyer
gemini-3-8-flashau lieu degemini-3.8-flashcomme ID de modèle. - Utiliser des
contentsnatifs Gemini sur l'endpoint compatible OpenAI. - Compter sur la rétrogradation silencieuse de
minimalverslow, combinerthinkingBudgetetthinkingLevel, s'appuyer sur des contrôles d'échantillonnage ignorés, ou terminer la conversation par le rôlemodel. - Remplir la fenêtre de contexte sans récupération ni filtrage par pertinence.
- Supposer que le tarif public de Google est identique au tarif en direct du compte EvoLink.
- Déclarer le succès après un seul HTTP 200 sans vérifier la forme de la réponse et la facturation.
- Changer le modèle de production par défaut sans voie de fallback mesurée.
FAQ
Quel est l'ID du modèle Gemini 3.8 Flash ?
gemini-3.8-flash. La version avec des points est l'identifiant d'API ; gemini-3-8-flash est le slug de la page EvoLink.Quel endpoint EvoLink dois-je utiliser ?
https://direct.evolink.ai/v1/chat/completions pour les Chat Completions compatibles OpenAI. Pour les payloads natifs Gemini, utilisez https://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContent. Les deux endpoints listent gemini-3.8-flash dans leur énumération de modèles documentée ; vérifiez malgré tout qu'il est activé pour le compte cible.Puis-je utiliser le SDK Python OpenAI ?
base_url du client sur https://direct.evolink.ai/v1, passez votre clé EvoLink et sélectionnez gemini-3.8-flash.Par quel niveau de thinking commencer ?
medium, puis testez low ou high face à vos seuils de qualité, de tokens et de latence. N'envoyez pas minimal : EvoLink le rétrograderait vers low, ce qui masque le niveau réel dans vos logs.Gemini 3.8 Flash prend-il en charge les images, la vidéo, l'audio et les PDF ?
Oui, comme modalités d'entrée. Il renvoie du texte et ne propose pas de génération d'images, d'audio ni de flux en direct.
3.8 Flash est-il moins cher que 3.7 Flash ?
Pas selon la grille tarifaire pendant la période de lancement de Google : leurs tarifs d'entrée, de sortie et de lecture de cache sont identiques. Google indique que 3.8 consomme plus de tokens ; comparez donc le coût complet par tâche acceptée.
Comment confirmer que mon intégration est prête pour la production ?
Vérifiez un appel réussi et son enregistrement de facturation, testez chaque fonctionnalité de protocole que vous utilisez, rejouez un jeu d'évaluation figé, faites un canary sur du trafic réel et conservez un rollback explicite.
Où comparer toutes les routes Gemini ?
Sources et notes de vérification
- Google : lancement de Gemini 3.8 Flash
- Google AI for Developers : modèle Gemini 3.8 Flash
- Google AI for Developers : tarifs de l'API Gemini
- Google Cloud : guide Gemini 3.8 Flash
- EvoLink : démarrage rapide de l'API Gemini native
- EvoLink : référence de l'API Gemini native
- EvoLink : démarrage rapide compatible OpenAI pour Gemini
gemini-3.8-flash pour les deux endpoints ; l'accès à l'endpoint et la facturation doivent malgré tout être confirmés par un appel réussi dans le compte cible avant toute promotion complète en production.

