Seedance 2.5 est disponible sur EvoLinkEssayer Seedance 2.5
Une requête développeur traverse une passerelle d’IA unifiée vers des routes texte, image, audio, document et agent
Tutoriel

Utiliser Gemini 3.8 Flash sur EvoLink : guide de mise en production

EvoLink Team
EvoLink Team
Product Team
3 septembre 2026
12 min de lecture

Démarrage rapide

Pour utiliser Gemini 3.8 Flash sur EvoLink, créez une clé API EvoLink, envoyez une requête Chat Completions compatible OpenAI à https://direct.evolink.ai/v1/chat/completions et définissez model sur gemini-3.8-flash.
curl https://direct.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [
      {"role": "user", "content": "Return three rollout risks for an AI API migration."}
    ],
    "max_tokens": 500
  }'
Utilisez l'ID de modèle exact avec des points, gemini-3.8-flash. La forme avec tirets, gemini-3-8-flash, est l'URL de la page modèle, pas la valeur de modèle de l'API.
Avant d'envoyer du trafic de production, confirmez que la route et le prix en direct sont visibles pour votre compte. La documentation Gemini d'EvoLink, native et compatible OpenAI, confirme l'hôte et les formats de requête utilisés ci-dessous et liste gemini-3.8-flash dans l'énumération des modèles des deux endpoints. Ce guide ne considère pas pour autant qu'une mention dans la documentation ou la mise en ligne d'une page prouve un appel facturé réussi dans chaque compte ou chaque région.

Ce dont vous avez besoin

  • Un compte EvoLink et une clé API stockée dans une variable d'environnement, jamais commitée dans le dépôt.
  • Un client capable d'envoyer des requêtes JSON en HTTPS, ou un SDK compatible OpenAI avec une base_url personnalisée.
  • Un petit jeu d'évaluation représentatif et des règles d'acceptation mesurables.
  • Une journalisation de l'ID du modèle, du statut, de la latence, de l'usage de tokens, des retries et de l'acceptation applicative.
  • Un modèle de fallback tel que Gemini 3.7 Flash pendant le déploiement.

Gemini 3.8 Flash accepte du texte, des images, de la vidéo, de l'audio et des PDF en entrée, et renvoie du texte. Google documente un contexte d'entrée de 1 048 576 tokens et jusqu'à 65 536 tokens en sortie. Considérez ces limites comme une capacité, pas comme une raison de remplir chaque requête.

Choisir la surface d'API

EvoLink expose deux styles de requête utiles pour les charges Gemini :

SurfaceEndpointCas d'usage idéal
Chat Completions compatible OpenAIhttps://direct.evolink.ai/v1/chat/completionsClients OpenAI existants, routage multi-modèles unifié, applications texte et agents
generateContent natif Geminihttps://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContentPayloads de contenu au format Gemini et sémantique de requête native
Utilisez un seul protocole de façon cohérente dans un même chemin de requête. Ne mélangez pas des messages au style OpenAI et des contents natifs Gemini dans le même payload.

Exemple Python compatible OpenAI

Installez le package Python OpenAI, puis pointez-le vers EvoLink :

pip install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["EVOLINK_API_KEY"],
    base_url="https://direct.evolink.ai/v1",
)

response = client.chat.completions.create(
    model="gemini-3.8-flash",
    messages=[
        {
            "role": "system",
            "content": "Answer with concise, testable recommendations.",
        },
        {
            "role": "user",
            "content": "Review this deployment plan and identify missing rollback gates.",
        },
    ],
    max_tokens=800,
)

print(response.choices[0].message.content)

Gardez la première requête simple. Confirmez l'authentification, l'accès à la route, le parsing de la réponse et les champs d'usage avant d'ajouter des outils, du contexte long ou du streaming.

Exemple de requête native Gemini

Utilisez la surface native quand votre application construit déjà des objets Gemini contents et generationConfig :
curl "https://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{
      "role": "user",
      "parts": [{"text": "Create a five-step canary checklist for this API release."}]
    }],
    "generationConfig": {
      "maxOutputTokens": 800,
      "thinkingConfig": {"thinkingLevel": "medium"}
    }
  }'
EvoLink documente https://direct.evolink.ai comme BaseURL par défaut pour les modèles texte et les connexions longue durée. Il décrit https://api.evolink.ai comme l'endpoint principal des services multimodaux et comme fallback pour les modèles texte ; l'exemple natif par défaut ci-dessus utilise donc direct.evolink.ai.

Niveaux de thinking et règles de migration

Gemini 3.8 Flash prend en charge les niveaux de thinking low, medium et high, avec medium par défaut. Google indique que minimal n'est pas pris en charge. La référence de l'API native d'EvoLink précise qu'un minimal non pris en charge est automatiquement rétrogradé vers low : la requête n'échoue pas, mais le niveau effectif est alors low, et non celui que vous avez demandé.
La forme exacte du champ dépend du protocole. Les requêtes natives Gemini utilisent thinkingConfig.thinkingLevel. Les clients compatibles OpenAI ne peuvent exposer un champ de raisonnement mappé que si le gateway le documente ; n'inventez pas et ne transmettez pas de champs non pris en charge. Commencez par la valeur par défaut, puis ne changez qu'un contrôle à la fois.

Quand vous migrez un client Gemini plus ancien, auditez les points suivants :

Ancien comportementAction pour Gemini 3.8Pourquoi
thinkingBudget numérique de Gemini 2.5Utiliser generationConfig.thinkingConfig.thinkingLevel pour Gemini 3.xEvoLink documente les deux contrôles comme mutuellement exclusifs
Thinking minimalPasser à low, testéminimal n'est pas pris en charge ; EvoLink le rétrograde automatiquement vers low, définissez donc low explicitement pour un contrôle prévisible
temperature / topP personnalisésNe comptez pas sur ces valeurs pour changer la sortie ; gardez-les dans la plage si vous les envoyezEvoLink indique que les valeurs personnalisées n'affectent pas la sortie de Gemini 3.x et que les valeurs hors plage renvoient 400
topK personnaliséSupprimer, sauf à le conserver pour la compatibilité clientEvoLink indique que topK est ignoré
Dernier message avec le rôle modelTerminer la requête par un tour dont le rôle n'est pas modelEvoLink indique que Gemini 3.5+ renvoie sinon une erreur
Réponse de fonctionRenvoyer l'id et le name de la fonction correspondanteEvoLink exige les deux pour Gemini 3.x

Une requête qui renvoie HTTP 200 ne suffit pas. Revalidez la sortie structurée, les arguments d'outils, l'état multi-tours et le comportement de refus après la migration.

Entrée multimodale sans gaspiller le contexte

Le modèle comprend le texte, les images, la vidéo, l'audio et les PDF, mais une fenêtre de 1M tokens ne rend pas utile chaque gros payload. Construisez le contexte délibérément :

  • Incluez les sections de document ou les segments de média nécessaires à la décision.
  • Gardez les instructions système stables, les consignes de dépôt et les schémas d'outils dans un préfixe constant pour que le cache ait une chance d'aider.
  • Récupérez les preuves pertinentes avant d'attacher une archive entière.
  • Fixez un budget de sortie adapté à la tâche ; le maximum de 65 536 tokens est un plafond.
  • Enregistrez séparément les tokens d'entrée et les tokens lus en cache pour que le « contexte long » ne masque pas une dépense évitable.

Pour les longs documents répétés, comparez le comportement des hits de cache sur un préfixe de prompt stable. Le tarif de lancement de Google pour la lecture de cache est de $0.075 par million de tokens jusqu'au 31 décembre 2026, mais la facturation EvoLink doit être vérifiée dans votre compte en direct.

Mise en production en cinq étapes

Déploiement d'API en cinq étapes, de la configuration de la clé et la validation des requêtes jusqu'au monitoring et au rollback
Déploiement d'API en cinq étapes, de la configuration de la clé et la validation des requêtes jusqu'au monitoring et au rollback

1. Vérifier l'accès et les tarifs

Créez une clé de test restreinte, confirmez que le modèle apparaît dans les routes disponibles du compte, envoyez une petite requête et vérifiez l'enregistrement d'usage ou de facturation qui en résulte. Une page modèle publique confirme une disponibilité prévue, pas le chemin d'appel propre à votre compte.

2. Valider le contrat de requête

Testez d'abord les requêtes synchrones. Testez ensuite, comme cas séparés, le streaming, la sortie structurée, les outils, le contexte long et l'entrée multimodale. Cela isole les échecs de protocole des échecs de qualité du modèle.

3. Rejouer un jeu d'évaluation figé

Comparez 3.8 Flash à la référence actuelle au même niveau de thinking. Mesurez la réussite au premier passage, les livrables acceptés, les tokens de sortie et de thinking, les hits de cache, les tool calls valides, la latence, les corrections humaines et le taux de fallback.

4. Canary sur du trafic observable

Commencez par un petit pourcentage ou une classe de charge à faible risque. Attachez l'ID du modèle choisi et la cohorte d'évaluation à chaque trace. Évitez toute promotion automatique fondée sur le seul succès HTTP agrégé.

5. Promouvoir ou revenir en arrière selon des seuils écrits

Ne promouvez le modèle que s'il franchit des seuils prédéfinis de qualité, de coût et de latence. Revenez en arrière en restaurant la valeur de modèle précédente dès que les erreurs critiques, le coût par tâche acceptée ou la latence dépassent leur limite.

Google décrit explicitement Gemini 3.8 Flash comme offrant une précision supérieure avec une consommation de tokens supérieure à celle de 3.7 Flash. Votre canary doit donc mesurer le coût par tâche acceptée, pas seulement les tarifs par token. Consultez le comparatif complet Gemini 3.8 Flash vs 3.7 Flash.

La gestion des erreurs qui a sa place en production

N'utilisez des retries bornés que pour les échecs transitoires : limites de débit, indisponibilité en amont ou timeouts de transport. Ne réessayez pas à l'identique des payloads mal formés ou des paramètres non pris en charge.

Comportement recommandé :

  • Réessayez les échecs transitoires avec backoff exponentiel et jitter.
  • Fixez un nombre maximal de tentatives et une échéance de bout en bout.
  • Réutilisez une stratégie d'idempotence là où l'application peut produire des effets de bord.
  • Journalisez les ID de requête et les corps d'erreur nettoyés ; ne journalisez jamais les clés API ni les prompts sensibles.
  • Routez vers un fallback testé quand l'échéance ou le seuil d'erreurs est atteint.
  • Traitez les erreurs 4xx répétées comme un problème de contrat à corriger, pas comme un manque de capacité qu’il suffirait d’attendre.

Checklist d'observabilité

Pour chaque requête, capturez :

  • la fonctionnalité applicative et la cohorte d'évaluation ;
  • l'ID de modèle demandé et l'ID de modèle servi ;
  • le protocole et la famille d'endpoint ;
  • le niveau de thinking et la limite de sortie ;
  • les tokens d'entrée, de sortie, de thinking et de lecture de cache quand ils sont renvoyés ;
  • la latence, le statut, la classe d'erreur et le nombre de retries ;
  • la validité des tool calls ou le résultat de la validation de schéma ;
  • l'acceptation applicative, la correction par un relecteur et l'issue du fallback.

Ces données permettent à un gateway d'API unifié de soutenir la sélection de modèle au lieu de devenir un proxy opaque. Vous pouvez garder plusieurs routes Gemini derrière un seul client tout en sachant laquelle crée de la valeur.

Les erreurs de configuration les plus fréquentes

  • Envoyer gemini-3-8-flash au lieu de gemini-3.8-flash comme ID de modèle.
  • Utiliser des contents natifs Gemini sur l'endpoint compatible OpenAI.
  • Compter sur la rétrogradation silencieuse de minimal vers low, combiner thinkingBudget et thinkingLevel, s'appuyer sur des contrôles d'échantillonnage ignorés, ou terminer la conversation par le rôle model.
  • Remplir la fenêtre de contexte sans récupération ni filtrage par pertinence.
  • Supposer que le tarif public de Google est identique au tarif en direct du compte EvoLink.
  • Déclarer le succès après un seul HTTP 200 sans vérifier la forme de la réponse et la facturation.
  • Changer le modèle de production par défaut sans voie de fallback mesurée.

FAQ

Quel est l'ID du modèle Gemini 3.8 Flash ?

Utilisez gemini-3.8-flash. La version avec des points est l'identifiant d'API ; gemini-3-8-flash est le slug de la page EvoLink.
Utilisez https://direct.evolink.ai/v1/chat/completions pour les Chat Completions compatibles OpenAI. Pour les payloads natifs Gemini, utilisez https://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContent. Les deux endpoints listent gemini-3.8-flash dans leur énumération de modèles documentée ; vérifiez malgré tout qu'il est activé pour le compte cible.

Puis-je utiliser le SDK Python OpenAI ?

Oui. Définissez la base_url du client sur https://direct.evolink.ai/v1, passez votre clé EvoLink et sélectionnez gemini-3.8-flash.

Par quel niveau de thinking commencer ?

Commencez par la valeur par défaut documentée, medium, puis testez low ou high face à vos seuils de qualité, de tokens et de latence. N'envoyez pas minimal : EvoLink le rétrograderait vers low, ce qui masque le niveau réel dans vos logs.

Gemini 3.8 Flash prend-il en charge les images, la vidéo, l'audio et les PDF ?

Oui, comme modalités d'entrée. Il renvoie du texte et ne propose pas de génération d'images, d'audio ni de flux en direct.

3.8 Flash est-il moins cher que 3.7 Flash ?

Pas selon la grille tarifaire pendant la période de lancement de Google : leurs tarifs d'entrée, de sortie et de lecture de cache sont identiques. Google indique que 3.8 consomme plus de tokens ; comparez donc le coût complet par tâche acceptée.

Comment confirmer que mon intégration est prête pour la production ?

Vérifiez un appel réussi et son enregistrement de facturation, testez chaque fonctionnalité de protocole que vous utilisez, rejouez un jeu d'évaluation figé, faites un canary sur du trafic réel et conservez un rollback explicite.

Où comparer toutes les routes Gemini ?

Utilisez la collection de modèles Gemini pour comparer les rôles dans la famille, le contexte et les prix, puis ouvrez chaque page modèle pour ses informations à jour côté compte.

Sources et notes de vérification

Faits du modèle, tarifs Google et formats de requête EvoLink revérifiés le 3 septembre 2026. La documentation d'EvoLink liste gemini-3.8-flash pour les deux endpoints ; l'accès à l'endpoint et la facturation doivent malgré tout être confirmés par un appel réussi dans le compte cible avant toute promotion complète en production.

Prêt à réduire vos coûts IA de 89 % ?

Commencez avec EvoLink dès aujourd'hui et découvrez la puissance du routage intelligent des API.