
Gemini 3.8 Flash vs Gemini 3.7 Flash : précision ou efficacité en tokens ?

La réponse courte
Ne migrez pas toute une flotte sur la foi d'un graphique de benchmark. Rejouez un jeu de tâches représentatif, gardez le niveau de thinking et le contrat d'outils constants, puis comparez les résultats acceptés, le total de tokens de sortie et de thinking, la latence, les retries et le temps de relecture.
Référence officielle : qu'est-ce qui est réellement identique ?
Au 3 septembre 2026, Google documente la base suivante. Les prix ci-dessous sont les tarifs de lancement de Google, valables jusqu'au 31 décembre 2026 ; Google affiche des tarifs standard plus élevés à partir du 1er janvier 2027. Les tarifs de votre compte EvoLink peuvent différer : prenez le prix en direct renvoyé par votre compte comme référence de facturation.
| Dimension | Gemini 3.8 Flash | Gemini 3.7 Flash | Impact sur la décision |
|---|---|---|---|
| ID du modèle | gemini-3.8-flash | gemini-3.7-flash | Changement de modèle explicite |
| Tarif de lancement en entrée | $0.75 / 1M tokens | $0.75 / 1M tokens | Aucun avantage tarifaire |
| Tarif de lancement en sortie | $3.75 / 1M tokens | $3.75 / 1M tokens | Le volume de tokens décide de la dépense |
| Tarif de lancement en lecture de cache | $0.075 / 1M tokens | $0.075 / 1M tokens | Des préfixes stables peuvent réduire le coût des entrées répétées |
| Contexte en entrée | 1 048 576 tokens | 1 048 576 tokens | Capacité identique |
| Sortie maximale | 65 536 tokens | 65 536 tokens | Plafond documenté identique |
| Modalités en entrée | Texte, image, vidéo, audio, PDF | Texte, image, vidéo, audio, PDF | Même prise en charge multimodale |
| Modalité en sortie | Texte | Texte | Aucun des deux ne génère de médias |
| Niveaux de thinking | low, medium, high | low, medium, high | Comparer au même niveau |
Ce qui change avec Gemini 3.8 Flash
Google positionne 3.8 Flash comme son modèle workhorse de classe Flash le plus capable pour le coding, les workflows agentiques, le travail de connaissance et la compréhension multimodale. Ses supports de lancement rapportent des progrès sur des évaluations orientées coding et terminal. Ce sont des signaux annoncés par le fournisseur : utiles pour décider quoi tester, mais pas un substitut à vos propres critères d'acceptation en production. Sorti le 2 septembre 2026, le modèle place le tarif et la consommation de tokens au cœur du débat : c'est précisément l'arbitrage que cet article détaille.
Le modèle suit aussi le contrat de requête actuel de Gemini 3 :
- Sur la surface Gemini native d'EvoLink, Gemini 3.x utilise
generationConfig.thinkingConfig.thinkingLevel;thinkingBudgetest le contrôle propre à Gemini 2.5, mutuellement exclusif avec le premier. - Les valeurs de thinking prises en charge sont
low,medium(par défaut) ethigh;minimaln'est pas pris en charge, et EvoLink le rétrograde automatiquement verslow. - EvoLink indique que les valeurs personnalisées de
temperatureettopPn'affectent pas la sortie de Gemini 3.x, quetopKest ignoré, et qu'une valeur hors plage detemperatureoutopPrenvoie une erreur 400. - Ne terminez pas une requête par un tour
model. - Les réponses de fonction doivent renvoyer l'
idet lenamede la fonction correspondante.
Ces règles s'appliquent aussi à une comparaison propre entre 3.7 et 3.8. Une différence de paramètre passée inaperçue peut ressembler à une différence de qualité de modèle.
Matrice de décision
| Charge de travail | Commencer par | Pourquoi | Quoi mesurer avant la promotion |
|---|---|---|---|
| Patchs de code avec tests stricts | Tester 3.8 en challenger | Google rapporte de meilleurs scores sur certains benchmarks de coding ; l'effet en production est inconnu | Tests réussis, retouches en revue, tokens totaux, latence |
| Agents multi-étapes avec outils | Tester 3.8 en challenger | Google met en avant les benchmarks agentiques ; l'effet sur les tool calls en production est inconnu | Appels valides, étapes échouées, retries, taux de complétion |
| Analyse de documents et de graphiques | Test côte à côte | Les deux ont le même contexte et les mêmes modalités | Exactitude des citations, erreurs d'extraction, tokens de sortie |
| Pipeline de classification stable | Garder 3.7 comme contrôle | Google recommande 3.7 quand l'efficacité de calcul est la priorité | Dérive, coût pour 1 000 labels acceptés, latence p95 |
| Résumé à gros volume | Garder le modèle actuel comme contrôle | Aucun résultat publié par EvoLink n'établit un avantage pour 3.8 | Qualité de compression, longueur de sortie, taux de relecture |
| Trafic de production mixte | Router les deux | Un seul modèle par défaut convient rarement à toutes les tâches | Acceptation par route, dépense, fréquence de fallback |
Le tableau répartit les candidats au test ; il ne prédit pas de gagnant. Gardez le modèle de production actuel comme contrôle jusqu'à ce que le challenger franchisse des seuils prédéfinis d'acceptation, de coût et de latence.
La métrique qui compte : le coût par tâche acceptée
Le prix du token n'est qu'un terme du coût de production. Utilisez un calcul par modèle de ce type :
coût par tâche acceptée = (dépense totale du modèle + dépense des retries + coût de la relecture humaine) / tâches acceptéesEvoLink n'a pas publié de comparaison de charge contrôlée montrant que 3.8 Flash réduit les retries, le travail de relecture ou le coût total par tâche. La formule ci-dessus est une méthode d'évaluation, pas un résultat mesuré. Les faits publiés par Google — précision supérieure et consommation de tokens supérieure — n'établissent pas quel modèle est le moins cher pour une tâche de production menée à terme.
Suivez au minimum :
- le taux de résultats acceptés et la réussite au premier passage ;
- les tokens d'entrée, de sortie et de thinking pour la tâche entière, retries compris ;
- les tokens lus en cache et le taux de hit de cache ;
- les tool calls valides versus rejetés ;
- le délai jusqu'à un résultat accepté ;
- les minutes de correction humaine ;
- la fréquence des fallbacks et des rollbacks.
Une évaluation 3.8 vs 3.7 reproductible

- Gelez un jeu représentatif. Utilisez des tâches réelles, sans données sensibles, couvrant les cas faciles, médians et sujets à l'échec. Cinquante tâches peuvent révéler des régressions évidentes ; une promotion en production mérite un jeu plus large.
- Gardez le contrat constant. Utilisez des instructions système, des outils, des schémas, un contexte, un budget de sortie et un niveau de thinking identiques. Commencez par
medium, sauf raison précise de tester un autre niveau. - Démarrez une session propre. Ne réutilisez ni contenu mis en cache ni état propre à un modèle quand vous changez de modèle. Mélanger les états peut fausser la comparaison.
- Notez l'acceptation, pas le style. Définissez des tests exécutables, des contrôles d'extraction, des règles de citation ou des grilles de relecture avant de voir les résultats.
- Chiffrez la boucle complète. Incluez la sortie de raisonnement, les retries, les appels de fallback et le temps de relecture — pas seulement la première réponse.
- Canary avant de changer le défaut. Envoyez une petite tranche de trafic observable vers 3.8 et gardez un rollback vers 3.7 en un seul changement.
Écrivez les seuils de promotion avant le test. Par exemple : aucune hausse significative des erreurs critiques, une amélioration définie du taux de tâches acceptées, et une hausse maximale tolérée du coût par tâche acceptée et de la latence p95.
Checklist de migration et de rollback
Un changement de modèle au sein d'une même famille doit tout de même être traité comme une mise en production qui change le comportement.
- Changez la valeur
modelde l'API degemini-3.7-flashàgemini-3.8-flash; n'utilisez pas le slug de pagegemini-3-8-flashcomme ID de modèle. - Auditez les anciens clients : contrôles de thinking mutuellement exclusifs, contrôles d'échantillonnage ignorés et valeurs hors plage.
- Mappez le thinking
minimalvers un niveau pris en charge et testé — en générallow— plutôt que de supposer silencieusement l'équivalence. - Revalidez les schémas de sortie structurée et de réponse de fonction.
- Invalidez les caches de prompt propres à un modèle et démarrez les sessions de comparaison proprement.
- Enregistrez l'ID du modèle, la route, le niveau de thinking, les catégories de tokens, la latence, le nombre de retries et le résultat d'acceptation.
- Gardez 3.7 configuré en fallback explicite jusqu'à ce que 3.8 ait passé la fenêtre d'observation.
model à chaque requête. La valeur opérationnelle, c'est une sélection et un rollback maîtrisés, pas la promesse que chaque requête obtienne le coût le plus bas possible.Qui devrait tester 3.8 dès maintenant ?
Les erreurs de comparaison les plus fréquentes
- Qualifier 3.8 de « moins cher » parce que le tarif de lancement est inférieur à un futur tarif standard. La date de comparaison et la période tarifaire doivent être précisées.
- Assimiler un prix par token identique à un coût par tâche identique.
- Comparer le thinking
highsur 3.8 avecmediumoulowsur 3.7. - Réutiliser un cache propre à un modèle entre les variantes.
- Présenter des gains de benchmark comme des gains applicatifs garantis.
- Mesurer la qualité des réponses en ignorant les retries, le temps de relecture et les échecs d'outils.
- Remplacer le modèle de production par défaut sans seuil de rollback.
FAQ
Gemini 3.8 Flash est-il meilleur que Gemini 3.7 Flash ?
Les éléments publiés ne désignent aucun vainqueur global. Google rapporte une précision supérieure pour 3.8 Flash, en particulier sur les benchmarks de coding et agentiques mis en avant, et documente aussi une consommation de tokens supérieure. EvoLink n'a pas publié de résultats de charge contrôlés qui transformeraient ces faits en conclusion au niveau de la tâche.
Gemini 3.8 Flash est-il plus cher que 3.7 Flash ?
Leurs tarifs de lancement Google par token sont identiques jusqu'au 31 décembre 2026. Une tâche sur 3.8 peut malgré tout coûter plus cher si elle consomme plus de tokens de sortie ou de thinking. Les tarifs de votre compte EvoLink sont à vérifier dans l'affichage des prix en direct.
Que deviennent les tarifs en 2027 ?
Google affiche des tarifs standard à partir du 1er janvier 2027 : $1.50 par million de tokens en entrée, $7.50 par million de tokens en sortie et $0.15 par million de tokens lus en cache. Revérifiez les tarifs de Google et d'EvoLink avant cette date.
Les deux modèles ont-ils des fenêtres de contexte différentes ?
Non. Google documente pour les deux une limite d'entrée de 1 048 576 tokens et une sortie maximale de 65 536 tokens.
Gemini 3.8 Flash prend-il en charge le thinking minimal ?
low, medium et high, avec medium par défaut. La référence de l'API native d'EvoLink indique qu'un minimal non pris en charge est automatiquement rétrogradé vers low : définissez donc low explicitement plutôt que de compter sur la rétrogradation.Puis-je réutiliser le contenu mis en cache en passant de 3.7 à 3.8 ?
Ne partez pas du principe que le contenu mis en cache est portable d'une version de modèle à l'autre. Recréez les caches propres au modèle et démarrez les évaluations de migration avec un état propre.
Dois-je remplacer 3.7 Flash immédiatement ?
Aucun remplacement automatique n'est justifié. Faites un replay et un canary, puis promouvez 3.8 uniquement pour les charges où il franchit des seuils de qualité, de coût et de latence écrits à l'avance.
EvoLink peut-il router les deux modèles via une seule intégration ?
gemini-3.8-flash dans l'énumération des modèles de l'endpoint natif comme de l'endpoint compatible OpenAI.Sources et notes de vérification
- Google : lancement de Gemini 3.8 Flash
- Google AI for Developers : modèle Gemini 3.8 Flash
- Google AI for Developers : tarifs de l'API Gemini
- Google Cloud : guide Gemini 3.8 Flash
- Google DeepMind : model card Gemini 3.8 Flash
- EvoLink : référence de l'API Gemini native
gemini-3.8-flash pour les deux endpoints ; l'accès au niveau du compte doit malgré tout être vérifié avant tout déploiement en production.

