Seedance 2.5 est disponible sur EvoLinkEssayer Seedance 2.5
Deux routes d’IA en production opposant l’efficacité de calcul à un chemin de raisonnement plus large
Comparison

Gemini 3.8 Flash vs Gemini 3.7 Flash : précision ou efficacité en tokens ?

EvoLink Team
EvoLink Team
Product Team
3 septembre 2026
13 min de lecture

La réponse courte

Les éléments publiés par Google permettent deux conclusions : Gemini 3.8 Flash affiche une précision annoncée plus élevée et une consommation de tokens plus élevée, tandis que Google recommande Gemini 3.7 Flash quand l'efficacité de calcul est la priorité. EvoLink n'a publié aucun résultat contrôlé montrant moins de sorties rejetées, d'échecs d'outils, de retries ou de corrections humaines : cet article ne désigne donc pas de vainqueur sur le coût par tâche.
Le détail important passe facilement inaperçu : Google a lancé les deux modèles aux mêmes tarifs de lancement par token, mais indique explicitement que 3.8 Flash consomme plus de tokens tout en offrant une précision supérieure. Autrement dit, « même prix » ne veut pas dire « même facture ». La décision de production se prend au niveau du coût par tâche acceptée, pas du prix par million de tokens.

Ne migrez pas toute une flotte sur la foi d'un graphique de benchmark. Rejouez un jeu de tâches représentatif, gardez le niveau de thinking et le contrat d'outils constants, puis comparez les résultats acceptés, le total de tokens de sortie et de thinking, la latence, les retries et le temps de relecture.

Référence officielle : qu'est-ce qui est réellement identique ?

Au 3 septembre 2026, Google documente la base suivante. Les prix ci-dessous sont les tarifs de lancement de Google, valables jusqu'au 31 décembre 2026 ; Google affiche des tarifs standard plus élevés à partir du 1er janvier 2027. Les tarifs de votre compte EvoLink peuvent différer : prenez le prix en direct renvoyé par votre compte comme référence de facturation.

DimensionGemini 3.8 FlashGemini 3.7 FlashImpact sur la décision
ID du modèlegemini-3.8-flashgemini-3.7-flashChangement de modèle explicite
Tarif de lancement en entrée$0.75 / 1M tokens$0.75 / 1M tokensAucun avantage tarifaire
Tarif de lancement en sortie$3.75 / 1M tokens$3.75 / 1M tokensLe volume de tokens décide de la dépense
Tarif de lancement en lecture de cache$0.075 / 1M tokens$0.075 / 1M tokensDes préfixes stables peuvent réduire le coût des entrées répétées
Contexte en entrée1 048 576 tokens1 048 576 tokensCapacité identique
Sortie maximale65 536 tokens65 536 tokensPlafond documenté identique
Modalités en entréeTexte, image, vidéo, audio, PDFTexte, image, vidéo, audio, PDFMême prise en charge multimodale
Modalité en sortieTexteTexteAucun des deux ne génère de médias
Niveaux de thinkinglow, medium, highlow, medium, highComparer au même niveau
Cette surface inchangée rend 3.8 facile à tester à côté de 3.7. Elle ne rend pas la mise à niveau économiquement automatique.

Ce qui change avec Gemini 3.8 Flash

Google positionne 3.8 Flash comme son modèle workhorse de classe Flash le plus capable pour le coding, les workflows agentiques, le travail de connaissance et la compréhension multimodale. Ses supports de lancement rapportent des progrès sur des évaluations orientées coding et terminal. Ce sont des signaux annoncés par le fournisseur : utiles pour décider quoi tester, mais pas un substitut à vos propres critères d'acceptation en production. Sorti le 2 septembre 2026, le modèle place le tarif et la consommation de tokens au cœur du débat : c'est précisément l'arbitrage que cet article détaille.

La déclaration la plus utile pour décider figure dans le guide développeur de Google : 3.8 Flash offre une précision supérieure avec une consommation de tokens supérieure à celle de 3.7 Flash, et Google recommande 3.7 quand l'efficacité de calcul est la priorité. C'est une orientation produit inhabituellement claire. Elle exclut toute affirmation simpliste selon laquelle 3.8 serait toujours le choix le moins cher ou le plus efficace.

Le modèle suit aussi le contrat de requête actuel de Gemini 3 :

  • Sur la surface Gemini native d'EvoLink, Gemini 3.x utilise generationConfig.thinkingConfig.thinkingLevel ; thinkingBudget est le contrôle propre à Gemini 2.5, mutuellement exclusif avec le premier.
  • Les valeurs de thinking prises en charge sont low, medium (par défaut) et high ; minimal n'est pas pris en charge, et EvoLink le rétrograde automatiquement vers low.
  • EvoLink indique que les valeurs personnalisées de temperature et topP n'affectent pas la sortie de Gemini 3.x, que topK est ignoré, et qu'une valeur hors plage de temperature ou topP renvoie une erreur 400.
  • Ne terminez pas une requête par un tour model.
  • Les réponses de fonction doivent renvoyer l'id et le name de la fonction correspondante.

Ces règles s'appliquent aussi à une comparaison propre entre 3.7 et 3.8. Une différence de paramètre passée inaperçue peut ressembler à une différence de qualité de modèle.

Matrice de décision

Charge de travailCommencer parPourquoiQuoi mesurer avant la promotion
Patchs de code avec tests strictsTester 3.8 en challengerGoogle rapporte de meilleurs scores sur certains benchmarks de coding ; l'effet en production est inconnuTests réussis, retouches en revue, tokens totaux, latence
Agents multi-étapes avec outilsTester 3.8 en challengerGoogle met en avant les benchmarks agentiques ; l'effet sur les tool calls en production est inconnuAppels valides, étapes échouées, retries, taux de complétion
Analyse de documents et de graphiquesTest côte à côteLes deux ont le même contexte et les mêmes modalitésExactitude des citations, erreurs d'extraction, tokens de sortie
Pipeline de classification stableGarder 3.7 comme contrôleGoogle recommande 3.7 quand l'efficacité de calcul est la prioritéDérive, coût pour 1 000 labels acceptés, latence p95
Résumé à gros volumeGarder le modèle actuel comme contrôleAucun résultat publié par EvoLink n'établit un avantage pour 3.8Qualité de compression, longueur de sortie, taux de relecture
Trafic de production mixteRouter les deuxUn seul modèle par défaut convient rarement à toutes les tâchesAcceptation par route, dépense, fréquence de fallback

Le tableau répartit les candidats au test ; il ne prédit pas de gagnant. Gardez le modèle de production actuel comme contrôle jusqu'à ce que le challenger franchisse des seuils prédéfinis d'acceptation, de coût et de latence.

La métrique qui compte : le coût par tâche acceptée

Le prix du token n'est qu'un terme du coût de production. Utilisez un calcul par modèle de ce type :

coût par tâche acceptée = (dépense totale du modèle + dépense des retries + coût de la relecture humaine) / tâches acceptées

EvoLink n'a pas publié de comparaison de charge contrôlée montrant que 3.8 Flash réduit les retries, le travail de relecture ou le coût total par tâche. La formule ci-dessus est une méthode d'évaluation, pas un résultat mesuré. Les faits publiés par Google — précision supérieure et consommation de tokens supérieure — n'établissent pas quel modèle est le moins cher pour une tâche de production menée à terme.

Suivez au minimum :

  • le taux de résultats acceptés et la réussite au premier passage ;
  • les tokens d'entrée, de sortie et de thinking pour la tâche entière, retries compris ;
  • les tokens lus en cache et le taux de hit de cache ;
  • les tool calls valides versus rejetés ;
  • le délai jusqu'à un résultat accepté ;
  • les minutes de correction humaine ;
  • la fréquence des fallbacks et des rollbacks.

Une évaluation 3.8 vs 3.7 reproductible

Boucle d'évaluation en production comparant résultats acceptés, consommation de tokens, retries et voies de rollback
Boucle d'évaluation en production comparant résultats acceptés, consommation de tokens, retries et voies de rollback
  1. Gelez un jeu représentatif. Utilisez des tâches réelles, sans données sensibles, couvrant les cas faciles, médians et sujets à l'échec. Cinquante tâches peuvent révéler des régressions évidentes ; une promotion en production mérite un jeu plus large.
  2. Gardez le contrat constant. Utilisez des instructions système, des outils, des schémas, un contexte, un budget de sortie et un niveau de thinking identiques. Commencez par medium, sauf raison précise de tester un autre niveau.
  3. Démarrez une session propre. Ne réutilisez ni contenu mis en cache ni état propre à un modèle quand vous changez de modèle. Mélanger les états peut fausser la comparaison.
  4. Notez l'acceptation, pas le style. Définissez des tests exécutables, des contrôles d'extraction, des règles de citation ou des grilles de relecture avant de voir les résultats.
  5. Chiffrez la boucle complète. Incluez la sortie de raisonnement, les retries, les appels de fallback et le temps de relecture — pas seulement la première réponse.
  6. Canary avant de changer le défaut. Envoyez une petite tranche de trafic observable vers 3.8 et gardez un rollback vers 3.7 en un seul changement.

Écrivez les seuils de promotion avant le test. Par exemple : aucune hausse significative des erreurs critiques, une amélioration définie du taux de tâches acceptées, et une hausse maximale tolérée du coût par tâche acceptée et de la latence p95.

Checklist de migration et de rollback

Un changement de modèle au sein d'une même famille doit tout de même être traité comme une mise en production qui change le comportement.

  • Changez la valeur model de l'API de gemini-3.7-flash à gemini-3.8-flash ; n'utilisez pas le slug de page gemini-3-8-flash comme ID de modèle.
  • Auditez les anciens clients : contrôles de thinking mutuellement exclusifs, contrôles d'échantillonnage ignorés et valeurs hors plage.
  • Mappez le thinking minimal vers un niveau pris en charge et testé — en général low — plutôt que de supposer silencieusement l'équivalence.
  • Revalidez les schémas de sortie structurée et de réponse de fonction.
  • Invalidez les caches de prompt propres à un modèle et démarrez les sessions de comparaison proprement.
  • Enregistrez l'ID du modèle, la route, le niveau de thinking, les catégories de tokens, la latence, le nombre de retries et le résultat d'acceptation.
  • Gardez 3.7 configuré en fallback explicite jusqu'à ce que 3.8 ait passé la fenêtre d'observation.
Avec EvoLink, les équipes peuvent garder Gemini 3.8 Flash et Gemini 3.7 Flash derrière une seule intégration API et changer la valeur model à chaque requête. La valeur opérationnelle, c'est une sélection et un rollback maîtrisés, pas la promesse que chaque requête obtienne le coût le plus bas possible.

Qui devrait tester 3.8 dès maintenant ?

Lancez un test challenger contrôlé de 3.8 si les capacités de coding, d'agents ou d'analyse de documents mises en avant par Google correspondent à un besoin d'évaluation actuel, et si vous collectez déjà la télémétrie de tokens, de latence et d'acceptation. C'est une recommandation de test, pas une conclusion de mise à niveau.
Restez sur 3.7 pour l'instant si la charge est stable et à gros volume, si la qualité passe déjà la barre, si l'efficacité de calcul est une contrainte principale, ou si votre équipe ne peut pas tenir une vraie fenêtre de régression et de canary.
N'envisagez le routage par charge de travail qu'après évaluation. Gardez chaque route existante comme contrôle, promouvez 3.8 uniquement pour les classes de tâches où il franchit des seuils écrits, et conservez une voie de rollback. Consultez le comparatif des modèles Gemini pour l'ensemble de la famille et le guide d'intégration de Gemini 3.8 Flash pour des exemples de requêtes et les contrôles de déploiement.

Les erreurs de comparaison les plus fréquentes

  • Qualifier 3.8 de « moins cher » parce que le tarif de lancement est inférieur à un futur tarif standard. La date de comparaison et la période tarifaire doivent être précisées.
  • Assimiler un prix par token identique à un coût par tâche identique.
  • Comparer le thinking high sur 3.8 avec medium ou low sur 3.7.
  • Réutiliser un cache propre à un modèle entre les variantes.
  • Présenter des gains de benchmark comme des gains applicatifs garantis.
  • Mesurer la qualité des réponses en ignorant les retries, le temps de relecture et les échecs d'outils.
  • Remplacer le modèle de production par défaut sans seuil de rollback.

FAQ

Gemini 3.8 Flash est-il meilleur que Gemini 3.7 Flash ?

Les éléments publiés ne désignent aucun vainqueur global. Google rapporte une précision supérieure pour 3.8 Flash, en particulier sur les benchmarks de coding et agentiques mis en avant, et documente aussi une consommation de tokens supérieure. EvoLink n'a pas publié de résultats de charge contrôlés qui transformeraient ces faits en conclusion au niveau de la tâche.

Gemini 3.8 Flash est-il plus cher que 3.7 Flash ?

Leurs tarifs de lancement Google par token sont identiques jusqu'au 31 décembre 2026. Une tâche sur 3.8 peut malgré tout coûter plus cher si elle consomme plus de tokens de sortie ou de thinking. Les tarifs de votre compte EvoLink sont à vérifier dans l'affichage des prix en direct.

Que deviennent les tarifs en 2027 ?

Google affiche des tarifs standard à partir du 1er janvier 2027 : $1.50 par million de tokens en entrée, $7.50 par million de tokens en sortie et $0.15 par million de tokens lus en cache. Revérifiez les tarifs de Google et d'EvoLink avant cette date.

Les deux modèles ont-ils des fenêtres de contexte différentes ?

Non. Google documente pour les deux une limite d'entrée de 1 048 576 tokens et une sortie maximale de 65 536 tokens.

Gemini 3.8 Flash prend-il en charge le thinking minimal ?

Non. Les valeurs prises en charge sont low, medium et high, avec medium par défaut. La référence de l'API native d'EvoLink indique qu'un minimal non pris en charge est automatiquement rétrogradé vers low : définissez donc low explicitement plutôt que de compter sur la rétrogradation.

Puis-je réutiliser le contenu mis en cache en passant de 3.7 à 3.8 ?

Ne partez pas du principe que le contenu mis en cache est portable d'une version de modèle à l'autre. Recréez les caches propres au modèle et démarrez les évaluations de migration avec un état propre.

Dois-je remplacer 3.7 Flash immédiatement ?

Aucun remplacement automatique n'est justifié. Faites un replay et un canary, puis promouvez 3.8 uniquement pour les charges où il franchit des seuils de qualité, de coût et de latence écrits à l'avance.

Oui. Le catalogue produit d'EvoLink comprend les deux routes derrière son API unifiée. Gardez la sélection du modèle explicite, vérifiez l'accès et les tarifs en direct dans votre compte, et conservez 3.7 comme voie de rollback pendant la fenêtre d'évaluation. La documentation de l'API Gemini d'EvoLink liste gemini-3.8-flash dans l'énumération des modèles de l'endpoint natif comme de l'endpoint compatible OpenAI.

Sources et notes de vérification

Faits officiels, tarifs et règles de requête EvoLink revérifiés le 3 septembre 2026. Les descriptions de benchmarks sont celles du fournisseur sauf mention contraire explicite ; les résultats en production dépendent de la charge de travail. La documentation d'EvoLink liste gemini-3.8-flash pour les deux endpoints ; l'accès au niveau du compte doit malgré tout être vérifié avant tout déploiement en production.

Prêt à réduire vos coûts IA de 89 % ?

Commencez avec EvoLink dès aujourd'hui et découvrez la puissance du routage intelligent des API.