Seedance 2.5 est disponible sur EvoLinkEssayer Seedance 2.5
Deux routes d’IA lumineuses traversant une passerelle de production sombre
Comparison

Gemini 3.7 Flash vs Gemini 3.6 Flash : faut-il migrer ?

EvoLink Team
EvoLink Team
Product Team
14 août 2026
8 min de lecture

La réponse courte

Gemini 3.7 Flash coûte exactement le même prix que Gemini 3.6 Flash. Aucun argument tarifaire d'un côté comme de l'autre : mêmes tarifs input, output et cache, même contexte de 1,048,576 tokens, mêmes endpoints. La décision en devient inhabituellement nette : vous arbitrez entre effort de migration et capacités, sans aucune ligne budgétaire à défendre.
Migrez si votre charge relève du coding ou des agents multi-étapes, là où les benchmarks publiés par Google montrent les gains les plus nets. Restez sur 3.6 pour l'instant si vous faites de la classification ou de l'extraction à gros volume au niveau de thinking minimal, car ce niveau n'existe plus sur 3.7 — pour ces pipelines, la vraie réponse n'est pas 3.7 mais Gemini 3.5 Flash-Lite.

Tout ce qui suit, c'est ce qu'il faut vérifier avant de vous engager.

Ce qui a réellement changé

Gemini 3.7 Flash n'est pas un nouveau modèle pré-entraîné. La model card de Google le présente comme des améliorations algorithmiques apportées à la base de raisonnement de Gemini 3.6 Flash, livrées trois semaines plus tard. Ce cadrage compte pour une décision de migration : attendez-vous à une dérive de comportement au sein de la même famille, pas à un modèle différent avec d'autres modes de défaillance.
Les gains publiés par Google se concentrent sur trois terrains : le coding de production (FrontierCode), l'ingénierie logicielle à long horizon (DeepSWE) et l'exécution agentique (Terminal-bench, AutomationBench), où le benchmark agentique double quasiment. Les chiffres complets et les réserves d'attribution fournisseur figurent dans l'analyse de la sortie de Gemini 3.7 Flash ; ce sont les chiffres de Google, et aucune réplication indépendante n'existait au lancement.
Ce qui n'a pas changé : le prix, la fenêtre de contexte, l'output maximal, les modalités supportées et les endpoints que vous appelez. Une migration se résume donc surtout à un changement d'ID de modèle et à un peu d'hygiène de paramètres.

La migration 3.6 vers 3.7 est-elle transparente ?

Pas tout à fait. Selon la checklist de migration officielle de Google, quatre points cassent :

  • Le niveau de thinking minimal disparaît. Les niveaux sont low, medium (par défaut) et high. Envoyer minimal à la Gemini API renvoie une erreur.
  • temperature, top_p, top_k et candidate_count doivent être retirés des configurations de génération.
  • Le thinking_budget numérique est remplacé par la chaîne thinking_level.
  • Les tours de modèle pré-remplis doivent être supprimés.
Sur EvoLink, les requêtes qui envoient encore reasoning_effort: "none" ou "minimal" seront rétrogradées vers low au lieu d'échouer : une migration progressive ne cassera donc pas en vol pendant que vous mettez à jour vos points d'appel.

Les changements de comportement à tester

Les benchmarks vous disent où un modèle a progressé sur les tâches de quelqu'un d'autre. Voici les changements les plus susceptibles de se manifester sur les vôtres :

Consommation de tokens par tâche. Une grille tarifaire identique ne veut pas dire une facture identique. Plusieurs retours au lancement ont observé une consommation de tokens par tâche plus élevée sur 3.7 que sur 3.6 — plausible pour un modèle réglé pour raisonner davantage. Comme les tokens de thinking sont facturés au tarif de sortie, un modèle qui réfléchit plus peut coûter plus par tâche à prix par token identique. Mesurez les tokens totaux par résultat accepté, pas par requête.
Votre palier le moins cher vient d'augmenter. Si vous tourniez en minimal, votre nouveau plancher est low. Sur un pipeline de classification à gros volume, cet écart se cumule sur chaque appel : c'est la raison la plus fréquente pour laquelle une charge 3.6 ne devrait pas basculer vers 3.7.
Suivi des instructions et rigueur factuelle. Google annonce une sécurité et un ton comparables à 3.6 Flash. Un tracker indépendant a mesuré un taux d'hallucination plus élevé pour 3.7 au lancement. Ni l'un ni l'autre ne constitue un verdict sur vos prompts : c'est une raison de passer votre propre jeu de régression avant de promouvoir le modèle.
Comportement des boucles d'agent. L'annonce phare, ce sont moins de boucles d'agent en échec et une meilleure récupération quand l'agent se heurte à un blocage. Si vous faites tourner des agents, c'est le changement à instrumenter : comptez les retries, les tool calls invalides et les runs abandonnés, pas seulement la qualité de la réponse finale.

Quand rester sur 3.6 Flash est le bon choix

  • Vous dépendez du thinking minimal. Évaluez 3.5 Flash-Lite plutôt que de payer le plancher low sur chaque appel.
  • Votre charge est simple, sensible à la latence et à gros volume. Raisonner plus n'est pas gratuit ; une route de gamme Lite l'emporte en général.
  • Votre pipeline est validé, gelé, et vous n'avez aucune douleur côté coding ou agents. Sans incitation tarifaire, mettre à jour un système stable ne vous achète guère plus que du travail de revalidation.
  • Vous ne pouvez pas vous offrir une fenêtre de régression maintenant. Trois semaines entre deux sorties laissent penser qu'un autre modèle arrive ; regrouper vos validations ne coûte rien.

Une évaluation reproductible

Parcours sombres d’évaluation en production avec jalons de validation et voie de retour
Parcours sombres d’évaluation en production avec jalons de validation et voie de retour
Le prix étant identique, la seule question qui vaille est de savoir si 3.7 termine vos tâches mieux par token. Quatre étapes :
  1. Gelez une référence. Capturez 50 à 200 requêtes réelles sur 3.6 Flash avec une télémétrie complète : tokens d'entrée, tokens de sortie, tokens de thinking, hits de cache, validité des tool calls, retries et corrections humaines.
  2. Rejouez-les sur 3.7. Mêmes prompts, mêmes outils, même niveau de thinking (mappez explicitement minimallow pour savoir ce que vous comparez). Une variable à la fois.
  3. Faites tourner 3.7 en challenger. Routez une part du trafic réel et comparez sur le taux de tâches acceptées et le coût total par tâche acceptée — pas sur le prix par requête, identique par définition.
  4. Fixez à l'avance vos seuils de promotion et de rollback. Décidez quels chiffres feraient de 3.7 votre modèle par défaut et quels chiffres vous feraient revenir en arrière, avant de regarder les résultats.

Les deux modèles restent disponibles au même prix sur les mêmes endpoints : le rollback se résume à un changement d'ID de modèle, sans aucune conséquence commerciale.

Garder 3.6 et 3.7 côte à côte, c'est tout l'intérêt d'un gateway : une clé, un client, deux IDs de modèle et un interrupteur qu'on peut rebasculer gratuitement. Appelez gemini-3.7-flash pour la part challenger et laissez gemini-3.6-flash servir la production jusqu'à ce que vos seuils soient atteints.
Pages modèle avec tarifs à jour et exemples de code : Gemini 3.7 Flash · Gemini 3.6 Flash · tous les modèles Gemini.

FAQ

Gemini 3.7 Flash est-il meilleur que Gemini 3.6 Flash ?

Sur les benchmarks publiés par Google, oui — de la façon la plus nette sur le coding et l'exécution agentique. Ce sont des chiffres fournisseur, et un tracker indépendant a mesuré un taux d'hallucination plus élevé au lancement : vérifiez sur vos propres tâches avant de changer vos valeurs par défaut.

Gemini 3.7 Flash est-il plus cher que 3.6 Flash ?

Non. Les deux partagent la même grille tarifaire, y compris le tarif de lancement jusqu'au 31 décembre 2026. Votre facture peut malgré tout évoluer si 3.7 consomme plus de tokens par tâche, puisque les tokens de thinking sont facturés au tarif de sortie.

Dois-je modifier mon code pour migrer de 3.6 vers 3.7 ?

Essentiellement l'ID du modèle, plus la suppression de temperature, top_p, top_k et candidate_count, le remplacement du thinking_budget numérique par la chaîne thinking_level, et la suppression des tours de modèle pré-remplis.

Par quoi le niveau de thinking minimal est-il remplacé ?

low est le nouveau plancher sur 3.7 Flash. Pour de la classification et de l'extraction à gros volume sensibles au coût, Gemini 3.5 Flash-Lite est généralement une meilleure route que de payer low sur chaque appel.

Faut-il migrer si je ne fais que du chat simple ou de la classification ?

En général non. Les gains se concentrent sur le coding et les agents multi-étapes ; le travail simple à gros volume est mieux servi par un modèle de gamme Lite.

Puis-je utiliser Gemini 3.7 Flash et 3.6 Flash en même temps ?

Oui. Ils partagent les endpoints et la tarification : vous pouvez router une part de trafic vers 3.7 en challenger et faire un rollback en changeant l'ID du modèle.

Gemini 3.6 Flash va-t-il être déprécié ?

Google n'a annoncé aucune date de retrait pour Gemini 3.6 Flash. Le modèle reste disponible au même prix aux côtés de 3.7 Flash.

Combien de temps me reste-t-il avant le changement de prix ?

Les tarifs de lancement s'appliquent aux deux modèles jusqu'au 31 décembre 2026, avec les tarifs standard à partir du 1er janvier 2027 — la décision de migrer et l'échéance tarifaire sont donc indépendantes l'une de l'autre.

Prêt à réduire vos coûts IA de 89 % ?

Commencez avec EvoLink dès aujourd'hui et découvrez la puissance du routage intelligent des API.