
Gemini 3.7 Flash vs Gemini 3.6 Flash : faut-il migrer ?

La réponse courte
minimal, car ce niveau n'existe plus sur 3.7 — pour ces pipelines, la vraie réponse n'est pas 3.7 mais Gemini 3.5 Flash-Lite.Tout ce qui suit, c'est ce qu'il faut vérifier avant de vous engager.
Ce qui a réellement changé
La migration 3.6 vers 3.7 est-elle transparente ?
Pas tout à fait. Selon la checklist de migration officielle de Google, quatre points cassent :
- Le niveau de thinking
minimaldisparaît. Les niveaux sontlow,medium(par défaut) ethigh. Envoyerminimalà la Gemini API renvoie une erreur. temperature,top_p,top_ketcandidate_countdoivent être retirés des configurations de génération.- Le
thinking_budgetnumérique est remplacé par la chaînethinking_level. - Les tours de modèle pré-remplis doivent être supprimés.
reasoning_effort: "none" ou "minimal" seront rétrogradées vers low au lieu d'échouer : une migration progressive ne cassera donc pas en vol pendant que vous mettez à jour vos points d'appel.Les changements de comportement à tester
Les benchmarks vous disent où un modèle a progressé sur les tâches de quelqu'un d'autre. Voici les changements les plus susceptibles de se manifester sur les vôtres :
minimal, votre nouveau plancher est low. Sur un pipeline de classification à gros volume, cet écart se cumule sur chaque appel : c'est la raison la plus fréquente pour laquelle une charge 3.6 ne devrait pas basculer vers 3.7.Quand rester sur 3.6 Flash est le bon choix
- Vous dépendez du thinking
minimal. Évaluez 3.5 Flash-Lite plutôt que de payer le plancherlowsur chaque appel. - Votre charge est simple, sensible à la latence et à gros volume. Raisonner plus n'est pas gratuit ; une route de gamme Lite l'emporte en général.
- Votre pipeline est validé, gelé, et vous n'avez aucune douleur côté coding ou agents. Sans incitation tarifaire, mettre à jour un système stable ne vous achète guère plus que du travail de revalidation.
- Vous ne pouvez pas vous offrir une fenêtre de régression maintenant. Trois semaines entre deux sorties laissent penser qu'un autre modèle arrive ; regrouper vos validations ne coûte rien.
Une évaluation reproductible

- Gelez une référence. Capturez 50 à 200 requêtes réelles sur 3.6 Flash avec une télémétrie complète : tokens d'entrée, tokens de sortie, tokens de thinking, hits de cache, validité des tool calls, retries et corrections humaines.
- Rejouez-les sur 3.7. Mêmes prompts, mêmes outils, même niveau de thinking (mappez explicitement
minimal→lowpour savoir ce que vous comparez). Une variable à la fois. - Faites tourner 3.7 en challenger. Routez une part du trafic réel et comparez sur le taux de tâches acceptées et le coût total par tâche acceptée — pas sur le prix par requête, identique par définition.
- Fixez à l'avance vos seuils de promotion et de rollback. Décidez quels chiffres feraient de 3.7 votre modèle par défaut et quels chiffres vous feraient revenir en arrière, avant de regarder les résultats.
Les deux modèles restent disponibles au même prix sur les mêmes endpoints : le rollback se résume à un changement d'ID de modèle, sans aucune conséquence commerciale.
Faire tourner les deux sur EvoLink
gemini-3.7-flash pour la part challenger et laissez gemini-3.6-flash servir la production jusqu'à ce que vos seuils soient atteints.FAQ
Gemini 3.7 Flash est-il meilleur que Gemini 3.6 Flash ?
Sur les benchmarks publiés par Google, oui — de la façon la plus nette sur le coding et l'exécution agentique. Ce sont des chiffres fournisseur, et un tracker indépendant a mesuré un taux d'hallucination plus élevé au lancement : vérifiez sur vos propres tâches avant de changer vos valeurs par défaut.
Gemini 3.7 Flash est-il plus cher que 3.6 Flash ?
Non. Les deux partagent la même grille tarifaire, y compris le tarif de lancement jusqu'au 31 décembre 2026. Votre facture peut malgré tout évoluer si 3.7 consomme plus de tokens par tâche, puisque les tokens de thinking sont facturés au tarif de sortie.
Dois-je modifier mon code pour migrer de 3.6 vers 3.7 ?
temperature, top_p, top_k et candidate_count, le remplacement du thinking_budget numérique par la chaîne thinking_level, et la suppression des tours de modèle pré-remplis.Par quoi le niveau de thinking minimal est-il remplacé ?
low est le nouveau plancher sur 3.7 Flash. Pour de la classification et de l'extraction à gros volume sensibles au coût, Gemini 3.5 Flash-Lite est généralement une meilleure route que de payer low sur chaque appel.Faut-il migrer si je ne fais que du chat simple ou de la classification ?
En général non. Les gains se concentrent sur le coding et les agents multi-étapes ; le travail simple à gros volume est mieux servi par un modèle de gamme Lite.
Puis-je utiliser Gemini 3.7 Flash et 3.6 Flash en même temps ?
Oui. Ils partagent les endpoints et la tarification : vous pouvez router une part de trafic vers 3.7 en challenger et faire un rollback en changeant l'ID du modèle.
Gemini 3.6 Flash va-t-il être déprécié ?
Google n'a annoncé aucune date de retrait pour Gemini 3.6 Flash. Le modèle reste disponible au même prix aux côtés de 3.7 Flash.
Combien de temps me reste-t-il avant le changement de prix ?
Les tarifs de lancement s'appliquent aux deux modèles jusqu'au 31 décembre 2026, avec les tarifs standard à partir du 1er janvier 2027 — la décision de migrer et l'échéance tarifaire sont donc indépendantes l'une de l'autre.


