Seedance 2.5 est disponible sur EvoLinkEssayer Seedance 2.5

Gemini 3.7 Flash API

Google-Génération de texte-à partir de $0.675 / 1M tokens d’entrée$1.500 tarif officiel-Disponible
Contexte 1MSortie maximale 65KCache de promptsChat + Gemini API
Documentation API
Production routeLive
Fournisseur
Google
Modèle
3.7 Flash
Fenêtre de contexte
1 048 576 tokens
Protocoles
Chat + Gemini

Choisir Gemini 3.7 Flash

Le tout dernier modèle de travail de gamme Flash de Google pour un codage économique, des workflows agentiques, le travail de connaissance et le raisonnement multimodal, avec une meilleure efficacité en tokens que Gemini 3.6 Flash et une fenêtre de contexte de 1M tokens.

Gemini 3.7 Flash

Modèle de travail de gamme Flash de Google

Sélectionné
À partir de $0.675 / 1M tokens d’entrée$1.500 tarif officielgemini-3.7-flash
Idéal pour

Codage en production et refactoring full-stack, agents multi-étapes et orchestration, analyse de documents et de graphiques, et charges de travail à fort volume où une meilleure efficacité en tokens réduit le coût par tâche terminée.

Entrée
$0.675 / 1M-55%
45.9 cr / 1M$1.500tarif officiel
Lecture du cache
$0.068 / 1M-55%
4.6 cr / 1M$0.150tarif officiel
Sortie
$3.375 / 1M-55%
229.5 cr / 1M$7.500tarif officiel

Gemini 3.7 Flash pricing

Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.7 Flash rate.

3.7 Flash

Token calculator

Enter the token mix for one request.

Estimated request cost

Gemini 3.7 Flash
Official rate
USD$0.0018
Credits0.1158
Input tokens0.0459 cr
Cache read tokens0.001 cr
Output tokens0.0689 cr

Minimum charge: 0.01 credits per request.

EvoLink vs Google direct

Same token mix, default group price.
-55%
EvoLink estimate$0.0018
Google official$0.0038
You save$0.0021

Budget guide

Approximate requests using the current token mix.
Add credits
$10
About 5872 requests

For quick testing

$50
About 29360 requests

For regular development

$100
About 58721 requests

For production evaluation

Model pricing

Gemini 3.7 Flash

All context sizes
Input tokens
$0.675 / 1M-55%
45.9 cr / 1M$1.500official price
Cache read tokens
$0.068 / 1M-55%
4.6 cr / 1M$0.150official price
Output tokens
$3.375 / 1M-55%
229.5 cr / 1M$7.500official price

USD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.

API Gemini 3.7 Flash pour un code et des workflows d’agents économiques

Appelez le nouveau modèle de gamme Flash de Google via l’API unifiée d’EvoLink. Gemini 3.7 Flash améliore le code, le travail de connaissance et le raisonnement multimodal avec une meilleure efficacité des tokens que Gemini 3.6 Flash, ainsi qu’une fenêtre de contexte de 1 048 576 tokens, le cache de prompts, la sortie structurée et l’usage d’outils, au tarif de lancement officiel de Google de 0,75 $ / 3,75 $ par million de tokens d’entrée / sortie (jusqu’au 31 décembre 2026).

Gemini 3.7 Flash
Cas d’usage de Gemini 3.7 Flash

Où Gemini 3.7 Flash gagne sa place dans une pile de modèles en production

Google positionne Gemini 3.7 Flash comme un cheval de bataille : meilleur code, meilleur travail de connaissance et meilleures performances multimodales, avec une efficacité de tokens nettement supérieure à celle de Gemini 3.6 Flash. Il convient surtout au travail de production où un raisonnement suffisamment bon à un coût de tokens plus faible l’emporte sur le paiement d’un niveau premium.

Code et refactorisation économiques

Gemini 3.7 Flash vise le code quotidien, le prototypage et la refactorisation full-stack avec moins de tokens et moins d’appels au modèle que Gemini 3.6 Flash. Il est disponible dans l’environnement d’agents Antigravity de Google. Mesurez les correctifs acceptés et le temps de revue, pas la qualité d’un extrait isolé.

Workflows agentiques et orchestration

Il convient à l’orchestration multi-étapes, à la sélection d’outils, aux sorties structurées et à l’exécution de code, où un coût par appel plus faible se cumule sur de longues exécutions d’agent. Conservez les messages complets de l’assistant, les identifiants d’appel, les arguments et les résultats entre les tours.

Travail de connaissance et raisonnement multimodal

Utilisez-le pour l’analyse de documents, l’interprétation de graphiques et la génération de mises en page web à plusieurs éléments sur un contexte de 1M tokens. La recherche d’information et la structure documentaire comptent toujours : une fenêtre de 1M ne rend pas utile un contexte non pertinent.

Quand une autre route est le meilleur choix

La classification et l’extraction triviales, sensibles à la latence ou à très gros volume relèvent généralement du moins cher Gemini 3.5 Flash-Lite. Envoyez le raisonnement le plus difficile vers un modèle Pro. Ne passez à 3.7 Flash que lorsque son efficacité réduit réellement le coût par tâche acceptée.

Signaux du jour du lancement

Ce que suggèrent les premières réactions à Gemini 3.7 Flash — et ce qui reste à prouver

Gemini 3.7 Flash est sorti le 2026-08-13. Traitez les réactions de la communauté du jour du lancement comme des hypothèses à vérifier sur vos propres tâches, outils, budgets et critères d’acceptation, et non comme des benchmarks établis.

Même tarif que 3.6 Flash, exécution agentique plus solide

Google positionne 3.7 Flash comme le modèle agentique principal de la famille Gemini 3 : Google le présente comme son modèle de travail le plus capable à ce jour pour le code et les agents, avec des progrès nets en génération de code et en exécution terminal, au tarif exactement identique à Gemini 3.6 Flash. Sur la même charge, le gain vient de moins de reprises et de boucles d’agent plus courtes, pas d’un tarif au token plus bas.

C’est un cheval de bataille de gamme Flash, pas un modèle d’ingénierie haut de gamme

Une partie des discussions du lancement le place derrière de plus grands modèles de pointe sur les benchmarks difficiles d’ingénierie logicielle. Si votre travail est de la refactorisation profonde de dépôts ou du code autonome prolongé, comparez-le à un modèle Pro ou premium avant d’en faire le choix par défaut.

Vérifiez la consommation de tokens par tâche sur vos prompts

Certains retours du jour du lancement ont observé une consommation de tokens par tâche plus élevée qu’avec Gemini 3.6 Flash. Contrôlez la longueur des réponses, le respect des instructions et la discipline d’appel d’outils sur des prompts représentatifs pour que le raisonnement supplémentaire n’augmente pas discrètement le coût de sortie.

C’est un modèle Google fermé, accessible uniquement par API

Gemini 3.7 Flash n’a pas de poids ouverts et ne peut pas être auto-hébergé. L’accès se fait via l’API Gemini et des plateformes comme Google AI Studio, Antigravity et des passerelles unifiées comme EvoLink : routez donc selon le coût et la fiabilité, pas selon un déploiement local.

Capacités essentielles

Pourquoi Gemini 3.7 Flash peut traiter ces charges de travail

Gemini 3.7 Flash est le plus utile lorsque une grande fenêtre de contexte, une meilleure efficacité des tokens et des préfixes de prompt réutilisables agissent ensemble. La capacité de contexte seule n’améliore pas une réponse ; la charge a toujours besoin d’éléments pertinents, d’une structure claire et d’un budget de sortie.

Un espace de travail de 1M tokens, pas un objectif à remplir

La fenêtre de 1 048 576 tokens peut garder disponibles code, spécifications et résultats d’outils liés sans découpage excessif. La recherche et la compaction du contexte comptent toujours, car des entrées non pertinentes rivalisent pour l’attention et augmentent le coût de traitement.

Une meilleure efficacité des tokens que 3.6 Flash

Gemini 3.7 Flash vise à terminer des workflows multi-étapes en moins de tours et avec moins de tokens. Moins d’appels au modèle et moins de tokens au total sont la source de l’avantage de coût ; suivez donc le total de tokens par tâche acceptée plutôt que le prix d’une seule requête.

Le cache de prompts est rentable quand les préfixes restent stables

Les consignes de dépôt, les prompts système, les documents de référence et les schémas d’outils offrent la meilleure opportunité de cache lorsque leur ordre reste constant. Des changements fréquents de modèle ou de structure de prompt peuvent forcer un nouveau traitement du long préfixe.

Contrôles de production de l’API Gemini 3.7 Flash

Ce qu’il faut vérifier avant d’envoyer du trafic de production vers Gemini 3.7 Flash

Une charge adaptée peut tout de même échouer parce que l’intégration utilise le mauvais identifiant, envoie des paramètres non pris en charge ou perd l’état de l’agent entre les tours. Vérifiez la surface de requête et le contrat conversationnel avant d’évaluer la qualité du modèle.

01

Utiliser l’ID de modèle exact gemini-3.7-flash

Envoyez model "gemini-3.7-flash" (avec des points) sur la route de l’API EvoLink. La forme avec tirets gemini-3-7-flash n’est que l’URL de la page, pas le paramètre de modèle de l’API.

ID modèle
02

Utiliser OpenAI Chat Completions ou l’API native Gemini

EvoLink expose Gemini 3.7 Flash via /v1/chat/completions compatible OpenAI et le point de terminaison natif Gemini generateContent. Utilisez la même clé API EvoLink pour l’un ou l’autre protocole.

Protocoles
03

Tenir compte des changements de paramètres non rétrocompatibles

Selon la checklist de migration officielle de Google : supprimez les valeurs personnalisées de temperature, top-P, top-K et candidate_count, remplacez le thinking_budget numérique par la chaîne thinking_level et supprimez les tours model préremplis. Adaptez vos anciens constructeurs de requêtes Gemini en conséquence.

Migration
04

Renvoyer l’état complet de l’assistant et des outils

Les agents multi-tours doivent conserver les messages complets de l’assistant, les identifiants d’appel, les arguments et les résultats. Ne garder que le texte final rompt la continuité de l’état et peut faire échouer des étapes ultérieures même si la fenêtre de contexte est assez grande.

État des outils
Économie en production

Comparer le coût par tâche acceptée, pas seulement le prix des tokens

Gemini 3.7 Flash l’emporte sur le plan économique lorsque son efficacité réduit les tokens, les appels au modèle, les reprises ou le retravail humain sur la même charge. Évaluez des lots de tâches identiques au lieu de comparer des prix de prompts isolés.

Réussite au premier essaiTaux de livrables acceptésNombre de reprisesTokens de sortieTaux de cacheAppels d’outils validesTemps jusqu’au résultat acceptéCorrection humaine et fallback

Si Gemini 3.7 Flash produit des résultats exploitables avec moins de tokens et moins d’effort de revue, son efficacité en tokens se cumule en un véritable avantage de coût. Si la qualité fléchit sur vos tâches les plus difficiles, faites-les remonter vers un modèle Pro et gardez 3.7 Flash pour la majorité efficace.

Comparer les modèles à long contexte après les tests de charge de travail

EvoLink

Vérifiez d’abord si Gemini 3.7 Flash réduit les reprises et la revue. Comparez ensuite prix, contexte, cache et adéquation à la charge de travail.

Gemini 3.7 Flash
Entrée / sortie$0.675 / $3.375
Contexte1M
CacheLectures automatiques du cache
Idéal pourCodage en production et refactoring full-stack, agents multi-étapes et orchestration, analyse de documents et de graphiques, et charges de travail à fort volume où une meilleure efficacité en tokens réduit le coût par tâche terminée.
Gemini 3.5 Flash Lite
Entrée / sortie$0.3 / $2.5
Contexte1M
CacheCache de contexte
Idéal pourGemini de gamme Pro pour les tâches de raisonnement les plus profondes que la ligne Flash n’est pas conçue pour traiter.
Gemini 3.1 Pro
Entrée / sortie$1.68 / $10.08
Contexte1M
CacheCache de contexte
Idéal pourGemini de gamme Pro pour les tâches de raisonnement les plus profondes que la ligne Flash n’est pas conçue pour traiter.

Autres modèles Gemini sur EvoLink

Gemini 3.5 Flash

Gemini 3.5 Flash

The previous-generation Flash workhorse that 3.7 Flash improves on for token efficiency and output cost.

Voir le modèle
Gemini 3.5 Flash Lite

Gemini 3.5 Flash Lite

The cheapest, fastest 3.5-class route for classification, extraction, and high-throughput subagents.

Voir le modèle
Gemini 3.1 Pro

Gemini 3.1 Pro

The Pro-tier step up when a task needs deeper reasoning than the Flash line can deliver.

Voir le modèle
Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite

The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.

Voir le modèle

Autres modèles de texte

GPT-5.6

GPT-5.6

OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.

Voir le modèle
Claude Opus 4.8

Claude Opus 4.8

Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.

Voir le modèle
DeepSeek V4

DeepSeek V4

Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.

Voir le modèle
Kimi K3

Kimi K3

Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.

Voir le modèle

Lectures pour les équipes de production

Date de sortie et déploiement de Gemini 3.7 Flash

Date de sortie et déploiement de Gemini 3.7 Flash

Ce qui est sorti le 13 août 2026, l’ID de modèle gemini-3.7-flash, les tarifs officiels et où le modèle est disponible.

Lire le guide
Gemini 3.7 Flash vs Gemini 3.6 Flash

Gemini 3.7 Flash vs Gemini 3.6 Flash

Même tarif, trois semaines d’écart : checklist de migration, changements de comportement à tester et quand rester sur 3.6.

Lire le guide
Comparer la famille d’API Gemini

Comparer la famille d’API Gemini

Voyez, avant de router, en quoi 3.7 Flash, 3.5 Flash-Lite, 3.6 Flash et 3.1 Pro diffèrent en prix, contexte et adéquation à la charge.

Lire le guide
API Gemini 3.5 Flash-Lite

API Gemini 3.5 Flash-Lite

La route 3.5 la moins chère et la plus rapide pour la classification, l’extraction et les sous-agents à haut débit ; faites remonter le travail difficile vers 3.7 Flash.

Lire le guide
API Gemini 3.6 Flash

API Gemini 3.6 Flash

Le modèle Flash de génération précédente, au même tarif : comparez-le avant de basculer le trafic de production vers 3.7 Flash.

Lire le guide
API Gemini 3.1 Pro

API Gemini 3.1 Pro

Passez au niveau Pro lorsqu’une tâche exige un raisonnement plus profond que ce que la ligne Flash peut offrir.

Lire le guide

FAQ de l’API Gemini 3.7 Flash

L’API Gemini 3.7 Flash est-elle disponible via EvoLink ?

Oui. Gemini 3.7 Flash est disponible comme modèle de production avec tarifs en direct et tarifs officiels de secours.

Quel ID de modèle utiliser pour l’API Gemini 3.7 Flash ?

Envoyez le modèle "gemini-3.7-flash" (avec des points). Le format à tirets gemini-3-7-flash n’est que l’URL de la page, pas le paramètre de modèle de l’API.

Quels protocoles et SDK fonctionnent avec Gemini 3.7 Flash ?

Utilisez le point de terminaison Chat Completions compatible OpenAI ou le point de terminaison natif Gemini generateContent avec la même clé API EvoLink. Ce modèle ne propose pas de route Messages API d’Anthropic.

L’API Gemini 3.7 Flash prend-elle vraiment en charge le contexte complet de 1M ?

Oui — la route enregistre 1 048 576 tokens d’entrée selon la documentation de Google. Les limites plus petites proviennent généralement d’une surface produit Gemini particulière ou d’une configuration client, pas du modèle d’API lui-même.

Comment utiliser la fenêtre de contexte de 1M tokens de Gemini 3.7 Flash ?

Gardez ensemble le code, les documents et les résultats d’outils liés, mais utilisez la recherche, des préfixes mis en cache stables et la compaction de contexte plutôt que de remplir la fenêtre par défaut.

En quoi Gemini 3.7 Flash diffère-t-il de Gemini 3.6 Flash et 3.5 Flash-Lite ?

3.7 Flash est au même tarif que 3.6 Flash, mais affiche selon Google des scores officiels plus élevés sur les benchmarks de code et d’agents comme FrontierCode et Terminal-bench. 3.5 Flash-Lite reste la route la moins chère et la plus rapide pour la classification et les tâches à haut débit.

Gemini 3.7 Flash est-il vraiment moins cher à exécuter s’il consomme plus de tokens ?

Les tarifs par token sont identiques à ceux de Gemini 3.6 Flash. Google positionne 3.7 Flash pour terminer les tâches en moins de tours, tandis que certains retours du jour du lancement ont observé une consommation de tokens par tâche plus élevée. Comparez le total de tokens par tâche acceptée sur votre propre charge de travail plutôt que le tarif par requête.

Quels changements incompatibles gérer lors de la migration vers Gemini 3.7 Flash ?

Retirez les valeurs personnalisées de temperature, top-P, top-K et candidate_count des configurations de génération, remplacez le thinking_budget numérique par la chaîne thinking_level et supprimez les tours model préremplis — le tout selon la checklist de migration officielle de Google.

Qu’est devenu le niveau de réflexion minimal dans Gemini 3.7 Flash ?

Google l’a supprimé : les niveaux disponibles sont low, medium (par défaut) et high, et envoyer minimal à l’API Gemini renvoie une erreur. EvoLink rétrograde reasoning_effort none ou minimal vers low pour que les requêtes migrées n’échouent pas. Pour les pipelines de classification à fort volume, Gemini 3.5 Flash-Lite reste le plancher le moins cher.

Comment les tokens de réflexion de Gemini 3.7 Flash sont-ils facturés ?

Les tokens de réflexion sont facturés au tarif de sortie selon la grille de Google ; un raisonnement verbeux peut donc rendre la facture nettement plus élevée que la réponse visible. Définissez des niveaux de réflexion adaptés à la tâche et surveillez les tokens de raisonnement et de réponse finale.

Gemini 3.7 Flash peut-il analyser la vidéo et l’audio ?

Oui. Le modèle accepte des entrées texte, image, vidéo, audio et PDF et produit du texte, ce qui en fait un choix courant pour la compréhension vidéo et audio. La génération d’image, d’audio et de flux en direct n’est pas prise en charge.

Existe-t-il un Gemini 3.7 Pro ?

Non. À la sortie de 3.7 Flash, le modèle Pro le plus récent de Google reste gemini-3.1-pro-preview, et aucun 3.5 ou 3.7 Pro n’a été annoncé sur les canaux officiels.

Combien de temps dure le tarif de lancement de Gemini 3.7 Flash ?

Google affiche $0.75 en entrée et $3.75 en sortie par million de tokens comme tarif de lancement jusqu’au 31 décembre 2026, avec des tarifs standard de $1.50 et $7.50 à partir du 1er janvier 2027. Consultez la section tarifs de cette page pour le tarif EvoLink actuel.

Gemini 3.7 Flash suit-il les instructions de façon plus fiable que 3.6 Flash ?

Google rapporte une sécurité et un ton similaires à 3.6 Flash, tandis qu’un tracker indépendant a mesuré un taux d’hallucination plus élevé au lancement. Vérifiez le respect des instructions et la discipline factuelle sur vos propres tâches représentatives avant de le promouvoir en production.

Que doit mesurer une évaluation en production ?

Mesurez réussite au premier essai, livrables acceptés, reprises, tokens de sortie, taux de cache, appels d’outils valides, temps, correction humaine et fallback.