GPT Image 2.5 Flare & Sunburst sont disponibles sur EvoLinkEssayer GPT Image 2.5

Gemini 3.6 Flash API

Accédez à Gemini 3.6 Flash de Google — aussi recherché sous Gemini 3.6 — via l'API de chat unifiée d'EvoLink. Testez le codage, les agents multi-étapes, l'usage d'outils avant d'intégrer.

GoogleGénération de texteDisponible
à partir de $0.675 / 1M tokens d’entrée$0.750 prix officiel-10%
Documentation API
Raisonnement multimodalAppel d'outilsSortie structuréeCache de promptsChat + Gemini API
Route productionLive
Contexte
1.05M de contexte · 65.5K de sortie max.
Idéal pour
Codage, orchestration d’agents, analyse de documents
Entrée
Texte + images
Sortie
Texte · JSON (sortie structurée) · appels d'outils

Choisir Gemini 3.6 Flash

Le tout dernier modèle de travail de gamme Flash de Google pour un codage économique, des workflows agentiques, le travail de connaissance et le raisonnement multimodal, avec une meilleure efficacité en tokens que Gemini 3.5 Flash et une fenêtre de contexte de 1M tokens.

Gemini 3.6 Flash

Modèle de travail de gamme Flash de Google

Sélectionné
ID du modèle
gemini-3.6-flash
Idéal pour

Codage en production et refactoring full-stack, agents multi-étapes et orchestration, analyse de documents et de graphiques, et charges de travail à fort volume où une meilleure efficacité en tokens réduit le coût par tâche terminée.

Entrée
$0.675 / 1M-10%
45.9 cr / 1M$0.750prix officiel
Lecture cache
$0.068 / 1M-55%
4.6 cr / 1M$0.150prix officiel
Sortie
$3.375 / 1M-10%
229.5 cr / 1M$3.750prix officiel

Tous les tarifs sont par 1M de tokens, en USD et en crédits, et reflètent la tarification actuelle de votre compte.

Tarifs Gemini 3.6 Flash

Estimez le coût d'une requête Gemini 3.6 Flash avant l'intégration. Le calculateur utilise les tarifs actuels de votre compte ; les prix officiels servent de référence.

Calculateur de requête

Saisissez la répartition des tokens d'une requête et le nombre de recherches Google.

Coût estimé par requête

Gemini 3.6 Flash
USD$0.0018
Crédits0.1158

Estimation officielle $0.0020 · économie $0.0003 (11%)

Tokens d'entrée0.0459 cr
Tokens lus en cache0.001 cr
Tokens de sortie0.0689 cr
Recherche Google0 cr

Facturation minimale : 0.01 crédit par requête.

Guide budgétaire

Nombre approximatif de requêtes avec les tokens et les recherches saisis.
Ajouter des crédits
$10
Environ 5872 requêtes

Pour des tests rapides

$50
Environ 29360 requêtes

Pour le développement courant

$100
Environ 58721 requêtes

Pour l'évaluation en production

Tarifs des outils côté serveur

Gemini 3.x facture chaque recherche non vide, même sans sources renvoyées. Une requête peut lancer plusieurs recherches. Les frais de recherche s’ajoutent après application du minimum de facturation des tokens.
  • Recherche Google$0.014/ recherche0.952 cr / recherche

API Gemini 3.6 Flash pour un code et des workflows d’agents économiques

Appelez le nouveau modèle de gamme Flash de Google via l’API unifiée d’EvoLink. Gemini 3.6 Flash améliore le code, le travail de connaissance et le raisonnement multimodal avec une meilleure efficacité des tokens que Gemini 3.5 Flash, ainsi qu’une fenêtre de contexte de 1 048 576 tokens, le cache de prompts, la sortie structurée et l’usage d’outils, à 1,50 $ / 7,50 $ par million de tokens d’entrée / sortie.

Gemini 3.6 Flash est servi sur EvoLink sous l'ID de modèle gemini-3.6-flash via Chat Completions · API native Gemini, avec la même clé API et le même solde que tous les autres modèles. Il offre une fenêtre de contexte de 1.05M et jusqu'à 65.5K tokens de sortie, ainsi que le codage, les agents multi-étapes, l'usage d'outils.

Gemini 3.6 Flash

Spécifications et capacités de Gemini 3.6 Flash

Les chiffres proviennent de la configuration de route EvoLink ; les capacités sont celles que l'API expose aujourd'hui.

Fenêtre de contexte
1.05M tokens
Sortie max.
65.5K tokens
Entrée
Texte + images
Sortie
Texte · JSON (sortie structurée) · appels d'outils
Raisonnement
Effort de raisonnement configurable
Usage d'outils
Appels de fonctions avec séquences d'outils multi-étapes
Cache de prompt
Lectures de cache automatiques à tarif réduit
Outils côté serveur
Recherche Google, facturés par recherche
Protocoles
Chat Completions · API native Gemini
ID du modèle
gemini-3.6-flash

Pourquoi Gemini 3.6 Flash peut traiter ces charges de travail

Gemini 3.6 Flash est le plus utile lorsque une grande fenêtre de contexte, une meilleure efficacité des tokens et des préfixes de prompt réutilisables agissent ensemble. La capacité de contexte seule n’améliore pas une réponse ; la charge a toujours besoin d’éléments pertinents, d’une structure claire et d’un budget de sortie.

Un espace de travail de 1M tokens, pas un objectif à remplir

La fenêtre de 1 048 576 tokens peut garder disponibles code, spécifications et résultats d’outils liés sans découpage excessif. La recherche et la compaction du contexte comptent toujours, car des entrées non pertinentes rivalisent pour l’attention et augmentent le coût de traitement.

Une meilleure efficacité des tokens que 3.5 Flash

Gemini 3.6 Flash vise à terminer des workflows multi-étapes en moins de tours et avec moins de tokens. Moins d’appels au modèle et une sortie moins chère sont la source de l’avantage de coût ; suivez donc le total de tokens par tâche acceptée plutôt que le prix d’une seule requête.

Le cache de prompts est rentable quand les préfixes restent stables

Les consignes de dépôt, les prompts système, les documents de référence et les schémas d’outils offrent la meilleure opportunité de cache lorsque leur ordre reste constant. Des changements fréquents de modèle ou de structure de prompt peuvent forcer un nouveau traitement du long préfixe.

Où Gemini 3.6 Flash gagne sa place dans une pile de modèles en production

Google positionne Gemini 3.6 Flash comme un cheval de bataille : meilleur code, meilleur travail de connaissance et meilleures performances multimodales, avec une efficacité de tokens nettement supérieure à celle de Gemini 3.5 Flash. Il convient surtout au travail de production où un raisonnement suffisamment bon à un coût de tokens plus faible l’emporte sur le paiement d’un niveau premium.

Code et refactorisation économiques

Gemini 3.6 Flash vise le code quotidien, le prototypage et la refactorisation full-stack avec moins de tokens et moins d’appels au modèle que Gemini 3.5 Flash. C’est le modèle d’agent par défaut de Google dans Antigravity. Mesurez les correctifs acceptés et le temps de revue, pas la qualité d’un extrait isolé.

Workflows agentiques et orchestration

Il convient à l’orchestration multi-étapes, à la sélection d’outils, aux sorties structurées et à l’exécution de code, où un coût par appel plus faible se cumule sur de longues exécutions d’agent. Conservez les messages complets de l’assistant, les identifiants d’appel, les arguments et les résultats entre les tours.

Travail de connaissance et raisonnement multimodal

Utilisez-le pour l’analyse de documents, l’interprétation de graphiques et la génération de mises en page web à plusieurs éléments sur un contexte de 1M tokens. La recherche d’information et la structure documentaire comptent toujours : une fenêtre de 1M ne rend pas utile un contexte non pertinent.

Quand une autre route est le meilleur choix

La classification et l’extraction triviales, sensibles à la latence ou à très gros volume relèvent généralement du moins cher Gemini 3.5 Flash-Lite. Envoyez le raisonnement le plus difficile vers un modèle Pro. Ne passez à 3.6 Flash que lorsque son efficacité réduit réellement le coût par tâche acceptée.

Ce que suggèrent les premières réactions à Gemini 3.6 Flash — et ce qui reste à prouver

Gemini 3.6 Flash est sorti le 2026-07-21. Traitez les réactions de la communauté du jour du lancement comme des hypothèses à vérifier sur vos propres tâches, outils, budgets et critères d’acceptation, et non comme des benchmarks établis.

L’efficacité des tokens et un coût de sortie plus bas sont l’argument principal

Les pages d’API de Google et de tiers mettent en avant moins de tokens, moins d’appels au modèle et moins de circonvolutions, avec une sortie à 7,50 $ par million contre 9,00 $ pour Gemini 3.5 Flash. Sur la même charge, cela peut réduire le coût par tâche terminée même à qualité comparable.

C’est un cheval de bataille de gamme Flash, pas un modèle d’ingénierie haut de gamme

Une partie des discussions du lancement le place derrière de plus grands modèles de pointe sur les benchmarks difficiles d’ingénierie logicielle. Si votre travail est de la refactorisation profonde de dépôts ou du code autonome prolongé, comparez-le à un modèle Pro ou premium avant d’en faire le choix par défaut.

Vérifiez la discipline de sortie et le formatage sur vos prompts

Certains premiers utilisateurs signalent des réponses verbeuses ou trop formatées sur certaines tâches. Contrôlez la longueur des réponses, le respect des instructions et la discipline d’appel d’outils sur des prompts représentatifs pour que la verbosité n’augmente pas discrètement le coût de sortie.

C’est un modèle Google fermé, accessible uniquement par API

Gemini 3.6 Flash n’a pas de poids ouverts et ne peut pas être auto-hébergé. L’accès se fait via l’API Gemini et des plateformes comme Google AI Studio, Antigravity et des passerelles unifiées comme EvoLink : routez donc selon le coût et la fiabilité, pas selon un déploiement local.

Deux façons d'utiliser Gemini 3.6 Flash : API EvoLink ou Agent

Utilisez l'API EvoLink pour les backends produit et les traitements par lots, ou appelez Gemini 3.6 Flash depuis Codex, Claude ou Gemini pour vos workflows de code et d'analyse. Les deux voies partagent la même clé API EvoLink, le même solde, le même ID de modèle et le même historique de requêtes.

Option 1

Intégrer avec l'API EvoLink

Idéal pour : backends produit, traitements par lots, pipelines automatisés

Envoyez à EvoLink des requêtes Chat Completions compatibles OpenAI (ou Anthropic Messages) et contrôlez l'ID de modèle, le prompt système, le budget de sortie, les outils et la sortie structurée.

  1. 1Créez une clé API EvoLink dans la console
  2. 2Pointez votre SDK OpenAI ou Anthropic vers l'URL de base EvoLink et sélectionnez l'ID de modèle affiché ci-dessus
  3. 3Envoyez une requête représentative et lisez le champ usage pour les tokens d'entrée, en cache et de sortie
  4. 4Définissez max_tokens et les réessais par tâche ; conservez les ID et résultats des appels d'outils entre les tours
Option 2

L'appeler avec un Agent

Idéal pour : tâches de code, de revue et d'analyse dans Codex, Claude et Gemini

Donnez à l'Agent la tâche, les entrées à inclure et les critères d'acceptation. Il assemble la requête, appelle Gemini 3.6 Flash via EvoLink et renvoie la réponse avec la consommation de tokens.

  1. 1Définissez EVOLINK_API_KEY dans votre environnement local ; jamais dans le code ni dans un prompt
  2. 2Décrivez la tâche, les entrées à inclure et le format de sortie attendu
  3. 3Demandez à l'Agent d'appeler Gemini 3.6 Flash via EvoLink et d'afficher la requête avant l'envoi
  4. 4Laissez l'Agent rapporter la réponse, la consommation de tokens et tout corps d'erreur

Exemple de code API Gemini 3.6 Flash et gestion des erreurs

Cet exemple montre la requête exécutable la plus courte : un appel Chat Completions compatible OpenAI avec un prompt système, un message utilisateur et un budget de sortie. Ouvrez l'onglet API pour la référence complète des paramètres et réponses.

Voir la documentation API complète
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.6-flash",
    "messages": [
      { "role": "system", "content": "You are a precise assistant. Answer in JSON when asked." },
      { "role": "user", "content": "Classify the sentiment of each review below and return a JSON array:\n<reviews>" }
    ],
    "max_tokens": 1024,
    "temperature": 0.1
  }'

# The Gemini native API is available with the same model ID; see the docs
# for the request shape.
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens).

Requête invalide ou paramètre non pris en charge

Vérifiez l'ID de modèle, le tableau messages et les plages de paramètres dans la référence API ; retirez les champs que cette route ne prend pas en charge.

Problème d'authentification ou de solde

Vérifiez le jeton Bearer Authorization et confirmez le solde disponible dans la console.

Longueur de contexte dépassée

Les tokens du prompt dépassent la fenêtre de contexte de Gemini 3.6 Flash. Réduisez ou ne récupérez que les éléments pertinents et réutilisez les préfixes en cache.

Limite de débit (429)

Attendez et réessayez avec un délai aléatoire ; regroupez ou mettez en file d'attente les requêtes au lieu de rafales parallèles.

Contenu ou appel d'outil rejeté

Vérifiez le contenu sensible, les arguments d'appel d'outil mal formés et les écarts de schéma JSON avant de réessayer.

Ce qu’il faut vérifier avant d’envoyer du trafic de production vers Gemini 3.6 Flash

Une charge adaptée peut tout de même échouer parce que l’intégration utilise le mauvais identifiant, envoie des paramètres non pris en charge ou perd l’état de l’agent entre les tours. Vérifiez la surface de requête et le contrat conversationnel avant d’évaluer la qualité du modèle.

01

Utiliser l’ID de modèle exact gemini-3.6-flash

Envoyez model "gemini-3.6-flash" (avec des points) sur la route de l’API EvoLink. La forme avec tirets gemini-3-6-flash n’est que l’URL de la page, pas le paramètre de modèle de l’API.

ID modèle
02

Utiliser OpenAI Chat Completions ou l’API native Gemini

EvoLink expose Gemini 3.6 Flash via /v1/chat/completions compatible OpenAI et le point de terminaison natif Gemini generateContent. Utilisez la même clé API EvoLink pour l’un ou l’autre protocole.

Protocoles
03

Tenir compte des changements de paramètres non rétrocompatibles

Les valeurs personnalisées de temperature, top-K et top-P sont ignorées ; les pénalités personnalisées de frequency et presence renvoient une erreur ; et une requête dont le dernier tour a le rôle model est rejetée. Adaptez en conséquence les anciens constructeurs de requêtes Gemini.

Migration
04

Renvoyer l’état complet de l’assistant et des outils

Les agents multi-tours doivent conserver les messages complets de l’assistant, les identifiants d’appel, les arguments et les résultats. Ne garder que le texte final rompt la continuité de l’état et peut faire échouer des étapes ultérieures même si la fenêtre de contexte est assez grande.

État des outils

Mise en cache des prompts pour les contextes longs répétés

Les lectures automatiques du cache bénéficient d'un tarif réduit dédié lorsque des instructions de dépôt stables, des documents de référence et des schémas d'outils peuvent être réutilisés.

Contexte de 1M tokens avec une limite de sortie par défaut de 65K

Gardez le code, les spécifications, les documents et l'état de l'agent liés dans un même contexte de travail. Considérez la limite comme une capacité, pas comme un objectif : récupérez les éléments pertinents et fixez des budgets de sortie adaptés à la tâche.

Comparez le coût par tâche acceptée de Gemini 3.6 Flash, pas seulement le prix du token

Gemini 3.6 Flash l’emporte sur le plan économique lorsque son efficacité réduit les tokens, les appels au modèle, les reprises ou le retravail humain sur la même charge. Évaluez des lots de tâches identiques au lieu de comparer des prix de prompts isolés.

Réussite au premier essaiTaux de livrables acceptésNombre de reprisesTokens de sortieTaux de cacheAppels d’outils validesTemps jusqu’au résultat acceptéCorrection humaine et fallback

Si Gemini 3.6 Flash produit des résultats exploitables avec moins de tokens et moins d’effort de revue, ses tarifs plus bas se cumulent en un véritable avantage de coût. Si la qualité fléchit sur vos tâches les plus difficiles, faites-les remonter vers un modèle Pro et gardez 3.6 Flash pour la majorité efficace.

Comparer Gemini 3.6 Flash aux principaux modèles à long contexte après les tests de charge

EvoLink

Vérifiez d’abord si Gemini 3.6 Flash réduit les reprises et la revue. Comparez ensuite prix, contexte, cache et adéquation à la charge de travail.

Gemini 3.6 Flash
Entrée / sortie$0.675 / $3.375
Contexte1.05M
CacheLectures automatiques du cache
Idéal pourCodage en production et refactoring full-stack, agents multi-étapes et orchestration, analyse de documents et de graphiques, et charges de travail à fort volume où une meilleure efficacité en tokens réduit le coût par tâche terminée.
Gemini 3.5 Flash Lite
Entrée / sortie$0.271 / $2.25
Contexte1.05M
CacheCache de contexte
Idéal pourLa route 3.5 la moins chère et la plus rapide pour la classification, l’extraction et les sous-agents à haut débit ; faites remonter le travail difficile vers 3.6 Flash.
Gemini 3.1 Pro
Entrée / sortie$1.865 / $11.183
Contexte1.05M
CacheCache de contexte
Idéal pourPassez au niveau Pro lorsqu’une tâche exige un raisonnement plus profond que ce que la ligne Flash peut offrir.

Famille de modèles Gemini

Même clé API, même solde : changez de palier sans toucher à l’intégration.

Comparer tous les modèles Gemini
Gemini 3.8 Flash

Gemini 3.8 Flash

La toute dernière génération Flash pour les charges de code, de raisonnement et d’agents plus exigeantes.

Voir le modèle
Gemini 3.7 Flash

Gemini 3.7 Flash

Une génération Flash récente pour un raisonnement solide dans une catégorie rapide et efficace.

Voir le modèle
Gemini 3.5 Flash Lite

Gemini 3.5 Flash Lite

La route 3.5 la moins chère et la plus rapide pour la classification, l’extraction et les sous-agents à haut débit ; faites remonter le travail difficile vers 3.6 Flash.

Voir le modèle

Autres modèles texte sur EvoLink en plus de Gemini 3.6 Flash

GPT-5.6

GPT-5.6

La famille frontière d’OpenAI par paliers (Sol/Terra/Luna) pour arbitrer capacité, latence et coût.

Voir le modèle
Claude Opus 4.8

Claude Opus 4.8

La route premium d’Anthropic pour les agents longs, les revues complexes et les tâches à fort jugement.

Voir le modèle
DeepSeek V4

DeepSeek V4

La route DeepSeek économique à contexte 1M pour les charges de code, de raisonnement et d’agents à fort volume.

Voir le modèle
Kimi K3

Kimi K3

La route de raisonnement à long contexte de Moonshot pour le code à l’échelle d’un dépôt et le multi-document.

Voir le modèle

Pour aller plus loin avec Gemini 3.6 Flash

Date de sortie et déploiement de Gemini 3.6 Flash

Date de sortie et déploiement de Gemini 3.6 Flash

Ce qui est sorti le 21 juillet 2026, l’ID de modèle gemini-3.6-flash, les tarifs officiels et où le modèle est disponible.

Lire le guide
Comparer la famille d’API Gemini

Comparer la famille d’API Gemini

Voyez, avant de router, en quoi 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash et 3.1 Pro diffèrent en prix, contexte et adéquation à la charge.

Lire le guide
API Gemini 3.5 Flash-Lite

API Gemini 3.5 Flash-Lite

La route 3.5 la moins chère et la plus rapide pour la classification, l’extraction et les sous-agents à haut débit ; faites remonter le travail difficile vers 3.6 Flash.

Lire le guide
API Gemini 3.5 Flash

API Gemini 3.5 Flash

Le modèle Flash de génération précédente que 3.6 Flash améliore sur l’efficacité des tokens et le coût de sortie.

Lire le guide
API Gemini 3.1 Pro

API Gemini 3.1 Pro

Passez au niveau Pro lorsqu’une tâche exige un raisonnement plus profond que ce que la ligne Flash peut offrir.

Lire le guide

FAQ de l’API Gemini 3.6 Flash

L’API Gemini 3.6 Flash est-elle disponible via EvoLink ?

Oui. Gemini 3.6 Flash est disponible comme modèle de production avec tarifs en direct et tarifs officiels de secours.

Quel ID de modèle utiliser pour l’API Gemini 3.6 Flash ?

Envoyez le modèle "gemini-3.6-flash" (avec des points). Le format à tirets gemini-3-6-flash n’est que l’URL de la page, pas le paramètre de modèle de l’API.

Quels protocoles et SDK fonctionnent avec Gemini 3.6 Flash ?

Utilisez le point de terminaison Chat Completions compatible OpenAI ou le point de terminaison natif Gemini generateContent avec la même clé API EvoLink. Ce modèle ne propose pas de route Messages API d’Anthropic.

L’API Gemini 3.6 Flash prend-elle en charge 1M de contexte ou seulement 256K ?

La route EvoLink enregistre 1 048 576 tokens. Les limites plus petites proviennent généralement d’une surface produit Gemini particulière ou d’une configuration client, pas du modèle d’API lui-même.

Comment utiliser la fenêtre de contexte de 1M tokens de Gemini 3.6 Flash ?

Gardez ensemble le code, les documents et les résultats d’outils liés, mais utilisez la recherche, des préfixes mis en cache stables et la compaction de contexte plutôt que de remplir la fenêtre par défaut.

En quoi Gemini 3.6 Flash diffère-t-il de Gemini 3.5 Flash et 3.5 Flash-Lite ?

3.6 Flash est le nouveau modèle de travail, avec un meilleur codage et une meilleure efficacité en tokens que 3.5 Flash (sortie à 7,50 $ contre 9,00 $ par 1M). 3.5 Flash-Lite est la route la moins chère et la plus rapide pour la classification et les tâches à haut débit.

Pourquoi Gemini 3.6 Flash coûte-t-il moins cher à exécuter que Gemini 3.5 Flash ?

Il vise moins de tokens et moins d’appels au modèle par tâche, et son prix de sortie est plus bas. Suivez le total de tokens par tâche acceptée, pas seulement le tarif par requête.

Quels changements incompatibles gérer lors de la migration vers Gemini 3.6 Flash ?

Les valeurs personnalisées de temperature, top-K et top-P sont ignorées ; les pénalités personnalisées de frequency et presence renvoient une erreur ; et une requête dont le dernier tour a le rôle de modèle est rejetée.

Comment définir le budget de sortie de Gemini 3.6 Flash ?

Limitez la sortie selon la complexité de la tâche et surveillez à la fois les tokens de raisonnement et de réponse finale. La limite de 65 536 tokens est une capacité, pas un objectif courant.

Gemini 3.6 Flash est-il un bon choix par défaut pour les requêtes en temps réel ou à fort volume ?

Pour la classification et l’extraction les moins chères et à plus faible latence, utilisez Gemini 3.5 Flash-Lite. Utilisez 3.6 Flash lorsque sa qualité de codage et de raisonnement justifie un tarif légèrement plus élevé.

Comment comparer Gemini 3.6 Flash à GPT, Claude, GLM ou DeepSeek ?

Évaluez Gemini 3.6 Flash pour son codage efficace et son économie d’agents, GPT et Claude comme références de capacité de pointe, et GLM ou DeepSeek comme références ouvertes sensibles au coût.

Que doit mesurer une évaluation en production ?

Mesurez réussite au premier essai, livrables acceptés, reprises, tokens de sortie, taux de cache, appels d’outils valides, temps, correction humaine et fallback.