
Guide Gemini 3.6 Flash : API, Thinking, cas d’usage et production
Gemini 3.6 Flash en bref
| Élément | Information actuelle | Conséquence pour les développeurs |
|---|---|---|
| Statut | GA depuis le 21 juillet 2026 | Prêt pour une évaluation contrôlée en production |
| ID du modèle | gemini-3.6-flash | Ne pas utiliser l’ancien libellé -tiered |
| Contexte d’entrée | 1 048 576 tokens | Toujours limiter résolution et historique |
| Sortie maximale | 65 536 tokens | Définir une limite applicative plus basse si utile |
| Entrées | Texte, image, audio, vidéo, PDF | Compréhension multimodale, pas génération de médias |
| Sortie | Texte | Pas de génération native d’image ou d’audio |
| Thinking par défaut | medium | Commencer par défaut et changer avec des données réelles |
Qu’est-ce que Gemini 3.6 Flash et à qui s’adresse-t-il ?
Il conserve la vitesse et l’inférence scalable de la famille Flash, mais son rôle dépasse le chat rapide. Google met en avant les agents de code, les outils complexes, les documents multimodaux et le raisonnement visuel ou spatial. Il faut donc mesurer s’il réduit les corrections, évite les modifications de code hors sujet, choisit les bons outils et termine une tâche de bout en bout avec moins d’intervention.
Ce n’est pas le choix automatique pour tout. Classification, routage et extraction simple à gros volume peuvent mieux convenir à Flash-Lite. Un modèle Pro peut offrir un plafond de raisonnement supérieur. Image, audio ou voix temps réel exigent des modèles spécialisés.
| Charge | Première route à évaluer | Pourquoi |
|---|---|---|
| Code, débogage, agents multiétapes | Gemini 3.6 Flash | Équilibre raisonnement, outils et efficacité |
| Classification, tags, routage | Classe Flash-Lite | Débit et coût minimal dominent |
| Recherche ou raisonnement difficile | Classe Pro | Le plafond de raisonnement peut primer sur la latence |
| Génération image/audio/voix temps réel | Modèle spécialisé ou Live | 3.6 Flash produit uniquement du texte |
Le public principal comprend développeurs d’applications, ingénieurs agents, équipes plateforme, responsables produit et FinOps. Les métriques sont respectivement compatibilité API, fin des boucles d’outils, rollout/fallback, acceptation utilisateur et coût par tâche acceptée.
Capacités officielles et limites pratiques
La liste de Google décrit le modèle upstream. Les outils Preview comme Computer Use demandent des validations de sécurité, de permissions et de canal ; ils ne valent pas une fonction de texte stable.
| Capacité | Statut officiel | Limite pratique |
|---|---|---|
| Thinking | Pris en charge | Arbitrer qualité, latence et coût |
| Instructions système | Prises en charge | Ne remplacent pas l’autorisation applicative |
| Structured Outputs | Pris en charge | Valider schéma et règles côté serveur |
| Function Calling | Pris en charge | L’application exécute outils, retries et effets |
| Code Execution | Pris en charge | Isoler identifiants et systèmes de production |
| Google Search / Maps | Pris en charge | Vérifier permissions, sources et frais séparés |
| Context Caching | Pris en charge | Mesurer taux de hit et stockage |
| URL Context | Pris en charge | Traiter les pages externes comme non fiables |
| Computer Use | Preview | Isoler et approuver les actions sensibles |
| Live API | Non pris en charge | Employer un modèle Live pour la voix temps réel |
| Fine-tuning | Non pris en charge | Personnaliser via contexte et instructions |
Un même modèle peut exposer des fonctions différentes selon le canal. Vérifiez séparément capacité, transmission, Usage et facturation.
Structure d’une requête : les champs essentiels
| Champ | Requis | Rôle | Note de production |
|---|---|---|---|
contents | Oui | Messages multitours et contenus multimodaux | Finir par l’utilisateur, sans préremplir un tour modèle final |
systemInstruction | Non | Rôle, règles et limites | Aucun secret ni autorité irréversible |
generationConfig | Non | Longueur, Thinking, sortie structurée | Configurer par charge |
tools | Non | Function Calling et Code Execution | Valider arguments et réponses |
safetySettings | Non | Politique de sécurité | Aligner sur le risque produit |
cachedContent | Non | Référence au cache | Suivre hits et coût de stockage |
Une Base URL générique suffit pour comprendre le format natif. Les adresses, l’authentification et les tarifs sont comparés plus loin.
curl "{BASE_URL}/v1beta/models/gemini-3.6-flash:generateContent" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"role":"user","parts":[{"text":"Explique les API idempotentes en trois points."}]}]}'generateContent par streamGenerateContent et ajoutez ?alt=sse pour les Server-Sent Events. Testez les deux chemins : buffering proxy, timeouts et reprise apparaissent souvent en conditions réelles.temperature, topP ou topK comme réglages : Gemini 3.x est optimisé pour son échantillonnage par défaut et peut les ignorer. candidateCount > 1 échoue. Plusieurs candidats exigent des requêtes séparées et observables.Thinking Level : équilibrer qualité, latence et coût
usageMetadata.thoughtsTokenCount et facturés en sortie.medium. Montez à high seulement si les tâches réelles montrent un raisonnement insuffisant. Classification, extraction et routage simple peuvent tester un niveau moindre. Mettre toujours high peut augmenter le premier token, le coût et les actions d’outil inutiles.| Tâche | Niveau initial | Mesure |
|---|---|---|
| Classification, routage, champs fixes | minimal | Latence, schéma, erreurs |
| Q&R documentaire, explication de code | medium | Précision, couverture, coût |
| Débogage, maths, outils multiples | high | Achèvement, corrections, boucles |
| Fonction interactive | Démarrer à medium, puis réduire | P95, acceptation utilisateur |
curl "{BASE_URL}/v1beta/models/gemini-3.6-flash:generateContent" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"role":"user","parts":[{"text":"Trouve la condition de concurrence et propose le plus petit correctif sûr."}]}],"generationConfig":{"thinkingConfig":{"thinkingLevel":"high"},"maxOutputTokens":4096}}'thinkingLevel et l’ancien thinkingBudget ensemble : la requête échoue. Supprimez d’abord le champ legacy, puis comparez selon le coût par tâche réussie.Que journaliser dans les réponses, streams et Usage
candidates[].content.parts, la fin dans finishReason. usageMetadata peut inclure promptTokenCount, candidatesTokenCount, thoughtsTokenCount et totalTokenCount.Journalisez ID/version, début/fin, HTTP, finish reason, tokens d’entrée, de sortie visible et de pensée, outils, retries et acceptation métier. Le KPI utile n’est pas HTTP 200 mais le coût par tâche acceptée.
{
"candidates":[{"content":{"role":"model","parts":[{"text":"..."}]},"finishReason":"STOP"}],
"usageMetadata":{"promptTokenCount":1200,"candidatesTokenCount":480,"thoughtsTokenCount":320,"totalTokenCount":2000},
"modelVersion":"gemini-3.6-flash"
}L’exemple comporte 480 tokens visibles et 320 thought tokens, tous facturés en sortie.
Entrées multimodales et sortie structurée
parts. Utilisez fileData pour un fichier distant et inlineData pour un petit Base64. Le serveur doit valider MIME, taille, permissions et origine d’URL afin d’éviter un accès interne non contrôlé.Images, graphiques et interfaces
Utilisez-les pour extraction, lecture de graphiques, QA visuelle et compréhension d’interface. Précisez région, champs et format. Testez basse résolution, petits libellés et coordonnées ambiguës sur un jeu réel.
PDF et documents longs
Un million de tokens aide pour contrats, rapports, documentation et dépôts, sans remplacer l’architecture de l’information. Demandez des citations, testez le rappel entre sections et mesurez les omissions. Les grandes entrées augmentent latence et coût ; la résolution modifie les tokens.
Compréhension audio et vidéo
Segmentez les médias longs lorsque possible et gardez les informations temporelles. Mesurez rappel d’événements, précision des horodatages et confusion entre montré et dit. Il s’agit de compréhension, pas de génération native.
Exemple de Structured Output
{
"contents":[{"role":"user","parts":[
{"text":"Extrais le fournisseur, la date, la devise et le total de cette facture."},
{"fileData":{"mimeType":"image/jpeg","fileUri":"https://example.com/invoice.jpg"}}
]}],
"generationConfig":{"responseMimeType":"application/json","responseSchema":{"type":"object","properties":{"vendor":{"type":"string"},"date":{"type":"string"},"currency":{"type":"string"},"total":{"type":"number"}},"required":["vendor","date","currency","total"]}}
}Structured Outputs réduit les erreurs de parsing, pas les erreurs factuelles. Vérifiez plages, formats et preuves pour montants, dates et comptes. Contrats et paiements demandent une revue humaine.
Function Calling, Code Execution et workflows d’agents
Une boucle fiable suit cinq étapes : appel structuré proposé, arguments validés, outil exécuté, FunctionResponse correspondante renvoyée, prochaine action ou réponse produite. Conservez ID, outil, arguments, résultat et latence.
Le modèle ne doit pas être un exécutant sans limite. Classez les outils : lecture souvent automatique ; écriture réversible avec idempotence et rollback ; paiement, publication, suppression et permissions avec approbation humaine explicite.
| Risque agent | Contrôle | Métrique |
|---|---|---|
| Boucle infinie | Tours, timeout, plafond de coût | Moyenne/P95 des appels |
| Arguments inventés | JSON Schema, enums, validation serveur | Taux de rejet |
| Modifications hors sujet | Périmètre fichiers, tests, diff | Acceptation du patch, hors-sujet |
| Injection externe | Web et fichiers non fiables | Actions bloquées/non autorisées |
| Écriture dupliquée | Clé d’idempotence, transaction, état | Taux de doublons |
Pour les agents de code, utilisez des tâches réelles : corriger un défaut, exécuter les tests, produire un diff minimal. Mesurez succès au premier passage, tests, corrections, changements hors sujet et coût par patch accepté. Les benchmarks ne sont qu’une hypothèse.
Huit cas d’usage développeur à tester en priorité
| Cas d’usage | Configuration | Métrique d’acceptation | Risque principal |
|---|---|---|---|
| Agent de code | Comparer medium et high | Tests, acceptation du patch | Hors-sujet, corrections |
| Agent multi-outils | Limiter outils, tours et coût | Achèvement, sélection | Doublons, autorité excessive |
| PDF long | Exiger citations et schéma | Précision, omissions | Coût, fausse attribution |
| Images/graphiques | Région, champs, format | Précision champs/localisation | Résolution, erreur visuelle |
| Vidéo/audio | Segmenter et garder le temps | Rappel, horodatage | Croissance des tokens |
| Extraction structurée | Schéma et validation serveur | Conformité, retries | Bon format, mauvais fait |
| Classification/résumé batch | Thinking faible d’abord | Débit, coût/tâche | Sur-raisonnement |
| Fonction utilisateur | Streaming, timeout, fallback | TTFT, P95, acceptation | Pics, variance fournisseur |
Tous sont objectivement mesurables. « La réponse semble bonne » n’est pas un critère ; chaque charge exige métriques automatiques et grille humaine.
Quand ne pas utiliser Gemini 3.6 Flash ?
- Le produit exige la génération native d’image ou d’audio.
- Il dépend d’une Live API pour la voix temps réel.
- Il dépend de Computer Use sans accepter Preview ni approbation humaine.
- Une tâche simple et massive vise uniquement le coût unitaire minimal.
- Paiement, suppression, publication ou action sensible n’a ni validation ni rollback.
- L’équipe n’a pas de jeu d’évaluation réel.
- Le modèle actuel remplit déjà les objectifs et 3.6 Flash n’apporte aucun gain mesurable.
Erreurs API courantes : symptôme, cause et correction
| Symptôme | Cause probable | Correction et vérification |
|---|---|---|
| HTTP 400 | Tour final model prérempli | Supprimer le prefill, finir par utilisateur |
| Sampling sans effet | temperature, topP ou topK | Retirer ; utiliser Thinking et instructions |
| Échec Thinking | thinkingLevel et thinkingBudget ensemble | Garder seulement thinkingLevel |
| Candidats multiples en échec | candidateCount > 1 | Retirer ou mettre 1 |
| Parsing JSON en échec | Le prompt demande seulement « JSON » | Utiliser responseMimeType et responseSchema |
| Trop d’outils | Thinking haut ou règles larges | Réduire niveau, outils et tours |
| Coût inattendu | Thoughts, historique ou retries | Garder Usage et calculer par acceptation |
| Stream coupé | Proxy, timeout, reprise faible | Tester SSE, heartbeat, reconnexion et idempotence |
En cas d’erreur, conservez requête expurgée, statut HTTP, réponse, version et ID avant de créer une reproduction minimale. Modifier les prompts sans télémétrie rend le diagnostic plus difficile et peut continuer la facturation.
Tarifs officiels et coût réel d’une tâche
$1.50 par million de tokens d’entrée et $7.50 par million de sortie. Les thought tokens sont de la sortie. Le tarif catalogue n’est qu’un point de départ.Coût réel d’une tâche
= entrée
+ sortie visible et pensée
+ outils ou grounding
+ cache
+ retries échouésPour 100 000 tokens d’entrée, 6 000 visibles et 4 000 de pensée :
100 000 / 1 000 000 × $1.50
+ 10 000 / 1 000 000 × $7.50
= $0.225Un retry complet peut presque doubler le coût. Comparez le coût par résultat accepté ; réduire appels erronés, modifications hors sujet et corrections humaines peut compter davantage.
De l’évaluation à la production : replay, canary et fallback
- Échantillonner des tâches réelles expurgées, normales, limites et en échec.
- Mesurer qualité, P50/P95, tokens, retries et reprise humaine du modèle actuel.
- Rejouer les mêmes entrées hors ligne avec revue aveugle au modèle.
- Employer le shadow traffic sans renvoyer sa sortie aux utilisateurs.
- Ouvrir un petit canary peu risqué avec seuils d’arrêt automatiques.
- Garder le modèle stable en fallback et tester timeout/erreurs.
- Étendre seulement si coût accepté, latence et sécurité passent ensemble.

| Porte | Condition suggérée |
|---|---|
| Compatibilité | Aucun 4xx inconnu ; réponses structurées/outils parsables |
| Qualité | Acceptation critique au moins égale à la baseline |
| Latence | P95 dans le budget ; récupération des streams |
| Coût | Objectif par tâche acceptée atteint |
| Sécurité | Aucun outil non autorisé ; sensibles approuvés |
| Rollback | Fallback testé sans release applicative |
Accès direct à Google ou agrégateur d’API IA ?
Après validation du modèle, il faut attribuer la complexité d’intégration et d’exploitation. Les deux choix sont valables selon que le système reste exclusivement Gemini et que l’équipe veut maintenir authentification, différences de requêtes, Usage, facturation et migration par fournisseur.
Quand l’accès direct à Google est pertinent
- Le produit utilisera seulement Gemini.
- Permissions, facturation et observabilité sont déjà dans Google Cloud.
- Les outils Preview doivent être disponibles au plus tôt.
- La plateforme peut gérer quotas, erreurs, coûts et reprise.
- Le couplage à l’interface native est acceptable.
Quand un agrégateur d’API IA est pertinent
- Un produit sélectionne un modèle différent par tâche.
- Qualité, latence et coût sont comparés sur le même jeu.
- L’organisation évite comptes, clés et factures séparés.
- Elle veut pouvoir changer lors d’une évolution de modèle, prix ou disponibilité.
- Les nouveaux modèles doivent réutiliser intégration, télémétrie et rollout.
| Domaine | Fournisseur direct | Agrégateur d’API IA |
|---|---|---|
| Nouveau modèle | Construire, valider et déployer séparément | Réutiliser point d’entrée et évaluation |
| Clés API | Distribuées par fournisseur | Gestion centralisée |
| Usage/facturation | Consoles à rapprocher | Appels et dépenses ensemble |
| Comparaison | Construire un adaptateur | Préserver facilement les tests multimodèles |
| Migration | Code métier lié au fournisseur | Moins de changements dans l’accès |
| Nouvelle fonction upstream | Souvent disponible d’abord | Attendre la vérification du passthrough |
Ne choisissez pas selon le nombre de modèles. Vérifiez appel réel, ID/endpoints explicites, streaming stable, thoughts dans Usage, erreurs traçables, prix transparents et limites publiées.
Accéder à Gemini 3.6 Flash avec EvoLink
EvoLink expose le format natif Google. Une application Gemini existante peut commencer en changeant la Base URL et en utilisant l’authentification Bearer.
| Paramètre | Valeur |
|---|---|
| ID du modèle | gemini-3.6-flash |
| Base URL recommandée | https://direct.evolink.ai |
| Base URL de secours | https://api.evolink.ai |
| Authentification | Authorization: Bearer YOUR_API_KEY |
| Endpoint synchrone | /v1beta/models/gemini-3.6-flash:generateContent |
| Endpoint streaming | /v1beta/models/gemini-3.6-flash:streamGenerateContent |
curl "https://direct.evolink.ai/v1beta/models/gemini-3.6-flash:generateContent" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"role":"user","parts":[{"text":"Explique les API idempotentes en trois points."}]}]}'Limites actuelles des capacités EvoLink
| Capacité | Statut de la route | Recommandation |
|---|---|---|
| Thinking | Pris en charge | Utiliser thinkingConfig.thinkingLevel |
| Structured Outputs | Pris en charge | Valider le schéma côté serveur |
| Function Calling | Pris en charge | Conserver ID, arguments et résultat |
| Code Execution | Pris en charge | Isoler et limiter les permissions |
| Context Caching | Pris en charge | Mesurer hits et stockage |
| Search / Maps / URL Context | Documenté comme pris en charge | Tester permissions, résultats et facturation |
| Computer Use | Non pris en charge actuellement | Ne pas supposer le passthrough Preview |
| Live API | Non pris en charge | Choisir une autre route pour la voix temps réel |
Tarif EvoLink : 10 % sous Google Standard
| Élément | Google Standard | EvoLink | Différence par million |
|---|---|---|---|
| Entrée | $1.50 | $1.35 | $0.15 |
| Sortie et Thinking | $7.50 | $6.75 | $0.75 |
$0.2025 via EvoLink. La remise réduit le catalogue ; l’économie réelle exige Usage, retries et acceptation.Checklist sécurité, données et conformité
Gardez les clés côté serveur, classez et minimisez les données, et considérez web, fichiers et outils comme non fiables : ils ne peuvent modifier les règles d’autorisation.
Classez les outils en lecture, écriture réversible ou haut risque. Le haut risque exige approbation et piste d’audit. Les politiques diffèrent aussi : Google indique que le contenu gratuit peut améliorer ses produits, contrairement au niveau payant. Confirmez contrat, région et exigences sectorielles.
FAQ
Gemini 3.6 Flash est-il officiellement disponible ?
Est-il disponible via EvoLink ?
gemini-3.6-flash au format natif. https://direct.evolink.ai est recommandé et https://api.evolink.ai sert de secours.Quel ID de modèle utiliser ?
gemini-3.6-flash, pas le libellé préversion gemini-3.6-flash-tiered.Quelles modalités sont prises en charge ?
Texte, image, audio, vidéo et PDF en entrée, texte en sortie. Pas de génération image/audio ni de Live API.
Quelles sont les limites de contexte et de sortie ?
1 048 576 tokens en entrée et 65 536 en sortie. Résolution et historique affectent encore qualité, latence et coût.
Quel Thinking Level choisir ?
medium, testez minimal pour classification/extraction et high pour code, maths ou outils multiples. Décidez selon achèvement, latence et coût.Les thought tokens sont-ils facturés ?
usageMetadata.thoughtsTokenCount.Pourquoi temperature, topP et topK n’ont-ils pas d’effet ?
Gemini 3.x n’est pas conçu pour ce réglage et la route les ignore. Utilisez instructions, schéma et Thinking.
Pourquoi candidateCount échoue-t-il ?
Plusieurs candidats par requête ne sont pas pris en charge. Une valeur supérieure à 1 échoue ; envoyez des requêtes séparées.
Combien coûte Gemini 3.6 Flash sur EvoLink ?
$1.35 par million en entrée et $6.75 par million en sortie, soit 90 % du prix Google Standard. Thoughts, outils et retries modifient le coût final.EvoLink prend-il en charge Computer Use sur cette route ?
Non. Google le classe Preview, mais la route EvoLink actuelle ne le prend pas en charge.
Faut-il remplacer Gemini 3.5 Flash immédiatement ?
Non. Faites replay, shadow traffic, canary contrôlé et fallback testé. Étendez seulement quand coût, latence et qualité passent ensemble.
Sources et politique de mise à jour
- Google : annonce de Gemini 3.6 Flash
- Google : documentation du modèle Gemini 3.6 Flash
- Google : guide développeur Gemini 3
- Google : tarifs de l’API Gemini
Capacités, prix, routes et paramètres peuvent changer. Avant la production, testez endpoint, Usage, facturation, streaming et erreurs avec vos propres requêtes.


