Seedance 2.5 est disponible sur EvoLinkEssayer Seedance 2.5

Gemini 3.8 Flash API

Google-Génération de texte-à partir de $0.675 / 1M tokens d’entrée$1.500 tarif de lancement Google-Disponible
Contexte 1MSortie maximale 65KCache de promptsChat + Gemini API
Documentation API
Route de productionEn ligne
Fournisseur
Google
Modèle
3.8 Flash
Fenêtre de contexte
1 048 576 tokens
Protocoles
Chat + Gemini

Choisir Gemini 3.8 Flash

Le dernier modèle de travail Flash de Google pour le code, les workflows agentiques, le travail de connaissance et le raisonnement multimodal, avec une précision annoncée supérieure à Gemini 3.7 Flash et un contexte de 1M tokens.

Gemini 3.8 Flash

Modèle de travail de gamme Flash de Google

Sélectionné
À partir de $0.675 / 1M tokens d’entrée$1.500 tarif de lancement Googlegemini-3.8-flash
Idéal pour

Code et refactoring full-stack, agents multi-étapes et analyse de documents ou graphiques lorsque la précision accrue justifie la consommation supplémentaire de tokens.

Entrée
$0.675 / 1M-55%
45.9 cr / 1M$1.500tarif de lancement Google
Lecture du cache
$0.068 / 1M-55%
4.6 cr / 1M$0.150tarif de lancement Google
Sortie
$3.375 / 1M-55%
229.5 cr / 1M$7.500tarif de lancement Google

Tarifs de Gemini 3.8 Flash

Estimez le coût d’une requête avec le calculateur interactif et comparez EvoLink au tarif de lancement actuel de Google.

3.8 Flash

Calculateur de tokens

Saisissez la répartition des tokens d’une requête.

Coût estimé

Gemini 3.8 Flash
Tarif actuel
USD$0.0018
Credits0.1158
Tokens d’entrée0.0459 cr
Tokens de lecture cache0.001 cr
Tokens de sortie0.0689 cr

Facturation minimale : 0,01 crédit par requête.

EvoLink vs accès direct à Google

Même répartition de tokens, tarif du groupe par défaut.
-55%
Estimation EvoLink$0.0018
Tarif de lancement Google$0.0038
Économie$0.0021

Guide de budget

Nombre approximatif de requêtes avec la répartition actuelle.
Ajouter des crédits
$10
Environ 5872 requêtes

Pour un test rapide

$50
Environ 29360 requêtes

Pour le développement courant

$100
Environ 58721 requêtes

Pour une évaluation en production

Tarifs du modèle

Gemini 3.8 Flash

Toutes les tailles de contexte
Tokens d’entrée
$0.675 / 1M-55%
45.9 cr / 1M$1.500Tarif de lancement Google
Tokens de lecture cache
$0.068 / 1M-55%
4.6 cr / 1M$0.150Tarif de lancement Google
Tokens de sortie
$3.375 / 1M-55%
229.5 cr / 1M$7.500Tarif de lancement Google

Les montants USD et crédits sont indiqués par million de tokens. Le tarif en direct du backend prime sur ces valeurs de secours.

API Gemini 3.8 Flash pour le code et les workflows d’agents

Appelez le nouveau modèle Flash de Google via l’API unifiée d’EvoLink. Google annonce une précision supérieure à Gemini 3.7 Flash, avec une consommation de tokens plus élevée. Il prend en charge un contexte de 1 048 576 tokens, le cache de prompts, la sortie structurée et les outils, au tarif de lancement Google de 0,75 $ / 3,75 $ par million de tokens d’entrée / sortie jusqu’au 31 décembre 2026.

Gemini 3.8 Flash
Cas d’usage de Gemini 3.8 Flash

Où Gemini 3.8 Flash gagne sa place dans une pile de modèles en production

Google positionne Gemini 3.8 Flash comme un modèle plus précis pour le code, le travail de connaissance et les tâches multimodales, tout en documentant une consommation de tokens supérieure à Gemini 3.7 Flash. Il convient lorsque le meilleur taux de réussite compense ce coût supplémentaire.

Évaluer le code et la refactorisation

Gemini 3.8 Flash vise le code quotidien, le prototypage et la refactorisation full-stack avec une précision annoncée supérieure à Gemini 3.7 Flash, mais une consommation potentiellement plus élevée. Mesurez les correctifs acceptés, le total de tokens et le temps de revue.

Workflows agentiques et orchestration

Google met en avant l’orchestration multi-étapes, la sélection d’outils, les sorties structurées et l’exécution de code. EvoLink n’a pas mesuré le taux d’achèvement ni le coût total de ces workflows ; lors des tests, conservez les messages complets de l’assistant, les identifiants d’appel d’outils, les arguments et les résultats entre les tours.

Travail de connaissance et raisonnement multimodal

Utilisez-le pour l’analyse de documents, l’interprétation de graphiques et la génération de mises en page web à plusieurs éléments sur un contexte de 1M tokens. La recherche d’information et la structure documentaire comptent toujours : une fenêtre de 1M ne rend pas utile un contexte non pertinent.

Quand une autre route est le meilleur choix

Gemini 3.5 Flash-Lite affiche un tarif par token publié plus bas pour la classification et l’extraction à gros volume. N’attribuez pas 3.8 Flash sur la base d’un avantage de coût par tâche supposé ; comparez-le à votre route actuelle selon les mêmes critères d’acceptation.

Preuves officielles du lancement

Ce que Google confirme — et ce qu’EvoLink n’a pas mesuré

Google a publié Gemini 3.8 Flash le 2026-09-02 avec des déclarations au niveau du modèle sur les benchmarks et la consommation de tokens. EvoLink n’a publié aucune étude contrôlée de charge de travail 3.8 contre 3.7 ; cette page n’affirme donc ni moins de reprises, ni des boucles d’agent plus courtes, ni un coût par tâche inférieur.

Même tarif de lancement par token, scores officiels plus élevés

Google affiche les mêmes tarifs de lancement en entrée, en sortie et en lecture de cache pour 3.8 Flash et 3.7 Flash, et rapporte des scores plus élevés pour 3.8 sur les benchmarks de code et d’agents mis en avant. Google documente aussi une consommation de tokens plus élevée ; ces faits n’établissent pas une facture plus basse pour une tâche de production.

Les benchmarks officiels ne sont pas un classement de production entre fournisseurs

Les résultats de lancement de Google décrivent des benchmarks sélectionnés et ne prouvent pas que 3.8 Flash dépasse tous les modèles Pro ou tiers sur votre charge de travail. Cette page ne revendique donc aucun gagnant entre fournisseurs.

La consommation de tokens plus élevée est une réserve officielle

Google indique explicitement que 3.8 Flash améliore la précision tout en utilisant plus de tokens que 3.7 Flash. Les tarifs par token publiés ne suffisent pas à déterminer quel modèle coûte le moins cher pour une tâche achevée.

C’est un modèle Google fermé, accessible uniquement par API

Gemini 3.8 Flash n’a pas de poids ouverts et ne peut pas être auto-hébergé. L’accès se fait via l’API Gemini et des plateformes comme Google AI Studio, Antigravity et des passerelles unifiées comme EvoLink : routez donc selon le coût et la fiabilité, pas selon un déploiement local.

Capacités essentielles

Pourquoi Gemini 3.8 Flash peut traiter ces charges de travail

Gemini 3.8 Flash est le plus utile lorsqu’une grande fenêtre de contexte, une meilleure précision par tâche et des préfixes de prompt réutilisables agissent ensemble. La capacité de contexte seule n’améliore pas une réponse ; la charge a toujours besoin d’éléments pertinents, d’une structure claire et d’un budget de sortie.

Un espace de travail de 1M tokens, pas un objectif à remplir

La fenêtre de 1 048 576 tokens peut garder disponibles code, spécifications et résultats d’outils liés sans découpage excessif. La recherche et la compaction du contexte comptent toujours, car des entrées non pertinentes rivalisent pour l’attention et augmentent le coût de traitement.

Une précision accrue avec plus de tokens

Google documente une précision supérieure et une consommation de tokens plus élevée que Gemini 3.7 Flash. Suivez le coût total par tâche acceptée pour vérifier si les meilleurs résultats compensent les tokens supplémentaires.

Le cache de prompts est rentable quand les préfixes restent stables

Les consignes de dépôt, les prompts système, les documents de référence et les schémas d’outils offrent la meilleure opportunité de cache lorsque leur ordre reste constant. Des changements fréquents de modèle ou de structure de prompt peuvent forcer un nouveau traitement du long préfixe.

Contrôles de production de l’API Gemini 3.8 Flash

Ce qu’il faut vérifier avant d’envoyer du trafic de production vers Gemini 3.8 Flash

Une charge adaptée peut tout de même échouer parce que l’intégration utilise le mauvais identifiant, envoie des paramètres non pris en charge ou perd l’état de l’agent entre les tours. Vérifiez la surface de requête et le contrat conversationnel avant d’évaluer la qualité du modèle.

01

Utiliser l’ID de modèle exact gemini-3.8-flash

Envoyez model "gemini-3.8-flash" (avec des points) sur la route de l’API EvoLink. La forme avec tirets gemini-3-8-flash n’est que l’URL de la page, pas le paramètre de modèle de l’API.

ID modèle
02

Utiliser OpenAI Chat Completions ou l’API native Gemini

EvoLink expose Gemini 3.8 Flash via /v1/chat/completions compatible OpenAI et le point de terminaison natif Gemini generateContent. Utilisez la même clé API EvoLink pour l’un ou l’autre protocole.

Protocoles
03

Tenir compte des changements de paramètres non rétrocompatibles

Pour les requêtes natives EvoLink, Gemini 3.x utilise generationConfig.thinkingConfig.thinkingLevel ; thinkingBudget concerne Gemini 2.5 et les deux contrôles sont mutuellement exclusifs. EvoLink documente que les valeurs personnalisées de temperature et topP n’affectent pas la sortie de Gemini 3.x, que topK est ignoré et que des valeurs de temperature ou topP hors plage renvoient 400. Le dernier tour de la conversation ne doit pas utiliser le rôle model.

Migration
04

Renvoyer l’état complet de l’assistant et des outils

Les agents multi-tours doivent conserver les messages complets de l’assistant, les identifiants d’appel, les arguments et les résultats. Ne garder que le texte final rompt la continuité de l’état et peut faire échouer des étapes ultérieures même si la fenêtre de contexte est assez grande.

État des outils
Économie en production

Aucun gagnant sur le coût par tâche n’a été établi

Les faits vérifiés : 3.8 Flash et 3.7 Flash partagent les mêmes tarifs de lancement par token de Google, tandis que Google indique que 3.8 consomme plus de tokens et atteint une meilleure précision. EvoLink n’a publié aucun résultat contrôlé sur les reprises, les livrables acceptés, les appels d’outils, le temps écoulé ou la revue humaine.

Réussite au premier essaiTaux de livrables acceptésNombre de reprisesTokens de sortieTaux de cacheAppels d’outils validesTemps jusqu’au résultat acceptéCorrection humaine et fallback

Ce sont des critères d’évaluation, pas des résultats observés de Gemini 3.8 Flash. Tant que les mêmes échantillons de production n’ont pas été testés avec les mêmes réglages, n’affirmez pas que 3.8 réduit le coût par tâche acceptée ; choisissez 3.7 ou Flash-Lite lorsque leur prix et leur profil de calcul documentés correspondent déjà à la charge de travail.

Comparer les modèles à long contexte après les tests de charge de travail

EvoLink

Vérifiez si la précision accrue compense la consommation supplémentaire de tokens de Gemini 3.8 Flash. Comparez ensuite prix, contexte, cache et adéquation à la charge.

Gemini 3.8 Flash
Entrée / sortie$0.675 / $3.375
Contexte1M
CacheLectures automatiques du cache
Idéal pourCode et refactoring full-stack, agents multi-étapes et analyse de documents ou graphiques lorsque la précision accrue justifie la consommation supplémentaire de tokens.
Gemini 3.5 Flash Lite
Entrée / sortie$0.3 / $2.5
Contexte1M
CacheCache de contexte
Idéal pourRoute au tarif par token publié plus bas, à comparer pour la classification, l’extraction et les tâches à haut débit.
Gemini 3.1 Pro
Entrée / sortie$1.68 / $10.08
Contexte1M
CacheCache de contexte
Idéal pourRoute de comparaison de niveau Pro pour les tâches exigeant un raisonnement plus poussé que la gamme Flash.

Autres modèles Gemini sur EvoLink

Gemini 3.5 Flash

Gemini 3.5 Flash

Route Flash de classe 3.5 à comparer sur la qualité, la latence et l’usage de tokens.

Voir le modèle
Gemini 3.5 Flash Lite

Gemini 3.5 Flash Lite

Route au tarif par token publié plus bas, à comparer pour la classification, l’extraction et les sous-agents à haut débit.

Voir le modèle
Gemini 3.1 Pro

Gemini 3.1 Pro

Route de comparaison de niveau Pro pour les tâches de raisonnement plus poussé.

Voir le modèle
Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite

Route 3.1 légère à comparer pour les charges à gros volume sensibles au coût.

Voir le modèle

Autres modèles de texte

GPT-5.6

GPT-5.6

Famille de modèles OpenAI à plusieurs niveaux pour comparer capacités, latence et routage par coût.

Voir le modèle
Claude Opus 4.8

Claude Opus 4.8

Modèle Anthropic à comparer sur les agents de code de longue durée et les revues exigeant du jugement.

Voir le modèle
DeepSeek V4

DeepSeek V4

Route de comparaison en modèle ouvert pour les charges de code, de raisonnement et d’agents.

Voir le modèle
Kimi K3

Kimi K3

Route Moonshot à comparer sur le raisonnement à long contexte et le travail multi-documents.

Voir le modèle

Lectures pour les équipes de production

Gemini 3.8 Flash vs Gemini 3.7 Flash

Gemini 3.8 Flash vs Gemini 3.7 Flash

Comparez précision, consommation de tokens, tarifs de lancement et coût par tâche acceptée en production avant de changer votre modèle par défaut.

Lire le guide
Utiliser l’API Gemini 3.8 Flash

Utiliser l’API Gemini 3.8 Flash

Envoyez la première requête, appliquez les règles de migration Gemini 3 et ajoutez télémétrie, canary et contrôles de rollback.

Lire le guide
Comparer la famille d’API Gemini

Comparer la famille d’API Gemini

Voyez, avant de router, en quoi 3.8 Flash, 3.5 Flash-Lite, 3.7 Flash et 3.1 Pro diffèrent en prix, contexte et adéquation à la charge.

Lire le guide
API Gemini 3.5 Flash-Lite

API Gemini 3.5 Flash-Lite

La route 3.5 la moins chère et la plus rapide pour la classification, l’extraction et les sous-agents à haut débit ; faites remonter le travail difficile vers 3.8 Flash.

Lire le guide
API Gemini 3.7 Flash

API Gemini 3.7 Flash

Le modèle Flash de génération précédente, au même tarif : comparez-le avant de basculer le trafic de production vers 3.8 Flash.

Lire le guide
API Gemini 3.1 Pro

API Gemini 3.1 Pro

Passez au niveau Pro lorsqu’une tâche exige un raisonnement plus profond que ce que la ligne Flash peut offrir.

Lire le guide

FAQ de l’API Gemini 3.8 Flash

L’API Gemini 3.8 Flash est-elle disponible via EvoLink ?

Oui. Gemini 3.8 Flash est listé comme modèle de production. La page utilise le tarif backend lorsqu’il est disponible, sinon le tarif de lancement actuel de Google comme comparaison.

Quel ID de modèle utiliser pour l’API Gemini 3.8 Flash ?

Envoyez le modèle "gemini-3.8-flash" (avec des points). Le format à tirets gemini-3-8-flash n’est que l’URL de la page, pas le paramètre de modèle de l’API.

Quels protocoles et SDK fonctionnent avec Gemini 3.8 Flash ?

EvoLink documente Chat Completions compatible OpenAI et le generateContent natif de Gemini sur direct.evolink.ai avec la même clé API, et gemini-3.8-flash figure dans l’énumération de modèles des deux points de terminaison. Confirmez tout de même la route active dans votre compte.

L’API Gemini 3.8 Flash prend-elle vraiment en charge le contexte complet de 1M ?

Oui — la route enregistre 1 048 576 tokens d’entrée selon la documentation de Google. Les limites plus petites proviennent généralement d’une surface produit Gemini particulière ou d’une configuration client, pas du modèle d’API lui-même.

Comment utiliser la fenêtre de contexte de 1M tokens de Gemini 3.8 Flash ?

Gardez ensemble le code, les documents et les résultats d’outils liés, mais utilisez la recherche, des préfixes mis en cache stables et la compaction de contexte plutôt que de remplir la fenêtre par défaut.

En quoi Gemini 3.8 Flash diffère-t-il de Gemini 3.7 Flash et 3.5 Flash-Lite ?

Google affiche les mêmes tarifs de lancement par token pour 3.8 et 3.7, rapporte des scores plus élevés pour 3.8 sur une sélection de benchmarks de code et d’agents, et documente une consommation de tokens plus élevée pour 3.8. Google affiche des tarifs par token plus bas pour 3.5 Flash-Lite ; les résultats par charge de travail restent à tester.

Gemini 3.8 Flash est-il vraiment moins cher à exécuter s’il consomme plus de tokens ?

Les tarifs par token sont identiques à ceux de Gemini 3.7 Flash, mais Google documente une consommation plus élevée avec une précision accrue. Comparez le coût total par tâche acceptée sur votre propre charge de travail au lieu de supposer un coût inférieur par tâche.

Quelles règles de paramètres gérer lors de la migration vers Gemini 3.8 Flash ?

Pour les requêtes natives EvoLink, Gemini 3.x utilise generationConfig.thinkingConfig.thinkingLevel ; thinkingBudget concerne Gemini 2.5 et ne peut pas être combiné avec thinkingLevel. EvoLink documente que les valeurs personnalisées de temperature et topP n’affectent pas la sortie de Gemini 3.x, que topK est ignoré et que des valeurs de temperature ou topP hors plage renvoient 400. Le dernier tour ne doit pas utiliser le rôle model.

Qu’est devenu le niveau de réflexion minimal dans Gemini 3.8 Flash ?

Google documente low, medium (par défaut) et high pour Gemini 3.8 Flash ; minimal n’est pas pris en charge. La référence de l’API native d’EvoLink indique qu’un minimal non pris en charge est automatiquement rétrogradé en low, les requêtes migrées n’échouent donc pas ; définissez tout de même low explicitement pour un contrôle prévisible. Gemini 3.5 Flash-Lite affiche des tarifs par token publiés plus bas et peut rester une route de comparaison pour la classification à fort volume.

Comment les tokens de réflexion de Gemini 3.8 Flash sont-ils facturés ?

Les tokens de réflexion sont facturés au tarif de sortie selon la grille de Google ; un raisonnement verbeux peut donc rendre la facture nettement plus élevée que la réponse visible. Définissez des niveaux de réflexion adaptés à la tâche et surveillez les tokens de raisonnement et de réponse finale.

Gemini 3.8 Flash peut-il analyser la vidéo et l’audio ?

Oui. Le modèle accepte des entrées texte, image, vidéo, audio et PDF et produit du texte, ce qui en fait un choix courant pour la compréhension vidéo et audio. La génération d’image, d’audio et de flux en direct n’est pas prise en charge.

Existe-t-il un Gemini 3.7 Pro ?

Non. À la sortie de 3.8 Flash, le modèle Pro le plus récent de Google reste gemini-3.1-pro-preview, et aucun 3.5 ou 3.7 Pro n’a été annoncé sur les canaux officiels.

Combien de temps dure le tarif de lancement de Gemini 3.8 Flash ?

Google affiche $0.75 en entrée et $3.75 en sortie par million de tokens comme tarif de lancement jusqu’au 31 décembre 2026, avec des tarifs standard de $1.50 et $7.50 à partir du 1er janvier 2027. Consultez la section tarifs de cette page pour le tarif EvoLink actuel.

Gemini 3.8 Flash suit-il les instructions de façon plus fiable que 3.7 Flash ?

Google rapporte une précision globale plus élevée et une consommation de tokens plus élevée, mais EvoLink n’a publié aucune comparaison contrôlée du respect des instructions. Testez des tâches représentatives avant de le promouvoir en production.

Que doit mesurer une évaluation en production ?

Mesurez réussite au premier essai, livrables acceptés, reprises, tokens de sortie, taux de cache, appels d’outils valides, temps, correction humaine et fallback.