Gemini 3.5 Flash Lite API
Choisir Gemini 3.5 Flash Lite
Le modèle de classe 3.5 le moins cher et le plus rapide de Google pour la classification, le routage et l’extraction à faible latence ainsi que les sous-agents légers, avec un contexte complet de 1M tokens à $0.30 / $2.50 par 1M tokens.
Gemini 3.5 Flash Lite
Le modèle de classe 3.5 le plus rapide et le plus économique de Google
gemini-3.5-flash-liteClassification et extraction à haut débit, actions en temps réel à faible latence, sous-agents ciblés et charges sensibles au coût où la vitesse et le prix comptent plus que le raisonnement maximal.
Gemini 3.5 Flash Lite pricing
Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.5 Flash Lite rate.
Token calculator
Enter the token mix for one request.Estimated request cost
Gemini 3.5 Flash LiteMinimum charge: 0.01 credits per request.
EvoLink vs Google direct
Same token mix, default group price.Budget guide
Approximate requests using the current token mix.For quick testing
For regular development
For production evaluation
Model pricing
| Model | Context | Input tokens | Cache read tokens | Output tokens |
|---|---|---|---|---|
Gemini 3.5 Flash Litegemini-3.5-flash-lite | All context sizes | $0.271 / 1M-10% 18.4 cr / 1M$0.300official price | $0.028 / 1M-7% 1.9 cr / 1M$0.030official price | $2.250 / 1M-10% 153 cr / 1M$2.500official price |
Gemini 3.5 Flash Lite
All context sizesUSD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.
API Gemini 3.5 Flash Lite pour des charges rapides, économiques et à haut débit
Appelez le modèle de classe 3.5 le moins cher et le plus rapide de Google via l’API unifiée d’EvoLink. Gemini 3.5 Flash Lite est conçu pour la classification, le routage, l’extraction et les sous-agents légers à faible latence — avec une fenêtre de contexte de 1 048 576 tokens, le cache de prompts, la sortie structurée et l’usage d’outils — à $0.30 / $2.50 par million de tokens d’entrée / sortie.
Où Gemini 3.5 Flash Lite mérite sa place dans une pile de modèles de production
Google positionne Gemini 3.5 Flash Lite comme son modèle de classe 3.5 le plus rapide et le plus économique. Il convient surtout au travail à fort volume et sensible à la latence, où le prix bas et la vitesse comptent plus que le raisonnement maximal — et où vous pouvez escalader les rares requêtes difficiles vers un modèle plus grand.
Classification et extraction à haut débit
Gemini 3.5 Flash Lite est conçu pour la classification, le routage et l’extraction JSON à haut débit. À $0.30 / $2.50 par 1M de tokens, vous traitez de gros volumes de requêtes à faible coût là où un modèle premium serait gaspillé.
Échelle à faible latence et sensible au coût
Google annonce environ 350 tokens de sortie par seconde, ce qui convient aux actions d’UI en temps réel, à l’autocomplétion, à la modération et à d’autres chemins critiques en latence. Mesurez le coût et la vitesse par requête, pas les titres des benchmarks.
Sous-agents légers et ciblés
Il convient aux sous-agents qui exécutent des tâches ciblées au sein de systèmes multi-agents plus larges. Il utilise par défaut un raisonnement minimal pour la vitesse ; pour l’usage d’outils en plusieurs étapes, vérifiez que les agents ne s’arrêtent pas trop tôt avant de passer à l’échelle.
Quand escalader vers un modèle plus grand
Le refactoring profond de dépôts, le codage autonome prolongé et le raisonnement difficile en plusieurs étapes relèvent de Gemini 3.6 Flash ou d’un modèle de niveau Pro. Utilisez Flash Lite pour la grande majorité à fort volume et n’escaladez que la minorité difficile.
Ce que suggèrent les premières réactions à Gemini 3.5 Flash Lite — et ce qui reste à prouver
Gemini 3.5 Flash Lite est sorti le 21/07/2026 en remplacement de Gemini 2.5 Flash. Traitez les réactions du lancement comme des hypothèses à vérifier sur vos propres tâches, outils, budgets et critères d’acceptation.
Le rapport prix-performance est le titre
À $0.30 en entrée / $2.50 en sortie par 1M de tokens et environ 350 tokens par seconde, son atout est le débit par dollar. Sur un travail simple et à fort volume, il peut battre des modèles plus chers sur le coût total avec une qualité acceptable.
Il remplace Gemini 2.5 Flash et les charges 3-Flash plus légères
Google le présente comme un remplacement direct de Gemini 2.5 Flash et des tâches Gemini 3 Flash moins complexes. Si vous les utilisez aujourd’hui, réévaluez vos prompts avant de migrer pour que la qualité et le formatage restent dans les tolérances.
Le raisonnement minimal est le défaut — validez les agents multi-étapes
Flash Lite utilise par défaut un raisonnement minimal pour la vitesse et le coût. Google note que le raisonnement minimal peut provoquer un arrêt prématuré des outils sur les tâches multi-étapes ; testez donc l’achèvement des agents avant un déploiement à haut débit.
C’est un modèle Google fermé, uniquement par API
Gemini 3.5 Flash Lite n’a pas de poids ouverts et ne peut pas être auto-hébergé. L’accès se fait via l’API Gemini et des plateformes comme Google AI Studio, ainsi que des passerelles unifiées comme EvoLink — routez selon le coût et la latence, pas selon un déploiement local.
Pourquoi Gemini 3.5 Flash Lite peut traiter ces charges de travail
Gemini 3.5 Flash Lite associe un prix bas et une vitesse élevée à un contexte complet de 1M tokens et au cache de prompts. Ce n’est pas un modèle de raisonnement maximal ; sa valeur est de faire un travail simple, vite et à bas coût, à grande échelle.
Un contexte de 1M tokens sur le niveau le moins cher
La fenêtre de 1 048 576 tokens permet même au modèle de classe 3.5 le moins cher de traiter de longs documents, transcriptions ou journaux en une passe. La recherche et la compression du contexte réduisent encore le coût, car une entrée non pertinente consomme quand même des tokens.
Vitesse et débit plutôt que raisonnement profond
Avec environ 350 tokens de sortie par seconde et un raisonnement minimal par défaut, Flash Lite optimise des réponses rapides et à fort volume. Réservez les configurations et modèles de raisonnement plus lourd aux requêtes qui en ont vraiment besoin.
Le cache de prompts réduit encore le coût
Des prompts système, des instructions et des schémas d’outils stables créent des accès au cache lus au tarif de cache réduit dédié. Gardez l’ordre du préfixe constant pour que les appels répétés à fort volume restent peu coûteux.
Ce qu’il faut vérifier avant d’envoyer du trafic de production vers Gemini 3.5 Flash Lite
Une charge adaptée peut tout de même échouer parce que l’intégration utilise le mauvais identifiant, envoie des paramètres non pris en charge ou suppose un raisonnement profond que les défauts de raisonnement minimal ne fournissent pas. Vérifiez le contrat de requête avant d’évaluer la qualité.
Utiliser l’ID de modèle exact gemini-3.5-flash-lite
Envoyez model "gemini-3.5-flash-lite" (avec un point après 3.5) sur la route de l’API EvoLink. Le gemini-3-5-flash-lite avec tirets n’est que l’URL de la page, pas le paramètre de modèle de l’API.
Utiliser OpenAI Chat Completions ou l’API native Gemini
EvoLink expose Gemini 3.5 Flash Lite via /v1/chat/completions compatible OpenAI et l’endpoint natif generateContent de Gemini. Utilisez la même clé API EvoLink pour l’un ou l’autre protocole.
Tenir compte des changements de paramètres incompatibles
Les valeurs personnalisées de temperature, top-K et top-P sont ignorées ; les valeurs personnalisées de frequency et presence penalty renvoient une erreur ; et une requête dont le dernier tour a le rôle model est rejetée. Adaptez en conséquence les anciens constructeurs de requêtes Gemini.
Valider les agents multi-étapes en raisonnement minimal
Comme Flash Lite utilise par défaut un raisonnement minimal, confirmez que les agents multi-étapes appelant des outils terminent leurs étapes au lieu de s’arrêter trop tôt. Réservez le raisonnement plus difficile à un modèle plus grand plutôt que de sur-ajuster celui-ci.
Comparer le coût par tâche acceptée, pas seulement le prix du token
Gemini 3.5 Flash Lite l’emporte quand son prix bas et sa vitesse franchissent votre seuil de qualité sur un travail à fort volume. Évaluez des lots de tâches identiques et escaladez les requêtes qu’il ne peut pas traiter plutôt que de payer des tarifs premium sur tout le trafic.
Si Gemini 3.5 Flash Lite franchit votre seuil de qualité sur des tâches simples et à fort volume, son tarif bas et sa vitesse en font le défaut de production le moins cher. N’acheminez que les requêtes qu’il échoue vers Gemini 3.6 Flash ou un modèle de niveau Pro.
Comparer les modèles à long contexte après les tests de charge de travail
EvoLinkVérifiez d’abord si Gemini 3.5 Flash Lite réduit les reprises et la revue. Comparez ensuite prix, contexte, cache et adéquation à la charge de travail.
| Modèle | Gemini 3.5 Flash Lite | Gemini 3.6 Flash | Gemini 3.1 Pro |
|---|---|---|---|
| Entrée / sortie | $0.271 / $2.25 | $1.5 / $7.5 | $1.68 / $10.08 |
| Contexte | 1M | 1M | 1M |
| Cache | Lectures automatiques du cache | Cache de contexte | Cache de contexte |
| Idéal pour | Classification et extraction à haut débit, actions en temps réel à faible latence, sous-agents ciblés et charges sensibles au coût où la vitesse et le prix comptent plus que le raisonnement maximal. | Gemini plus grand vers lequel escalader lorsqu’une tâche dépasse la vitesse à pensée minimale de Flash-Lite. | Gemini plus grand vers lequel escalader lorsqu’une tâche dépasse la vitesse à pensée minimale de Flash-Lite. |
Autres modèles Gemini sur EvoLink

Gemini 3.6 Flash
The workhorse to escalate to when a task needs stronger coding or reasoning than the Lite tier provides.
Voir le modèle
Gemini 3.5 Flash
The mid Flash tier between Flash-Lite and the Pro line, balancing cost and capability.
Voir le modèle
Gemini 3.1 Pro
The Pro-tier step up for the deepest reasoning tasks the Flash line is not built to handle.
Voir le modèle
Gemini 3.1 Flash Lite
The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.
Voir le modèleOther text models

GPT-5.6
OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.
Voir le modèle
Claude Opus 4.8
Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.
Voir le modèle
DeepSeek V4
Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.
Voir le modèle
Kimi K3
Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.
Voir le modèleLectures pour les équipes de production

Gemini 3.6 Flash release date & rollout
What launched, the model ID, official pricing, and where the model is available.
Lire le guideFAQ de l’API Gemini 3.5 Flash Lite
L’API Gemini 3.5 Flash Lite est-elle disponible via EvoLink ?
Oui. Gemini 3.5 Flash Lite est disponible comme modèle de production avec tarifs en direct et tarifs officiels de secours.
Quel ID de modèle utiliser pour l’API Gemini 3.5 Flash Lite ?
Envoyez model « gemini-3.5-flash-lite » (avec un point après 3.5). La forme avec tirets gemini-3-5-flash-lite n’est que l’URL de la page, pas le paramètre de modèle de l’API.
Quels protocoles et SDK fonctionnent avec Gemini 3.5 Flash Lite ?
Utilisez l’endpoint Chat Completions compatible OpenAI ou l’endpoint natif generateContent de Gemini avec la même clé API EvoLink. Il n’existe pas de route Anthropic Messages pour ce modèle.
L’API Gemini 3.5 Flash Lite prend-elle en charge 1M de contexte ou seulement 256K ?
La route EvoLink enregistre 1 048 576 tokens. Les limites plus petites proviennent généralement d’une surface produit Gemini particulière ou d’une configuration client, pas du modèle de l’API lui-même.
À quelle vitesse et à quel coût fonctionne Gemini 3.5 Flash Lite ?
C’est le modèle de classe 3.5 le plus rapide et le plus économique de Google : $0.30 en entrée / $2.50 en sortie par 1M tokens, à environ 350 tokens de sortie par seconde. Ce débit par dollar est son principal atout.
À quoi Gemini 3.5 Flash Lite est-il le mieux adapté ?
Classification à haut débit, routage, extraction JSON, actions d’interface à faible latence et sous-agents ciblés. Pour du code approfondi ou du raisonnement difficile, escaladez vers Gemini 3.6 Flash ou un modèle de niveau Pro.
En quoi Gemini 3.5 Flash Lite diffère-t-il de 3.5 Flash et 3.6 Flash ?
Flash Lite est le niveau le moins cher et le plus rapide et utilise par défaut une pensée minimale. 3.5 Flash et 3.6 Flash sont des chevaux de trait plus performants et plus chers pour le code et les agents.
Gemini 3.5 Flash Lite remplace-t-il Gemini 2.5 Flash ?
Google le positionne comme un remplacement de Gemini 2.5 Flash et des charges Gemini 3 Flash moins complexes. Réévaluez vos prompts avant de migrer.
Quels changements cassants dois-je gérer lors de la migration ?
Les valeurs personnalisées de temperature, top-K et top-P sont ignorées ; les valeurs personnalisées de frequency et presence penalty renvoient une erreur ; et une requête dont le dernier tour a le rôle model est rejetée.
Gemini 3.5 Flash Lite est-il un bon choix par défaut pour le temps réel ou le volume élevé ?
Oui, c’est précisément pour cela qu’il est conçu. Il utilise par défaut une pensée minimale pour la vitesse ; validez donc que les agents multi-étapes terminent leurs étapes avant un déploiement à haut débit.
Comment comparer Gemini 3.5 Flash Lite à GPT, Claude, GLM ou DeepSeek ?
Comparez-le à d’autres niveaux bon marché et rapides sur le coût pour 1K requêtes et la latence, pas à des modèles de raisonnement premium. Escaladez vers un modèle plus grand les requêtes qu’il ne peut pas traiter.
Que doit mesurer une évaluation en production de Gemini 3.5 Flash Lite ?
Suivez le coût pour 1K requêtes, les tokens par seconde, la réussite au premier essai, les livrables acceptés, les taux de cache et la fréquence à laquelle les requêtes doivent escalader vers un modèle plus grand.