Kimi K3 est maintenant disponibleDécouvrir Kimi K3

Gemini 3.5 Flash Lite API

Google-Génération de texte-à partir de $0.271 / 1M tokens d’entrée$0.300 tarif officiel-Disponible
Contexte 1MSortie par défaut 65KCache de promptsChat + Gemini API
Documentation API
Production routeLive
Fournisseur
Google
Modèle
Flash Lite
Fenêtre de contexte
1 048 576 tokens
Protocoles
Chat + Gemini

Choisir Gemini 3.5 Flash Lite

Le modèle de classe 3.5 le moins cher et le plus rapide de Google pour la classification, le routage et l’extraction à faible latence ainsi que les sous-agents légers, avec un contexte complet de 1M tokens à $0.30 / $2.50 par 1M tokens.

Gemini 3.5 Flash Lite

Le modèle de classe 3.5 le plus rapide et le plus économique de Google

Sélectionné
À partir de $0.271 / 1M tokens d’entrée$0.300 tarif officielgemini-3.5-flash-lite
Idéal pour

Classification et extraction à haut débit, actions en temps réel à faible latence, sous-agents ciblés et charges sensibles au coût où la vitesse et le prix comptent plus que le raisonnement maximal.

Entrée
$0.271 / 1M-10%
18.4 cr / 1M$0.300tarif officiel
Lecture du cache
$0.028 / 1M-7%
1.9 cr / 1M$0.030tarif officiel
Sortie
$2.250 / 1M-10%
153 cr / 1M$2.500tarif officiel

Gemini 3.5 Flash Lite pricing

Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.5 Flash Lite rate.

Flash Lite

Token calculator

Enter the token mix for one request.

Estimated request cost

Gemini 3.5 Flash Lite
Official rate
USD$0.0010
Credits0.0647
Input tokens0.0184 cr
Cache read tokens0.0004 cr
Output tokens0.0459 cr

Minimum charge: 0.01 credits per request.

EvoLink vs Google direct

Same token mix, default group price.
-10%
EvoLink estimate$0.0010
Google official$0.0011
You save$0.0002

Budget guide

Approximate requests using the current token mix.
Add credits
$10
About 10510 requests

For quick testing

$50
About 52550 requests

For regular development

$100
About 105100 requests

For production evaluation

Model pricing

Gemini 3.5 Flash Lite

All context sizes
Input tokens
$0.271 / 1M-10%
18.4 cr / 1M$0.300official price
Cache read tokens
$0.028 / 1M-7%
1.9 cr / 1M$0.030official price
Output tokens
$2.250 / 1M-10%
153 cr / 1M$2.500official price

USD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.

API Gemini 3.5 Flash Lite pour des charges rapides, économiques et à haut débit

Appelez le modèle de classe 3.5 le moins cher et le plus rapide de Google via l’API unifiée d’EvoLink. Gemini 3.5 Flash Lite est conçu pour la classification, le routage, l’extraction et les sous-agents légers à faible latence — avec une fenêtre de contexte de 1 048 576 tokens, le cache de prompts, la sortie structurée et l’usage d’outils — à $0.30 / $2.50 par million de tokens d’entrée / sortie.

Gemini 3.5 Flash Lite
Cas d’usage de Gemini 3.5 Flash Lite

Où Gemini 3.5 Flash Lite mérite sa place dans une pile de modèles de production

Google positionne Gemini 3.5 Flash Lite comme son modèle de classe 3.5 le plus rapide et le plus économique. Il convient surtout au travail à fort volume et sensible à la latence, où le prix bas et la vitesse comptent plus que le raisonnement maximal — et où vous pouvez escalader les rares requêtes difficiles vers un modèle plus grand.

Classification et extraction à haut débit

Gemini 3.5 Flash Lite est conçu pour la classification, le routage et l’extraction JSON à haut débit. À $0.30 / $2.50 par 1M de tokens, vous traitez de gros volumes de requêtes à faible coût là où un modèle premium serait gaspillé.

Échelle à faible latence et sensible au coût

Google annonce environ 350 tokens de sortie par seconde, ce qui convient aux actions d’UI en temps réel, à l’autocomplétion, à la modération et à d’autres chemins critiques en latence. Mesurez le coût et la vitesse par requête, pas les titres des benchmarks.

Sous-agents légers et ciblés

Il convient aux sous-agents qui exécutent des tâches ciblées au sein de systèmes multi-agents plus larges. Il utilise par défaut un raisonnement minimal pour la vitesse ; pour l’usage d’outils en plusieurs étapes, vérifiez que les agents ne s’arrêtent pas trop tôt avant de passer à l’échelle.

Quand escalader vers un modèle plus grand

Le refactoring profond de dépôts, le codage autonome prolongé et le raisonnement difficile en plusieurs étapes relèvent de Gemini 3.6 Flash ou d’un modèle de niveau Pro. Utilisez Flash Lite pour la grande majorité à fort volume et n’escaladez que la minorité difficile.

Signaux du lancement

Ce que suggèrent les premières réactions à Gemini 3.5 Flash Lite — et ce qui reste à prouver

Gemini 3.5 Flash Lite est sorti le 21/07/2026 en remplacement de Gemini 2.5 Flash. Traitez les réactions du lancement comme des hypothèses à vérifier sur vos propres tâches, outils, budgets et critères d’acceptation.

Le rapport prix-performance est le titre

À $0.30 en entrée / $2.50 en sortie par 1M de tokens et environ 350 tokens par seconde, son atout est le débit par dollar. Sur un travail simple et à fort volume, il peut battre des modèles plus chers sur le coût total avec une qualité acceptable.

Il remplace Gemini 2.5 Flash et les charges 3-Flash plus légères

Google le présente comme un remplacement direct de Gemini 2.5 Flash et des tâches Gemini 3 Flash moins complexes. Si vous les utilisez aujourd’hui, réévaluez vos prompts avant de migrer pour que la qualité et le formatage restent dans les tolérances.

Le raisonnement minimal est le défaut — validez les agents multi-étapes

Flash Lite utilise par défaut un raisonnement minimal pour la vitesse et le coût. Google note que le raisonnement minimal peut provoquer un arrêt prématuré des outils sur les tâches multi-étapes ; testez donc l’achèvement des agents avant un déploiement à haut débit.

C’est un modèle Google fermé, uniquement par API

Gemini 3.5 Flash Lite n’a pas de poids ouverts et ne peut pas être auto-hébergé. L’accès se fait via l’API Gemini et des plateformes comme Google AI Studio, ainsi que des passerelles unifiées comme EvoLink — routez selon le coût et la latence, pas selon un déploiement local.

Capacités essentielles

Pourquoi Gemini 3.5 Flash Lite peut traiter ces charges de travail

Gemini 3.5 Flash Lite associe un prix bas et une vitesse élevée à un contexte complet de 1M tokens et au cache de prompts. Ce n’est pas un modèle de raisonnement maximal ; sa valeur est de faire un travail simple, vite et à bas coût, à grande échelle.

Un contexte de 1M tokens sur le niveau le moins cher

La fenêtre de 1 048 576 tokens permet même au modèle de classe 3.5 le moins cher de traiter de longs documents, transcriptions ou journaux en une passe. La recherche et la compression du contexte réduisent encore le coût, car une entrée non pertinente consomme quand même des tokens.

Vitesse et débit plutôt que raisonnement profond

Avec environ 350 tokens de sortie par seconde et un raisonnement minimal par défaut, Flash Lite optimise des réponses rapides et à fort volume. Réservez les configurations et modèles de raisonnement plus lourd aux requêtes qui en ont vraiment besoin.

Le cache de prompts réduit encore le coût

Des prompts système, des instructions et des schémas d’outils stables créent des accès au cache lus au tarif de cache réduit dédié. Gardez l’ordre du préfixe constant pour que les appels répétés à fort volume restent peu coûteux.

Contrôles de production de l’API Gemini 3.5 Flash Lite

Ce qu’il faut vérifier avant d’envoyer du trafic de production vers Gemini 3.5 Flash Lite

Une charge adaptée peut tout de même échouer parce que l’intégration utilise le mauvais identifiant, envoie des paramètres non pris en charge ou suppose un raisonnement profond que les défauts de raisonnement minimal ne fournissent pas. Vérifiez le contrat de requête avant d’évaluer la qualité.

01

Utiliser l’ID de modèle exact gemini-3.5-flash-lite

Envoyez model "gemini-3.5-flash-lite" (avec un point après 3.5) sur la route de l’API EvoLink. Le gemini-3-5-flash-lite avec tirets n’est que l’URL de la page, pas le paramètre de modèle de l’API.

ID modèle
02

Utiliser OpenAI Chat Completions ou l’API native Gemini

EvoLink expose Gemini 3.5 Flash Lite via /v1/chat/completions compatible OpenAI et l’endpoint natif generateContent de Gemini. Utilisez la même clé API EvoLink pour l’un ou l’autre protocole.

Protocoles
03

Tenir compte des changements de paramètres incompatibles

Les valeurs personnalisées de temperature, top-K et top-P sont ignorées ; les valeurs personnalisées de frequency et presence penalty renvoient une erreur ; et une requête dont le dernier tour a le rôle model est rejetée. Adaptez en conséquence les anciens constructeurs de requêtes Gemini.

Migration
04

Valider les agents multi-étapes en raisonnement minimal

Comme Flash Lite utilise par défaut un raisonnement minimal, confirmez que les agents multi-étapes appelant des outils terminent leurs étapes au lieu de s’arrêter trop tôt. Réservez le raisonnement plus difficile à un modèle plus grand plutôt que de sur-ajuster celui-ci.

Agents
Économie en production

Comparer le coût par tâche acceptée, pas seulement le prix du token

Gemini 3.5 Flash Lite l’emporte quand son prix bas et sa vitesse franchissent votre seuil de qualité sur un travail à fort volume. Évaluez des lots de tâches identiques et escaladez les requêtes qu’il ne peut pas traiter plutôt que de payer des tarifs premium sur tout le trafic.

Réussite au premier essaiLivrables acceptésNombre de nouvelles tentativesTokens de sortieTaux de cacheTokens par secondeCoût pour 1 000 requêtesTaux d’escalade vers un modèle plus grand

Si Gemini 3.5 Flash Lite franchit votre seuil de qualité sur des tâches simples et à fort volume, son tarif bas et sa vitesse en font le défaut de production le moins cher. N’acheminez que les requêtes qu’il échoue vers Gemini 3.6 Flash ou un modèle de niveau Pro.

Comparer les modèles à long contexte après les tests de charge de travail

EvoLink

Vérifiez d’abord si Gemini 3.5 Flash Lite réduit les reprises et la revue. Comparez ensuite prix, contexte, cache et adéquation à la charge de travail.

Gemini 3.5 Flash Lite
Entrée / sortie$0.271 / $2.25
Contexte1M
CacheLectures automatiques du cache
Idéal pourClassification et extraction à haut débit, actions en temps réel à faible latence, sous-agents ciblés et charges sensibles au coût où la vitesse et le prix comptent plus que le raisonnement maximal.
Gemini 3.6 Flash
Entrée / sortie$1.5 / $7.5
Contexte1M
CacheCache de contexte
Idéal pourGemini plus grand vers lequel escalader lorsqu’une tâche dépasse la vitesse à pensée minimale de Flash-Lite.
Gemini 3.1 Pro
Entrée / sortie$1.68 / $10.08
Contexte1M
CacheCache de contexte
Idéal pourGemini plus grand vers lequel escalader lorsqu’une tâche dépasse la vitesse à pensée minimale de Flash-Lite.

Autres modèles Gemini sur EvoLink

Gemini 3.6 Flash

Gemini 3.6 Flash

The workhorse to escalate to when a task needs stronger coding or reasoning than the Lite tier provides.

Voir le modèle
Gemini 3.5 Flash

Gemini 3.5 Flash

The mid Flash tier between Flash-Lite and the Pro line, balancing cost and capability.

Voir le modèle
Gemini 3.1 Pro

Gemini 3.1 Pro

The Pro-tier step up for the deepest reasoning tasks the Flash line is not built to handle.

Voir le modèle
Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite

The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.

Voir le modèle

Other text models

GPT-5.6

GPT-5.6

OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.

Voir le modèle
Claude Opus 4.8

Claude Opus 4.8

Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.

Voir le modèle
DeepSeek V4

DeepSeek V4

Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.

Voir le modèle
Kimi K3

Kimi K3

Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.

Voir le modèle

Lectures pour les équipes de production

Gemini 3.6 Flash release date & rollout

Gemini 3.6 Flash release date & rollout

What launched, the model ID, official pricing, and where the model is available.

Lire le guide

FAQ de l’API Gemini 3.5 Flash Lite

L’API Gemini 3.5 Flash Lite est-elle disponible via EvoLink ?

Oui. Gemini 3.5 Flash Lite est disponible comme modèle de production avec tarifs en direct et tarifs officiels de secours.

Quel ID de modèle utiliser pour l’API Gemini 3.5 Flash Lite ?

Envoyez model « gemini-3.5-flash-lite » (avec un point après 3.5). La forme avec tirets gemini-3-5-flash-lite n’est que l’URL de la page, pas le paramètre de modèle de l’API.

Quels protocoles et SDK fonctionnent avec Gemini 3.5 Flash Lite ?

Utilisez l’endpoint Chat Completions compatible OpenAI ou l’endpoint natif generateContent de Gemini avec la même clé API EvoLink. Il n’existe pas de route Anthropic Messages pour ce modèle.

L’API Gemini 3.5 Flash Lite prend-elle en charge 1M de contexte ou seulement 256K ?

La route EvoLink enregistre 1 048 576 tokens. Les limites plus petites proviennent généralement d’une surface produit Gemini particulière ou d’une configuration client, pas du modèle de l’API lui-même.

À quelle vitesse et à quel coût fonctionne Gemini 3.5 Flash Lite ?

C’est le modèle de classe 3.5 le plus rapide et le plus économique de Google : $0.30 en entrée / $2.50 en sortie par 1M tokens, à environ 350 tokens de sortie par seconde. Ce débit par dollar est son principal atout.

À quoi Gemini 3.5 Flash Lite est-il le mieux adapté ?

Classification à haut débit, routage, extraction JSON, actions d’interface à faible latence et sous-agents ciblés. Pour du code approfondi ou du raisonnement difficile, escaladez vers Gemini 3.6 Flash ou un modèle de niveau Pro.

En quoi Gemini 3.5 Flash Lite diffère-t-il de 3.5 Flash et 3.6 Flash ?

Flash Lite est le niveau le moins cher et le plus rapide et utilise par défaut une pensée minimale. 3.5 Flash et 3.6 Flash sont des chevaux de trait plus performants et plus chers pour le code et les agents.

Gemini 3.5 Flash Lite remplace-t-il Gemini 2.5 Flash ?

Google le positionne comme un remplacement de Gemini 2.5 Flash et des charges Gemini 3 Flash moins complexes. Réévaluez vos prompts avant de migrer.

Quels changements cassants dois-je gérer lors de la migration ?

Les valeurs personnalisées de temperature, top-K et top-P sont ignorées ; les valeurs personnalisées de frequency et presence penalty renvoient une erreur ; et une requête dont le dernier tour a le rôle model est rejetée.

Gemini 3.5 Flash Lite est-il un bon choix par défaut pour le temps réel ou le volume élevé ?

Oui, c’est précisément pour cela qu’il est conçu. Il utilise par défaut une pensée minimale pour la vitesse ; validez donc que les agents multi-étapes terminent leurs étapes avant un déploiement à haut débit.

Comment comparer Gemini 3.5 Flash Lite à GPT, Claude, GLM ou DeepSeek ?

Comparez-le à d’autres niveaux bon marché et rapides sur le coût pour 1K requêtes et la latence, pas à des modèles de raisonnement premium. Escaladez vers un modèle plus grand les requêtes qu’il ne peut pas traiter.

Que doit mesurer une évaluation en production de Gemini 3.5 Flash Lite ?

Suivez le coût pour 1K requêtes, les tokens par seconde, la réussite au premier essai, les livrables acceptés, les taux de cache et la fréquence à laquelle les requêtes doivent escalader vers un modèle plus grand.