Gemini 3.5 Flash Lite API
Elegir Gemini 3.5 Flash Lite
El modelo de clase 3.5 más barato y rápido de Google para clasificación, enrutamiento y extracción de baja latencia y subagentes ligeros, con un contexto completo de 1M tokens a $0.30 / $2.50 por 1M tokens.
Gemini 3.5 Flash Lite
El modelo de clase 3.5 más rápido y rentable de Google
gemini-3.5-flash-liteClasificación y extracción de alto rendimiento, acciones en tiempo real de baja latencia, subagentes enfocados y cargas sensibles al coste donde la velocidad y el precio importan más que el máximo razonamiento.
Gemini 3.5 Flash Lite pricing
Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.5 Flash Lite rate.
Token calculator
Enter the token mix for one request.Estimated request cost
Gemini 3.5 Flash LiteMinimum charge: 0.01 credits per request.
EvoLink vs Google direct
Same token mix, default group price.Budget guide
Approximate requests using the current token mix.For quick testing
For regular development
For production evaluation
Model pricing
| Model | Context | Input tokens | Cache read tokens | Output tokens |
|---|---|---|---|---|
Gemini 3.5 Flash Litegemini-3.5-flash-lite | All context sizes | $0.271 / 1M-10% 18.4 cr / 1M$0.300official price | $0.028 / 1M-7% 1.9 cr / 1M$0.030official price | $2.250 / 1M-10% 153 cr / 1M$2.500official price |
Gemini 3.5 Flash Lite
All context sizesUSD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.
API de Gemini 3.5 Flash Lite para cargas rápidas, económicas y de alto volumen
Llama al modelo de clase 3.5 más barato y rápido de Google mediante la API unificada de EvoLink. Gemini 3.5 Flash Lite está diseñado para clasificación, enrutamiento, extracción y subagentes ligeros de baja latencia — con ventana de contexto de 1.048.576 tokens, caché de prompts, salida estructurada y uso de herramientas — a $0.30 / $2.50 por millón de tokens de entrada / salida.
Dónde se gana Gemini 3.5 Flash Lite un lugar en una arquitectura de modelos de producción
Google posiciona Gemini 3.5 Flash Lite como su modelo de clase 3.5 más rápido y rentable. Encaja mejor en trabajo de alto volumen y sensible a la latencia, donde el precio bajo y la velocidad importan más que el razonamiento máximo, y donde puedes escalar las pocas solicitudes difíciles a un modelo mayor.
Clasificación y extracción de alto volumen
Gemini 3.5 Flash Lite está diseñado para clasificación, enrutamiento y extracción de JSON de alto volumen. A $0.30 / $2.50 por 1M de tokens procesas grandes volúmenes de solicitudes de forma barata donde un modelo premium se desperdiciaría.
Escala de baja latencia y sensible al coste
Google indica unos 350 tokens de salida por segundo, lo que encaja con acciones de UI en tiempo real, autocompletado, moderación y otras rutas críticas de latencia. Mide coste y velocidad por solicitud, no los titulares de los benchmarks.
Subagentes ligeros y enfocados
Sirve para subagentes que ejecutan tareas concretas dentro de sistemas multiagente más grandes. Usa por defecto pensamiento mínimo para ganar velocidad; para uso de herramientas en varios pasos, valida que los agentes no terminen antes de tiempo antes de escalar.
Cuándo escalar a un modelo mayor
La refactorización profunda de repositorios, la programación autónoma prolongada y el razonamiento difícil de varios pasos corresponden a Gemini 3.6 Flash o a un modelo de nivel Pro. Usa Flash Lite para la mayoría de alto volumen y enruta hacia arriba solo la minoría difícil.
Qué sugieren las primeras reacciones a Gemini 3.5 Flash Lite y qué falta comprobar
Gemini 3.5 Flash Lite se lanzó el 21-07-2026 como reemplazo de Gemini 2.5 Flash. Trata las reacciones del lanzamiento como hipótesis que debes verificar en tus propias tareas, herramientas, presupuestos y criterios de aceptación.
La relación precio-rendimiento es el titular
A $0.30 de entrada / $2.50 de salida por 1M de tokens y unos 350 tokens por segundo, su atractivo es el rendimiento por dólar. En trabajo simple y de alto volumen puede superar a modelos más caros en coste total con una calidad aceptable.
Reemplaza a Gemini 2.5 Flash y a cargas más ligeras de 3-Flash
Google lo plantea como sustituto directo de Gemini 2.5 Flash y de tareas de Gemini 3 Flash menos complejas. Si hoy usas esos modelos, vuelve a evaluar tus prompts antes de migrar para que la calidad y el formato se mantengan dentro de la tolerancia.
El pensamiento mínimo es lo predeterminado: valida agentes de varios pasos
Flash Lite usa por defecto pensamiento mínimo para ganar velocidad y coste. Google señala que el pensamiento mínimo puede causar una terminación prematura de herramientas en tareas de varios pasos, así que prueba que los agentes completen las tareas antes de un despliegue de alto volumen.
Es un modelo de Google cerrado y solo por API
Gemini 3.5 Flash Lite no tiene pesos abiertos y no se puede autoalojar. El acceso es a través de la API de Gemini y plataformas como Google AI Studio, además de gateways unificados como EvoLink: enruta por coste y latencia, no por despliegue local.
Por qué Gemini 3.5 Flash Lite puede con estas cargas de trabajo
Gemini 3.5 Flash Lite combina precio bajo y alta velocidad con un contexto completo de 1M tokens y caché de prompts. No es un modelo de razonamiento máximo; su valor está en hacer trabajo simple rápido y barato a escala.
Contexto de 1M tokens en el nivel más barato
La ventana de 1.048.576 tokens permite que incluso el modelo de clase 3.5 más barato procese documentos largos, transcripciones o registros en una sola pasada. La recuperación y la compactación del contexto siguen reduciendo el coste, ya que la entrada irrelevante también consume tokens.
Velocidad y rendimiento por encima del razonamiento profundo
Con unos 350 tokens de salida por segundo y pensamiento mínimo por defecto, Flash Lite optimiza para respuestas rápidas y de alto volumen. Reserva las configuraciones y los modelos de razonamiento más pesado para las solicitudes que realmente lo necesitan.
La caché de prompts reduce aún más el coste
Los prompts de sistema, las instrucciones y los esquemas de herramientas estables generan aciertos de caché que se leen a la tarifa de caché reducida. Mantén el orden del prefijo constante para que las llamadas repetidas de alto volumen sigan siendo baratas.
Qué verificar antes de enviar tráfico de producción a Gemini 3.5 Flash Lite
Una carga adecuada aún puede fallar porque la integración usa el identificador equivocado, envía parámetros no admitidos o asume un razonamiento profundo que los valores predeterminados de pensamiento mínimo no ofrecen. Verifica el contrato de la solicitud antes de evaluar la calidad.
Usar el ID de modelo exacto gemini-3.5-flash-lite
Envía model "gemini-3.5-flash-lite" (con un punto tras 3.5) en la ruta de la API de EvoLink. El gemini-3-5-flash-lite con guiones es solo la URL de la página, no el parámetro de modelo de la API.
Usar OpenAI Chat Completions o la API nativa de Gemini
EvoLink expone Gemini 3.5 Flash Lite a través de /v1/chat/completions compatible con OpenAI y del endpoint nativo generateContent de Gemini. Usa la misma clave API de EvoLink para cualquiera de los dos protocolos.
Atender los cambios de parámetros incompatibles
Los valores propios de temperature, top-K y top-P se ignoran; los valores propios de frequency y presence penalty devuelven un error; y se rechaza una solicitud cuyo último turno tiene el rol model. Actualiza en consecuencia los constructores de solicitudes de Gemini más antiguos.
Validar agentes de varios pasos con pensamiento mínimo
Como Flash Lite usa por defecto pensamiento mínimo, confirma que los agentes de varios pasos con llamadas a herramientas completan sus pasos en lugar de detenerse antes de tiempo. Reserva el razonamiento más difícil para un modelo mayor en vez de sobreajustar este.
Comparar el coste por tarea aceptada, no solo el precio por token
Gemini 3.5 Flash Lite gana cuando su precio bajo y su velocidad superan tu umbral de calidad en trabajo de alto volumen. Evalúa conjuntos de tareas idénticos y escala las solicitudes que no puede manejar en lugar de pagar tarifas premium por todo el tráfico.
Si Gemini 3.5 Flash Lite supera tu umbral de calidad en tareas simples y de alto volumen, su tarifa baja y su velocidad lo convierten en el valor predeterminado de producción más barato. Enruta solo las solicitudes que falla a Gemini 3.6 Flash o a un modelo de nivel Pro.
Comparar modelos de contexto largo después de probar la carga de trabajo
EvoLinkPrimero compruebe si Gemini 3.5 Flash Lite reduce reintentos y revisión. Después compare precio, contexto, caché y adecuación a la carga de trabajo para elegir la ruta.
| Modelo | Gemini 3.5 Flash Lite | Gemini 3.6 Flash | Gemini 3.1 Pro |
|---|---|---|---|
| Entrada / salida | $0.271 / $2.25 | $1.5 / $7.5 | $1.68 / $10.08 |
| Contexto | 1M | 1M | 1M |
| Caché | Lecturas automáticas de caché | Caché de contexto | Caché de contexto |
| Ideal para | Clasificación y extracción de alto rendimiento, acciones en tiempo real de baja latencia, subagentes enfocados y cargas sensibles al coste donde la velocidad y el precio importan más que el máximo razonamiento. | Gemini más grande al que escalar cuando una tarea supera la velocidad de pensamiento mínimo de Flash-Lite. | Gemini más grande al que escalar cuando una tarea supera la velocidad de pensamiento mínimo de Flash-Lite. |
Otros modelos Gemini en EvoLink

Gemini 3.6 Flash
The workhorse to escalate to when a task needs stronger coding or reasoning than the Lite tier provides.
Ver modelo
Gemini 3.5 Flash
The mid Flash tier between Flash-Lite and the Pro line, balancing cost and capability.
Ver modelo
Gemini 3.1 Pro
The Pro-tier step up for the deepest reasoning tasks the Flash line is not built to handle.
Ver modelo
Gemini 3.1 Flash Lite
The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.
Ver modeloOther text models

GPT-5.6
OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.
Ver modelo
Claude Opus 4.8
Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.
Ver modelo
DeepSeek V4
Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.
Ver modelo
Kimi K3
Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.
Ver modeloLecturas para equipos de producción

Gemini 3.6 Flash release date & rollout
What launched, the model ID, official pricing, and where the model is available.
Leer la guíaPreguntas frecuentes de la API de Gemini 3.5 Flash Lite
¿La API de Gemini 3.5 Flash Lite está disponible en EvoLink?
Sí. Gemini 3.5 Flash Lite está disponible como modelo de producción con precios en vivo y tarifas oficiales de respaldo.
¿Qué ID de modelo debo usar para la API de Gemini 3.5 Flash Lite?
Envíe model "gemini-3.5-flash-lite" (con un punto después de 3.5). La forma con guiones gemini-3-5-flash-lite es solo la URL de la página, no el parámetro de modelo de la API.
¿Qué protocolos y SDK funcionan con Gemini 3.5 Flash Lite?
Use el endpoint Chat Completions compatible con OpenAI o el endpoint nativo generateContent de Gemini con la misma clave API de EvoLink. No existe una ruta Anthropic Messages para este modelo.
¿La API de Gemini 3.5 Flash Lite admite 1M de contexto o solo 256K?
La ruta de EvoLink registra 1.048.576 tokens. Los límites más pequeños suelen provenir de una superficie de producto de Gemini concreta o de la configuración del cliente, no del modelo de la API en sí.
¿Qué tan rápido y económico es Gemini 3.5 Flash Lite?
Es el modelo de clase 3.5 más rápido y rentable de Google: $0.30 de entrada / $2.50 de salida por 1M tokens a unos 350 tokens de salida por segundo. Ese rendimiento por dólar es su principal ventaja.
¿Para qué es ideal Gemini 3.5 Flash Lite?
Clasificación de alto rendimiento, enrutamiento, extracción de JSON, acciones de UI de baja latencia y subagentes enfocados. Para programación profunda o razonamiento difícil, escale a Gemini 3.6 Flash o a un modelo de nivel Pro.
¿En qué se diferencia Gemini 3.5 Flash Lite de 3.5 Flash y 3.6 Flash?
Flash Lite es el nivel más barato y rápido y usa pensamiento mínimo de forma predeterminada. 3.5 Flash y 3.6 Flash son caballos de batalla más capaces y de mayor precio para programación y agentes.
¿Gemini 3.5 Flash Lite reemplaza a Gemini 2.5 Flash?
Google lo posiciona como reemplazo de Gemini 2.5 Flash y de cargas de Gemini 3 Flash menos complejas. Vuelva a evaluar sus prompts antes de migrar.
¿Qué cambios incompatibles debo gestionar al migrar?
Los valores personalizados de temperature, top-K y top-P se ignoran; los valores personalizados de frequency y presence penalty devuelven un error; y se rechaza una solicitud cuyo último turno tenga el rol model.
¿Gemini 3.5 Flash Lite es una buena opción predeterminada para tiempo real o gran volumen?
Sí, para eso está diseñado. Usa pensamiento mínimo de forma predeterminada para ganar velocidad, así que valide que los agentes de varios pasos completen sus pasos antes de un despliegue de alto rendimiento.
¿Cómo comparar Gemini 3.5 Flash Lite con GPT, Claude, GLM o DeepSeek?
Compárelo con otros niveles baratos y rápidos por coste por cada 1K solicitudes y latencia, no con modelos de razonamiento premium. Escale a un modelo más grande las solicitudes que no pueda gestionar.
¿Qué debería medir una evaluación de producción de Gemini 3.5 Flash Lite?
Mida coste por cada 1K solicitudes, tokens por segundo, éxito al primer intento, entregables aceptados, aciertos de caché y con qué frecuencia las solicitudes deben escalar a un modelo más grande.