Kimi K3 ya está disponibleDescubrir Kimi K3

Gemini 3.5 Flash Lite API

Google-Generación de texto-desde $0.271 / 1M tokens de entrada$0.300 precio oficial-Disponible
Contexto de 1MSalida predeterminada de 65KCaché de promptsChat + Gemini API
Production routeLive
Proveedor
Google
Modelo
Flash Lite
Ventana de contexto
1.048.576 tokens
Protocolos
Chat + Gemini

Elegir Gemini 3.5 Flash Lite

El modelo de clase 3.5 más barato y rápido de Google para clasificación, enrutamiento y extracción de baja latencia y subagentes ligeros, con un contexto completo de 1M tokens a $0.30 / $2.50 por 1M tokens.

Gemini 3.5 Flash Lite

El modelo de clase 3.5 más rápido y rentable de Google

Seleccionado
Desde $0.271 / 1M tokens de entrada$0.300 precio oficialgemini-3.5-flash-lite
Ideal para

Clasificación y extracción de alto rendimiento, acciones en tiempo real de baja latencia, subagentes enfocados y cargas sensibles al coste donde la velocidad y el precio importan más que el máximo razonamiento.

Entrada
$0.271 / 1M-10%
18.4 cr / 1M$0.300precio oficial
Lectura de caché
$0.028 / 1M-7%
1.9 cr / 1M$0.030precio oficial
Salida
$2.250 / 1M-10%
153 cr / 1M$2.500precio oficial

Gemini 3.5 Flash Lite pricing

Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.5 Flash Lite rate.

Flash Lite

Token calculator

Enter the token mix for one request.

Estimated request cost

Gemini 3.5 Flash Lite
Official rate
USD$0.0010
Credits0.0647
Input tokens0.0184 cr
Cache read tokens0.0004 cr
Output tokens0.0459 cr

Minimum charge: 0.01 credits per request.

EvoLink vs Google direct

Same token mix, default group price.
-10%
EvoLink estimate$0.0010
Google official$0.0011
You save$0.0002

Budget guide

Approximate requests using the current token mix.
Add credits
$10
About 10510 requests

For quick testing

$50
About 52550 requests

For regular development

$100
About 105100 requests

For production evaluation

Model pricing

Gemini 3.5 Flash Lite

All context sizes
Input tokens
$0.271 / 1M-10%
18.4 cr / 1M$0.300official price
Cache read tokens
$0.028 / 1M-7%
1.9 cr / 1M$0.030official price
Output tokens
$2.250 / 1M-10%
153 cr / 1M$2.500official price

USD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.

API de Gemini 3.5 Flash Lite para cargas rápidas, económicas y de alto volumen

Llama al modelo de clase 3.5 más barato y rápido de Google mediante la API unificada de EvoLink. Gemini 3.5 Flash Lite está diseñado para clasificación, enrutamiento, extracción y subagentes ligeros de baja latencia — con ventana de contexto de 1.048.576 tokens, caché de prompts, salida estructurada y uso de herramientas — a $0.30 / $2.50 por millón de tokens de entrada / salida.

Gemini 3.5 Flash Lite
Casos de uso de Gemini 3.5 Flash Lite

Dónde se gana Gemini 3.5 Flash Lite un lugar en una arquitectura de modelos de producción

Google posiciona Gemini 3.5 Flash Lite como su modelo de clase 3.5 más rápido y rentable. Encaja mejor en trabajo de alto volumen y sensible a la latencia, donde el precio bajo y la velocidad importan más que el razonamiento máximo, y donde puedes escalar las pocas solicitudes difíciles a un modelo mayor.

Clasificación y extracción de alto volumen

Gemini 3.5 Flash Lite está diseñado para clasificación, enrutamiento y extracción de JSON de alto volumen. A $0.30 / $2.50 por 1M de tokens procesas grandes volúmenes de solicitudes de forma barata donde un modelo premium se desperdiciaría.

Escala de baja latencia y sensible al coste

Google indica unos 350 tokens de salida por segundo, lo que encaja con acciones de UI en tiempo real, autocompletado, moderación y otras rutas críticas de latencia. Mide coste y velocidad por solicitud, no los titulares de los benchmarks.

Subagentes ligeros y enfocados

Sirve para subagentes que ejecutan tareas concretas dentro de sistemas multiagente más grandes. Usa por defecto pensamiento mínimo para ganar velocidad; para uso de herramientas en varios pasos, valida que los agentes no terminen antes de tiempo antes de escalar.

Cuándo escalar a un modelo mayor

La refactorización profunda de repositorios, la programación autónoma prolongada y el razonamiento difícil de varios pasos corresponden a Gemini 3.6 Flash o a un modelo de nivel Pro. Usa Flash Lite para la mayoría de alto volumen y enruta hacia arriba solo la minoría difícil.

Señales del lanzamiento

Qué sugieren las primeras reacciones a Gemini 3.5 Flash Lite y qué falta comprobar

Gemini 3.5 Flash Lite se lanzó el 21-07-2026 como reemplazo de Gemini 2.5 Flash. Trata las reacciones del lanzamiento como hipótesis que debes verificar en tus propias tareas, herramientas, presupuestos y criterios de aceptación.

La relación precio-rendimiento es el titular

A $0.30 de entrada / $2.50 de salida por 1M de tokens y unos 350 tokens por segundo, su atractivo es el rendimiento por dólar. En trabajo simple y de alto volumen puede superar a modelos más caros en coste total con una calidad aceptable.

Reemplaza a Gemini 2.5 Flash y a cargas más ligeras de 3-Flash

Google lo plantea como sustituto directo de Gemini 2.5 Flash y de tareas de Gemini 3 Flash menos complejas. Si hoy usas esos modelos, vuelve a evaluar tus prompts antes de migrar para que la calidad y el formato se mantengan dentro de la tolerancia.

El pensamiento mínimo es lo predeterminado: valida agentes de varios pasos

Flash Lite usa por defecto pensamiento mínimo para ganar velocidad y coste. Google señala que el pensamiento mínimo puede causar una terminación prematura de herramientas en tareas de varios pasos, así que prueba que los agentes completen las tareas antes de un despliegue de alto volumen.

Es un modelo de Google cerrado y solo por API

Gemini 3.5 Flash Lite no tiene pesos abiertos y no se puede autoalojar. El acceso es a través de la API de Gemini y plataformas como Google AI Studio, además de gateways unificados como EvoLink: enruta por coste y latencia, no por despliegue local.

Capacidades clave

Por qué Gemini 3.5 Flash Lite puede con estas cargas de trabajo

Gemini 3.5 Flash Lite combina precio bajo y alta velocidad con un contexto completo de 1M tokens y caché de prompts. No es un modelo de razonamiento máximo; su valor está en hacer trabajo simple rápido y barato a escala.

Contexto de 1M tokens en el nivel más barato

La ventana de 1.048.576 tokens permite que incluso el modelo de clase 3.5 más barato procese documentos largos, transcripciones o registros en una sola pasada. La recuperación y la compactación del contexto siguen reduciendo el coste, ya que la entrada irrelevante también consume tokens.

Velocidad y rendimiento por encima del razonamiento profundo

Con unos 350 tokens de salida por segundo y pensamiento mínimo por defecto, Flash Lite optimiza para respuestas rápidas y de alto volumen. Reserva las configuraciones y los modelos de razonamiento más pesado para las solicitudes que realmente lo necesitan.

La caché de prompts reduce aún más el coste

Los prompts de sistema, las instrucciones y los esquemas de herramientas estables generan aciertos de caché que se leen a la tarifa de caché reducida. Mantén el orden del prefijo constante para que las llamadas repetidas de alto volumen sigan siendo baratas.

Comprobaciones de producción de la API de Gemini 3.5 Flash Lite

Qué verificar antes de enviar tráfico de producción a Gemini 3.5 Flash Lite

Una carga adecuada aún puede fallar porque la integración usa el identificador equivocado, envía parámetros no admitidos o asume un razonamiento profundo que los valores predeterminados de pensamiento mínimo no ofrecen. Verifica el contrato de la solicitud antes de evaluar la calidad.

01

Usar el ID de modelo exacto gemini-3.5-flash-lite

Envía model "gemini-3.5-flash-lite" (con un punto tras 3.5) en la ruta de la API de EvoLink. El gemini-3-5-flash-lite con guiones es solo la URL de la página, no el parámetro de modelo de la API.

ID del modelo
02

Usar OpenAI Chat Completions o la API nativa de Gemini

EvoLink expone Gemini 3.5 Flash Lite a través de /v1/chat/completions compatible con OpenAI y del endpoint nativo generateContent de Gemini. Usa la misma clave API de EvoLink para cualquiera de los dos protocolos.

Protocolos
03

Atender los cambios de parámetros incompatibles

Los valores propios de temperature, top-K y top-P se ignoran; los valores propios de frequency y presence penalty devuelven un error; y se rechaza una solicitud cuyo último turno tiene el rol model. Actualiza en consecuencia los constructores de solicitudes de Gemini más antiguos.

Migración
04

Validar agentes de varios pasos con pensamiento mínimo

Como Flash Lite usa por defecto pensamiento mínimo, confirma que los agentes de varios pasos con llamadas a herramientas completan sus pasos en lugar de detenerse antes de tiempo. Reserva el razonamiento más difícil para un modelo mayor en vez de sobreajustar este.

Agentes
Economía de producción

Comparar el coste por tarea aceptada, no solo el precio por token

Gemini 3.5 Flash Lite gana cuando su precio bajo y su velocidad superan tu umbral de calidad en trabajo de alto volumen. Evalúa conjuntos de tareas idénticos y escala las solicitudes que no puede manejar en lugar de pagar tarifas premium por todo el tráfico.

Éxito al primer intentoEntregables aceptadosNúmero de reintentosTokens de salidaTasa de aciertos de cachéTokens por segundoCoste por 1.000 solicitudesTasa de escalado a un modelo mayor

Si Gemini 3.5 Flash Lite supera tu umbral de calidad en tareas simples y de alto volumen, su tarifa baja y su velocidad lo convierten en el valor predeterminado de producción más barato. Enruta solo las solicitudes que falla a Gemini 3.6 Flash o a un modelo de nivel Pro.

Comparar modelos de contexto largo después de probar la carga de trabajo

EvoLink

Primero compruebe si Gemini 3.5 Flash Lite reduce reintentos y revisión. Después compare precio, contexto, caché y adecuación a la carga de trabajo para elegir la ruta.

Gemini 3.5 Flash Lite
Entrada / salida$0.271 / $2.25
Contexto1M
CachéLecturas automáticas de caché
Ideal paraClasificación y extracción de alto rendimiento, acciones en tiempo real de baja latencia, subagentes enfocados y cargas sensibles al coste donde la velocidad y el precio importan más que el máximo razonamiento.
Gemini 3.6 Flash
Entrada / salida$1.5 / $7.5
Contexto1M
CachéCaché de contexto
Ideal paraGemini más grande al que escalar cuando una tarea supera la velocidad de pensamiento mínimo de Flash-Lite.
Gemini 3.1 Pro
Entrada / salida$1.68 / $10.08
Contexto1M
CachéCaché de contexto
Ideal paraGemini más grande al que escalar cuando una tarea supera la velocidad de pensamiento mínimo de Flash-Lite.

Otros modelos Gemini en EvoLink

Gemini 3.6 Flash

Gemini 3.6 Flash

The workhorse to escalate to when a task needs stronger coding or reasoning than the Lite tier provides.

Ver modelo
Gemini 3.5 Flash

Gemini 3.5 Flash

The mid Flash tier between Flash-Lite and the Pro line, balancing cost and capability.

Ver modelo
Gemini 3.1 Pro

Gemini 3.1 Pro

The Pro-tier step up for the deepest reasoning tasks the Flash line is not built to handle.

Ver modelo
Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite

The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.

Ver modelo

Other text models

GPT-5.6

GPT-5.6

OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.

Ver modelo
Claude Opus 4.8

Claude Opus 4.8

Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.

Ver modelo
DeepSeek V4

DeepSeek V4

Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.

Ver modelo
Kimi K3

Kimi K3

Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.

Ver modelo

Lecturas para equipos de producción

Gemini 3.6 Flash release date & rollout

Gemini 3.6 Flash release date & rollout

What launched, the model ID, official pricing, and where the model is available.

Leer la guía

Preguntas frecuentes de la API de Gemini 3.5 Flash Lite

¿La API de Gemini 3.5 Flash Lite está disponible en EvoLink?

Sí. Gemini 3.5 Flash Lite está disponible como modelo de producción con precios en vivo y tarifas oficiales de respaldo.

¿Qué ID de modelo debo usar para la API de Gemini 3.5 Flash Lite?

Envíe model "gemini-3.5-flash-lite" (con un punto después de 3.5). La forma con guiones gemini-3-5-flash-lite es solo la URL de la página, no el parámetro de modelo de la API.

¿Qué protocolos y SDK funcionan con Gemini 3.5 Flash Lite?

Use el endpoint Chat Completions compatible con OpenAI o el endpoint nativo generateContent de Gemini con la misma clave API de EvoLink. No existe una ruta Anthropic Messages para este modelo.

¿La API de Gemini 3.5 Flash Lite admite 1M de contexto o solo 256K?

La ruta de EvoLink registra 1.048.576 tokens. Los límites más pequeños suelen provenir de una superficie de producto de Gemini concreta o de la configuración del cliente, no del modelo de la API en sí.

¿Qué tan rápido y económico es Gemini 3.5 Flash Lite?

Es el modelo de clase 3.5 más rápido y rentable de Google: $0.30 de entrada / $2.50 de salida por 1M tokens a unos 350 tokens de salida por segundo. Ese rendimiento por dólar es su principal ventaja.

¿Para qué es ideal Gemini 3.5 Flash Lite?

Clasificación de alto rendimiento, enrutamiento, extracción de JSON, acciones de UI de baja latencia y subagentes enfocados. Para programación profunda o razonamiento difícil, escale a Gemini 3.6 Flash o a un modelo de nivel Pro.

¿En qué se diferencia Gemini 3.5 Flash Lite de 3.5 Flash y 3.6 Flash?

Flash Lite es el nivel más barato y rápido y usa pensamiento mínimo de forma predeterminada. 3.5 Flash y 3.6 Flash son caballos de batalla más capaces y de mayor precio para programación y agentes.

¿Gemini 3.5 Flash Lite reemplaza a Gemini 2.5 Flash?

Google lo posiciona como reemplazo de Gemini 2.5 Flash y de cargas de Gemini 3 Flash menos complejas. Vuelva a evaluar sus prompts antes de migrar.

¿Qué cambios incompatibles debo gestionar al migrar?

Los valores personalizados de temperature, top-K y top-P se ignoran; los valores personalizados de frequency y presence penalty devuelven un error; y se rechaza una solicitud cuyo último turno tenga el rol model.

¿Gemini 3.5 Flash Lite es una buena opción predeterminada para tiempo real o gran volumen?

Sí, para eso está diseñado. Usa pensamiento mínimo de forma predeterminada para ganar velocidad, así que valide que los agentes de varios pasos completen sus pasos antes de un despliegue de alto rendimiento.

¿Cómo comparar Gemini 3.5 Flash Lite con GPT, Claude, GLM o DeepSeek?

Compárelo con otros niveles baratos y rápidos por coste por cada 1K solicitudes y latencia, no con modelos de razonamiento premium. Escale a un modelo más grande las solicitudes que no pueda gestionar.

¿Qué debería medir una evaluación de producción de Gemini 3.5 Flash Lite?

Mida coste por cada 1K solicitudes, tokens por segundo, éxito al primer intento, entregables aceptados, aciertos de caché y con qué frecuencia las solicitudes deben escalar a un modelo más grande.