GPT Image 2.5 Flare & Sunburst ya están disponibles en EvoLinkProbar GPT Image 2.5

Gemini 3.5 Flash Lite API

Accede a Gemini 3.5 Flash Lite de Google —también buscado como Gemini 3.5 Flash-Lite— a través de la API de chat unificada de EvoLink. Prueba el enrutado de baja latencia, la salida estructurada, el uso de herramientas antes de integrar.

GoogleGeneración de textoDisponible
desde $0.271 / 1M tokens de entrada$0.300 precio oficial-10%
Inferencia de baja latenciaUso de herramientasSalida estructuradaCaché de promptsChat + Gemini API
Ruta de producciónLive
Contexto
1.05M de contexto · 65.5K de salida máx.
Ideal para
Clasificación, extracción, enrutado, subagentes
Entrada
Texto + imágenes
Salida
Texto · JSON (salida estructurada) · llamadas a herramientas

Elegir Gemini 3.5 Flash Lite

El modelo de clase 3.5 más barato y rápido de Google para clasificación, enrutamiento y extracción de baja latencia y subagentes ligeros, con un contexto completo de 1M tokens a $0.300 / $2.500 por 1M tokens.

Gemini 3.5 Flash Lite

El modelo de clase 3.5 más rápido y rentable de Google

Seleccionado
ID del modelo
gemini-3.5-flash-lite
Ideal para

Clasificación y extracción de alto rendimiento, acciones en tiempo real de baja latencia, subagentes enfocados y cargas sensibles al coste donde la velocidad y el precio importan más que el máximo razonamiento.

Entrada
$0.271 / 1M-10%
18.4 cr / 1M$0.300precio oficial
Lectura de caché
$0.028 / 1M-7%
1.9 cr / 1M$0.030precio oficial
Salida
$2.250 / 1M-10%
153 cr / 1M$2.500precio oficial

Todas las tarifas son por 1M de tokens, en USD y créditos, y reflejan los precios actuales de tu cuenta.

Precios de Gemini 3.5 Flash Lite

Estima el coste de una solicitud de Gemini 3.5 Flash Lite antes de integrar. La calculadora usa las tarifas actuales de tu cuenta; los precios oficiales sirven de referencia.

Calculadora de solicitud

Introduce la combinación de tokens de una solicitud y el número de consultas de Google.

Coste estimado por solicitud

Gemini 3.5 Flash Lite
USD$0.0010
Créditos0.0647

Estimación oficial $0.0011 · ahorras $0.0002 (10%)

Tokens de entrada0.0184 cr
Tokens de lectura de caché0.0004 cr
Tokens de salida0.0459 cr
Búsqueda de Google0 cr

Cargo mínimo: 0.01 créditos por solicitud.

Guía de presupuesto

Solicitudes aproximadas según los tokens y las consultas de búsqueda indicados.
Añadir créditos
$10
Unas 10510 solicitudes

Para pruebas rápidas

$50
Unas 52550 solicitudes

Para el desarrollo habitual

$100
Unas 105100 solicitudes

Para la evaluación en producción

Tarifas de herramientas del servidor

Gemini 3.x cobra cada consulta de búsqueda no vacía, incluso si no se devuelven fuentes. Una solicitud puede ejecutar varias consultas. Los cargos de búsqueda se suman después de aplicar el cargo mínimo por tokens.
  • Búsqueda de Google$0.014/ consulta0.952 cr / consulta

API de Gemini 3.5 Flash Lite para cargas rápidas, económicas y de alto volumen

Llama al modelo de clase 3.5 más barato y rápido de Google mediante la API unificada de EvoLink. Gemini 3.5 Flash Lite está diseñado para clasificación, enrutamiento, extracción y subagentes ligeros de baja latencia — con ventana de contexto de 1.048.576 tokens, caché de prompts, salida estructurada y uso de herramientas — a $0.300 / $2.500 por millón de tokens de entrada / salida.

Gemini 3.5 Flash Lite se sirve en EvoLink con el ID de modelo gemini-3.5-flash-lite mediante Chat Completions · API nativa de Gemini, con la misma clave API y saldo que usas para cualquier otro modelo. Ofrece una ventana de contexto de 1.05M y hasta 65.5K tokens de salida, además de el enrutado de baja latencia, la salida estructurada, el uso de herramientas.

Gemini 3.5 Flash Lite

Especificaciones y capacidades de Gemini 3.5 Flash Lite

Las cifras proceden de la configuración de ruta de EvoLink; las capacidades son las que la API expone hoy.

Ventana de contexto
1.05M tokens
Salida máx.
65.5K tokens
Entrada
Texto + imágenes
Salida
Texto · JSON (salida estructurada) · llamadas a herramientas
Uso de herramientas
Llamadas a funciones con secuencias de herramientas de varios pasos
Caché de prompts
Lecturas de caché automáticas a tarifa reducida
Herramientas del servidor
Búsqueda de Google, facturadas por consulta de búsqueda
Protocolos
Chat Completions · API nativa de Gemini
ID del modelo
gemini-3.5-flash-lite

Por qué Gemini 3.5 Flash Lite puede con estas cargas de trabajo

Gemini 3.5 Flash Lite combina precio bajo y alta velocidad con un contexto completo de 1M tokens y caché de prompts. No es un modelo de razonamiento máximo; su valor está en hacer trabajo simple rápido y barato a escala.

Contexto de 1M tokens en el nivel más barato

La ventana de 1.048.576 tokens permite que incluso el modelo de clase 3.5 más barato procese documentos largos, transcripciones o registros en una sola pasada. La recuperación y la compactación del contexto siguen reduciendo el coste, ya que la entrada irrelevante también consume tokens.

Velocidad y rendimiento por encima del razonamiento profundo

Con unos 350 tokens de salida por segundo y pensamiento mínimo por defecto, Flash Lite optimiza para respuestas rápidas y de alto volumen. Reserva las configuraciones y los modelos de razonamiento más pesado para las solicitudes que realmente lo necesitan.

La caché de prompts reduce aún más el coste

Los prompts de sistema, las instrucciones y los esquemas de herramientas estables generan aciertos de caché que se leen a la tarifa de caché reducida. Mantén el orden del prefijo constante para que las llamadas repetidas de alto volumen sigan siendo baratas.

Dónde se gana Gemini 3.5 Flash Lite un lugar en una arquitectura de modelos de producción

Google posiciona Gemini 3.5 Flash Lite como su modelo de clase 3.5 más rápido y rentable. Encaja mejor en trabajo de alto volumen y sensible a la latencia, donde el precio bajo y la velocidad importan más que el razonamiento máximo, y donde puedes escalar las pocas solicitudes difíciles a un modelo mayor.

Clasificación y extracción de alto volumen

Gemini 3.5 Flash Lite está diseñado para clasificación, enrutamiento y extracción de JSON de alto volumen. A $0.300 / $2.500 por 1M de tokens procesas grandes volúmenes de solicitudes de forma barata donde un modelo premium se desperdiciaría.

Escala de baja latencia y sensible al coste

Google indica unos 350 tokens de salida por segundo, lo que encaja con acciones de UI en tiempo real, autocompletado, moderación y otras rutas críticas de latencia. Mide coste y velocidad por solicitud, no los titulares de los benchmarks.

Subagentes ligeros y enfocados

Sirve para subagentes que ejecutan tareas concretas dentro de sistemas multiagente más grandes. Usa por defecto pensamiento mínimo para ganar velocidad; para uso de herramientas en varios pasos, valida que los agentes no terminen antes de tiempo antes de escalar.

Cuándo escalar a un modelo mayor

La refactorización profunda de repositorios, la programación autónoma prolongada y el razonamiento difícil de varios pasos corresponden a Gemini 3.6 Flash o a un modelo de nivel Pro. Usa Flash Lite para la mayoría de alto volumen y enruta hacia arriba solo la minoría difícil.

Qué sugieren las primeras reacciones a Gemini 3.5 Flash Lite y qué falta comprobar

Gemini 3.5 Flash Lite se lanzó el 21-07-2026 como reemplazo de Gemini 2.5 Flash. Trata las reacciones del lanzamiento como hipótesis que debes verificar en tus propias tareas, herramientas, presupuestos y criterios de aceptación.

La relación precio-rendimiento es el titular

A $0.300 de entrada / $2.500 de salida por 1M de tokens y unos 350 tokens por segundo, su atractivo es el rendimiento por dólar. En trabajo simple y de alto volumen puede superar a modelos más caros en coste total con una calidad aceptable.

Reemplaza a Gemini 2.5 Flash y a cargas más ligeras de 3-Flash

Google lo plantea como sustituto directo de Gemini 2.5 Flash y de tareas de Gemini 3 Flash menos complejas. Si hoy usas esos modelos, vuelve a evaluar tus prompts antes de migrar para que la calidad y el formato se mantengan dentro de la tolerancia.

El pensamiento mínimo es lo predeterminado: valida agentes de varios pasos

Flash Lite usa por defecto pensamiento mínimo para ganar velocidad y coste. Google señala que el pensamiento mínimo puede causar una terminación prematura de herramientas en tareas de varios pasos, así que prueba que los agentes completen las tareas antes de un despliegue de alto volumen.

Es un modelo de Google cerrado y solo por API

Gemini 3.5 Flash Lite no tiene pesos abiertos y no se puede autoalojar. El acceso es a través de la API de Gemini y plataformas como Google AI Studio, además de gateways unificados como EvoLink: enruta por coste y latencia, no por despliegue local.

Dos formas de usar Gemini 3.5 Flash Lite: API de EvoLink o Agente

Usa la API de EvoLink para backends de producto y trabajos por lotes, o llama a Gemini 3.5 Flash Lite desde Codex, Claude o Gemini para flujos de código y análisis. Ambas vías comparten la misma clave API de EvoLink, saldo, ID de modelo e historial de solicitudes.

Opción 1

Integrar con la API de EvoLink

Ideal para: backends de producto, trabajos por lotes, pipelines automatizados

Envía a EvoLink solicitudes Chat Completions compatibles con OpenAI (o Anthropic Messages) y controla el ID de modelo, el prompt de sistema, el presupuesto de salida, las herramientas y la salida estructurada.

  1. 1Crea una clave API de EvoLink en la consola
  2. 2Apunta tu SDK de OpenAI o Anthropic a la URL base de EvoLink y selecciona el ID de modelo mostrado arriba
  3. 3Envía una solicitud representativa y lee el campo usage para tokens de entrada, en caché y de salida
  4. 4Define max_tokens y reintentos por tarea; conserva los ID y resultados de llamadas a herramientas entre turnos
Opción 2

Llamarlo con un Agente

Ideal para: tareas de código, revisión y análisis en Codex, Claude y Gemini

Dale al Agente la tarea, las entradas a incluir y los criterios de aceptación. Él arma la solicitud, llama a Gemini 3.5 Flash Lite a través de EvoLink y devuelve la respuesta con el uso de tokens.

  1. 1Define EVOLINK_API_KEY en tu entorno local; nunca en código ni en un prompt
  2. 2Describe la tarea, las entradas a incluir y el formato de salida esperado
  3. 3Pide al Agente que llame a Gemini 3.5 Flash Lite a través de EvoLink y muestre la solicitud antes de enviarla
  4. 4Deja que el Agente informe la respuesta, el uso de tokens y cualquier cuerpo de error

Ejemplo de código de la API de Gemini 3.5 Flash Lite y manejo de errores

Este ejemplo muestra la solicitud ejecutable más corta: una llamada Chat Completions compatible con OpenAI con prompt de sistema, mensaje de usuario y presupuesto de salida. Abre la pestaña API para la referencia completa de parámetros y respuestas.

Ver documentación completa de la API
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.5-flash-lite",
    "messages": [
      { "role": "system", "content": "You are a precise assistant. Answer in JSON when asked." },
      { "role": "user", "content": "Classify the sentiment of each review below and return a JSON array:\n<reviews>" }
    ],
    "max_tokens": 1024,
    "temperature": 0.1
  }'

# The Gemini native API is available with the same model ID; see the docs
# for the request shape.
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens).

Solicitud inválida o parámetro no admitido

Comprueba el ID de modelo, el array messages y los rangos de parámetros en la referencia de la API; elimina los campos que esta ruta no admite.

Problema de autenticación o saldo

Comprueba el token Bearer de Authorization y confirma el saldo disponible en la consola.

Longitud de contexto excedida

Los tokens del prompt superan la ventana de contexto de Gemini 3.5 Flash Lite. Recorta o recupera solo la evidencia relevante y reutiliza prefijos en caché.

Límite de tasa (429)

Espera y reintenta con jitter; agrupa o encola las solicitudes en lugar de ráfagas paralelas.

Contenido o llamada a herramienta rechazados

Revisa contenido sensible, argumentos de llamada a herramienta mal formados y desajustes del esquema JSON antes de reintentar.

Qué verificar antes de enviar tráfico de producción a Gemini 3.5 Flash Lite

Una carga adecuada aún puede fallar porque la integración usa el identificador equivocado, envía parámetros no admitidos o asume un razonamiento profundo que los valores predeterminados de pensamiento mínimo no ofrecen. Verifica el contrato de la solicitud antes de evaluar la calidad.

01

Usar el ID de modelo exacto gemini-3.5-flash-lite

Envía model "gemini-3.5-flash-lite" (con un punto tras 3.5) en la ruta de la API de EvoLink. El gemini-3-5-flash-lite con guiones es solo la URL de la página, no el parámetro de modelo de la API.

ID del modelo
02

Usar OpenAI Chat Completions o la API nativa de Gemini

EvoLink expone Gemini 3.5 Flash Lite a través de /v1/chat/completions compatible con OpenAI y del endpoint nativo generateContent de Gemini. Usa la misma clave API de EvoLink para cualquiera de los dos protocolos.

Protocolos
03

Atender los cambios de parámetros incompatibles

Los valores propios de temperature, top-K y top-P se ignoran; los valores propios de frequency y presence penalty devuelven un error; y se rechaza una solicitud cuyo último turno tiene el rol model. Actualiza en consecuencia los constructores de solicitudes de Gemini más antiguos.

Migración
04

Validar agentes de varios pasos con pensamiento mínimo

Como Flash Lite usa por defecto pensamiento mínimo, confirma que los agentes de varios pasos con llamadas a herramientas completan sus pasos en lugar de detenerse antes de tiempo. Reserva el razonamiento más difícil para un modelo mayor en vez de sobreajustar este.

Agentes

Caché de prompts para contextos largos repetidos

Las lecturas automáticas de caché usan una tarifa reducida específica cuando se pueden reutilizar instrucciones de repositorio estables, documentos de referencia y esquemas de herramientas.

Contexto de 1M tokens con un límite de salida por defecto de 65K

Mantén el código relacionado, las especificaciones, los documentos y el estado del agente en un mismo contexto de trabajo. Trata el límite como capacidad, no como objetivo: recupera la evidencia relevante y fija presupuestos de salida adecuados a cada tarea.

Compara el coste por tarea aceptada de Gemini 3.5 Flash Lite, no solo el precio por token

Gemini 3.5 Flash Lite gana cuando su precio bajo y su velocidad superan tu umbral de calidad en trabajo de alto volumen. Evalúa conjuntos de tareas idénticos y escala las solicitudes que no puede manejar en lugar de pagar tarifas premium por todo el tráfico.

Éxito al primer intentoEntregables aceptadosNúmero de reintentosTokens de salidaTasa de aciertos de cachéTokens por segundoCoste por 1.000 solicitudesTasa de escalado a un modelo mayor

Si Gemini 3.5 Flash Lite supera tu umbral de calidad en tareas simples y de alto volumen, su tarifa baja y su velocidad lo convierten en el valor predeterminado de producción más barato. Enruta solo las solicitudes que falla a Gemini 3.6 Flash o a un modelo de nivel Pro.

Compara Gemini 3.5 Flash Lite con los principales modelos de contexto largo tras las pruebas de carga

EvoLink

Primero compruebe si Gemini 3.5 Flash Lite reduce reintentos y revisión. Después compare precio, contexto, caché y adecuación a la carga de trabajo para elegir la ruta.

Gemini 3.5 Flash Lite
Entrada / salida$0.271 / $2.25
Contexto1.05M
CachéLecturas automáticas de caché
Ideal paraClasificación y extracción de alto rendimiento, acciones en tiempo real de baja latencia, subagentes enfocados y cargas sensibles al coste donde la velocidad y el precio importan más que el máximo razonamiento.
Gemini 3.6 Flash
Entrada / salida$0.675 / $3.375
Contexto1.05M
CachéCaché de contexto
Ideal paraEl caballo de batalla al que escalar cuando una tarea necesita más código o razonamiento que el que ofrece el nivel Lite.
Gemini 3.1 Pro
Entrada / salida$1.865 / $11.183
Contexto1.05M
CachéCaché de contexto
Ideal paraSube al nivel Pro para las tareas de razonamiento más profundo que la línea Flash no está hecha para resolver.

Familia de modelos Gemini

Misma clave API y saldo: cambia de nivel sin tocar la integración.

Comparar todos los modelos Gemini
Gemini 3.8 Flash

Gemini 3.8 Flash

La generación Flash más reciente para cargas más exigentes de programación, razonamiento y agentes.

Ver modelo
Gemini 3.7 Flash

Gemini 3.7 Flash

Una generación Flash reciente para un razonamiento sólido en un nivel rápido y eficiente.

Ver modelo
Gemini 3.6 Flash

Gemini 3.6 Flash

El caballo de batalla al que escalar cuando una tarea necesita más código o razonamiento que el que ofrece el nivel Lite.

Ver modelo

Otros modelos de texto en EvoLink además de Gemini 3.5 Flash Lite

GPT-5.6

GPT-5.6

La familia frontier de OpenAI por niveles (Sol/Terra/Luna) para equilibrar capacidad, latencia y coste.

Ver modelo
Claude Opus 4.8

Claude Opus 4.8

La ruta premium de Anthropic para agentes de larga duración, revisiones complejas y trabajo que exige criterio.

Ver modelo
DeepSeek V4

DeepSeek V4

La ruta económica de DeepSeek con contexto de 1M para cargas intensivas de código, razonamiento y agentes.

Ver modelo
Kimi K3

Kimi K3

La ruta de razonamiento de contexto largo de Moonshot para código a escala de repositorio y trabajo multidocumento.

Ver modelo

Lecturas relacionadas sobre Gemini 3.5 Flash Lite

Comparar la familia de API de Gemini

Comparar la familia de API de Gemini

Mira en qué se diferencian 3.5 Flash-Lite, 3.6 Flash, 3.5 Flash y 3.1 Pro en precio, velocidad, contexto y encaje de carga antes de enrutar.

Leer la guía
API de Gemini 3.6 Flash

API de Gemini 3.6 Flash

El caballo de batalla al que escalar cuando una tarea necesita más código o razonamiento que el que ofrece el nivel Lite.

Leer la guía
API de Gemini 3.5 Flash

API de Gemini 3.5 Flash

El nivel Flash intermedio entre Flash-Lite y la línea Pro, para equilibrar coste y capacidad.

Leer la guía
API de Gemini 2.5 Flash

API de Gemini 2.5 Flash

El modelo de la generación anterior al que Gemini 3.5 Flash-Lite reemplaza en precio y velocidad.

Leer la guía
API de Gemini 3.1 Pro

API de Gemini 3.1 Pro

Sube al nivel Pro para las tareas de razonamiento más profundo que la línea Flash no está hecha para resolver.

Leer la guía

Preguntas frecuentes de la API de Gemini 3.5 Flash Lite

¿La API de Gemini 3.5 Flash Lite está disponible en EvoLink?

Sí. Gemini 3.5 Flash Lite está disponible como modelo de producción con precios en vivo y tarifas oficiales de respaldo.

¿Qué ID de modelo debo usar para la API de Gemini 3.5 Flash Lite?

Envíe model "gemini-3.5-flash-lite" (con un punto después de 3.5). La forma con guiones gemini-3-5-flash-lite es solo la URL de la página, no el parámetro de modelo de la API.

¿Qué protocolos y SDK funcionan con Gemini 3.5 Flash Lite?

Use el endpoint Chat Completions compatible con OpenAI o el endpoint nativo generateContent de Gemini con la misma clave API de EvoLink. No existe una ruta Anthropic Messages para este modelo.

¿La API de Gemini 3.5 Flash Lite admite 1M de contexto o solo 256K?

La ruta de EvoLink registra 1.048.576 tokens. Los límites más pequeños suelen provenir de una superficie de producto de Gemini concreta o de la configuración del cliente, no del modelo de la API en sí.

¿Qué tan rápido y económico es Gemini 3.5 Flash Lite?

Es el modelo de clase 3.5 más rápido y rentable de Google: $0.300 de entrada / $2.500 de salida por 1M tokens a unos 350 tokens de salida por segundo. Ese rendimiento por dólar es su principal ventaja.

¿Para qué es ideal Gemini 3.5 Flash Lite?

Clasificación de alto rendimiento, enrutamiento, extracción de JSON, acciones de UI de baja latencia y subagentes enfocados. Para programación profunda o razonamiento difícil, escale a Gemini 3.6 Flash o a un modelo de nivel Pro.

¿En qué se diferencia Gemini 3.5 Flash Lite de 3.5 Flash y 3.6 Flash?

Flash Lite es el nivel más barato y rápido y usa pensamiento mínimo de forma predeterminada. 3.5 Flash y 3.6 Flash son caballos de batalla más capaces y de mayor precio para programación y agentes.

¿Gemini 3.5 Flash Lite reemplaza a Gemini 2.5 Flash?

Google lo posiciona como reemplazo de Gemini 2.5 Flash y de cargas de Gemini 3 Flash menos complejas. Vuelva a evaluar sus prompts antes de migrar.

¿Qué cambios incompatibles debo gestionar al migrar?

Los valores personalizados de temperature, top-K y top-P se ignoran; los valores personalizados de frequency y presence penalty devuelven un error; y se rechaza una solicitud cuyo último turno tenga el rol model.

¿Gemini 3.5 Flash Lite es una buena opción predeterminada para tiempo real o gran volumen?

Sí, para eso está diseñado. Usa pensamiento mínimo de forma predeterminada para ganar velocidad, así que valide que los agentes de varios pasos completen sus pasos antes de un despliegue de alto rendimiento.

¿Cómo comparar Gemini 3.5 Flash Lite con GPT, Claude, GLM o DeepSeek?

Compárelo con otros niveles baratos y rápidos por coste por cada 1K solicitudes y latencia, no con modelos de razonamiento premium. Escale a un modelo más grande las solicitudes que no pueda gestionar.

¿Qué debería medir una evaluación de producción de Gemini 3.5 Flash Lite?

Mida coste por cada 1K solicitudes, tokens por segundo, éxito al primer intento, entregables aceptados, aciertos de caché y con qué frecuencia las solicitudes deben escalar a un modelo más grande.