Gemini 3.8 Flash API
Elegir Gemini 3.8 Flash
El modelo de trabajo Flash más reciente de Google para programación, flujos con agentes, trabajo de conocimiento y razonamiento multimodal, con mayor precisión reportada que Gemini 3.7 Flash y contexto de 1M tokens.
Gemini 3.8 Flash
Modelo de trabajo de gama Flash de Google
gemini-3.8-flashProgramación y refactorización full-stack, agentes de varios pasos y análisis de documentos o gráficos cuando la mayor precisión compensa el consumo adicional de tokens.
Precios de Gemini 3.8 Flash
Estima el coste de una solicitud con la calculadora interactiva y compara EvoLink con el precio introductorio actual de Google.
Calculadora de tokens
Introduce la mezcla de tokens de una solicitud.Coste estimado
Gemini 3.8 FlashCargo mínimo: 0,01 créditos por solicitud.
EvoLink frente a Google directo
Misma mezcla de tokens, precio del grupo predeterminado.Guía de presupuesto
Solicitudes aproximadas con la mezcla de tokens actual.Para pruebas rápidas
Para desarrollo habitual
Para evaluación en producción
Precios del modelo
| Modelo | Contexto | Tokens de entrada | Tokens de lectura de caché | Tokens de salida |
|---|---|---|---|---|
Gemini 3.8 Flashgemini-3.8-flash | Todos los tamaños de contexto | $0.675 / 1M-55% 45.9 cr / 1M$1.500Precio introductorio de Google | $0.068 / 1M-55% 4.6 cr / 1M$0.150Precio introductorio de Google | $3.375 / 1M-55% 229.5 cr / 1M$7.500Precio introductorio de Google |
Gemini 3.8 Flash
Todos los tamaños de contextoUSD y créditos se muestran por 1M de tokens. El precio en vivo del backend tiene prioridad sobre estas tarifas de respaldo.
API de Gemini 3.8 Flash para código y flujos de agentes
Llama al nuevo modelo Flash de Google mediante la API unificada de EvoLink. Google reporta mayor precisión que Gemini 3.7 Flash, junto con un mayor consumo de tokens. Incluye contexto de 1.048.576 tokens, caché de prompts, salida estructurada y uso de herramientas, al precio introductorio de Google de $0,75 / $3,75 por millón de tokens de entrada / salida hasta el 31 de diciembre de 2026.
Dónde se gana Gemini 3.8 Flash un lugar en una arquitectura de modelos de producción
Google posiciona Gemini 3.8 Flash como un modelo de mayor precisión para código, trabajo de conocimiento y tareas multimodales, aunque documenta un mayor consumo de tokens que Gemini 3.7 Flash. Encaja cuando una mayor tasa de éxito compensa el coste adicional de tokens.
Evaluar código y refactorización
Gemini 3.8 Flash apunta al código diario, el prototipado y la refactorización full-stack con mayor precisión reportada que Gemini 3.7 Flash, pero puede consumir más tokens. Mida parches aceptados, tokens totales y tiempo de revisión.
Flujos de trabajo con agentes y orquestación
Google destaca la orquestación de varios pasos, la selección de herramientas, la salida estructurada y la ejecución de código. EvoLink no ha medido la finalización de tareas ni el coste total de estos flujos; al probarlos, conserve mensajes completos del asistente, IDs de llamadas a herramientas, argumentos y resultados entre turnos.
Trabajo de conocimiento y razonamiento multimodal
Úselo para análisis de documentos, interpretación de gráficos y generación de maquetas web con varios elementos en un contexto de 1M tokens. La recuperación y la estructura documental siguen importando: una ventana de 1M no vuelve útil el contexto irrelevante.
Cuándo otra ruta es la mejor opción
Gemini 3.5 Flash-Lite tiene una tarifa por token publicada más baja para clasificación y extracción de gran volumen. No asigne 3.8 Flash partiendo de una supuesta ventaja de coste por tarea; compárelo con su ruta actual bajo los mismos criterios de aceptación.
Qué confirma Google y qué no ha medido EvoLink
Google lanzó Gemini 3.8 Flash el 2026-09-02 y publicó afirmaciones a nivel de modelo sobre benchmarks y consumo de tokens. EvoLink no ha publicado un estudio controlado de carga de trabajo 3.8 frente a 3.7, así que esta página no afirma menos reintentos, bucles de agente más cortos ni un menor coste por tarea.
Misma tarifa introductoria por token, puntuaciones oficiales más altas
Google lista las mismas tarifas introductorias de entrada, salida y lectura de caché para 3.8 Flash y 3.7 Flash, y reporta puntuaciones más altas de 3.8 en los benchmarks de código y agentes destacados. Google también documenta un mayor consumo de tokens; esos hechos no establecen una factura menor para una tarea de producción.
Los benchmarks oficiales no son un ranking de producción entre proveedores
Los resultados de lanzamiento de Google describen benchmarks seleccionados y no demuestran que 3.8 Flash supere a todos los modelos de nivel Pro o de terceros en su carga de trabajo. Por eso esta página no declara ningún ganador entre proveedores.
El mayor consumo de tokens es una advertencia oficial
Google afirma explícitamente que 3.8 Flash mejora la precisión mientras usa más tokens que 3.7 Flash. Las tarifas por token publicadas no bastan por sí solas para determinar qué modelo cuesta menos por tarea completada.
Es un modelo de Google cerrado y solo por API
Gemini 3.8 Flash no tiene pesos abiertos y no puede autoalojarse. El acceso es a través de la API de Gemini y plataformas como Google AI Studio, Antigravity y pasarelas unificadas como EvoLink, así que enrute por coste y fiabilidad, no por despliegue local.
Por qué Gemini 3.8 Flash puede resolver estas cargas de trabajo
Gemini 3.8 Flash es más útil cuando una ventana de contexto amplia, mayor precisión por tarea y prefijos de prompt reutilizables actúan juntos. La capacidad de contexto por sí sola no mejora una respuesta: la carga sigue necesitando evidencia relevante, estructura clara y un presupuesto de salida.
Un espacio de trabajo de 1M tokens, no un objetivo que llenar
La ventana de 1.048.576 tokens puede mantener disponibles código, especificaciones y resultados de herramientas relacionados sin fragmentación excesiva. La recuperación y la compactación del contexto siguen importando porque la entrada irrelevante compite por la atención y aumenta el coste de procesamiento.
Mayor precisión con mayor consumo de tokens
Google documenta una mayor precisión y un mayor consumo de tokens frente a Gemini 3.7 Flash. Mida el coste total por tarea aceptada para saber si los mejores resultados compensan los tokens adicionales.
La caché de prompts rinde cuando los prefijos se mantienen estables
Las instrucciones del repositorio, los prompts de sistema, el material de referencia y los esquemas de herramientas ofrecen la mayor oportunidad de caché cuando su orden se mantiene constante. Cambios frecuentes de modelo o de estructura del prompt pueden obligar a procesar de nuevo el prefijo largo.
Qué verificar antes de enviar tráfico de producción a Gemini 3.8 Flash
Una carga adecuada puede fallar igualmente porque la integración use el identificador equivocado, envíe parámetros no admitidos o pierda el estado del agente entre turnos. Verifique la superficie de la solicitud y el contrato conversacional antes de evaluar la calidad del modelo.
Usar el ID exacto del modelo gemini-3.8-flash
Envíe model "gemini-3.8-flash" (con puntos) en la ruta de la API de EvoLink. La forma con guiones gemini-3-8-flash es solo la URL de la página, no el parámetro de modelo de la API.
Usar OpenAI Chat Completions o la API nativa de Gemini
EvoLink expone Gemini 3.8 Flash mediante /v1/chat/completions compatible con OpenAI y el endpoint nativo de Gemini generateContent. Use la misma clave API de EvoLink para cualquiera de los dos protocolos.
Atender los cambios de parámetros que rompen compatibilidad
En las solicitudes nativas de EvoLink, Gemini 3.x usa generationConfig.thinkingConfig.thinkingLevel; thinkingBudget corresponde a Gemini 2.5 y ambos controles son mutuamente excluyentes. EvoLink documenta que los valores personalizados de temperature y topP no afectan a la salida de Gemini 3.x, que topK se ignora y que los valores de temperature o topP fuera de rango devuelven 400. El último turno de la conversación no debe usar el rol model.
Reenviar el estado completo del asistente y las herramientas
Los agentes de varios turnos deben conservar mensajes completos del asistente, IDs de llamadas, argumentos y resultados. Conservar solo el texto final rompe la continuidad del estado y puede hacer fallar pasos posteriores aunque la ventana de contexto sea suficientemente grande.
No se ha establecido ningún ganador en coste por tarea
Los hechos verificados son que 3.8 Flash y 3.7 Flash comparten las mismas tarifas introductorias por token de Google, mientras que Google indica que 3.8 usa más tokens y logra mayor precisión. EvoLink no ha publicado resultados controlados sobre reintentos, entregables aceptados, llamadas a herramientas, tiempo transcurrido ni revisión humana.
Estas son entradas de evaluación, no resultados observados de Gemini 3.8 Flash. Hasta que las mismas muestras de producción se prueben con la misma configuración, no afirme que 3.8 reduce el coste por tarea aceptada; elija 3.7 o Flash-Lite cuando su precio y perfil de cómputo documentados ya encajen con la carga de trabajo.
Comparar modelos de contexto largo después de probar la carga de trabajo
EvoLinkCompruebe si la mayor precisión compensa el consumo adicional de tokens de Gemini 3.8 Flash. Después compare precio, contexto, caché y adecuación para elegir la ruta.
| Modelo | Gemini 3.8 Flash | Gemini 3.5 Flash Lite | Gemini 3.1 Pro |
|---|---|---|---|
| Entrada / salida | $0.675 / $3.375 | $0.3 / $2.5 | $1.68 / $10.08 |
| Contexto | 1M | 1M | 1M |
| Caché | Lecturas automáticas de caché | Caché de contexto | Caché de contexto |
| Ideal para | Programación y refactorización full-stack, agentes de varios pasos y análisis de documentos o gráficos cuando la mayor precisión compensa el consumo adicional de tokens. | Ruta con tarifa por token publicada más baja para comparar en clasificación, extracción y tareas de alto rendimiento. | Ruta de comparación de nivel Pro para tareas que requieren un razonamiento más profundo que el de la línea Flash. |
Otros modelos Gemini en EvoLink

Gemini 3.5 Flash
Ruta Flash de la clase 3.5 para comparar calidad, latencia y uso de tokens.
Ver modelo
Gemini 3.5 Flash Lite
Ruta con tarifa por token publicada más baja para comparar en clasificación, extracción y subagentes de alto rendimiento.
Ver modelo

Gemini 3.1 Flash Lite
Ruta ligera 3.1 para comparar en cargas de gran volumen sensibles al coste.
Ver modeloOtros modelos de texto

GPT-5.6
Familia de modelos OpenAI por niveles para comparar capacidad, latencia y enrutamiento por coste.
Ver modelo
Claude Opus 4.8
Modelo de Anthropic para comparar en agentes de código de larga duración y revisiones que exigen criterio.
Ver modelo
DeepSeek V4
Ruta de comparación de modelo abierto para cargas de código, razonamiento y agentes.
Ver modelo
Kimi K3
Ruta de Moonshot para comparar en razonamiento de contexto largo y trabajo multidocumento.
Ver modeloLecturas para equipos de producción

Gemini 3.8 Flash vs Gemini 3.7 Flash
Compara precisión, consumo de tokens, tarifas introductorias y coste por tarea aceptada en producción antes de cambiar tu modelo predeterminado.
Leer la guía
Cómo usar la API de Gemini 3.8 Flash
Envía la primera solicitud, aplica las reglas de migración de Gemini 3 y añade telemetría, canary y controles de rollback.
Leer la guía
Comparar la familia de API de Gemini
Vea, antes de enrutar, cómo se diferencian 3.8 Flash, 3.5 Flash-Lite, 3.7 Flash y 3.1 Pro en precio, contexto y encaje de carga.
Leer la guíaAPI de Gemini 3.5 Flash-Lite
La ruta 3.5 más barata y rápida para clasificación, extracción y subagentes de alto rendimiento; escale el trabajo difícil a 3.8 Flash.
Leer la guíaAPI de Gemini 3.7 Flash
El modelo Flash de la generación anterior, al mismo precio: compáralo antes de mover tráfico de producción a 3.8 Flash.
Leer la guía
API de Gemini 3.1 Pro
Suba al nivel Pro cuando una tarea necesite un razonamiento más profundo del que puede ofrecer la línea Flash.
Leer la guíaPreguntas frecuentes de la API de Gemini 3.8 Flash
¿La API de Gemini 3.8 Flash está disponible en EvoLink?
Sí. Gemini 3.8 Flash figura como modelo de producción. La página usa el precio del backend cuando está disponible y, si no, el precio introductorio actual de Google como comparación.
¿Qué ID de modelo debo usar para la API de Gemini 3.8 Flash?
Envíe el modelo "gemini-3.8-flash" (con puntos). El formato con guiones gemini-3-8-flash es solo la URL de la página, no el parámetro de modelo de la API.
¿Qué protocolos y SDK funcionan con Gemini 3.8 Flash?
EvoLink documenta Chat Completions compatible con OpenAI y el generateContent nativo de Gemini en direct.evolink.ai con la misma clave API, y gemini-3.8-flash figura en el enum de modelos de ambos endpoints. Aun así, confirme la ruta activa en su cuenta.
¿La API de Gemini 3.8 Flash realmente admite el contexto completo de 1M?
Sí: la ruta registra 1.048.576 tokens de entrada según la documentación de Google. Los límites menores suelen provenir de una superficie de producto de Gemini concreta o de la configuración del cliente, no del modelo de la API en sí.
¿Cómo debería usar la ventana de contexto de 1M tokens de Gemini 3.8 Flash?
Mantenga juntos el código, los documentos y los resultados de herramientas relacionados, pero use recuperación, prefijos en caché estables y compactación de contexto en lugar de llenar la ventana por defecto.
¿En qué se diferencia Gemini 3.8 Flash de Gemini 3.7 Flash y 3.5 Flash-Lite?
Google lista las mismas tarifas introductorias por token para 3.8 y 3.7, reporta puntuaciones más altas de 3.8 en benchmarks seleccionados de código y agentes, y documenta un mayor consumo de tokens de 3.8. Google lista tarifas por token más bajas para 3.5 Flash-Lite; los resultados por carga de trabajo siguen requiriendo pruebas.
¿Gemini 3.8 Flash realmente sale más barato si usa más tokens?
Las tarifas por token coinciden con las de Gemini 3.7 Flash, pero Google documenta un mayor consumo de tokens junto con una mayor precisión. Compare el coste total por tarea aceptada en su propia carga de trabajo en lugar de asumir un menor coste por tarea.
¿Qué reglas de parámetros debo gestionar al migrar a Gemini 3.8 Flash?
En las solicitudes nativas de EvoLink, Gemini 3.x usa generationConfig.thinkingConfig.thinkingLevel; thinkingBudget corresponde a Gemini 2.5 y no puede combinarse con thinkingLevel. EvoLink documenta que los valores personalizados de temperature y topP no afectan a la salida de Gemini 3.x, que topK se ignora y que los valores de temperature o topP fuera de rango devuelven 400. El último turno no debe usar el rol model.
¿Qué pasó con el nivel de pensamiento minimal en Gemini 3.8 Flash?
Google documenta low, medium (predeterminado) y high para Gemini 3.8 Flash; minimal no está admitido. La referencia de la API nativa de EvoLink indica que un minimal no admitido se degrada automáticamente a low, por lo que las solicitudes migradas no fallan; aun así, establezca low de forma explícita para un control predecible. Gemini 3.5 Flash-Lite tiene tarifas por token publicadas más bajas y puede seguir siendo una ruta de comparación para clasificación de gran volumen.
¿Cómo se facturan los tokens de pensamiento de Gemini 3.8 Flash?
Los tokens de pensamiento se facturan a la tarifa de salida según los precios de Google, por lo que un razonamiento extenso puede hacer la factura notablemente mayor que la respuesta visible. Establezca niveles de pensamiento adecuados a la tarea y supervise los tokens de razonamiento y de respuesta final.
¿Puede Gemini 3.8 Flash analizar vídeo y audio?
Sí. El modelo acepta entrada de texto, imagen, vídeo, audio y PDF y genera texto, lo que lo convierte en una opción habitual para cargas de comprensión de vídeo y audio. No admite generación de imagen, audio ni transmisión en vivo.
¿Existe un Gemini 3.7 Pro?
No. Al lanzarse 3.8 Flash, el modelo más reciente de la línea Pro de Google sigue siendo gemini-3.1-pro-preview, y no se ha anunciado ningún 3.5 o 3.7 Pro en canales oficiales.
¿Cuánto dura el precio introductorio de Gemini 3.8 Flash?
Google publica $0.75 de entrada y $3.75 de salida por millón de tokens como precio introductorio hasta el 31 de diciembre de 2026, con tarifas estándar de $1.50 y $7.50 desde el 1 de enero de 2027. Consulte la sección de precios de esta página para la tarifa actual de EvoLink.
¿Es Gemini 3.8 Flash más fiable que 3.7 Flash siguiendo instrucciones?
Google informa de una mayor precisión general y un mayor consumo de tokens, pero EvoLink no ha publicado una comparación controlada de seguimiento de instrucciones. Pruebe tareas representativas antes de llevarlo a producción.
¿Qué debería medir una evaluación de producción de Gemini 3.8 Flash?
Controle el éxito al primer intento, los entregables aceptados, los reintentos, los tokens de salida, los aciertos de caché, las llamadas válidas a herramientas, el tiempo hasta el resultado aceptado, la corrección humana y la tasa de fallback.