
Gemini 3.8 Flash vs 3.7 Flash: ¿más precisión o más eficiencia en tokens?

La respuesta corta
No migres toda una flota a partir de una gráfica de benchmarks. Repite un conjunto de tareas representativo, mantén constantes el nivel de thinking y el contrato de herramientas, y compara resultados aceptados, tokens totales de output y de thinking, latencia, reintentos y tiempo de revisión.
Línea base oficial: ¿qué es realmente igual?
A fecha del 3 de septiembre de 2026, Google documenta la siguiente línea base. Los precios de abajo son las tarifas introductorias de Google hasta el 31 de diciembre de 2026; Google publica tarifas estándar más altas a partir del 1 de enero de 2027. Los precios de tu cuenta de EvoLink pueden ser distintos, así que usa el precio en vivo que devuelve tu cuenta como fuente de verdad para la facturación.
| Dimensión | Gemini 3.8 Flash | Gemini 3.7 Flash | Impacto en la decisión |
|---|---|---|---|
| ID del modelo | gemini-3.8-flash | gemini-3.7-flash | Cambio de modelo explícito |
| Precio intro de input | $0.75 / 1M tokens | $0.75 / 1M tokens | Sin ventaja de tarifa |
| Precio intro de output | $3.75 / 1M tokens | $3.75 / 1M tokens | El volumen de tokens decide el gasto |
| Precio intro de lectura de caché | $0.075 / 1M tokens | $0.075 / 1M tokens | Los prefijos estables pueden abaratar el input repetido |
| Contexto de entrada | 1,048,576 tokens | 1,048,576 tokens | Misma capacidad |
| Output máximo | 65,536 tokens | 65,536 tokens | Mismo techo documentado |
| Modalidades de entrada | Texto, imagen, vídeo, audio, PDF | Texto, imagen, vídeo, audio, PDF | Misma entrada multimodal |
| Modalidad de salida | Texto | Texto | Ninguno genera medios |
| Niveles de thinking | low, medium, high | low, medium, high | Compara al mismo nivel |
Qué cambió en Gemini 3.8 Flash
Google posiciona 3.8 Flash como su modelo de trabajo de clase Flash más capaz para coding, flujos agénticos, trabajo de conocimiento y comprensión multimodal. Sus materiales de lanzamiento reportan mejoras en evaluaciones de coding y orientadas a terminal. Son señales reportadas por el proveedor: útiles para decidir qué probar, pero no sustituyen tus criterios de aceptación en producción.
El modelo también sigue el contrato de petición vigente de Gemini 3:
- En la superficie Gemini nativa de EvoLink, Gemini 3.x usa
generationConfig.thinkingConfig.thinkingLevel;thinkingBudgetes el control de Gemini 2.5 y ambos son mutuamente excluyentes. - Los valores de thinking admitidos son
low,medium(el valor por defecto) yhigh;minimalno está soportado y EvoLink lo degrada alowautomáticamente. - EvoLink indica que los valores personalizados de
temperatureytopPno afectan a la salida de Gemini 3.x, quetopKse ignora y que los valores fuera de rango detemperatureotopPdevuelven 400. - No termines una petición con un turno de rol
model. - Las respuestas de función deben devolver el
idy elnamede la función correspondiente.
Estas reglas también aplican a una comparación limpia entre 3.7 y 3.8. Una diferencia de parámetros oculta puede parecer una diferencia de calidad del modelo.
Matriz de decisión
| Carga de trabajo | Empieza con | Por qué | Qué medir antes de promocionar |
|---|---|---|---|
| Parches de código con tests estrictos | Prueba 3.8 como retador | Google reporta puntuaciones más altas en ciertos benchmarks de coding; el efecto en producción se desconoce | Tests superados, ediciones en revisión, tokens totales, latencia |
| Agentes de herramientas multi-paso | Prueba 3.8 como retador | Google destaca benchmarks agénticos; el efecto en tool calls de producción se desconoce | Llamadas válidas, pasos fallidos, reintentos, tasa de finalización |
| Análisis de documentos y gráficos | Prueba en paralelo | Ambos tienen el mismo contexto y las mismas modalidades | Precisión de citas, errores de extracción, tokens de output |
| Pipeline de clasificación estable | Mantén 3.7 como control | Google recomienda 3.7 cuando la prioridad es la eficiencia de cómputo | Deriva, coste por 1,000 etiquetas aceptadas, latencia p95 |
| Resumen de alto volumen | Mantén el modelo actual como control | Ningún resultado publicado por EvoLink establece una ventaja de 3.8 | Calidad de compresión, longitud de salida, tasa de revisión |
| Tráfico de producción mixto | Enruta ambos | Un único valor por defecto rara vez sirve para todas las tareas | Aceptación por ruta, gasto, frecuencia de fallback |
La tabla reparte candidatos de prueba; no predice un ganador. Mantén el modelo actual de producción como control hasta que el retador supere las umbrales de aceptación, coste y latencia definidas de antemano.
La métrica que importa: coste por tarea aceptada
El precio por token es solo un término del coste de producción. Usa un cálculo a nivel de modelo como este:
coste por tarea aceptada = (gasto total del modelo + gasto en reintentos + coste de revisión humana) / tareas aceptadasEvoLink no ha publicado una comparativa controlada de cargas de trabajo que demuestre que 3.8 Flash reduce reintentos, trabajo de revisión o coste total por tarea. La fórmula anterior es un método de evaluación, no un resultado medido. Los hechos publicados por Google —mayor precisión y mayor consumo de tokens— no establecen qué modelo sale más barato por tarea completada en producción.
Registra como mínimo:
- tasa de resultados aceptados y éxito al primer intento;
- tokens de input, output y thinking de la tarea completa, reintentos incluidos;
- tokens de lectura de caché y tasa de aciertos de caché;
- tool calls válidas frente a rechazadas;
- tiempo hasta un resultado aceptado;
- minutos de corrección humana;
- frecuencia de fallback y de rollback.
Una evaluación reproducible de 3.8 frente a 3.7

- Congela un conjunto representativo. Usa tareas reales y seguras en cuanto a privacidad que cubran casos fáciles, medianos y propensos a fallo. Cincuenta tareas pueden revelar regresiones evidentes; una promoción a producción merece un conjunto mayor.
- Mantén el contrato constante. Usa las mismas instrucciones de sistema, herramientas, esquemas, contexto, presupuesto de salida y nivel de thinking. Empieza con
mediumsalvo que tengas un motivo para probar otro nivel. - Arranca una sesión limpia. No reutilices contenido cacheado ni estado específico de un modelo al cambiar de modelo. Mezclar estado puede corromper la comparación.
- Puntúa aceptación, no estilo. Define tests ejecutables, comprobaciones de extracción, reglas de citación o rúbricas de revisión antes de ver los resultados.
- Pon precio al bucle completo. Incluye la salida de razonamiento, los reintentos, las llamadas de fallback y el tiempo de revisión, no solo la primera respuesta.
- Canary antes de cambiar el default. Envía una porción de tráfico pequeña y observable a 3.8 y conserva un rollback de un solo cambio hacia 3.7.
Escribe las umbrales de promoción antes de la prueba. Por ejemplo: ningún aumento material de errores críticos, una mejora definida en la tasa de tareas aceptadas y un incremento máximo tolerado en el coste por tarea aceptada y en la latencia p95.
Checklist de migración y rollback
Un cambio de modelo dentro de la misma familia sigue mereciendo tratarse como un release de comportamiento.
- Cambia el valor de modelo de la API de
gemini-3.7-flashagemini-3.8-flash; no uses el slug de páginagemini-3-8-flashcomo ID del modelo. - Audita los clientes antiguos en busca de controles de thinking mutuamente excluyentes, controles de muestreo ignorados y valores fuera de rango.
- Mapea el thinking
minimala un nivel soportado y probado —normalmentelow— en lugar de asumir en silencio que son equivalentes. - Vuelve a validar los esquemas de salida estructurada y de respuestas de función.
- Invalida las cachés de prompt específicas del modelo y arranca las sesiones de comparación con estado limpio.
- Registra ID del modelo, ruta, nivel de thinking, categorías de tokens, latencia, número de reintentos y resultado de aceptación.
- Mantén 3.7 configurado como fallback explícito hasta que 3.8 supere la ventana de observación.
model en cada petición. El valor operativo es la selección controlada y el rollback, no una promesa de que cada petición reciba el coste más bajo posible.¿Quién debería probar 3.8 ahora?
Errores habituales al comparar
- Llamar "más barato" a 3.8 porque la tarifa introductoria es inferior a una tarifa estándar futura. Hay que indicar la fecha de comparación y el periodo de precio correctos.
- Tratar un precio por token igual como si fuera un coste por tarea igual.
- Comparar el thinking
highen 3.8 conmediumolowen 3.7. - Reutilizar una caché específica de un modelo entre variantes.
- Presentar mejoras de benchmark como mejoras garantizadas en la aplicación.
- Medir la calidad de la respuesta ignorando reintentos, tiempo de revisión y fallos de herramientas.
- Sustituir el modelo por defecto de producción sin un umbral de rollback.
Preguntas frecuentes
¿Es Gemini 3.8 Flash mejor que Gemini 3.7 Flash?
En la evidencia publicada no hay un ganador global. Google reporta mayor precisión para 3.8 Flash, sobre todo en los benchmarks de coding y agénticos que destaca, y también documenta un mayor consumo de tokens. EvoLink no ha publicado resultados controlados de cargas de trabajo que conviertan esos hechos en una conclusión a nivel de tarea.
¿Es Gemini 3.8 Flash más caro que 3.7 Flash?
Sus tarifas introductorias por token en Google son las mismas hasta el 31 de diciembre de 2026. Aun así, una tarea en 3.8 puede costar más si consume más tokens de output o de thinking. El precio de tu cuenta de EvoLink debe comprobarse en la superficie de precios en vivo.
¿Qué pasa con los precios en 2027?
Google publica tarifas estándar a partir del 1 de enero de 2027: $1.50 por millón de tokens de input, $7.50 por millón de tokens de output y $0.15 por millón de tokens de lectura de caché. Vuelve a comprobar los precios de Google y de EvoLink antes de esa fecha.
¿Tienen los modelos ventanas de contexto distintas?
No. Google documenta un límite de entrada de 1,048,576 tokens y un output máximo de 65,536 tokens para ambos.
¿Gemini 3.8 Flash admite el nivel de thinking minimal?
low, medium y high, con medium por defecto. La referencia de la API nativa de EvoLink indica que un minimal no soportado se degrada automáticamente a low, así que fija low de forma explícita en lugar de depender de esa degradación.¿Puedo reutilizar el contenido cacheado al pasar de 3.7 a 3.8?
No asumas que el contenido cacheado es portable entre versiones del modelo. Vuelve a crear las cachés específicas del modelo y arranca las evaluaciones de migración con estado limpio.
¿Debo sustituir 3.7 Flash de inmediato?
No hay ninguna sustitución automática justificada. Ejecuta un replay y un canary, y promociona 3.8 solo en las cargas de trabajo en las que supere las umbrales de calidad, coste y latencia escritas de antemano.
¿Puede EvoLink enrutar ambos modelos con una sola integración?
gemini-3.8-flash en el enum de modelos tanto del endpoint nativo como del compatible con OpenAI.Fuentes y notas de verificación
- Google: lanzamiento de Gemini 3.8 Flash
- Google AI for Developers: modelo Gemini 3.8 Flash
- Google AI for Developers: precios de la Gemini API
- Google Cloud: guía de Gemini 3.8 Flash
- Google DeepMind: model card de Gemini 3.8 Flash
- EvoLink: referencia de la API nativa de Gemini
gemini-3.8-flash en ambos endpoints; el acceso a nivel de cuenta debe verificarse igualmente antes del despliegue en producción.

