Seedance 2.5 ya está disponible en EvoLinkProbar Seedance 2.5
Dos rutas de IA en producción que contrastan la eficiencia de cómputo con un camino de razonamiento más amplio
Comparación

Gemini 3.8 Flash vs 3.7 Flash: ¿más precisión o más eficiencia en tokens?

EvoLink Team
EvoLink Team
Product Team
3 de septiembre de 2026
13 min de lectura

La respuesta corta

La evidencia publicada por Google sostiene dos conclusiones: Gemini 3.8 Flash tiene una precisión reportada mayor y un mayor consumo de tokens, y Google recomienda Gemini 3.7 Flash cuando la prioridad es la eficiencia de cómputo. EvoLink no ha publicado resultados controlados que muestren menos salidas rechazadas, menos fallos de herramientas, menos reintentos ni menos correcciones humanas, así que este artículo no declara un ganador en coste por tarea.
El detalle importante es fácil de pasar por alto: Google lanzó los dos modelos con las mismas tarifas introductorias por token, pero dice de forma explícita que 3.8 Flash consume más tokens a cambio de una precisión mayor. Es decir, "mismo precio" no significa "misma factura". La decisión de producción se toma al nivel del coste por tarea aceptada, no del precio por millón de tokens.

No migres toda una flota a partir de una gráfica de benchmarks. Repite un conjunto de tareas representativo, mantén constantes el nivel de thinking y el contrato de herramientas, y compara resultados aceptados, tokens totales de output y de thinking, latencia, reintentos y tiempo de revisión.

Línea base oficial: ¿qué es realmente igual?

A fecha del 3 de septiembre de 2026, Google documenta la siguiente línea base. Los precios de abajo son las tarifas introductorias de Google hasta el 31 de diciembre de 2026; Google publica tarifas estándar más altas a partir del 1 de enero de 2027. Los precios de tu cuenta de EvoLink pueden ser distintos, así que usa el precio en vivo que devuelve tu cuenta como fuente de verdad para la facturación.

DimensiónGemini 3.8 FlashGemini 3.7 FlashImpacto en la decisión
ID del modelogemini-3.8-flashgemini-3.7-flashCambio de modelo explícito
Precio intro de input$0.75 / 1M tokens$0.75 / 1M tokensSin ventaja de tarifa
Precio intro de output$3.75 / 1M tokens$3.75 / 1M tokensEl volumen de tokens decide el gasto
Precio intro de lectura de caché$0.075 / 1M tokens$0.075 / 1M tokensLos prefijos estables pueden abaratar el input repetido
Contexto de entrada1,048,576 tokens1,048,576 tokensMisma capacidad
Output máximo65,536 tokens65,536 tokensMismo techo documentado
Modalidades de entradaTexto, imagen, vídeo, audio, PDFTexto, imagen, vídeo, audio, PDFMisma entrada multimodal
Modalidad de salidaTextoTextoNinguno genera medios
Niveles de thinkinglow, medium, highlow, medium, highCompara al mismo nivel
Que la superficie no cambie hace que 3.8 sea fácil de probar junto a 3.7. No convierte la actualización en algo económicamente automático.

Qué cambió en Gemini 3.8 Flash

Google posiciona 3.8 Flash como su modelo de trabajo de clase Flash más capaz para coding, flujos agénticos, trabajo de conocimiento y comprensión multimodal. Sus materiales de lanzamiento reportan mejoras en evaluaciones de coding y orientadas a terminal. Son señales reportadas por el proveedor: útiles para decidir qué probar, pero no sustituyen tus criterios de aceptación en producción.

La afirmación más relevante para decidir aparece en la guía de Google para desarrolladores: 3.8 Flash ofrece mayor precisión con un mayor consumo de tokens que 3.7 Flash, y Google recomienda 3.7 cuando la prioridad es la eficiencia de cómputo. Es una guía de producto inusualmente clara. Descarta la afirmación simplista de que 3.8 es siempre la opción más barata o más eficiente.

El modelo también sigue el contrato de petición vigente de Gemini 3:

  • En la superficie Gemini nativa de EvoLink, Gemini 3.x usa generationConfig.thinkingConfig.thinkingLevel; thinkingBudget es el control de Gemini 2.5 y ambos son mutuamente excluyentes.
  • Los valores de thinking admitidos son low, medium (el valor por defecto) y high; minimal no está soportado y EvoLink lo degrada a low automáticamente.
  • EvoLink indica que los valores personalizados de temperature y topP no afectan a la salida de Gemini 3.x, que topK se ignora y que los valores fuera de rango de temperature o topP devuelven 400.
  • No termines una petición con un turno de rol model.
  • Las respuestas de función deben devolver el id y el name de la función correspondiente.

Estas reglas también aplican a una comparación limpia entre 3.7 y 3.8. Una diferencia de parámetros oculta puede parecer una diferencia de calidad del modelo.

Matriz de decisión

Carga de trabajoEmpieza conPor quéQué medir antes de promocionar
Parches de código con tests estrictosPrueba 3.8 como retadorGoogle reporta puntuaciones más altas en ciertos benchmarks de coding; el efecto en producción se desconoceTests superados, ediciones en revisión, tokens totales, latencia
Agentes de herramientas multi-pasoPrueba 3.8 como retadorGoogle destaca benchmarks agénticos; el efecto en tool calls de producción se desconoceLlamadas válidas, pasos fallidos, reintentos, tasa de finalización
Análisis de documentos y gráficosPrueba en paraleloAmbos tienen el mismo contexto y las mismas modalidadesPrecisión de citas, errores de extracción, tokens de output
Pipeline de clasificación estableMantén 3.7 como controlGoogle recomienda 3.7 cuando la prioridad es la eficiencia de cómputoDeriva, coste por 1,000 etiquetas aceptadas, latencia p95
Resumen de alto volumenMantén el modelo actual como controlNingún resultado publicado por EvoLink establece una ventaja de 3.8Calidad de compresión, longitud de salida, tasa de revisión
Tráfico de producción mixtoEnruta ambosUn único valor por defecto rara vez sirve para todas las tareasAceptación por ruta, gasto, frecuencia de fallback

La tabla reparte candidatos de prueba; no predice un ganador. Mantén el modelo actual de producción como control hasta que el retador supere las umbrales de aceptación, coste y latencia definidas de antemano.

La métrica que importa: coste por tarea aceptada

El precio por token es solo un término del coste de producción. Usa un cálculo a nivel de modelo como este:

coste por tarea aceptada = (gasto total del modelo + gasto en reintentos + coste de revisión humana) / tareas aceptadas

EvoLink no ha publicado una comparativa controlada de cargas de trabajo que demuestre que 3.8 Flash reduce reintentos, trabajo de revisión o coste total por tarea. La fórmula anterior es un método de evaluación, no un resultado medido. Los hechos publicados por Google —mayor precisión y mayor consumo de tokens— no establecen qué modelo sale más barato por tarea completada en producción.

Registra como mínimo:

  • tasa de resultados aceptados y éxito al primer intento;
  • tokens de input, output y thinking de la tarea completa, reintentos incluidos;
  • tokens de lectura de caché y tasa de aciertos de caché;
  • tool calls válidas frente a rechazadas;
  • tiempo hasta un resultado aceptado;
  • minutos de corrección humana;
  • frecuencia de fallback y de rollback.

Una evaluación reproducible de 3.8 frente a 3.7

Bucle de evaluación en producción que compara resultados aceptados, consumo de tokens, reintentos y rutas de rollback
Bucle de evaluación en producción que compara resultados aceptados, consumo de tokens, reintentos y rutas de rollback
  1. Congela un conjunto representativo. Usa tareas reales y seguras en cuanto a privacidad que cubran casos fáciles, medianos y propensos a fallo. Cincuenta tareas pueden revelar regresiones evidentes; una promoción a producción merece un conjunto mayor.
  2. Mantén el contrato constante. Usa las mismas instrucciones de sistema, herramientas, esquemas, contexto, presupuesto de salida y nivel de thinking. Empieza con medium salvo que tengas un motivo para probar otro nivel.
  3. Arranca una sesión limpia. No reutilices contenido cacheado ni estado específico de un modelo al cambiar de modelo. Mezclar estado puede corromper la comparación.
  4. Puntúa aceptación, no estilo. Define tests ejecutables, comprobaciones de extracción, reglas de citación o rúbricas de revisión antes de ver los resultados.
  5. Pon precio al bucle completo. Incluye la salida de razonamiento, los reintentos, las llamadas de fallback y el tiempo de revisión, no solo la primera respuesta.
  6. Canary antes de cambiar el default. Envía una porción de tráfico pequeña y observable a 3.8 y conserva un rollback de un solo cambio hacia 3.7.

Escribe las umbrales de promoción antes de la prueba. Por ejemplo: ningún aumento material de errores críticos, una mejora definida en la tasa de tareas aceptadas y un incremento máximo tolerado en el coste por tarea aceptada y en la latencia p95.

Checklist de migración y rollback

Un cambio de modelo dentro de la misma familia sigue mereciendo tratarse como un release de comportamiento.

  • Cambia el valor de modelo de la API de gemini-3.7-flash a gemini-3.8-flash; no uses el slug de página gemini-3-8-flash como ID del modelo.
  • Audita los clientes antiguos en busca de controles de thinking mutuamente excluyentes, controles de muestreo ignorados y valores fuera de rango.
  • Mapea el thinking minimal a un nivel soportado y probado —normalmente low— en lugar de asumir en silencio que son equivalentes.
  • Vuelve a validar los esquemas de salida estructurada y de respuestas de función.
  • Invalida las cachés de prompt específicas del modelo y arranca las sesiones de comparación con estado limpio.
  • Registra ID del modelo, ruta, nivel de thinking, categorías de tokens, latencia, número de reintentos y resultado de aceptación.
  • Mantén 3.7 configurado como fallback explícito hasta que 3.8 supere la ventana de observación.
Con EvoLink, los equipos pueden mantener Gemini 3.8 Flash y Gemini 3.7 Flash detrás de una sola integración de API y cambiar el valor de model en cada petición. El valor operativo es la selección controlada y el rollback, no una promesa de que cada petición reciba el coste más bajo posible.

¿Quién debería probar 3.8 ahora?

Ejecuta una prueba controlada con 3.8 como retador cuando las capacidades de coding, agentes o documentos que Google destaca coincidan con una necesidad de evaluación actual y ya recojas telemetría de tokens, latencia y aceptación. Es una recomendación de prueba, no una conclusión de actualización.
Quédate en 3.7 por ahora si la carga de trabajo es estable y de alto volumen, la calidad ya supera el listón, la eficiencia de cómputo es una restricción principal o tu equipo no puede ejecutar una ventana adecuada de regresión y canary.
Plantéate enrutar por carga de trabajo solo después de evaluar. Mantén cada ruta existente como control, promociona 3.8 solo en las clases de tarea en las que supere las umbrales escritos y conserva una vía de rollback. Consulta la comparativa de modelos Gemini para ver la familia completa y la guía de integración de Gemini 3.8 Flash para ejemplos de peticiones y controles de despliegue.

Errores habituales al comparar

  • Llamar "más barato" a 3.8 porque la tarifa introductoria es inferior a una tarifa estándar futura. Hay que indicar la fecha de comparación y el periodo de precio correctos.
  • Tratar un precio por token igual como si fuera un coste por tarea igual.
  • Comparar el thinking high en 3.8 con medium o low en 3.7.
  • Reutilizar una caché específica de un modelo entre variantes.
  • Presentar mejoras de benchmark como mejoras garantizadas en la aplicación.
  • Medir la calidad de la respuesta ignorando reintentos, tiempo de revisión y fallos de herramientas.
  • Sustituir el modelo por defecto de producción sin un umbral de rollback.

Preguntas frecuentes

¿Es Gemini 3.8 Flash mejor que Gemini 3.7 Flash?

En la evidencia publicada no hay un ganador global. Google reporta mayor precisión para 3.8 Flash, sobre todo en los benchmarks de coding y agénticos que destaca, y también documenta un mayor consumo de tokens. EvoLink no ha publicado resultados controlados de cargas de trabajo que conviertan esos hechos en una conclusión a nivel de tarea.

¿Es Gemini 3.8 Flash más caro que 3.7 Flash?

Sus tarifas introductorias por token en Google son las mismas hasta el 31 de diciembre de 2026. Aun así, una tarea en 3.8 puede costar más si consume más tokens de output o de thinking. El precio de tu cuenta de EvoLink debe comprobarse en la superficie de precios en vivo.

¿Qué pasa con los precios en 2027?

Google publica tarifas estándar a partir del 1 de enero de 2027: $1.50 por millón de tokens de input, $7.50 por millón de tokens de output y $0.15 por millón de tokens de lectura de caché. Vuelve a comprobar los precios de Google y de EvoLink antes de esa fecha.

¿Tienen los modelos ventanas de contexto distintas?

No. Google documenta un límite de entrada de 1,048,576 tokens y un output máximo de 65,536 tokens para ambos.

¿Gemini 3.8 Flash admite el nivel de thinking minimal?

No. Los valores admitidos son low, medium y high, con medium por defecto. La referencia de la API nativa de EvoLink indica que un minimal no soportado se degrada automáticamente a low, así que fija low de forma explícita en lugar de depender de esa degradación.

¿Puedo reutilizar el contenido cacheado al pasar de 3.7 a 3.8?

No asumas que el contenido cacheado es portable entre versiones del modelo. Vuelve a crear las cachés específicas del modelo y arranca las evaluaciones de migración con estado limpio.

¿Debo sustituir 3.7 Flash de inmediato?

No hay ninguna sustitución automática justificada. Ejecuta un replay y un canary, y promociona 3.8 solo en las cargas de trabajo en las que supere las umbrales de calidad, coste y latencia escritas de antemano.

Sí. El catálogo de productos de EvoLink incluye ambas rutas de modelo detrás de su API unificada. Mantén la selección de modelo explícita, verifica el acceso y el precio en vivo en tu cuenta, y conserva 3.7 como vía de rollback durante la ventana de evaluación. La documentación de la Gemini API de EvoLink lista gemini-3.8-flash en el enum de modelos tanto del endpoint nativo como del compatible con OpenAI.

Fuentes y notas de verificación

Los hechos oficiales, los precios y las reglas de petición de EvoLink se volvieron a comprobar el 3 de septiembre de 2026. Las descripciones de benchmarks son datos reportados por el proveedor salvo que se indique explícitamente lo contrario; los resultados en producción siguen dependiendo de cada carga de trabajo. La documentación de EvoLink lista gemini-3.8-flash en ambos endpoints; el acceso a nivel de cuenta debe verificarse igualmente antes del despliegue en producción.

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.