Seedance 2.5 ya está disponible en EvoLinkProbar Seedance 2.5
Dos rutas de IA iluminadas que atraviesan una pasarela de producción oscura
Comparación

Gemini 3.7 Flash vs Gemini 3.6 Flash: ¿conviene actualizar?

EvoLink Team
EvoLink Team
Product Team
14 de agosto de 2026
8 min de lectura

La respuesta corta

Gemini 3.7 Flash cuesta exactamente lo mismo que Gemini 3.6 Flash. No hay argumento de precio en ninguna dirección: mismas tarifas de input, output y caché, el mismo contexto de 1,048,576 tokens y los mismos endpoints. Eso deja una decisión inusualmente limpia: cambias esfuerzo de migración por capacidad, sin ninguna partida de presupuesto que defender.
Actualiza si tu carga de trabajo es de coding o de agentes multi-paso, que es donde los benchmarks publicados por Google muestran la mayor mejora. Quédate de momento en 3.6 si haces clasificación o extracción de alto volumen con el nivel de thinking minimal, porque ese nivel ya no existe en 3.7 — para esos pipelines la respuesta honesta no es 3.7, es Gemini 3.5 Flash-Lite.

Todo lo que viene a continuación es lo que conviene verificar antes de comprometerse.

Qué cambió de verdad

Gemini 3.7 Flash no es un modelo preentrenado nuevo. La model card de Google lo describe como mejoras algorítmicas sobre la base de razonamiento de Gemini 3.6 Flash, publicadas tres semanas después. Ese matiz importa para decidir la actualización: hay que esperar deriva de comportamiento dentro de la misma familia, no un modelo distinto con modos de fallo distintos.
Las mejoras publicadas por Google se concentran en tres frentes: coding de producción (FrontierCode), ingeniería de software de horizonte largo (DeepSWE) y ejecución agéntica (Terminal-bench, AutomationBench), donde el benchmark agéntico llega prácticamente a duplicarse. Las cifras completas y las advertencias sobre la atribución del proveedor están en el análisis del lanzamiento de Gemini 3.7 Flash; son números del propio Google y en el momento del lanzamiento no existía réplica independiente.
Lo que no cambió: precio, ventana de contexto, output máximo, modalidades soportadas y los endpoints a los que llamas. Por tanto, migrar es sobre todo cambiar el ID del modelo y hacer limpieza de parámetros.

¿La migración de 3.6 a 3.7 es transparente?

No del todo. Según la checklist oficial de migración de Google, hay cuatro cosas que rompen:

  • El nivel de thinking minimal desaparece. Los niveles son low, medium (por defecto) y high. Enviar minimal a la Gemini API devuelve error.
  • Hay que eliminar temperature, top_p, top_k y candidate_count de la configuración de generación.
  • El thinking_budget numérico se sustituye por el string thinking_level.
  • Hay que eliminar los turnos de modelo prellenados.
En EvoLink, las peticiones que todavía envían reasoning_effort: "none" o "minimal" se degradarán a low en lugar de fallar, así que una migración por fases no se romperá en caliente mientras actualizas los puntos de llamada.

Los cambios de comportamiento que merece la pena probar

Los benchmarks te dicen dónde mejoró un modelo en las tareas de otra persona. Estos son los cambios con más probabilidad de aparecer en las tuyas:

Consumo de tokens por tarea. Que la tarifa sea la misma no significa que la factura lo sea. Algunos informes del día del lanzamiento observaron mayor consumo de tokens por tarea en 3.7 que en 3.6, algo plausible en un modelo ajustado para razonar más. Como los tokens de thinking se facturan a la tarifa de output, un modelo que piensa más puede salir más caro por tarea con un precio por token idéntico. Mide tokens totales por resultado aceptado, no por petición.
Tu escalón más barato acaba de encarecerse. Si venías usando minimal, tu nuevo suelo es low. En un pipeline de clasificación de alto volumen esa diferencia se acumula en cada llamada, y es la razón más habitual por la que una carga en 3.6 no debería pasar a 3.7.
Seguimiento de instrucciones y disciplina factual. Google indica que la seguridad y el tono son comparables a los de 3.6 Flash. Un tracker independiente midió una tasa de alucinación más alta en 3.7 durante el lanzamiento. Ninguna de las dos cosas es un veredicto sobre tus prompts: son un motivo para pasar tu propio set de regresión antes de promocionarlo.
Comportamiento del bucle de agente. La promesa principal son menos bucles de agente fallidos y mejor recuperación cuando el agente se atasca. Si ejecutas agentes, este es el cambio que conviene instrumentar: cuenta reintentos, tool calls inválidas y ejecuciones abandonadas, no solo la calidad de la respuesta final.

Cuándo quedarse en 3.6 Flash es la decisión correcta

  • Dependes del thinking minimal. Evalúa 3.5 Flash-Lite en lugar de pagar el suelo de low en cada llamada.
  • Tu carga es simple, crítica en latencia y de alto volumen. Razonar más no es gratis; una ruta de gama Lite suele ganar.
  • Tienes un pipeline validado y congelado, sin dolor en coding ni en agentes. Sin incentivo de precio, actualizar un sistema estable solo te compra trabajo de revalidación y poco más.
  • Ahora mismo no puedes permitirte una ventana de regresión. Tres semanas entre lanzamientos sugieren que llegará otro modelo; no hay penalización por agrupar tu validación.

Una evaluación reproducible

Rutas oscuras de evaluación en producción con puertas de validación y vía de reversión
Rutas oscuras de evaluación en producción con puertas de validación y vía de reversión
Como el precio es idéntico, la única pregunta que vale la pena responder es si 3.7 termina tus tareas mejor por token. Cuatro pasos:
  1. Congela una línea base. Captura entre 50 y 200 peticiones reales en 3.6 Flash con telemetría completa: tokens de input, tokens de output, tokens de thinking, aciertos de caché, validez de las tool calls, reintentos y correcciones humanas.
  2. Repite contra 3.7. Mismos prompts, mismas herramientas, mismo nivel de thinking (mapea minimallow de forma explícita para saber qué estás comparando). Cambia una variable cada vez.
  3. Lanza 3.7 como retador. Enruta una porción del tráfico real y compara por tasa de tareas aceptadas y coste total por tarea aceptada, no por precio por petición, que es idéntico por definición.
  4. Fija de antemano los umbrales de promoción y rollback. Decide qué números convertirían a 3.7 en tu opción por defecto y qué números te harían volver atrás, antes de mirar los resultados.

Ambos modelos siguen disponibles al mismo precio en los mismos endpoints, así que el rollback es un cambio de ID de modelo sin ninguna consecuencia comercial.

Mantener 3.6 y 3.7 en paralelo es justo el sentido de un gateway: una key, un cliente, dos IDs de modelo y un interruptor que no cuesta nada revertir. Llama a gemini-3.7-flash para la porción de tráfico del retador y deja gemini-3.6-flash sirviendo producción hasta que se cumplan tus umbrales.
Páginas de modelo con tarifas actuales y ejemplos de código: Gemini 3.7 Flash · Gemini 3.6 Flash · todos los modelos Gemini.

Preguntas frecuentes

¿Es Gemini 3.7 Flash mejor que Gemini 3.6 Flash?

En los benchmarks publicados por Google, sí, sobre todo en coding y ejecución agéntica. Son cifras reportadas por el proveedor, y un tracker independiente midió una tasa de alucinación más alta durante el lanzamiento, así que verifica con tus propias tareas antes de cambiar los valores por defecto.

¿Es Gemini 3.7 Flash más caro que 3.6 Flash?

No. Ambos comparten la misma tarifa, incluido el precio introductorio hasta el 31 de diciembre de 2026. Tu factura sí puede cambiar si 3.7 consume más tokens por tarea, ya que los tokens de thinking se facturan a la tarifa de output.

¿Tengo que tocar código para migrar de 3.6 a 3.7?

Básicamente el ID del modelo, además de eliminar temperature, top_p, top_k y candidate_count, sustituir el thinking_budget numérico por el string thinking_level y quitar los turnos de modelo prellenados.

¿Qué sustituye al nivel de thinking minimal?

low es el nuevo suelo en 3.7 Flash. Para clasificación y extracción de alto volumen sensibles al coste, Gemini 3.5 Flash-Lite suele ser mejor ruta que pagar low en cada llamada.

¿Debo actualizar si solo hago chat sencillo o clasificación?

Normalmente no. Las mejoras se concentran en coding y agentes multi-paso; el trabajo simple de alto volumen se cubre mejor con un modelo de gama Lite.

¿Puedo usar Gemini 3.7 Flash y 3.6 Flash a la vez?

Sí. Comparten endpoints y precio, así que puedes enrutar una porción del tráfico a 3.7 como retador y hacer rollback cambiando el ID del modelo.

¿Se va a retirar Gemini 3.6 Flash?

Google no ha anunciado fecha de retirada para Gemini 3.6 Flash. Sigue disponible al mismo precio junto a 3.7 Flash.

¿Cuánto tiempo tengo antes de que cambie el precio?

Las tarifas introductorias se aplican a ambos modelos hasta el 31 de diciembre de 2026, con tarifas estándar a partir del 1 de enero de 2027, así que la decisión de actualizar y la fecha límite de precio son independientes entre sí.

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.