MiniMax H3 (Hailuo 3) ya está en EvoLinkPruébalo con 10 créditos gratis
Cuatro niveles de Thinking de Gemini 3.6 Flash representados como etapas de razonamiento crecientes
analysis

Niveles de Thinking de Gemini 3.6 Flash: costes medidos

Jacey
Jacey
Founder
22 de julio de 2026
29 min de lectura
Última verificación: 2026-07-21. Escrito por el equipo de investigación del modelo EvoLink. Los números en esta página provienen de 406 llamadas API que realizamos el día del lanzamiento; el método se describe en su totalidad a continuación. EvoLink crea una infraestructura de modelos de IA para equipos de producción y los modelos medidos aquí se ejecutan en ella.
La versión corta
  • minimal costó un 73.6% menos que el medium predeterminado en nuestras nueve tareas representativas de producción y obtuvo la misma puntuación de nueve sobre nueve. Si nunca has elegido un nivel, este es tu mayor mecanismo de ahorro.
  • Los tokens de pensamiento fueron 75% de la factura total en medium, contando los tokens de entrada. La longitud de las respuestas apenas cambió en los cuatro niveles, por lo que casi cada dólar de diferencia entre los niveles es pensamiento.
  • low no gasta un presupuesto fijo. En las nueve ejecuciones de extracción estructurada, emitió exactamente cero tokens de pensamiento, lo que hace que cueste lo mismo que minimal allí, sin dejar de pensar en llamadas a herramientas y tareas de código.
  • Por encima de low, pensar más no produjo más respuestas correctas en nuestra ronda más difícil. Las puntuaciones fueron 2, 10, 10 y 8 de 15 para minimal, low, medium y high.
  • El valor predeterminado no es incorrecto, simplemente no está dirigido. medium es una configuración intermedia razonable para trabajos desconocidos. Una vez que conozcas la forma de tu trabajo, vale la pena establecer el nivel deliberadamente.
  • Todos los puntos de referencia publicados para este modelo se ejecutan en high, mientras que la API predeterminada es medium. Esas son facturas diferentes y latencias diferentes.

La respuesta corta, por nivel

El nivel de pensamiento es la variable de costo más grande en una solicitud Gemini 3.6 Flash, mayor que la elección entre Gemini 3.6 Flash y Gemini 3.5 Flash. Los tokens de pensamiento se facturan según la tasa de salida y superan en número a los tokens de respuesta en aproximadamente seis a uno en la configuración predeterminada.

Esto es lo que nos costó cada nivel al completar una vez las mismas nueve tareas y en qué tipo de trabajo justificó ese gasto.

NivelCosto por pasadaFrente al medium predeterminadoÚsalo cuando
minimal$0.015873.6% más baratoExtracción, clasificación, enrutamiento, ubicación de códigos y cadenas de herramientas que solo tienen que seguir el script
low$0.023261.2% más baratoEl mismo trabajo, más llamadas a herramientas de varios pasos en las que es posible que el modelo tenga que recuperarse de algo que sale mal.
medium (predeterminado)$0.0598referenciaAún no conoces la composición de tu tráfico o el trabajo varía demasiado como para definirla
high$0.06539.3% másResérvalo. En nuestras tareas, la mayor parte del presupuesto adicional no se utilizó y, en nuestra ronda difícil, obtuvo una puntuación inferior a medium
Esta tabla no puede garantizar que minimal sea suficiente para tu carga de trabajo. Lo fue para la nuestra, cuya composición describimos con detalle a continuación.

El número que nadie publica: tokens de respuesta contra tokens de pensamiento

Cada comparación de precios de este modelo que pudimos encontrar el día del lanzamiento trata los tokens de salida como un solo número. Eso fusiona dos cantidades que no se comportan en nada parecido, y una vez que las separas, la mayor parte de la confusión en torno a esta versión se resuelve.

Aquí hay un recorrido por nuestras nueve tareas, con el lado de salida dividido en los tokens que puede leer y los tokens que no.

ConfiguraciónTokens de respuestaTokens de ThinkingPorcentaje de Thinking en la salidaCosto por paseCorrectoLatencia promedio
3.6 Flash minimal1,16200%$0.01589/92.8s
3.6 Flash low1,0561,09551%$0.02329/93.3s
3.6 Flash medium (predeterminado)1,0805,94485%$0.05989/95.1s
3.6 Flash high1,0926,67986%$0.06539/95.3s
3.5 Flash medium1,0785,82784%$0.06929/95.1s
3.5 Flash high1,1137,18587%$0.08189/95.7s
3.5 Flash-Lite minimal (predeterminado)97700%$0.00368/91.8s
3.5 Flash-Lite high1,0978,28888%$0.02499/94.2s

Lea primero la columna del token de respuesta. En ocho configuraciones, dos modelos y cuatro niveles de pensamiento, se mantiene entre los tokens 977 y 1,162, y la cifra más alta de la columna pertenece a la configuración más barata. Los modelos producen respuestas de aproximadamente la misma extensión sin importar cuánto piensen primero.

Ahora lea la columna de pensamiento. Va desde cero hasta 8,288. Esa es toda la historia de su factura.

Aquí están los mismos datos que el dinero, dividiendo cada pase en lo que pagó por la entrada, por la respuesta y por el pensamiento, a las tasas de nivel estándar de Gemini 3.6 Flash de $1.50 por millón de tokens de entrada y $7.50 por millón de tokens de salida.

NivelEntradaRespuestaThinkingTotalPorcentaje de Thinking en la factura total
minimal$0.0071$0.0087$0.0000$0.01580%
low$0.0071$0.0079$0.0082$0.023235%
medium$0.0071$0.0081$0.0446$0.059875%
high$0.0071$0.0082$0.0501$0.065377%

En el nivel predeterminado, tres cuartas partes de lo que paga son razonamientos que nunca ve, en tareas en las que el nivel no influye en si la respuesta es correcta. Eso no es un defecto del modelo. Es lo que sucede cuando un valor predeterminado de propósito general cumple con una carga de trabajo específica.

Esto también explica por qué "el nuevo modelo guarda tokens" recibe respuestas contradictorias en público. La afirmación se refiere a los tokens de salida, los tokens de salida son en su mayoría tokens de pensamiento, y el recuento de tokens de pensamiento depende del nivel de pensamiento, lo cual casi nadie afirma. Una medición sin un nivel indicado no es reproducible.

Cómo medimos esto

Dos rondas, realizadas en 2026-07-21, el día en que se lanzaron ambos modelos.

Primera ronda: cuánto cuestan los niveles en el trabajo de producción ordinario. Nueve tareas en tres grupos de tres. Extracción estructurada de una factura, un archivo de registro y el HTML de una página de producto. Herramienta multivuelta que requiere de tres a cinco pasos frente a herramientas simuladas. Ubicación y reparación de código, donde la descripción de un error debe convertirse en un parche que se ejecute. Las entradas se ejecutaron aproximadamente entre tokens 1,000 y 4,000, por lo que esto cubre tamaños de solicitudes normales y no dice nada sobre el trabajo de contexto prolongado. Cada tarea se ejecutó tres veces en cada una de las ocho configuraciones de modelo y nivel de pensamiento: 216 llamadas, $1.03.
Segunda ronda: donde la calidad realmente falla. Escribimos 20 tareas deliberadamente más difíciles que cubren resolución de contradicciones, correlación entre registros, conversión de unidades de varios pasos, errores de funciones cruzadas y cadenas de herramientas más largas. Cada uno se ejecutó una vez en la configuración más débil y una vez en la más fuerte para clasificarlos por dificultad; Sólo las tareas en las que los más débiles fallaron y las más fuertes aprobaron contienen información sobre dónde difieren los niveles. Tres de los 20 calificaron. Esos tres se ejecutaron cinco veces en cada una de las seis configuraciones, que son llamadas 90. Luego volvimos a ejecutar todas las tareas de 20 tres veces en minimal para verificar si la clasificación se mantuvo, que es otra llamada de 60. La segunda ronda llegó a las llamadas 190 y $1.34.
Condiciones que aplican a todos los números de esta página.
  • Las llamadas se realizaron a través de OpenRouter con el proveedor anclado a Google AI Studio y se enviaron en serie en lugar de simultáneamente. La puerta de enlace no expone qué región atendió la solicitud, por lo que no podemos indicar una.
  • Los costos se calculan a partir de los precios de lista del nivel estándar de Google, no de la propia facturación de la puerta de enlace. La puerta de enlace tiene un nivel de descuento, y combinar los dos haría que nuestras cifras fueran incomparables con los precios publicados por Google.
  • No se establecieron parámetros de muestreo. temperature, top_p y top_k están obsoletos en Gemini 3.x y se aceptan y luego se ignoran, por lo que configurarlos no habría cambiado nada e implicaría que no habíamos leído la documentación. Si aún los configura en producción, el resto de los cambios en la interfaz de esta versión se tratan en nuestra Gemini 3.6 Flash guía de lanzamiento.
  • La calificación se basa en reglas, no en humanos. La corrección es una métrica de apoyo aquí, presente para descartar la explicación de que un nivel barato parece barato porque silenciosamente está haciendo menos trabajo.
  • Las fichas de respuesta y las fichas de pensamiento se registraron por separado para cada llamada, lo que hace posibles las tablas anteriores.
Una limitación honesta sobre las ejecuciones repetidas. Durante la primera ronda, la corrección nunca varió entre las tres repeticiones de una tarea: cada configuración obtuvo la misma puntuación en cada ejecución. Los recuentos de tokens de pensamiento variaron mucho, entre 6% y 51% para la misma tarea y nivel. Una tarea de código en high devolvió tokens de pensamiento 331, 538 y 347 en tres solicitudes idénticas. Por lo tanto, es necesario promediar tres ejecuciones para las cifras de costos y no es necesario para las cifras de exactitud. En la segunda ronda, donde las tareas se sitúan en el límite de lo que los modelos pueden hacer, esa estabilidad desaparece por completo, lo que tratamos como un hallazgo más que como una nota a pie de página.

Por qué los puntos de referencia publicados no responden a esta pregunta

Hay una razón documentada por la que nadie puede buscar esto. Las cifras de referencia en circulación se miden en niveles a los que no llega la mayor parte del tráfico de producción, y las fuentes rara vez lo dicen.

  • Artificial Analysis, actualmente la única fuente independiente con un desglose completo de este modelo, medido en high. La API predeterminada es medium.
  • La propia tabla de resultados de Google para Gemini 3.5 Flash-Lite se produjo en high pensando, mientras que la API predeterminada de ese modelo es minimal. Ejecutar la configuración predeterminada no es el experimento que describe la tabla.
  • En la tabla de comparación de Google, la fila DeepSWE ejecuta Gemini 3.5 Flash en medium y Gemini 3.6 Flash en high, por lo que las dos figuras de Géminis en esa fila no son una comparación del mismo nivel.
  • El título de Google "hasta 65% en DeepSWE" se refiere a una reducción en el uso de tokens, no a una puntuación. La puntuación DeepSWE es 49%.
La afirmación de eficiencia más citada tiene un problema similar. Google afirma que el nuevo modelo utiliza aproximadamente 17% menos tokens de salida, citando Artificial Analysis en lugar de su propia medición. Los recuentos absolutos de tokens publicados en esa misma página, 59 millones contra 75 millones, resultan en 21.3%. Las dos cifras no se han reconciliado públicamente y ninguna menciona un nivel de pensamiento o un conjunto de tareas. Usamos el 17% más conservador siempre que aparece el reclamo en nuestro trabajo, y lo tratamos como una entrada para la aritmética en lugar de una medida.

Nada de eso hace que las cifras publicadas sean erróneas. Les da respuestas a una pregunta diferente a "¿cuánto me costará esto en el nivel que realmente corro?".

Primera ronda: los niveles del trabajo ordinario

Tres resultados, en el orden en que importan.

minimal significa no pensar en absoluto, ni menos pensamiento. Los tokens de pensamiento arrojaron exactamente cero, no un número pequeño. En todas nuestras ejecuciones de minimal en Gemini 3.6 Flash, 101 de las llamadas a 102 arrojaron precisamente cero tokens de pensamiento. La única excepción es tan extraña que tiene su propia sección a continuación. Al mismo tiempo, la corrección se mantuvo sin cambios en nueve de nueve, y la latencia media cayó de 5.1 segundos a 2.8 segundos. En este conjunto de tareas, el nivel predeterminado no generó nada excepto una factura 3.8 veces más grande y una respuesta dos veces más lenta.
high costó solo 9.3% más que medium aquí, porque el presupuesto adicional no se gastó en gran medida: el pensamiento pasó de 5,944 a 6,679 tokens. Esto es un hecho sobre estas nueve tareas, no sobre el modelo. Dale trabajo que realmente necesite más razonamiento y la brecha se ampliará. No incluya esta relación en su propio pronóstico.
Ambos niveles de modelo nuevo resultaron más baratos que el nivel equivalente en Gemini 3.5 Flash, por 13.6% en medium y 20.1% en high. Casi todo ese ahorro proviene del recorte del precio de producción de $9.00 a $7.50 por millón de tokens, en lugar de la eficiencia de los tokens: en medium nuestros tokens de producción facturados en realidad aumentaron 1.7% frente al modelo anterior, y en high cayeron 6.4%. Si lo mismo se aplica a su tráfico depende de su relación entrada-salida, ya que el precio de entrada no cambió en absoluto, y nuestra Gemini 3.5 Flash calculadora de costos explica esa aritmética a través de ejemplos elaborados en el modelo anterior.

low es adaptable, no un presupuesto fijo más pequeño

Este es el resultado que no esperábamos y es el más directamente útil en esta página.

En low, Gemini 3.6 Flash dedicó su pensamiento de manera desigual a nuestros tres tipos de tareas. Fichas de pensamiento por pase:
grupo de tareasminimallowmediumhigh
Extracción estructurada002,6732,916
Llamadas a herramientas en varios turnos05491,7971,914
Localización y reparación de código05461,4741,849
En las tres tareas de extracción y durante las tres repeticiones, low generó exactamente cero tokens de pensamiento. Ese grupo costó $0.00490 con low, frente a $0.00489 con minimal: una diferencia de dos décimas de punto porcentual. En las llamadas a herramientas y la reparación de código, el mismo nivel consumió entre 100 y 440 tokens de pensamiento por tarea.
La consecuencia práctica: si tu tráfico combina extracción y trabajo de varios pasos bajo una sola configuración de modelo, low mantiene un costo cercano al de minimal en la parte de extracción y conserva una reserva de razonamiento para el resto. No necesitas dividir el tráfico entre dos configuraciones para obtener la mayor parte del ahorro. En nuestro conjunto de tareas, esa combinación costó un 61.2% menos que el valor predeterminado.
Una advertencia sobre el alcance: describimos lo que hizo una configuración en nueve tareas durante un día, no un comportamiento documentado por Google. Informamos de la observación sin afirmar que conocemos el mecanismo que la produce. No construiríamos un sistema que dependiera de que low nunca use tokens de pensamiento en tareas de extracción sin comprobarlo antes con nuestros propios prompts.

Segunda ronda: donde la calidad realmente se rompe

La primera ronda no pudo responder a la pregunta sobre la calidad, porque cada configuración obtuvo nueve puntos sobre nueve. Nueve tareas no eran lo suficientemente difíciles como para separar cuatro niveles. Así que los hicimos más difíciles y la respuesta que obtuvimos no fue la que implican los niveles.

Primero, el resultado de la clasificación, que ya es un hallazgo por sí mismo. De 20 tareas deliberadamente difíciles, minimal resolvió correctamente 17 en los tres intentos: reconciliar tres cifras contradictorias de una factura y volver a calcularlas, relacionar tres registros de solicitud intercalados en una sola cadena de fallos, aplicar la metarregla «el documento firmado más tarde prevalece» a cláusulas contractuales en conflicto, convertir varias divisas y periodos, localizar un fallo de clave de caché que abarca dos funciones y detectar un fallo del limitador de tasa que solo aparece en la tercera llamada. Resolvió todas ellas sin gastar un solo token de pensamiento. Las mismas tareas consumieron entre 1,100 y 6,900 tokens de pensamiento en high.

De modo que el nivel de pensamiento no compra la corrección del razonamiento, al menos no en el rango que ocupan estas tareas. Lo que compra es algo más estrecho.

Las tres tareas que separaron los niveles fueron llamadas de herramientas de múltiples turnos y compartían una forma específica: algo sale mal en la mitad y el modelo tiene que agregar una acción que no estaba en el plan original. Interceptar un paquete antes de que se pueda cambiar la dirección. Vuelva a intentarlo una vez después de una respuesta de límite de velocidad. Regrese un envío a la etiqueta original después de que uno acelerado no se imprima. Las tareas que requerían negarse a actuar o elegir correctamente entre las opciones ofrecidas se manejaban en minimal cada vez, incluida una cadena de ocho pasos de largo.

Así es como las seis configuraciones obtuvieron puntajes en esas tres tareas, cinco intentos cada una.

ConfiguraciónTarea 1Tarea 2Tarea 3TotalCosto por llamada
3.6 Flash minimal1/50/51/52/15$0.00175
3.6 Flash low4/51/55/510/15$0.00553
3.6 Flash medium (predeterminado)5/55/50/510/15$0.00674
3.6 Flash high5/52/51/58/15$0.00739
3.5 Flash-Lite minimal (predeterminado)4/55/50/59/15$0.00068
3.5 Flash-Lite high2/55/53/510/15$0.00262

El costo por llamada excluye una solicitud anómala descrita en la sección siguiente; allí se indican también los totales que la incluyen.

Hay exactamente un paso real hacia adelante, y es de minimal a low. Dos de 15 se convierten en diez de 15. Pasado ese punto la línea es plana y luego se dobla hacia abajo: diez, diez, ocho.
Por tarea, la imagen es más desordenada de lo que sugieren los totales. La tarea 1 mejora claramente a medida que aumenta el nivel. La tarea 2 necesita que medium sea confiable y luego vuelve a dos de cinco en high. La tarea 3 se ejecuta completamente al revés, obteniendo cinco de cinco en low, cero de cinco en medium y uno de cinco en high. Pensar más empeoró esa tarea, de manera consistente, en cinco intentos cada uno.
No vamos a explicar por qué, porque no lo sabemos. Lo que el patrón respalda es una afirmación más estrecha y defendible: en tareas en el límite de la capacidad de un modelo, el nivel no es un dial de calidad que puedas subir. Más allá de low, las diferencias que medimos son menores que la variación entre ejecuciones idénticas.
Esa inestabilidad es, por sí sola, el hallazgo más transferible. En la primera ronda, la corrección no varió entre repeticiones de la misma tarea en ninguna de las 216 llamadas. En la segunda, la mayoría de las celdas de la tabla muestran valores como uno de cinco o cuatro de cinco. La misma solicitud, enviada cinco veces al mismo nivel, produjo respuestas distintas. Cualquier evaluación que ejecute cada configuración una sola vez también mide ruido; esto incluye nuestro pase inicial de clasificación de dificultad, ejecutado una vez por configuración de forma deliberada. Al repetir tres veces las tareas clasificadas con minimal, 17 de 20 se confirmaron claramente, pero una tarea marcada como fallo en la ejecución única solo acertó una de tres veces. Esa es exactamente la variación que describimos.

La consecuencia de ingeniería es más útil que una recomendación de nivel. Si su agente tiene que recuperarse de estados inesperados, incorpore el reintento y la verificación en su aplicación y trate el nivel de pensamiento como una configuración de costos en lugar de lo que hace que la recuperación sea confiable.

Gemini 3.6 Flash low contra Gemini 3.5 Flash-Lite

Esta comparación no tiene datos publicados en ninguna parte que podamos encontrar, y es a la que realmente se enfrenta un equipo preocupado por los costos: por aproximadamente el mismo dinero, ¿ejecuta el modelo más potente con un poco de reflexión, o el modelo más barato pensando mucho?

En la primera ronda costaron casi lo mismo. Gemini 3.6 Flash en low era $0.0232 por pasada; Gemini 3.5 Flash-Lite en high era $0.0249. Ambos obtuvieron nueve puntos sobre nueve. Gemini 3.6 Flash en low fue más rápido, en 3.3 segundos frente a 4.2 segundos de latencia promedio, y alcanzó esa puntuación en 1,095 tokens de pensamiento donde Flash-Lite necesitaba 8,288.
En la segunda ronda, las tareas de llamada de herramientas más difíciles, volvieron a empatar en diez de 15, pero los precios se separaron: Flash-Lite en high costó $0.00262 por llamada frente a $0.00553. En ese conjunto de tareas, el modelo más barato que pensó detenidamente costó menos de la mitad del precio por el mismo puntaje.

Cuál de esas dos imágenes se aplica a usted depende de su combinación de tareas, y esa es la respuesta honesta y no una protección. Las dos configuraciones están en la misma banda de rendimiento en nuestras dos rondas. La relación de precios entre ellos no es estable en todos los conjuntos de tareas.

Dos observaciones más de los mismos datos, que vale la pena conocer antes de utilizar Flash-Lite de forma predeterminada.

El nivel minimal predeterminado en Flash-Lite falló en una tarea de manera específica y repetible. En una cadena de notificación de tres pasos, llamó a las dos primeras herramientas y luego se detuvo sin enviar la notificación, tres de cada tres veces, con una firma idéntica cada vez. Esa fue la única diferencia de calidad en todas las 216 llamadas de la primera ronda. También reproduce una limitación que el propio Google documenta: el valor predeterminado minimal se describe como inadecuado para el uso autónomo de subagente porque finaliza las llamadas a la herramienta prematuramente. Si ejecuta Flash-Lite como agente, aumente el nivel o espere ese error.
Los niveles más bajos de los dos modelos fallan de manera diferente y ninguno es uniformemente más fuerte. En las tareas de llamada de herramientas de la segunda ronda, Flash-Lite en minimal obtuvo nueve de 15 contra dos de Gemini 3.6 Flash de 15. En la cadena de notificación de la primera ronda, esa relación se invirtió: Gemini 3.6 Flash en minimal pasó tres de cada tres veces, donde Flash-Lite falló tres de cada tres veces. Aquí no hay ningún orden, sólo dos formas de falla diferentes, y un nivel que es seguro para el tráfico de un modelo no lo es automáticamente para el del otro.

Una anomalía que no podemos explicar

En la segunda ronda, una llamada a minimal devolvió 62,916 tokens de pensamiento.
Todas las demás llamadas minimal en nuestros datos arrojaron exactamente cero. Este usó cinco giros de herramienta, produjo una salida cercana al techo de salida 65,536-token del modelo, tomó 209 segundos y costó $0.48. Eso es aproximadamente 270 veces lo que cuestan las otras llamadas en ese nivel, y casi todo el $0.50 que esa configuración gastó en toda su ronda 15-call. También fue la única vez que minimal hizo bien esa tarea en particular.
Informamos esto porque sucedió y porque es importante para cualquiera que haga un presupuesto en minimal. No vamos a ofrecer un mecanismo, porque no lo tenemos. La tarjeta modelo de Google enumera respuestas lentas ocasionales entre las limitaciones conocidas del modelo, pero no podemos conectar esa nota con esta observación con confianza.
La conclusión operativa no tiene explicación: si ejecuta minimal en el trabajo de llamada de herramientas, establezca un límite máximo de token de salida y un tiempo de espera. No es lo mismo un nivel que normalmente gasta cero fichas de pensamiento que un nivel que no puede gastar ninguna.

Qué nivel para qué tarea

Esta es la tabla que conviene conservar. Cada fila está respaldada por las dos rondas descritas anteriormente; los límites de esa evidencia se indican debajo.

Tipo de trabajoNivelPor qué
Extracción, clasificación, respuesta a preguntas, localización y reparación de código en un solo turnominimal17 de 20 tareas deliberadamente difíciles se resolvieron correctamente en los tres intentos, al 26% del costo predeterminado
Llamadas a herramientas de varios pasos que solo tienen que seguir el plan o rechazar una acción.minimal es suficienteUna cadena de ocho pasos, encontrar la excepción en un lote, rechazar una solicitud fuera de política y elegir la fuente de datos autorizada, todo pasó tres de cada tres veces.
Llamadas a herramientas en varios pasos donde el modelo puede necesitar una acción que no estaba en el plan: reintentar, revertir o interceptar de forma preventivalow como mínimominimal obtuvo 2/15 justo en estas tareas; low obtuvo 10/15
El mismo caso, pero necesitas fiabilidadNingún nivel lo resuelvelow, medium y high obtuvieron 10, 10 y 8 de 15. Las diferencias son menores que la variación entre ejecuciones. Resuélvelo con reintentos y verificación en la aplicación
Tráfico mixto bajo una sola configuraciónlowUsó cero tokens de pensamiento en nuestras tareas de extracción y conservó una reserva para el resto, con un costo un 61.2% inferior al predeterminado
Aún no conoces la composición de tu tráficomedium, luego mideEl valor predeterminado es un punto de partida razonable. Solo resulta caro cuando ya sabes que no lo necesitas
El límite de este consejo. Se basa en 29 tareas diseñadas por nosotros: nueve ordinarias y 20 difíciles, todas con entradas inferiores a unos 4,000 tokens. No abarca contexto largo, entradas multimodales, escritura creativa ni investigación abierta. Otro conjunto de tareas puede producir respuestas diferentes, y tenemos evidencia directa: al comparar si Gemini 3.6 Flash usa más o menos tokens de pensamiento que Gemini 3.5 Flash en medium, la prueba independiente de aibenchy midió un 66.2% más y nosotros un 2.0% más. Sus 22 preguntas breves de benchmark y nuestras tareas de extracción, llamadas a herramientas y código dieron respuestas opuestas a la misma pregunta. No es una disputa que haya que resolver: el hallazgo es que el ahorro de tokens depende de la carga de trabajo, no solo del modelo.

Midiendo esto en tu propio tráfico

Cuatro pasos, en el orden que le permita obtener una respuesta más rápidamente.

  1. Registra los tokens de pensamiento por separado hoy, antes de cambiar nada. La API de Google devuelve el recuento en total_thought_tokens, junto con el nivel que estableciste. Si solo realiza un seguimiento de los tokens de producción total, no puede distinguir una regresión rápida de un nivel que decidió pensar más esta semana.
    from google import genai
    from google.genai import types
    
    client = genai.Client()  # reads the API key from the environment
    
    response = client.models.generate_content(
        model="gemini-3.6-flash",
        contents=prompt,
        config=types.GenerateContentConfig(
            thinking_config=types.ThinkingConfig(thinking_level="minimal"),
        ),
    )
    
    log.info(
        "level=minimal thinking_tokens=%s",
        response.usage_metadata.total_thought_tokens,
    )
Almacene el recuento de pensamiento como su propio campo junto a su métrica de token de salida existente y almacene el nivel que envió junto con él. Sumar los dos recuentos de fichas descarta la única señal que indica cuál se movió. 2. Establezca el nivel explícitamente, incluso si lo establece en medium. Un valor predeterminado heredado es una decisión de costos que nadie tomó. También significa que su factura puede moverse cuando se mueve un valor predeterminado. 3. Reproduzca un día de tráfico real en minimal y en low y compare los resultados con los actuales en lugar de con un punto de referencia. En nuestras tareas, esa comparación valió la pena entre 61% y 74% de la factura, lo cual es un efecto mayor que cualquier intercambio de modelo disponible en este nivel. 4. Califique las rutas de llamada de herramientas por separado de todo lo demás. Ese es el único lugar donde encontramos la corrección del cambio de nivel, y promediarlo junto con el tráfico de extracción lo ocultará.

Realizar esa comparación entre varios modelos generalmente significa una integración separada por proveedor, y ese costo de integración es la razón más común por la que los equipos omiten la medición por completo. La estandarización en un punto final compatible con OpenAI lo elimina, por lo que la cadena del modelo se convierte en lo único que cambia entre ejecuciones.

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.evolink.ai/v1",
    api_key=os.environ["EVOLINK_API_KEY"],
)

for model in ("gemini-3.6-flash", "gemini-3.5-flash-lite"):
    response = client.chat.completions.create(model=model, messages=messages)
    record(model, response.usage)
EvoLink es una infraestructura de modelo de IA para equipos de producción, y este tipo de medición es parte de su finalidad: el uso se informa por solicitud, por lo que puede mantener las columnas de respuesta y pensamiento separadas de la primera ejecución. El lugar donde se ejecuta la comparación importa mucho menos que ejecutarla.

Preguntas frecuentes

¿Cuál es el nivel de pensamiento predeterminado para Gemini 3.6 Flash? medium. Los valores seleccionables son minimal, low, medium y high. Gemini 3.5 Flash-Lite tiene como valor predeterminado minimal, por lo que los dos modelos se comportan de manera muy diferente desde el primer momento.
¿Puedo dejar de pensar por completo? minimal es la configuración más baja disponible, y la documentación de Google describe el pensamiento como activado de forma predeterminada para este modelo en lugar de algo que usted desactiva. En la práctica, minimal devolvió exactamente cero tokens de pensamiento en 101 de nuestras llamadas a 102, por lo que se comporta como desactivado a efectos de facturación en la mayoría de las solicitudes. La única excepción está documentada arriba, por lo que no la describiríamos como una garantía.
¿Se facturan los tokens de pensamiento? Sí, a la tarifa de salida. La documentación de Google establece que el precio de una respuesta es la suma de los tokens de salida y los tokens de pensamiento. Con una tarifa de $7.50 por millón de tokens de salida en Gemini 3.6 Flash y una proporción de pensamiento equivalente al 85% de los tokens de salida en el nivel predeterminado, los tokens de pensamiento representan la mayor parte de la factura.
¿Cuánto más barato es minimal que el predeterminado? En nuestro conjunto de nueve tareas, minimal fue un 73.6% más barato por pasada, con la misma corrección de nueve sobre nueve y aproximadamente la mitad de latencia. La proporción dependerá de cuánto haga pensar tu carga de trabajo al modelo en medium; tómala como una razón para medir, no como una cifra para pronosticar.
¿Un nivel de pensamiento más alto hace que el modelo sea más preciso? No de manera confiable, en lo que medimos. De minimal a low hubo un claro avance en la llamada de herramientas de varios pasos, de dos de 15 a diez de 15. Por encima de low, las puntuaciones fueron diez, diez y ocho de 15, y una tarea obtuvo peor puntuación en niveles más altos en cinco intentos cada una. En tareas de un solo turno con mucho razonamiento, minimal resolvió 17 de 20 problemas difíciles sin ningún token de pensamiento.
¿Qué nivel de pensamiento utilizan los puntos de referencia publicados? Artificial Analysis se publica en high, y la tabla de resultados Flash-Lite de Google también se produjo en high, mientras que la API predeterminada de ese modelo es minimal. Si ejecuta los valores predeterminados, no está ejecutando la configuración que describen esos números.
¿Cómo puedo ver cuántos tokens de pensamiento utilizó una solicitud? Lea total_thought_tokens de la respuesta. Regístrelo como su propio campo junto a los tokens de salida en lugar de sumarlos, o no podrá atribuir un cambio de costo más adelante.
¿El nivel de pensamiento cambia la longitud de la respuesta? Apenas. En ocho configuraciones que cubren dos modelos y cuatro niveles, los tokens de respuesta permanecieron entre 977 y 1,162 por pasada en nuestro conjunto de tareas. El nivel cambia lo que hace el modelo antes de responder, no cuánto escribe.

Fuentes

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.