Kimi K3 ya está disponibleDescubrir Kimi K3

Gemini 3.6 Flash API

Google-Generación de texto-desde $1.350 / 1M tokens de entrada$1.500 precio oficial-Disponible
Contexto de 1MSalida predeterminada de 65KCaché de promptsChat + Gemini API
Production routeLive
Proveedor
Google
Modelo
3.6 Flash
Ventana de contexto
1.048.576 tokens
Protocolos
Chat + Gemini

Elegir Gemini 3.6 Flash

El modelo de trabajo de gama Flash más reciente de Google para programación rentable, flujos de trabajo con agentes, trabajo de conocimiento y razonamiento multimodal, con mejor eficiencia de tokens que Gemini 3.5 Flash y una ventana de contexto de 1M tokens.

Gemini 3.6 Flash

Modelo de trabajo de gama Flash de Google

Seleccionado
Desde $1.350 / 1M tokens de entrada$1.500 precio oficialgemini-3.6-flash
Ideal para

Programación de producción y refactorización full-stack, agentes de varios pasos y orquestación, análisis de documentos y gráficos, y cargas de trabajo de gran volumen donde una mejor eficiencia de tokens reduce el coste por tarea completada.

Entrada
$1.350 / 1M-10%
91.8 cr / 1M$1.500precio oficial
Lectura de caché
$0.136 / 1M-10%
9.2 cr / 1M$0.150precio oficial
Salida
$6.750 / 1M-10%
459 cr / 1M$7.500precio oficial

Gemini 3.6 Flash pricing

Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.6 Flash rate.

3.6 Flash

Token calculator

Enter the token mix for one request.

Estimated request cost

Gemini 3.6 Flash
Official rate
USD$0.0035
Credits0.2314
Input tokens0.0918 cr
Cache read tokens0.0019 cr
Output tokens0.1377 cr

Minimum charge: 0.01 credits per request.

EvoLink vs Google direct

Same token mix, default group price.
-10%
EvoLink estimate$0.0035
Google official$0.0038
You save$0.0004

Budget guide

Approximate requests using the current token mix.
Add credits
$10
About 2938 requests

For quick testing

$50
About 14693 requests

For regular development

$100
About 29386 requests

For production evaluation

Model pricing

Gemini 3.6 Flash

All context sizes
Input tokens
$1.350 / 1M-10%
91.8 cr / 1M$1.500official price
Cache read tokens
$0.136 / 1M-10%
9.2 cr / 1M$0.150official price
Output tokens
$6.750 / 1M-10%
459 cr / 1M$7.500official price

USD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.

API de Gemini 3.6 Flash para código y flujos de agentes rentables

Llama al nuevo modelo de gama Flash de Google a través de la API unificada de EvoLink. Gemini 3.6 Flash mejora el código, el trabajo de conocimiento y el razonamiento multimodal con mejor eficiencia de tokens que Gemini 3.5 Flash, además de una ventana de contexto de 1.048.576 tokens, caché de prompts, salida estructurada y uso de herramientas, a $1,50 / $7,50 por millón de tokens de entrada / salida.

Gemini 3.6 Flash
Casos de uso de Gemini 3.6 Flash

Dónde se gana Gemini 3.6 Flash un lugar en una arquitectura de modelos de producción

Google posiciona Gemini 3.6 Flash como un caballo de batalla: mejor código, trabajo de conocimiento y rendimiento multimodal, con una eficiencia de tokens notablemente superior a la de Gemini 3.5 Flash. Encaja mejor en trabajo de producción donde un razonamiento suficientemente bueno a menor coste de tokens supera pagar por un nivel premium.

Código y refactorización rentables

Gemini 3.6 Flash apunta al código diario, el prototipado y la refactorización full-stack con menos tokens y menos llamadas al modelo que Gemini 3.5 Flash. Es el modelo de agente por defecto de Google en Antigravity. Mida parches aceptados y tiempo de revisión, no la calidad de fragmentos aislados.

Flujos de trabajo con agentes y orquestación

Encaja en orquestación de varios pasos, selección de herramientas, salida estructurada y ejecución de código, donde un menor coste por llamada se acumula a lo largo de ejecuciones de agente prolongadas. Conserve mensajes completos del asistente, IDs de llamadas, argumentos y resultados entre turnos.

Trabajo de conocimiento y razonamiento multimodal

Úselo para análisis de documentos, interpretación de gráficos y generación de maquetas web con varios elementos en un contexto de 1M tokens. La recuperación y la estructura documental siguen importando: una ventana de 1M no vuelve útil el contexto irrelevante.

Cuándo otra ruta es la mejor opción

La clasificación y extracción triviales, sensibles a la latencia o de gran volumen suelen encajar mejor en el más barato Gemini 3.5 Flash-Lite. Envíe el razonamiento más difícil a un modelo de nivel Pro. Escale a 3.6 Flash solo cuando su eficiencia reduzca de verdad el coste por tarea aceptada.

Señales del día de lanzamiento

Qué sugieren las primeras reacciones a Gemini 3.6 Flash y qué falta por demostrar

Gemini 3.6 Flash se lanzó el 2026-07-21. Trate las reacciones de la comunidad del día de lanzamiento como hipótesis que verificar en sus propias tareas, herramientas, presupuestos y criterios de aceptación, no como benchmarks establecidos.

La eficiencia de tokens y el menor coste de salida son el titular

Las páginas de API de Google y de terceros destacan menos tokens, menos llamadas al modelo y menos rodeos, con la salida a $7,50 por millón frente a $9,00 de Gemini 3.5 Flash. En la misma carga esto puede reducir el coste por tarea completada aun con calidad comparable.

Es un caballo de batalla de gama Flash, no un modelo de ingeniería de gama alta

Parte del debate del lanzamiento lo sitúa por detrás de modelos frontera mayores en benchmarks difíciles de ingeniería de software. Si su trabajo es refactorización profunda de repositorios o código autónomo prolongado, compárelo con un modelo Pro o premium antes de hacerlo el predeterminado.

Verifique la disciplina de salida y el formato en sus prompts

Algunos primeros usuarios informan de respuestas verbosas o con demasiado formato en ciertas tareas. Revise la longitud de las respuestas, el seguimiento de instrucciones y la disciplina de llamadas a herramientas en prompts representativos para que la verbosidad no eleve en silencio el coste de salida.

Es un modelo de Google cerrado y solo por API

Gemini 3.6 Flash no tiene pesos abiertos y no puede autoalojarse. El acceso es a través de la API de Gemini y plataformas como Google AI Studio, Antigravity y pasarelas unificadas como EvoLink, así que enrute por coste y fiabilidad, no por despliegue local.

Capacidades clave

Por qué Gemini 3.6 Flash puede resolver estas cargas de trabajo

Gemini 3.6 Flash es más útil cuando una ventana de contexto amplia, una mayor eficiencia de tokens y prefijos de prompt reutilizables actúan juntos. La capacidad de contexto por sí sola no mejora una respuesta: la carga sigue necesitando evidencia relevante, estructura clara y un presupuesto de salida.

Un espacio de trabajo de 1M tokens, no un objetivo que llenar

La ventana de 1.048.576 tokens puede mantener disponibles código, especificaciones y resultados de herramientas relacionados sin fragmentación excesiva. La recuperación y la compactación del contexto siguen importando porque la entrada irrelevante compite por la atención y aumenta el coste de procesamiento.

Mayor eficiencia de tokens que 3.5 Flash

Gemini 3.6 Flash busca completar flujos de varios pasos en menos turnos y con menos tokens. Menos llamadas al modelo y una salida más barata son el origen de la ventaja de coste, así que mida el total de tokens por tarea aceptada en lugar del precio de una sola solicitud.

La caché de prompts rinde cuando los prefijos se mantienen estables

Las instrucciones del repositorio, los prompts de sistema, el material de referencia y los esquemas de herramientas ofrecen la mayor oportunidad de caché cuando su orden se mantiene constante. Cambios frecuentes de modelo o de estructura del prompt pueden obligar a procesar de nuevo el prefijo largo.

Comprobaciones de producción de la API de Gemini 3.6 Flash

Qué verificar antes de enviar tráfico de producción a Gemini 3.6 Flash

Una carga adecuada puede fallar igualmente porque la integración use el identificador equivocado, envíe parámetros no admitidos o pierda el estado del agente entre turnos. Verifique la superficie de la solicitud y el contrato conversacional antes de evaluar la calidad del modelo.

01

Usar el ID exacto del modelo gemini-3.6-flash

Envíe model "gemini-3.6-flash" (con puntos) en la ruta de la API de EvoLink. La forma con guiones gemini-3-6-flash es solo la URL de la página, no el parámetro de modelo de la API.

ID del modelo
02

Usar OpenAI Chat Completions o la API nativa de Gemini

EvoLink expone Gemini 3.6 Flash mediante /v1/chat/completions compatible con OpenAI y el endpoint nativo de Gemini generateContent. Use la misma clave API de EvoLink para cualquiera de los dos protocolos.

Protocolos
03

Atender los cambios de parámetros que rompen compatibilidad

Los valores propios de temperature, top-K y top-P se ignoran; las penalizaciones propias de frequency y presence devuelven un error; y se rechaza una solicitud cuyo último turno tiene el rol model. Actualice los constructores de solicitudes de Gemini más antiguos en consecuencia.

Migración
04

Reenviar el estado completo del asistente y las herramientas

Los agentes de varios turnos deben conservar mensajes completos del asistente, IDs de llamadas, argumentos y resultados. Conservar solo el texto final rompe la continuidad del estado y puede hacer fallar pasos posteriores aunque la ventana de contexto sea suficientemente grande.

Estado
Economía de producción

Comparar el coste por tarea aceptada, no solo el precio por token

Gemini 3.6 Flash gana en economía cuando su eficiencia reduce tokens, llamadas al modelo, reintentos o retrabajo humano en la misma carga. Evalúe conjuntos de tareas idénticos en lugar de comparar precios de prompts aislados.

Éxito al primer intentoTasa de entregables aceptadosNúmero de reintentosTokens de salidaTasa de aciertos de cachéLlamadas válidas a herramientasTiempo hasta un resultado aceptadoCorrección humana y fallback

Si Gemini 3.6 Flash produce resultados utilizables con menos tokens y menos esfuerzo de revisión, sus tarifas más bajas se acumulan en una ventaja de coste real. Si la calidad decae en sus tareas más difíciles, escálelas a un modelo de nivel Pro y reserve 3.6 Flash para la mayoría eficiente.

Comparar modelos de contexto largo después de probar la carga de trabajo

EvoLink

Primero compruebe si Gemini 3.6 Flash reduce reintentos y revisión. Después compare precio, contexto, caché y adecuación a la carga de trabajo para elegir la ruta.

Gemini 3.6 Flash
Entrada / salida$1.35 / $6.75
Contexto1M
CachéLecturas automáticas de caché
Ideal paraProgramación de producción y refactorización full-stack, agentes de varios pasos y orquestación, análisis de documentos y gráficos, y cargas de trabajo de gran volumen donde una mejor eficiencia de tokens reduce el coste por tarea completada.
Gemini 3.5 Flash Lite
Entrada / salida$0.3 / $2.5
Contexto1M
CachéCaché de contexto
Ideal paraGemini de gama Pro para las tareas de razonamiento más profundas que la línea Flash no está diseñada para abordar.
Gemini 3.1 Pro
Entrada / salida$1.68 / $10.08
Contexto1M
CachéCaché de contexto
Ideal paraGemini de gama Pro para las tareas de razonamiento más profundas que la línea Flash no está diseñada para abordar.

Otros modelos Gemini en EvoLink

Gemini 3.5 Flash

Gemini 3.5 Flash

The previous-generation Flash workhorse that 3.6 Flash improves on for token efficiency and output cost.

Ver modelo
Gemini 3.5 Flash Lite

Gemini 3.5 Flash Lite

The cheapest, fastest 3.5-class route for classification, extraction, and high-throughput subagents.

Ver modelo
Gemini 3.1 Pro

Gemini 3.1 Pro

The Pro-tier step up when a task needs deeper reasoning than the Flash line can deliver.

Ver modelo
Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite

The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.

Ver modelo

Other text models

GPT-5.6

GPT-5.6

OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.

Ver modelo
Claude Opus 4.8

Claude Opus 4.8

Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.

Ver modelo
DeepSeek V4

DeepSeek V4

Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.

Ver modelo
Kimi K3

Kimi K3

Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.

Ver modelo

Lecturas para equipos de producción

Gemini 3.6 Flash release date & rollout

Gemini 3.6 Flash release date & rollout

What launched, the model ID, official pricing, and where the model is available.

Leer la guía

Preguntas frecuentes de la API de Gemini 3.6 Flash

¿La API de Gemini 3.6 Flash está disponible en EvoLink?

Sí. Gemini 3.6 Flash está disponible como modelo de producción con precios en vivo y tarifas oficiales de respaldo.

¿Qué ID de modelo debo usar para la API de Gemini 3.6 Flash?

Envíe el modelo "gemini-3.6-flash" (con puntos). El formato con guiones gemini-3-6-flash es solo la URL de la página, no el parámetro de modelo de la API.

¿Qué protocolos y SDK funcionan con Gemini 3.6 Flash?

Use el endpoint Chat Completions compatible con OpenAI o el endpoint nativo de Gemini generateContent con la misma clave API de EvoLink. Este modelo no ofrece una ruta de Messages API de Anthropic.

¿La API de Gemini 3.6 Flash admite 1M de contexto o solo 256K?

La ruta de EvoLink registra 1.048.576 tokens. Los límites menores suelen provenir de una superficie de producto de Gemini concreta o de la configuración del cliente, no del modelo de la API en sí.

¿Cómo debería usar la ventana de contexto de 1M tokens de Gemini 3.6 Flash?

Mantenga juntos el código, los documentos y los resultados de herramientas relacionados, pero use recuperación, prefijos en caché estables y compactación de contexto en lugar de llenar la ventana por defecto.

¿En qué se diferencia Gemini 3.6 Flash de Gemini 3.5 Flash y 3.5 Flash-Lite?

3.6 Flash es el modelo de trabajo más reciente, con mejor programación y eficiencia de tokens que 3.5 Flash (salida de 7,50 $ frente a 9,00 $ por 1M). 3.5 Flash-Lite es la ruta más barata y rápida para clasificación y tareas de alto rendimiento.

¿Por qué es más barato ejecutar Gemini 3.6 Flash que Gemini 3.5 Flash?

Apunta a menos tokens y menos llamadas al modelo por tarea, y su precio de salida es más bajo. Controle el total de tokens por tarea aceptada, no solo la tarifa por solicitud.

¿Qué cambios importantes debo gestionar al migrar a Gemini 3.6 Flash?

Los valores personalizados de temperature, top-K y top-P se ignoran; las penalizaciones personalizadas de frequency y presence devuelven un error; y se rechaza una solicitud cuyo último turno tiene el rol de modelo.

¿Cómo debería definir el presupuesto de salida de Gemini 3.6 Flash?

Limite la salida según la complejidad de la tarea y supervise tanto los tokens de razonamiento como los de la respuesta final. El límite de 65.536 tokens es capacidad, no un objetivo habitual.

¿Es Gemini 3.6 Flash una buena opción por defecto para solicitudes en tiempo real o de gran volumen?

Para la clasificación y extracción más baratas y de menor latencia, use Gemini 3.5 Flash-Lite. Use 3.6 Flash cuando su calidad de programación y razonamiento justifique una tarifa algo más alta.

¿Cómo debería comparar Gemini 3.6 Flash con GPT, Claude, GLM o DeepSeek?

Evalúe Gemini 3.6 Flash por su programación eficiente y economía de agentes, GPT y Claude como referencias de capacidad de vanguardia, y GLM o DeepSeek como bases abiertas sensibles al coste.

¿Qué debería medir una evaluación de producción de Gemini 3.6 Flash?

Controle el éxito al primer intento, los entregables aceptados, los reintentos, los tokens de salida, los aciertos de caché, las llamadas válidas a herramientas, el tiempo hasta el resultado aceptado, la corrección humana y la tasa de fallback.