
Guía de Gemini 3.6 Flash: API, Thinking, casos de uso y producción
Referencia rápida de Gemini 3.6 Flash
| Elemento | Información actual | Implicación para desarrollo |
|---|---|---|
| Estado | GA desde el 21 de julio de 2026 | Listo para evaluación controlada en producción |
| ID del modelo | gemini-3.6-flash | No usar la etiqueta inicial -tiered |
| Contexto de entrada | 1.048.576 tokens | Seguir controlando resolución e historial |
| Salida máxima | 65.536 tokens | Definir un límite menor a nivel de aplicación |
| Entradas | Texto, imagen, audio, vídeo y PDF | Comprensión multimodal, no generación de medios |
| Salida | Texto | Sin generación nativa de imagen o audio |
| Thinking predeterminado | medium | Empezar aquí y cambiar solo con datos reales |
¿Qué es Gemini 3.6 Flash y para quién sirve?
Mantiene el énfasis de la familia Flash en velocidad e inferencia escalable, pero va más allá del chat rápido. Google lo orienta a agentes de código, herramientas complejas, documentos multimodales y razonamiento visual o espacial. Hay que medir si reduce reparaciones, evita cambios de código ajenos, selecciona bien las herramientas y completa una tarea de extremo a extremo con menos intervención.
No es la opción automática para todo. Clasificación, enrutamiento y extracción sencilla de gran volumen pueden encajar mejor en Flash-Lite. Un modelo Pro puede ofrecer el techo de razonamiento más alto. Imagen, audio o voz en tiempo real requieren modelos especializados.
| Carga | Primera ruta que evaluar | Motivo |
|---|---|---|
| Código, depuración, agentes multipaso | Gemini 3.6 Flash | Equilibra razonamiento, herramientas y eficiencia |
| Clasificación, etiquetas, enrutamiento | Clase Flash-Lite | Importan más rendimiento y coste mínimo |
| Investigación o razonamiento difícil | Clase Pro | El techo de razonamiento puede pesar más que la latencia |
| Generación de imagen, audio o voz en vivo | Modelo especializado o Live | 3.6 Flash solo produce texto |
La audiencia principal son desarrolladores de aplicaciones, ingenieros de agentes, equipos de plataforma, responsables de producto y FinOps. Cada grupo debe medir compatibilidad API, finalización de bucles, rollout/fallback, aceptación de usuario o coste por tarea aceptada.
Capacidades oficiales y límites prácticos
La lista de Google describe el modelo upstream. Las herramientas Preview, como Computer Use, exigen validación adicional de seguridad, permisos y canal; no equivalen a una función estable de texto.
| Capacidad | Estado oficial | Límite práctico |
|---|---|---|
| Thinking | Compatible | Ajustar calidad, latencia y coste |
| Instrucciones del sistema | Compatible | No sustituyen la autorización de la aplicación |
| Structured Outputs | Compatible | Validar esquema y reglas en servidor |
| Function Calling | Compatible | La aplicación ejecuta herramientas y efectos |
| Code Execution | Compatible | Aislar credenciales y sistemas de producción |
| Google Search / Maps | Compatible | Revisar permisos, fuentes y cargos separados |
| Context Caching | Compatible | Medir aciertos y coste de almacenamiento |
| URL Context | Compatible | Tratar páginas externas como entrada no fiable |
| Computer Use | Preview | Aislar y aprobar acciones sensibles |
| Live API | No compatible | Usar un modelo Live para voz en tiempo real |
| Fine-tuning | No compatible | Personalizar con contexto e instrucciones |
Un mismo modelo puede exponer capacidades distintas según el canal. Verifica por separado modelo, passthrough, Usage y facturación.
Estructura de solicitud: campos que más se usan
| Campo | Obligatorio | Función | Nota de producción |
|---|---|---|---|
contents | Sí | Mensajes multivuelta y contenido multimodal | Terminar con usuario; no prefijar un turno final del modelo |
systemInstruction | No | Rol, reglas y límites | No incluir secretos ni autoridad irreversible |
generationConfig | No | Longitud, Thinking y salida estructurada | Configurar por carga |
tools | No | Function Calling y Code Execution | Validar argumentos y respuestas |
safetySettings | No | Política de seguridad | Alinear con riesgo de producto |
cachedContent | No | Contexto en caché | Vigilar aciertos y almacenamiento |
Una Base URL de marcador permite entender la forma nativa; después se comparan canales, autenticación y precios.
curl "{BASE_URL}/v1beta/models/gemini-3.6-flash:generateContent" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"role":"user","parts":[{"text":"Explica las API idempotentes en tres puntos."}]}]}'generateContent por streamGenerateContent y añade ?alt=sse para Server-Sent Events. Prueba ambos caminos: buffering del proxy, timeouts y recuperación aparecen en el serving real.temperature, topP o topK como controles: Gemini 3.x está optimizado para su muestreo por defecto y puede ignorarlos. candidateCount > 1 falla. Para varios candidatos, envía solicitudes separadas y observables.Thinking Level: equilibrio entre calidad, latencia y coste
usageMetadata.thoughtsTokenCount y facturados como salida.medium; sube a high solo si las tareas reales muestran razonamiento insuficiente. Clasificación, extracción y routing sencillo pueden probar un nivel menor. Usar siempre high puede aumentar tiempo al primer token, coste y acciones innecesarias.| Tarea | Nivel inicial | Qué medir |
|---|---|---|
| Clasificación, routing, extracción fija | minimal | Latencia, esquema, errores |
| Q&A documental, explicación de código | medium | Precisión, cobertura, coste |
| Depuración, matemáticas, varias herramientas | high | Finalización, reparaciones, bucles |
| Función interactiva | Empezar en medium y bajar | P95, aceptación de usuario |
curl "{BASE_URL}/v1beta/models/gemini-3.6-flash:generateContent" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"role":"user","parts":[{"text":"Encuentra la condición de carrera y propone el cambio seguro más pequeño."}]}],"generationConfig":{"thinkingConfig":{"thinkingLevel":"high"},"maxOutputTokens":4096}}'thinkingLevel y el antiguo thinkingBudget juntos: la solicitud falla. Retira primero el campo legado y compara niveles por coste de tarea exitosa.Qué registrar de respuestas, streams y Usage
candidates[].content.parts, y el fin en finishReason. usageMetadata puede contener promptTokenCount, candidatesTokenCount, thoughtsTokenCount y totalTokenCount.Registra ID/versión del modelo, inicio/fin, HTTP, finish reason, tokens de entrada, salida visible y pensamiento, herramientas, reintentos y aceptación de negocio. El KPI útil no es HTTP 200, sino coste por tarea aceptada.
{
"candidates":[{"content":{"role":"model","parts":[{"text":"..."}]},"finishReason":"STOP"}],
"usageMetadata":{"promptTokenCount":1200,"candidatesTokenCount":480,"thoughtsTokenCount":320,"totalTokenCount":2000},
"modelVersion":"gemini-3.6-flash"
}Aquí hay 480 tokens visibles y 320 thought tokens; ambos se facturan como salida.
Entrada multimodal y salida estructurada
parts. Usa fileData para archivos remotos e inlineData para Base64 pequeño. El servidor debe validar MIME, tamaño, permisos y origen de URL para evitar acceso interno sin restricciones.Imágenes, gráficos e interfaces
Úsalas para extracción, gráficos, QA visual y comprensión de interfaces. Indica región, campos y formato. Evalúa baja resolución, etiquetas pequeñas y coordenadas ambiguas con un conjunto real.
PDF y documentos largos
Un millón de tokens ayuda con contratos, informes, documentación y repositorios, pero no sustituye la arquitectura de información. Exige citas, prueba recuerdo entre secciones y mide omisiones. Entradas grandes elevan latencia y coste; la resolución cambia tokens.
Comprensión de audio y vídeo
Segmenta medios largos cuando sea posible y conserva tiempos. Mide recuerdo de eventos, precisión temporal y confusión entre imagen y voz. Es comprensión, no generación nativa.
Ejemplo de Structured Output
{
"contents":[{"role":"user","parts":[
{"text":"Extrae proveedor, fecha, moneda y total de esta factura."},
{"fileData":{"mimeType":"image/jpeg","fileUri":"https://example.com/invoice.jpg"}}
]}],
"generationConfig":{"responseMimeType":"application/json","responseSchema":{"type":"object","properties":{"vendor":{"type":"string"},"date":{"type":"string"},"currency":{"type":"string"},"total":{"type":"number"}},"required":["vendor","date","currency","total"]}}
}Structured Outputs reduce errores de parsing, no valida hechos. Comprueba rangos, formatos y evidencia de importes, fechas e identificadores. Contratos y pagos requieren revisión humana.
Function Calling, Code Execution y agentes
Un bucle fiable tiene cinco pasos: el modelo propone una llamada estructurada, la aplicación valida argumentos, ejecuta, devuelve una FunctionResponse coincidente y el modelo decide la siguiente acción o respuesta. Conserva ID, herramienta, argumentos, resultado y latencia.
No trates al modelo como ejecutor con autoridad ilimitada. Clasifica herramientas: lectura puede automatizarse; escritura reversible requiere idempotencia y rollback; pago, publicación, borrado y permisos exigen aprobación humana explícita.
| Riesgo del agente | Control | Métrica |
|---|---|---|
| Bucle infinito | Turnos, timeout y coste acumulado máximos | Media y P95 de llamadas |
| Argumentos inventados | JSON Schema, enums, servidor | Rechazo de argumentos |
| Cambios ajenos | Alcance de archivos, tests, diff | Aceptación de patch y cambios ajenos |
| Inyección externa | Web y archivos como datos no fiables | Acciones bloqueadas/no autorizadas |
| Escritura duplicada | Idempotencia, transacción, estado | Duplicados |
Para agentes de código, usa tareas reales del repositorio: corregir un defecto, ejecutar tests y producir un diff mínimo. Mide éxito inicial, tests, reparaciones, cambios ajenos y coste por patch aceptado. Los benchmarks solo plantean hipótesis.
Ocho casos de uso que conviene probar primero
| Caso | Configuración | Métrica de aceptación | Riesgo principal |
|---|---|---|---|
| Agente de código | Comparar medium y high | Tests, aceptación de patch | Cambios ajenos, reparaciones |
| Agente multiherramienta | Limitar tools, turnos y coste | Finalización y selección | Duplicados, autoridad excesiva |
| PDF largo | Citas y esquema | Precisión de citas, omisiones | Coste, atribución falsa |
| Imágenes y gráficos | Región, campos y formato | Precisión de campos/ubicación | Resolución, lectura visual |
| Vídeo o audio | Segmentar y conservar tiempo | Recuerdo y timestamps | Crecimiento de tokens |
| Extracción estructurada | Esquema y validación | Cumplimiento, reintentos | Formato correcto, dato falso |
| Clasificación y resúmenes batch | Thinking bajo primero | Rendimiento, coste/tarea | Razonamiento excesivo |
| Funciones para usuarios | Streaming, timeout, fallback | TTFT, P95, aceptación | Picos y variación de proveedor |
Todos pueden medirse. “Parece bueno” no es aceptación: cada carga necesita métricas automáticas y una rúbrica humana.
¿Cuándo no usar Gemini 3.6 Flash?
- Si el producto necesita generación nativa de imagen o audio.
- Si depende de Live API para voz en tiempo real.
- Si necesita Computer Use pero no admite cambios Preview ni aprobación humana.
- Para tareas masivas muy simples donde solo importa el coste unitario mínimo.
- Para pagos, borrado, publicación o acciones sensibles sin aprobación y rollback.
- Si no existe un conjunto real de evaluación.
- Si el modelo actual ya cumple y 3.6 Flash no mejora calidad, latencia o coste de forma medible.
Errores comunes de API: síntoma, causa y solución
| Síntoma | Causa probable | Solución y verificación |
|---|---|---|
| HTTP 400 | Turno final model prefijado | Eliminar prefill y terminar con usuario |
| Sampling sin efecto | temperature, topP o topK | Retirar; usar Thinking e instrucciones |
| Falla Thinking | thinkingLevel y thinkingBudget juntos | Conservar solo thinkingLevel |
| Fallan varios candidatos | candidateCount > 1 | Quitar o usar 1 |
| Falla JSON | El prompt solo pide “JSON” | Usar responseMimeType y responseSchema |
| Demasiadas tools | Thinking alto o reglas amplias | Bajar nivel y limitar tools/turnos |
| Coste inesperado | Thoughts, historial o reintentos | Guardar Usage y calcular por aceptación |
| Stream desconectado | Proxy, timeout, recuperación débil | Probar SSE, heartbeat, reconexión e idempotencia |
Ante un error, conserva solicitud redactada, HTTP, respuesta, versión e ID antes de reducir a una reproducción mínima. Cambiar prompts sin telemetría dificulta aislar el fallo y puede seguir generando cargos.
Precio oficial y coste real por tarea
$1.50 por millón de tokens de entrada y $7.50 por millón de salida. Los thought tokens cuentan como salida. El precio de lista no es el coste de completar una tarea.Coste real de tarea
= entrada
+ salida visible y pensamiento
+ herramientas o grounding
+ caché
+ reintentos fallidosPara 100.000 tokens de entrada, 6.000 visibles y 4.000 de pensamiento:
100.000 / 1.000.000 × $1.50
+ 10.000 / 1.000.000 × $7.50
= $0.225Un reintento completo casi duplica el coste. Compara coste por resultado aceptado; reducir tools incorrectas, ediciones ajenas y reparación humana puede importar más.
De evaluación a producción: replay, canary y fallback
- Muestrear tareas reales redactadas, con casos normales, límite y fallo.
- Registrar calidad, P50/P95, tokens, reintentos e intervención del modelo actual.
- Repetir offline los mismos inputs con revisores ciegos al nombre.
- Usar shadow traffic sin mostrar la salida al usuario.
- Abrir un canary pequeño y de bajo riesgo con umbrales de parada.
- Mantener el modelo estable como fallback y ensayar timeout/errores.
- Ampliar solo si coste aceptado, latencia y seguridad pasan juntos.

| Puerta | Condición sugerida |
|---|---|
| Compatibilidad | Sin 4xx desconocidos; respuestas estructuradas/tools parsean |
| Calidad | Aceptación crítica no inferior a baseline |
| Latencia | P95 dentro del presupuesto; streams se recuperan |
| Coste | Cumple coste por tarea aceptada |
| Seguridad | Sin tools no autorizadas; sensibles con aprobación |
| Rollback | Fallback ensayado sin publicar aplicación |
¿Acceso directo a Google o agregador de API de IA?
Tras aprobar el modelo, hay que decidir quién asume integración y operaciones. Ambas opciones pueden ser correctas según si el sistema será solo Gemini y si el equipo quiere mantener autenticación, diferencias de solicitud, Usage, facturación y migraciones de cada proveedor.
Cuándo conviene el acceso directo a Google
- El producto usará solo Gemini.
- Permisos, facturación y observabilidad ya viven en Google Cloud.
- Se necesita acceso temprano a herramientas Preview.
- Plataforma puede mantener cuotas, errores, costes y recuperación.
- La dependencia de la interfaz nativa es aceptable.
Cuándo conviene un agregador de API de IA
- Un producto elige modelos distintos por tarea.
- Se comparan calidad, latencia y coste con el mismo conjunto.
- No se quieren cuentas, claves y facturas separadas.
- Se necesita cambiar ante precio, disponibilidad o modelo.
- Los nuevos modelos deben reutilizar integración, telemetría y rollout.
| Área | Proveedor directo | Agregador de API de IA |
|---|---|---|
| Nuevo modelo | Construir, validar y desplegar aparte | Reutilizar entrada y evaluación |
| Claves | Distribuidas por proveedor | Gestión central |
| Uso/facturación | Conciliar consolas | Observar llamadas y gasto juntos |
| Comparación | Crear adaptador común | Mantener pruebas multimodelo |
| Migración | Código ligado al proveedor | Menos cambios en acceso |
| Función upstream nueva | Suele llegar primero | Esperar verificación de passthrough |
No elijas solo por cantidad de modelos. Verifica llamada real, ID/endpoints claros, streaming estable, thoughts en Usage, errores trazables, precio transparente y límites publicados.
Cómo acceder a Gemini 3.6 Flash mediante EvoLink
EvoLink expone el formato nativo de Google. Una aplicación Gemini puede empezar cambiando la Base URL y usando autenticación Bearer.
| Ajuste | Valor |
|---|---|
| ID | gemini-3.6-flash |
| Base URL recomendada | https://direct.evolink.ai |
| Base URL de respaldo | https://api.evolink.ai |
| Autenticación | Authorization: Bearer YOUR_API_KEY |
| Endpoint síncrono | /v1beta/models/gemini-3.6-flash:generateContent |
| Endpoint streaming | /v1beta/models/gemini-3.6-flash:streamGenerateContent |
curl "https://direct.evolink.ai/v1beta/models/gemini-3.6-flash:generateContent" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"role":"user","parts":[{"text":"Explica las API idempotentes en tres puntos."}]}]}'Límites actuales de capacidades en EvoLink
| Capacidad | Estado de ruta | Recomendación |
|---|---|---|
| Thinking | Compatible | Usar thinkingConfig.thinkingLevel |
| Structured Outputs | Compatible | Validar esquema en servidor |
| Function Calling | Compatible | Guardar ID, argumentos y resultado |
| Code Execution | Compatible | Entorno aislado y permisos limitados |
| Context Caching | Compatible | Observar aciertos y almacenamiento |
| Search / Maps / URL Context | Documentado como compatible | Probar permisos, resultados y cobro |
| Computer Use | No compatible actualmente | No asumir passthrough del Preview |
| Live API | No compatible | Elegir otra ruta para voz en tiempo real |
Precio de EvoLink: un 10 % menos que Google Standard
| Concepto | Google Standard | EvoLink | Diferencia por millón |
|---|---|---|---|
| Entrada | $1.50 | $1.35 | $0.15 |
| Salida y Thinking | $7.50 | $6.75 | $0.75 |
$0.2025 en EvoLink. El descuento reduce la lista, pero la economía real exige Usage, reintentos y aceptación.Lista de seguridad, datos y cumplimiento
Mantén claves en servidor, clasifica y minimiza datos y trata web, archivos y tools como entrada no fiable que no puede cambiar autorizaciones.
Clasifica tools como lectura, escritura reversible o alto riesgo. El alto riesgo exige aprobación y auditoría. Las políticas también difieren: Google indica que el contenido del nivel gratuito puede usarse para mejorar productos, mientras que el pagado no. Confirma contrato, región y requisitos sectoriales.
Preguntas frecuentes
¿Gemini 3.6 Flash está publicado oficialmente?
¿Está disponible mediante EvoLink?
gemini-3.6-flash en formato nativo. Se recomienda https://direct.evolink.ai; el respaldo es https://api.evolink.ai.¿Qué ID debo usar?
gemini-3.6-flash, no la etiqueta previa gemini-3.6-flash-tiered.¿Qué modalidades admite?
Texto, imagen, audio, vídeo y PDF como entrada; texto como salida. No genera imagen/audio ni usa Live API.
¿Cuáles son los límites?
1.048.576 tokens de entrada y 65.536 de salida. Resolución e historial siguen afectando calidad, latencia y coste.
¿Qué Thinking Level debería usar?
medium; prueba minimal para clasificación/extracción y high para código, matemáticas o varias tools. Decide por finalización, latencia y coste.¿Se facturan los thought tokens?
usageMetadata.thoughtsTokenCount.¿Por qué no funcionan temperature, topP o topK?
Gemini 3.x no está pensado para ese tuning y la ruta los ignora. Usa instrucciones, esquema y Thinking.
¿Por qué falla candidateCount?
No admite varios candidatos en una solicitud. Un valor superior a 1 falla; envía solicitudes separadas.
¿Cuánto cuesta en EvoLink?
$1.35 por millón de entrada y $6.75 por millón de salida, el 90 % de Google Standard. Thoughts son salida; tools y reintentos alteran el coste.¿EvoLink admite Computer Use en esta ruta?
No. Google lo marca Preview, pero la ruta actual de EvoLink no lo soporta.
¿Debo sustituir Gemini 3.5 Flash ya?
No. Haz replay, shadow traffic, canary controlado y fallback probado. Amplía solo cuando coste, latencia y calidad pasen juntos.
Fuentes y política de actualización
- Google: anuncio de Gemini 3.6 Flash
- Google: documentación del modelo Gemini 3.6 Flash
- Google: guía para desarrolladores de Gemini 3
- Google: precios de Gemini API
Capacidades, precios, rutas y parámetros pueden cambiar. Antes de producción, prueba endpoint, Usage, cobro, streaming y errores con tus propias solicitudes.


