Kimi K3 ya está disponibleDescubrir Kimi K3
Guía para integrar y evaluar Gemini 3.6 Flash en producción
guide

Guía de Gemini 3.6 Flash: API, Thinking, casos de uso y producción

Jessie
Jessie
COO
22 de julio de 2026
18 min de lectura
Veredicto rápido: Gemini 3.6 Flash es un modelo GA pensado para agentes de código, uso de herramientas en varios pasos, documentos largos y comprensión multimodal. Ya puede evaluarse con cargas reales, pero no debería sustituir todo el tráfico de producción hasta superar pruebas de replay, límites de canary y simulacros de fallback. Antes de integrarlo, conviene entender sus modalidades, Thinking, cambios de API y coste por tarea aceptada.
Esto no es otro resumen del lanzamiento. Responde a lo que un desarrollador necesita después: cómo construir la primera solicitud, elegir un nivel de Thinking, priorizar cargas, calcular el coste real y desplegar sin perder una ruta segura de reversión. Para fecha y disponibilidad por canal, consulta el estado de lanzamiento de Gemini 3.6 Flash.

Referencia rápida de Gemini 3.6 Flash

ElementoInformación actualImplicación para desarrollo
EstadoGA desde el 21 de julio de 2026Listo para evaluación controlada en producción
ID del modelogemini-3.6-flashNo usar la etiqueta inicial -tiered
Contexto de entrada1.048.576 tokensSeguir controlando resolución e historial
Salida máxima65.536 tokensDefinir un límite menor a nivel de aplicación
EntradasTexto, imagen, audio, vídeo y PDFComprensión multimodal, no generación de medios
SalidaTextoSin generación nativa de imagen o audio
Thinking predeterminadomediumEmpezar aquí y cambiar solo con datos reales

¿Qué es Gemini 3.6 Flash y para quién sirve?

Mantiene el énfasis de la familia Flash en velocidad e inferencia escalable, pero va más allá del chat rápido. Google lo orienta a agentes de código, herramientas complejas, documentos multimodales y razonamiento visual o espacial. Hay que medir si reduce reparaciones, evita cambios de código ajenos, selecciona bien las herramientas y completa una tarea de extremo a extremo con menos intervención.

No es la opción automática para todo. Clasificación, enrutamiento y extracción sencilla de gran volumen pueden encajar mejor en Flash-Lite. Un modelo Pro puede ofrecer el techo de razonamiento más alto. Imagen, audio o voz en tiempo real requieren modelos especializados.

CargaPrimera ruta que evaluarMotivo
Código, depuración, agentes multipasoGemini 3.6 FlashEquilibra razonamiento, herramientas y eficiencia
Clasificación, etiquetas, enrutamientoClase Flash-LiteImportan más rendimiento y coste mínimo
Investigación o razonamiento difícilClase ProEl techo de razonamiento puede pesar más que la latencia
Generación de imagen, audio o voz en vivoModelo especializado o Live3.6 Flash solo produce texto

La audiencia principal son desarrolladores de aplicaciones, ingenieros de agentes, equipos de plataforma, responsables de producto y FinOps. Cada grupo debe medir compatibilidad API, finalización de bucles, rollout/fallback, aceptación de usuario o coste por tarea aceptada.

Capacidades oficiales y límites prácticos

La lista de Google describe el modelo upstream. Las herramientas Preview, como Computer Use, exigen validación adicional de seguridad, permisos y canal; no equivalen a una función estable de texto.

CapacidadEstado oficialLímite práctico
ThinkingCompatibleAjustar calidad, latencia y coste
Instrucciones del sistemaCompatibleNo sustituyen la autorización de la aplicación
Structured OutputsCompatibleValidar esquema y reglas en servidor
Function CallingCompatibleLa aplicación ejecuta herramientas y efectos
Code ExecutionCompatibleAislar credenciales y sistemas de producción
Google Search / MapsCompatibleRevisar permisos, fuentes y cargos separados
Context CachingCompatibleMedir aciertos y coste de almacenamiento
URL ContextCompatibleTratar páginas externas como entrada no fiable
Computer UsePreviewAislar y aprobar acciones sensibles
Live APINo compatibleUsar un modelo Live para voz en tiempo real
Fine-tuningNo compatiblePersonalizar con contexto e instrucciones

Un mismo modelo puede exponer capacidades distintas según el canal. Verifica por separado modelo, passthrough, Usage y facturación.

Estructura de solicitud: campos que más se usan

CampoObligatorioFunciónNota de producción
contentsMensajes multivuelta y contenido multimodalTerminar con usuario; no prefijar un turno final del modelo
systemInstructionNoRol, reglas y límitesNo incluir secretos ni autoridad irreversible
generationConfigNoLongitud, Thinking y salida estructuradaConfigurar por carga
toolsNoFunction Calling y Code ExecutionValidar argumentos y respuestas
safetySettingsNoPolítica de seguridadAlinear con riesgo de producto
cachedContentNoContexto en cachéVigilar aciertos y almacenamiento

Una Base URL de marcador permite entender la forma nativa; después se comparan canales, autenticación y precios.

curl "{BASE_URL}/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"role":"user","parts":[{"text":"Explica las API idempotentes en tres puntos."}]}]}'
Para streaming, cambia generateContent por streamGenerateContent y añade ?alt=sse para Server-Sent Events. Prueba ambos caminos: buffering del proxy, timeouts y recuperación aparecen en el serving real.
No uses temperature, topP o topK como controles: Gemini 3.x está optimizado para su muestreo por defecto y puede ignorarlos. candidateCount > 1 falla. Para varios candidatos, envía solicitudes separadas y observables.

Thinking Level: equilibrio entre calidad, latencia y coste

El nivel de Thinking controla la profundidad potencial del razonamiento, no un presupuesto fijo. Las tareas difíciles consumen más thought tokens, visibles en usageMetadata.thoughtsTokenCount y facturados como salida.
Empieza con medium; sube a high solo si las tareas reales muestran razonamiento insuficiente. Clasificación, extracción y routing sencillo pueden probar un nivel menor. Usar siempre high puede aumentar tiempo al primer token, coste y acciones innecesarias.
TareaNivel inicialQué medir
Clasificación, routing, extracción fijaminimalLatencia, esquema, errores
Q&A documental, explicación de códigomediumPrecisión, cobertura, coste
Depuración, matemáticas, varias herramientashighFinalización, reparaciones, bucles
Función interactivaEmpezar en medium y bajarP95, aceptación de usuario
curl "{BASE_URL}/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"role":"user","parts":[{"text":"Encuentra la condición de carrera y propone el cambio seguro más pequeño."}]}],"generationConfig":{"thinkingConfig":{"thinkingLevel":"high"},"maxOutputTokens":4096}}'
No envíes thinkingLevel y el antiguo thinkingBudget juntos: la solicitud falla. Retira primero el campo legado y compara niveles por coste de tarea exitosa.

Qué registrar de respuestas, streams y Usage

El resultado está en candidates[].content.parts, y el fin en finishReason. usageMetadata puede contener promptTokenCount, candidatesTokenCount, thoughtsTokenCount y totalTokenCount.

Registra ID/versión del modelo, inicio/fin, HTTP, finish reason, tokens de entrada, salida visible y pensamiento, herramientas, reintentos y aceptación de negocio. El KPI útil no es HTTP 200, sino coste por tarea aceptada.

{
  "candidates":[{"content":{"role":"model","parts":[{"text":"..."}]},"finishReason":"STOP"}],
  "usageMetadata":{"promptTokenCount":1200,"candidatesTokenCount":480,"thoughtsTokenCount":320,"totalTokenCount":2000},
  "modelVersion":"gemini-3.6-flash"
}

Aquí hay 480 tokens visibles y 320 thought tokens; ambos se facturan como salida.

Entrada multimodal y salida estructurada

Texto y medios pueden convivir en parts. Usa fileData para archivos remotos e inlineData para Base64 pequeño. El servidor debe validar MIME, tamaño, permisos y origen de URL para evitar acceso interno sin restricciones.

Imágenes, gráficos e interfaces

Úsalas para extracción, gráficos, QA visual y comprensión de interfaces. Indica región, campos y formato. Evalúa baja resolución, etiquetas pequeñas y coordenadas ambiguas con un conjunto real.

PDF y documentos largos

Un millón de tokens ayuda con contratos, informes, documentación y repositorios, pero no sustituye la arquitectura de información. Exige citas, prueba recuerdo entre secciones y mide omisiones. Entradas grandes elevan latencia y coste; la resolución cambia tokens.

Comprensión de audio y vídeo

Segmenta medios largos cuando sea posible y conserva tiempos. Mide recuerdo de eventos, precisión temporal y confusión entre imagen y voz. Es comprensión, no generación nativa.

Ejemplo de Structured Output

{
  "contents":[{"role":"user","parts":[
    {"text":"Extrae proveedor, fecha, moneda y total de esta factura."},
    {"fileData":{"mimeType":"image/jpeg","fileUri":"https://example.com/invoice.jpg"}}
  ]}],
  "generationConfig":{"responseMimeType":"application/json","responseSchema":{"type":"object","properties":{"vendor":{"type":"string"},"date":{"type":"string"},"currency":{"type":"string"},"total":{"type":"number"}},"required":["vendor","date","currency","total"]}}
}

Structured Outputs reduce errores de parsing, no valida hechos. Comprueba rangos, formatos y evidencia de importes, fechas e identificadores. Contratos y pagos requieren revisión humana.

Function Calling, Code Execution y agentes

Un bucle fiable tiene cinco pasos: el modelo propone una llamada estructurada, la aplicación valida argumentos, ejecuta, devuelve una FunctionResponse coincidente y el modelo decide la siguiente acción o respuesta. Conserva ID, herramienta, argumentos, resultado y latencia.

No trates al modelo como ejecutor con autoridad ilimitada. Clasifica herramientas: lectura puede automatizarse; escritura reversible requiere idempotencia y rollback; pago, publicación, borrado y permisos exigen aprobación humana explícita.

Riesgo del agenteControlMétrica
Bucle infinitoTurnos, timeout y coste acumulado máximosMedia y P95 de llamadas
Argumentos inventadosJSON Schema, enums, servidorRechazo de argumentos
Cambios ajenosAlcance de archivos, tests, diffAceptación de patch y cambios ajenos
Inyección externaWeb y archivos como datos no fiablesAcciones bloqueadas/no autorizadas
Escritura duplicadaIdempotencia, transacción, estadoDuplicados

Para agentes de código, usa tareas reales del repositorio: corregir un defecto, ejecutar tests y producir un diff mínimo. Mide éxito inicial, tests, reparaciones, cambios ajenos y coste por patch aceptado. Los benchmarks solo plantean hipótesis.

Ocho casos de uso que conviene probar primero

CasoConfiguraciónMétrica de aceptaciónRiesgo principal
Agente de códigoComparar medium y highTests, aceptación de patchCambios ajenos, reparaciones
Agente multiherramientaLimitar tools, turnos y costeFinalización y selecciónDuplicados, autoridad excesiva
PDF largoCitas y esquemaPrecisión de citas, omisionesCoste, atribución falsa
Imágenes y gráficosRegión, campos y formatoPrecisión de campos/ubicaciónResolución, lectura visual
Vídeo o audioSegmentar y conservar tiempoRecuerdo y timestampsCrecimiento de tokens
Extracción estructuradaEsquema y validaciónCumplimiento, reintentosFormato correcto, dato falso
Clasificación y resúmenes batchThinking bajo primeroRendimiento, coste/tareaRazonamiento excesivo
Funciones para usuariosStreaming, timeout, fallbackTTFT, P95, aceptaciónPicos y variación de proveedor

Todos pueden medirse. “Parece bueno” no es aceptación: cada carga necesita métricas automáticas y una rúbrica humana.

¿Cuándo no usar Gemini 3.6 Flash?

  • Si el producto necesita generación nativa de imagen o audio.
  • Si depende de Live API para voz en tiempo real.
  • Si necesita Computer Use pero no admite cambios Preview ni aprobación humana.
  • Para tareas masivas muy simples donde solo importa el coste unitario mínimo.
  • Para pagos, borrado, publicación o acciones sensibles sin aprobación y rollback.
  • Si no existe un conjunto real de evaluación.
  • Si el modelo actual ya cumple y 3.6 Flash no mejora calidad, latencia o coste de forma medible.

Errores comunes de API: síntoma, causa y solución

SíntomaCausa probableSolución y verificación
HTTP 400Turno final model prefijadoEliminar prefill y terminar con usuario
Sampling sin efectotemperature, topP o topKRetirar; usar Thinking e instrucciones
Falla ThinkingthinkingLevel y thinkingBudget juntosConservar solo thinkingLevel
Fallan varios candidatoscandidateCount > 1Quitar o usar 1
Falla JSONEl prompt solo pide “JSON”Usar responseMimeType y responseSchema
Demasiadas toolsThinking alto o reglas ampliasBajar nivel y limitar tools/turnos
Coste inesperadoThoughts, historial o reintentosGuardar Usage y calcular por aceptación
Stream desconectadoProxy, timeout, recuperación débilProbar SSE, heartbeat, reconexión e idempotencia

Ante un error, conserva solicitud redactada, HTTP, respuesta, versión e ID antes de reducir a una reproducción mínima. Cambiar prompts sin telemetría dificulta aislar el fallo y puede seguir generando cargos.

Precio oficial y coste real por tarea

Google Standard cuesta $1.50 por millón de tokens de entrada y $7.50 por millón de salida. Los thought tokens cuentan como salida. El precio de lista no es el coste de completar una tarea.
Coste real de tarea
= entrada
+ salida visible y pensamiento
+ herramientas o grounding
+ caché
+ reintentos fallidos

Para 100.000 tokens de entrada, 6.000 visibles y 4.000 de pensamiento:

100.000 / 1.000.000 × $1.50
+ 10.000 / 1.000.000 × $7.50
= $0.225

Un reintento completo casi duplica el coste. Compara coste por resultado aceptado; reducir tools incorrectas, ediciones ajenas y reparación humana puede importar más.

De evaluación a producción: replay, canary y fallback

  1. Muestrear tareas reales redactadas, con casos normales, límite y fallo.
  2. Registrar calidad, P50/P95, tokens, reintentos e intervención del modelo actual.
  3. Repetir offline los mismos inputs con revisores ciegos al nombre.
  4. Usar shadow traffic sin mostrar la salida al usuario.
  5. Abrir un canary pequeño y de bajo riesgo con umbrales de parada.
  6. Mantener el modelo estable como fallback y ensayar timeout/errores.
  7. Ampliar solo si coste aceptado, latencia y seguridad pasan juntos.
Flujo de validación en producción de Gemini 3.6 Flash con compatibilidad, replay, canary y fallback
Flujo de validación en producción de Gemini 3.6 Flash con compatibilidad, replay, canary y fallback
PuertaCondición sugerida
CompatibilidadSin 4xx desconocidos; respuestas estructuradas/tools parsean
CalidadAceptación crítica no inferior a baseline
LatenciaP95 dentro del presupuesto; streams se recuperan
CosteCumple coste por tarea aceptada
SeguridadSin tools no autorizadas; sensibles con aprobación
RollbackFallback ensayado sin publicar aplicación

¿Acceso directo a Google o agregador de API de IA?

Tras aprobar el modelo, hay que decidir quién asume integración y operaciones. Ambas opciones pueden ser correctas según si el sistema será solo Gemini y si el equipo quiere mantener autenticación, diferencias de solicitud, Usage, facturación y migraciones de cada proveedor.

Cuándo conviene el acceso directo a Google

  • El producto usará solo Gemini.
  • Permisos, facturación y observabilidad ya viven en Google Cloud.
  • Se necesita acceso temprano a herramientas Preview.
  • Plataforma puede mantener cuotas, errores, costes y recuperación.
  • La dependencia de la interfaz nativa es aceptable.

Cuándo conviene un agregador de API de IA

  • Un producto elige modelos distintos por tarea.
  • Se comparan calidad, latencia y coste con el mismo conjunto.
  • No se quieren cuentas, claves y facturas separadas.
  • Se necesita cambiar ante precio, disponibilidad o modelo.
  • Los nuevos modelos deben reutilizar integración, telemetría y rollout.
ÁreaProveedor directoAgregador de API de IA
Nuevo modeloConstruir, validar y desplegar aparteReutilizar entrada y evaluación
ClavesDistribuidas por proveedorGestión central
Uso/facturaciónConciliar consolasObservar llamadas y gasto juntos
ComparaciónCrear adaptador comúnMantener pruebas multimodelo
MigraciónCódigo ligado al proveedorMenos cambios en acceso
Función upstream nuevaSuele llegar primeroEsperar verificación de passthrough

No elijas solo por cantidad de modelos. Verifica llamada real, ID/endpoints claros, streaming estable, thoughts en Usage, errores trazables, precio transparente y límites publicados.

EvoLink expone el formato nativo de Google. Una aplicación Gemini puede empezar cambiando la Base URL y usando autenticación Bearer.

AjusteValor
IDgemini-3.6-flash
Base URL recomendadahttps://direct.evolink.ai
Base URL de respaldohttps://api.evolink.ai
AutenticaciónAuthorization: Bearer YOUR_API_KEY
Endpoint síncrono/v1beta/models/gemini-3.6-flash:generateContent
Endpoint streaming/v1beta/models/gemini-3.6-flash:streamGenerateContent
Crea una clave en el panel de EvoLink y guárdala en variable de servidor o gestor de secretos, nunca en navegador, app móvil o Git.
curl "https://direct.evolink.ai/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"role":"user","parts":[{"text":"Explica las API idempotentes en tres puntos."}]}]}'
CapacidadEstado de rutaRecomendación
ThinkingCompatibleUsar thinkingConfig.thinkingLevel
Structured OutputsCompatibleValidar esquema en servidor
Function CallingCompatibleGuardar ID, argumentos y resultado
Code ExecutionCompatibleEntorno aislado y permisos limitados
Context CachingCompatibleObservar aciertos y almacenamiento
Search / Maps / URL ContextDocumentado como compatibleProbar permisos, resultados y cobro
Computer UseNo compatible actualmenteNo asumir passthrough del Preview
Live APINo compatibleElegir otra ruta para voz en tiempo real
ConceptoGoogle StandardEvoLinkDiferencia por millón
Entrada$1.50$1.35$0.15
Salida y Thinking$7.50$6.75$0.75
El ejemplo del agente documental cuesta unos $0.2025 en EvoLink. El descuento reduce la lista, pero la economía real exige Usage, reintentos y aceptación.
Probar Gemini 3.6 Flash con un 10 % de descuento Explorar modelos Gemini en EvoLink

Lista de seguridad, datos y cumplimiento

Mantén claves en servidor, clasifica y minimiza datos y trata web, archivos y tools como entrada no fiable que no puede cambiar autorizaciones.

Clasifica tools como lectura, escritura reversible o alto riesgo. El alto riesgo exige aprobación y auditoría. Las políticas también difieren: Google indica que el contenido del nivel gratuito puede usarse para mejorar productos, mientras que el pagado no. Confirma contrato, región y requisitos sectoriales.

Preguntas frecuentes

¿Gemini 3.6 Flash está publicado oficialmente?

Sí. Google lo lanzó como GA el 21 de julio de 2026. Consulta el estado por canal.
Sí. EvoLink expone gemini-3.6-flash en formato nativo. Se recomienda https://direct.evolink.ai; el respaldo es https://api.evolink.ai.

¿Qué ID debo usar?

gemini-3.6-flash, no la etiqueta previa gemini-3.6-flash-tiered.

¿Qué modalidades admite?

Texto, imagen, audio, vídeo y PDF como entrada; texto como salida. No genera imagen/audio ni usa Live API.

¿Cuáles son los límites?

1.048.576 tokens de entrada y 65.536 de salida. Resolución e historial siguen afectando calidad, latencia y coste.

¿Qué Thinking Level debería usar?

Empieza con medium; prueba minimal para clasificación/extracción y high para código, matemáticas o varias tools. Decide por finalización, latencia y coste.

¿Se facturan los thought tokens?

Sí, como salida y visibles en usageMetadata.thoughtsTokenCount.

¿Por qué no funcionan temperature, topP o topK?

Gemini 3.x no está pensado para ese tuning y la ruta los ignora. Usa instrucciones, esquema y Thinking.

¿Por qué falla candidateCount?

No admite varios candidatos en una solicitud. Un valor superior a 1 falla; envía solicitudes separadas.

$1.35 por millón de entrada y $6.75 por millón de salida, el 90 % de Google Standard. Thoughts son salida; tools y reintentos alteran el coste.

No. Google lo marca Preview, pero la ruta actual de EvoLink no lo soporta.

¿Debo sustituir Gemini 3.5 Flash ya?

No. Haz replay, shadow traffic, canary controlado y fallback probado. Amplía solo cuando coste, latencia y calidad pasen juntos.

Fuentes y política de actualización

Última verificación: 22 de julio de 2026. Estado, especificaciones, capacidades y precio de Google proceden de fuentes oficiales. Endpoints, capacidades y descuento de EvoLink proceden de la documentación actual y deben confirmarse con la factura real antes de producción.

Capacidades, precios, rutas y parámetros pueden cambiar. Antes de producción, prueba endpoint, Usage, cobro, streaming y errores con tus propias solicitudes.

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.