Seedance 2.5 ya está disponible en EvoLinkProbar Seedance 2.5
Una petición de desarrollador atraviesa un gateway de IA unificado hacia rutas de texto, imagen, audio, documentos y agentes
Tutorial

Cómo usar Gemini 3.8 Flash en EvoLink: guía de producción

EvoLink Team
EvoLink Team
Product Team
3 de septiembre de 2026
12 min de lectura

Inicio rápido

Para usar Gemini 3.8 Flash en EvoLink, crea una API key de EvoLink, envía una petición Chat Completions compatible con OpenAI a https://direct.evolink.ai/v1/chat/completions y fija model en gemini-3.8-flash.
curl https://direct.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.8-flash",
    "messages": [
      {"role": "user", "content": "Return three rollout risks for an AI API migration."}
    ],
    "max_tokens": 500
  }'
Usa el ID exacto con puntos, gemini-3.8-flash. La forma con guiones gemini-3-8-flash es la URL de la página del modelo, no el valor de modelo de la API.
Antes de enviar tráfico de producción, confirma que la ruta y el precio en vivo son visibles en tu cuenta. La documentación de EvoLink para Gemini, tanto la nativa como la compatible con OpenAI, confirma el host y las formas de petición usadas más abajo y lista gemini-3.8-flash en el enum de modelos de ambos endpoints. Aun así, esta guía no trata un listado en la documentación ni el lanzamiento de una página como prueba de una llamada facturable exitosa en todas las cuentas o regiones.

Qué necesitas

  • Una cuenta de EvoLink y una API key guardada en una variable de entorno, nunca subida al control de versiones.
  • Un cliente capaz de hacer peticiones HTTPS con JSON, o un SDK compatible con OpenAI con un base_url personalizado.
  • Un conjunto de evaluación pequeño y representativo, con reglas de aceptación medibles.
  • Logging de ID del modelo, estado, latencia, uso de tokens, reintentos y aceptación a nivel de aplicación.
  • Un modelo de fallback como Gemini 3.7 Flash durante el despliegue.

Gemini 3.8 Flash acepta entrada de texto, imagen, vídeo, audio y PDF, y devuelve texto. Google documenta un contexto de entrada de 1,048,576 tokens y hasta 65,536 tokens de salida. Trata esos límites como capacidad, no como un motivo para llenar cada petición.

Elige la superficie de API

EvoLink expone dos estilos de petición útiles para cargas de trabajo Gemini:

SuperficieEndpointMejor encaje
Chat Completions compatible con OpenAIhttps://direct.evolink.ai/v1/chat/completionsClientes OpenAI existentes, enrutado multi-modelo unificado, aplicaciones de texto y agentes
generateContent nativo de Geminihttps://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContentPayloads de contenido con forma Gemini y semántica de petición nativa
Usa un solo protocolo de forma consistente dentro de cada ruta de petición. No mezcles messages al estilo OpenAI con contents nativos de Gemini en el mismo payload.

Ejemplo en Python compatible con OpenAI

Instala el paquete de OpenAI para Python y apúntalo a EvoLink:

pip install openai
import os
from openai import OpenAI

client = OpenAI(
    api_key=os.environ["EVOLINK_API_KEY"],
    base_url="https://direct.evolink.ai/v1",
)

response = client.chat.completions.create(
    model="gemini-3.8-flash",
    messages=[
        {
            "role": "system",
            "content": "Answer with concise, testable recommendations.",
        },
        {
            "role": "user",
            "content": "Review this deployment plan and identify missing rollback gates.",
        },
    ],
    max_tokens=800,
)

print(response.choices[0].message.content)

Mantén la primera petición sencilla. Confirma la autenticación, el acceso a la ruta, el parseo de la respuesta y los campos de uso antes de añadir herramientas, contexto largo o streaming.

Ejemplo de petición nativa de Gemini

Usa la superficie nativa cuando tu aplicación ya construya objetos contents y generationConfig de Gemini:
curl "https://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContent" \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "contents": [{
      "role": "user",
      "parts": [{"text": "Create a five-step canary checklist for this API release."}]
    }],
    "generationConfig": {
      "maxOutputTokens": 800,
      "thinkingConfig": {"thinkingLevel": "medium"}
    }
  }'
EvoLink documenta https://direct.evolink.ai como BaseURL por defecto para modelos de texto y conexiones de larga duración. Describe https://api.evolink.ai como el endpoint principal para servicios multimodales y como fallback para modelos de texto, por lo que el ejemplo nativo por defecto de arriba usa direct.evolink.ai.

Niveles de thinking y reglas de migración

Gemini 3.8 Flash admite los niveles de thinking low, medium y high, con medium por defecto. Google indica que minimal no está soportado. La referencia de la API nativa de EvoLink establece que un minimal no soportado se degrada automáticamente a low, así que la petición no falla, pero el nivel efectivo pasa a ser low y no el que pediste.
La forma exacta del campo depende del protocolo. Las peticiones nativas de Gemini usan thinkingConfig.thinkingLevel. Los clientes compatibles con OpenAI pueden exponer un campo de razonamiento mapeado solo cuando el gateway lo documenta; no inventes ni reenvíes campos no soportados. Empieza con el valor por defecto y cambia un control cada vez.

Al migrar un cliente Gemini antiguo, audita estos puntos:

Comportamiento antiguoAcción en Gemini 3.8Por qué
thinkingBudget numérico de Gemini 2.5Usa generationConfig.thinkingConfig.thinkingLevel para Gemini 3.xEvoLink documenta ambos controles como mutuamente excluyentes
Thinking minimalCámbialo a low probadominimal no está soportado; EvoLink lo degrada a low automáticamente, así que fija low explícitamente para un control predecible
temperature / topP personalizadosNo cuentes con que los valores cambien la salida; mantenlos dentro de rango si los envíasEvoLink indica que los valores personalizados no afectan a la salida de Gemini 3.x y que los valores fuera de rango devuelven 400
topK personalizadoElimínalo salvo que lo conserves por compatibilidad del clienteEvoLink indica que topK se ignora
Último mensaje con rol modelTermina la petición con un turno que no sea modelEvoLink indica que Gemini 3.5+ devuelve error en caso contrario
Respuesta de funciónDevuelve el id y el name de la función correspondienteEvoLink exige ambos para Gemini 3.x

Que una petición devuelva HTTP 200 no basta. Vuelve a validar la salida estructurada, los argumentos de herramientas, el estado multi-turno y el comportamiento ante rechazos después de la migración.

Entrada multimodal sin desperdiciar contexto

El modelo puede entender texto, imágenes, vídeo, audio y PDF, pero una ventana de 1M de tokens no hace útil cualquier payload grande. Construye el contexto de forma deliberada:

  • Incluye las secciones del documento o los segmentos de medios necesarios para la decisión.
  • Mantén las instrucciones de sistema estables, la guía del repositorio y los esquemas de herramientas en un prefijo consistente para que la caché tenga oportunidad de ayudar.
  • Recupera la evidencia relevante antes de adjuntar un archivo completo.
  • Fija un presupuesto de salida adecuado a la tarea; el máximo de 65,536 tokens es un techo.
  • Registra por separado los tokens de input y los de lectura de caché para que el "contexto grande" no oculte gasto evitable.

Para documentos largos repetidos, compara el comportamiento de aciertos de caché con un prefijo de prompt estable. La tarifa introductoria de lectura de caché de Google es de $0.075 por millón de tokens hasta el 31 de diciembre de 2026, pero la facturación de EvoLink debe verificarse en tu cuenta en vivo.

Despliegue en producción en cinco etapas

Despliegue de API en cinco etapas, desde la configuración de la key y la validación de peticiones hasta la monitorización y el rollback
Despliegue de API en cinco etapas, desde la configuración de la key y la validación de peticiones hasta la monitorización y el rollback

1. Verifica el acceso y el precio

Crea una key de prueba restringida, confirma que el modelo aparece en las rutas disponibles de la cuenta, envía una petición pequeña y comprueba el registro de uso o de facturación resultante. Una página pública del modelo confirma la disponibilidad prevista, no la ruta de llamada específica de tu cuenta.

2. Valida el contrato de petición

Prueba primero las peticiones síncronas. Después prueba el streaming, la salida estructurada, las herramientas, el contexto largo y la entrada multimodal como casos separados. Así aíslas los fallos de protocolo de los fallos de calidad del modelo.

3. Repite un conjunto de evaluación fijo

Compara 3.8 Flash con la línea base actual al mismo nivel de thinking. Mide el éxito al primer intento, los entregables aceptados, los tokens de output y de thinking, los aciertos de caché, las tool calls válidas, la latencia, la corrección humana y la tasa de fallback.

4. Canary con tráfico observable

Empieza con un porcentaje pequeño o con una clase de carga de trabajo de bajo riesgo. Adjunta el ID del modelo elegido y la cohorte de evaluación a cada traza. Evita promocionar automáticamente basándote solo en el éxito HTTP agregado.

5. Promociona o revierte según umbrales escritos

Promociona solo si el modelo supera los umbrales de calidad, coste y latencia definidos de antemano. Revierte restaurando el valor de modelo anterior cuando los errores críticos, el coste por tarea aceptada o la latencia crucen su límite.

Google describe explícitamente Gemini 3.8 Flash como un modelo de mayor precisión con un mayor consumo de tokens que 3.7 Flash. Por eso tu canary debe medir el coste por tarea aceptada, no solo las tarifas por token. Consulta la comparativa completa de Gemini 3.8 Flash vs 3.7 Flash.

Gestión de errores que sí pertenece a producción

Usa reintentos acotados solo para fallos transitorios como límites de tasa, indisponibilidad upstream o timeouts de transporte. No reintentes sin cambios payloads malformados ni parámetros no soportados.

Comportamiento recomendado:

  • Reintenta los fallos transitorios con backoff exponencial y jitter.
  • Fija un número máximo de intentos y un plazo de extremo a extremo.
  • Reutiliza una estrategia de idempotencia allí donde la aplicación pueda crear efectos secundarios.
  • Registra los IDs de petición y los cuerpos de error saneados; nunca registres API keys ni prompts sensibles.
  • Enruta a un fallback probado cuando se alcance el plazo o el umbral de errores.
  • Trata los errores 400 repetidos como un problema de contrato que hay que corregir, no como un problema de capacidad que baste con esperar a que pase.

Checklist de observabilidad

Para cada petición, captura:

  • funcionalidad de la aplicación y cohorte de evaluación;
  • IDs de modelo solicitado y servido;
  • protocolo y familia de endpoint;
  • nivel de thinking y límite de salida;
  • tokens de input, output, thinking y lectura de caché cuando se devuelvan;
  • latencia, estado, clase de error y número de reintentos;
  • validez de la tool call o resultado de la validación de esquema;
  • aceptación de la aplicación, corrección del revisor y resultado del fallback.

Estos datos permiten que un gateway de API unificado respalde la selección de modelo en lugar de convertirse en un proxy opaco. Puedes mantener varias rutas Gemini detrás de un mismo cliente sabiendo cuál de ellas crea valor.

Errores habituales de configuración

  • Enviar gemini-3-8-flash en lugar de gemini-3.8-flash como ID del modelo.
  • Usar contents nativos de Gemini en el endpoint compatible con OpenAI.
  • Depender de que minimal se degrade silenciosamente a low, combinar thinkingBudget con thinkingLevel, contar con controles de muestreo ignorados o terminar la conversación con el rol model.
  • Llenar la ventana de contexto sin recuperación ni filtrado de relevancia.
  • Asumir que la tarifa pública de Google es idéntica a la tarifa en vivo de tu cuenta de EvoLink.
  • Declarar el éxito tras un único HTTP 200 sin comprobar la forma de la respuesta ni la facturación.
  • Cambiar el modelo por defecto de producción sin una vía de fallback medida.

Preguntas frecuentes

¿Cuál es el ID del modelo Gemini 3.8 Flash?

Usa gemini-3.8-flash. La versión con puntos es el identificador de la API; gemini-3-8-flash es el slug de la página en EvoLink.
Usa https://direct.evolink.ai/v1/chat/completions para Chat Completions compatible con OpenAI. Para payloads nativos de Gemini, usa https://direct.evolink.ai/v1beta/models/gemini-3.8-flash:generateContent. Ambos endpoints listan gemini-3.8-flash en su enum de modelos documentado; verifica igualmente que esté habilitado en la cuenta de destino.

¿Puedo usar el SDK de OpenAI para Python?

Sí. Fija el base_url del cliente en https://direct.evolink.ai/v1, pasa tu key de EvoLink y selecciona gemini-3.8-flash.

¿Con qué nivel de thinking debería empezar?

Empieza con el valor por defecto documentado, medium, y después prueba low o high contra umbrales de calidad, tokens y latencia. No envíes minimal; EvoLink lo degradaría a low, lo que oculta el nivel real en tus logs.

¿Gemini 3.8 Flash admite imágenes, vídeo, audio y PDF?

Sí, como modalidades de entrada. Devuelve texto y no ofrece generación de imágenes, audio ni streaming en vivo.

¿Es 3.8 Flash más barato que 3.7 Flash?

No según la tarifa durante el periodo introductorio de Google: sus tarifas de input, output y lectura de caché coinciden. Google indica que 3.8 usa más tokens, así que compara el coste completo por tarea aceptada.

¿Cómo confirmo que mi integración está lista para producción?

Verifica una llamada exitosa y su registro de facturación, prueba cada característica del protocolo que uses, repite un conjunto de evaluación fijo, haz canary con tráfico real y conserva un rollback explícito.

¿Dónde puedo comparar todas las rutas Gemini?

Usa la colección de modelos Gemini para comparar roles dentro de la familia, contexto y precios, y después abre cada página de modelo para ver sus detalles actuales de cara a tu cuenta.

Fuentes y notas de verificación

Los hechos del modelo, los precios de Google y los formatos de petición de EvoLink se volvieron a comprobar el 3 de septiembre de 2026. La documentación de EvoLink lista gemini-3.8-flash en ambos endpoints; el acceso al endpoint y la facturación deben confirmarse igualmente con una llamada exitosa en la cuenta de destino antes de la promoción completa a producción.

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.