GPT Image 2.5 Flare & Sunburst ya están disponibles en EvoLinkProbar GPT Image 2.5
Tutorial de DeepSeek V4 Flash Vision Exp API para enviar imágenes
Tutorial

Cómo usar DeepSeek V4 Flash Vision Exp API con imágenes

Jacey
Jacey
Founder
21 de agosto de 2026
Actualizado el 10 de septiembre de 2026
10 min de lectura
Actualización de ciclo de vida — 10 de septiembre de 2026: DeepSeek lanzó V4.1 Flash. En la API directa de DeepSeek, deepseek-v4-flash y deepseek-v4-flash-vision-exp ya se reenvían a V4.1 Flash, y está previsto que deepseek-v4-pro haga lo mismo el 14 de septiembre de 2026 a las 12:00, hora de Pekín (04:00 UTC). En EvoLink, deepseek-v4-flash y deepseek-v4-pro no se ven afectados y siguen sirviendo DeepSeek V4 Flash y V4 Pro; deepseek-v4-flash-vision-exp ahora redirige a DeepSeek V4.1 Flash. Consulta la actualización oficial, la página del modelo V4.1 Flash y la guía de migración.
DeepSeek publicó el 21 de agosto de 2026 el modelo experimental deepseek-v4-flash-vision-exp, que acepta texto e imágenes en la misma solicitud. En EvoLink, las solicitudes a deepseek-v4-flash-vision-exp ahora redirigen a DeepSeek V4.1 Flash; usa deepseek-v4.1-flash en las integraciones nuevas. Las estructuras de solicitud de abajo recogen la documentación del 21 de agosto. Antes de reutilizarlas con el nuevo ID, confirma una solicitud representativa por protocolo y vuelve a ejecutar tu conjunto de evaluación con imágenes, porque el modelo detrás del ID ha cambiado.
A 21 de agosto de 2026, la documentación pública de DeepSeek V4 en EvoLink incluía el ID en los tres protocolos. Chat Completions usa image_url, Messages un bloque image con fuente URL o Base64 y Responses input_image. Los ejemplos siguientes respetan esas formas. Antes de ampliar tráfico, ejecuta una solicitud representativa con la cuenta de producción.
Ver la página del modelo DeepSeek V4.1 Flash
Si el router también procesa texto, usa la comparación Vision Exp vs Flash: en EvoLink, el tráfico de solo texto puede seguir en deepseek-v4-flash y el trabajo con imágenes pasa a V4.1 Flash.

Respuesta rápida: qué necesitas antes de la primera imagen

El ID original es deepseek-v4-flash-vision-exp; en EvoLink ahora redirige a DeepSeek V4.1 Flash, y las integraciones nuevas usan deepseek-v4.1-flash. image_url, image e input_image pertenecen respectivamente a Chat, Messages y Responses; no se pueden intercambiar.
ComprobaciónResultado necesarioMotivo
IDLas integraciones nuevas envían deepseek-v4.1-flash; el antiguo deepseek-v4-flash-vision-exp sigue funcionando, pero redirige a V4.1 FlashFlash de texto no procesa evidencia visual
ProtocoloLa ruta elegida documenta imágenesCompatibilidad de texto no demuestra multimodalidad
EntradaFunciona una URL o Base64 representativaLa sintaxis y validación cambian por ruta
UsoLa respuesta incluye entrada y salidaPermite medir el coste por resultado aceptado
FacturaciónLa solicitud aparece correctamente en EvoLinkRespuesta válida no garantiza el cargo final
FallbackUna ruta Vision verificada puede sustituirlaEl modelo detrás de cualquier ID puede cambiar, fallar o retirarse

Si falla una comprobación en ejecución, mantén esa carga en un modelo Vision ya verificado y evalúa V4.1 Flash por separado como candidato para esa carga.

Flujo de entrada de imágenes

El flujo práctico es adjuntar una o varias imágenes a una instrucción concreta, elegir el protocolo, validar el resultado estructurado y registrar el uso antes de aumentar tráfico. Un navegador o agente no debe realizar una acción irreversible basándose en una única respuesta visual sin revisar.

Imágenes, documentos y gráficos pasan por una API multimodal hacia tres flujos de respuesta estructurada
Imágenes, documentos y gráficos pasan por una API multimodal hacia tres flujos de respuesta estructurada

Prepara un conjunto pequeño: captura limpia, interfaz densa, página escaneada, gráfico con etiquetas pequeñas e imagen ambigua. Define antes los campos o la decisión esperados.

Elegir la estructura del protocolo

Estos ejemplos coinciden con las formas actuales de EvoLink. Usa el endpoint, campos obligatorios y límites de la página correspondiente.

Chat Completions: image_url

Para una aplicación con un array OpenAI messages, combina texto e imagen en el contenido de usuario:
{
  "model": "deepseek-v4-flash-vision-exp",
  "messages": [{
    "role": "user",
    "content": [
      { "type": "text", "text": "Return the visible error message and the UI state as JSON." },
      { "type": "image_url", "image_url": { "url": "https://example.com/screenshot.png" } }
    ]
  }]
}
La documentación Chat de EvoLink muestra Vision Exp, URL, Base64 y varias imágenes. Coloca la imagen en un mensaje user y conserva el ID exacto.

Messages: bloque image

Messages sirve para estructuras compatibles con Anthropic. max_tokens es obligatorio en el nivel superior:
{
  "model": "deepseek-v4-flash-vision-exp",
  "max_tokens": 1024,
  "messages": [{
    "role": "user",
    "content": [
      { "type": "image", "source": { "type": "url", "url": "https://example.com/invoice.png" } },
      { "type": "text", "text": "Extract invoice number, date, currency, subtotal, tax, and total." }
    ]
  }]
}
EvoLink admite source.type como base64 o url. Para comprender imágenes usa siempre un modelo con visión (en EvoLink, deepseek-v4.1-flash): la documentación avisa de que Flash y Pro de texto pueden sustituir la imagen real en vez de analizarla.

Responses: input_image

Responses encaja en flujos de agentes más largos:

{
  "model": "deepseek-v4-flash-vision-exp",
  "input": [{
    "role": "user",
    "content": [
      { "type": "input_text", "text": "Summarize the chart, then list every directly observed label." },
      { "type": "input_image", "image_url": "https://example.com/chart.png" }
    ]
  }]
}
Responses documenta Vision Exp, input_image y varias imágenes. Revisa por separado eventos streaming, herramientas y errores; admitir imágenes no implica exponer todo el comportamiento de Files API upstream.

¿URL, Base64 o Files API?

MétodoMejor usoControl de producción
URL públicaRecurso público o URL firmada temporalAccesible, redirecciones permitidas y sin datos sensibles
Data URI Base64Imagen privada pequeña en la solicitudTamaño dentro del límite y logs sin payload sensible
Files APIArchivo gestionado o reutilizableSoporte, vida útil y permisos documentados por EvoLink

Usa una URL firmada para archivos grandes accesibles al gateway y Base64 para imágenes privadas pequeñas. No afirmes soporte de Files API sin documentación específica. DeepSeek documenta JPEG, PNG, GIF y WebP upstream; EvoLink puede aplicar límites más estrictos de tamaño, URL, tiempo y cantidad.

Estimar el coste sin duplicar precios

Para el modelo Vision Exp del 21 de agosto, DeepSeek indicó que una imagen se convertía en hasta 384 tokens de entrada. Su guía Vision actual fija un límite superior de 1024 tokens por imagen en la API directa, y las solicitudes a este ID ahora se ejecutan en V4.1 Flash. Usa la regla actual para acotar la parte visual y confírmalo con el uso de EvoLink; no es el coste completo:
coste por tarea completada = imagen + texto de entrada + salida + reintentos + rondas de agente/herramientas

Para dos imágenes, parte de un techo prudente de 2048 tokens visuales según la regla actual de la API directa y suma prompt y salida. Contrasta después con el uso real de EvoLink. No supongas que la caché del prefijo de texto se aplica igual a la imagen.

Consulta los precios actuales en la página de Vision Exp; esta guía no mantiene una segunda tabla.

Validar antes de automatizar

CargaCriterioEscalado
FacturaCoincidencia exacta de campos obligatoriosRevisión humana si falta un campo o falla el checksum
QA de capturaEstado y error visibles correctosReintentar con recorte y después revisar
GráficoEtiquetas separadas de interpretaciónRechazar cifras sin evidencia
Agente UIAcción correcta sin efecto peligrosoConfirmar antes de acciones irreversibles

Mide la tasa de resultados aceptados, no solo HTTP 200. Reintentos y correcciones pueden hacer más cara una ruta aparentemente barata.

Errores frecuentes

SíntomaCausa probableAcción
Modelo fuera del enumID incorrecto, caché antigua o cuenta sin accesoVerificar ID y cuenta; no sustituir por Flash de texto
Imagen no admitidaModelo o protocolo de textoRuta de imagen documentada o fallback Vision
400 invalid content blockForma de otro protocoloAsociar image_url, image o input_image a su ruta
Imagen inaccesibleURL privada, caducada, redirigida o bloqueadaURL firmada accesible o Base64 admitido
Solicitud grandeBase64 o lote supera el límiteRedimensionar, comprimir, dividir o usar ruta de archivo documentada
429 o timeoutCapacidad o concurrenciaReintentos limitados, menos solicitudes y failover

No inventes RPM, TPM, tamaño ni concurrencia. Usa los límites de la ruta y prueba con la cuenta que llevará producción.

Despliegue progresivo

  1. Completar una solicitud URL o Base64 en el protocolo elegido.
  2. Confirmar respuesta, uso, facturación y logs.
  3. Comparar el conjunto visual fijo con un fallback.
  4. Enviar una pequeña parte y medir coste por resultado aceptado.
  5. Ampliar solo si calidad, latencia, errores y coste cumplen el umbral.

Guarda el ID de modelo en configuración en lugar de fijarlo en el código. El gateway unificado de EvoLink permite comparar rutas, uso y facturación sin reconstruir la integración alrededor de un único modelo de proveedor.

FAQ

¿Cuál es el ID exacto?

El ID original es deepseek-v4-flash-vision-exp, de un lanzamiento experimental upstream; si todavía lo llamas, conserva el sufijo -exp completo. En EvoLink, este ID ahora redirige a DeepSeek V4.1 Flash, así que las integraciones nuevas deben usar deepseek-v4.1-flash.
El ID sigue funcionando en EvoLink, pero las solicitudes a deepseek-v4-flash-vision-exp ahora se redirigen a DeepSeek V4.1 Flash. Usa deepseek-v4.1-flash en las integraciones nuevas y consulta la guía de migración antes de fiarte de resultados de imagen anteriores.

¿Puedo enviar imágenes a deepseek-v4-flash?

No. La ruta de texto puede descartar la imagen real. Usa deepseek-v4.1-flash u otro modelo de visión verificado cuando la respuesta dependa de píxeles.

¿URL o Base64?

URL firmada para recursos grandes accesibles; Base64 para imágenes privadas pequeñas dentro del límite. Protege los datos en ambos casos.

¿Admite Files API?

DeepSeek la documenta upstream, pero eso no demuestra que cada ruta EvoLink la exponga. Espera confirmación explícita.

¿Cuánto cuesta una imagen?

Para el Vision Exp original, DeepSeek indicó hasta 384 tokens de entrada por imagen; su guía Vision actual fija un límite superior de 1024 tokens por imagen en la API directa. Las solicitudes a este ID ahora se ejecutan en V4.1 Flash, así que planifica con la regla actual, suma texto, salida, reintentos y rondas de agente, y aplica después el precio actual de la página de producto.

¿Qué formatos admite?

JPEG, PNG, GIF y WebP upstream. Comprueba además los límites EvoLink de tamaño, URL y multiimagen.

¿Qué probar antes de producción?

Imágenes simples y difíciles, salida estructurada, texto pequeño, campos ausentes, latencia, reintentos, uso, facturación y fallback.

Fuentes y próximos pasos

Sincroniza esta guía con las tres páginas de EvoLink y repite ejemplos y facturación si cambian el modelo detrás de este ID, los campos o los límites.

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.