GPT Image 2.5 Flare & Sunburst ya están disponibles en EvoLinkProbar GPT Image 2.5
DeepSeek V4 Flash Vision Exp vs Flash: ¿imagen o texto?
Comparación

DeepSeek V4 Flash Vision Exp vs Flash: ¿imagen o texto?

Jessie
Jessie
COO
21 de agosto de 2026
Actualizado el 10 de septiembre de 2026
10 min de lectura
Actualización de ciclo de vida — 10 de septiembre de 2026: DeepSeek lanzó V4.1 Flash. En la API directa de DeepSeek, deepseek-v4-flash y deepseek-v4-flash-vision-exp ya se reenvían a V4.1 Flash, y está previsto que deepseek-v4-pro haga lo mismo el 14 de septiembre de 2026 a las 12:00, hora de Pekín (04:00 UTC). En EvoLink, deepseek-v4-flash y deepseek-v4-pro no se ven afectados y siguen sirviendo DeepSeek V4 Flash y V4 Pro; deepseek-v4-flash-vision-exp ahora redirige a DeepSeek V4.1 Flash. Consulta la actualización oficial, la página del modelo V4.1 Flash y la guía de migración.
Actualizado el 10 de septiembre de 2026: en EvoLink, envía la evidencia en imágenes a DeepSeek V4.1 Flash y mantén los prompts de solo texto en DeepSeek V4 Flash. Las solicitudes a deepseek-v4-flash-vision-exp ahora redirigen a V4.1 Flash, así que los resultados de Vision Exp de abajo describen el modelo del 21 de agosto; vuelve a ejecutar el conjunto de evaluación con imágenes en su sustituto. El principio de enrutamiento no cambia: la entrada de imagen no justifica migrar todas las solicitudes de Flash. En EvoLink, detecta primero la modalidad, evalúa cada ruta con sus propios criterios y mantén un fallback verificado detrás de la ruta de imagen.
Desde el 21 de agosto de 2026, EvoLink documenta deepseek-v4-flash-vision-exp con comprensión de imágenes en Chat Completions, Messages y Responses. Se lanzó como modelo experimental y en EvoLink el ID ahora redirige a V4.1 Flash; antes de ampliar producción, verifica estructura, uso, facturación y fallback con solicitudes representativas.
Ver la página de Vision Exp

Veredicto: enrutar por modalidad, no por novedad

CondiciónPrimera opciónRazón
Necesita captura, escaneo, gráfico, foto o UI renderizadaVision ExpDepende de evidencia que Flash de texto no puede ver
Todo está en texto, código, JSON o salida de herramientaFlashVision no añade señal útil
Ya hay texto fiable y el diseño no importaFlashEl texto normalizado basta
Importan tablas, posición, escritura o jerarquía visualVision ExpLa imagen original conserva el diseño
Agente visual con capturas cambiantesVision Exp + fallbackNecesita grounding y despliegue controlado
Clasificación, resumen o código de texto a gran volumenFlashLa ruta estable sigue siendo el valor predeterminado
No forman una simple escala de calidad. Vision Exp es la ruta de imagen y Flash la de texto. Si nadie necesita inspeccionar un adjunto, elimínalo en vez de pagar Vision.

Diferencias reales

FactorVision ExpFlash
IDdeepseek-v4-flash-vision-expdeepseek-v4-flash
EstadoLanzado el 21 de agosto como modelo de imagen experimental; en EvoLink el ID ahora redirige a V4.1 FlashRuta de texto de producción en EvoLink, sin cambios por la actualización del 10 de septiembre
EntradaTexto e imágenesTexto
SalidaTextoTexto
Cargas inicialesCapturas, documentos, gráficos, agentes visualesCódigo, clasificación, resumen, agentes de texto, transformación
EvaluaciónPrecisión visual, grounding, letra pequeña, diseñoPrecisión, latencia, tokens, herramientas, estabilidad
ProducciónFeature flag, protocolo, canary y fallbackRuta de texto predeterminada y regresiones
EvoLink documenta image_url en Chat, un bloque image Base64 o URL en Messages e input_image en Responses. La guía de entrada de imágenes detalla cada payload; Files API exige documentación propia.
Consulta la página de Flash para su estado y precios. Compartir “Flash” en el nombre no convierte la ruta de texto en multimodal.
Un gateway API separa capturas, documentos y gráficos del tráfico de código y texto antes de producir salidas estructuradas
Un gateway API separa capturas, documentos y gráficos del tráfico de código y texto antes de producir salidas estructuradas

Árbol de decisión aplicable

  1. ¿El resultado depende de evidencia visual? Si no, enviar texto normalizado a Flash.
  2. ¿Hace falta la imagen original? Si OCR contiene todo y el diseño no importa, seguir con Flash.
  3. ¿El protocolo acepta el formato? Si no, detener o usar fallback Vision; nunca eliminar la imagen en silencio.
  4. ¿Está permitida la ruta para esa cuenta y carga? Aislar la ruta de imagen con feature flag o allowlist.
  5. ¿Supera la aceptación visual? Si no, reintento limitado o failover.
if requires_visual_evidence and vision_route_verified:
    route = "deepseek-v4-flash-vision-exp"
else:
    route = "deepseek-v4-flash"

Registra la razón de la ruta para auditar uso, fallos y migraciones dentro del gateway unificado.

Matriz de cargas

CargaRutaAceptaciónFallback
Triage de bug por capturaVision ExpEstado visible y región correctaOtro Vision o revisión humana
Factura/formularioVision si importa el diseñoPrecisión, omisiones y trazabilidadOCR + Flash
GráficoVision ExpEjes, leyenda, unidades y tendenciaDatos estructurados + Flash
Observación de agente UIVision ExpGrounding y precondicionesÁrbol de accesibilidad, herramienta u otro Vision
Repositorio desde archivosFlashTests, referencias y tarea completaPro u otro texto según el riesgo
Clasificación/resumenFlashDataset etiquetado y schemaReintento u otro texto
PDF con texto limpioFlashIntegridad en páginas de muestraVision si se pierde el diseño
Lote texto + capturasSepararÉxito y coste por rutaCola separada para fallos visuales

Así Vision solo se usa cuando aporta evidencia y la ruta de imagen no se vuelve punto único de fallo para el tráfico de texto.

Comparar coste por tarea correcta

Para el modelo Vision Exp del 21 de agosto, DeepSeek indicó hasta 384 tokens de entrada por imagen. Su guía Vision actual fija un límite superior de 1024 tokens por imagen en su API directa, y las solicitudes a este ID ahora se ejecutan en V4.1 Flash, así que planifica con la regla actual. Ninguna de las dos cifras es el coste final de una tarea visual correcta ni el contrato de facturación de EvoLink.
coste de tarea correcta = entrada + salida + reintentos + preprocesado + revisión + impacto del fallo
Para Vision registra imágenes, tokens, salida, reintentos y correcciones; para Flash, entrada/salida, caché y escalados. Compara la misma unidad de negocio. Usa los precios actuales de Vision Exp y Flash, no una tabla duplicada.

Evaluar con la evidencia adecuada

Conjunto Vision Exp

  • transcripción y campos; ejes, leyendas, unidades y valores; texto pequeño y UI densa; grounding de elementos; no inventar lo ilegible; latencia, reintentos y correcciones.

Conjunto Flash

  • precisión textual; schema y herramientas; primer token y latencia total; tokens de entrada, razonamiento y salida; reintentos y escalados.

En el lanzamiento de agosto, DeepSeek afirmó que el modelo experimental Vision igualaba a Flash en texto. Es una afirmación del proveedor, no una decisión de migración. Mueve el tráfico de texto solo si una prueba equivalente demuestra una ventaja real.

  1. Confirmar ID, protocolo y campo de imagen en la documentación.
  2. Ejecutar una llamada real y revisar respuesta, uso y facturación.
  3. Usar feature flag y empezar con canary interno o de bajo riesgo.
  4. Ampliar capturas, gráficos y tipos de documento por separado.
  5. Mantener Flash como texto predeterminado hasta demostrar ventaja.

Errores de enrutamiento

ErrorRiesgoPolítica correcta
Sustituir Flash globalmente porque el modelo de imagen es más nuevoAñade una dependencia del modelo de imagen al tráfico de textoEnrutar por evidencia necesaria
Enviar todo PDF como imágenesTrabajo visual innecesarioExtraer texto primero; conservar imagen si importa el diseño
Igualar upstream y EvoLinkRutas pueden variarVerificar docs EvoLink y una llamada real
Comparar solo tarifaFaltan reintentos, revisión y fallosCoste por tarea terminada
Creer una descripción fluidaPuede leer mal gráfico o letra pequeñaCriterios específicos
Eliminar imagen sin errorRespuesta plausible sin evidenciaFallar cerrado o fallback Vision
Quitar -expEn EvoLink llama al deepseek-v4-flash de solo textoEnviar deepseek-v4.1-flash para trabajo nuevo con imágenes; si conservas el ID antiguo, envíalo exacto

Fallback recomendado

Las capturas y gráficos deben pasar a otro modelo Vision, no a Flash sin imagen. Los documentos pueden usar OCR trazable + Flash si perder el diseño es aceptable. Pausa acciones destructivas con grounding incierto, limita tiempo/reintentos/presupuesto y mide el fallback por separado.

El gateway unificado de EvoLink mantiene explícitas y comparables las rutas de texto, Vision y fallback.

FAQ

¿Vision Exp y Flash son el mismo modelo?

No en EvoLink. deepseek-v4-flash sigue sirviendo V4 Flash de solo texto, mientras que deepseek-v4-flash-vision-exp ahora redirige a DeepSeek V4.1 Flash. En la API directa de DeepSeek, ambos nombres anteriores ya se reenvían a V4.1 Flash.

¿Qué ID acepta imágenes?

En EvoLink, usa deepseek-v4.1-flash para cargas nuevas con imágenes. Las solicitudes existentes a deepseek-v4-flash-vision-exp siguen funcionando, pero se redirigen a V4.1 Flash.

¿Flash puede leer capturas?

No. En EvoLink, deepseek-v4-flash sigue siendo la ruta de texto de V4 Flash. Usa deepseek-v4.1-flash u otro modelo de visión verificado si importan los píxeles.

¿Vision Exp admite texto solo?

Las solicitudes a este ID ahora se ejecutan en V4.1 Flash. En EvoLink, mantén el tráfico de solo texto en deepseek-v4-flash salvo que tu propia evaluación demuestre una ventaja real de V4.1 Flash.

¿Vision Exp es más barato?

No lo deduzcas del nombre. Mide imagen, salida, reintentos, preprocesado y revisión.

¿Cuántos tokens usa una imagen?

Para el Vision Exp original, DeepSeek indicó hasta 384 tokens de entrada por imagen. Su guía Vision actual fija un límite superior de 1024 tokens por imagen en la API directa. Las solicitudes a este ID ahora se ejecutan en V4.1 Flash, así que mide el uso que devuelven tus solicitudes en EvoLink para calcular el coste de producción.

¿Cuál es más estable?

En EvoLink, Flash es la ruta de texto establecida. Las solicitudes al ID de Vision Exp ahora se ejecutan en V4.1 Flash, así que repite tu evaluación visual y despliega el tráfico de imágenes con feature flag, canary y un fallback verificado.

¿PDF a Vision o Flash?

Flash si basta el texto extraído; un modelo de imagen (en EvoLink, deepseek-v4.1-flash) si tablas, posición, escritura, sellos u otra evidencia cambian la respuesta.

¿Qué fallback usar?

Otro modelo de visión verificado para tareas que dependen de imágenes, u OCR trazable + Flash cuando el texto extraído sea suficiente. Como deepseek-v4-flash-vision-exp ahora redirige a V4.1 Flash en EvoLink, cambiar entre esos dos IDs no es un fallback.

Fuentes

¿Listo para reducir tus costos de IA en un 89%?

Comienza a usar EvoLink hoy y experimenta el poder del enrutamiento inteligente de API.