
DeepSeek V4 Flash Vision Exp vs Flash: ¿imagen o texto?
deepseek-v4-flash-vision-exp con comprensión de imágenes en Chat Completions, Messages y Responses. Antes de ampliar producción, verifica estructura, uso, facturación y fallback con solicitudes representativas.Veredicto: enrutar por modalidad, no por novedad
| Condición | Primera opción | Razón |
|---|---|---|
| Necesita captura, escaneo, gráfico, foto o UI renderizada | Vision Exp | Depende de evidencia que Flash de texto no puede ver |
| Todo está en texto, código, JSON o salida de herramienta | Flash | Vision no añade señal útil |
| Ya hay texto fiable y el diseño no importa | Flash | El texto normalizado basta |
| Importan tablas, posición, escritura o jerarquía visual | Vision Exp | La imagen original conserva el diseño |
| Agente visual con capturas cambiantes | Vision Exp + fallback | Necesita grounding y despliegue controlado |
| Clasificación, resumen o código de texto a gran volumen | Flash | La ruta estable sigue siendo el valor predeterminado |
Diferencias reales
| Factor | Vision Exp | Flash |
|---|---|---|
| ID | deepseek-v4-flash-vision-exp | deepseek-v4-flash |
| Estado | Comprensión de imagen experimental en EvoLink | Ruta de texto de producción |
| Entrada | Texto e imágenes | Texto |
| Salida | Texto | Texto |
| Cargas iniciales | Capturas, documentos, gráficos, agentes visuales | Código, clasificación, resumen, agentes de texto, transformación |
| Evaluación | Precisión visual, grounding, letra pequeña, diseño | Precisión, latencia, tokens, herramientas, estabilidad |
| Producción | Feature flag, protocolo, canary y fallback | Ruta de texto predeterminada y regresiones |
image_url en Chat, un bloque image Base64 o URL en Messages e input_image en Responses. La guía de entrada de imágenes detalla cada payload; Files API exige documentación propia.
Árbol de decisión aplicable
- ¿El resultado depende de evidencia visual? Si no, enviar texto normalizado a Flash.
- ¿Hace falta la imagen original? Si OCR contiene todo y el diseño no importa, seguir con Flash.
- ¿El protocolo acepta el formato? Si no, detener o usar fallback Vision; nunca eliminar la imagen en silencio.
- ¿Está permitida la ruta para esa cuenta y carga? Aislar el ID experimental con feature flag o allowlist.
- ¿Supera la aceptación visual? Si no, reintento limitado o failover.
if requires_visual_evidence and vision_route_verified:
route = "deepseek-v4-flash-vision-exp"
else:
route = "deepseek-v4-flash"Registra la razón de la ruta para auditar uso, fallos y migraciones dentro del gateway unificado.
Matriz de cargas
| Carga | Ruta | Aceptación | Fallback |
|---|---|---|---|
| Triage de bug por captura | Vision Exp | Estado visible y región correcta | Otro Vision o revisión humana |
| Factura/formulario | Vision si importa el diseño | Precisión, omisiones y trazabilidad | OCR + Flash |
| Gráfico | Vision Exp | Ejes, leyenda, unidades y tendencia | Datos estructurados + Flash |
| Observación de agente UI | Vision Exp | Grounding y precondiciones | Árbol de accesibilidad, herramienta u otro Vision |
| Repositorio desde archivos | Flash | Tests, referencias y tarea completa | Pro u otro texto según el riesgo |
| Clasificación/resumen | Flash | Dataset etiquetado y schema | Reintento u otro texto |
| PDF con texto limpio | Flash | Integridad en páginas de muestra | Vision si se pierde el diseño |
| Lote texto + capturas | Separar | Éxito y coste por ruta | Cola separada para fallos visuales |
Así Vision solo se usa cuando aporta evidencia y la ruta experimental no se vuelve punto único de fallo.
Comparar coste por tarea correcta
coste de tarea correcta = entrada + salida + reintentos + preprocesado + revisión + impacto del falloEvaluar con la evidencia adecuada
Conjunto Vision Exp
- transcripción y campos; ejes, leyendas, unidades y valores; texto pequeño y UI densa; grounding de elementos; no inventar lo ilegible; latencia, reintentos y correcciones.
Conjunto Flash
- precisión textual; schema y herramientas; primer token y latencia total; tokens de entrada, razonamiento y salida; reintentos y escalados.
DeepSeek afirma que Vision Exp iguala Flash en texto. Es una afirmación del proveedor, no una decisión de migración. Mueve el tráfico solo tras una prueba equivalente y aceptar el riesgo experimental.
Despliegue en EvoLink
- Confirmar ID, protocolo y campo de imagen en la documentación.
- Ejecutar una llamada real y revisar respuesta, uso y facturación.
- Usar feature flag y empezar con canary interno o de bajo riesgo.
- Ampliar capturas, gráficos y tipos de documento por separado.
- Mantener Flash como texto predeterminado hasta demostrar ventaja.
Errores de enrutamiento
| Error | Riesgo | Política correcta |
|---|---|---|
| Sustituir Flash globalmente porque Vision es nuevo | Dependencia experimental del texto | Enrutar por evidencia necesaria |
| Enviar todo PDF como imágenes | Trabajo visual innecesario | Extraer texto primero; conservar imagen si importa el diseño |
| Igualar upstream y EvoLink | Rutas pueden variar | Verificar docs EvoLink y una llamada real |
| Comparar solo tarifa | Faltan reintentos, revisión y fallos | Coste por tarea terminada |
| Creer una descripción fluida | Puede leer mal gráfico o letra pequeña | Criterios específicos |
| Eliminar imagen sin error | Respuesta plausible sin evidencia | Fallar cerrado o fallback Vision |
Quitar -exp | Otro modelo o fallo | Guardar el ID exacto |
Fallback recomendado
Las capturas y gráficos deben pasar a otro modelo Vision, no a Flash sin imagen. Los documentos pueden usar OCR trazable + Flash si perder el diseño es aceptable. Pausa acciones destructivas con grounding incierto, limita tiempo/reintentos/presupuesto y mide el fallback por separado.
El gateway unificado de EvoLink mantiene explícitas y comparables las rutas de texto, Vision y fallback.
FAQ
¿Vision Exp y Flash son el mismo modelo?
No. Tienen IDs distintos: Vision Exp recibe texto e imágenes; Flash es la ruta de texto.
¿Qué ID acepta imágenes?
deepseek-v4-flash-vision-exp en Chat, Messages y Responses. Conserva -exp.¿Flash puede leer capturas?
deepseek-v4-flash está documentado como texto. Usa Vision si importan los píxeles.¿Vision Exp admite texto solo?
Sí upstream, pero no justifica migrar. Flash sigue como predeterminado sin ventaja medida.
¿Vision Exp es más barato?
No lo deduzcas del nombre. Mide imagen, salida, reintentos, preprocesado y revisión.
¿Cuántos tokens usa una imagen?
Hasta 384 de entrada según DeepSeek; usa el consumo real de EvoLink para producción.
¿Cuál es más estable?
Flash está establecido y Vision Exp es experimental. Usa feature flag, canary y fallback.
¿PDF a Vision o Flash?
Flash si basta el texto extraído; Vision si tablas, posición, escritura, sellos u otra evidencia cambian la respuesta.
¿Qué fallback usar?
Otro modelo Vision para imágenes u OCR trazable + Flash cuando el texto sea suficiente.


