
DeepSeek V4 Flash Vision Exp vs Flash: ¿imagen o texto?
Actualización de ciclo de vida — 10 de septiembre de 2026: DeepSeek lanzó V4.1 Flash. En la API directa de DeepSeek,deepseek-v4-flashydeepseek-v4-flash-vision-expya se reenvían a V4.1 Flash, y está previsto quedeepseek-v4-prohaga lo mismo el 14 de septiembre de 2026 a las 12:00, hora de Pekín (04:00 UTC). En EvoLink,deepseek-v4-flashydeepseek-v4-prono se ven afectados y siguen sirviendo DeepSeek V4 Flash y V4 Pro;deepseek-v4-flash-vision-expahora redirige a DeepSeek V4.1 Flash. Consulta la actualización oficial, la página del modelo V4.1 Flash y la guía de migración.
deepseek-v4-flash-vision-exp ahora redirigen a V4.1 Flash, así que los resultados de Vision Exp de abajo describen el modelo del 21 de agosto; vuelve a ejecutar el conjunto de evaluación con imágenes en su sustituto. El principio de enrutamiento no cambia: la entrada de imagen no justifica migrar todas las solicitudes de Flash. En EvoLink, detecta primero la modalidad, evalúa cada ruta con sus propios criterios y mantén un fallback verificado detrás de la ruta de imagen.deepseek-v4-flash-vision-exp con comprensión de imágenes en Chat Completions, Messages y Responses. Se lanzó como modelo experimental y en EvoLink el ID ahora redirige a V4.1 Flash; antes de ampliar producción, verifica estructura, uso, facturación y fallback con solicitudes representativas.Veredicto: enrutar por modalidad, no por novedad
| Condición | Primera opción | Razón |
|---|---|---|
| Necesita captura, escaneo, gráfico, foto o UI renderizada | Vision Exp | Depende de evidencia que Flash de texto no puede ver |
| Todo está en texto, código, JSON o salida de herramienta | Flash | Vision no añade señal útil |
| Ya hay texto fiable y el diseño no importa | Flash | El texto normalizado basta |
| Importan tablas, posición, escritura o jerarquía visual | Vision Exp | La imagen original conserva el diseño |
| Agente visual con capturas cambiantes | Vision Exp + fallback | Necesita grounding y despliegue controlado |
| Clasificación, resumen o código de texto a gran volumen | Flash | La ruta estable sigue siendo el valor predeterminado |
Diferencias reales
| Factor | Vision Exp | Flash |
|---|---|---|
| ID | deepseek-v4-flash-vision-exp | deepseek-v4-flash |
| Estado | Lanzado el 21 de agosto como modelo de imagen experimental; en EvoLink el ID ahora redirige a V4.1 Flash | Ruta de texto de producción en EvoLink, sin cambios por la actualización del 10 de septiembre |
| Entrada | Texto e imágenes | Texto |
| Salida | Texto | Texto |
| Cargas iniciales | Capturas, documentos, gráficos, agentes visuales | Código, clasificación, resumen, agentes de texto, transformación |
| Evaluación | Precisión visual, grounding, letra pequeña, diseño | Precisión, latencia, tokens, herramientas, estabilidad |
| Producción | Feature flag, protocolo, canary y fallback | Ruta de texto predeterminada y regresiones |
image_url en Chat, un bloque image Base64 o URL en Messages e input_image en Responses. La guía de entrada de imágenes detalla cada payload; Files API exige documentación propia.
Árbol de decisión aplicable
- ¿El resultado depende de evidencia visual? Si no, enviar texto normalizado a Flash.
- ¿Hace falta la imagen original? Si OCR contiene todo y el diseño no importa, seguir con Flash.
- ¿El protocolo acepta el formato? Si no, detener o usar fallback Vision; nunca eliminar la imagen en silencio.
- ¿Está permitida la ruta para esa cuenta y carga? Aislar la ruta de imagen con feature flag o allowlist.
- ¿Supera la aceptación visual? Si no, reintento limitado o failover.
if requires_visual_evidence and vision_route_verified:
route = "deepseek-v4-flash-vision-exp"
else:
route = "deepseek-v4-flash"Registra la razón de la ruta para auditar uso, fallos y migraciones dentro del gateway unificado.
Matriz de cargas
| Carga | Ruta | Aceptación | Fallback |
|---|---|---|---|
| Triage de bug por captura | Vision Exp | Estado visible y región correcta | Otro Vision o revisión humana |
| Factura/formulario | Vision si importa el diseño | Precisión, omisiones y trazabilidad | OCR + Flash |
| Gráfico | Vision Exp | Ejes, leyenda, unidades y tendencia | Datos estructurados + Flash |
| Observación de agente UI | Vision Exp | Grounding y precondiciones | Árbol de accesibilidad, herramienta u otro Vision |
| Repositorio desde archivos | Flash | Tests, referencias y tarea completa | Pro u otro texto según el riesgo |
| Clasificación/resumen | Flash | Dataset etiquetado y schema | Reintento u otro texto |
| PDF con texto limpio | Flash | Integridad en páginas de muestra | Vision si se pierde el diseño |
| Lote texto + capturas | Separar | Éxito y coste por ruta | Cola separada para fallos visuales |
Así Vision solo se usa cuando aporta evidencia y la ruta de imagen no se vuelve punto único de fallo para el tráfico de texto.
Comparar coste por tarea correcta
coste de tarea correcta = entrada + salida + reintentos + preprocesado + revisión + impacto del falloEvaluar con la evidencia adecuada
Conjunto Vision Exp
- transcripción y campos; ejes, leyendas, unidades y valores; texto pequeño y UI densa; grounding de elementos; no inventar lo ilegible; latencia, reintentos y correcciones.
Conjunto Flash
- precisión textual; schema y herramientas; primer token y latencia total; tokens de entrada, razonamiento y salida; reintentos y escalados.
En el lanzamiento de agosto, DeepSeek afirmó que el modelo experimental Vision igualaba a Flash en texto. Es una afirmación del proveedor, no una decisión de migración. Mueve el tráfico de texto solo si una prueba equivalente demuestra una ventaja real.
Despliegue en EvoLink
- Confirmar ID, protocolo y campo de imagen en la documentación.
- Ejecutar una llamada real y revisar respuesta, uso y facturación.
- Usar feature flag y empezar con canary interno o de bajo riesgo.
- Ampliar capturas, gráficos y tipos de documento por separado.
- Mantener Flash como texto predeterminado hasta demostrar ventaja.
Errores de enrutamiento
| Error | Riesgo | Política correcta |
|---|---|---|
| Sustituir Flash globalmente porque el modelo de imagen es más nuevo | Añade una dependencia del modelo de imagen al tráfico de texto | Enrutar por evidencia necesaria |
| Enviar todo PDF como imágenes | Trabajo visual innecesario | Extraer texto primero; conservar imagen si importa el diseño |
| Igualar upstream y EvoLink | Rutas pueden variar | Verificar docs EvoLink y una llamada real |
| Comparar solo tarifa | Faltan reintentos, revisión y fallos | Coste por tarea terminada |
| Creer una descripción fluida | Puede leer mal gráfico o letra pequeña | Criterios específicos |
| Eliminar imagen sin error | Respuesta plausible sin evidencia | Fallar cerrado o fallback Vision |
Quitar -exp | En EvoLink llama al deepseek-v4-flash de solo texto | Enviar deepseek-v4.1-flash para trabajo nuevo con imágenes; si conservas el ID antiguo, envíalo exacto |
Fallback recomendado
Las capturas y gráficos deben pasar a otro modelo Vision, no a Flash sin imagen. Los documentos pueden usar OCR trazable + Flash si perder el diseño es aceptable. Pausa acciones destructivas con grounding incierto, limita tiempo/reintentos/presupuesto y mide el fallback por separado.
El gateway unificado de EvoLink mantiene explícitas y comparables las rutas de texto, Vision y fallback.
FAQ
¿Vision Exp y Flash son el mismo modelo?
deepseek-v4-flash sigue sirviendo V4 Flash de solo texto, mientras que deepseek-v4-flash-vision-exp ahora redirige a DeepSeek V4.1 Flash. En la API directa de DeepSeek, ambos nombres anteriores ya se reenvían a V4.1 Flash.¿Qué ID acepta imágenes?
deepseek-v4.1-flash para cargas nuevas con imágenes. Las solicitudes existentes a deepseek-v4-flash-vision-exp siguen funcionando, pero se redirigen a V4.1 Flash.¿Flash puede leer capturas?
deepseek-v4-flash sigue siendo la ruta de texto de V4 Flash. Usa deepseek-v4.1-flash u otro modelo de visión verificado si importan los píxeles.¿Vision Exp admite texto solo?
deepseek-v4-flash salvo que tu propia evaluación demuestre una ventaja real de V4.1 Flash.¿Vision Exp es más barato?
No lo deduzcas del nombre. Mide imagen, salida, reintentos, preprocesado y revisión.
¿Cuántos tokens usa una imagen?
¿Cuál es más estable?
En EvoLink, Flash es la ruta de texto establecida. Las solicitudes al ID de Vision Exp ahora se ejecutan en V4.1 Flash, así que repite tu evaluación visual y despliega el tráfico de imágenes con feature flag, canary y un fallback verificado.
¿PDF a Vision o Flash?
deepseek-v4.1-flash) si tablas, posición, escritura, sellos u otra evidencia cambian la respuesta.¿Qué fallback usar?
deepseek-v4-flash-vision-exp ahora redirige a V4.1 Flash en EvoLink, cambiar entre esos dos IDs no es un fallback.

