GPT Image 2.5 Flare & Sunburst sont disponibles sur EvoLinkEssayer GPT Image 2.5
DeepSeek V4 Flash Vision Exp vs Flash : image ou texte ?
Comparison

DeepSeek V4 Flash Vision Exp vs Flash : image ou texte ?

Jessie
Jessie
COO
21 août 2026
Mis à jour le 10 septembre 2026
10 min de lecture
Mise à jour du cycle de vie — 10 septembre 2026 : DeepSeek a publié V4.1 Flash. Sur l’API directe de DeepSeek, deepseek-v4-flash et deepseek-v4-flash-vision-exp renvoient désormais vers V4.1 Flash, et deepseek-v4-pro doit suivre le 14 septembre 2026 à 12 h 00, heure de Pékin (04 h 00 UTC). Sur EvoLink, deepseek-v4-flash et deepseek-v4-pro ne sont pas concernés et continuent de servir DeepSeek V4 Flash et V4 Pro ; deepseek-v4-flash-vision-exp redirige désormais vers DeepSeek V4.1 Flash. Voir la mise à jour officielle, la page du modèle V4.1 Flash et le guide de migration.
Mise à jour du 10 septembre 2026 : sur EvoLink, envoyez les preuves visuelles à DeepSeek V4.1 Flash et gardez les prompts texte seul sur DeepSeek V4 Flash. Les requêtes vers deepseek-v4-flash-vision-exp redirigent désormais vers V4.1 Flash : les résultats Vision Exp ci-dessous décrivent donc le modèle du 21 août, et le jeu d’évaluation image doit être relancé sur son remplaçant. Le principe de routage ne change pas : l’entrée image ne justifie pas de migrer toutes les requêtes Flash. Sur EvoLink, détectez d’abord la modalité, évaluez chaque voie avec ses propres critères et conservez un fallback validé derrière la voie image.
Depuis le 21 août 2026, EvoLink documente deepseek-v4-flash-vision-exp avec compréhension d’image sur Chat Completions, Messages et Responses. Le modèle a été publié comme version expérimentale et, sur EvoLink, cet ID redirige désormais vers V4.1 Flash : vérifiez structure, usage, facturation et fallback avec des requêtes représentatives avant d’élargir la production.
Voir la page Vision Exp

Verdict rapide : router par modalité, pas par nouveauté

ConditionPremier choixMotif
Capture, scan, graphique, photo ou UI rendue nécessaireVision ExpLe résultat dépend d’une preuve que Flash texte ne voit pas
Tâche entièrement en texte, code, JSON ou sortie d’outilFlashLa voie Vision n’ajoute aucun signal utile
Texte fiable déjà extrait et mise en page sans importanceFlashLe texte normalisé suffit
Tableaux, position, écriture ou hiérarchie visuelle comptentVision ExpL’image d’origine préserve la mise en page
Agent visuel observant des captures changeantesVision Exp + fallbackGrounding requis, déploiement progressif contrôlé
Classification, résumé ou code texte à fort volumeFlashLa route texte établie reste le défaut opérationnel
Ce n’est pas une simple échelle de qualité. Vision Exp est la voie image ; Flash, la voie texte. Retirez une pièce jointe inutile plutôt que de payer une requête Vision sans besoin visuel.

Différences réelles

FacteurVision ExpFlash
IDdeepseek-v4-flash-vision-expdeepseek-v4-flash
StatutPublié le 21 août comme modèle image expérimental ; sur EvoLink, l’ID redirige désormais vers V4.1 FlashModèle texte disponible en production sur EvoLink, non concerné par le changement du 10 septembre
EntréeTexte et imagesTexte
SortieTexteTexte
Tâches initialesCaptures, extraction de documents, graphiques, agents visuelsCode, classification, résumé, agents texte, transformation structurée
ÉvaluationPrécision visuelle, grounding, petit texte, mise en pagePrécision, latence, tokens, outils, stabilité texte
ProductionFeature flag, contrôle protocole, canary, fallbackRoute texte par défaut et régressions
EvoLink documente image_url sur Chat, un bloc image Base64 ou URL sur Messages et input_image sur Responses. Le guide d’intégration image détaille les payloads ; Files API garde sa propre exigence documentaire.
Consultez la page Flash pour son statut et ses tarifs. Le nom « Flash » partagé ne confère pas l’image au modèle texte.
Un gateway API sépare les captures, documents et graphiques du trafic code et texte avant la sortie structurée
Un gateway API sépare les captures, documents et graphiques du trafic code et texte avant la sortie structurée

Arbre de décision applicable

  1. Le résultat dépend-il d’une preuve visuelle ? Sinon, envoyer le texte normalisé à Flash.
  2. L’image originale est-elle nécessaire ? Si l’OCR contient tout et que la mise en page ne compte pas, rester sur Flash.
  3. Le protocole EvoLink accepte-t-il le format ? Sinon, arrêter ou utiliser un fallback Vision, jamais supprimer silencieusement l’image.
  4. La route est-elle autorisée pour ce tenant et ce workload ? Isoler la voie image par feature flag ou allowlist.
  5. La sortie passe-t-elle l’acceptation visuelle ? Sinon, retry borné ou failover.
if requires_visual_evidence and vision_route_verified:
    route = "deepseek-v4-flash-vision-exp"
else:
    route = "deepseek-v4-flash"

Enregistrez la raison du routage pour auditer usage, erreurs et migrations dans le gateway unifié.

Matrice de workloads

WorkloadRouteAcceptationFallback
Triage de bug par captureVision ExpÉtat visible et zone pertinente correctsAutre Vision ou revue humaine
Facture/formulaireVision si mise en page importantePrécision, omissions, traçabilité de pageOCR + Flash
GraphiqueVision ExpAxes, légende, unités et tendanceDonnées structurées + Flash
Observation d’agent UIVision ExpGrounding et préconditions d’actionArbre d’accessibilité, état d’outil ou autre Vision
Dépôt depuis fichiers sourceFlashTests, références de fichiers, tâche terminéePro ou autre modèle texte selon le risque
Classification/résuméFlashJeu annoté et schéma de sortieRetry ou autre texte
PDF avec texte propreFlashComplétude sur pages échantillonsVision uniquement si perte de mise en page
Lot texte + capturesSéparerSuccès et coût par voieFile séparée pour les échecs visuels

Cette séparation réserve le traitement visuel au besoin réel et évite de faire de la voie image un point unique de panne pour le trafic texte.

Comparer le coût par tâche réussie

Pour le modèle Vision Exp du 21 août, DeepSeek annonçait jusqu’à 384 tokens d’entrée par image. Le guide Vision actuel de DeepSeek fixe un plafond de 1024 tokens par image sur son API directe, et les requêtes vers cet ID tournent désormais sur V4.1 Flash : planifiez avec la règle actuelle. Aucun de ces deux chiffres n’est le coût final d’une tâche visuelle réussie, ni le contrat de facturation d’EvoLink. Le coût utile est :
coût tâche réussie = entrée + sortie + retries + prétraitement + revue + impact d’échec
Pour Vision, suivez nombre d’images, tokens, sortie, retries et corrections ; pour Flash, entrée/sortie, cache et escalades. Comparez une même unité métier, par exemple un document correctement traité. Utilisez les tarifs en direct des pages Vision Exp et Flash, pas une grille dupliquée.

Évaluer avec la bonne preuve

Jeu Vision Exp

  • transcription et champs de scans/documents ; axes, légendes, unités et valeurs ; petit texte et UI dense ; grounding d’éléments ; refus d’inventer l’illisible ; latence, retries et corrections.

Jeu Flash

  • précision texte ; schéma et outils ; première réponse et latence totale ; tokens entrée/raisonnement/sortie ; retries et escalades.

Lors de la sortie d’août, DeepSeek affirmait que Vision Exp égalait Flash sur le texte. C’est une déclaration fournisseur, pas une décision de migration. Ne déplacez le trafic texte qu’après une évaluation équivalente montrant un bénéfice produit réel, et si le risque lié au nouveau modèle est acceptable.

  1. Vérifier que l’ID, le protocole et le champ image figurent dans les docs.
  2. Exécuter un appel réel et contrôler réponse, usage et facturation.
  3. Utiliser un feature flag, puis commencer avec un canary interne ou peu risqué.
  4. Étendre séparément captures, graphiques et types de documents.
  5. Garder Flash par défaut pour le texte jusqu’à preuve d’un bénéfice de migration.

Erreurs de routage fréquentes

ErreurRisquePolitique correcte
Remplacer Flash globalement car le modèle image est plus récentDépendance du trafic texte au modèle imageRouter selon la preuve nécessaire
Envoyer tous les PDF en imagesTraitement inutile si texte propreExtraire d’abord, conserver l’image si le layout compte
Confondre support upstream et EvoLinkRoutes différentes selon modèle/protocoleVérifier doc EvoLink et un appel réel
Comparer seulement le tarifRetries, revue et échecs absentsMesurer le coût par tâche terminée
Croire une description fluideLecture fausse possibleCritères d’acceptation dédiés
Supprimer l’image sans erreurRéponse plausible sans preuveÉchec fermé ou fallback Vision
Retirer -expSur EvoLink, cela appelle deepseek-v4-flash, texte seulEnvoyer deepseek-v4.1-flash pour les nouvelles tâches image ; si l’ancien ID est conservé, l’envoyer tel quel

Fallback recommandé

Les captures et graphiques doivent aller vers un autre modèle Vision validé, pas vers Flash sans image. Une extraction de document peut passer par un OCR traçable puis Flash si la perte de mise en page est acceptable. Suspendez les actions destructrices d’un agent en cas de grounding incertain, bornez délais/retries/budget (un nouveau modèle ne justifie pas des retries illimités) et mesurez le fallback séparément.

Le gateway unifié EvoLink rend explicites les voies texte, Vision et fallback tout en gardant usage et coût comparables.

FAQ

Vision Exp et Flash sont-ils identiques ?

Pas sur EvoLink. deepseek-v4-flash continue de servir V4 Flash, texte seul, tandis que deepseek-v4-flash-vision-exp redirige désormais vers DeepSeek V4.1 Flash. Sur l’API directe de DeepSeek, les deux anciens noms renvoient désormais vers V4.1 Flash.

Quel ID accepte les images ?

Sur EvoLink, utilisez deepseek-v4.1-flash pour les nouveaux workloads image. Les requêtes existantes vers deepseek-v4-flash-vision-exp fonctionnent toujours, mais elles sont redirigées vers V4.1 Flash.

Flash peut-il lire une capture ?

Non. Sur EvoLink, deepseek-v4-flash reste la route V4 Flash texte seul. Utilisez deepseek-v4.1-flash ou un autre modèle Vision validé si les pixels comptent.

Vision Exp accepte-t-il le texte seul ?

Les requêtes vers cet ID tournent désormais sur V4.1 Flash. Sur EvoLink, gardez le trafic texte seul sur deepseek-v4-flash, sauf si votre propre évaluation montre un avantage réel de V4.1 Flash.

Vision Exp est-il moins cher ?

Ne l’inférez pas du nom. Mesurez le coût complet avec image, sortie, retries, prétraitement et revue.

Combien de tokens par image ?

Pour le modèle Vision Exp d’origine, DeepSeek annonçait jusqu’à 384 tokens d’entrée par image. Son guide Vision actuel fixe un plafond de 1024 tokens par image sur l’API directe. Les requêtes vers cet ID tournent désormais sur V4.1 Flash : mesurez l’usage renvoyé par vos requêtes EvoLink pour le coût de production.

Quel modèle est le plus stable ?

Sur EvoLink, Flash est la route texte établie. Les requêtes vers l’ID Vision Exp tournent désormais sur V4.1 Flash : relancez votre évaluation visuelle et déployez le trafic image avec feature flag, canary et fallback validé.

PDF : Vision ou Flash ?

Flash si le texte extrait suffit ; un modèle image (sur EvoLink, deepseek-v4.1-flash) si tableaux, positions, écriture, tampons ou autres preuves visuelles changent la réponse.

Quel fallback pour Vision Exp ?

Un autre modèle Vision validé pour les tâches image, ou OCR traçable + Flash si le texte extrait suffit. Comme deepseek-v4-flash-vision-exp redirige désormais vers V4.1 Flash sur EvoLink, basculer entre ces deux IDs n’est pas un fallback.

Sources

Prêt à réduire vos coûts IA de 89 % ?

Commencez avec EvoLink dès aujourd'hui et découvrez la puissance du routage intelligent des API.