GPT Image 2.5 Flare & Sunburst sont disponibles sur EvoLinkEssayer GPT Image 2.5
Tutoriel API DeepSeek V4 Flash Vision Exp pour les entrées image
Tutoriel

Utiliser l’API DeepSeek V4 Flash Vision Exp avec des images

Jacey
Jacey
Founder
21 août 2026
Mis à jour le 10 septembre 2026
10 min de lecture
Mise à jour du cycle de vie — 10 septembre 2026 : DeepSeek a publié V4.1 Flash. Sur l’API directe de DeepSeek, deepseek-v4-flash et deepseek-v4-flash-vision-exp renvoient désormais vers V4.1 Flash, et deepseek-v4-pro doit suivre le 14 septembre 2026 à 12 h 00, heure de Pékin (04 h 00 UTC). Sur EvoLink, deepseek-v4-flash et deepseek-v4-pro ne sont pas concernés et continuent de servir DeepSeek V4 Flash et V4 Pro ; deepseek-v4-flash-vision-exp redirige désormais vers DeepSeek V4.1 Flash. Voir la mise à jour officielle, la page du modèle V4.1 Flash et le guide de migration.
DeepSeek a publié le 21 août 2026 le modèle expérimental deepseek-v4-flash-vision-exp, capable de recevoir du texte et des images dans une même requête. Sur EvoLink, les requêtes vers deepseek-v4-flash-vision-exp redirigent désormais vers DeepSeek V4.1 Flash ; utilisez deepseek-v4.1-flash pour les nouvelles intégrations. Les structures de requête ci-dessous reflètent la documentation du 21 août. Avant de les réutiliser avec le nouvel ID, validez une requête représentative par protocole et relancez votre jeu d’évaluation image, car le modèle derrière l’ID a changé.
Au 21 août 2026, la documentation publique DeepSeek V4 d’EvoLink répertoriait l’ID dans les trois protocoles. Chat Completions utilise image_url, Messages un bloc image dont la source est une URL ou du Base64, et Responses input_image. Les exemples ci-dessous respectent ces structures. Exécutez une requête représentative avec le compte de production avant d’augmenter le trafic.
Voir la page du modèle DeepSeek V4.1 Flash
Si le routeur traite aussi du texte seul, consultez le comparatif Vision Exp vs Flash : sur EvoLink, le trafic texte seul peut rester sur deepseek-v4-flash, et les tâches image passent à V4.1 Flash.

Réponse rapide : prérequis du premier appel image

L’ID d’origine est deepseek-v4-flash-vision-exp ; sur EvoLink, il redirige désormais vers DeepSeek V4.1 Flash, et les nouvelles intégrations utilisent deepseek-v4.1-flash. Les blocs image_url, image et input_image appartiennent respectivement à Chat, Messages et Responses : ils ne sont pas interchangeables.
VérificationRésultat requisPourquoi
ID du modèleLes nouvelles intégrations envoient deepseek-v4.1-flash ; l’ancien deepseek-v4-flash-vision-exp fonctionne toujours mais redirige vers V4.1 FlashFlash texte ne traite pas la preuve visuelle
ProtocoleLa route choisie documente l’imageUne compatibilité texte ne prouve pas la multimodalité
EntréeUne URL ou un Base64 représentatif fonctionneSyntaxe et validation diffèrent selon la route
UsageLa réponse contient l’usage entrée/sortieNécessaire pour mesurer le coût par résultat accepté
FacturationLa requête apparaît correctement dans EvoLinkUne réponse valide ne suffit pas à confirmer la facturation
FallbackUne route Vision validée peut prendre le relaisLe modèle derrière un ID peut changer, échouer ou être retiré

Si un contrôle d’exécution échoue, gardez ce workload sur un modèle Vision déjà validé et traitez V4.1 Flash comme un candidat à évaluer.

Comprendre le workflow d’entrée image

Le flux pratique consiste à joindre une ou plusieurs images à une instruction précise, sélectionner le protocole, valider le résultat structuré et enregistrer l’usage avant d’élargir le routage. Un navigateur ou un agent ne doit jamais exécuter une action irréversible sur la seule base d’une réponse visuelle non vérifiée.

Images, documents et graphiques routés par une API multimodale vers trois workflows de réponse structurée
Images, documents et graphiques routés par une API multimodale vers trois workflows de réponse structurée

Préparez un petit jeu d’évaluation : capture nette, interface dense, page numérisée, graphique à petites étiquettes et image volontairement ambiguë. Définissez les champs ou la décision attendue avant l’appel.

Choisir la structure du protocole

Ces exemples correspondent aux formes EvoLink actuelles. Utilisez l’endpoint, les champs obligatoires et les limites de la page du protocole choisi.

Chat Completions : image_url

Pour une application utilisant déjà un tableau OpenAI messages, combinez texte et image dans le contenu utilisateur :
{
  "model": "deepseek-v4-flash-vision-exp",
  "messages": [{
    "role": "user",
    "content": [
      { "type": "text", "text": "Return the visible error message and the UI state as JSON." },
      { "type": "image_url", "image_url": { "url": "https://example.com/screenshot.png" } }
    ]
  }]
}
La page Chat EvoLink documente Vision Exp, les URL, le Base64 et plusieurs images. Placez l’image dans un message user et gardez l’ID exact.

Messages : bloc image

Messages convient aux structures compatibles Anthropic. Le champ supérieur max_tokens est obligatoire :
{
  "model": "deepseek-v4-flash-vision-exp",
  "max_tokens": 1024,
  "messages": [{
    "role": "user",
    "content": [
      { "type": "image", "source": { "type": "url", "url": "https://example.com/invoice.png" } },
      { "type": "text", "text": "Extract invoice number, date, currency, subtotal, tax, and total." }
    ]
  }]
}
EvoLink accepte ici source.type égal à base64 ou url. Utilisez toujours un modèle image (sur EvoLink, deepseek-v4.1-flash) pour comprendre l’image : la documentation prévient que Flash et Pro texte peuvent remplacer l’image réelle au lieu de l’analyser.

Responses : input_image

Responses convient aux workflows agentiques plus longs :

{
  "model": "deepseek-v4-flash-vision-exp",
  "input": [{
    "role": "user",
    "content": [
      { "type": "input_text", "text": "Summarize the chart, then list every directly observed label." },
      { "type": "input_image", "image_url": "https://example.com/chart.png" }
    ]
  }]
}
La documentation Responses liste Vision Exp, input_image et les entrées multi-images. Vérifiez séparément les événements streaming, les outils et les erreurs ; l’image documentée ne garantit pas toutes les fonctions Files API upstream.

URL, Base64 ou Files API ?

MéthodeBon usageContrôle de production
URL publiqueAsset public ou URL signée courteURL accessible, redirections permises, aucune donnée sensible exposée
Data URI Base64Petite image privée dans la requêteTaille conforme et logs sans payload sensible
Files APIFichier réutilisé ou géréSupport, durée de vie et permissions explicitement documentés par EvoLink

Préférez une URL signée pour les gros fichiers accessibles au gateway et Base64 pour les petites images privées. N’affirmez pas la disponibilité de Files API sans documentation EvoLink dédiée. DeepSeek documente JPEG, PNG, GIF et WebP upstream ; les limites de taille, URL, délai et nombre d’images peuvent être plus strictes sur le gateway.

Estimer le coût sans dupliquer les tarifs

Pour le modèle Vision Exp du 21 août, DeepSeek indiquait jusqu’à 384 tokens d’entrée par image. Son guide Vision actuel fixe un plafond de 1024 tokens par image sur l’API directe, et les requêtes vers cet ID tournent désormais sur V4.1 Flash. Utilisez la règle actuelle pour borner la partie image, puis confirmez avec l’usage EvoLink ; ce plafond n’est pas le coût complet de la requête.
coût par tâche terminée = image + texte d’entrée + sortie + retries + tours agent/outils

Pour deux images, utilisez 2048 tokens image comme plafond prudent selon la règle actuelle de l’API directe, puis ajoutez prompt et sortie. Comparez ensuite avec l’usage réel EvoLink. Ne supposez pas que le cache des préfixes texte s’applique de la même manière aux images.

Consultez la page produit Vision Exp pour les tarifs EvoLink actuels ; ce tutoriel ne maintient pas une deuxième grille.

Valider avant d’automatiser

WorkloadCritère d’acceptationEscalade
Extraction de factureCorrespondance exacte des champs obligatoiresRevue humaine en cas de champ absent ou checksum incohérent
QA de captureÉtat et erreur visible correctsNouveau test avec recadrage, puis revue
Analyse de graphiqueÉtiquettes séparées de l’interprétationRefuser les valeurs sans preuve visuelle
Agent UIAction correcte sans effet dangereuxConfirmation avant action irréversible

Mesurez le taux de résultats acceptés, pas seulement les réponses HTTP réussies. Retries et corrections humaines peuvent rendre une route apparemment moins chère plus coûteuse.

Erreurs fréquentes

SymptômeCause probableAction
Modèle absent de l’enumID erroné, cache ancien ou compte sans accèsVérifier ID et compte ; ne pas substituer Flash texte
Image/document non supportéMauvais modèle ou protocole texteRoute image documentée ou fallback Vision
400 invalid content blockStructure d’un autre protocoleAssocier image_url, image ou input_image à la route
Image inaccessibleURL privée, expirée, redirigée ou bloquéeURL signée accessible ou Base64 pris en charge
Requête trop grandeBase64 ou lot au-delà de la limiteRedimensionner, compresser, diviser ou utiliser une route fichier documentée
429 ou timeoutCapacité ou concurrence dépasséeRetries bornés, moins de requêtes en vol et failover

N’inventez pas de limite RPM, TPM, taille ou concurrence. Utilisez les limites de la route et vérifiez le comportement avec le compte qui portera le trafic.

Déploiement progressif

  1. Réussir une requête URL ou Base64 sur le protocole choisi.
  2. Contrôler réponse, usage, facturation et logs d’erreur.
  3. Comparer le jeu d’évaluation fixe à un fallback.
  4. Router une petite part et mesurer le coût par résultat accepté.
  5. Élargir seulement si qualité, latence, erreurs et coût respectent les seuils.

Gardez l’ID de modèle en configuration plutôt qu’en dur. Le gateway unifié EvoLink permet de comparer routes, usage et facturation sans reconstruire l’intégration autour d’un seul modèle provider.

FAQ

Quel est l’ID exact du modèle ?

L’ID d’origine est deepseek-v4-flash-vision-exp, issu d’une version expérimentale upstream ; si vous l’appelez encore, conservez le suffixe -exp complet. Sur EvoLink, cet ID redirige désormais vers DeepSeek V4.1 Flash : les nouvelles intégrations doivent utiliser deepseek-v4.1-flash.
L’ID fonctionne toujours sur EvoLink, mais les requêtes vers deepseek-v4-flash-vision-exp sont désormais redirigées vers DeepSeek V4.1 Flash. Utilisez deepseek-v4.1-flash pour les nouvelles intégrations et consultez le guide de migration avant de vous fier à des résultats image antérieurs.

Puis-je envoyer une image à deepseek-v4-flash ?

Non. La route texte peut ignorer l’image réelle. Utilisez deepseek-v4.1-flash ou un autre modèle Vision validé dès que la réponse dépend des pixels.

URL ou Base64 ?

URL signée pour un asset plus grand accessible au gateway ; Base64 pour une petite image privée dans la limite documentée. Protégez les données dans les deux cas.

Files API est-il pris en charge ?

DeepSeek le documente upstream, mais cela ne prouve pas son exposition sur chaque route EvoLink. Attendez une confirmation explicite de la route.

Combien coûte une image ?

Pour le modèle Vision Exp d’origine, DeepSeek indiquait jusqu’à 384 tokens d’entrée par image ; son guide Vision actuel fixe un plafond de 1024 tokens par image sur l’API directe. Les requêtes vers cet ID tournent désormais sur V4.1 Flash : planifiez avec la règle actuelle, ajoutez texte, sortie, retries et tours agent, puis appliquez les tarifs en direct de la page produit.

Quels formats d’image ?

JPEG, PNG, GIF et WebP sont documentés upstream. Vérifiez aussi les limites EvoLink de taille, URL et multi-image.

Que tester avant la production ?

Images simples et difficiles, sortie structurée, petit texte, champs absents, latence, retries, usage, facturation et fallback.

Sources et prochaines étapes

Synchronisez ce guide avec les trois pages EvoLink et retestez exemples et facturation si le modèle derrière cet ID, les champs image ou les limites changent.

Prêt à réduire vos coûts IA de 89 % ?

Commencez avec EvoLink dès aujourd'hui et découvrez la puissance du routage intelligent des API.