Seedance 2.5 ist jetzt auf EvoLink verfügbarSeedance 2.5 testen
DeepSeek V4 Flash Vision Exp API-Tutorial für Bild-Inputs
Tutorial

DeepSeek V4 Flash Vision Exp API mit Bildern verwenden

Jacey
Jacey
Founder
21. August 2026
9 Min. Lesezeit
DeepSeek veröffentlichte am 21. August 2026 das experimentelle Modell deepseek-v4-flash-vision-exp, das Text und Bilder in derselben Anfrage akzeptiert. EvoLink dokumentiert das Modell inzwischen für Chat Completions, Messages und Responses. Für die Integration reicht es nicht, nur ein Bildfeld einzufügen: Wählen Sie das Protokoll passend zur bestehenden Anwendung, prüfen Sie die zurückgegebene Usage und behalten Sie wegen des experimentellen Status einen Fallback.
Die öffentlichen DeepSeek-V4-Dokumente von EvoLink führen deepseek-v4-flash-vision-exp in allen drei Protokollen. Chat Completions verwendet image_url, Messages einen image-Content-Block mit Base64- oder URL-Quelle und Responses input_image. Die folgenden Beispiele entsprechen diesen dokumentierten Formen. Bevor Sie den Traffic erhöhen, führen Sie mit dem Produktionskonto eine repräsentative Anfrage aus.
Vision-Exp-Modellseite und Live-Preise ansehen
Wenn Ihr Router auch reine Textanfragen verarbeitet, hilft der Vergleich Vision Exp vs Flash, Bildbelege an Vision Exp und durchsatzorientierten Textverkehr an Flash zu leiten.

Kurzantwort: Was vor dem ersten Bild-Request nötig ist

Die Modell-ID lautet deepseek-v4-flash-vision-exp. EvoLink dokumentiert drei Bildformen: image_url für Chat Completions, einen image-Block für Messages und input_image für Responses. Content Blocks verschiedener Protokolle dürfen nicht vermischt werden.
PrüfungErforderliches ErgebnisWarum es wichtig ist
Modell-IDExakt deepseek-v4-flash-vision-exp sendenDie Text-Route Flash verarbeitet keine Bildbelege
ProtokollDie gewählte Route dokumentiert BildinhaltTextkompatibilität beweist keine multimodale Kompatibilität
EingabeEine repräsentative URL oder Base64-Datei funktioniertValidierung und Content-Block-Syntax unterscheiden sich
UsageInput- und Output-Nutzung erscheint in der AntwortNur so lässt sich der Preis pro akzeptiertem Ergebnis messen
AbrechnungDer Request erscheint korrekt in Usage oder BillingEine erfolgreiche Antwort allein bestätigt nicht den finalen Abrechnungsweg
FallbackEine verifizierte Vision-Route kann übernehmenDas -exp-Modell kann sich ändern, ausfallen oder eingestellt werden

Scheitert eine Laufzeitprüfung, lassen Sie diesen Workload auf einem bereits verifizierten Vision-Modell und behandeln Vision Exp zunächst als Evaluationskandidat.

Workflow für Bild-Inputs verstehen

Der praktische Ablauf lautet: ein oder mehrere Bilder mit einer präzisen Textanweisung senden, ein aktiviertes Protokoll wählen, das strukturierte Ergebnis validieren und Usage erfassen, bevor mehr Traffic geroutet wird. Ein Browser oder Agent sollte aufgrund einer einzigen ungeprüften Bildantwort keine irreversible Aktion ausführen.

Bilder, Dokumente und Diagramme werden über eine multimodale API in drei strukturierte Antwort-Workflows geroutet
Bilder, Dokumente und Diagramme werden über eine multimodale API in drei strukturierte Antwort-Workflows geroutet

Erstellen Sie vor der Integration ein kleines Testset: einen sauberen Screenshot, eine dichte Benutzeroberfläche, eine gescannte Seite, ein Diagramm mit kleinen Beschriftungen und ein absichtlich mehrdeutiges Bild. Definieren Sie vor dem Request die erwarteten Felder oder die gewünschte Entscheidung.

Das passende Protokollformat wählen

Die folgenden Beispiele entsprechen den aktuellen EvoLink-Content-Formen für Vision Exp. Nutzen Sie Endpoint, Pflichtfelder und Limits der verlinkten Protokollseite, denn die drei Payloads sind nicht austauschbar.

Chat Completions: image_url

Chat Completions passt zu Anwendungen, die bereits ein OpenAI-kompatibles messages-Array verwenden. Der User-Content kombiniert Text und image_url:
{
  "model": "deepseek-v4-flash-vision-exp",
  "messages": [
    {
      "role": "user",
      "content": [
        { "type": "text", "text": "Return the visible error message and the UI state as JSON." },
        { "type": "image_url", "image_url": { "url": "https://example.com/screenshot.png" } }
      ]
    }
  ]
}
Die aktuelle EvoLink-Dokumentation für Chat Completions zeigt Vision Exp, image_url, URL- und Base64-Beispiele sowie mehrere Bilder. Bildinhalte gehören in eine user-Nachricht; senden Sie die exakte Vision-Exp-ID.

Messages: image-Content-Block

Messages passt zu Anwendungen mit Anthropic-kompatibler Struktur. Die EvoLink-Dokumentation verlangt max_tokens auf oberster Ebene, daher bleibt das Feld im Bildbeispiel erhalten:
{
  "model": "deepseek-v4-flash-vision-exp",
  "max_tokens": 1024,
  "messages": [
    {
      "role": "user",
      "content": [
        { "type": "image", "source": { "type": "url", "url": "https://example.com/invoice.png" } },
        { "type": "text", "text": "Extract invoice number, date, currency, subtotal, tax, and total." }
      ]
    }
  ]
}
EvoLink dokumentiert Vision-Exp-Bildblöcke mit source.type gleich base64 oder url. Für Bildverständnis muss deepseek-v4-flash-vision-exp verwendet werden: Laut Dokumentation können die Textmodelle Flash und Pro das eigentliche Bild verwerfen, anstatt es auszuwerten.

Responses: input_image

Responses eignet sich, wenn der multimodale Request Teil eines längeren Agent-Workflows ist. Das dokumentierte EvoLink-Format kombiniert input_text und input_image:
{
  "model": "deepseek-v4-flash-vision-exp",
  "input": [
    {
      "role": "user",
      "content": [
        { "type": "input_text", "text": "Summarize the chart, then list every directly observed label." },
        { "type": "input_image", "image_url": "https://example.com/chart.png" }
      ]
    }
  ]
}
Die Responses-Dokumentation listet Vision Exp, input_image und mehrere Bilder. Streaming-Events, Tools und Fehler müssen trotzdem separat für diese Route geprüft werden. Dokumentierter Bild-Input bedeutet nicht, dass jedes Upstream-Verhalten der Files API über dieselbe Route verfügbar ist.

Bild-URL, Base64 oder Files API?

Die Wahl hängt von Datenzugriff, Request-Größe, Wiederverwendung und dem dokumentierten EvoLink-Umfang ab.

MethodeGeeignet fürProduktionsprüfung
Öffentliche Bild-URLÖffentliche oder kurzlebig signierte AssetsGateway kann die URL abrufen, Redirects sind zulässig, URL enthält keine sensiblen Daten
Base64 Data URIKleine private Bilder direkt im RequestRequest bleibt unter dem Limit und Logs speichern keine sensiblen Payloads
Files APIWiederverwendete oder verwaltete DateienEvoLink dokumentiert Files API, Lebensdauer und Berechtigungen ausdrücklich für diese Route

Für größere Bilder ist eine kurzlebig signierte URL sinnvoll, sofern das Gateway sie abrufen kann. Base64 eignet sich für kleine private Bilder. Behaupten Sie keine Files-API-Unterstützung, bevor sie in der EvoLink-Dokumentation der Route steht.

DeepSeek dokumentiert upstream JPEG, PNG, GIF und WebP. Größen-, URL-, Timeout- und Mehrbild-Limits des Gateways können enger sein.

Bildkosten ohne zweite Preistabelle schätzen

DeepSeek gibt an, dass ein Bild mit bis zu 384 Input-Tokens tokenisiert wird. Damit lässt sich der Bildanteil begrenzen, nicht aber der gesamte Task-Preis.
Kosten pro abgeschlossenem Task = Bild-Input + Text-Input + Output + Retries + weitere Agent-/Tool-Runden

Für zwei Bilder können 768 Bild-Input-Tokens als konservative Upstream-Obergrenze angesetzt werden, bevor Prompt und Output hinzukommen. Vergleichen Sie die Schätzung anschließend mit der tatsächlichen Usage der EvoLink-Route. Ein Cache-Vorteil für wiederholte Textpräfixe darf nicht automatisch auf Bildinhalte übertragen werden.

Die aktuellen EvoLink-Raten stehen auf der Produktseite von DeepSeek V4 Flash Vision Exp. Dieser Leitfaden pflegt absichtlich keine zweite Preistabelle.

Ergebnis vor der Automatisierung validieren

Eine flüssige Bildantwort kann trotzdem falsch sein. Definieren Sie je Workload eine Abnahmeregel:

WorkloadAbnahmemetrikEskalationsregel
RechnungsdatenExakte Übereinstimmung der PflichtfelderMenschliche Prüfung bei fehlendem Feld oder fehlerhafter Prüfsumme
Screenshot-QARichtiger Zustand und sichtbarer FehlertextMit Crop erneut versuchen, dann prüfen lassen
DiagrammanalyseBeschriftungen klar von Interpretation getrenntUnbelegte Zahlen zurückweisen
UI-AgentRichtige nächste Aktion ohne gefährliche NebenwirkungIrreversible Aktionen müssen bestätigt werden

Messen Sie die Quote akzeptierter Ergebnisse, nicht nur HTTP-Erfolg. Ein billiger Request mit vielen Wiederholungen oder manuellen Korrekturen kann teurer werden als eine stärkere Fallback-Route.

Häufige Fehler bei Bild-Requests

SymptomWahrscheinliche UrsacheMaßnahme
Modell fehlt im erlaubten EnumID falsch, Cache veraltet oder Konto ohne ZugriffExakte ID und Kontozugriff prüfen; nicht auf Text-Flash ausweichen
Bild-/Dokumentinhalt nicht unterstütztGewähltes Protokoll oder Modell ist textbasiertDokumentierte Bildroute oder verifiziertes Fallback verwenden
400 invalid content blockPayload nutzt die falsche Protokollformimage_url, image oder input_image passend zur Route einsetzen
Bild kann nicht geladen werdenURL privat, abgelaufen, umgeleitet oder blockiertAbrufbare signierte URL oder unterstütztes Base64 verwenden
Request zu großBase64 oder mehrere Bilder überschreiten ein LimitVerkleinern, komprimieren, aufteilen oder dokumentierte Datei-Route nutzen
429 oder TimeoutParallelität oder Routenkapazität überschrittenBegrenzte Retries, weniger parallele Requests und Failover einsetzen

Erfinden Sie keine feste RPM-, TPM-, Dateigrößen- oder Parallelitätsgrenze. Nutzen Sie die routenspezifische EvoLink-Dokumentation und prüfen Sie das Verhalten mit dem späteren Produktionskonto.

Kontrollierter Produktions-Rollout

Starten Sie mit einer kleinen, beobachtbaren Traffic-Klasse wie Screenshot-QA mit menschlicher Prüfung. Modellwahl gehört in die Konfiguration, nicht als fest codierte experimentelle ID in die gesamte Anwendung.

  1. Einen URL- oder Base64-Request im gewählten Protokoll erfolgreich ausführen.
  2. Antwort, Usage, Abrechnung und Fehler-Logging prüfen.
  3. Das feste visuelle Testset mit Vision Exp und einem Fallback vergleichen.
  4. Nur einen kleinen Traffic-Anteil routen und Kosten pro akzeptiertem Ergebnis messen.
  5. Erst erweitern, wenn Qualität, Latenz, Fehler und Kosten den Grenzwert erfüllen.

Das einheitliche EvoLink-API-Gateway erleichtert diesen Ablauf, weil Teams Routen, Nutzung und Abrechnung vergleichen können, ohne die gesamte Integration für ein experimentelles Provider-Modell neu aufzubauen.

FAQ

Wie lautet die genaue Modell-ID?

Die ID ist deepseek-v4-flash-vision-exp. Das Suffix -exp muss erhalten bleiben und kennzeichnet die experimentelle Upstream-Version.
Ja. Seit dem 21. August 2026 dokumentiert EvoLink deepseek-v4-flash-vision-exp mit Bildverständnis für Chat Completions, Messages und Responses. Verwenden Sie das Payload-Format der gewählten Protokollseite.

Kann ich Bilder an deepseek-v4-flash senden?

Nein. Laut EvoLink-Dokumentation kann die Text-Route das echte Bild verwerfen, statt es auszuwerten. Für bildabhängige Aufgaben ist Vision Exp oder ein anderes verifiziertes Vision-Modell nötig.

Bild-URL oder Base64?

Eine signierte URL eignet sich für größere Assets, wenn das Gateway sie abrufen kann. Base64 passt zu kleinen privaten Bildern innerhalb des dokumentierten Request-Limits. Schützen Sie sensible Daten in beiden Fällen.

Unterstützt das Modell Files-API-Uploads?

DeepSeek dokumentiert upstream eine Files API. Das beweist nicht, dass dieselbe Funktion über jede EvoLink-Route verfügbar ist. Verwenden Sie sie nur nach ausdrücklicher Bestätigung in der EvoLink-Dokumentation.

Wie viel kostet ein Bild?

DeepSeek nennt bis zu 384 Input-Tokens pro Bild. Addieren Sie Text-Input, Output, Retries und Agent-Runden und wenden Sie anschließend die Live-Raten der Produktseite an.

Welche Bildformate werden unterstützt?

DeepSeek dokumentiert upstream JPEG, PNG, GIF und WebP. Prüfen Sie vor Produktion zusätzlich EvoLink-spezifische Größen-, URL- und Mehrbild-Limits.

Was sollte vor Produktions-Traffic getestet werden?

Testen Sie einfache und schwierige Bilder, strukturierte Ausgabe, kleine Schrift, fehlende Felder, Latenz, Retries, Usage, Abrechnung und Fallback. Erweitern Sie erst, wenn die Kosten pro akzeptiertem Ergebnis passen.

Quellen und nächste Schritte

Halten Sie diesen Leitfaden mit den drei EvoLink-Protokollseiten synchron. Ändern sich experimentelle Modell-ID, Bildfelder oder Routengrenzen, müssen Beispiele und Abrechnung erneut geprüft werden.

Bereit, Ihre KI-Kosten um 89 % zu senken?

Starten Sie noch heute mit EvoLink und erleben Sie die Vorteile intelligenter API-Routing.