GPT Image 2.5 Flare & Sunburst sind jetzt auf EvoLink verfügbarGPT Image 2.5 testen
DeepSeek V4 Flash Vision Exp API-Tutorial für Bild-Inputs
Tutorial

DeepSeek V4 Flash Vision Exp API mit Bildern verwenden

Jacey
Jacey
Founder
21. August 2026
Aktualisiert am 10. September 2026
10 Min. Lesezeit
Lifecycle-Update – 10. September 2026: DeepSeek hat V4.1 Flash veröffentlicht. In der DeepSeek-Direkt-API werden deepseek-v4-flash und deepseek-v4-flash-vision-exp jetzt an V4.1 Flash weitergeleitet; deepseek-v4-pro folgt planmäßig am 14. September 2026 um 12:00 Uhr Pekinger Zeit (04:00 UTC). Auf EvoLink sind deepseek-v4-flash und deepseek-v4-pro nicht betroffen und liefern weiterhin DeepSeek V4 Flash und V4 Pro; deepseek-v4-flash-vision-exp leitet jetzt an DeepSeek V4.1 Flash weiter. Siehe das offizielle Update, die Modellseite von V4.1 Flash und den Migrationsleitfaden.
DeepSeek veröffentlichte am 21. August 2026 das experimentelle Modell deepseek-v4-flash-vision-exp, das Text und Bilder in derselben Anfrage akzeptiert. Auf EvoLink werden Requests an deepseek-v4-flash-vision-exp jetzt an DeepSeek V4.1 Flash weitergeleitet; für neue Integrationen verwenden Sie deepseek-v4.1-flash. Die Request-Formen unten geben die Dokumentation vom 21. August wieder. Bevor Sie sie mit der neuen ID wiederverwenden, bestätigen Sie je Protokoll einen repräsentativen Request und führen Ihr Bild-Evaluationsset erneut aus, denn das Modell hinter der ID hat sich geändert.
Stand 21. August 2026 führen die öffentlichen DeepSeek-V4-Dokumente von EvoLink deepseek-v4-flash-vision-exp in allen drei Protokollen. Chat Completions verwendet image_url, Messages einen image-Content-Block mit Base64- oder URL-Quelle und Responses input_image. Die folgenden Beispiele entsprechen diesen dokumentierten Formen. Bevor Sie den Traffic erhöhen, führen Sie mit dem Produktionskonto eine repräsentative Anfrage aus.
Zur Modellseite von DeepSeek V4.1 Flash
Wenn Ihr Router auch reine Textanfragen verarbeitet, hilft der Vergleich Vision Exp vs Flash: Auf EvoLink kann reiner Textverkehr auf deepseek-v4-flash bleiben, Bildaufgaben wandern zu V4.1 Flash.

Kurzantwort: Was vor dem ersten Bild-Request nötig ist

Die ursprüngliche Modell-ID lautet deepseek-v4-flash-vision-exp; auf EvoLink leitet sie jetzt an DeepSeek V4.1 Flash weiter, neue Integrationen verwenden deepseek-v4.1-flash. EvoLink dokumentiert drei Bildformen: image_url für Chat Completions, einen image-Block für Messages und input_image für Responses. Content Blocks verschiedener Protokolle dürfen nicht vermischt werden.
PrüfungErforderliches ErgebnisWarum es wichtig ist
Modell-IDNeue Integrationen senden deepseek-v4.1-flash; das alte deepseek-v4-flash-vision-exp funktioniert noch, leitet aber an V4.1 Flash weiterDie Text-Route Flash verarbeitet keine Bildbelege
ProtokollDie gewählte Route dokumentiert BildinhaltTextkompatibilität beweist keine multimodale Kompatibilität
EingabeEine repräsentative URL oder Base64-Datei funktioniertValidierung und Content-Block-Syntax unterscheiden sich
UsageInput- und Output-Nutzung erscheint in der AntwortNur so lässt sich der Preis pro akzeptiertem Ergebnis messen
AbrechnungDer Request erscheint korrekt in Usage oder BillingEine erfolgreiche Antwort allein bestätigt nicht den finalen Abrechnungsweg
FallbackEine verifizierte Vision-Route kann übernehmenDas Modell hinter jeder ID kann sich ändern, ausfallen oder eingestellt werden

Scheitert eine Laufzeitprüfung, lassen Sie diesen Workload auf einem bereits verifizierten Vision-Modell und behandeln V4.1 Flash zunächst als Evaluationskandidat.

Workflow für Bild-Inputs verstehen

Der praktische Ablauf lautet: ein oder mehrere Bilder mit einer präzisen Textanweisung senden, ein aktiviertes Protokoll wählen, das strukturierte Ergebnis validieren und Usage erfassen, bevor mehr Traffic geroutet wird. Ein Browser oder Agent sollte aufgrund einer einzigen ungeprüften Bildantwort keine irreversible Aktion ausführen.

Bilder, Dokumente und Diagramme werden über eine multimodale API in drei strukturierte Antwort-Workflows geroutet
Bilder, Dokumente und Diagramme werden über eine multimodale API in drei strukturierte Antwort-Workflows geroutet

Erstellen Sie vor der Integration ein kleines Testset: einen sauberen Screenshot, eine dichte Benutzeroberfläche, eine gescannte Seite, ein Diagramm mit kleinen Beschriftungen und ein absichtlich mehrdeutiges Bild. Definieren Sie vor dem Request die erwarteten Felder oder die gewünschte Entscheidung.

Das passende Protokollformat wählen

Die folgenden Beispiele entsprechen den aktuellen EvoLink-Content-Formen für Vision Exp. Nutzen Sie Endpoint, Pflichtfelder und Limits der verlinkten Protokollseite, denn die drei Payloads sind nicht austauschbar.

Chat Completions: image_url

Chat Completions passt zu Anwendungen, die bereits ein OpenAI-kompatibles messages-Array verwenden. Der User-Content kombiniert Text und image_url:
{
  "model": "deepseek-v4-flash-vision-exp",
  "messages": [
    {
      "role": "user",
      "content": [
        { "type": "text", "text": "Return the visible error message and the UI state as JSON." },
        { "type": "image_url", "image_url": { "url": "https://example.com/screenshot.png" } }
      ]
    }
  ]
}
Die aktuelle EvoLink-Dokumentation für Chat Completions zeigt Vision Exp, image_url, URL- und Base64-Beispiele sowie mehrere Bilder. Bildinhalte gehören in eine user-Nachricht; senden Sie die Modell-ID exakt.

Messages: image-Content-Block

Messages passt zu Anwendungen mit Anthropic-kompatibler Struktur. Die EvoLink-Dokumentation verlangt max_tokens auf oberster Ebene, daher bleibt das Feld im Bildbeispiel erhalten:
{
  "model": "deepseek-v4-flash-vision-exp",
  "max_tokens": 1024,
  "messages": [
    {
      "role": "user",
      "content": [
        { "type": "image", "source": { "type": "url", "url": "https://example.com/invoice.png" } },
        { "type": "text", "text": "Extract invoice number, date, currency, subtotal, tax, and total." }
      ]
    }
  ]
}
EvoLink dokumentiert Vision-Exp-Bildblöcke mit source.type gleich base64 oder url. Für Bildverständnis ist eine bildfähige ID nötig (dokumentiert war deepseek-v4-flash-vision-exp, neue Integrationen nutzen deepseek-v4.1-flash): Laut Dokumentation können die Textmodelle Flash und Pro das eigentliche Bild verwerfen, anstatt es auszuwerten.

Responses: input_image

Responses eignet sich, wenn der multimodale Request Teil eines längeren Agent-Workflows ist. Das dokumentierte EvoLink-Format kombiniert input_text und input_image:
{
  "model": "deepseek-v4-flash-vision-exp",
  "input": [
    {
      "role": "user",
      "content": [
        { "type": "input_text", "text": "Summarize the chart, then list every directly observed label." },
        { "type": "input_image", "image_url": "https://example.com/chart.png" }
      ]
    }
  ]
}
Die Responses-Dokumentation listet Vision Exp, input_image und mehrere Bilder. Streaming-Events, Tools und Fehler müssen trotzdem separat für diese Route geprüft werden. Dokumentierter Bild-Input bedeutet nicht, dass jedes Upstream-Verhalten der Files API über dieselbe Route verfügbar ist.

Bild-URL, Base64 oder Files API?

Die Wahl hängt von Datenzugriff, Request-Größe, Wiederverwendung und dem dokumentierten EvoLink-Umfang ab.

MethodeGeeignet fürProduktionsprüfung
Öffentliche Bild-URLÖffentliche oder kurzlebig signierte AssetsGateway kann die URL abrufen, Redirects sind zulässig, URL enthält keine sensiblen Daten
Base64 Data URIKleine private Bilder direkt im RequestRequest bleibt unter dem Limit und Logs speichern keine sensiblen Payloads
Files APIWiederverwendete oder verwaltete DateienEvoLink dokumentiert Files API, Lebensdauer und Berechtigungen ausdrücklich für diese Route

Für größere Bilder ist eine kurzlebig signierte URL sinnvoll, sofern das Gateway sie abrufen kann. Base64 eignet sich für kleine private Bilder. Behaupten Sie keine Files-API-Unterstützung, bevor sie in der EvoLink-Dokumentation der Route steht.

DeepSeek dokumentiert upstream JPEG, PNG, GIF und WebP. Größen-, URL-, Timeout- und Mehrbild-Limits des Gateways können enger sein.

Bildkosten ohne zweite Preistabelle schätzen

Für das Vision-Exp-Modell vom 21. August gab DeepSeek an, dass ein Bild mit bis zu 384 Input-Tokens tokenisiert wurde. Der aktuelle Vision-Leitfaden nennt für die Direkt-API eine Obergrenze von 1024 Tokens pro Bild, und Requests an diese ID laufen jetzt auf V4.1 Flash. Begrenzen Sie den Bildanteil mit der aktuellen Regel und prüfen Sie ihn anschließend mit der EvoLink-Usage; der gesamte Task-Preis ist das nicht.
Kosten pro abgeschlossenem Task = Bild-Input + Text-Input + Output + Retries + weitere Agent-/Tool-Runden

Für zwei Bilder ergibt die aktuelle Regel der Direkt-API eine Obergrenze von 2.048 Bild-Tokens (nach der ursprünglichen Vision-Exp-Angabe waren es 768), bevor Prompt und Output hinzukommen. Vergleichen Sie die Schätzung anschließend mit der tatsächlichen Usage der EvoLink-Route. Ein Cache-Vorteil für wiederholte Textpräfixe darf nicht automatisch auf Bildinhalte übertragen werden.

Die aktuellen EvoLink-Raten stehen auf der Produktseite von DeepSeek V4 Flash Vision Exp. Dieser Leitfaden pflegt absichtlich keine zweite Preistabelle.

Ergebnis vor der Automatisierung validieren

Eine flüssige Bildantwort kann trotzdem falsch sein. Definieren Sie je Workload eine Abnahmeregel:

WorkloadAbnahmemetrikEskalationsregel
RechnungsdatenExakte Übereinstimmung der PflichtfelderMenschliche Prüfung bei fehlendem Feld oder fehlerhafter Prüfsumme
Screenshot-QARichtiger Zustand und sichtbarer FehlertextMit Crop erneut versuchen, dann prüfen lassen
DiagrammanalyseBeschriftungen klar von Interpretation getrenntUnbelegte Zahlen zurückweisen
UI-AgentRichtige nächste Aktion ohne gefährliche NebenwirkungIrreversible Aktionen müssen bestätigt werden

Messen Sie die Quote akzeptierter Ergebnisse, nicht nur HTTP-Erfolg. Ein billiger Request mit vielen Wiederholungen oder manuellen Korrekturen kann teurer werden als eine stärkere Fallback-Route.

Häufige Fehler bei Bild-Requests

SymptomWahrscheinliche UrsacheMaßnahme
Modell fehlt im erlaubten EnumID falsch, Cache veraltet oder Konto ohne ZugriffExakte ID und Kontozugriff prüfen; nicht auf Text-Flash ausweichen
Bild-/Dokumentinhalt nicht unterstütztGewähltes Protokoll oder Modell ist textbasiertDokumentierte Bildroute oder verifiziertes Fallback verwenden
400 invalid content blockPayload nutzt die falsche Protokollformimage_url, image oder input_image passend zur Route einsetzen
Bild kann nicht geladen werdenURL privat, abgelaufen, umgeleitet oder blockiertAbrufbare signierte URL oder unterstütztes Base64 verwenden
Request zu großBase64 oder mehrere Bilder überschreiten ein LimitVerkleinern, komprimieren, aufteilen oder dokumentierte Datei-Route nutzen
429 oder TimeoutParallelität oder Routenkapazität überschrittenBegrenzte Retries, weniger parallele Requests und Failover einsetzen

Erfinden Sie keine feste RPM-, TPM-, Dateigrößen- oder Parallelitätsgrenze. Nutzen Sie die routenspezifische EvoLink-Dokumentation und prüfen Sie das Verhalten mit dem späteren Produktionskonto.

Kontrollierter Produktions-Rollout

Starten Sie mit einer kleinen, beobachtbaren Traffic-Klasse wie Screenshot-QA mit menschlicher Prüfung. Modellwahl gehört in die Konfiguration, nicht als fest codierte Modell-ID in die gesamte Anwendung.

  1. Einen URL- oder Base64-Request im gewählten Protokoll erfolgreich ausführen.
  2. Antwort, Usage, Abrechnung und Fehler-Logging prüfen.
  3. Das feste visuelle Testset mit Vision Exp und einem Fallback vergleichen.
  4. Nur einen kleinen Traffic-Anteil routen und Kosten pro akzeptiertem Ergebnis messen.
  5. Erst erweitern, wenn Qualität, Latenz, Fehler und Kosten den Grenzwert erfüllen.

Das einheitliche EvoLink-API-Gateway erleichtert diesen Ablauf, weil Teams Routen, Nutzung und Abrechnung vergleichen können, ohne die gesamte Integration um ein einzelnes Provider-Modell herum neu aufzubauen.

FAQ

Wie lautet die genaue Modell-ID?

Die ursprüngliche ID ist deepseek-v4-flash-vision-exp und stammt aus einem experimentellen Upstream-Release; wenn Sie sie weiter aufrufen, behalten Sie das vollständige Suffix -exp bei. Auf EvoLink leitet diese ID jetzt an DeepSeek V4.1 Flash weiter, neue Integrationen sollten daher deepseek-v4.1-flash verwenden.
Die ID funktioniert auf EvoLink weiterhin, Requests an deepseek-v4-flash-vision-exp werden aber an DeepSeek V4.1 Flash weitergeleitet. Verwenden Sie für neue Integrationen deepseek-v4.1-flash und lesen Sie den Migrationsleitfaden, bevor Sie sich auf frühere Bildergebnisse verlassen.

Kann ich Bilder an deepseek-v4-flash senden?

Nein. Laut EvoLink-Dokumentation kann die Text-Route das echte Bild verwerfen, statt es auszuwerten. Für bildabhängige Aufgaben ist deepseek-v4.1-flash oder ein anderes verifiziertes Vision-Modell nötig.

Bild-URL oder Base64?

Eine signierte URL eignet sich für größere Assets, wenn das Gateway sie abrufen kann. Base64 passt zu kleinen privaten Bildern innerhalb des dokumentierten Request-Limits. Schützen Sie sensible Daten in beiden Fällen.

Unterstützt das Modell Files-API-Uploads?

DeepSeek dokumentiert upstream eine Files API. Das beweist nicht, dass dieselbe Funktion über jede EvoLink-Route verfügbar ist. Verwenden Sie sie nur nach ausdrücklicher Bestätigung in der EvoLink-Dokumentation.

Wie viel kostet ein Bild?

Für das ursprüngliche Vision-Exp-Modell nannte DeepSeek bis zu 384 Input-Tokens pro Bild; der aktuelle Vision-Leitfaden setzt für die Direkt-API eine Obergrenze von 1024 Tokens pro Bild. Requests an diese ID laufen jetzt auf V4.1 Flash – planen Sie mit der aktuellen Regel, addieren Sie Text-Input, Output, Retries und Agent-Runden und wenden Sie anschließend die Live-Raten der Produktseite an.

Welche Bildformate werden unterstützt?

DeepSeek dokumentiert upstream JPEG, PNG, GIF und WebP. Prüfen Sie vor Produktion zusätzlich EvoLink-spezifische Größen-, URL- und Mehrbild-Limits.

Was sollte vor Produktions-Traffic getestet werden?

Testen Sie einfache und schwierige Bilder, strukturierte Ausgabe, kleine Schrift, fehlende Felder, Latenz, Retries, Usage, Abrechnung und Fallback. Erweitern Sie erst, wenn die Kosten pro akzeptiertem Ergebnis passen.

Quellen und nächste Schritte

Halten Sie diesen Leitfaden mit den drei EvoLink-Protokollseiten synchron. Ändern sich das Modell hinter dieser ID, Bildfelder oder Routengrenzen, müssen Beispiele und Abrechnung erneut geprüft werden.

Bereit, Ihre KI-Kosten um 89 % zu senken?

Starten Sie noch heute mit EvoLink und erleben Sie die Vorteile intelligenter API-Routing.