
DeepSeek V4 Flash Vision Exp API mit Bildern verwenden
deepseek-v4-flash-vision-exp, das Text und Bilder in derselben Anfrage akzeptiert. EvoLink dokumentiert das Modell inzwischen für Chat Completions, Messages und Responses. Für die Integration reicht es nicht, nur ein Bildfeld einzufügen: Wählen Sie das Protokoll passend zur bestehenden Anwendung, prüfen Sie die zurückgegebene Usage und behalten Sie wegen des experimentellen Status einen Fallback.deepseek-v4-flash-vision-exp in allen drei Protokollen. Chat Completions verwendet image_url, Messages einen image-Content-Block mit Base64- oder URL-Quelle und Responses input_image. Die folgenden Beispiele entsprechen diesen dokumentierten Formen. Bevor Sie den Traffic erhöhen, führen Sie mit dem Produktionskonto eine repräsentative Anfrage aus.Kurzantwort: Was vor dem ersten Bild-Request nötig ist
deepseek-v4-flash-vision-exp. EvoLink dokumentiert drei Bildformen: image_url für Chat Completions, einen image-Block für Messages und input_image für Responses. Content Blocks verschiedener Protokolle dürfen nicht vermischt werden.| Prüfung | Erforderliches Ergebnis | Warum es wichtig ist |
|---|---|---|
| Modell-ID | Exakt deepseek-v4-flash-vision-exp senden | Die Text-Route Flash verarbeitet keine Bildbelege |
| Protokoll | Die gewählte Route dokumentiert Bildinhalt | Textkompatibilität beweist keine multimodale Kompatibilität |
| Eingabe | Eine repräsentative URL oder Base64-Datei funktioniert | Validierung und Content-Block-Syntax unterscheiden sich |
| Usage | Input- und Output-Nutzung erscheint in der Antwort | Nur so lässt sich der Preis pro akzeptiertem Ergebnis messen |
| Abrechnung | Der Request erscheint korrekt in Usage oder Billing | Eine erfolgreiche Antwort allein bestätigt nicht den finalen Abrechnungsweg |
| Fallback | Eine verifizierte Vision-Route kann übernehmen | Das -exp-Modell kann sich ändern, ausfallen oder eingestellt werden |
Scheitert eine Laufzeitprüfung, lassen Sie diesen Workload auf einem bereits verifizierten Vision-Modell und behandeln Vision Exp zunächst als Evaluationskandidat.
Workflow für Bild-Inputs verstehen
Der praktische Ablauf lautet: ein oder mehrere Bilder mit einer präzisen Textanweisung senden, ein aktiviertes Protokoll wählen, das strukturierte Ergebnis validieren und Usage erfassen, bevor mehr Traffic geroutet wird. Ein Browser oder Agent sollte aufgrund einer einzigen ungeprüften Bildantwort keine irreversible Aktion ausführen.

Erstellen Sie vor der Integration ein kleines Testset: einen sauberen Screenshot, eine dichte Benutzeroberfläche, eine gescannte Seite, ein Diagramm mit kleinen Beschriftungen und ein absichtlich mehrdeutiges Bild. Definieren Sie vor dem Request die erwarteten Felder oder die gewünschte Entscheidung.
Das passende Protokollformat wählen
Die folgenden Beispiele entsprechen den aktuellen EvoLink-Content-Formen für Vision Exp. Nutzen Sie Endpoint, Pflichtfelder und Limits der verlinkten Protokollseite, denn die drei Payloads sind nicht austauschbar.
Chat Completions: image_url
messages-Array verwenden. Der User-Content kombiniert Text und image_url:{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": [
{ "type": "text", "text": "Return the visible error message and the UI state as JSON." },
{ "type": "image_url", "image_url": { "url": "https://example.com/screenshot.png" } }
]
}
]
}image_url, URL- und Base64-Beispiele sowie mehrere Bilder. Bildinhalte gehören in eine user-Nachricht; senden Sie die exakte Vision-Exp-ID.Messages: image-Content-Block
max_tokens auf oberster Ebene, daher bleibt das Feld im Bildbeispiel erhalten:{
"model": "deepseek-v4-flash-vision-exp",
"max_tokens": 1024,
"messages": [
{
"role": "user",
"content": [
{ "type": "image", "source": { "type": "url", "url": "https://example.com/invoice.png" } },
{ "type": "text", "text": "Extract invoice number, date, currency, subtotal, tax, and total." }
]
}
]
}source.type gleich base64 oder url. Für Bildverständnis muss deepseek-v4-flash-vision-exp verwendet werden: Laut Dokumentation können die Textmodelle Flash und Pro das eigentliche Bild verwerfen, anstatt es auszuwerten.Responses: input_image
input_text und input_image:{
"model": "deepseek-v4-flash-vision-exp",
"input": [
{
"role": "user",
"content": [
{ "type": "input_text", "text": "Summarize the chart, then list every directly observed label." },
{ "type": "input_image", "image_url": "https://example.com/chart.png" }
]
}
]
}input_image und mehrere Bilder. Streaming-Events, Tools und Fehler müssen trotzdem separat für diese Route geprüft werden. Dokumentierter Bild-Input bedeutet nicht, dass jedes Upstream-Verhalten der Files API über dieselbe Route verfügbar ist.Bild-URL, Base64 oder Files API?
Die Wahl hängt von Datenzugriff, Request-Größe, Wiederverwendung und dem dokumentierten EvoLink-Umfang ab.
| Methode | Geeignet für | Produktionsprüfung |
|---|---|---|
| Öffentliche Bild-URL | Öffentliche oder kurzlebig signierte Assets | Gateway kann die URL abrufen, Redirects sind zulässig, URL enthält keine sensiblen Daten |
| Base64 Data URI | Kleine private Bilder direkt im Request | Request bleibt unter dem Limit und Logs speichern keine sensiblen Payloads |
| Files API | Wiederverwendete oder verwaltete Dateien | EvoLink dokumentiert Files API, Lebensdauer und Berechtigungen ausdrücklich für diese Route |
Für größere Bilder ist eine kurzlebig signierte URL sinnvoll, sofern das Gateway sie abrufen kann. Base64 eignet sich für kleine private Bilder. Behaupten Sie keine Files-API-Unterstützung, bevor sie in der EvoLink-Dokumentation der Route steht.
DeepSeek dokumentiert upstream JPEG, PNG, GIF und WebP. Größen-, URL-, Timeout- und Mehrbild-Limits des Gateways können enger sein.
Bildkosten ohne zweite Preistabelle schätzen
Kosten pro abgeschlossenem Task = Bild-Input + Text-Input + Output + Retries + weitere Agent-/Tool-RundenFür zwei Bilder können 768 Bild-Input-Tokens als konservative Upstream-Obergrenze angesetzt werden, bevor Prompt und Output hinzukommen. Vergleichen Sie die Schätzung anschließend mit der tatsächlichen Usage der EvoLink-Route. Ein Cache-Vorteil für wiederholte Textpräfixe darf nicht automatisch auf Bildinhalte übertragen werden.
Ergebnis vor der Automatisierung validieren
Eine flüssige Bildantwort kann trotzdem falsch sein. Definieren Sie je Workload eine Abnahmeregel:
| Workload | Abnahmemetrik | Eskalationsregel |
|---|---|---|
| Rechnungsdaten | Exakte Übereinstimmung der Pflichtfelder | Menschliche Prüfung bei fehlendem Feld oder fehlerhafter Prüfsumme |
| Screenshot-QA | Richtiger Zustand und sichtbarer Fehlertext | Mit Crop erneut versuchen, dann prüfen lassen |
| Diagrammanalyse | Beschriftungen klar von Interpretation getrennt | Unbelegte Zahlen zurückweisen |
| UI-Agent | Richtige nächste Aktion ohne gefährliche Nebenwirkung | Irreversible Aktionen müssen bestätigt werden |
Messen Sie die Quote akzeptierter Ergebnisse, nicht nur HTTP-Erfolg. Ein billiger Request mit vielen Wiederholungen oder manuellen Korrekturen kann teurer werden als eine stärkere Fallback-Route.
Häufige Fehler bei Bild-Requests
| Symptom | Wahrscheinliche Ursache | Maßnahme |
|---|---|---|
| Modell fehlt im erlaubten Enum | ID falsch, Cache veraltet oder Konto ohne Zugriff | Exakte ID und Kontozugriff prüfen; nicht auf Text-Flash ausweichen |
| Bild-/Dokumentinhalt nicht unterstützt | Gewähltes Protokoll oder Modell ist textbasiert | Dokumentierte Bildroute oder verifiziertes Fallback verwenden |
| 400 invalid content block | Payload nutzt die falsche Protokollform | image_url, image oder input_image passend zur Route einsetzen |
| Bild kann nicht geladen werden | URL privat, abgelaufen, umgeleitet oder blockiert | Abrufbare signierte URL oder unterstütztes Base64 verwenden |
| Request zu groß | Base64 oder mehrere Bilder überschreiten ein Limit | Verkleinern, komprimieren, aufteilen oder dokumentierte Datei-Route nutzen |
| 429 oder Timeout | Parallelität oder Routenkapazität überschritten | Begrenzte Retries, weniger parallele Requests und Failover einsetzen |
Erfinden Sie keine feste RPM-, TPM-, Dateigrößen- oder Parallelitätsgrenze. Nutzen Sie die routenspezifische EvoLink-Dokumentation und prüfen Sie das Verhalten mit dem späteren Produktionskonto.
Kontrollierter Produktions-Rollout
Starten Sie mit einer kleinen, beobachtbaren Traffic-Klasse wie Screenshot-QA mit menschlicher Prüfung. Modellwahl gehört in die Konfiguration, nicht als fest codierte experimentelle ID in die gesamte Anwendung.
- Einen URL- oder Base64-Request im gewählten Protokoll erfolgreich ausführen.
- Antwort, Usage, Abrechnung und Fehler-Logging prüfen.
- Das feste visuelle Testset mit Vision Exp und einem Fallback vergleichen.
- Nur einen kleinen Traffic-Anteil routen und Kosten pro akzeptiertem Ergebnis messen.
- Erst erweitern, wenn Qualität, Latenz, Fehler und Kosten den Grenzwert erfüllen.
Das einheitliche EvoLink-API-Gateway erleichtert diesen Ablauf, weil Teams Routen, Nutzung und Abrechnung vergleichen können, ohne die gesamte Integration für ein experimentelles Provider-Modell neu aufzubauen.
FAQ
Wie lautet die genaue Modell-ID?
deepseek-v4-flash-vision-exp. Das Suffix -exp muss erhalten bleiben und kennzeichnet die experimentelle Upstream-Version.Ist DeepSeek V4 Flash Vision Exp auf EvoLink verfügbar?
deepseek-v4-flash-vision-exp mit Bildverständnis für Chat Completions, Messages und Responses. Verwenden Sie das Payload-Format der gewählten Protokollseite.Kann ich Bilder an deepseek-v4-flash senden?
Nein. Laut EvoLink-Dokumentation kann die Text-Route das echte Bild verwerfen, statt es auszuwerten. Für bildabhängige Aufgaben ist Vision Exp oder ein anderes verifiziertes Vision-Modell nötig.
Bild-URL oder Base64?
Eine signierte URL eignet sich für größere Assets, wenn das Gateway sie abrufen kann. Base64 passt zu kleinen privaten Bildern innerhalb des dokumentierten Request-Limits. Schützen Sie sensible Daten in beiden Fällen.
Unterstützt das Modell Files-API-Uploads?
DeepSeek dokumentiert upstream eine Files API. Das beweist nicht, dass dieselbe Funktion über jede EvoLink-Route verfügbar ist. Verwenden Sie sie nur nach ausdrücklicher Bestätigung in der EvoLink-Dokumentation.
Wie viel kostet ein Bild?
DeepSeek nennt bis zu 384 Input-Tokens pro Bild. Addieren Sie Text-Input, Output, Retries und Agent-Runden und wenden Sie anschließend die Live-Raten der Produktseite an.
Welche Bildformate werden unterstützt?
DeepSeek dokumentiert upstream JPEG, PNG, GIF und WebP. Prüfen Sie vor Produktion zusätzlich EvoLink-spezifische Größen-, URL- und Mehrbild-Limits.
Was sollte vor Produktions-Traffic getestet werden?
Testen Sie einfache und schwierige Bilder, strukturierte Ausgabe, kleine Schrift, fehlende Felder, Latenz, Retries, Usage, Abrechnung und Fallback. Erweitern Sie erst, wenn die Kosten pro akzeptiertem Ergebnis passen.
Quellen und nächste Schritte
- EvoLink: DeepSeek V4 Chat Completions
- EvoLink: DeepSeek V4 Messages
- EvoLink: DeepSeek V4 Responses
- DeepSeek Vision Guide
- DeepSeek V4 Flash Vision Exp Release
- DeepSeek API Changelog
Halten Sie diesen Leitfaden mit den drei EvoLink-Protokollseiten synchron. Ändern sich experimentelle Modell-ID, Bildfelder oder Routengrenzen, müssen Beispiele und Abrechnung erneut geprüft werden.


