
DeepSeek V4 Flash Vision Exp vs. Flash: Bild oder Text?
Lifecycle-Update – 10. September 2026: DeepSeek hat V4.1 Flash veröffentlicht. In der DeepSeek-Direkt-API werdendeepseek-v4-flashunddeepseek-v4-flash-vision-expjetzt an V4.1 Flash weitergeleitet;deepseek-v4-profolgt planmäßig am 14. September 2026 um 12:00 Uhr Pekinger Zeit (04:00 UTC). Auf EvoLink sinddeepseek-v4-flashunddeepseek-v4-pronicht betroffen und liefern weiterhin DeepSeek V4 Flash und V4 Pro;deepseek-v4-flash-vision-expleitet jetzt an DeepSeek V4.1 Flash weiter. Siehe das offizielle Update, die Modellseite von V4.1 Flash und den Migrationsleitfaden.
deepseek-v4-flash-vision-exp werden jetzt an V4.1 Flash weitergeleitet; die Vision-Exp-Ergebnisse unten beschreiben daher das Modell vom 21. August – führen Sie das Bild-Evaluationsset mit dem Nachfolger erneut aus. Das Routing-Prinzip bleibt: Bild-Input ist kein Grund, jeden Flash-Request zu migrieren. In EvoLink sollte zuerst die Modalität erkannt, jede Route mit eigenen Erfolgskriterien bewertet und hinter der Bildroute ein verifiziertes Fallback gehalten werden.deepseek-v4-flash-vision-exp mit Bildverständnis für Chat Completions, Messages und Responses. Das Modell erschien als experimentelles Modell, und auf EvoLink leitet die ID inzwischen an V4.1 Flash weiter; vor dem Produktions-Rollout sollten Bildformat, Usage, Abrechnung und Fallback daher weiterhin mit repräsentativen Requests geprüft werden.Kurzurteil: Nach Modalität routen, nicht nach Neuheit
| Workload-Bedingung | Startmodell | Grund |
|---|---|---|
| Antwort braucht Screenshot, Scan, Diagramm, Foto oder gerenderte UI | Vision Exp | Der Task benötigt visuelle Belege, die Text-Flash nicht prüfen kann |
| Aufgabe liegt vollständig als Text, Code, JSON oder Tool-Output vor | Flash | Die Vision-Route liefert kein zusätzliches Signal |
| Dokument hat zuverlässigen extrahierten Text und Layout ist unwichtig | Flash | Normalisierter Text reicht aus |
| Tabellen, Position, Handschrift oder visuelle Hierarchie sind wichtig | Vision Exp | Originalseite bewahrt Layout und Markierungen |
| Visueller Agent beobachtet wechselnde UI-Screenshots | Vision Exp + Fallback | Visuelles Grounding ist nötig, die Bildroute muss kontrolliert ausgerollt werden |
| Hochvolumige Textklassifikation, Zusammenfassung oder Coding | Flash | Etablierte Text-Route bleibt operativer Standard |
Was unterscheidet die Modelle tatsächlich?
| Faktor | DeepSeek V4 Flash Vision Exp | DeepSeek V4 Flash |
|---|---|---|
| Modell-ID | deepseek-v4-flash-vision-exp | deepseek-v4-flash |
| Status | Am 21. August als experimentelles Bildmodell erschienen; auf EvoLink leitet die ID jetzt an V4.1 Flash weiter | Allgemein verfügbare Text-Route auf EvoLink, von der Änderung vom 10. September nicht betroffen |
| Input | Text und Bilder | Nur Text |
| Output | Text | Text |
| Gute Start-Workloads | Screenshot-Prüfung, Dokumentextraktion, Diagrammanalyse, visuelle Agents | Coding, Klassifikation, Zusammenfassung, Text-Agents, strukturierte Transformation |
| Evaluationsfokus | Visuelle Genauigkeit, Grounding, kleine Schrift, Layout | Task-Genauigkeit, Latenz, Output-Tokens, Tools, Textstabilität |
| Produktionsregel | Feature Flag, Protokollprüfung, Canary, Fallback | Standard-Text-Route mit Regression-Monitoring |
image_url, Messages einen image-Block mit Base64- oder URL-Quelle und Responses input_image. Der Leitfaden für Bild-Inputs ordnet die Payload dem Protokoll zu; Files-API-Verhalten braucht weiterhin eine eigene dokumentierte Route.
Durchsetzbarer Routing-Entscheidungsbaum
Die sicherste Regel ist zuerst deterministisch:
- Hängt das Ergebnis von visuellen Belegen ab? Falls nein, normalisierten Text an
deepseek-v4-flashsenden. - Ist das Originalbild nötig? Enthält OCR oder strukturierte Extraktion alles, bleibt die Text-Route.
- Akzeptiert das gewählte EvoLink-Protokoll das Format? Falls nein, stoppen oder zu einem verifizierten Vision-Fallback wechseln; Bilder nie still verwerfen.
- Ist Vision für Tenant und Workload erlaubt? Bildroute per Feature Flag, Allowlist oder Router-Regel isolieren.
- Besteht das Ergebnis die visuelle Abnahme? Andernfalls begrenzt erneut versuchen oder failovern, flüssigen Text nicht automatisch glauben.
if requires_visual_evidence and vision_route_verified:
route = "deepseek-v4-flash-vision-exp"
else:
route = "deepseek-v4-flash"Speichern Sie auch den Routing-Grund. So bleiben Nutzung, Fehler und spätere Modellmigrationen im einheitlichen Gateway nachvollziehbar.
Workload-Routing-Matrix
| Workload | Route | Abnahme | Fallback |
|---|---|---|---|
| Screenshot-Bug-Triage | Vision Exp | Sichtbarer Zustand und relevante Region korrekt | Anderes Vision-Modell oder Mensch |
| Rechnung/Formular | Vision Exp, wenn Layout zählt | Feldgenauigkeit, Fehlstellen, Seitennachweis | OCR + Flash über extrahierten Text |
| Diagramminterpretation | Vision Exp | Achsen, Legende, Einheiten und Trend korrekt | Strukturierte Daten + Flash |
| UI-Agent-Beobachtung | Vision Exp | Element-Grounding und Aktionsbedingungen | Accessibility Tree, Tool-State oder Vision-Fallback |
| Repository-Analyse aus Quelldateien | Flash | Tests, Dateiverweise und Task-Abschluss | Pro oder anderes Textmodell je Fehlerkosten |
| Textklassifikation/Zusammenfassung | Flash | Markiertes Validierungsset und Output-Schema | Retry oder alternatives Textmodell |
| PDF mit sauberem extrahiertem Text | Flash | Vollständigkeit gegen Stichprobenseiten | Vision nur bei Layoutverlust |
| Gemischte Text-/Screenshot-Batches | Traffic trennen | Erfolgsrate und Kosten pro Route | Fehlgeschlagene visuelle Tasks separat einreihen |
Die Trennung bindet visuelle Verarbeitung an echten Bedarf und verhindert, dass die Bildroute zum Single Point of Failure für Text-Traffic wird.
Kosten pro erfolgreichen Task statt Tokenpreis vergleichen
Kosten pro erfolgreichem Task = Input + Output + Retries + Vorverarbeitung + Review + AusfallwirkungFür Vision Exp sollten Bildanzahl, Bild- und Text-Tokens, Output, Retries und menschliche Korrekturen erfasst werden. Für Flash zählen Input/Output, Cache-Verhalten und Eskalationsrate. Vergleichen Sie dieselbe Geschäftseinheit, etwa ein korrekt verarbeitetes Dokument, nicht nur einen Request.
Beide Routen mit passenden Belegen bewerten
Testen Sie nicht nur Text und schließen daraus, Vision sei nutzlos. Testen Sie auch nicht nur Screenshots und schließen daraus, Vision solle Flash überall ersetzen.
Testset für Vision Exp
- Transkriptions- und Feldgenauigkeit bei Scans und Dokumenten
- Achsen, Legenden, Einheiten und Werte in Diagrammen
- kleine Schrift und dichte UI
- Positions- oder Element-Grounding für visuelle Agents
- keine erfundenen Inhalte bei unlesbaren Stellen
- Latenz, Retry-Rate und Korrekturen
Testset für Flash
- Antwort- oder Transformationsgenauigkeit
- Schema-Gültigkeit und Tool-Verhalten
- Time to First Token und Gesamtlatenz
- Input-, Reasoning- und Output-Tokens
- Retry- oder Eskalationsrate
Zum Release im August sagte DeepSeek, dass das experimentelle Vision-Modell bei reinen Textaufgaben Flash entspreche. Das ist eine Anbieterangabe, keine Migrationsentscheidung. Ändern Sie die Text-Route nur, wenn ein gleichartiger Test einen klaren Produktvorteil zeigt.
Produktions-Rollout auf EvoLink
1. Routen-Gate erfüllen
- EvoLink-Dokumentation listet
deepseek-v4-flash-vision-exp - Protokoll und Bildfeld sind dokumentiert
- echter Account-Request liefert gültige Antwort und Usage
- Abrechnung stimmt mit der aktuellen Preisoberfläche überein
- nicht unterstützte oder zu große Inputs scheitern vorhersehbar
2. Feature Flag einsetzen
deepseek-v4-flash nicht global. Wählen Sie Vision nur bei echtem visuellem Bedarf und erlaubtem Tenant.3. Mit Canary-Traffic beginnen
Starten Sie intern oder mit risikoarmen Bildaufgaben. Protokollieren Sie Input, Routing-Grund, Latenz, Usage, Abnahme, Fallback und Korrektur.
4. Pro Workload erweitern
Skalieren Sie Screenshot-Prüfung, Diagrammanalyse und ausgewählte Dokumenttypen getrennt. Erfolg in einem Use Case validiert nicht alle visuellen Aufgaben.
5. Textstandard beibehalten
Bis Vision Exp einen Übernahmevorteil belegt, verarbeitet Flash weiterhin Text-Traffic. Das begrenzt Ausfälle und verbessert Kostenzuordnung.
Häufige Routing-Fehler
| Fehler | Problem | Bessere Regel |
|---|---|---|
| Bildmodell ersetzt Flash global, weil es neuer ist | Text-Traffic hängt von einem Bildmodell ab | Nach Input-Beleg und Workload routen |
| Jedes PDF als Bilder senden | Visuelle Verarbeitung trotz sauberem Text | Erst Text extrahieren, Bilder nur bei wichtigem Layout |
| Upstream-Support mit EvoLink gleichsetzen | Modell- und Protokollrouten können abweichen | Exakte EvoLink-Doku und echten Request prüfen |
| Nur Listenpreise vergleichen | Retries, Output, Review und Ausfälle fehlen | Kosten pro abgeschlossenem Task messen |
| Flüssige Bildbeschreibung glauben | Diagramm oder Kleinschrift kann falsch gelesen sein | Workload-spezifische Abnahme einführen |
| Nicht unterstützte Bilder still verwerfen | Antwort wirkt plausibel, nutzt aber den Beleg nicht | Geschlossen fehlschlagen oder Vision-Fallback nutzen |
-exp entfernen | Auf EvoLink ruft das die reine Text-ID deepseek-v4-flash auf | Für neue Bildaufgaben deepseek-v4.1-flash senden; die alte ID, falls beibehalten, exakt senden |
Empfohlene Fallback-Policy
- Screenshots und Diagramme zu einer anderen verifizierten Vision-Route, nicht ohne Bild an Flash.
- Dokumente können über nachvollziehbares OCR zu Flash gehen, wenn Layoutverlust akzeptabel ist.
- Bei unsicherem Grounding oder Route destruktive Agent-Aktionen pausieren.
- Timeouts, Retries und Gesamtbudget begrenzen. Ein neues Modell rechtfertigt keine unbegrenzten Retries.
- Fallback-Nutzung getrennt messen, damit Gesamterfolg keine schwache Vision-Route verdeckt.
Das einheitliche EvoLink-Gateway dient dabei als kontrollierte Auswahlfläche: Text-, Vision- und Fallback-Routen bleiben explizit, während Nutzung und Kosten vergleichbar sind.
FAQ
Sind Vision Exp und Flash dasselbe Modell?
deepseek-v4-flash liefert weiterhin das reine Textmodell V4 Flash, während deepseek-v4-flash-vision-exp jetzt an DeepSeek V4.1 Flash weiterleitet. In der DeepSeek-Direkt-API werden beide alten Namen inzwischen an V4.1 Flash weitergeleitet.Welche Modell-ID unterstützt Bilder?
deepseek-v4.1-flash. Bestehende Requests an deepseek-v4-flash-vision-exp funktionieren weiterhin, werden aber an V4.1 Flash weitergeleitet.Kann DeepSeek V4 Flash Screenshots lesen?
deepseek-v4-flash weiterhin die reine Text-Route von V4 Flash. Für pixelabhängige Aufgaben nutzen Sie deepseek-v4.1-flash oder ein anderes verifiziertes Vision-Modell.Kann Vision Exp reinen Text verarbeiten?
deepseek-v4-flash, sofern Ihre eigene Evaluation keinen klaren Vorteil für V4.1 Flash zeigt.Ist Vision Exp günstiger als Flash?
Das folgt nicht aus dem Namen. Vergleichen Sie Live-Preismodule und Kosten pro erfolgreichem Task einschließlich Bild-Input, Output, Retries, Vorverarbeitung und Review.
Wie viele Tokens nutzt ein Bild?
Welches Modell ist produktionsstabiler?
Auf EvoLink ist Flash die etablierte Text-Route. Requests an die Vision-Exp-ID laufen jetzt auf V4.1 Flash – wiederholen Sie daher Ihre visuelle Evaluation und rollen Sie Bild-Traffic mit Feature Flag, Canary und verifiziertem Fallback aus.
PDF an Vision Exp oder Flash?
deepseek-v4.1-flash) ist sinnvoll, wenn Tabellen, räumliches Layout, Handschrift, Stempel oder andere visuelle Belege die Antwort ändern.Wie sollte der Fallback aussehen?
deepseek-v4-flash-vision-exp auf EvoLink jetzt an V4.1 Flash weiterleitet, ist ein Wechsel zwischen diesen beiden IDs kein Fallback.

