GPT Image 2.5 Flare & Sunburst sind jetzt auf EvoLink verfügbarGPT Image 2.5 testen
DeepSeek V4 Flash Vision Exp vs. Flash: Bild oder Text?
Comparison

DeepSeek V4 Flash Vision Exp vs. Flash: Bild oder Text?

Jessie
Jessie
COO
21. August 2026
Aktualisiert am 10. September 2026
10 Min. Lesezeit
Lifecycle-Update – 10. September 2026: DeepSeek hat V4.1 Flash veröffentlicht. In der DeepSeek-Direkt-API werden deepseek-v4-flash und deepseek-v4-flash-vision-exp jetzt an V4.1 Flash weitergeleitet; deepseek-v4-pro folgt planmäßig am 14. September 2026 um 12:00 Uhr Pekinger Zeit (04:00 UTC). Auf EvoLink sind deepseek-v4-flash und deepseek-v4-pro nicht betroffen und liefern weiterhin DeepSeek V4 Flash und V4 Pro; deepseek-v4-flash-vision-exp leitet jetzt an DeepSeek V4.1 Flash weiter. Siehe das offizielle Update, die Modellseite von V4.1 Flash und den Migrationsleitfaden.
Aktualisiert am 10. September 2026: Senden Sie Bildbelege auf EvoLink an DeepSeek V4.1 Flash und lassen Sie reine Text-Prompts auf DeepSeek V4 Flash. Requests an deepseek-v4-flash-vision-exp werden jetzt an V4.1 Flash weitergeleitet; die Vision-Exp-Ergebnisse unten beschreiben daher das Modell vom 21. August – führen Sie das Bild-Evaluationsset mit dem Nachfolger erneut aus. Das Routing-Prinzip bleibt: Bild-Input ist kein Grund, jeden Flash-Request zu migrieren. In EvoLink sollte zuerst die Modalität erkannt, jede Route mit eigenen Erfolgskriterien bewertet und hinter der Bildroute ein verifiziertes Fallback gehalten werden.
Seit dem 21. August 2026 dokumentiert EvoLink deepseek-v4-flash-vision-exp mit Bildverständnis für Chat Completions, Messages und Responses. Das Modell erschien als experimentelles Modell, und auf EvoLink leitet die ID inzwischen an V4.1 Flash weiter; vor dem Produktions-Rollout sollten Bildformat, Usage, Abrechnung und Fallback daher weiterhin mit repräsentativen Requests geprüft werden.
Vision-Exp-Modellseite ansehen

Kurzurteil: Nach Modalität routen, nicht nach Neuheit

Workload-BedingungStartmodellGrund
Antwort braucht Screenshot, Scan, Diagramm, Foto oder gerenderte UIVision ExpDer Task benötigt visuelle Belege, die Text-Flash nicht prüfen kann
Aufgabe liegt vollständig als Text, Code, JSON oder Tool-Output vorFlashDie Vision-Route liefert kein zusätzliches Signal
Dokument hat zuverlässigen extrahierten Text und Layout ist unwichtigFlashNormalisierter Text reicht aus
Tabellen, Position, Handschrift oder visuelle Hierarchie sind wichtigVision ExpOriginalseite bewahrt Layout und Markierungen
Visueller Agent beobachtet wechselnde UI-ScreenshotsVision Exp + FallbackVisuelles Grounding ist nötig, die Bildroute muss kontrolliert ausgerollt werden
Hochvolumige Textklassifikation, Zusammenfassung oder CodingFlashEtablierte Text-Route bleibt operativer Standard
Die Modelle bilden keine einfache Qualitätsstufe. Vision Exp ist die bildspezifische Route, Flash die Text-Route. Wenn ein Request zwar einen Anhang enthält, aber niemand das Bild auswerten muss, entfernen Sie den Anhang statt unnötig Vision zu verwenden.

Was unterscheidet die Modelle tatsächlich?

FaktorDeepSeek V4 Flash Vision ExpDeepSeek V4 Flash
Modell-IDdeepseek-v4-flash-vision-expdeepseek-v4-flash
StatusAm 21. August als experimentelles Bildmodell erschienen; auf EvoLink leitet die ID jetzt an V4.1 Flash weiterAllgemein verfügbare Text-Route auf EvoLink, von der Änderung vom 10. September nicht betroffen
InputText und BilderNur Text
OutputTextText
Gute Start-WorkloadsScreenshot-Prüfung, Dokumentextraktion, Diagrammanalyse, visuelle AgentsCoding, Klassifikation, Zusammenfassung, Text-Agents, strukturierte Transformation
EvaluationsfokusVisuelle Genauigkeit, Grounding, kleine Schrift, LayoutTask-Genauigkeit, Latenz, Output-Tokens, Tools, Textstabilität
ProduktionsregelFeature Flag, Protokollprüfung, Canary, FallbackStandard-Text-Route mit Regression-Monitoring
EvoLink dokumentiert Bilder auf allen drei Routen: Chat Completions nutzt image_url, Messages einen image-Block mit Base64- oder URL-Quelle und Responses input_image. Der Leitfaden für Bild-Inputs ordnet die Payload dem Protokoll zu; Files-API-Verhalten braucht weiterhin eine eigene dokumentierte Route.
Status, Workloads und Live-Preise der Text-Route stehen auf der DeepSeek-V4-Flash-Produktseite. Der gemeinsame Name „Flash“ ist kein Beleg dafür, dass die Text-Route Bilder versteht.
Ein einheitliches API-Gateway trennt Screenshot-, Dokument- und Diagramm-Inputs von Code- und Text-Traffic
Ein einheitliches API-Gateway trennt Screenshot-, Dokument- und Diagramm-Inputs von Code- und Text-Traffic

Durchsetzbarer Routing-Entscheidungsbaum

Die sicherste Regel ist zuerst deterministisch:

  1. Hängt das Ergebnis von visuellen Belegen ab? Falls nein, normalisierten Text an deepseek-v4-flash senden.
  2. Ist das Originalbild nötig? Enthält OCR oder strukturierte Extraktion alles, bleibt die Text-Route.
  3. Akzeptiert das gewählte EvoLink-Protokoll das Format? Falls nein, stoppen oder zu einem verifizierten Vision-Fallback wechseln; Bilder nie still verwerfen.
  4. Ist Vision für Tenant und Workload erlaubt? Bildroute per Feature Flag, Allowlist oder Router-Regel isolieren.
  5. Besteht das Ergebnis die visuelle Abnahme? Andernfalls begrenzt erneut versuchen oder failovern, flüssigen Text nicht automatisch glauben.
if requires_visual_evidence and vision_route_verified:
    route = "deepseek-v4-flash-vision-exp"
else:
    route = "deepseek-v4-flash"

Speichern Sie auch den Routing-Grund. So bleiben Nutzung, Fehler und spätere Modellmigrationen im einheitlichen Gateway nachvollziehbar.

Workload-Routing-Matrix

WorkloadRouteAbnahmeFallback
Screenshot-Bug-TriageVision ExpSichtbarer Zustand und relevante Region korrektAnderes Vision-Modell oder Mensch
Rechnung/FormularVision Exp, wenn Layout zähltFeldgenauigkeit, Fehlstellen, SeitennachweisOCR + Flash über extrahierten Text
DiagramminterpretationVision ExpAchsen, Legende, Einheiten und Trend korrektStrukturierte Daten + Flash
UI-Agent-BeobachtungVision ExpElement-Grounding und AktionsbedingungenAccessibility Tree, Tool-State oder Vision-Fallback
Repository-Analyse aus QuelldateienFlashTests, Dateiverweise und Task-AbschlussPro oder anderes Textmodell je Fehlerkosten
Textklassifikation/ZusammenfassungFlashMarkiertes Validierungsset und Output-SchemaRetry oder alternatives Textmodell
PDF mit sauberem extrahiertem TextFlashVollständigkeit gegen StichprobenseitenVision nur bei Layoutverlust
Gemischte Text-/Screenshot-BatchesTraffic trennenErfolgsrate und Kosten pro RouteFehlgeschlagene visuelle Tasks separat einreihen

Die Trennung bindet visuelle Verarbeitung an echten Bedarf und verhindert, dass die Bildroute zum Single Point of Failure für Text-Traffic wird.

Kosten pro erfolgreichen Task statt Tokenpreis vergleichen

Für das Vision-Exp-Modell vom 21. August gab DeepSeek bis zu 384 Input-Tokens pro Bild an. Der aktuelle Vision-Leitfaden von DeepSeek nennt für die Direkt-API eine Obergrenze von 1024 Tokens pro Bild, und Requests an diese ID laufen jetzt auf V4.1 Flash – planen Sie daher mit der aktuellen Regel. Beide Zahlen helfen beim Bildanteil, sind aber weder der Endpreis eines erfolgreichen visuellen Tasks noch die Abrechnungsgrundlage von EvoLink.
Kosten pro erfolgreichem Task = Input + Output + Retries + Vorverarbeitung + Review + Ausfallwirkung

Für Vision Exp sollten Bildanzahl, Bild- und Text-Tokens, Output, Retries und menschliche Korrekturen erfasst werden. Für Flash zählen Input/Output, Cache-Verhalten und Eskalationsrate. Vergleichen Sie dieselbe Geschäftseinheit, etwa ein korrekt verarbeitetes Dokument, nicht nur einen Request.

EvoLink-Preise können sich von Direktpreisen unterscheiden und ändern. Nutzen Sie die Live-Preismodule auf der Vision-Exp-Seite und der Flash-Seite; dieser Artikel dupliziert keine Preistabelle.

Beide Routen mit passenden Belegen bewerten

Testen Sie nicht nur Text und schließen daraus, Vision sei nutzlos. Testen Sie auch nicht nur Screenshots und schließen daraus, Vision solle Flash überall ersetzen.

Testset für Vision Exp

  • Transkriptions- und Feldgenauigkeit bei Scans und Dokumenten
  • Achsen, Legenden, Einheiten und Werte in Diagrammen
  • kleine Schrift und dichte UI
  • Positions- oder Element-Grounding für visuelle Agents
  • keine erfundenen Inhalte bei unlesbaren Stellen
  • Latenz, Retry-Rate und Korrekturen

Testset für Flash

  • Antwort- oder Transformationsgenauigkeit
  • Schema-Gültigkeit und Tool-Verhalten
  • Time to First Token und Gesamtlatenz
  • Input-, Reasoning- und Output-Tokens
  • Retry- oder Eskalationsrate

Zum Release im August sagte DeepSeek, dass das experimentelle Vision-Modell bei reinen Textaufgaben Flash entspreche. Das ist eine Anbieterangabe, keine Migrationsentscheidung. Ändern Sie die Text-Route nur, wenn ein gleichartiger Test einen klaren Produktvorteil zeigt.

1. Routen-Gate erfüllen

  • EvoLink-Dokumentation listet deepseek-v4-flash-vision-exp
  • Protokoll und Bildfeld sind dokumentiert
  • echter Account-Request liefert gültige Antwort und Usage
  • Abrechnung stimmt mit der aktuellen Preisoberfläche überein
  • nicht unterstützte oder zu große Inputs scheitern vorhersehbar

2. Feature Flag einsetzen

Ersetzen Sie deepseek-v4-flash nicht global. Wählen Sie Vision nur bei echtem visuellem Bedarf und erlaubtem Tenant.

3. Mit Canary-Traffic beginnen

Starten Sie intern oder mit risikoarmen Bildaufgaben. Protokollieren Sie Input, Routing-Grund, Latenz, Usage, Abnahme, Fallback und Korrektur.

4. Pro Workload erweitern

Skalieren Sie Screenshot-Prüfung, Diagrammanalyse und ausgewählte Dokumenttypen getrennt. Erfolg in einem Use Case validiert nicht alle visuellen Aufgaben.

5. Textstandard beibehalten

Bis Vision Exp einen Übernahmevorteil belegt, verarbeitet Flash weiterhin Text-Traffic. Das begrenzt Ausfälle und verbessert Kostenzuordnung.

Häufige Routing-Fehler

FehlerProblemBessere Regel
Bildmodell ersetzt Flash global, weil es neuer istText-Traffic hängt von einem Bildmodell abNach Input-Beleg und Workload routen
Jedes PDF als Bilder sendenVisuelle Verarbeitung trotz sauberem TextErst Text extrahieren, Bilder nur bei wichtigem Layout
Upstream-Support mit EvoLink gleichsetzenModell- und Protokollrouten können abweichenExakte EvoLink-Doku und echten Request prüfen
Nur Listenpreise vergleichenRetries, Output, Review und Ausfälle fehlenKosten pro abgeschlossenem Task messen
Flüssige Bildbeschreibung glaubenDiagramm oder Kleinschrift kann falsch gelesen seinWorkload-spezifische Abnahme einführen
Nicht unterstützte Bilder still verwerfenAntwort wirkt plausibel, nutzt aber den Beleg nichtGeschlossen fehlschlagen oder Vision-Fallback nutzen
-exp entfernenAuf EvoLink ruft das die reine Text-ID deepseek-v4-flash aufFür neue Bildaufgaben deepseek-v4.1-flash senden; die alte ID, falls beibehalten, exakt senden

Empfohlene Fallback-Policy

  • Screenshots und Diagramme zu einer anderen verifizierten Vision-Route, nicht ohne Bild an Flash.
  • Dokumente können über nachvollziehbares OCR zu Flash gehen, wenn Layoutverlust akzeptabel ist.
  • Bei unsicherem Grounding oder Route destruktive Agent-Aktionen pausieren.
  • Timeouts, Retries und Gesamtbudget begrenzen. Ein neues Modell rechtfertigt keine unbegrenzten Retries.
  • Fallback-Nutzung getrennt messen, damit Gesamterfolg keine schwache Vision-Route verdeckt.

Das einheitliche EvoLink-Gateway dient dabei als kontrollierte Auswahlfläche: Text-, Vision- und Fallback-Routen bleiben explizit, während Nutzung und Kosten vergleichbar sind.

FAQ

Sind Vision Exp und Flash dasselbe Modell?

Auf EvoLink nicht. deepseek-v4-flash liefert weiterhin das reine Textmodell V4 Flash, während deepseek-v4-flash-vision-exp jetzt an DeepSeek V4.1 Flash weiterleitet. In der DeepSeek-Direkt-API werden beide alten Namen inzwischen an V4.1 Flash weitergeleitet.

Welche Modell-ID unterstützt Bilder?

Auf EvoLink verwenden Sie für neue Bild-Workloads deepseek-v4.1-flash. Bestehende Requests an deepseek-v4-flash-vision-exp funktionieren weiterhin, werden aber an V4.1 Flash weitergeleitet.

Kann DeepSeek V4 Flash Screenshots lesen?

Nein. Auf EvoLink ist deepseek-v4-flash weiterhin die reine Text-Route von V4 Flash. Für pixelabhängige Aufgaben nutzen Sie deepseek-v4.1-flash oder ein anderes verifiziertes Vision-Modell.

Kann Vision Exp reinen Text verarbeiten?

Requests an diese ID laufen jetzt auf V4.1 Flash. Lassen Sie reinen Text-Traffic auf EvoLink bei deepseek-v4-flash, sofern Ihre eigene Evaluation keinen klaren Vorteil für V4.1 Flash zeigt.

Ist Vision Exp günstiger als Flash?

Das folgt nicht aus dem Namen. Vergleichen Sie Live-Preismodule und Kosten pro erfolgreichem Task einschließlich Bild-Input, Output, Retries, Vorverarbeitung und Review.

Wie viele Tokens nutzt ein Bild?

Für das ursprüngliche Vision-Exp-Modell nannte DeepSeek bis zu 384 Input-Tokens je Bild. Der aktuelle Vision-Leitfaden setzt für die Direkt-API eine Obergrenze von 1024 Tokens pro Bild. Requests an diese ID laufen jetzt auf V4.1 Flash; für Produktionskosten messen Sie die Usage, die Ihre EvoLink-Requests zurückgeben.

Welches Modell ist produktionsstabiler?

Auf EvoLink ist Flash die etablierte Text-Route. Requests an die Vision-Exp-ID laufen jetzt auf V4.1 Flash – wiederholen Sie daher Ihre visuelle Evaluation und rollen Sie Bild-Traffic mit Feature Flag, Canary und verifiziertem Fallback aus.

PDF an Vision Exp oder Flash?

Flash reicht bei vollständigem extrahiertem Text. Ein Bildmodell (auf EvoLink deepseek-v4.1-flash) ist sinnvoll, wenn Tabellen, räumliches Layout, Handschrift, Stempel oder andere visuelle Belege die Antwort ändern.

Wie sollte der Fallback aussehen?

Der Fallback muss den nötigen Beleg erhalten: ein anderes verifiziertes Vision-Modell für Bildtasks oder eine nachvollziehbare OCR-plus-Flash-Pipeline, wenn extrahierter Text genügt. Weil deepseek-v4-flash-vision-exp auf EvoLink jetzt an V4.1 Flash weiterleitet, ist ein Wechsel zwischen diesen beiden IDs kein Fallback.

Quellen

Bereit, Ihre KI-Kosten um 89 % zu senken?

Starten Sie noch heute mit EvoLink und erleben Sie die Vorteile intelligenter API-Routing.