
DeepSeek V4 Flash Vision Exp vs Flash: 이미지와 텍스트 선택
deepseek-v4-flash-vision-exp를 Chat, Messages, Responses에서 문서화했습니다. Production 확대 전 이미지 구조, Usage, Billing, Fallback을 대표 Request로 확인하세요.결론: 최신 여부가 아니라 입력으로 Routing
| 조건 | 시작 Route | 이유 |
|---|---|---|
| Screenshot, Scan, Chart, Photo, Rendered UI 필요 | Vision Exp | Text Flash가 볼 수 없는 시각 증거 |
| Text, Code, JSON, Tool Output으로 완결 | Flash | Vision이 유효 Signal을 추가하지 않음 |
| 신뢰할 수 있는 추출 Text와 불필요한 Layout | Flash | 정규화 Text로 충분 |
| Table, 위치, 손글씨, 시각 계층 중요 | Vision Exp | 원본 이미지가 Layout 유지 |
| 변화하는 UI를 보는 Agent | Vision + Fallback | Grounding 필요, 실험 Route 단계 도입 |
| 대량 Text 분류, 요약, Coding | Flash | 안정 Text Route 유지 |
실제 차이
| 항목 | Vision Exp | Flash |
|---|---|---|
| ID | deepseek-v4-flash-vision-exp | deepseek-v4-flash |
| 상태 | EvoLink 실험 이미지 이해 모델 | Production Text 모델 |
| 입력 | Text + Image | Text |
| 출력 | Text | Text |
| 시작 Workload | Screenshot, 문서, Chart, Visual Agent | Coding, 분류, 요약, Text Agent, 변환 |
| 평가 | 시각 정확도, Grounding, 작은 글자, Layout | Task 정확도, Latency, Token, Tool, 안정성 |
| 정책 | Feature Flag, Protocol, Canary, Fallback | 기본 Text Route와 Regression 감시 |
image_url, Messages의 Base64/URL image, Responses input_image를 문서화합니다. 이미지 입력 가이드에서 Payload를 맞추고 Files API는 별도 문서로 확인하세요. Flash 상태와 가격은 Flash 제품 페이지를 사용합니다.
적용 가능한 Routing Tree
- 시각 증거가 필요한가? 아니면 정규화 Text를 Flash로.
- 원본 이미지가 필요한가? OCR로 충분하면 Flash로.
- Protocol이 Format을 받는가? 아니면 중단하거나 Vision Fallback으로. 이미지를 조용히 버리지 않기.
- Tenant/Workload가 실험 Route를 허용하는가? Feature Flag/Allowlist로 분리.
- 시각 승인 기준을 통과하는가? 아니면 제한 Retry 또는 Failover.
if requires_visual_evidence and vision_route_verified:
route = "deepseek-v4-flash-vision-exp"
else:
route = "deepseek-v4-flash"선택 이유도 기록해 Usage, 실패, 향후 Migration을 감사할 수 있게 합니다.
Workload Matrix
| Workload | Route | 승인 | Fallback |
|---|---|---|---|
| Screenshot Bug | Vision | 상태와 영역 정확 | 다른 Vision/사람 |
| 송장/Form | Layout 중요 시 Vision | Field 정확도, 누락, Page 추적 | OCR + Flash |
| Chart | Vision | Axis, Legend, Unit, Trend | 구조 Data + Flash |
| UI Agent | Vision | Element Grounding과 Action 조건 | Accessibility Tree/다른 Vision |
| Source Repository | Flash | Test, File 참조, 완료 | Pro/다른 Text |
| Text 분류/요약 | Flash | Labeled Set과 Schema | Retry/다른 Text |
| Text 추출 PDF | Flash | Sample Page 완전성 | Layout 손실 Page만 Vision |
| Text+이미지 Batch | 분리 | Route별 Success/Cost | Visual 실패 별도 Queue |
Token 단가보다 성공 Task Cost
성공 Task Cost = Input + Output + Retry + 전처리 + Review + 실패 영향Route별 평가
Vision Exp
- Scan/문서 전사·Field, Chart Axis/Legend/Unit/Value, 작은 글자와 복잡한 UI, Element Grounding, 읽기 어려운 내용 비조작, Latency/Retry/수정률.
Flash
- Text 정확도, Schema/Tool, First Token/총 Latency, Input/Reasoning/Output Token, Retry/Escalation.
Vision Exp의 Text 능력이 Flash와 같다는 내용은 Vendor Claim이지 Migration 결정이 아닙니다. 동일 조건 평가와 실험 Risk 수용이 필요합니다.
EvoLink Production 도입
- ID, Protocol, 이미지 Field 문서 확인.
- 실제 Account로 Response, Usage, Billing 확인.
- Feature Flag와 저위험 Canary 시작.
- Screenshot, Chart, 문서 Type별 확대.
- 이점이 증명될 때까지 Text Default는 Flash.
흔한 Routing 오류
| 오류 | Risk | 개선 |
|---|---|---|
| 최신이라 Flash 전체 대체 | Text도 실험 의존 | 필요한 증거로 Route |
| 모든 PDF를 이미지로 전송 | Text로 충분해도 Vision 처리 | 먼저 추출, Layout 필요 시 이미지 |
| Upstream과 EvoLink 동일시 | Route 차이 | EvoLink 문서와 실제 Call |
| 표시 가격만 비교 | Retry/Review/실패 제외 | 완료 Task Cost |
| 유창한 설명 신뢰 | Chart/작은 글자 오독 | Workload별 기준 |
| 이미지 조용히 제거 | 증거 없는 그럴듯한 답 | Fail Closed/Fallback |
-exp 제거 | 다른 ID/실패 | 정확한 ID 저장 |
Fallback 정책
Screenshot/Chart는 이미지를 제거해 Flash로 보내지 말고 다른 Vision Route로 보냅니다. Layout 손실이 허용되는 문서는 추적 가능한 OCR + Flash를 사용할 수 있습니다. Grounding이 불확실하면 파괴적 Action을 멈추고 Timeout, Retry, Budget을 제한하며 Fallback 사용률을 별도 측정하세요.
EvoLink 통합 Gateway는 Text, Vision, Fallback Route를 명시적으로 유지하면서 Usage와 Cost를 비교합니다.
FAQ
Vision Exp와 Flash는 같은 모델인가요?
아닙니다. ID가 다르며 Vision Exp는 이미지+Text, Flash는 Text Route입니다.
이미지 지원 ID는?
deepseek-v4-flash-vision-exp입니다. Chat, Messages, Responses에서 -exp를 포함하세요.Flash가 Screenshot을 읽나요?
deepseek-v4-flash는 Text Route입니다. Pixel 의존 Task는 Vision을 사용하세요.Vision Exp를 Text에 쓸 수 있나요?
가능하지만 Migration 근거는 아닙니다. 측정 이점이 없으면 Flash를 유지하세요.
Vision Exp가 더 저렴한가요?
이름으로 판단하지 말고 이미지, Output, Retry, 전처리, Review를 포함해 비교하세요.
이미지 Token은?
Upstream 최대 384 Input Token이며 Production은 실제 EvoLink Usage를 사용합니다.
어느 모델이 안정적인가요?
Flash는 기존 Text Route, Vision Exp는 실험판입니다. Feature Flag, Canary, Fallback이 필요합니다.
PDF는 어디로 보내나요?
추출 Text로 충분하면 Flash, Table·위치·손글씨·도장이 중요하면 Vision입니다.
Fallback은?
이미지 Task는 다른 Vision, Text로 충분하면 추적 가능한 OCR + Flash입니다.


