Seedance 2.5がEvoLinkで利用可能にSeedance 2.5を試す
DeepSeek V4 Flash Vision Exp APIの画像入力ワークフロー
チュートリアル

DeepSeek V4 Flash Vision Exp APIの使い方:画像入力ガイド

Jacey
Jacey
Founder
2026年8月21日
10 分
DeepSeekは2026年8月21日、テキストと画像を同じリクエストで扱う実験モデルdeepseek-v4-flash-vision-expを公開しました。EvoLinkではChat Completions、Messages、Responsesの3方式が文書化されています。画像フィールドを追加するだけでなく、既存アプリに合う方式を選び、返却Usageを確認し、実験モデル用のFallbackを残すことが重要です。
現在のEvoLink文書では、Chatはimage_url、MessagesはURLまたはBase64をsourceとするimageブロック、Responsesはinput_imageを使います。以下はその形式に合わせています。本番Trafficを増やす前に、本番Accountで代表画像を1件通してください。
Vision Expモデルと現在の料金を見る
RouterがText-only Requestも扱う場合は、Vision Exp vs Flash比較を使い、画像証拠をVision Exp、高処理量のText TrafficをFlashに分けます。

最初の画像リクエスト前に必要な確認

Model IDはdeepseek-v4-flash-vision-expです。3方式のContent Blockは相互に置換できません。
確認合格条件理由
Model ID正確なIDを送るText版Flashは画像証拠を処理しない
Protocol選択Routeに画像入力の記載があるText互換だけではMultimodalを保証しない
Input代表的なURLまたはBase64が成功構文とValidationが異なる
UsageInput/Output Usageを取得合格結果あたりCostの計算に必要
BillingEvoLink Usage/Billingに反映成功Responseだけでは課金を保証しない
Fallback検証済みVision Routeがある-expは変更・停止の可能性がある

Runtime確認に失敗したWorkloadは検証済みVisionモデルに残し、Vision Expを評価候補として扱います。

画像入力ワークフロー

1枚以上の画像と具体的な指示を送り、Protocolを選択し、構造化結果とUsageを検証してからTrafficを増やします。未レビューの1回答だけでBrowserやAgentに不可逆操作をさせないでください。

画像、文書、グラフをマルチモーダルAPI経由で3種類の構造化レスポンスへRoutingする流れ
画像、文書、グラフをマルチモーダルAPI経由で3種類の構造化レスポンスへRoutingする流れ

きれいなScreenshot、密なUI、Scan文書、小さいLabelのChart、意図的に曖昧な画像を含む小さな評価Setを作り、期待Fieldや判断を先に定義します。

Protocol別の画像形式

Chat Completions:image_url

{
  "model": "deepseek-v4-flash-vision-exp",
  "messages": [{
    "role": "user",
    "content": [
      { "type": "text", "text": "Return the visible error message and the UI state as JSON." },
      { "type": "image_url", "image_url": { "url": "https://example.com/screenshot.png" } }
    ]
  }]
}
EvoLink Chat文書はURL、Base64、複数画像を記載しています。画像はuser Message内に置き、Vision Expの正確なIDを使います。

Messages:imageブロック

{
  "model": "deepseek-v4-flash-vision-exp",
  "max_tokens": 1024,
  "messages": [{
    "role": "user",
    "content": [
      { "type": "image", "source": { "type": "url", "url": "https://example.com/invoice.png" } },
      { "type": "text", "text": "Extract invoice number, date, currency, subtotal, tax, and total." }
    ]
  }]
}
MessagesではTop Levelのmax_tokensが必要で、source.typebase64またはurlです。Text版Flash/Proは実画像を処理せず置換する場合があるため、画像理解には必ずVision Expを指定します。

Responses:input_image

{
  "model": "deepseek-v4-flash-vision-exp",
  "input": [{
    "role": "user",
    "content": [
      { "type": "input_text", "text": "Summarize the chart, then list every directly observed label." },
      { "type": "input_image", "image_url": "https://example.com/chart.png" }
    ]
  }]
}
Responses文書はinput_imageと複数画像を記載しています。Streaming Event、Tool、ErrorはRouteごとに確認し、画像対応からFiles API全機能を推測しないでください。

URL・Base64・Files APIの選び方

方法向くケース本番確認
Public URLPublic Assetや短期Signed URLGatewayから取得可能、機密を含まない
Base64 Data URI小さいPrivate画像Request Limit内、Logに機密Payloadを残さない
Files API再利用・管理するFileEvoLinkがSupport、寿命、権限を明記

大きい画像は取得可能なSigned URL、小さいPrivate画像はBase64が適します。EvoLink文書がないFiles API対応は主張しません。DeepSeek UpstreamはJPEG、PNG、GIF、WebPを記載していますが、GatewayのSize、URL、Timeout、枚数Limitは別途確認します。

画像Costの見積もり

DeepSeekによると1画像は最大384 Input Tokenです。
完了Task Cost = 画像Input + Text Input + Output + Retry + Agent/Tool追加Turn
2画像なら画像部分を最大768 TokenとしてPromptとOutputを加え、実際のEvoLink Usageと比較します。Text Prefix Cacheが画像にも同じように効くとは仮定しません。現在のRateはVision Exp製品ページを参照し、本記事では料金表を重複させません。

自動化前の受入基準

Workload指標Escalation
請求書抽出必須Field完全一致欠落やChecksum不一致は人手確認
Screenshot QA状態とError Textが正しいCrop再試行後にReview
Chart分析Labelと解釈を分離根拠のない数値をReject
UI Agent危険な副作用のない正しいAction不可逆操作は確認必須

HTTP成功率ではなく合格結果率を測定します。Retryや人手修正が多い安価なRouteは、強いFallbackより高くなる場合があります。

よくある画像Request Error

症状原因対応
ModelがEnumにないID誤り、古いCache、Account権限IDとAccessを確認、Text Flashへ置換しない
Image非対応Text Model/Protocolを選択文書化されたVision Routeへ
400 invalid content block別Protocolの形式image_urlimageinput_imageを正しく対応
Image取得失敗Private、期限切れ、Redirect、Block取得可能なSigned URLかBase64
Request過大Base64/複数画像がLimit超過Resize、圧縮、分割、文書化されたFile Route
429/Timeout同時実行数や容量上限付きRetry、並列削減、Failover

RPM、TPM、File Size、Concurrencyを推測せず、Route文書と本番Accountで確認します。

本番Rollout

  1. 選択ProtocolでURL/Base64を1件成功させる。
  2. Response、Usage、Billing、Error Logを確認。
  3. 固定評価SetでVision ExpとFallbackを比較。
  4. 少量Trafficで合格結果Costを測定。
  5. 品質、Latency、Error、CostがThresholdを満たしてから拡大。

Model IDはConfigで管理します。EvoLinkの統合Gatewayなら、実験モデル専用にIntegrationを書き直さず、Route・Usage・Billingを比較できます。

FAQ

正確なModel IDは?

deepseek-v4-flash-vision-expです。実験版を示す-expを省略しません。

EvoLinkで利用できますか?

はい。2026年8月21日時点でChat Completions、Messages、Responsesの画像理解が文書化されています。

deepseek-v4-flashへ画像を送れますか?

画像証拠は処理されない可能性があります。画像依存TaskではVision Expか検証済みVisionモデルを使います。

URLとBase64のどちら?

大きく取得可能なAssetはSigned URL、小さいPrivate画像はLimit内でBase64を使います。

Files APIは使えますか?

Upstreamの記載だけではEvoLink各Routeの対応を証明できません。EvoLink文書で明示された場合のみ使います。

1画像のCostは?

DeepSeekは最大384 Input Tokenとしています。Text、Output、Retry、Agent Turnを加え、製品ページのLive Rateを適用します。

対応Formatは?

UpstreamはJPEG、PNG、GIF、WebPです。EvoLink固有のSize、URL、複数画像Limitも確認します。

本番前に何をTestする?

簡単/難しい画像、構造化出力、小文字、欠落Field、Latency、Retry、Usage、Billing、Fallbackです。

参照資料

Model ID、画像Field、Route Limitが変わったら、例とBillingを再検証します。

AIコストを89%削減する準備はできましたか?

今すぐEvoLinkを始めて、インテリジェントなAPIルーティングの力を体験してください。