Seedance 2.5がEvoLinkで利用可能にSeedance 2.5を試す

DeepSeek V4 Flash API

DeepSeek-テキスト生成-入力 100 万トークンあたり $0.148 から-利用可能
100 万コンテキスト38.4 万最大出力思考モードChat + Messages + Responses
API ドキュメント
Production routeLive
提供元
DeepSeek
モデル
DeepSeek V4 Flash
コンテキスト長
1,000,000 トークン
プロトコル
Chat + Messages + Responses

DeepSeek V4 Flash を選択

コーディング、推論、長文コンテキスト分析の評価用ルートです。Chat Completions、Messages、Responses の 3 つのプロトコルで利用できます。

DeepSeek V4 Flash

DeepSeek の推論・ツール利用モデル

選択中
入力 100 万トークンあたり $0.148 からdeepseek-v4-flash
主な用途

大規模なコーディング、推論、長文ドキュメント分析、キャッシュ入力料金を活かす低コストなエージェント処理。

入力
$0.148 / 1M
10 cr / 1M
キャッシュ入力
$0.0030 / 1M
0.2 cr / 1M
出力
$0.295 / 1M
20 cr / 1M

DeepSeek V4 Flash 料金

Estimate uncached input, cached input, and output tokens together. Live prices for your user group override the contract-backed fallback rates.

DeepSeek V4 Flash

Request calculator

Enter uncached input, cached input, and output tokens.

Estimated request cost

DeepSeek V4 Flash
USD$0.0003
Credits0.0161
Uncached input tokens0.01 cr
Cached input tokens0.0001 cr
Output tokens0.006 cr

Budget guide

Approximate requests using the current mix.
Add credits
$10
About 42236 requests

For quick testing

$50
About 211180 requests

For regular development

$100
About 422360 requests

For production evaluation

Token rates

ModelPrompt tokensUncached input tokensCached input tokensOutput tokens
DeepSeek V4 Flashdeepseek-v4-flash1M
$0.148 / 1M
10 cr / 1M
$0.0030 / 1M
0.2 cr / 1M
$0.295 / 1M
20 cr / 1M

USD and credits are shown per 1M tokens. Live prices for your user group override the fallback rates. Minimum total charge: 0.01 credits.

DeepSeek V4 Flash API とは?

DeepSeek V4 Flash は DeepSeek の高速な汎用モデルで、284B パラメータの MoE(Mixture-of-Experts)アーキテクチャ(トークンあたり 13B を活性化)と、生成を高速化する内蔵の DSpark 投機的デコーディングモジュールを備え、100 万トークンのコンテキスト、38.4 万トークンの最大出力、任意の思考モードに対応します。EvoLink では /v1/chat/completions(OpenAI 形式)と /v1/messages(Anthropic 形式)の両方で、モデル ID deepseek-v4-flash として利用できます。価格の境界、対応ワークフロー、モデル設定は下部の Pricing と API を参照してください。

DeepSeek V4 Flash
EvoLink モデル IDdeepseek-v4-flash

Chat Completions、Messages、Responses のリクエストでは、ここに表示される正確なモデル ID を使用します。

モデル仕様

コンテキスト長1,000,000 トークン
API プロトコルChat Completions · Messages · Responses
思考モードリクエストごとに任意
最大出力384,000 トークン
トークン課金入力 · キャッシュ入力 · 出力
提供元DeepSeek
タスクとワークフロー

DeepSeek V4 Flash API はどのようなタスクに適していますか?

DeepSeek V4 Flash は、100 万 Token のコンテキスト、調整可能な推論、ツール呼び出しを備えたテキスト専用モデルです。画像入力には対応していません。根拠を保持し、外部システムを呼び出し、検証できる結果を返す必要がある処理で特に有用です。

リポジトリ単位のコーディングとコードレビュー

関連ソース、Issue、テスト結果、過去の変更を一つのタスクにまとめ、複数ファイルにまたがる原因調査、実装計画、レビューに利用できます。本番導入前には固定したリポジトリ課題で、テスト成功率、未完了の手順、構造化結果、人による修正量を確認してください。

長文書と複数ソースの分析

100万 Token のコンテキストには、レポート、契約書、ナレッジベース、会話履歴、検索結果をまとめて含められます。ただし、情報量を増やすだけで回答が改善するとは限りません。重要な根拠が保持されるかを確認し、Pricing の実際の料金とキャッシュ入力の仕組みから有効な結果あたりのコストを計算してください。

高並列の Agent とバッチワークフロー

0731 正式版で agentic 性能とツール呼び出しが改善され、Flash の高いアカウント単位の同時実行上限は並列バッチパイプラインに適しています。function calling で自前の検索・実行ツールを接続し、実際のワークロードで多段階タスクの完了率を検証してから拡大してください。

構造化出力と Agent オーケストレーション

テキスト入力を JSON Schema、function calling、多段階 Agent に接続し、抽出、レビュー、後続処理を自動化できます。本番前に Schema の有効率、関数引数、ストリーミングの終了、ツール失敗後の安全な復旧を確認してください。

API 接続の選択

DeepSeek V4 Flash を利用するプラットフォームによって何が変わりますか?

同じモデルでも、コンテキスト設定、ツール対応、使用量表示、課金方法はプラットフォームごとに異なる場合があります。EvoLink はモデル設定と使用量を一つの API にまとめ、後からのモデル変更を簡単にします。

正しい API モデル ID を使う

deepseek-v4-flash はページ URL と検索で使われる表記で、API リクエストのモデル ID は deepseek-v4-flash です。既存の Chat Completions または Responses アプリではモデル設定を変更します。正確なフィールドは API セクションで確認できます。

現在の API ルート設定を基準にする

DeepSeek は100万 Token のモデルウィンドウを公開していますが、プラットフォームによってコンテキスト設定、ツール、レート制限が異なる場合があります。EvoLink では現在のルートに表示されるモデル設定、利用可能な機能、実際の usage を基準にしてください。

ワークフローで Chat と Responses を選ぶ

通常のチャット、ストリーミング、クライアント関数は Chat Completions から始めます。長い多段階 Agent ワークフローが必要な場合は、0731 版で追加された Responses プロトコルを評価します。Responses で文書化されているサーバーツールは function calling、web search、apply_patch で、code interpreter はこのルートでは無視されます。使い慣れた OpenAI 形式を保ちつつ、不要な複雑さを避けられます。

統一ゲートウェイでモデル選択を残す

EvoLink の一つのアカウント、残高、API 形式で Grok、GPT、Claude、Kimi を利用できます。モデルを設定層に置けば、品質、コスト、可用性に応じてルートを変更でき、プロバイダーごとの再実装を減らせます。

コスト管理

DeepSeek V4 Flash API のコストをより正確に管理するには?

現在の Token 料金(入力、キャッシュヒット、出力)は Pricing に表示されます。実運用では、キャッシュ、コンテキスト管理、推論設定、モデルルーティングによって不要な消費を抑え、完了した業務単位で費用を把握できます。

反復するコンテキストをキャッシュしやすくする

固定したシステムプロンプト、ツール Schema、共通コンテキストは再利用しやすくなります。選択したプロトコルが対応するキャッシュまたは会話 ID を設定し、usage の cached tokens で効果を確認してください。

タスクに必要なコンテキストだけ送る

100万 Token は大規模リポジトリや長文書に役立ちますが、毎回使い切る必要はありません。関連するファイル、メッセージ、検索結果だけを選ぶと、入力コストを抑え、重要な根拠に集中しやすくなります。

タスクごとに推論、出力、ツールを調整する

簡単な処理は低い reasoning effort と短い出力から始め、難しい分析で推論予算を増やします。調査や Agent ではツール呼び出し回数も監視し、検索や実行の重複、無効なループを避けてください。

完了タスクの総コストでモデルを比較する

Token、キャッシュ入力、サーバーツール、必要な再試行を一つの完了タスクとして評価します。EvoLink でモデルと使用量をまとめて確認すれば、DeepSeek V4 Flash と他ルートが同じ作業を完了する総費用を比較できます。

本番利用の確認事項

DeepSeek V4 Flash を本番環境で使う前に何を確認すべきですか?

少数の実ワークロードから始め、品質、遅延、コスト、信頼性を確認してから、移行するトラフィックを増やします。

接続と使用量データが明確

正しい deepseek-v4-flash モデル ID と対象プロトコルを使用し、必要な応答、usage、キャッシュ情報が返ることを確認します。明確な使用量データはコスト分析に役立ち、Chat と Responses を同じ基準で観測できます。

出力が実際の業務要件を満たす

実際のコード変更、長文書分析、調査、構造化抽出で確認します。回答品質だけでなく、テストの成功、引用の信頼性、関数引数の正確さ、後続システムが JSON Schema を直接処理できるかを見ます。

遅延とエラー処理が要件に合う

代表的な負荷で応答時間を観測し、レート制限、タイムアウト、不正な構造化出力、ツール失敗に対する再試行を準備します。EvoLink でモデル選択を設定可能にすると、ルートが一時的に使えない場合に検証済みの代替へ切り替えやすくなります。

コストとモデル選択を管理できる

Pricing、usage、最終請求から同種タスクの総コストを計算し、DeepSeek V4 Flash を標準、高難度タスク、またはフォールバックのどこに置くか決めます。統一ゲートウェイにより、この判断を接続実装から分離できます。

まず DeepSeek V4 Flash を少数の観測可能で戻せるタスクに適用し、品質、遅延、コストが期待を満たしてから拡大してください。EvoLink の統一 API で複数モデルを選べる状態にすると、拡張、切り替え、コスト最適化が容易になります。

プロトコルとルートの選択

Chat Completions、Responses、本番トラフィックをどう選びますか?

二つのプロトコルは異なるワークフロー向けです。これは選択の要約です。正確なフィールドは API と EvoLink ドキュメント、Token 料金は既存の Pricing を参照してください。予算を見積もる際は、ツール呼び出しの回数をタスク全体のコストに含めてください。

01

通常チャットとクライアント関数:Chat Completions

OpenAI 互換チャット、ストリーミング、クライアント側 function calling を既に使っている場合は Chat Completions から始めます。メッセージ形式、ストリーム終了、関数引数、usage が現在のクライアントの期待と一致するか確認します。

チャットとクライアント関数
02

Agent ワークフロー:Responses

長い多段階 Agent フローや Codex 型の統合には、0731 版で追加された Responses API を評価してください。接続前に、対応するリクエストフィールド、失敗状態、再試行境界を最新の EvoLink ドキュメントで確認します。

Agent ワークフロー
03

大規模コンテキスト:キャッシュと総費用を確認

長文書、リポジトリ、長い会話を常に一回のリクエストへ全投入する必要はありません。代表的な長さ、キャッシュのヒットとミス、出力長、再試行を比較し、最終請求から成功タスクの費用を計算します。

コンテキストコスト
04

本番トラフィック:小さく始めて代替を残す

最初は少数の観測可能なタスクを DeepSeek V4 Flash に送り、実績のある GPT、Claude、Kimi ルートを維持します。EvoLink の統一 API はモデル選択、usage、残高を集約し、制限、タイムアウト、Schema、ツール障害後の切り替えを容易にします。

段階的な拡大

関連モデル

GPT-5.6

GPT-5.6

性能、遅延、コストルーティングの柔軟性を比較できる OpenAI の階層型フロンティアファミリーです。

モデルを見る
Claude Opus 5

Claude Opus 5

長時間実行エージェント、ツール利用、複雑なレビュー向けの Anthropic プレミアムルートです。

モデルを見る
Kimi K3

Kimi K3

キャッシュ入力が別料金の Moonshot 長文コンテキスト推論ルートです。

モデルを見る
DeepSeek V4 Pro

DeepSeek V4 Pro

大規模なコーディング、推論、エージェント向けのコスト重視のオープンモデルルートです。

モデルを見る

DeepSeek V4 Flash の関連ガイドとアップグレード情報

DeepSeek V4 Pro API の使い方

DeepSeek V4 Pro API の使い方

最初の呼び出し、thinking の調整、Flash と Pro のトラフィック振り分け戦略を解説します。

ガイドを読む
DeepSeek V4 0813 公開:何が変わったか

DeepSeek V4 0813 公開:何が変わったか

正式版の agent と Codex の変更点を上流ドキュメントで検証しました。

ガイドを読む
DeepSeek V4 API レビュー:Flash と Pro

DeepSeek V4 API レビュー:Flash と Pro

費用、思考モード、本番導入チェックリストを比較します。

ガイドを読む
DeepSeek V4 vs GPT-5.4 vs Claude Opus 4.6

DeepSeek V4 vs GPT-5.4 vs Claude Opus 4.6

三つのフロンティアルートの公式価格と機能を比較します。

ガイドを読む

DeepSeek V4 Flash API のよくある質問

DeepSeek V4 Flash API は現在 EvoLink で利用できますか?

はい。DeepSeek V4 Flash は EvoLink の本番ルートで利用できます。モデル ID deepseek-v4-flash を指定して Chat Completions または Responses から呼び出せます。モデル ID、料金、コンテキスト、対応ワークフローは本ページで確認してください。

deepseek-v4-flash は API のモデル ID ですか?

はい。リクエストで指定するモデル ID は deepseek-v4-flash で、本ページの URL と同じ文字列です。現在の正式版は 0731 ビルド(2026 年 7 月 31 日に正式化)で、同じ ID のまま自動的に新版が適用されます。旧エイリアスの deepseek-chat と deepseek-reasoner は 2026 年 7 月 24 日に上流で廃止されました。

コンテキスト長と料金の考え方は?

DeepSeek のコンテキストウィンドウは 1,000,000 Token です。長文コンテキスト専用の料金区分はなく、課金は Pricing に表示される実際の Token 単価とキャッシュ入力の仕組みに従います。毎回全体を使わず、代表的な長さとキャッシュヒットをテストしてください。

DeepSeek V4 Flash はどの入出力に対応しますか?

テキスト入力とテキスト出力のみです。DeepSeek V4 Flash にはどのプロトコルでも視覚能力はありませんが、境界はプロトコルごとに異なります。Messages ルートは画像やドキュメントのコンテンツタイプを拒否し、Responses ルートは画像やファイル添付を理解せずプレースホルダーに変換します。スクリーンショット理解やドキュメント解析は、同じ EvoLink ゲートウェイ上の視覚対応モデルへルーティングしてください。

Chat Completions と Responses API はどう選びますか?

通常チャット、ストリーミング、クライアント関数には Chat Completions、長い多段階 Agent ワークフローには 0731 版で追加された Responses を評価します。正確なフィールドは API と EvoLink ドキュメントを参照してください。

reasoning effort はどのように選びますか?

有効な段階は low、high、max で、既定値は high です。medium は指定できますが暗黙に high へ変換されるため、medium と high の比較には実際の差がありません。通常のタスクは low から始め、同じタスクで low と high を比較し、max は失敗のやり直しが追加の推論 Token より高くつく最難関のタスクに残してください。

キャッシュ入力は DeepSeek V4 Flash API の料金にどう影響しますか?

反復コンテキストの費用を下げられますが、キャッシュミス、長い出力、再試行、ツールの反復は総額を増やします。Pricing と最終請求から成功タスクあたりのコストを計算してください。

DeepSeek V4 Flash のレート制限は?

上流に Token ベースの RPM/TPM 制限はなく、制約はアカウント単位の同時実行上限です。Flash は約 2,500 並列(Pro の約 5 倍)で、超過すると 429 が返り、約 10 分間キューに滞留すると切断されます。この余裕が Flash のスループット面の強みです。実測した上限より少ない同時リクエスト数を保ち、指数バックオフを使えば、高並列のバッチ処理に適しています。

Flash と Pro はどう使い分けますか?

分類、要約、短い編集、高並列のバッチ処理には Flash が適しています。速度と Pro の約 5 倍の同時実行上限が最も活きる領域です。8 ステップを超える長い Agent チェーンや事実の正確さが重要なタスクには Pro を選んでください。両者は同じ EvoLink API を共有しているため、タスク種別での振り分けは設定変更だけで済みます。

DeepSeek V4 Flash を GPT、Claude、Kimi と比較するには?

同じ実タスクを同じコンテキスト、ツール、推論設定で実行します。品質、応答時間、Token 構成、ツール動作、総費用を比較すると、各トラフィックに適した EvoLink ルートを判断できます。

DeepSeek V4 Flash はオープンソースですか?

はい。Flash 0731 の重みは MIT ライセンスで Hugging Face に公開されています。オープンな重みとホスティング API は独立した入手経路であり、EvoLink ルートが提供するのはホスティング API です。同じ MIT の重みがサードパーティのホスティングにも存在することが、フォールバックルーティングを可能にしています。

導入時にどのフォールバックモデルを残すべきですか?

同じワークロードを安定して処理できるモデルを残し、ルートを設定可能にします。制限、タイムアウト、不正な出力が発生した場合、EvoLink から GPT、Claude、Kimi などへ切り替えられます。