Seedance 2.5 已上线 EvoLink立即体验

DeepSeek V4 Flash API

DeepSeek-文本生成-$0.148 / 百万输入 Token 起-可用
100 万上下文38.4 万最大输出思考模式Chat + Messages + Responses
API 文档
Production routeLive
提供方
DeepSeek
模型
DeepSeek V4 Flash
上下文窗口
1,000,000 Token
支持协议
Chat + Messages + Responses

选择 DeepSeek V4 Flash

用于评估编程、推理与长上下文分析的路由,同时提供 Chat Completions、Messages 与 Responses 三种协议,用你技术栈已有的那种即可。

DeepSeek V4 Flash

DeepSeek 推理与工具调用模型

已选择
$0.148 / 百万输入 Token 起deepseek-v4-flash
适用场景

大批量编程、推理、长文档分析,以及需要低价路由与缓存输入计费的 Agent 流量。

输入
$0.148 / 1M
10 cr / 1M
缓存输入
$0.0030 / 1M
0.2 cr / 1M
输出
$0.295 / 1M
20 cr / 1M

DeepSeek V4 Flash 价格

估算非缓存输入、缓存输入与输出 Token。登录后优先使用当前用户组实时价格,契约价格仅作兜底。

DeepSeek V4 Flash

请求费用计算器

输入非缓存输入、缓存输入与输出 Token 数量。

单次请求预估

DeepSeek V4 Flash
USD$0.0003
Credits0.0161
非缓存输入 Token0.01 cr
缓存输入 Token0.0001 cr
输出 Token0.006 cr

预算参考

按当前用量组合估算可调用次数。
充值 Credits
$10
约 42236 次请求

快速测试

$50
约 211180 次请求

日常开发

$100
约 422360 次请求

生产评估

Token 价格

模型Prompt Token非缓存输入 Token缓存输入 Token输出 Token
DeepSeek V4 Flashdeepseek-v4-flash1M
$0.148 / 1M
10 cr / 1M
$0.0030 / 1M
0.2 cr / 1M
$0.295 / 1M
20 cr / 1M

美元与 Credits 均按每百万 Token 展示。登录后优先使用当前用户组实时价格,契约价格仅作兜底;单次请求最低计费 0.01 Credits。

DeepSeek V4 Flash API 是什么?

DeepSeek V4 Flash 是 DeepSeek 的快速通用模型:284B 参数 MoE 架构(每 token 激活 13B),内置 DSpark 投机解码模块加速生成,具备 100 万 Token 上下文、38.4 万最大输出,并支持按需开启思考模式。在 EvoLink 上可通过 /v1/chat/completions(OpenAI 风格)与 /v1/messages(Anthropic 风格)两种协议调用,模型 ID 为 deepseek-v4-flash。价格边界、支持的工作流与模型配置见下方 Pricing 与 API 区。

DeepSeek V4 Flash
EvoLink 模型 IDdeepseek-v4-flash

Chat Completions、Messages 与 Responses 请求必须使用这里展示的真实模型 ID。

模型参数

上下文窗口1,000,000 Token
API 协议Chat Completions · Messages · Responses
思考模式可按请求开启
最大输出384,000 Token
Token 计费项输入 · 缓存输入 · 输出
提供方DeepSeek
任务与工作流

DeepSeek V4 Flash API 适合哪些任务?

DeepSeek V4 Flash 的 100 万 Token 上下文、可配置推理和工具调用能力,主要服务于需要持续保留证据、调用外部工具并交付可验证结果的任务。该模型为纯文本模型,不接受图片输入。下面按工作负载说明它可能带来的价值,以及接入前应确认的边界。

仓库级编程与代码审查

把相关源码、Issue、测试结果和历史修改放进同一任务,适合跨文件定位问题、生成修改计划和审查变更。上线前应使用固定仓库任务检查测试通过率、未完成步骤、结构化结果和人工修正量,不能只凭一次演示判断编程能力。

长文档与多来源分析

100 万 Token 上下文可以同时容纳长报告、合同、知识库片段、历史消息和检索结果。更大的上下文不一定带来更好的答案;应检查关键证据是否被保留,并结合 Pricing 区的实时价格与缓存输入机制评估每个可接受结果的成本。

高并发 Agent 与批量工作流

0731 正式版提升了 agentic 与工具调用表现,Flash 档更高的账户级并发上限也适合并行批量流水线。通过函数调用接入你自己的检索与执行工具,并在真实工作负载上验证多步骤任务完成率后再扩量。

结构化输出与 Agent 编排

文本输入可以进入 JSON Schema、函数调用和多步骤 Agent 流程,用于抽取、审查和下游自动化。生产接入前应测试 Schema 有效率、函数参数、流式结束事件,以及工具失败后是否能够安全恢复。

API 接入选择

通过不同平台使用 DeepSeek V4 Flash,有哪些差别?

即使使用同一个模型,不同接入平台提供的上下文配置、工具支持、用量展示和计费方式也可能不同。通过 EvoLink 接入时,可以在统一 API 下查看模型配置与用量,并让后续模型切换保持简单。

使用正确的 API 模型 ID

deepseek-v4-flash 是页面 URL 与常见搜索写法,API 请求使用的模型 ID 是 deepseek-v4-flash。现有 Chat Completions 或 Responses 应用只需在模型配置中使用正确 ID,具体字段可继续查看页面 API 区。

以当前 API 通道的配置为准

DeepSeek 记录的模型窗口为 100 万 Token,但不同平台可能提供不同的上下文配置、工具集合和限流方式。通过 EvoLink 使用时,以当前页面展示的模型配置、可用功能和实际 usage 为准。

按工作流选择 Chat 或 Responses

普通聊天、流式输出和客户端函数可以从 Chat Completions 开始;需要长链路多步骤 Agent 工作流时,再评估 0731 版新增的 Responses 协议——其文档化的服务端工具为 function calling、web search 与 apply_patch,code interpreter 在该路由会被忽略。这样可以沿用熟悉的 OpenAI 风格接入,同时避免加入暂时不需要的复杂度。

在统一网关中保留模型选择空间

通过 EvoLink 使用同一套账号、余额和 API 方式接入 Grok、GPT、Claude 与 Kimi。模型选择保持在配置层后,可以根据任务质量、成本和可用性调整路由,而不必为每个供应商重复改造业务代码。

成本控制

如何更准确地控制 DeepSeek V4 Flash API 成本?

现有 Pricing 区负责展示实时 Token 价格(输入、缓存命中、输出)。实际使用时,还可以通过缓存、上下文管理、推理设置和模型路由减少不必要的消耗,让成本与完成的业务任务对应起来。

让重复上下文更容易使用缓存

稳定的系统提示、工具 Schema 和共享上下文更适合复用缓存。按所选协议配置支持的缓存或会话标识,并从 usage 中查看 cached tokens,可以更准确地判断重复请求是否获得了缓存收益。

只发送当前任务真正需要的上下文

100 万 Token 窗口适合大型代码库和长文档,但并不意味着每次请求都要填满。优先选择与当前任务相关的文件、对话和检索结果,可以减少输入成本,也更容易让模型聚焦关键证据。

按任务调整推理、输出与工具调用

简单任务可以从较低 reasoning effort 和较短输出开始,复杂分析再逐步增加推理预算。研究与 Agent 工作流还应关注工具调用次数,避免重复搜索、重复执行或无效循环带来额外消耗。

按完成任务的总成本比较模型

将 Token、缓存输入、服务端工具和必要重试放到同一个任务中评估。EvoLink 集中展示模型与用量,便于团队比较 DeepSeek V4 Flash 与其他路由完成相同工作所需的总费用。

生产使用建议

将 DeepSeek V4 Flash 用于生产环境前,建议确认什么?

从小规模真实工作负载开始,可以更快确认模型是否符合团队对质量、延迟、成本和稳定性的要求,再决定哪些流量适合逐步迁移。

接入与用量信息清晰

确认应用使用正确的 deepseek-v4-flash 模型 ID 和目标协议,并能正常获得所需的响应、usage 与缓存信息。清晰的用量数据便于后续分析成本,也能让 Chat 与 Responses 工作流保持一致的观测方式。

输出满足实际业务要求

使用代码修改、长文档分析、研究或结构化抽取等真实任务检查结果。除了回答质量,还应关注测试是否通过、引用是否可靠、函数参数是否正确,以及 JSON Schema 能否被下游系统直接使用。

延迟与异常处理符合预期

在常见请求量下观察响应时间,并为限流、超时、无效结构化输出和工具失败准备重试方式。通过 EvoLink 保持模型选择可配置,可以在某条路由暂时不可用时切换到已经验证的替代模型。

成本与模型选择保持可控

结合 Pricing、usage 和最终费用评估同一类任务的总成本,再决定 DeepSeek V4 Flash 适合默认路由、特定高难度任务还是备用模型。统一网关让团队可以按质量与预算调整模型,而不必重新建设接入层。

建议先将 DeepSeek V4 Flash 用于一小部分可观察、可回退的任务,确认质量、延迟和成本符合预期后再逐步扩大。通过 EvoLink 统一 API 保留多模型选择,可以让后续扩量、切换和成本优化更加简单。

协议与路由选择

Chat Completions、Responses 与生产流量怎么选?

两种协议服务于不同工作流。这里给出选型摘要;具体请求字段继续以页面 API 区和 EvoLink 文档为准,价格与工具调用费用继续以现有 Pricing 区为准。

01

普通对话与客户端函数:Chat Completions

已有 OpenAI 兼容聊天、流式响应或客户端 function calling 流程时,优先从 Chat Completions 开始。重点确认消息格式、流式结束、函数参数和 usage 是否与现有客户端预期一致。

对话与客户端函数
02

Agent 工作流:Responses

需要更长的多步骤 Agent 流程或 Codex 风格集成时,再评估 0731 版新增的 Responses 协议。接入前应对照当前 EvoLink 文档确认支持的请求字段、失败状态和重试边界。

Agent 工作流
03

大上下文任务:同时观察缓存与总费用

长文档、代码库和长会话不应默认把全部内容塞进一次请求。比较代表性上下文长度、缓存命中与未命中、输出长度和重试次数,再用最终账单核算成功任务成本。

上下文成本
04

生产流量:从小规模开始并保留回退

先让一小部分可观察的任务使用 DeepSeek V4 Flash,并保留已经稳定运行的 GPT、Claude 或 Kimi 路由。EvoLink 统一 API 可以集中管理模型选择、用量和余额,并在限流、超时、Schema 或工具失败时切换路由。

逐步扩量

相关模型

GPT-5.6

GPT-5.6

需要在同一 OpenAI 模型家族中按能力、延迟和成本分层路由时,可与 DeepSeek V4 Flash 使用相同任务做配对测试。

查看模型
Claude Opus 5

Claude Opus 5

需要长时间 Agent、复杂代码审查和工具可靠性时,可作为 DeepSeek V4 Flash 的高端对照与生产回退。

查看模型
Kimi K3

Kimi K3

长上下文任务高度关注缓存输入价格和总 Token 成本时,可与 DeepSeek V4 Flash 比较成功任务成本。

查看模型
DeepSeek V4 Pro

DeepSeek V4 Pro

大批量编程、推理和 Agent 流量优先考虑成本时,可作为 DeepSeek V4 Flash 的低价对照与回退路由。

查看模型

DeepSeek V4 Flash 相关指南与升级阅读

DeepSeek V4 Pro API 怎么用

DeepSeek V4 Pro API 怎么用

首次调用、thinking 档位控制,以及 Flash 与 Pro 之间的流量分流策略。

阅读指南
DeepSeek V4 0813 已上线:更新了什么

DeepSeek V4 0813 已上线:更新了什么

正式版的 agent 与 Codex 变化,已对照上游文档核验。

阅读指南
DeepSeek V4 API 评测:Flash 与 Pro 怎么选

DeepSeek V4 API 评测:Flash 与 Pro 怎么选

对比两档的成本、思考模式,以及生产上线检查清单。

阅读指南
DeepSeek V4 vs GPT-5.4 vs Claude Opus 4.6

DeepSeek V4 vs GPT-5.4 vs Claude Opus 4.6

三条前沿路由的官方定价与能力对比。

阅读指南

DeepSeek V4 Flash API 常见问题

现在可以通过 EvoLink 使用 DeepSeek V4 Flash API 吗?

可以。DeepSeek V4 Flash 已在 EvoLink 生产路由上线,使用模型 ID deepseek-v4-flash 通过 Chat Completions 或 Responses 直接调用;扩量前建议先在本页确认模型 ID、价格、上下文和支持方式。

deepseek-v4-flash 是 DeepSeek V4 Flash 的 API 模型 ID 吗?

是的。请求中 model 字段填写的就是 deepseek-v4-flash,与本页 URL 一致。当前正式版为 0731 版(2026 年 7 月 31 日转正),同一个 ID 自动指向新版,升级不需要换 ID。旧别名 deepseek-chat 与 deepseek-reasoner 已于 2026 年 7 月 24 日在上游退役。

DeepSeek V4 Flash 的上下文窗口和价格怎么计算?

DeepSeek 记录的上下文窗口是 1,000,000 Token。不存在单独的长上下文价格档;计费以 Pricing 区展示的实时 Token 价格与缓存输入机制为准。建议测试代表性上下文长度和缓存命中情况,而不是默认每次都用满窗口。

DeepSeek V4 Flash 支持哪些输入和输出?

仅支持文本输入和文本输出。DeepSeek V4 Flash 在任何协议下都没有视觉能力,但两条路由的边界不同:Messages 路由会直接拒绝图片和文档内容类型;Responses 路由则把图片和文件附件转成占位符,并不会真正理解。截图理解、文档解析类任务请路由到同一 EvoLink 网关上带视觉能力的模型。

Chat Completions 和 Responses API 应该怎么选?

普通聊天、流式响应和客户端函数优先评估 Chat Completions;长链路多步骤 Agent 工作流优先评估 0731 版新增的 Responses。精确字段以页面 API 区和 EvoLink 文档为准。

DeepSeek V4 Flash 的 reasoning effort 应该怎么选?

合法档位是 low、high 和 max,默认为 high;medium 可以传入,但会被静默映射为 high,因此比较 medium 和 high 不会有真实差异。建议日常任务从 low 起步,在相同任务上比较 low 和 high 的质量、延迟与总费用,max 留给失败重来比额外推理 Token 更贵的最难任务。

缓存输入会怎样影响 DeepSeek V4 Flash API 价格?

缓存输入可以降低重复上下文成本,但缓存未命中、长输出、重试和反复工具步骤仍会增加总费用。应以 Pricing 区和最终请求账单计算成功任务成本。

DeepSeek V4 Flash 有什么速率限制?

上游没有按 Token 的 RPM/TPM 限速,约束是账户级并发上限——Flash 档约 2,500 并发(约为 Pro 的 5 倍),超限返回 429,排队约 10 分钟未开始推理会被断开。更高的并发上限正是 Flash 的吞吐卖点:把在途请求数压在实测上限之下并使用指数退避,即可稳定跑高并发批量任务。

Flash 和 Pro 应该怎么选?

分类、摘要、短文本编辑和高并发批量流水线选 Flash,它的速度和约 5 倍于 Pro 的并发上限在这类任务上收益最大;8 步以上的长链路 Agent 和对事实准确性敏感的任务选 Pro。两档共用同一套 EvoLink API,按任务类型分流只是一处配置改动。

怎样比较 DeepSeek V4 Flash、GPT、Claude 与 Kimi?

可以让不同模型完成相同的真实任务,并使用一致的上下文、工具和推理设置。结合结果质量、响应时间、Token 构成、工具表现和总费用,更容易判断每类流量适合哪条 EvoLink 路由。

DeepSeek V4 Flash 开源吗?

开源——Flash 0731 权重已按 MIT 协议发布在 Hugging Face。开源权重和托管 API 是两条独立获取路径:EvoLink 路由提供托管 API,而同款 MIT 权重存在于第三方托管,正是回退路由可行的原因。

上线 DeepSeek V4 Flash 时应该保留什么回退模型?

建议保留一个已经稳定运行、能够完成同类任务的模型,并让路由选择保持可配置。发生限流、超时或无效输出时,可以通过 EvoLink 切换到 GPT、Claude、Kimi 或其他合适的替代路由。