GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验

DeepSeek V4.1 Flash API

通过 EvoLink 统一对话 API 接入 DeepSeek 的 V4.1 Flash(也常被搜索为 DeepSeek V4.1 / DeepSeek Flash)。集成前可先测试长上下文编程、图像输入、思考模式。

DeepSeek文本生成可用
$0.442 / 百万输入 Token 起
API 文档
长上下文编程图像输入思考模式提示缓存Chat + Messages + Responses
生产路由已上线
上下文
1M 上下文 · 最大输出 384K
适用场景
长上下文编程与 Agent 循环,且需要读图的场景
可输入
文本 + 图像
输出形态
文本 · JSON(结构化输出)

选择 DeepSeek V4.1 Flash

文字、图片和长上下文任务都用同一个模型 ID:deepseek-v4.1-flash。上线前请在 Pricing 区核对费率,并先测试你用的协议。

DeepSeek V4.1 Flash

DeepSeek 支持文字与图片输入的 Flash 模型

已选择
模型 ID
deepseek-v4.1-flash
适合

编程、Agent 循环、文档抽取和截图理解,100 万上下文;质量和每个合格结果的成本,请用自己的任务实测。

输入
$0.442 / 1M
30 cr / 1M
缓存命中
$0.015 / 1M
1 cr / 1M
输出
$1.324 / 1M
90 cr / 1M

所有费率按每百万 Token 计,同时显示美元与 Credits,以你账户当前的价格为准。

DeepSeek V4.1 Flash 价格

集成前先估算一次 DeepSeek V4.1 Flash 请求的费用。计算器按你账户的当前费率计算,官方价格仅作对照。

请求费用计算器

输入一次请求的 Token 组合。

单次请求预估

DeepSeek V4.1 Flash
USD$0.0009
Credits0.0572
输入 Token0.03 cr
缓存命中 Token0.0002 cr
输出 Token0.027 cr

最低计费:每次请求 0.01 Credits。

预算指南

按当前 Token 组合估算可发起的请求数。
充值 Credits
$10
约 11888 次请求

快速测试

$50
约 59440 次请求

日常开发

$100
约 118881 次请求

生产评估

DeepSeek V4.1 Flash API

DeepSeek V4.1 Flash 支持原生文字与图片输入,具备 100 万 Token 上下文和最高 38.4 万 Token 输出。在 EvoLink 上以模型 ID deepseek-v4.1-flash 调用,截图、文档和编程任务都可以通过统一 API 接入。切生产流量前,请以本页 Pricing 区和账户最终扣费核对成本,确认所用协议,并用自己的任务验证。

DeepSeek V4.1 Flash 在 EvoLink 上以模型 ID deepseek-v4.1-flash 提供,支持 Chat Completions · Anthropic Messages · Responses,和其他模型共用同一把 API 密钥与余额。它提供 1M 上下文窗口,最大输出 384K Token,并支持长上下文编程、图像输入、思考模式。

DeepSeek V4.1 Flash

DeepSeek V4.1 Flash 规格与能力

数字取自 EvoLink 路由配置;能力以 API 当前实际提供为准。

上下文窗口
1M Token
最大输出
384K Token
输入
文本 + 图像
输出
文本 · JSON(结构化输出)
推理
可选思考模式
提示缓存
自动缓存读取,享较低费率
协议
Chat Completions · Anthropic Messages · Responses
模型 ID
deepseek-v4.1-flash
图像输入
PNG · JPEG · WebP · GIF

API 模型 ID 是 deepseek-v4.1-flash,中间写点;本页 URL 用的是连字符。DeepSeek 官方直连接口用的是另一个名字 deepseek-flash。

DeepSeek V4.1 Flash API 适合哪些任务?

适合编程、Agent 循环,以及需要把问题和图片证据一起发送的任务。在 EvoLink 上,DeepSeek V4 Flash 仍作为独立模型(只支持文字输入)继续提供,可以先用同一批任务对比两者,再决定是否切流。发往 V4 Flash Vision Exp 的请求现已重定向到 V4.1 Flash。

长上下文编程与代码审查

把相关源文件、规范文档和 diff 放进同一个工作上下文,让模型出审查意见、补丁或风险清单。只放真正相关的上下文,并先查看 usage 中报告的缓存命中,再估算多轮成本。

前缀稳定的 Agent 循环

多步 Agent 里,系统提示、工具 Schema 和共享项目上下文在各轮之间保持完全一致。可复用的前缀在报告缓存命中时能降低重复输入成本,但不保证每次请求都命中。推算整个循环的成本之前,先在自己的日志里量一下真实命中率。

文档与截图和问题一起发

把扫描件、发票、仪表盘截图或图表连同问题一起发出去,要求返回结构化字段。在把结果交给下游自动决策之前,先用带标注的样例检查小字号、缺失字段和含义模糊的图表。

大批量结构化抽取

以较低的单 Token 价格做批量分类、字段抽取和摘要,输出 JSON 供下游处理。每条响应都要校验 Schema,低置信度的结果交人工复核,不要默认格式一定正确。

从 DeepSeek V4 Flash 换到 V4.1 Flash,有哪些变化?

在 EvoLink 上两个模型都继续可用:deepseek-v4-flash 仍是 V4 Flash,deepseek-v4.1-flash 是新模型,可以用同一批请求对比。请求格式兼容,不代表输出、思考行为、Token 用量或工具执行结果完全一样,切换前请逐项核对。

模型 ID 带点,URL 不带

API 模型 ID 是 deepseek-v4.1-flash——中间是点。本页地址是 /deepseek-v4-1-flash。请从 Models 卡片复制 ID,不要从地址栏推断;DeepSeek 官方直连接口用的是另一个名字 deepseek-flash。

按本页费率与最终扣费核算成本

当前 EvoLink 费率以 Pricing 区为准,最终扣费以账户账单为准。不要按模型名推断价格;思考输出、图片 Token、重试和合格率都会改变实际成本。

批量前先量图片用量

Pricing 区列出了输入、缓存输入和输出三档费率。批量处理前,先用有代表性的图片查看 usage 和最终扣费,再估算批量成本。

用你技术栈已有的那种协议

Chat Completions、Messages 与 Responses 使用同一个模型 ID。选择应用已经在用的协议,切流量前先在该协议上确认流式事件、工具调用和 usage 报告。

怎样让 DeepSeek V4.1 Flash API 的成本可预测?

上面的 Pricing 区放了实时费率和请求计算器。把它当作估算,再用实际报告的 Token 分类、最终扣费和合格结果去对账。

把前缀设计成能命中缓存的样子

DeepSeek 文档说明前缀缓存是自动的。把可复用的指令和工具定义放在会变的内容之前,并查看 usage 里的缓存 Token 字段。后缀变化不一定让整个共享前缀失效;实际收益取决于缓存是否可用以及 usage 的报告。

把 100 万上下文当容量,不要当目标

任务真的需要时,大上下文很有用,但发出去的每个 Token 都要计费。只检索真正相关的文件和段落,而不是整仓粘贴,通常能在不牺牲输出质量的前提下压低单次任务成本。

用自己的图片实测,不要抄别人的数字

图片消耗的 Token 数随分辨率和内容变化,别人截图上量出来的数字预测不了你的。跑一批有代表性的样本,读 usage 里报告的输入 Token,再把这个数字填进上面的计算器。

给每类任务设输出预算

38.4 万 Token 的输出上限是天花板,不是默认值。按所用协议给任务设置合适的输出上限,发现截断要处理,并限制重试次数——失败后反复重跑,可能比第一次就给足输出长度更贵。

两种方式使用 DeepSeek V4.1 Flash:EvoLink API 或 Agent

产品后端与批量任务走 EvoLink API;编码与分析类工作可直接在 Codex、Claude、Gemini 里调用 DeepSeek V4.1 Flash。两条路径共用同一把 EvoLink API 密钥、余额、模型 ID 与请求记录。

方式一

用 EvoLink API 接入

适合:产品后端、批量任务、自动化流水线

向 EvoLink 发送 OpenAI 兼容的 Chat Completions(或 Anthropic Messages)请求,自行控制模型 ID、系统提示、输出预算、工具与结构化输出。

  1. 1在控制台创建 EvoLink API 密钥
  2. 2把 OpenAI 或 Anthropic SDK 的 base URL 指向 EvoLink,并选择上方显示的模型 ID
  3. 3先发一条有代表性的请求,从 usage 字段读取输入、缓存与输出 token
  4. 4按任务设置 max_tokens 与重试;多轮时保留 tool-call ID 与工具结果
方式二

用 Agent 调用

适合:在 Codex、Claude、Gemini 里做编码、评审与分析

把任务、要带入的材料和验收标准交给 Agent,由它组装请求、通过 EvoLink 调用 DeepSeek V4.1 Flash,并把回答连同 token 用量一起返回。

  1. 1在本地环境变量里配置 EVOLINK_API_KEY,不要写进代码或提示词
  2. 2描述任务、要带入的材料和期望的输出格式
  3. 3让 Agent 通过 EvoLink 调用 DeepSeek V4.1 Flash,并在发送前先展示请求
  4. 4让 Agent 汇报回答、token 用量和任何错误信息

DeepSeek V4.1 Flash API 代码示例与错误处理

这个示例是最短可运行的请求:一条 OpenAI 兼容的 Chat Completions 调用,带系统提示、用户消息和输出预算。完整参数与响应说明见 API 标签页。

查看完整 API 文档
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4.1-flash",
    "messages": [
      { "role": "system", "content": "You are a senior engineer reviewing a pull request." },
      { "role": "user", "content": "Review this diff and list every risky change with file and line:\n<diff>" }
    ],
    "max_tokens": 4096,
    "temperature": 0.2
  }'

# Anthropic Messages (/v1/messages) and Responses (/v1/responses) accept the
# same model ID.
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens).

请求无效或参数不支持

对照 API 文档检查模型 ID、messages 数组和参数范围,去掉该路由不支持的字段。

鉴权或余额问题

检查 Authorization bearer token,并在控制台确认可用余额。

超出上下文长度

提示词 token 超过了 DeepSeek V4.1 Flash 的上下文窗口。裁剪或只检索相关材料,并复用缓存前缀。

触发限流(429)

退避并带抖动重试;用批处理或队列代替并发突发。

内容或工具调用被拒

重试前检查敏感内容、格式错误的 tool-call 参数和 JSON schema 不匹配。

第一个 DeepSeek V4.1 Flash 请求怎么发?

从拿到 API Key 到跑生产流量,四步走完。API 链接会打开 EvoLink 文档,V4.1 Flash 的协议示例将在那里补充。

01

复制准确的模型 ID

在模型配置里写 deepseek-v4.1-flash,中间是点。上面 Models 卡片的复制按钮给的就是准确字符串;不要用页面 slug 或 DeepSeek 官方直连接口的名字代替 EvoLink 的模型 ID。

模型配置
02

用现有协议先发一个纯文本请求

用有效的 Key 和所选协议当前的 EvoLink 请求示例,先发一个小的文字请求,确认端点、鉴权、响应解析和 usage 都正常,再加图片或工具调用。

第一个请求
03

加上图片,回读 usage

确认所选协议的图片字段:Chat Completions 用 image_url,Messages 用 image 块,Responses 用 input_image。图片请求成功后,把 usage 和最终扣费与对应的纯文字任务比较。

图像输入
04

稳住前缀,再扩量

保持可复用的指令和工具定义稳定,实测缓存命中而不是假设命中,等质量、延迟和最终扣费都通过验收标准后再加流量。

逐步扩量

缓存命中只按新输入的零头计费

DeepSeek 文档说明前缀缓存是自动的。把可复用的指令和工具定义放在前面,再查看 usage 里报告的缓存命中 Token。缓存复用可以降低重复输入成本,但不保证每次请求都能命中。

1M Token 上下文,384K 输出上限

把相关文件、规范和 Agent 状态放进同一个工作上下文,但把上限当作容量而不是目标:只检索真正需要的内容,保持前缀稳定以便命中缓存,并按任务设置输出预算——三个计费维度里输出最贵。

DeepSeek V4.1 Flash 与 Qwen 3.8 Max、GLM-5.3 对比

EvoLink

对照输入输出费率、上下文、缓存和适用任务。先用同一批请求实测再选路由;下表采用你账户当前的费率。

DeepSeek V4.1 Flash
输入 / 输出$0.442 / $1.324
上下文1M
缓存自动缓存命中
最适合编程、Agent 循环、文档抽取和截图理解,100 万上下文;质量和每个合格结果的成本,请用自己的任务实测。
Qwen 3.8 Max
输入 / 输出$1.765 / $5.295
上下文1.05M
缓存显式提示词缓存
最适合仓库级工程、多文档综合、重度工具调用 Agent
GLM-5.3
输入 / 输出$1.4 / $4.4
上下文1M
缓存自动缓存命中
最适合编程 Agent、长链路任务、重工具调用流程

把 DeepSeek V4.1 Flash 放到生产流量上之前,要确认什么?

要核对输出质量、支持的控制项和实际扣费。在 EvoLink 上,可以把同一批真实请求分别发给 V4 Flash 和 V4.1 Flash 并排比较;如果是从 Vision Exp 迁移,请与重定向之前保存的结果对比。

模型 ID 与协议接对了

确认请求发出去的是 deepseek-v4.1-flash、响应从预期的协议返回,并且 usage 对象把输入、缓存和输出 Token 分开报告。没有这个拆分,既算不清成本,也验证不了缓存到底有没有生效。

现有提示词的输出质量站得住

在 EvoLink 上拿一组固定的真实请求分别打到 deepseek-v4-flash 和 deepseek-v4.1-flash,把结果并排比较。指令遵循、格式有效性、工具调用结果和思考行为都要实测,不要默认为 V4 Flash 调过的提示词可以直接沿用。

图像结果达到你的验收标准

如果这次要新增图像输入,就针对你实际会处理的截图、表单和图表建一套固定评测集,检查字段准确率、缺失值、小字号处理和有没有编造细节,并定好哪个置信度以下必须转人工。

延迟和错误处理在压力下正常

在有代表性的流量下观察响应时间,并为限流、超时和结构化输出不合法准备好重试。把模型名放在配置里而不是写死在代码里,切回已验证的路由就只是改配置,不用发版。

先用有代表性的任务和一小部分流量开始。等质量、延迟和每个合格结果的成本都达标,再扩大流量。纯文字任务可以保留 deepseek-v4-flash 作为回退,它在 EvoLink 上仍是 V4 Flash;但它只支持文字输入,图片任务要回退到另一条通过同样视觉验收的模型,或转人工处理。发往 V4 Flash Vision Exp 的请求会重定向到 V4.1 Flash,不能当回退。

DeepSeek V4 模型家族

同一把 API 密钥、同一份余额,换档位不用改接入。

DeepSeek V4 Flash Vision

DeepSeek V4 Flash Vision

Vision Exp 旧模型 ID,现已重定向到 DeepSeek V4.1 Flash

查看模型
DeepSeek V4 Pro

DeepSeek V4 Pro

DeepSeek 推理与工具调用模型

查看模型
DeepSeek V4 Flash

DeepSeek V4 Flash

DeepSeek 推理与工具调用模型

查看模型

DeepSeek V4.1 Flash 之外的其他文本模型

GPT-5.6

GPT-5.6

OpenAI 的分档前沿系列,想知道同一个任务在高端路由上要花多少时,可以拿它当质量上限来对照。

查看模型
Claude Opus 5

Claude Opus 5

Anthropic 的高端路由,适合长时间 Agent、工具可靠性和复杂代码审查。

查看模型
Kimi K3

Kimi K3

月之暗面的长上下文推理路由,缓存输入单独定价,是 Agent 类任务的近距离参照。

查看模型
GLM-5.3

GLM-5.3

智谱的旗舰路由,同样是自动缓存;想用同一批提示词拿到第二个判断时,它是最接近的国产替代。

查看模型

DeepSeek V4.1 Flash 延伸阅读

DeepSeek V4 API 评测:Flash 与 Pro 怎么选

DeepSeek V4 API 评测:Flash 与 Pro 怎么选

从成本、思考模式和上线检查清单三方面对比 V4 两档;两档在 EvoLink 上都继续可用。

阅读指南
DeepSeek V4.1 Flash 迁移指南

DeepSeek V4.1 Flash 迁移指南

对照旧模型 ID、Pro 在官方接口的切换时间,以及分阶段切流的验证方法。

阅读指南
DeepSeek Vision Exp 与 Flash 的路由取舍

DeepSeek Vision Exp 与 Flash 的路由取舍

图片与纯文字的分流决策:在 EvoLink 上,图片任务改用 V4.1 Flash,纯文字流量可以继续留在 V4 Flash。

阅读指南
DeepSeek V4 对比 GPT-5.4 与 Claude Opus 4.6

DeepSeek V4 对比 GPT-5.4 与 Claude Opus 4.6

三条前沿路由的官方价格与能力对照。

阅读指南

DeepSeek V4.1 Flash API 常见问题

DeepSeek V4.1 Flash 的模型 ID 是什么?

EvoLink 上的模型 ID 是 deepseek-v4.1-flash,中间写点;本页地址是 /deepseek-v4-1-flash。DeepSeek 官方直连接口用的是 deepseek-flash。请按你所用的服务商和端点填写对应的名字。

V4.1 Flash 和 V4 Flash 差在哪?

V4.1 Flash 原生支持图片输入,V4 Flash 只支持文字输入;两者都是 100 万 Token 上下文、38.4 万 Token 输出上限。在 EvoLink 上,deepseek-v4-flash 不受 DeepSeek 在官方接口下线原模型的影响,仍是 V4 Flash,所以可以把两者并排运行。

它比 V4 Flash 贵吗?

请分别查看两个模型页 Pricing 区展示的费率,并以账户最终扣费为准,不要按模型名推断。任务成本还取决于输出长度、思考、图片、缓存命中和重试。DeepSeek 官方的峰谷价格是另一套价格表。

可以用哪些协议调用?

Chat Completions(/v1/chat/completions)、Messages(/v1/messages)和 Responses(/v1/responses)使用同一个模型 ID。上生产前用你的 Key 验证所选协议,包括流式、工具和 usage;不同协议的图片字段不一样。

图片怎么计费?

先在 Pricing 区查看输入、缓存输入和输出三档费率,再用有代表性的图片请求实测,把 usage 与最终扣费对上后再估算批量成本。

缓存是怎么生效的?

DeepSeek 文档说明前缀缓存是自动的。把可复用的上下文放在前面,并查看 usage 报告的缓存命中。重复使用提示词不保证命中缓存,改动后缀也不一定让已缓存的前缀 Token 全部失效。

思考模式默认开着吗?

DeepSeek 文档说明其官方直连接口默认开启思考模式,也提供非思考模式。请在你所用的协议上确认 EvoLink 的默认值和可用控制项;“支持关闭”不等于“默认关闭”。思考会增加输出用量,建议实测影响。

从 V4 Flash 迁过来只改模型名就行吗?

改模型名是主要的代码改动,但不是迁移的全部。在 EvoLink 上,保持 deepseek-v4-flash 继续运行,把同一批请求发给 deepseek-v4.1-flash,比较输出、工具结果和 usage,再逐步切流。

实际该发多少上下文?

按任务需要的证据发送,并设置合适的输出上限。用有代表性的几种上下文长度,统计合格结果、缓存复用和总扣费,不要每次请求都塞满 100 万窗口。

应该保留什么备用路由?

保留一条仍在提供你已验证过的模型的路线,并按任务类型区分。文字任务:EvoLink 上的 deepseek-v4-flash 和 deepseek-v4-pro 不受 DeepSeek 官方接口变更影响,仍是不同的模型;但模型不同不代表故障相互独立,依赖它们互备前请确认是否共用服务商或配额。图片任务:这两个模型只支持文字输入,需要另一条通过同样视觉验收的模型或人工流程。发往 V4 Flash Vision Exp 的请求已重定向到 V4.1 Flash,不能当备用。