GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验
DeepSeek V4 Flash Vision Exp vs Flash:图片还是纯文本?
对比

DeepSeek V4 Flash Vision Exp vs Flash:图片还是纯文本?

Jessie
Jessie
COO
2026年8月21日
更新于 2026年9月10日
19 分钟阅读
生命周期更新(2026 年 9 月 10 日): DeepSeek 发布了 V4.1 Flash。在 DeepSeek 官方直连接口上,deepseek-v4-flash 与 deepseek-v4-flash-vision-exp 已转到 V4.1 Flash,deepseek-v4-pro 计划于**北京时间 2026 年 9 月 14 日 12:00(UTC 04:00)**起跟进。在 EvoLink 上,deepseek-v4-flash 与 deepseek-v4-pro 不受影响,继续提供 DeepSeek V4 Flash 与 V4 Pro;deepseek-v4-flash-vision-exp 现已重定向到 DeepSeek V4.1 Flash。详见官方更新日志、V4.1 Flash 模型页与迁移指南。
2026 年 9 月 10 日更新:在 EvoLink 上,图片证据交给 DeepSeek V4.1 Flash,纯文本请求继续使用 DeepSeek V4 Flash。 发往 deepseek-v4-flash-vision-exp 的请求现已重定向到 V4.1 Flash,因此下文的 Vision Exp 结果描述的是 8 月 21 日的原模型,请在替代模型上重新跑一遍图片评测集。路由原则不变:新增图片输入不是迁移全部 Flash 流量的理由。在 EvoLink 上做生产路由时,应先判断输入模态,再按各自的成功标准评测两条路线,并为图片路线保留已验证的回退方案。
截至 2026 年 8 月 21 日,EvoLink 已在 Chat Completions、Messages 与 Responses 文档中记录 deepseek-v4-flash-vision-exp 的图片理解能力。该模型当时以实验版发布,现在 EvoLink 上这个 ID 已重定向到 V4.1 Flash,因此生产放量前仍要用代表性请求核对所选图片结构、usage、计费与回退行为。
查看 Vision Exp 模型页

快速结论:按输入模态路由,不按新旧路由

工作负载条件首选模型路由原因
答案依赖截图、扫描件、图表、照片或渲染后的 UIVision Exp任务依赖纯文本 Flash 无法读取的视觉证据
任务已经完整表示为文本、代码、JSON 或工具输出Flash视觉路线不会增加有效输入信号
文档已有可靠提取文本,且版式不影响答案Flash规范化文本已经足够,不必继续发送图片
文档的表格、位置、手写内容或视觉层级很重要Vision Exp保留原始页面图像,让模型检查版式和标记
视觉 Agent 必须观察持续变化的 UI 截图Vision Exp + 回退需要视觉定位,但 -exp 路线必须受控上线
高并发文本分类、摘要或代码任务Flash继续把成熟的纯文本路线作为默认值
这两个模型不是简单的质量高低档。Vision Exp 是视觉专用路线,Flash 是纯文本路线。 如果请求虽然带了图片,但业务并不需要检查图片,就应该移除附件,而不是无条件发送视觉请求。

两个模型到底有什么不同?

决策因素DeepSeek V4 Flash Vision ExpDeepSeek V4 Flash
请求模型 IDdeepseek-v4-flash-vision-expdeepseek-v4-flash
发布阶段8 月 21 日以实验版图片理解模型发布;EvoLink 上这个 ID 现已重定向到 V4.1 FlashEvoLink 上的正式纯文本模型,不受 9 月 10 日变更影响
输入模态文本和图片纯文本
输出模态文本文本
适合先试的任务截图检查、文档提取、图表分析、视觉 Agent编程、分类、摘要、文本 Agent、结构化转换
评测重点视觉准确率、定位、小字识别、版式保留任务准确率、延迟、输出 Token、工具行为、文本稳定性
生产策略功能开关、协议核验、灰度流量、已验证回退继续作为文本默认路线并做常规回归监控
EvoLink 现已记录三条路线的图片输入:Chat Completions 使用 image_url,Messages 使用来源为 Base64 或 URL 的 image 内容块,Responses 使用 input_image。请通过图片输入接入教程匹配所选协议的载荷;Files API 行为仍需以单独的路由文档为准。
普通文本路线的 EvoLink 状态、适用任务和实时价格,以 DeepSeek V4 Flash API 页面为准。不要因为两个模型名称都带有 “Flash”,就推断普通 Flash 也能接收图片。
统一 API 网关先把截图、文档和图表输入与代码、纯文本流量分开,再生成结构化输出
统一 API 网关先把截图、文档和图表输入与代码、纯文本流量分开,再生成结构化输出

一棵可以真正落地的路由决策树

最安全的策略应先确定,再智能:

  1. 结果是否依赖视觉证据? 如果不依赖,把规范化文本发给 deepseek-v4-flash。
  2. 是否必须保留原图? 如果可靠 OCR 或结构化提取已经包含任务需要的全部内容,继续走文本路线。
  3. EvoLink 当前协议是否支持该图片格式? 如果不支持,就停止请求或切到另一条已验证的视觉回退,不要静默丢弃图片。
  4. 当前租户和工作负载是否允许使用 Vision? 用功能开关、白名单或路由规则隔离图片路线。
  5. 结果是否通过视觉验收? 如果没有通过,只允许有限重试或回退,不能因为输出流畅就自动相信答案。

规划规则可以保持简单:

if requires_visual_evidence and vision_route_verified:
    route = "deepseek-v4-flash-vision-exp"
else:
    route = "deepseek-v4-flash"

实现时还应记录每次选择路线的原因。这样才能在统一网关中审计用量、失败原因和后续模型迁移。

工作负载路由矩阵

工作负载推荐路线验收标准回退方案
截图 Bug 定位Vision Exp识别当前可见状态,并指出相关区域另一条已验证视觉模型或人工复核
发票或表单提取版式重要时用 Vision Exp字段准确率、漏字段率、页面可追溯OCR 管线 + Flash 处理提取文本
图表解读Vision Exp正确读取坐标轴、图例、单位和趋势结构化图表数据 + Flash
UI Agent 观察Vision Exp元素定位准确,满足动作前置条件无障碍树、工具状态或另一条视觉路线
基于源文件的仓库分析Flash测试通过、文件引用准确、任务完成按错误成本升级到 Pro 或其他文本模型
文本分类或摘要Flash标注验证集和输出 Schema重试或其他文本模型
已有干净提取文本的 PDFFlash抽样页面内容完整仅对丢失版式的页面使用图片模型(EvoLink 上为 deepseek-v4.1-flash)
文本和截图混合批次拆分流量分路线成功率和成本失败的视觉任务单独排队

这样的拆分能让视觉处理成本只对应真实需要,也避免图片路线成为所有文本流量的单点故障。

比较成功任务成本,而不是只比 Token 单价

对于 8 月 21 日发布的 Vision Exp,DeepSeek 当时表示一张图片最多计入 384 个输入 Token。DeepSeek 当前的 Vision 文档把官方直连接口的上限写为每张图片 1024 个 Token,而发往这个 ID 的请求现在由 V4.1 Flash 处理,因此请按当前规则估算。这两个数字都只适合估算图片部分,既不等于视觉任务最终成功所需的成本,也不代表 EvoLink 的计费规则。

更实用的口径是:

成功任务成本 = 输入 + 输出 + 重试 + 预处理 + 人工复核 + 失败影响

对 Vision Exp,应记录图片数量、图片 Token、文本 Token、输出 Token、重试次数和人工纠正率;对 Flash,应记录输入输出 Token、缓存情况以及重试或升级率。两条路线最终要按同一业务单位比较,例如“正确处理一份文档”,而不是只比较一次请求。

EvoLink 价格可能与 DeepSeek 直连接口价格不同,也可能随时间变化。请使用 Vision Exp 产品页和 Flash 产品页现有的实时价格模块;本文不会重复维护另一张价格表。

用正确证据分别评测两条路线

不要只用纯文本提示测试两个模型,然后得出“Vision 没有价值”的结论;也不要只测试截图,就得出“Vision 应该取代 Flash”的结论。

Vision Exp 评测集

建立有日期版本的真实图片集,至少评估:

  • 扫描件和文档的转录、字段准确率
  • 图表坐标轴、图例、单位和值提取
  • 小字号与密集 UI 读取
  • 视觉 Agent 的位置或元素定位
  • 对无法看清内容是否会拒绝编造
  • 延迟、重试率和人工纠正率

Flash 评测集

保留现有文本回归集,至少评估:

  • 回答或转换任务准确率
  • Schema 合法性与工具调用行为
  • 首 Token 延迟与总延迟
  • 输入、推理和输出 Token 使用
  • 重试或升级率

8 月发布时,DeepSeek 表示实验版 Vision 在纯文本任务上与 Flash 相当。应把它视为厂商声明,而不是迁移结论。只有同条件评测证明存在明显产品收益,且新模型的风险可接受时,才考虑调整纯文本路线。

1. 先通过路由闸门

启用流量前,以下条件必须全部满足:

  • 当前 EvoLink 文档列出 deepseek-v4-flash-vision-exp
  • 文档明确支持你实际使用的协议和图片字段
  • 真实账号请求返回有效结果与 usage
  • 账单与当前价格页面一致
  • 不支持的格式和超限输入能按预期失败

2. 增加功能开关

不要在全局替换 deepseek-v4-flash。只在任务确实依赖视觉证据、且租户符合条件时,选择视觉专用路线。

3. 从灰度流量开始

先使用内部或低风险视觉任务,记录输入类型、路由原因、延迟、用量、验收结果、回退和人工纠正。

4. 按工作负载扩量

分别放大截图检查、图表分析和指定文档类型,而不是只设置一个全局百分比。一个用例成功,不代表所有视觉任务都已验证。

5. 保留纯文本默认路线

在 Vision Exp 没有证明接管价值之前,继续让 deepseek-v4-flash 处理纯文本流量。这能缩小故障范围,也让成本归因更清晰。

常见路由错误

错误为什么会失败更好的策略
因为图片模型更新就全量替换 Flash让纯文本流量也依赖图片模型按输入证据和工作负载需求选择
所有 PDF 都按图片发送即使已有干净文本仍增加视觉处理先提取文本,仅在版式重要时保留图片
把上游协议支持等同于 EvoLink 支持不同模型和协议的网关路线可能不同核验 EvoLink 精确文档并完成真实请求
只比较标价忽略重试、输出长度、人工复核和失败影响统计成功任务成本
相信流畅的视觉描述模型可能自信地读错图表或小字加入工作负载专用验收标准
静默丢弃不支持的图片内容回复看似合理,但没有使用核心证据关闭式失败或切到已验证视觉回退
去掉 -exp 后缀在 EvoLink 上会调用只支持文字的 deepseek-v4-flash新的图片任务发送 deepseek-v4.1-flash;继续用旧 ID 时要原样发送

推荐的回退策略

回退必须保留任务所需的信息:

  • 截图和图表任务应回退到另一条已验证视觉路线,而不是移除图片后直接交给纯文本 Flash。
  • 文档提取任务可以先用 OCR 生成可追溯文本,再交给 Flash,但前提是版式损失不影响结果。
  • 视觉 Agent 的定位置信度或路线可用性不明确时,应暂停破坏性动作。
  • 限制超时、重试次数和总预算;换了新模型也不等于可以无限重试。
  • 单独统计回退使用率,避免整体成功率掩盖较弱的主视觉路线。

EvoLink 统一网关在这里的价值,是把文本、视觉和回退路线放到同一套可控选择面中:应用无需为每个模型重写集成,同时可以比较用量和成本。

常见问题

DeepSeek V4 Flash Vision Exp 和 DeepSeek V4 Flash 是同一个模型吗?

不是。在 EvoLink 上,deepseek-v4-flash 继续提供纯文本的 V4 Flash,而 deepseek-v4-flash-vision-exp 现已重定向到 DeepSeek V4.1 Flash。在 DeepSeek 官方直连接口上,这两个旧名字都已转到 V4.1 Flash。

哪个模型 ID 支持图片输入?

在 EvoLink 上,新的图片任务请使用 deepseek-v4.1-flash。发往 deepseek-v4-flash-vision-exp 的现有请求仍可用,但会被重定向到 V4.1 Flash。

DeepSeek V4 Flash 能读取截图吗?

不能。在 EvoLink 上,deepseek-v4-flash 仍是纯文本的 V4 Flash 路线。任务依赖截图像素时,请使用 deepseek-v4.1-flash 或其他经过验证的视觉模型。

Vision Exp 可以处理纯文本请求吗?

发往这个 ID 的请求现在由 V4.1 Flash 处理。在 EvoLink 上,除非你自己的评测证明 V4.1 Flash 有明显收益,否则纯文本流量继续使用 deepseek-v4-flash。

Vision Exp 比 Flash 更便宜吗?

不能从模型名称推断。应比较当前 EvoLink 价格模块,并统计包含图片输入、输出、重试、预处理和人工复核的成功任务成本。

一张图片会使用多少 Token?

原版 Vision Exp 时,DeepSeek 表示每张图片最多计入 384 个输入 Token;DeepSeek 当前的 Vision 文档把官方直连接口的上限写为每张图片 1024 个 Token。发往这个 ID 的请求现在由 V4.1 Flash 处理,生产成本请以你的 EvoLink 请求返回的 usage 为准。

哪个模型更适合生产环境?

在 EvoLink 上,Flash 是已经建立的纯文本路线。发往 Vision Exp ID 的请求现在由 V4.1 Flash 处理,请重新跑视觉评测,并通过功能开关、灰度流量和已验证回退逐步放量图片流量。

PDF 应该发给 Vision Exp 还是 Flash?

如果干净的提取文本已经包含所需信息,就用 Flash;如果表格、空间版式、手写内容、印章或其他视觉证据会改变答案,就用图片模型(在 EvoLink 上为 deepseek-v4.1-flash)。

Vision Exp 应该怎么回退?

回退路线仍需接收任务所需证据:图片任务使用另一条经过验证的视觉模型;提取文本已经足够时,可以使用可追溯的 OCR + Flash 管线。由于在 EvoLink 上 deepseek-v4-flash-vision-exp 已重定向到 V4.1 Flash,在这两个 ID 之间切换不算回退。

资料来源

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。