
DeepSeek V4 Flash Vision Exp vs Flash:图片还是纯文本?
生命周期更新(2026 年 9 月 10 日): DeepSeek 发布了 V4.1 Flash。在 DeepSeek 官方直连接口上,deepseek-v4-flash与deepseek-v4-flash-vision-exp已转到 V4.1 Flash,deepseek-v4-pro计划于**北京时间 2026 年 9 月 14 日 12:00(UTC 04:00)**起跟进。在 EvoLink 上,deepseek-v4-flash与deepseek-v4-pro不受影响,继续提供 DeepSeek V4 Flash 与 V4 Pro;deepseek-v4-flash-vision-exp现已重定向到 DeepSeek V4.1 Flash。详见官方更新日志、V4.1 Flash 模型页与迁移指南。
deepseek-v4-flash-vision-exp 的请求现已重定向到 V4.1 Flash,因此下文的 Vision Exp 结果描述的是 8 月 21 日的原模型,请在替代模型上重新跑一遍图片评测集。路由原则不变:新增图片输入不是迁移全部 Flash 流量的理由。在 EvoLink 上做生产路由时,应先判断输入模态,再按各自的成功标准评测两条路线,并为图片路线保留已验证的回退方案。deepseek-v4-flash-vision-exp 的图片理解能力。该模型当时以实验版发布,现在 EvoLink 上这个 ID 已重定向到 V4.1 Flash,因此生产放量前仍要用代表性请求核对所选图片结构、usage、计费与回退行为。快速结论:按输入模态路由,不按新旧路由
| 工作负载条件 | 首选模型 | 路由原因 |
|---|---|---|
| 答案依赖截图、扫描件、图表、照片或渲染后的 UI | Vision Exp | 任务依赖纯文本 Flash 无法读取的视觉证据 |
| 任务已经完整表示为文本、代码、JSON 或工具输出 | Flash | 视觉路线不会增加有效输入信号 |
| 文档已有可靠提取文本,且版式不影响答案 | Flash | 规范化文本已经足够,不必继续发送图片 |
| 文档的表格、位置、手写内容或视觉层级很重要 | Vision Exp | 保留原始页面图像,让模型检查版式和标记 |
| 视觉 Agent 必须观察持续变化的 UI 截图 | Vision Exp + 回退 | 需要视觉定位,但 -exp 路线必须受控上线 |
| 高并发文本分类、摘要或代码任务 | Flash | 继续把成熟的纯文本路线作为默认值 |
两个模型到底有什么不同?
| 决策因素 | DeepSeek V4 Flash Vision Exp | DeepSeek V4 Flash |
|---|---|---|
| 请求模型 ID | deepseek-v4-flash-vision-exp | deepseek-v4-flash |
| 发布阶段 | 8 月 21 日以实验版图片理解模型发布;EvoLink 上这个 ID 现已重定向到 V4.1 Flash | EvoLink 上的正式纯文本模型,不受 9 月 10 日变更影响 |
| 输入模态 | 文本和图片 | 纯文本 |
| 输出模态 | 文本 | 文本 |
| 适合先试的任务 | 截图检查、文档提取、图表分析、视觉 Agent | 编程、分类、摘要、文本 Agent、结构化转换 |
| 评测重点 | 视觉准确率、定位、小字识别、版式保留 | 任务准确率、延迟、输出 Token、工具行为、文本稳定性 |
| 生产策略 | 功能开关、协议核验、灰度流量、已验证回退 | 继续作为文本默认路线并做常规回归监控 |
image_url,Messages 使用来源为 Base64 或 URL 的 image 内容块,Responses 使用 input_image。请通过图片输入接入教程匹配所选协议的载荷;Files API 行为仍需以单独的路由文档为准。
一棵可以真正落地的路由决策树
最安全的策略应先确定,再智能:
- 结果是否依赖视觉证据? 如果不依赖,把规范化文本发给
deepseek-v4-flash。 - 是否必须保留原图? 如果可靠 OCR 或结构化提取已经包含任务需要的全部内容,继续走文本路线。
- EvoLink 当前协议是否支持该图片格式? 如果不支持,就停止请求或切到另一条已验证的视觉回退,不要静默丢弃图片。
- 当前租户和工作负载是否允许使用 Vision? 用功能开关、白名单或路由规则隔离图片路线。
- 结果是否通过视觉验收? 如果没有通过,只允许有限重试或回退,不能因为输出流畅就自动相信答案。
规划规则可以保持简单:
if requires_visual_evidence and vision_route_verified:
route = "deepseek-v4-flash-vision-exp"
else:
route = "deepseek-v4-flash"实现时还应记录每次选择路线的原因。这样才能在统一网关中审计用量、失败原因和后续模型迁移。
工作负载路由矩阵
| 工作负载 | 推荐路线 | 验收标准 | 回退方案 |
|---|---|---|---|
| 截图 Bug 定位 | Vision Exp | 识别当前可见状态,并指出相关区域 | 另一条已验证视觉模型或人工复核 |
| 发票或表单提取 | 版式重要时用 Vision Exp | 字段准确率、漏字段率、页面可追溯 | OCR 管线 + Flash 处理提取文本 |
| 图表解读 | Vision Exp | 正确读取坐标轴、图例、单位和趋势 | 结构化图表数据 + Flash |
| UI Agent 观察 | Vision Exp | 元素定位准确,满足动作前置条件 | 无障碍树、工具状态或另一条视觉路线 |
| 基于源文件的仓库分析 | Flash | 测试通过、文件引用准确、任务完成 | 按错误成本升级到 Pro 或其他文本模型 |
| 文本分类或摘要 | Flash | 标注验证集和输出 Schema | 重试或其他文本模型 |
| 已有干净提取文本的 PDF | Flash | 抽样页面内容完整 | 仅对丢失版式的页面使用图片模型(EvoLink 上为 deepseek-v4.1-flash) |
| 文本和截图混合批次 | 拆分流量 | 分路线成功率和成本 | 失败的视觉任务单独排队 |
这样的拆分能让视觉处理成本只对应真实需要,也避免图片路线成为所有文本流量的单点故障。
比较成功任务成本,而不是只比 Token 单价
更实用的口径是:
成功任务成本 = 输入 + 输出 + 重试 + 预处理 + 人工复核 + 失败影响对 Vision Exp,应记录图片数量、图片 Token、文本 Token、输出 Token、重试次数和人工纠正率;对 Flash,应记录输入输出 Token、缓存情况以及重试或升级率。两条路线最终要按同一业务单位比较,例如“正确处理一份文档”,而不是只比较一次请求。
用正确证据分别评测两条路线
不要只用纯文本提示测试两个模型,然后得出“Vision 没有价值”的结论;也不要只测试截图,就得出“Vision 应该取代 Flash”的结论。
Vision Exp 评测集
建立有日期版本的真实图片集,至少评估:
- 扫描件和文档的转录、字段准确率
- 图表坐标轴、图例、单位和值提取
- 小字号与密集 UI 读取
- 视觉 Agent 的位置或元素定位
- 对无法看清内容是否会拒绝编造
- 延迟、重试率和人工纠正率
Flash 评测集
保留现有文本回归集,至少评估:
- 回答或转换任务准确率
- Schema 合法性与工具调用行为
- 首 Token 延迟与总延迟
- 输入、推理和输出 Token 使用
- 重试或升级率
8 月发布时,DeepSeek 表示实验版 Vision 在纯文本任务上与 Flash 相当。应把它视为厂商声明,而不是迁移结论。只有同条件评测证明存在明显产品收益,且新模型的风险可接受时,才考虑调整纯文本路线。
在 EvoLink 上的生产上线步骤
1. 先通过路由闸门
启用流量前,以下条件必须全部满足:
- 当前 EvoLink 文档列出
deepseek-v4-flash-vision-exp - 文档明确支持你实际使用的协议和图片字段
- 真实账号请求返回有效结果与 usage
- 账单与当前价格页面一致
- 不支持的格式和超限输入能按预期失败
2. 增加功能开关
deepseek-v4-flash。只在任务确实依赖视觉证据、且租户符合条件时,选择视觉专用路线。3. 从灰度流量开始
先使用内部或低风险视觉任务,记录输入类型、路由原因、延迟、用量、验收结果、回退和人工纠正。
4. 按工作负载扩量
分别放大截图检查、图表分析和指定文档类型,而不是只设置一个全局百分比。一个用例成功,不代表所有视觉任务都已验证。
5. 保留纯文本默认路线
deepseek-v4-flash 处理纯文本流量。这能缩小故障范围,也让成本归因更清晰。常见路由错误
| 错误 | 为什么会失败 | 更好的策略 |
|---|---|---|
| 因为图片模型更新就全量替换 Flash | 让纯文本流量也依赖图片模型 | 按输入证据和工作负载需求选择 |
| 所有 PDF 都按图片发送 | 即使已有干净文本仍增加视觉处理 | 先提取文本,仅在版式重要时保留图片 |
| 把上游协议支持等同于 EvoLink 支持 | 不同模型和协议的网关路线可能不同 | 核验 EvoLink 精确文档并完成真实请求 |
| 只比较标价 | 忽略重试、输出长度、人工复核和失败影响 | 统计成功任务成本 |
| 相信流畅的视觉描述 | 模型可能自信地读错图表或小字 | 加入工作负载专用验收标准 |
| 静默丢弃不支持的图片内容 | 回复看似合理,但没有使用核心证据 | 关闭式失败或切到已验证视觉回退 |
去掉 -exp 后缀 | 在 EvoLink 上会调用只支持文字的 deepseek-v4-flash | 新的图片任务发送 deepseek-v4.1-flash;继续用旧 ID 时要原样发送 |
推荐的回退策略
回退必须保留任务所需的信息:
- 截图和图表任务应回退到另一条已验证视觉路线,而不是移除图片后直接交给纯文本 Flash。
- 文档提取任务可以先用 OCR 生成可追溯文本,再交给 Flash,但前提是版式损失不影响结果。
- 视觉 Agent 的定位置信度或路线可用性不明确时,应暂停破坏性动作。
- 限制超时、重试次数和总预算;换了新模型也不等于可以无限重试。
- 单独统计回退使用率,避免整体成功率掩盖较弱的主视觉路线。
EvoLink 统一网关在这里的价值,是把文本、视觉和回退路线放到同一套可控选择面中:应用无需为每个模型重写集成,同时可以比较用量和成本。
常见问题
DeepSeek V4 Flash Vision Exp 和 DeepSeek V4 Flash 是同一个模型吗?
deepseek-v4-flash 继续提供纯文本的 V4 Flash,而 deepseek-v4-flash-vision-exp 现已重定向到 DeepSeek V4.1 Flash。在 DeepSeek 官方直连接口上,这两个旧名字都已转到 V4.1 Flash。哪个模型 ID 支持图片输入?
deepseek-v4.1-flash。发往 deepseek-v4-flash-vision-exp 的现有请求仍可用,但会被重定向到 V4.1 Flash。DeepSeek V4 Flash 能读取截图吗?
deepseek-v4-flash 仍是纯文本的 V4 Flash 路线。任务依赖截图像素时,请使用 deepseek-v4.1-flash 或其他经过验证的视觉模型。Vision Exp 可以处理纯文本请求吗?
deepseek-v4-flash。Vision Exp 比 Flash 更便宜吗?
不能从模型名称推断。应比较当前 EvoLink 价格模块,并统计包含图片输入、输出、重试、预处理和人工复核的成功任务成本。
一张图片会使用多少 Token?
哪个模型更适合生产环境?
在 EvoLink 上,Flash 是已经建立的纯文本路线。发往 Vision Exp ID 的请求现在由 V4.1 Flash 处理,请重新跑视觉评测,并通过功能开关、灰度流量和已验证回退逐步放量图片流量。
PDF 应该发给 Vision Exp 还是 Flash?
deepseek-v4.1-flash)。Vision Exp 应该怎么回退?
deepseek-v4-flash-vision-exp 已重定向到 V4.1 Flash,在这两个 ID 之间切换不算回退。

