Seedance 2.5 已上线 EvoLink立即体验
DeepSeek V4 Flash Vision Exp 图片输入 API 教程
教程

DeepSeek V4 Flash Vision Exp API 怎么用:图片输入教程

Jacey
Jacey
2026年8月21日
15 分钟阅读
DeepSeek 在 2026 年 8 月 21 日发布实验模型 deepseek-v4-flash-vision-exp,同一次请求可以包含文本与图片。EvoLink 现已在 Chat Completions、Messages 与 Responses 三种协议中记录该模型。对 EvoLink 用户来说,接入重点不只是“图片字段怎么写”,还要选择与现有应用匹配的协议、检查 usage,并为实验路由保留回退方案。
截至 2026 年 8 月 21 日,EvoLink 公开的 DeepSeek V4 文档已在三种协议中列出 deepseek-v4-flash-vision-exp。Chat Completions 使用 image_url,Messages 使用来源为 Base64 或 URL 的 image 内容块,Responses 使用 input_image。下面示例遵循这些文档结构;扩大生产流量前,仍应使用生产账户完成代表性请求。
查看 Vision Exp 模型页与实时价格
如果路由还会接收纯文本请求,可参考 Vision Exp vs Flash 对比,将图片证据分配给 Vision Exp,将高吞吐文本流量保留在 Flash。

快速结论:首次图片请求前要确认什么

模型 ID 是 deepseek-v4-flash-vision-exp。EvoLink 记录了三种图片输入结构:Chat Completions 使用 image_url,Messages 使用 image 内容块,Responses 使用 input_image。不同协议的内容块不能混用。
检查项上线前必须达到的结果原因
模型 ID严格发送文档中的 deepseek-v4-flash-vision-exp纯文本 Flash ID 不会处理图片证据
协议目标路由明确记录图片内容文本兼容不能证明多模态兼容
输入方式代表性图片通过 URL 或 Base64 请求成功内容块与网关校验可能不同
Usage响应包含预期的输入与输出用量必须能计算每个合格结果的成本
计费请求正确出现在 EvoLink 用量或账单中返回成功不代表最终计费路径正确
回退有一条经过验证的视觉模型路由-exp 模型可能变化、异常或下线

任何运行时检查未通过,都应继续使用已经验证的视觉模型,只把 Vision Exp 作为该工作负载的评估对象。

图片输入工作流

实际流程是:将一张或多张图片与明确指令放在同一请求中,选择已开放协议,验证结构化结果,并记录 usage 后再逐步增加流量。不要只凭一次未经复核的视觉回答,让浏览器或 Agent 执行不可逆操作。

图片、文档与图表通过多模态 API 路由到三种结构化响应工作流
图片、文档与图表通过多模态 API 路由到三种结构化响应工作流

正式接入前先准备小型评测集:至少包含干净截图、密集界面、扫描页面、小字号图表和一张故意存在歧义的图片。调用模型前,先定义需要抽取的字段或最终决策。

选择协议结构

下面示例匹配当前 EvoLink 文档中的 Vision Exp 内容结构。三种载荷不能混用,端点、必填字段与限制应以对应协议页面为准。

Chat Completions:image_url

应用已经使用 OpenAI 风格 messages 数组时,可以评估 Chat Completions。用户内容数组同时包含文本和 image_url
{
  "model": "deepseek-v4-flash-vision-exp",
  "messages": [
    {
      "role": "user",
      "content": [
        {
          "type": "text",
          "text": "请用 JSON 返回界面中的报错信息和当前 UI 状态。"
        },
        {
          "type": "image_url",
          "image_url": {
            "url": "https://example.com/screenshot.png"
          }
        }
      ]
    }
  ]
}
EvoLink 当前 Chat Completions 文档已经列出 Vision Exp、image_url、URL 与 Base64 示例,以及多图输入。图片内容应放在 user 消息中,并使用精确的 Vision Exp 模型 ID。

Messages:image 内容块

Messages 适合已经使用 Anthropic 风格请求结构的应用。EvoLink 当前 Messages 文档要求顶层必须包含 max_tokens,因此图片示例保留该字段:
{
  "model": "deepseek-v4-flash-vision-exp",
  "max_tokens": 1024,
  "messages": [
    {
      "role": "user",
      "content": [
        {
          "type": "image",
          "source": {
            "type": "url",
            "url": "https://example.com/invoice.png"
          }
        },
        {
          "type": "text",
          "text": "提取发票号、日期、币种、小计、税额与总额。"
        }
      ]
    }
  ]
}
EvoLink 当前 Messages 文档已经列出 Vision Exp 图片块,source.type 可以是 base64url。图片理解必须使用 deepseek-v4-flash-vision-exp:文档提醒,纯文本 Flash 与 Pro 路线可能丢弃实际图片,而不是处理图片内容。

Responses:input_image

图片请求属于更长的 Agent 工作流时,可以使用 Responses。EvoLink 文档结构将 input_textinput_image 放在一起:
{
  "model": "deepseek-v4-flash-vision-exp",
  "input": [
    {
      "role": "user",
      "content": [
        {
          "type": "input_text",
          "text": "总结图表,并列出图中直接观察到的全部标签。"
        },
        {
          "type": "input_image",
          "image_url": "https://example.com/chart.png"
        }
      ]
    }
  ]
}
EvoLink 当前 Responses 文档已经列出 Vision Exp、input_image 与多图输入。流式事件、工具和错误仍需按该路由单独核对;支持图片不等于上游 Files API 的全部行为也由同一路线暴露。

图片 URL、Base64 还是 Files API?

输入方式取决于数据访问、请求大小、复用需求以及 EvoLink 实际开放范围。

方式适合场景生产检查
公网图片 URL公共资源或短时签名资源网关能访问 URL、允许重定向,且 URL 不泄露敏感信息
Base64 data URI随请求直接发送的小型私有图片完整请求未超过文档限制,日志不会保留敏感载荷
Files API需要复用或集中管理的文件EvoLink 明确记录 Vision Exp 的 Files API、文件生命周期与权限

图片较大时,如果网关能够访问,优先使用短时签名 URL;图片较小且不能公开访问时,可以考虑 Base64。EvoLink 文档确认前,不要宣称 Files API 已经可用。

DeepSeek 上游记录支持 JPEG、PNG、GIF 与 WebP,但网关的文件大小、URL、超时和多图限制仍可能更严格。

不重复价格表,如何估算图片成本

DeepSeek 表示每张图片会被转换为最多 384 个输入 Token。这能帮助估算图片输入,但不是完整任务成本。

可以使用以下公式:

完整任务成本 = 图片输入 + 文本输入 + 输出 + 重试 + 额外 Agent/工具轮次

两张图片可以先用 768 个图片输入 Token 作为保守上限,再加上提示词和输出 Token。之后必须与已开放 EvoLink 路由返回的实际 usage 比较。重复的文本前缀可能受益于缓存,但不能默认图片内容采用相同缓存方式。

当前 EvoLink Token 费率请查看 DeepSeek V4 Flash Vision Exp 产品页。本文不维护第二张价格表,避免价格不一致。

自动化之前先验证结果

视觉回答即使语言流畅,也可能存在错误。每类工作负载都要定义验收规则:

工作负载验收指标升级规则
发票抽取必填字段与标准答案精确一致字段缺失或校验失败时转人工
截图 QA页面状态与可见错误文本正确先裁剪重试,再交给人工复核
图表分析观察到的标签与解释明确分开拒绝没有图像依据的数值结论
UI Agent下一步操作正确且没有危险副作用不可逆操作必须二次确认

要跟踪“合格结果率”,而不是只看 HTTP 请求成功率。便宜但反复重试、需要大量人工修改的结果,最终成本可能高于更稳定的回退模型。

常见图片请求失败

现象可能原因处理方式
模型不在允许枚举中模型 ID 拼写错误、缓存过旧或账户无权限核对精确 ID 与账户权限,不要改成纯文本 Flash ID
不支持图片/文档内容当前协议仍然是纯文本换成文档明确支持图片的协议或回退模型
400 内容块无效请求使用了错误协议结构按当前路由匹配 image_urlimageinput_image
无法获取图片URL 私有、已过期、重定向或被拦截使用可访问的签名 URL 或已支持的 Base64
请求过大Base64 或多图超过网关限制缩放、压缩、拆分请求或使用已开放文件路由
429 或超时并发或路由容量不足使用有上限的重试、减少在途请求并回退

不要为 Vision Exp 编造固定 RPM、TPM、文件大小或并发数字。以 EvoLink 路由文档为准,并使用真实生产账户验证异常行为。

生产流量怎么逐步放量

先选择自带人工复核的工作负载,例如截图 QA。模型选择放在配置层,不要把实验 ID 硬编码到整个应用中。

  1. 在目标协议完成一次图片 URL 或 Base64 请求;
  2. 确认响应、usage、计费和错误日志;
  3. 使用固定视觉评测集比较 Vision Exp 与回退模型;
  4. 只分配少量流量,并监控每个合格结果的成本;
  5. 质量、延迟、错误与成本达到阈值后再扩量。

EvoLink 统一 API 可以集中比较路由、用量与账单,让团队不必围绕一个实验模型重写整个接入层。

常见问题

DeepSeek V4 Flash Vision Exp 的准确模型 ID 是什么?

模型 ID 是 deepseek-v4-flash-vision-exp。必须保留 -exp 后缀,它表示上游实验版本。
支持。截至 2026 年 8 月 21 日,EvoLink 已在 Chat Completions、Messages 与 Responses 文档中列出 deepseek-v4-flash-vision-exp 及图片理解能力。请使用所选协议页面对应的精确载荷结构。

可以用纯文本 deepseek-v4-flash ID 发送图片吗?

不可以。EvoLink 文档提醒,纯文本 Flash 路线可能丢弃实际图片,而不是处理图片内容。任务依赖图片证据时,应使用 deepseek-v4-flash-vision-exp 或其他经过验证的视觉模型。

图片 URL 和 Base64 应该怎么选?

较大资源在网关可访问时使用签名 URL;小型私有图片在文档请求大小允许时使用 Base64。两种方式都要保护敏感数据。

支持 Files API 上传吗?

DeepSeek 上游记录了 Files API,但这不能证明 EvoLink 暴露了同一能力。只有 EvoLink 路由文档明确确认后才能使用。

一张图片多少钱?

DeepSeek 表示每张图片最多使用 384 个输入 Token。再加上文本输入、输出、重试和额外 Agent 轮次,并套用产品页展示的实时价格。

支持哪些图片格式?

DeepSeek 上游记录支持 JPEG、PNG、GIF 与 WebP。生产接入前,还要确认 EvoLink 的文件大小、URL 与多图限制。

生产放量前要测试什么?

测试常规与困难图片、结构化输出、小字号、缺失字段、延迟、重试、usage、计费和回退。只有每个合格结果的成本达到阈值后才扩量。

来源与下一步

持续让本文与三种 EvoLink 协议文档同步。实验模型 ID、图片字段或路由限制变化时,应重新运行示例并核对计费结果。

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。