
DeepSeek V4 Flash Vision Exp API 怎么用:图片输入教程
deepseek-v4-flash-vision-exp,同一次请求可以包含文本与图片。EvoLink 现已在 Chat Completions、Messages 与 Responses 三种协议中记录该模型。对 EvoLink 用户来说,接入重点不只是“图片字段怎么写”,还要选择与现有应用匹配的协议、检查 usage,并为实验路由保留回退方案。deepseek-v4-flash-vision-exp。Chat Completions 使用 image_url,Messages 使用来源为 Base64 或 URL 的 image 内容块,Responses 使用 input_image。下面示例遵循这些文档结构;扩大生产流量前,仍应使用生产账户完成代表性请求。快速结论:首次图片请求前要确认什么
deepseek-v4-flash-vision-exp。EvoLink 记录了三种图片输入结构:Chat Completions 使用 image_url,Messages 使用 image 内容块,Responses 使用 input_image。不同协议的内容块不能混用。| 检查项 | 上线前必须达到的结果 | 原因 |
|---|---|---|
| 模型 ID | 严格发送文档中的 deepseek-v4-flash-vision-exp | 纯文本 Flash ID 不会处理图片证据 |
| 协议 | 目标路由明确记录图片内容 | 文本兼容不能证明多模态兼容 |
| 输入方式 | 代表性图片通过 URL 或 Base64 请求成功 | 内容块与网关校验可能不同 |
| Usage | 响应包含预期的输入与输出用量 | 必须能计算每个合格结果的成本 |
| 计费 | 请求正确出现在 EvoLink 用量或账单中 | 返回成功不代表最终计费路径正确 |
| 回退 | 有一条经过验证的视觉模型路由 | -exp 模型可能变化、异常或下线 |
任何运行时检查未通过,都应继续使用已经验证的视觉模型,只把 Vision Exp 作为该工作负载的评估对象。
图片输入工作流
实际流程是:将一张或多张图片与明确指令放在同一请求中,选择已开放协议,验证结构化结果,并记录 usage 后再逐步增加流量。不要只凭一次未经复核的视觉回答,让浏览器或 Agent 执行不可逆操作。

正式接入前先准备小型评测集:至少包含干净截图、密集界面、扫描页面、小字号图表和一张故意存在歧义的图片。调用模型前,先定义需要抽取的字段或最终决策。
选择协议结构
Chat Completions:image_url
messages 数组时,可以评估 Chat Completions。用户内容数组同时包含文本和 image_url:{
"model": "deepseek-v4-flash-vision-exp",
"messages": [
{
"role": "user",
"content": [
{
"type": "text",
"text": "请用 JSON 返回界面中的报错信息和当前 UI 状态。"
},
{
"type": "image_url",
"image_url": {
"url": "https://example.com/screenshot.png"
}
}
]
}
]
}image_url、URL 与 Base64 示例,以及多图输入。图片内容应放在 user 消息中,并使用精确的 Vision Exp 模型 ID。Messages:image 内容块
max_tokens,因此图片示例保留该字段:{
"model": "deepseek-v4-flash-vision-exp",
"max_tokens": 1024,
"messages": [
{
"role": "user",
"content": [
{
"type": "image",
"source": {
"type": "url",
"url": "https://example.com/invoice.png"
}
},
{
"type": "text",
"text": "提取发票号、日期、币种、小计、税额与总额。"
}
]
}
]
}source.type 可以是 base64 或 url。图片理解必须使用 deepseek-v4-flash-vision-exp:文档提醒,纯文本 Flash 与 Pro 路线可能丢弃实际图片,而不是处理图片内容。Responses:input_image
input_text 与 input_image 放在一起:{
"model": "deepseek-v4-flash-vision-exp",
"input": [
{
"role": "user",
"content": [
{
"type": "input_text",
"text": "总结图表,并列出图中直接观察到的全部标签。"
},
{
"type": "input_image",
"image_url": "https://example.com/chart.png"
}
]
}
]
}input_image 与多图输入。流式事件、工具和错误仍需按该路由单独核对;支持图片不等于上游 Files API 的全部行为也由同一路线暴露。图片 URL、Base64 还是 Files API?
输入方式取决于数据访问、请求大小、复用需求以及 EvoLink 实际开放范围。
| 方式 | 适合场景 | 生产检查 |
|---|---|---|
| 公网图片 URL | 公共资源或短时签名资源 | 网关能访问 URL、允许重定向,且 URL 不泄露敏感信息 |
| Base64 data URI | 随请求直接发送的小型私有图片 | 完整请求未超过文档限制,日志不会保留敏感载荷 |
| Files API | 需要复用或集中管理的文件 | EvoLink 明确记录 Vision Exp 的 Files API、文件生命周期与权限 |
图片较大时,如果网关能够访问,优先使用短时签名 URL;图片较小且不能公开访问时,可以考虑 Base64。EvoLink 文档确认前,不要宣称 Files API 已经可用。
DeepSeek 上游记录支持 JPEG、PNG、GIF 与 WebP,但网关的文件大小、URL、超时和多图限制仍可能更严格。
不重复价格表,如何估算图片成本
可以使用以下公式:
完整任务成本 = 图片输入 + 文本输入 + 输出 + 重试 + 额外 Agent/工具轮次两张图片可以先用 768 个图片输入 Token 作为保守上限,再加上提示词和输出 Token。之后必须与已开放 EvoLink 路由返回的实际 usage 比较。重复的文本前缀可能受益于缓存,但不能默认图片内容采用相同缓存方式。
自动化之前先验证结果
视觉回答即使语言流畅,也可能存在错误。每类工作负载都要定义验收规则:
| 工作负载 | 验收指标 | 升级规则 |
|---|---|---|
| 发票抽取 | 必填字段与标准答案精确一致 | 字段缺失或校验失败时转人工 |
| 截图 QA | 页面状态与可见错误文本正确 | 先裁剪重试,再交给人工复核 |
| 图表分析 | 观察到的标签与解释明确分开 | 拒绝没有图像依据的数值结论 |
| UI Agent | 下一步操作正确且没有危险副作用 | 不可逆操作必须二次确认 |
要跟踪“合格结果率”,而不是只看 HTTP 请求成功率。便宜但反复重试、需要大量人工修改的结果,最终成本可能高于更稳定的回退模型。
常见图片请求失败
| 现象 | 可能原因 | 处理方式 |
|---|---|---|
| 模型不在允许枚举中 | 模型 ID 拼写错误、缓存过旧或账户无权限 | 核对精确 ID 与账户权限,不要改成纯文本 Flash ID |
| 不支持图片/文档内容 | 当前协议仍然是纯文本 | 换成文档明确支持图片的协议或回退模型 |
| 400 内容块无效 | 请求使用了错误协议结构 | 按当前路由匹配 image_url、image 或 input_image |
| 无法获取图片 | URL 私有、已过期、重定向或被拦截 | 使用可访问的签名 URL 或已支持的 Base64 |
| 请求过大 | Base64 或多图超过网关限制 | 缩放、压缩、拆分请求或使用已开放文件路由 |
| 429 或超时 | 并发或路由容量不足 | 使用有上限的重试、减少在途请求并回退 |
不要为 Vision Exp 编造固定 RPM、TPM、文件大小或并发数字。以 EvoLink 路由文档为准,并使用真实生产账户验证异常行为。
生产流量怎么逐步放量
先选择自带人工复核的工作负载,例如截图 QA。模型选择放在配置层,不要把实验 ID 硬编码到整个应用中。
- 在目标协议完成一次图片 URL 或 Base64 请求;
- 确认响应、usage、计费和错误日志;
- 使用固定视觉评测集比较 Vision Exp 与回退模型;
- 只分配少量流量,并监控每个合格结果的成本;
- 质量、延迟、错误与成本达到阈值后再扩量。
EvoLink 统一 API 可以集中比较路由、用量与账单,让团队不必围绕一个实验模型重写整个接入层。
常见问题
DeepSeek V4 Flash Vision Exp 的准确模型 ID 是什么?
deepseek-v4-flash-vision-exp。必须保留 -exp 后缀,它表示上游实验版本。EvoLink 已经支持 DeepSeek V4 Flash Vision Exp 吗?
deepseek-v4-flash-vision-exp 及图片理解能力。请使用所选协议页面对应的精确载荷结构。可以用纯文本 deepseek-v4-flash ID 发送图片吗?
deepseek-v4-flash-vision-exp 或其他经过验证的视觉模型。图片 URL 和 Base64 应该怎么选?
较大资源在网关可访问时使用签名 URL;小型私有图片在文档请求大小允许时使用 Base64。两种方式都要保护敏感数据。
支持 Files API 上传吗?
DeepSeek 上游记录了 Files API,但这不能证明 EvoLink 暴露了同一能力。只有 EvoLink 路由文档明确确认后才能使用。
一张图片多少钱?
DeepSeek 表示每张图片最多使用 384 个输入 Token。再加上文本输入、输出、重试和额外 Agent 轮次,并套用产品页展示的实时价格。
支持哪些图片格式?
DeepSeek 上游记录支持 JPEG、PNG、GIF 与 WebP。生产接入前,还要确认 EvoLink 的文件大小、URL 与多图限制。
生产放量前要测试什么?
测试常规与困难图片、结构化输出、小字号、缺失字段、延迟、重试、usage、计费和回退。只有每个合格结果的成本达到阈值后才扩量。
来源与下一步
- EvoLink DeepSeek V4 Chat Completions 文档
- EvoLink DeepSeek V4 Messages 文档
- EvoLink DeepSeek V4 Responses 文档
- DeepSeek Vision Guide
- DeepSeek V4 Flash Vision Exp 发布说明
- DeepSeek API 更新日志
持续让本文与三种 EvoLink 协议文档同步。实验模型 ID、图片字段或路由限制变化时,应重新运行示例并核对计费结果。


