GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验

Claude Haiku 5.5 API

通过 EvoLink 统一对话 API 接入 Anthropic 的 Claude Haiku 5.5(也常被搜索为 Haiku 5.5)。集成前可先测试工具调用、结构化输出、提示缓存。

Anthropic文本生成可用
起价 $0.096 / 百万输入 Token$0.100 官方价-4%
API 文档
自适应思考Effort 控制工具调用结构化输出提示词缓存Chat + Messages API
生产路由已上线
上下文
1M 上下文 · 最大输出 128K
适用场景
高并发分类与信息抽取、请求路由、子 Agent 任务
可输入
文本 + 图像
输出形态
文本 · JSON(结构化输出)· 工具调用

选择 Claude Haiku 5.5

Anthropic 最新的 Haiku 模型,面向大批量分类、信息抽取、路由和子 Agent 工作。提示词长度决定使用两档费率中的哪一档;输入、缓存写入、缓存读取、输出和联网搜索工具五个计费维度各自独立计量。

Claude Haiku 5.5

Anthropic 最新的 Haiku 模型

已选择
模型 ID
claude-haiku-5-5
适合

工单与意图分类、把字段抽成 JSON、请求路由,以及在更大模型之下运行的子 Agent 步骤——这些大批量、延迟敏感的工作应该用 Haiku 价位的路由完成,而不必升级到 Sonnet。

≤ 100K
输入
$0.096 / 1M-4%
6.5 cr / 1M$0.100官方价
缓存写入
$0.120 / 1M-5%
8.1 cr / 1M$0.125官方价
缓存读取
$0.011 / 1M
0.7 cr / 1M
输出
$0.475 / 1M-5%
32.3 cr / 1M$0.500官方价
> 100K
输入
$0.478 / 1M-4%
32.5 cr / 1M$0.500官方价
缓存写入
$0.596 / 1M-5%
40.5 cr / 1M$0.625官方价
缓存读取
$0.052 / 1M
3.5 cr / 1M
输出
$2.375 / 1M-5%
161.5 cr / 1M$2.500官方价

所有费率按每百万 Token 计,同时显示美元与 Credits,以你账户当前的价格为准。 提示 Token 超过 100K 后进入长上下文档位,所有 Token 角色按 ×5 计费。

Claude Haiku 5.5 价格

集成前先估算一次 Claude Haiku 5.5 请求的费用。计算器按你账户的当前费率计算,官方价格仅作对照。

请求费用计算器

输入一次请求的 Token 组合和成功的工具调用次数。

单次请求预估

Claude Haiku 5.5
短上下文费率
USD$0.0003
Credits0.0164

官方价预估 $0.0003 · 省 $0.0001(4%)

输入 Token0.0065 cr
缓存写入 Token0 cr
缓存读取 Token0.0002 cr
输出 Token0.0097 cr

最低计费:每次请求 0.01 Credits。 提示 Token 超过 100K 后进入长上下文档位,所有 Token 角色按 ×5 计费。

预算指南

按当前 Token 组合估算可发起的请求数。
充值 Credits
$10
约 39634 次请求

快速测试

$50
约 207317 次请求

日常开发

$100
约 414634 次请求

生产评估

服务端工具费率

联网搜索取决于所选路由,部分路由不支持。发送 web_search 前请确认可用性;下方费率仅适用于支持该工具的路由。
  • 网页搜索$0.010/ 次0.68 cr / 次

Claude Haiku 5.5 API

通过 EvoLink 统一网关接入 Claude Haiku 5.5 API。通过 EvoLink 统一 API 运行大批量分类、信息抽取、路由和子 Agent 调用,支持 100 万 Token 上下文与最高 12.8 万 Token 输出。提示词不超过 10 万 Token 时,每百万输入 Token $0.096、输出 Token $0.475,多个模型共用一个 API Key;首调前请核对 thinking 与 max_tokens 设置。

Claude Haiku 5.5 在 EvoLink 上以模型 ID claude-haiku-5-5 提供,支持 Chat Completions · Anthropic Messages,和其他模型共用同一把 API 密钥与余额。它提供 1M 上下文窗口,最大输出 128K Token,并支持工具调用、结构化输出、提示缓存。

Claude Haiku 5.5

Claude Haiku 5.5 规格与能力

数字取自 EvoLink 路由配置;能力以 API 当前实际提供为准。

上下文窗口
1M Token
最大输出
128K Token
输入
文本 + 图像
输出
文本 · JSON(结构化输出)· 工具调用
推理
思考模式(默认开启)
工具调用
函数调用,支持多步工具序列
提示缓存
缓存写入 + 缓存读取两种费率
长上下文档位
提示 Token 超过 100K 后按 ×5 计费
协议
Chat Completions · Anthropic Messages
模型 ID
claude-haiku-5-5

什么时候该把 Claude Haiku 5.5 设为默认路由

Haiku 5.5 是 Anthropic 面向大批量、延迟敏感型工作的快速、低成本 Claude。按「完成一个任务花多少」来选路由,先调 effort,再动提示词。

大批量分类、路由与信息抽取

给工单打标签、识别意图、做请求路由,把文档里的字段抽成 JSON。提示词尽量精简,并用结构化输出或参数取枚举值的工具约束答案,这样回复够短,请求也留在基础费率档。

给更大的模型当子 Agent

由 Opus 或 Sonnet 模型规划任务,搜索、读文件等范围较窄的步骤交给 Haiku 5.5。Anthropic 称 Haiku 5.5 在遵循指令和充当子 Agent 方面明显优于 Haiku 4.5。衡量标准应是完成的步骤,而不是单条回复。

低延迟对话与客服助手

用简短的系统提示词回答常规问题、调用少量工具。对话和简短的工具任务从 low effort 开始;如果助手要在长对话里始终遵守严格规则,再把档位调高。

什么时候该选其他路由

多文件编程、长周期 Agent 和分析级写作交给 Claude Sonnet 5.5,再往上是 Claude Opus 5.5。依赖采样参数、思考预算或 assistant 预填充、还没来得及重测的工作负载,先留在 Claude Haiku 4.5。

两种方式使用 Claude Haiku 5.5:EvoLink API 或 Agent

产品后端与批量任务走 EvoLink API;编码与分析类工作可直接在 Codex、Claude、Gemini 里调用 Claude Haiku 5.5。两条路径共用同一把 EvoLink API 密钥、余额、模型 ID 与请求记录。

方式一

用 EvoLink API 接入

适合:产品后端、批量任务、自动化流水线

向 EvoLink 发送 OpenAI 兼容的 Chat Completions(或 Anthropic Messages)请求,自行控制模型 ID、系统提示、输出预算、工具与结构化输出。

  1. 1在控制台创建 EvoLink API 密钥
  2. 2把 OpenAI 或 Anthropic SDK 的 base URL 指向 EvoLink,并选择上方显示的模型 ID
  3. 3先发一条有代表性的请求,从 usage 字段读取输入、缓存与输出 token
  4. 4按任务设置 max_tokens 与重试;多轮时保留 tool-call ID 与工具结果
方式二

用 Agent 调用

适合:在 Codex、Claude、Gemini 里做编码、评审与分析

把任务、要带入的材料和验收标准交给 Agent,由它组装请求、通过 EvoLink 调用 Claude Haiku 5.5,并把回答连同 token 用量一起返回。

  1. 1在本地环境变量里配置 EVOLINK_API_KEY,不要写进代码或提示词
  2. 2描述任务、要带入的材料和期望的输出格式
  3. 3让 Agent 通过 EvoLink 调用 Claude Haiku 5.5,并在发送前先展示请求
  4. 4让 Agent 汇报回答、token 用量和任何错误信息

Claude Haiku 5.5 API 代码示例与错误处理

这个示例是最短可运行的请求:一条 OpenAI 兼容的 Chat Completions 调用,带系统提示、用户消息和输出预算。完整参数与响应说明见 API 标签页。

查看完整 API 文档
cURL
curl -X POST https://direct.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "claude-haiku-5-5",
    "messages": [
      { "role": "system", "content": "Classify each support ticket as billing, bug, or how-to. Reply with one word." },
      { "role": "user", "content": "I was charged twice for my subscription." }
    ],
    "max_tokens": 4096
  }'

# Thinking is on by default and counts toward max_tokens, so leave room for
# it. This Chat Completions request returns choices[0].message and usage
# (prompt_tokens, completion_tokens, and cache read / write tokens when
# caching applies).
# For the Anthropic Messages format at /v1/messages, follow the linked
# Claude reference; its request fields and response format are different.

请求无效或参数不支持

对照 API 文档检查模型 ID、messages 数组和参数范围,去掉该路由不支持的字段。

鉴权或余额问题

检查 Authorization bearer token,并在控制台确认可用余额。

超出上下文长度

提示词 token 超过了 Claude Haiku 5.5 的上下文窗口。裁剪或只检索相关材料,并复用缓存前缀。

触发限流(429)

退避并带抖动重试;用批处理或队列代替并发突发。

内容或工具调用被拒

重试前检查敏感内容、格式错误的 tool-call 参数和 JSON schema 不匹配。

Claude Haiku 5.5 API 接入前检查

继续用同一个 EvoLink 客户端和 API Key。多数请求原样可用,下面四步覆盖与 Claude Haiku 4.5 行为不同的设置。

01

更换模型 ID

把客户端指向 EvoLink,API Key 不变,选择 claude-haiku-5-5。OpenAI 兼容的 Chat Completions 端点和 Anthropic Messages 端点都接受这个 ID。

改动很小
02

为思考留出空间

思考默认开启,并计入 max_tokens,所以按「只回一个词」设的上限,可能在写出任何文本之前就被用完。请调高 max_tokens 或调低 effort;响应可能以 thinking 块开头,请按块类型读取内容。

行为变化
03

去掉 Haiku 4.5 专属的设置

Anthropic 会拒绝 Haiku 5.5 上的思考预算、非默认的采样参数值和 assistant 预填充。EvoLink 会把思考预算转成带 effort 档位的自适应思考,并去掉 temperature、top_p 和 top_k;预填充请改用结构化输出或系统提示词里的指令。

破坏性变更
04

盯住 10 万 Token 提示词这条线

输入、缓存写入和缓存读取加在一起决定费率档。裁剪历史、减少检索量或拆分任务,让大批量请求的提示词保持在 10 万 Token 及以内;确实需要更多上下文的请求,按高费率档做预算。

成本控制

为反复出现的上下文做提示词缓存

缓存稳定的系统提示词、工具定义和参考文档,在多次请求之间复用。写入和读取分开计费。Anthropic 相比 Haiku 4.5 降低了可缓存提示词的最小长度,更短的提示词现在也能被缓存。缓存的 Token 仍计入决定费率档的提示词长度。

100 万 Token 上下文,费率档在 10 万 Token 处切换

该路由记录的上下文窗口为 100 万 Token,最多输出 12.8 万 Token。提示词(输入、缓存写入和缓存读取合计)不超过 10 万 Token 时按基础费率计费;超过 10 万 Token 后,整个请求(含输出)按 5× 计费。思考会计入 max_tokens,要为它留出空间。

思考默认开启——用 effort 来控制

请求没有设置 thinking 时会运行自适应思考,不指定档位则按 medium effort。思考按输出计费,除非你要求返回摘要,否则不返回思考文本。effort 为 high 及以下时仍接受 thinking: disabled;Anthropic 建议改为调低 effort。

不再适用的 Haiku 4.5 参数

Anthropic 会拒绝 Haiku 5.5 上的思考预算、非默认的采样参数值和 assistant 预填充。EvoLink 为了兼容,会把思考预算转成带 effort 档位的自适应思考,并去掉 temperature、top_p 和 top_k。强制指定工具可以使用,但此时响应会直接以工具调用开头,不带思考。

Claude Haiku 5.5:两档费率,五个计费维度

Claude Haiku 5.5 不是一个混合单价。提示词长度决定用哪一档费率,各维度独立计量,思考按输出计费。

输入与输出 Token,按提示词长度分档

提示词不超过 10 万 Token 时:EvoLink 上每百万输入 Token $0.096、每百万输出 Token $0.475,Anthropic 官方为 $0.100 与 $0.500。提示词超过 10 万 Token 后,整个请求改按高费率档计费:输入 $0.478、输出 $2.375。即使不返回思考文本,思考也按输出计费。

5 分钟缓存写入与缓存读取

把前缀缓存 5 分钟,每百万 Token $0.120;复用它每百万 Token $0.011。缓存的 Token 仍计入决定费率档的提示词长度。EvoLink 的价格会向上取整到一个完整的计费单位,所以缓存读取价可能略高于官方标价;估算节省时请以页面显示的价格为准。

联网搜索工具

在支持 web_search 的路由上,每次搜索 $0.010,不受高费率档的倍率影响。搜索结果产生的 Token 按普通输入计费。接入前请确认路由支持情况;有计费配置不代表所有路由都支持该工具。

先测工作负载,再比较 Claude 路由

EvoLink

先确认在你打算使用的 effort 档位下,Haiku 5.5 能否在自己的任务上守住质量,再比较价格、上下文、缓存和适用场景,选定生产路由。

Claude Haiku 5.5
输入 / 输出$0.096 / $0.475
上下文1M
缓存读 + 写
适用场景工单与意图分类、把字段抽成 JSON、请求路由,以及在更大模型之下运行的子 Agent 步骤——这些大批量、延迟敏感的工作应该用 Haiku 价位的路由完成,而不必升级到 Sonnet。
Claude Haiku 4.5
输入 / 输出$0.9 / $4.5
上下文200K
缓存读 + 写
适用场景上一代 Haiku,不论提示词长短都按同一费率计费;仍需要采样参数或思考预算的工作负载可以先留在这里。
Claude Sonnet 5.5
输入 / 输出$1.9 / $9.5
上下文1M
缓存读 + 写
适用场景Anthropic 最新的 Sonnet;多文件编程、重度使用工具的 Agent,以及 Haiku 5.5 完成不了的工作,升级到这一档。

Claude 模型家族

同一把 API 密钥、同一份余额,换档位不用改接入。

查看全部 Claude 模型
Claude Sonnet 5.5

Claude Sonnet 5.5

Anthropic 最新的 Sonnet;当 Haiku 5.5 完成不了多文件编程或重度使用工具的 Agent 工作时,升级到这一档。

查看模型
Claude Opus 5.5

Claude Opus 5.5

Anthropic 最新的 Opus,用于最难的长周期编程、知识工作和视觉分析。

查看模型
Claude Fable 5.1

Claude Fable 5.1

Anthropic 能力最强的模型,Opus 之上的 Fable 档,适合最长、最吃力的 Agent 工作负载。

查看模型

Claude Haiku 5.5 之外的其他文本模型

GPT-5.6

GPT-5.6

OpenAI 的分档前沿模型家族,可按能力、延迟和成本做路由。

查看模型
Grok 4.5

Grok 4.5

xAI 的推理与工具调用路由,50 万 Token 上下文,带服务端搜索工具。

查看模型
Kimi K3

Kimi K3

面向代码库级编程和多文档工作的长上下文推理模型。

查看模型
Gemini 3.6 Flash

Gemini 3.6 Flash

Google 的快速、低成本路由,适合高并发生产流量。

查看模型

Claude Haiku 5.5 延伸阅读

Claude API 价格指南

Claude API 价格指南

Claude 全系列的输入、输出、缓存写入、缓存读取和工具费用是怎么累加的。

阅读指南
Claude Sonnet 5.5 对比 Opus 5.5:怎么选

Claude Sonnet 5.5 对比 Opus 5.5:怎么选

由 Haiku 5.5 执行子 Agent 步骤时,负责规划的模型该怎么选。

阅读指南

Claude Haiku 5.5 API 常见问题

Claude Haiku 5.5 是什么模型?

本页介绍 Claude Haiku 5.5,在 EvoLink 上使用模型 ID "claude-haiku-5-5"。Haiku 是模型系列名称,请在请求中指定完整版本,不要将 "haiku" 当作模型 ID。Claude Haiku 4.5 有单独的模型页与价格。

Claude Haiku 5.5 API 应该使用哪个模型 ID?

发送 model "claude-haiku-5-5"。同一个 ID 同时适用于 OpenAI 兼容的 Chat Completions 端点和 Anthropic Messages 端点。

Claude Haiku 5.5 API 在 EvoLink 上多少钱?

提示词不超过 10 万 Token 时,EvoLink 价格为每百万输入 Token $0.096、每百万输出 Token $0.475;Anthropic 官方为 $0.100 与 $0.500。提示词超过 10 万 Token 后,价格为 $0.478 与 $2.375。

10 万 Token 这条费率分界线是怎么算的?

提示词长度是输入 Token 加上缓存写入和缓存读取的 Token。不超过 10 万时按基础费率计费。超过 10 万后,整个请求都按 5× 计费——输入、输出、缓存写入和缓存读取全部在内,而不只是超出分界线的那部分 Token。联网搜索调用不乘这个倍数。

Claude Haiku 5.5 比 Claude Haiku 4.5 便宜吗?

按 Anthropic 官方标价,提示词不超过 10 万 Token 时,Haiku 5.5 是 Haiku 4.5 价格的十分之一;超过后是它的一半。Haiku 5.5 使用更新的分词器,同样的文本会多算约 30% 的 Token,而且思考默认开启,所以请用自己的工作负载比较完成一个任务的成本,而不是只看 Token 单价。

Claude Haiku 5.5 的提示词缓存怎么计费?

在基础费率档下,EvoLink 上 5 分钟缓存写入每百万 Token $0.120,缓存读取 $0.011;Anthropic 官方为 $0.125 与 $0.010。两者分开计量,提示词超过 10 万 Token 后都按 5× 计费。估算时请使用页面显示的价格(含取整)。

Claude Haiku 5.5 的联网搜索工具怎么计费?

在支持 web_search 的路由上,每次搜索 $0.010。搜索结果产生的 Token 按普通输入计费。接入前请确认路由支持情况;有计费配置不代表所有路由都支持该工具。

Claude Haiku 5.5 可以关闭思考吗?

可以,前提是 effort 为 high 及以下:发送 thinking: disabled 即可。在 xhigh 或 max 下 Anthropic 会拒绝它,这时请调低 effort 档位或使用自适应思考。Anthropic 建议调低 effort 而不是关闭思考,因为在 low effort 下,模型遇到简单请求可以跳过思考。

Claude Haiku 5.5 应该用哪个 effort 档位?

默认是 medium。Anthropic 建议:对话、简短的工具任务和简单的大批量请求用 low;包括 Agent 编程在内的大多数工作用 medium;知识工作和需要严格遵循指令的场景用 high。在定下 xhigh 或 max 之前,先和 Claude Sonnet 5.5 做个对比。

从 Claude Haiku 4.5 迁移过来要改什么?

更换模型 ID,把思考预算换成自适应思考加 effort 档位,去掉 temperature、top_p 和 top_k,并替换 assistant 预填充。思考默认开启,所以要按块类型读取内容,并重新检查偏小的 max_tokens 取值。同样的文本,分词器会算出更多 Token;上下文扩大到 100 万 Token,最大输出扩大到 12.8 万;在 Claude API 上 computer use 需要使用 computer toolset。

为什么一个很短的分类请求会停在 max_tokens,却没有任何文本?

思考会计入 max_tokens。按「只回一个词」设的上限可能被思考用完,于是响应在 thinking 块之后、任何文本之前就结束了。请调高 max_tokens 为思考留出空间,或者调低 effort 档位。

Claude Haiku 5.5 拒绝请求时,响应是什么样的?

安全分类器可能拒绝请求。这时响应仍是一次正常的成功响应,stop_reason 为 "refusal" 并带有类别,所以读取内容前请先检查 stop_reason。Anthropic 不会把被拒绝的 Haiku 5.5 请求改由其他模型重新处理;请在客户端处理拒绝,并换一个提示词再试。

Claude Haiku 5.5 支持哪些协议和 SDK?

用同一个 EvoLink API Key,调用 OpenAI 兼容的 Chat Completions 端点或 Anthropic Messages 端点都可以。Claude Code 等 Anthropic 原生客户端,把 base URL 指向 EvoLink 即可使用。

Claude Code 订阅的用量限制会影响 EvoLink 上的 Claude Haiku 5.5 API 吗?

Claude 订阅额度与 EvoLink API 计费相互独立。通过 EvoLink 的请求按页面价格消耗 EvoLink 余额,仍受账户和路由限额约束。请在兼容客户端中配置 EvoLink API Key 与文档指定的端点。

Claude Haiku 5.5 的上下文窗口和最大输出是多少?

EvoLink 路由记录的上下文窗口为 100 万 Token,单次响应最多输出 12.8 万 Token。思考会计入 max_tokens,提示词超过 10 万 Token 时按高费率档计费。

生产环境应该怎样评估 Claude Haiku 5.5?

跟踪一次通过率、有效的结构化输出、重试次数、每个任务的模型请求次数、在所选 effort 下的输出 Token、缓存命中率、提示词超过 10 万 Token 的请求占比、拿到可用结果的耗时和人工修正量——而不是只看 Token 单价。