GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验
Claude Opus 5.5 与 5 对比封面:相连的陶土色与炭灰色路径
对比

Claude Opus 5.5 vs Claude Opus 5:值得升级吗

EvoLink 团队
EvoLink 团队
产品团队
2026年9月22日
20 分钟阅读
一句话结论:在长时间运行的 Agent 编程、大文档分析和图表密集的视觉任务上试点 Claude Opus 5.5,在配对重放给出结论之前,把 Claude Opus 5 留作回退路由。按 Anthropic 标价,Opus 5.5 每 token 便宜 20%,缓存读取便宜 60%,Anthropic 还说它完成任务消耗的 token 更少。但它不是直接替换:四种在 Opus 5 上正常的请求写法在 Opus 5.5 上会返回 400,默认 effort 从 high 降到 medium,而且同一档位下模型每轮想得更多。
这篇指南写给已经把 Opus 5 放进生产环境的团队。发布事实和“Opus 5.2”传闻的结局见 Claude Opus 5.5 正式发布。EvoLink 的实时价格、模型 ID 和接入参数在 Claude Opus 5.5 模型页与 Claude Opus 5 模型页。下文的价格都是 Anthropic 公布的标价,只用于把两个模型放在同一口径下比较。

一眼看懂的决策

如果你的情况是建议原因
新工作负载,还没有 Opus 基线直接从 Opus 5.5 开始Anthropic 推荐的默认,标价更低,限制相同
Opus 5 已在生产,思考已开启,tool_choice: auto在灰度后面试点 5.5显式设置 effort 后代码通常可以沿用;仍要逐项核对下文五项风险(思考设置、工具选择、进度文字、思考块回退、computer use 版本)
Opus 5 已在生产,但用了 thinking: disabled 或强制工具调用先修请求,再试点这两种写法在 5.5 上都返回 400
缓存重、稳定前缀大的 Agent优先试点5.5 的缓存读取便宜 60%
回退链会在对话中途从 Opus 降到 Sonnet 或 Haiku重测回退路径只有 Fable 5.1 和 Mythos 5.1 能读 Opus 5.5 的思考块
流式 UI 会展示工具调用之间的文字上线前先处理 thinking.display那段文字现在装在思考块里,默认为空
延迟敏感,之前为了速度关掉了思考用 5.5 的 low effort 对比 Opus 5 的关思考基线思考关不掉,effort 是唯一杠杆

这张表里没有无条件的赢家。当你的工作负载正是 Anthropic 优化的方向、请求形态又已经兼容时,升级是划算的;不是的话,先花的是工程时间。

Anthropic 改了什么

维度Claude Opus 5Claude Opus 5.5文档来源
发布2026 年 7 月 24 日2026 年 9 月 22 日发布说明
模型 IDclaude-opus-5claude-opus-5-5模型总览
输入 / 输出$5 / $25 每 MTok$4 / $20 每 MTok定价
缓存写入 5 分钟 / 1 小时$6.25 / $10$5 / $8定价
缓存读取$0.50(输入价的 10%)$0.20(输入价的 5%)定价
Batch$2.50 / $12.50$2 / $10定价
Fast mode(仅 Claude API)$10 / $50$8 / $40定价
上下文 / 最大输出1M / 128K1M / 128K模型总览
思考默认开启;effort high 及以下允许 disabled始终开启;disabled 与 budget_tokens 返回 400What's new
默认 efforthighmedium模型总览
强制工具调用(any、tool)支持返回 400What's new
工具调用之间的文字text 块进度更新型 thinking 块,默认展示为空What's new
思考块可读性Opus 5.5、Fable 5.1、Mythos 5.1 可读仅 Fable 5.1 与 Mythos 5.1 可读What's new
Claude API / Google Cloud 上的 computer use工具集或 computer_20251124仅工具集What's new
安全类别cybercyber、bio、reasoning_extractionWhat's new
知识截止更早2026 年 6 月模型总览
退役下限不早于 2027 年 7 月 24 日不早于 2027 年 9 月 22 日模型总览

表里每一项都是可以核验的合同变化。Anthropic 的能力表述是另一类:它报告 FrontierCode 领先、“大多数工作”达到 Claude Fable 5.1 水平、输出快 30% 以上、运行成本比 Opus 5 低 40%。这些是关于 Anthropic 自己任务组合的主张,把它们当作你评测要验证的假设。

同一口径的成本:20%、60% 还是 40%?

流传着三个不同的数字,它们量的是不同的东西。

  • 20% 是输入和输出的标价差。它作用于每一个 token,在任何行为差异之前。
  • 60% 是缓存读取的标价差。它只作用于输入中命中缓存的那部分。
  • 40% 是 Anthropic 对自己工作负载总运行成本的估算。它把单价下调和“每个完成任务消耗更少 token”捆在一起,所以取决于你的任务在新模型上怎么表现。

下表把标价套到三种固定 token 组合上,按每 1,000 个任务计。这是价格计算,不是质量调整后的成本。

工作负载(每任务)Opus 5Opus 5.5变化
A. 单次调用、无缓存:20K 输入,4K 输出$200.00$160.00-20%
B. 缓存重的 Agent:60K 缓存读取,10K 新输入,5K 缓存写入,6K 输出$261.25$197.00-25%
C. 与 A 相同,但 5.5 在同一 effort 下多输出 25% token$200.00$180.00-10%
C 是要盯住的那一行。Anthropic 的文档说,在相同 effort 档位下,Opus 5.5 每一轮倾向于比 Opus 5 想得更多,在 xhigh 和 max 上尤其明显,而思考按输出计费。在 A 的组合下,Opus 5.5 的输出 token 最多可以比 Opus 5 多 50%,每任务价格才会打平。会不会真的多出来,取决于你选的 effort 档位,以及模型是否用更少的轮次达到验收结果,后者正是 Anthropic 40% 数字的来源。
唯一能给升级下结论的比较是每个成功任务的成本:评测组的总花费(含失败、重试和工具费)除以通过验收的任务数,人工修复时间单独记录。放在下一节的 effort 扫描之后做,不要在之前。

兼容性风险,按出问题的先后顺序

1. 现在会失败的请求

范围说明:下文的 400 是 Anthropic 原生 API 的行为。在 EvoLink 上,网关会把旧的 thinking: disabled 和 budget_tokens 设置兼容转换为自适应思考而不是拒绝,强制工具选择则在 Chat Completions 与 Messages 两个端点上都会被拒绝;网关行为以 Claude Opus 5.5 模型页为准。
在请求构造代码里搜三种写法。thinking: {"type": "disabled"} 和 thinking: {"type": "enabled", "budget_tokens": N} 都返回 400 invalid_request_error。tool_choice: {"type": "any"} 和 {"type": "tool", "name": ...} 返回 400,token 计数端点也一样。在 Claude API 和 Google Cloud 上,computer_20251124 工具条目返回 400,改为声明 computer_toolset_20260801。
替换是机械的。删掉 thinking 字段,或者传等价的 thinking: {"type": "adaptive"},然后显式设置 output_config.effort。保留 tool_choice: auto,在必须产出符合 schema 参数的工具上设 strict: true,或者把 schema 移到 structured outputs,并在提示词里说明何时该用工具。然后在循环里核实工具确实被调用了,因为 auto 不保证一定调用。

2. 悄悄移动的默认值

不传 effort 的请求在 Opus 5 上按 high 跑,在 Opus 5.5 上按 medium 跑。如果你的生产请求从来没设过 effort,第一次 Opus 5.5 重放就不是同等条件的比较。先在两个模型上都显式设定档位再读结果,然后在 5.5 上扫描 low、medium、high。

3. 消失的进度文字

在工具调用之间,Opus 5 把简短叙述作为 text 块返回。Opus 5.5 把它作为进度更新型 thinking 块返回,每次工具调用前最多一个,在默认的 display: "omitted" 下 thinking 字段为空。不会报错,只是你的流式 UI 安静了。把 thinking.display 设为 "updates"(beta 头 thinking-display-updates-2026-08-18)或 "summarized",把每个非空思考块渲染在它对应的工具调用之前,并原样传回这些块。

4. 丢失推理的回退链

思考块记录了产生它的模型。Opus 5.5 能读 Opus 5 以及更早的 Opus、Sonnet、Haiku 的思考块,所以从 Opus 5 开始、转到 5.5 的对话保留推理。反方向只有 Claude Fable 5.1 和 Mythos 5.1 能读 Opus 5.5 的块。从 Opus 5.5 回退到 Opus 5、Sonnet 5 或 Haiku 4.5 的路由,剩余轮次不带之前的推理继续跑;请求成功,被丢弃的块不计费,但行为变了。API 还会检查 5.5 思考块之前的内容是否被编辑过,2026 年 8 月 31 日及之后创建的账号在编辑后重放会默认返回 400。保持历史只追加,用对话中途的 system 消息代替编辑 system prompt 或工具。

5. 新增的拒答类别

Opus 5.5 在网络安全分类器之外增加了生物分类器,并且会拒绝迫使它在回复里复述内部推理的请求,返回 stop_reason: "refusal",stop_details.category 为 bio 或 reasoning_extraction。服务端回退不会重试 reasoning_extraction。如果你的 Opus 5 集成从没检查过 stop_reason,试点前先加上。

六个场景,各自要证明什么

场景输入到输出“更好”的含义在 Opus 5.5 上要看什么
多文件代码变更仓库上下文到补丁测试通过;评审者改动更少即接受选定 effort 下的输出 token;到绿灯的步数
多轮工具 Agent任务加工具 schema 到一串工具调用任务完成;失败后循环可恢复auto 仍会调用工具;进度块已渲染;思考块原样传回
长文档分析文档与图像到有来源的结论结论与证据集吻合;无遗漏引用核对;Anthropic 称无依据数字更少,需验证
结构化提取半结构化文本到固定 JSONschema 有效率;字段准确率用 strict: true 取代强制工具调用
缓存重的工作流固定前缀加新任务到结果接受率不降;账单真的下降缓存命中占比;5 分钟与 1 小时写入的选择
多模型回退失败或超时的轮次到备用路由对话可继续;成本有界哪些模型能读 5.5 的思考块;拒答类别

这些都不是结果。它们是流量迁移前要填写的验收记录,每个任务类别一份,两个模型使用相同的提示词、工具、超时、effort 档位、重试规则和评审者。

什么时候继续用 Opus 5

在 Opus 5 已经满足通过率、延迟和成本目标、而重放没有显示可度量收益的地方,继续用它。在请求构造代码仍在发送 thinking: disabled 或强制工具调用、修复尚未上线的地方,继续用它。在每一个 5.5 灰度跑到能看清真实负载下 p95 延迟和拒答行为之前,把它留作回退路由。在回退链依赖下游模型读取对话思考块、且尚未重测的地方,也继续用它。

只要你在收集基线,等待就不是消极的。Anthropic 把 Opus 5 列为 Active,在自营平台上退役不早于 2027 年 7 月 24 日,所以有时间按证据而不是按发布日期迁移。

一套安全的迁移方案

1. 冻结 Opus 5 基线

从上面每个类别里挑出有代表性的任务。记录精确的请求形态、effort 档位、工具集和验收标准,在 Opus 5 上再跑一遍,让基线是新鲜的,不是记忆。

2. 修请求形态

删掉 thinking: disabled 和 budget_tokens,显式设置 effort,用 auto 加 strict 取代强制工具调用,把 computer use 迁到工具集,加上 stop_reason 处理。先把这些改动发到 Opus 5 上;每一项在那里也都有效,这样能把“修请求”和“换模型”分开。

3. 做 effort 扫描

在 Opus 5.5 上以 low、medium、high 重放基线。记录每一档的成功任务率、输出 token、耗时和每个成功任务的成本。按任务类别选出满足验收线的最便宜档位。不要凭习惯把 Opus 5 的 high 带过去。

4. 按任务类别灰度

把某一个任务类别的小比例流量路由到 Opus 5.5,配置 Opus 5 为回退,每次调用都记录请求模型、返回模型、effort、stop_reason 和计费维度。当一个类别的每任务成本和质量都在一个完整的真实流量周期里通过关口时再晋升,而不是一个好日子就晋升。

5. 定义回去的路

回滚是一次配置变更:把该类别切回 claude-opus-5。因为 Opus 5 读不了 Opus 5.5 的思考块,对话中途回滚会丢掉之前的推理继续跑;能开新对话边界就开。灰度开始前先写清谁能触发回滚、什么信号触发。

在 EvoLink 上,模型选择就是请求里的一个字符串,第 4、5 步都不需要发版。

查看 Claude Opus 5.5 路由与当前价格 把 Claude Opus 5 路由留作回退

常见问题

Claude Opus 5.5 比 Claude Opus 5 便宜吗?

按 token 算是的:Anthropic 标价输入和输出低 20%,缓存读取低 60%。按任务算取决于模型在你的 effort 档位下消耗多少 token;Anthropic 的 40% 是它在自己工作负载上的估算。

Opus 5.5 能直接替换 Opus 5 吗?

不能。关闭思考、设置思考预算、强制工具选择或声明旧版 computer-use 工具的请求都会返回 400。默认 effort 也从 high 降到 medium,工具调用之间的文字移进了思考块。

为什么 Opus 5.5 在我的工作负载上可能比 Opus 5 更贵?

因为它在同一 effort 档位下倾向于每轮想得更多,而思考按输出计费。在 20K 输入、4K 输出的任务上,它的输出可以多 50% 价格才会打平,所以 effort 要靠扫描选出来,不要把 high 直接带过去。

能为了延迟在 Opus 5.5 上关闭思考吗?

不能。用 effort: low,在延迟和接受率上对比你的 Opus 5 关思考基线。Anthropic 对“为关思考写的提示词”的建议还包括删掉“不要推理”之类的指令。

从 Opus 5.5 回退到 Opus 5,思考块会怎样?

Opus 5 读不了它们,API 会在模型看到请求之前丢弃。请求成功,被丢弃的块不计费,但剩余轮次不带之前的推理继续跑。从 Opus 5 转到 Opus 5.5 则会保留。

强制工具调用有替代方案吗?

保留 tool_choice: auto,在工具上设 strict: true 让任何调用都符合它的 schema,并在提示词里说明何时该用工具。如果只是要 JSON 输出,用 structured outputs 代替工具。

Opus 5 应该保留为回退吗?

应该,至少在灰度期间。Anthropic 把 claude-opus-5 列为 Active,在自营平台上退役不早于 2027 年 7 月 24 日。测试你计划回退到的那条具体路由,包括上面说的思考块行为。

哪些工作负载应该先迁?

长时间的 Agent 编程、大文档分析、有稳定前缀的缓存重 Agent,按预期收益依次排列。日常编程和高并发、延迟敏感的流量通常属于 Sonnet 5,而不是任何一个 Opus。

来源

事实核验时间:2026 年 9 月 22 日。成本示例使用 Anthropic 标价和固定 token 组合,是价格算术,不是实测结果。

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。