
Claude Opus 5.5 vs Claude Opus 5:值得升级吗
400,默认 effort 从 high 降到 medium,而且同一档位下模型每轮想得更多。一眼看懂的决策
| 如果你的情况是 | 建议 | 原因 |
|---|---|---|
| 新工作负载,还没有 Opus 基线 | 直接从 Opus 5.5 开始 | Anthropic 推荐的默认,标价更低,限制相同 |
Opus 5 已在生产,思考已开启,tool_choice: auto | 在灰度后面试点 5.5 | 显式设置 effort 后代码通常可以沿用;仍要逐项核对下文五项风险(思考设置、工具选择、进度文字、思考块回退、computer use 版本) |
Opus 5 已在生产,但用了 thinking: disabled 或强制工具调用 | 先修请求,再试点 | 这两种写法在 5.5 上都返回 400 |
| 缓存重、稳定前缀大的 Agent | 优先试点 | 5.5 的缓存读取便宜 60% |
| 回退链会在对话中途从 Opus 降到 Sonnet 或 Haiku | 重测回退路径 | 只有 Fable 5.1 和 Mythos 5.1 能读 Opus 5.5 的思考块 |
| 流式 UI 会展示工具调用之间的文字 | 上线前先处理 thinking.display | 那段文字现在装在思考块里,默认为空 |
| 延迟敏感,之前为了速度关掉了思考 | 用 5.5 的 low effort 对比 Opus 5 的关思考基线 | 思考关不掉,effort 是唯一杠杆 |
这张表里没有无条件的赢家。当你的工作负载正是 Anthropic 优化的方向、请求形态又已经兼容时,升级是划算的;不是的话,先花的是工程时间。
Anthropic 改了什么
| 维度 | Claude Opus 5 | Claude Opus 5.5 | 文档来源 |
|---|---|---|---|
| 发布 | 2026 年 7 月 24 日 | 2026 年 9 月 22 日 | 发布说明 |
| 模型 ID | claude-opus-5 | claude-opus-5-5 | 模型总览 |
| 输入 / 输出 | $5 / $25 每 MTok | $4 / $20 每 MTok | 定价 |
| 缓存写入 5 分钟 / 1 小时 | $6.25 / $10 | $5 / $8 | 定价 |
| 缓存读取 | $0.50(输入价的 10%) | $0.20(输入价的 5%) | 定价 |
| Batch | $2.50 / $12.50 | $2 / $10 | 定价 |
| Fast mode(仅 Claude API) | $10 / $50 | $8 / $40 | 定价 |
| 上下文 / 最大输出 | 1M / 128K | 1M / 128K | 模型总览 |
| 思考 | 默认开启;effort high 及以下允许 disabled | 始终开启;disabled 与 budget_tokens 返回 400 | What's new |
| 默认 effort | high | medium | 模型总览 |
强制工具调用(any、tool) | 支持 | 返回 400 | What's new |
| 工具调用之间的文字 | text 块 | 进度更新型 thinking 块,默认展示为空 | What's new |
| 思考块可读性 | Opus 5.5、Fable 5.1、Mythos 5.1 可读 | 仅 Fable 5.1 与 Mythos 5.1 可读 | What's new |
| Claude API / Google Cloud 上的 computer use | 工具集或 computer_20251124 | 仅工具集 | What's new |
| 安全类别 | cyber | cyber、bio、reasoning_extraction | What's new |
| 知识截止 | 更早 | 2026 年 6 月 | 模型总览 |
| 退役下限 | 不早于 2027 年 7 月 24 日 | 不早于 2027 年 9 月 22 日 | 模型总览 |
表里每一项都是可以核验的合同变化。Anthropic 的能力表述是另一类:它报告 FrontierCode 领先、“大多数工作”达到 Claude Fable 5.1 水平、输出快 30% 以上、运行成本比 Opus 5 低 40%。这些是关于 Anthropic 自己任务组合的主张,把它们当作你评测要验证的假设。
同一口径的成本:20%、60% 还是 40%?
流传着三个不同的数字,它们量的是不同的东西。
- 20% 是输入和输出的标价差。它作用于每一个 token,在任何行为差异之前。
- 60% 是缓存读取的标价差。它只作用于输入中命中缓存的那部分。
- 40% 是 Anthropic 对自己工作负载总运行成本的估算。它把单价下调和“每个完成任务消耗更少 token”捆在一起,所以取决于你的任务在新模型上怎么表现。
下表把标价套到三种固定 token 组合上,按每 1,000 个任务计。这是价格计算,不是质量调整后的成本。
| 工作负载(每任务) | Opus 5 | Opus 5.5 | 变化 |
|---|---|---|---|
| A. 单次调用、无缓存:20K 输入,4K 输出 | $200.00 | $160.00 | -20% |
| B. 缓存重的 Agent:60K 缓存读取,10K 新输入,5K 缓存写入,6K 输出 | $261.25 | $197.00 | -25% |
| C. 与 A 相同,但 5.5 在同一 effort 下多输出 25% token | $200.00 | $180.00 | -10% |
xhigh 和 max 上尤其明显,而思考按输出计费。在 A 的组合下,Opus 5.5 的输出 token 最多可以比 Opus 5 多 50%,每任务价格才会打平。会不会真的多出来,取决于你选的 effort 档位,以及模型是否用更少的轮次达到验收结果,后者正是 Anthropic 40% 数字的来源。兼容性风险,按出问题的先后顺序
1. 现在会失败的请求
400 是 Anthropic 原生 API 的行为。在 EvoLink 上,网关会把旧的 thinking: disabled 和 budget_tokens 设置兼容转换为自适应思考而不是拒绝,强制工具选择则在 Chat Completions 与 Messages 两个端点上都会被拒绝;网关行为以 Claude Opus 5.5 模型页为准。thinking: {"type": "disabled"} 和 thinking: {"type": "enabled", "budget_tokens": N} 都返回 400 invalid_request_error。tool_choice: {"type": "any"} 和 {"type": "tool", "name": ...} 返回 400,token 计数端点也一样。在 Claude API 和 Google Cloud 上,computer_20251124 工具条目返回 400,改为声明 computer_toolset_20260801。thinking 字段,或者传等价的 thinking: {"type": "adaptive"},然后显式设置 output_config.effort。保留 tool_choice: auto,在必须产出符合 schema 参数的工具上设 strict: true,或者把 schema 移到 structured outputs,并在提示词里说明何时该用工具。然后在循环里核实工具确实被调用了,因为 auto 不保证一定调用。2. 悄悄移动的默认值
effort 的请求在 Opus 5 上按 high 跑,在 Opus 5.5 上按 medium 跑。如果你的生产请求从来没设过 effort,第一次 Opus 5.5 重放就不是同等条件的比较。先在两个模型上都显式设定档位再读结果,然后在 5.5 上扫描 low、medium、high。3. 消失的进度文字
text 块返回。Opus 5.5 把它作为进度更新型 thinking 块返回,每次工具调用前最多一个,在默认的 display: "omitted" 下 thinking 字段为空。不会报错,只是你的流式 UI 安静了。把 thinking.display 设为 "updates"(beta 头 thinking-display-updates-2026-08-18)或 "summarized",把每个非空思考块渲染在它对应的工具调用之前,并原样传回这些块。4. 丢失推理的回退链
400。保持历史只追加,用对话中途的 system 消息代替编辑 system prompt 或工具。5. 新增的拒答类别
stop_reason: "refusal",stop_details.category 为 bio 或 reasoning_extraction。服务端回退不会重试 reasoning_extraction。如果你的 Opus 5 集成从没检查过 stop_reason,试点前先加上。六个场景,各自要证明什么
| 场景 | 输入到输出 | “更好”的含义 | 在 Opus 5.5 上要看什么 |
|---|---|---|---|
| 多文件代码变更 | 仓库上下文到补丁 | 测试通过;评审者改动更少即接受 | 选定 effort 下的输出 token;到绿灯的步数 |
| 多轮工具 Agent | 任务加工具 schema 到一串工具调用 | 任务完成;失败后循环可恢复 | auto 仍会调用工具;进度块已渲染;思考块原样传回 |
| 长文档分析 | 文档与图像到有来源的结论 | 结论与证据集吻合;无遗漏 | 引用核对;Anthropic 称无依据数字更少,需验证 |
| 结构化提取 | 半结构化文本到固定 JSON | schema 有效率;字段准确率 | 用 strict: true 取代强制工具调用 |
| 缓存重的工作流 | 固定前缀加新任务到结果 | 接受率不降;账单真的下降 | 缓存命中占比;5 分钟与 1 小时写入的选择 |
| 多模型回退 | 失败或超时的轮次到备用路由 | 对话可继续;成本有界 | 哪些模型能读 5.5 的思考块;拒答类别 |
这些都不是结果。它们是流量迁移前要填写的验收记录,每个任务类别一份,两个模型使用相同的提示词、工具、超时、effort 档位、重试规则和评审者。
什么时候继续用 Opus 5
thinking: disabled 或强制工具调用、修复尚未上线的地方,继续用它。在每一个 5.5 灰度跑到能看清真实负载下 p95 延迟和拒答行为之前,把它留作回退路由。在回退链依赖下游模型读取对话思考块、且尚未重测的地方,也继续用它。只要你在收集基线,等待就不是消极的。Anthropic 把 Opus 5 列为 Active,在自营平台上退役不早于 2027 年 7 月 24 日,所以有时间按证据而不是按发布日期迁移。
一套安全的迁移方案
1. 冻结 Opus 5 基线
从上面每个类别里挑出有代表性的任务。记录精确的请求形态、effort 档位、工具集和验收标准,在 Opus 5 上再跑一遍,让基线是新鲜的,不是记忆。
2. 修请求形态
thinking: disabled 和 budget_tokens,显式设置 effort,用 auto 加 strict 取代强制工具调用,把 computer use 迁到工具集,加上 stop_reason 处理。先把这些改动发到 Opus 5 上;每一项在那里也都有效,这样能把“修请求”和“换模型”分开。3. 做 effort 扫描
low、medium、high 重放基线。记录每一档的成功任务率、输出 token、耗时和每个成功任务的成本。按任务类别选出满足验收线的最便宜档位。不要凭习惯把 Opus 5 的 high 带过去。4. 按任务类别灰度
stop_reason 和计费维度。当一个类别的每任务成本和质量都在一个完整的真实流量周期里通过关口时再晋升,而不是一个好日子就晋升。5. 定义回去的路
claude-opus-5。因为 Opus 5 读不了 Opus 5.5 的思考块,对话中途回滚会丢掉之前的推理继续跑;能开新对话边界就开。灰度开始前先写清谁能触发回滚、什么信号触发。在 EvoLink 上,模型选择就是请求里的一个字符串,第 4、5 步都不需要发版。
查看 Claude Opus 5.5 路由与当前价格 把 Claude Opus 5 路由留作回退常见问题
Claude Opus 5.5 比 Claude Opus 5 便宜吗?
按 token 算是的:Anthropic 标价输入和输出低 20%,缓存读取低 60%。按任务算取决于模型在你的 effort 档位下消耗多少 token;Anthropic 的 40% 是它在自己工作负载上的估算。
Opus 5.5 能直接替换 Opus 5 吗?
400。默认 effort 也从 high 降到 medium,工具调用之间的文字移进了思考块。为什么 Opus 5.5 在我的工作负载上可能比 Opus 5 更贵?
high 直接带过去。能为了延迟在 Opus 5.5 上关闭思考吗?
effort: low,在延迟和接受率上对比你的 Opus 5 关思考基线。Anthropic 对“为关思考写的提示词”的建议还包括删掉“不要推理”之类的指令。从 Opus 5.5 回退到 Opus 5,思考块会怎样?
Opus 5 读不了它们,API 会在模型看到请求之前丢弃。请求成功,被丢弃的块不计费,但剩余轮次不带之前的推理继续跑。从 Opus 5 转到 Opus 5.5 则会保留。
强制工具调用有替代方案吗?
tool_choice: auto,在工具上设 strict: true 让任何调用都符合它的 schema,并在提示词里说明何时该用工具。如果只是要 JSON 输出,用 structured outputs 代替工具。Opus 5 应该保留为回退吗?
claude-opus-5 列为 Active,在自营平台上退役不早于 2027 年 7 月 24 日。测试你计划回退到的那条具体路由,包括上面说的思考块行为。哪些工作负载应该先迁?
长时间的 Agent 编程、大文档分析、有稳定前缀的缓存重 Agent,按预期收益依次排列。日常编程和高并发、延迟敏感的流量通常属于 Sonnet 5,而不是任何一个 Opus。
来源
- Anthropic:Claude Opus 5.5 新变化
- Anthropic:迁移到 Claude Opus 5.5
- Anthropic:模型总览
- Anthropic:定价
- Anthropic:Effort 参数
- Anthropic:Preserved thinking
- Anthropic:拒答与回退
- Anthropic:Introducing Claude Opus 5.5


