
Claude Opus 5.2 vs Claude Opus 5:切换之前先测什么
一眼看懂的决策
| 问题 | Claude Opus 5 | “Claude Opus 5.2” | 现在该做什么 |
|---|---|---|---|
| 有正式名称吗? | 有,2026 年 7 月 24 日发布 | 没有;是社区叫法 | 当观察项,不当路线图 |
| 有文档化的 API ID 吗? | claude-opus-5 | 在 Anthropic 文档、SDK 列表和 Claude Code 构建里都没找到 | 不要把猜的 ID 写进配置 |
| 价格和限制有文档吗? | 每百万 token $5 / $25;1M 上下文;128K 输出 | 未知 | 按 Opus 5 做预算 |
| 今天能做配对测试吗? | 能,通过有文档的渠道 | 没有可调用的候选 | 现在就冻结基线和回放集 |
| 用户怎么说? | “偷懒”、想太久、长任务要喊“继续” | “快多了”、“输出干净”、“不偷懒了”(仅 Claude Code) | 把每条反馈变成可度量的测试 |
| 万一切换,退路在哪? | 列为 Active,在 Anthropic 自营平台上退役“不早于 2027 年 7 月 24 日” | 不适用 | 实测你打算回退到的那条 EvoLink 路由 |
没有赢家,因为只有一列是有文档的产品。这次对比有用的产出,是后继者必须拿出的证据。
Claude Opus 5.2 对比 Opus 5:已知的区别与未知
Anthropic 的模型总览、价格页、发布说明和 Claude Code 更新日志记录了 Claude Opus 5,Opus 线没有更新的东西。从 9 月 14 日起,多个 X 账号报告 Claude Code 把部分 Opus 5 请求路由到了一个更新的构建。没有帖子附标识符或请求记录,各方对受影响的应用和套餐说法不一,Anthropic 也没有回应。
- “Foundry 的
claude-opus-5-2.yaml”是社区注册表里的条目,数值等于 Opus 5; - “五档 effort,含 xhigh 和 max”是 Opus 5 今天就有的文档能力;
- 8 月传闻过“Opus 5.1”,最终没有以该名称正式发布;
- 问模型“Tibo 是谁”读的是生成文本,不是模型身份。
用户报告了什么,以及什么才算证据
报道对“变了什么”的描述很一致,这让它们可以作为测试规格,尽管它们证明不了任何模型。
| 社区报告(Claude Code,9 月 14–17 日) | 它对应的 Opus 5 抱怨 | 什么才算证据 |
|---|---|---|
| “快多了”/“想得少了” | 在 high 和 xhigh 档位输出前思考很久 | 同一组任务、同一 effort 档位:每次通过验收的任务的耗时和输出 token,连续多天 |
| “不偷懒了”、“喜欢做长任务” | 做到一半停下来让用户继续 | 每个完成的长任务里用户催促次数;无人干预的完成率 |
| 输出很干净(X 帖);代码不再臃肿、不再过度设计(一条 Reddit 帖,我们只读到二手转述) | 过度设计或啰嗦的实现 | diff 大小相对请求范围;每个通过的改动里审核者的修改数 |
| 视觉和 3D 任务更好,“接近 Astra 水平”,但同一位发帖人仍认为 Astra 更强 | 视觉与空间任务偏弱 | 固定评分标准的配对视觉任务——如果这类负载对你重要 |
| 一位论坛用户的原话:“昨晚侥幸灰度到了,很好用,现在又走了” | 不是抱怨,是警告 | 任何改进都必须跨多天、跨 CLI 版本持续存在,才算基线 |
按任务看:什么改善才值得切换
“更好”对不同的工作负载意思不同。按任务类别先定好先看什么指标、多大的改善才值得花迁移成本。阈值由你定;这张表只告诉你往哪看。
| 任务类别 | 先看 | 同时盯 | 值得切换的改善 |
|---|---|---|---|
| 交互问答与对话 | 首个有用回答的 p50 和 p95 耗时 | 通过率、输出 token | 延迟从“用户有感”降到“用户无感”,且通过率不下降 |
| 仓库级编码 | 已通过改动的测试通过率 | diff 大小相对请求范围;审核者修改时间 | 更多改动一次通过测试,且 diff 不越出请求的文件 |
| 长时 Agent | 无人干预的完成率 | 每个任务的催促次数、工具报错后的恢复、每个完成任务的总 token | 原本要喊“继续”或人工救场的任务现在能自己跑完,且 token 没有失控 |
| 结构化提取 | 解析或 schema 校验成功率 | 重试次数、每条有效记录的成本 | 无效输出更少,每条有效记录的成本持平或更低 |
| 批量文档处理 | 每份通过验收的文档成本 | 批处理窗口内的吞吐、缓存命中率 | 每份通过文档的成本更低,且仍赶得上截止时间 |
如果某类任务今天在 Opus 5 上没有可度量的问题,那它就没有理由迁移,不管新模型在别处得了多少分。
Claude Opus 5 已经交付了什么
Opus 5 是这次对比里可度量的那一边:
- API 模型 ID
claude-opus-5,无日期的固定快照; - 每百万 token 输入 $5、输出 $25;缓存写入 $6.25(5 分钟)和 $10(1 小时);缓存读取 $0.50;批处理半价;仅 Claude API 提供的 research preview fast 模式 $10 / $50;
- 1M token 上下文,没有更小的档;128K 最大输出;
- 自适应思考默认开启;effort 档位 low、medium、high(默认)、xhigh、max;只有 high 及以下才能关闭思考;
- 思考 token 按输出 token 计费,并计入
max_tokens。
历史上的 Opus 发布改了什么,按影响分类
一次发布里的变化并不都会打破集成。把三类分开,你才知道该重测什么。
| 版本 | 日期 | 明确的破坏性变更 | 成本或行为变化 | 新增能力 |
|---|---|---|---|---|
| Opus 4.6 | 2026 年 2 月 5 日 | — | 引入自适应思考 | 1M 上下文;128K 输出;上下文压缩 |
| Opus 4.7 | 2026 年 4 月 16 日 | temperature、top_p、top_k 设为非默认值返回 400 | 新分词器:同样的文本计为更多 token | xhigh 档;更高分辨率视觉 |
| Opus 4.8 | 2026 年 5 月 28 日 | — | — | fast 模式;Agent 与推理提升 |
| Opus 5 | 2026 年 7 月 24 日 | 思考默认开启;在 xhigh 或 max 下关闭思考返回 400 | 思考 token 按输出计费,同样费率下输出量上升;默认回答更长 | 缓存最小 512 token;对话中途改工具(beta) |
切换之前的兼容性检查
| 检查面 | 查什么 | 为什么 |
|---|---|---|
| 模型标识符 | ID 由 Anthropic 或你所用的云渠道公布;Bedrock 和 Google Cloud 有各自的格式 | 猜的字符串可能失败,或被代理映射到无关模型 |
| 思考与 effort | 重跑你的 effort 矩阵;测试关闭路径和 400 行为 | Opus 5 两项都改过;默认值还可能再变 |
| token 计量 | 重新度量每个任务的输入、输出和缓存 token | 分词器和思考的变化会在标价不变时改变账单 |
| 采样参数 | 在配置里搜索模型会拒绝的参数 | 4.7 把非默认采样值变成了报错 |
| 结构化输出与工具 | 回放解析器与 schema 校验;注入工具故障 | Anthropic 的 Opus 5 更新说明指出,读取 content[0].text 的代码必须改为按 type 选取内容块,因为响应可能以思考块开头 |
| 回退 | 记录哪些请求由回退服务,并把它设为明确的实验分支 | 混合模型的结果会污染对比 |
关于身份:记录返回的 model 字段、请求 ID、用量和账单是必要的,但它不是对底层权重的独立证明,因为这些字段全部由服务端或代理提供。你能确立的是文档化的 ID 映射、返回的元数据、可信的上游记录和计费之间的一致性。这足以让一次替换可追溯,而这才是实际目标。
配对评测
1. 冻结 Opus 5 基线
记录提示词、工具、effort 档位、上下文状态、任务通过率、耗时、输入与输出 token、缓存使用、重试、审核时间和已知失败案例。把 Opus 5 让你“继续”或过度设计改动的那些会话一并记下;那些正是报道的说法,你需要“之前”的数字。
2. 建三组回放集
- 已知成功的任务,用来抓回归;
- 已知 Opus 5 失败的任务(偷懒、啰嗦、想太久),用来度量替代价值;
- 目前需要人工或另一条路由的前沿任务。

3. 只有成为有文档、前后一致的路由,候选才入场
候选进入测试框架的条件是:它的 ID 已由 Anthropic 或你的云渠道公布,一次鉴权请求成功,返回的元数据与文档化的映射一致,用量能与公布价格对上。之后使用与基线相同的提示词、工具、超时、effort 策略、重试规则和审核者。
成本算例
决定要不要切换的数字不是总花费,而是每个通过验收的任务你付了多少钱:
每次成功任务的 API 成本 = 整个评测组的实际 API 花费 ÷ 通过验收的任务数评测组消耗的一切都进分子:失败的尝试、重试、回退调用都算。缓存写入和读取按实际计费项计入。思考 token 已经按输出 token 计费,不要再加一遍。人工审核时间单独一列,不要折算成 API 费用。
| 基线组 | 候选组 | |
|---|---|---|
| 尝试的任务数 | 100 | 100 |
| API 总花费,含失败和重试 | $12.00 | $14.00 |
| 通过验收的任务数 | 80 | 95 |
| 每次成功任务的 API 成本 | $12.00 ÷ 80 = $0.150 | $14.00 ÷ 95 = $0.147 |
| 仍需人工修复或重做的任务 | 20 | 5 |
候选组多花了 $2.00,但每次成功任务的成本仍然略低,因为它的花费里有更大一部分产出了可用的结果。更大的差别在最后一行:回到人手里的任务少了 15 个。反过来的情况同样真实:如果候选组花了 $16.00、通过 85 个,每次成功任务的成本就是 $0.188,多出来的质量必须配得上高出 25% 的单位成本。先做除法,再看标题数字。
一张可以直接填的验收记录
“显著提升”“延迟守住”这类门槛没法核对。在跑之前,根据该任务类别的业务要求写下阈值,跑完再记录结果。每个任务类别复制一份。
| 字段 | 你的阈值(跑之前填) | 基线结果 | 候选结果 | 是否达标 |
|---|---|---|---|---|
| 任务类别与回放组 | — | |||
| 样本数(尝试的任务数) | 至少 ____ | |||
| 通过率(通过 ÷ 尝试) | 不低于 ____ %,且在已知成功组上不低于基线 | |||
| p95 延迟 | 不超过 ____ 秒 | |||
| 每次成功任务的 API 成本 | 不超过 $ ____ | |||
| 每 100 个任务的重试与回退调用数 | 不超过 ____ | |||
| 每个通过任务的人工修复时间 | 不超过 ____ 分钟 | |||
| 每个长任务的催促次数(仅 Agent) | 不超过 ____ | |||
| 连续 ____ 天的一致性 | 任何一天都没有一行不达标 |
按任务切换,并实测退路
现实的结果是一条路由策略,不是全局切换。把验收记录达标的任务类别按上面矩阵的顺序逐步切过去,其余留在 Opus 5。

claude-opus-5 列为 Active,退役“不早于 2027 年 7 月 24 日”,并说明页面上的日期适用于 Anthropic 自营平台(Claude API、Claude Platform on AWS 和 Microsoft Foundry),Amazon Bedrock 和 Google Cloud 自行设定时间表。这是一个评测窗口,但它不保证你打算回退到的那条具体路由的容量、权限或运行状态。在任何小流量验证之前,先让真实流量走一遍你准备用的 Opus 5 回退路由,确认配额和权限,并演练一次把流量切回它的配置变更。Opus 5 已经满足你的通过率、延迟和成本目标的地方,迁移没有实测收益的地方,或者你的日志还分不清主路由和回退调用的地方,就继续用 Opus 5。你在收集基线的时候,等待不是被动的;只有当交付因为一个没官宣的模型而停摆时,等待才是被动的。
EvoLink 的统一 API 把模型选择留在路由配置里而不是应用代码里,这让挑战者加得便宜、撤得也便宜。这套方案里没有任何一步需要今天就存在一条 Opus 5.2 路由。
查看当前 Claude Opus 5 路由 订阅 Claude Opus 5.2 API 上线提醒常见问题
Claude Opus 5.2 官宣了吗?
截至 2026 年 9 月 18 日,我们在 Anthropic 的模型目录、发布说明、价格页和新闻中心里都没有找到它。最新的 Opus 是 Claude Opus 5。
Claude Opus 5.2 比 Claude Opus 5 更好吗?
没有基于证据的对比,因为不存在有文档、可调用的 Opus 5.2。社区报道描述了 Claude Code 里更快、不偷懒的输出,但没有模型标识符和度量。
用户说 Opus 5.2 修了什么?
速度、想太久、长任务偷懒、代码啰嗦或过度设计。这些是回放集的正确类别,也是说法,不是结果。
成本怎么比才公平?
用评测组的 API 总花费(含失败和重试)除以通过验收的任务数。比较这个数字,而不是总花费或标价;人工修复时间单独列出。
更新的 Opus 会不会更快吃掉我的额度或预算?
在能度量之前无从得知。已有用户反映 Opus 5 用量上升;而在 Opus 5 上,思考 token 按输出 token 计费,所以想得更多的模型在同样标价下花得更多。请在你的 effort 档位上,按每次成功任务度量输入、输出和缓存 token。Claude 应用里消费者套餐的额度,与 API 计费是两回事。
该等 Opus 5.2 再开项目吗?
不该。用 Claude Opus 5 做已承诺的交付,把模型选择留在配置里,收集将来会成为升级评测集的记录。
现在能用 claude-opus-5-2 这个模型 ID 吗?
不能。我们在任何 Anthropic 文档里都没有找到这个标识符。猜的 ID 会失败,更糟的是可能被某个第三方代理映射到一个无关的模型。
新 Opus 发布后,Opus 5 还能用吗?
claude-opus-5 列为 Active,在其自营平台上退役不早于 2027 年 7 月 24 日;Bedrock 和 Google Cloud 自行设定日期。这不保证任何一条具体的网关路由,所以要实测你计划使用的回退路由。发布之后该怎么比较两者?
使用相同的提示词、工具、超时、effort 档位、上下文状态、重试规则和审核者。每个任务类别填一份验收记录,比较每次成功任务的成本,按任务类别逐步切换流量,并保留演练过的退路。
来源
- Anthropic:模型总览
- Anthropic:模型 ID 与版本规则,含“模型权重与服务基础设施”一节
- Anthropic:Claude Opus 5 更新说明(破坏性变更与思考 token 计费)
- Anthropic:effort 参数
- Anthropic:价格
- Anthropic:模型退役(平台适用范围、参数弃用)
- Anthropic:Claude Opus 4.7 发布
- Anthropic:Claude Opus 4.8 发布
- Anthropic:Claude Opus 5 发布
- X:@notjazii,2026 年 9 月 14 日
- X:@pankajkumar_dev,2026 年 9 月 15 日
- EvoLink:Claude Opus 5.2 什么时候上线
- EvoLink:Claude Opus 5.2 API 可用状态
- EvoLink:Claude Opus 5


