GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验
Claude Opus 5.2 对比 Claude Opus 5 的评测示意:暮色中琥珀与冰蓝两条同样明亮的光流通道一起进入透明测量闸门,一条透明玻璃回环弧线折返,象征回滚路径
model-comparison

Claude Opus 5.2 vs Claude Opus 5:切换之前先测什么

EvoLink 团队
EvoLink 团队
产品团队
2026年9月17日
更新于 2026年9月18日
25 分钟阅读
一句话结论:继续用 Claude Opus 5,并且开始认真地度量它。截至 2026 年 9 月 18 日,“Claude Opus 5.2”只存在于社区帖子里:我们在 Anthropic 的文档里没有找到它的任何模型、模型 ID、价格、规格或基准,所以除了“Claude Code 里输出更快、不再偷懒”的报道之外没有东西可比,也没有路由可切。你现在能做的,是把这些报道变成一套评测,等真正的点版本出现那天就能直接跑,并且用数字告诉你这次变化值不值得你的流量。
这篇指南写给已经把 Opus 5 放进生产环境的团队。路由报道背后的证据(包括已溯源的“Foundry slug”)在 Claude Opus 5.2 什么时候上线;各渠道可用性、模型 ID 和价格状态在 Claude Opus 5.2 API 页。下一代 Opus 是另一个问题,见 Claude Opus 6 vs Claude Opus 5

一眼看懂的决策

问题Claude Opus 5“Claude Opus 5.2”现在该做什么
有正式名称吗?有,2026 年 7 月 24 日发布没有;是社区叫法当观察项,不当路线图
有文档化的 API ID 吗?claude-opus-5在 Anthropic 文档、SDK 列表和 Claude Code 构建里都没找到不要把猜的 ID 写进配置
价格和限制有文档吗?每百万 token $5 / $25;1M 上下文;128K 输出未知按 Opus 5 做预算
今天能做配对测试吗?能,通过有文档的渠道没有可调用的候选现在就冻结基线和回放集
用户怎么说?“偷懒”、想太久、长任务要喊“继续”“快多了”、“输出干净”、“不偷懒了”(仅 Claude Code)把每条反馈变成可度量的测试
万一切换,退路在哪?列为 Active,在 Anthropic 自营平台上退役“不早于 2027 年 7 月 24 日”不适用实测你打算回退到的那条 EvoLink 路由

没有赢家,因为只有一列是有文档的产品。这次对比有用的产出,是后继者必须拿出的证据。

Claude Opus 5.2 对比 Opus 5:已知的区别与未知

Anthropic 的模型总览、价格页、发布说明和 Claude Code 更新日志记录了 Claude Opus 5,Opus 线没有更新的东西。从 9 月 14 日起,多个 X 账号报告 Claude Code 把部分 Opus 5 请求路由到了一个更新的构建。没有帖子附标识符或请求记录,各方对受影响的应用和套餐说法不一,Anthropic 也没有回应。

和报道一起流传的四件事,在发布追踪里有完整说明,这里只做摘要:
  • “Foundry 的 claude-opus-5-2.yaml”是社区注册表里的条目,数值等于 Opus 5;
  • “五档 effort,含 xhigh 和 max”是 Opus 5 今天就有的文档能力;
  • 8 月传闻过“Opus 5.1”,最终没有以该名称正式发布;
  • 问模型“Tibo 是谁”读的是生成文本,不是模型身份。
有一条官方事实对下文全部内容都重要。Anthropic 的版本规则文档写明:同一个 ID 的模型权重是固定的,有更新版本时会用新的模型 ID 发布;而请求路由器、采样逻辑等服务基础设施会变化,并且是稳定 ID 上出现行为差异时“最可能的原因”。所以同一个名字下会话变快,本身并不等于新模型。这也意味着真正的点版本会以一个新 ID 出现、由你主动选用——这正是受控评测能成立的前提。

用户报告了什么,以及什么才算证据

报道对“变了什么”的描述很一致,这让它们可以作为测试规格,尽管它们证明不了任何模型。

社区报告(Claude Code,9 月 14–17 日)它对应的 Opus 5 抱怨什么才算证据
“快多了”/“想得少了”在 high 和 xhigh 档位输出前思考很久同一组任务、同一 effort 档位:每次通过验收的任务的耗时和输出 token,连续多天
“不偷懒了”、“喜欢做长任务”做到一半停下来让用户继续每个完成的长任务里用户催促次数;无人干预的完成率
输出很干净(X 帖);代码不再臃肿、不再过度设计(一条 Reddit 帖,我们只读到二手转述)过度设计或啰嗦的实现diff 大小相对请求范围;每个通过的改动里审核者的修改数
视觉和 3D 任务更好,“接近 Astra 水平”,但同一位发帖人仍认为 Astra 更强视觉与空间任务偏弱固定评分标准的配对视觉任务——如果这类负载对你重要
一位论坛用户的原话:“昨晚侥幸灰度到了,很好用,现在又走了”不是抱怨,是警告任何改进都必须跨多天、跨 CLI 版本持续存在,才算基线

按任务看:什么改善才值得切换

“更好”对不同的工作负载意思不同。按任务类别先定好先看什么指标、多大的改善才值得花迁移成本。阈值由你定;这张表只告诉你往哪看。

任务类别先看同时盯值得切换的改善
交互问答与对话首个有用回答的 p50 和 p95 耗时通过率、输出 token延迟从“用户有感”降到“用户无感”,且通过率不下降
仓库级编码已通过改动的测试通过率diff 大小相对请求范围;审核者修改时间更多改动一次通过测试,且 diff 不越出请求的文件
长时 Agent无人干预的完成率每个任务的催促次数、工具报错后的恢复、每个完成任务的总 token原本要喊“继续”或人工救场的任务现在能自己跑完,且 token 没有失控
结构化提取解析或 schema 校验成功率重试次数、每条有效记录的成本无效输出更少,每条有效记录的成本持平或更低
批量文档处理每份通过验收的文档成本批处理窗口内的吞吐、缓存命中率每份通过文档的成本更低,且仍赶得上截止时间

如果某类任务今天在 Opus 5 上没有可度量的问题,那它就没有理由迁移,不管新模型在别处得了多少分。

Claude Opus 5 已经交付了什么

Opus 5 是这次对比里可度量的那一边:

  • API 模型 ID claude-opus-5,无日期的固定快照;
  • 每百万 token 输入 $5、输出 $25;缓存写入 $6.25(5 分钟)和 $10(1 小时);缓存读取 $0.50;批处理半价;仅 Claude API 提供的 research preview fast 模式 $10 / $50;
  • 1M token 上下文,没有更小的档;128K 最大输出;
  • 自适应思考默认开启;effort 档位 low、medium、high(默认)、xhigh、max;只有 high 及以下才能关闭思考;
  • 思考 token 按输出 token 计费,并计入 max_tokens
在 EvoLink 上,Claude Opus 5 页列出当前路由。把它当基线之前,先用自己的 key 核对文档化的 ID、返回的 model 字段、用量和计费。

历史上的 Opus 发布改了什么,按影响分类

一次发布里的变化并不都会打破集成。把三类分开,你才知道该重测什么。

版本日期明确的破坏性变更成本或行为变化新增能力
Opus 4.62026 年 2 月 5 日引入自适应思考1M 上下文;128K 输出;上下文压缩
Opus 4.72026 年 4 月 16 日temperaturetop_ptop_k 设为非默认值返回 400新分词器:同样的文本计为更多 tokenxhigh 档;更高分辨率视觉
Opus 4.82026 年 5 月 28 日fast 模式;Agent 与推理提升
Opus 52026 年 7 月 24 日思考默认开启;在 xhighmax 下关闭思考返回 400思考 token 按输出计费,同样费率下输出量上升;默认回答更长缓存最小 512 token;对话中途改工具(beta)
这些版本都标价每百万 token $5 / $25,彼此间隔 42 到 70 天,9 月 18 日是 Opus 5 之后的第 56 天。上一次代际升级见 Claude Opus 5 vs Claude Opus 4.8。两者都是历史,不是预测:未来的点版本可能带来这三类变化里的任何一种,也可能一种都没有。

切换之前的兼容性检查

检查面查什么为什么
模型标识符ID 由 Anthropic 或你所用的云渠道公布;Bedrock 和 Google Cloud 有各自的格式猜的字符串可能失败,或被代理映射到无关模型
思考与 effort重跑你的 effort 矩阵;测试关闭路径和 400 行为Opus 5 两项都改过;默认值还可能再变
token 计量重新度量每个任务的输入、输出和缓存 token分词器和思考的变化会在标价不变时改变账单
采样参数在配置里搜索模型会拒绝的参数4.7 把非默认采样值变成了报错
结构化输出与工具回放解析器与 schema 校验;注入工具故障Anthropic 的 Opus 5 更新说明指出,读取 content[0].text 的代码必须改为按 type 选取内容块,因为响应可能以思考块开头
回退记录哪些请求由回退服务,并把它设为明确的实验分支混合模型的结果会污染对比

关于身份:记录返回的 model 字段、请求 ID、用量和账单是必要的,但它不是对底层权重的独立证明,因为这些字段全部由服务端或代理提供。你能确立的是文档化的 ID 映射、返回的元数据、可信的上游记录和计费之间的一致性。这足以让一次替换可追溯,而这才是实际目标。

配对评测

1. 冻结 Opus 5 基线

记录提示词、工具、effort 档位、上下文状态、任务通过率、耗时、输入与输出 token、缓存使用、重试、审核时间和已知失败案例。把 Opus 5 让你“继续”或过度设计改动的那些会话一并记下;那些正是报道的说法,你需要“之前”的数字。

2. 建三组回放集

  • 已知成功的任务,用来抓回归;
  • 已知 Opus 5 失败的任务(偷懒、啰嗦、想太久),用来度量替代价值;
  • 目前需要人工或另一条路由的前沿任务。
Claude Opus 5 与 Opus 5.2 的配对评估方案:相同任务分别经过一致的工具与计时检查;平衡的输出只表示公平测试,不代表实测性能相同
Claude Opus 5 与 Opus 5.2 的配对评估方案:相同任务分别经过一致的工具与计时检查;平衡的输出只表示公平测试,不代表实测性能相同

3. 只有成为有文档、前后一致的路由,候选才入场

候选进入测试框架的条件是:它的 ID 已由 Anthropic 或你的云渠道公布,一次鉴权请求成功,返回的元数据与文档化的映射一致,用量能与公布价格对上。之后使用与基线相同的提示词、工具、超时、effort 策略、重试规则和审核者。

成本算例

决定要不要切换的数字不是总花费,而是每个通过验收的任务你付了多少钱:

每次成功任务的 API 成本 = 整个评测组的实际 API 花费 ÷ 通过验收的任务数

评测组消耗的一切都进分子:失败的尝试、重试、回退调用都算。缓存写入和读取按实际计费项计入。思考 token 已经按输出 token 计费,不要再加一遍。人工审核时间单独一列,不要折算成 API 费用。

下面的数字是为了演示算法而虚构的,不是任何模型的实测结果。
基线组候选组
尝试的任务数100100
API 总花费,含失败和重试$12.00$14.00
通过验收的任务数8095
每次成功任务的 API 成本$12.00 ÷ 80 = $0.150$14.00 ÷ 95 = $0.147
仍需人工修复或重做的任务205

候选组多花了 $2.00,但每次成功任务的成本仍然略低,因为它的花费里有更大一部分产出了可用的结果。更大的差别在最后一行:回到人手里的任务少了 15 个。反过来的情况同样真实:如果候选组花了 $16.00、通过 85 个,每次成功任务的成本就是 $0.188,多出来的质量必须配得上高出 25% 的单位成本。先做除法,再看标题数字。

一张可以直接填的验收记录

“显著提升”“延迟守住”这类门槛没法核对。在跑之前,根据该任务类别的业务要求写下阈值,跑完再记录结果。每个任务类别复制一份。

字段你的阈值(跑之前填)基线结果候选结果是否达标
任务类别与回放组
样本数(尝试的任务数)至少 ____
通过率(通过 ÷ 尝试)不低于 ____ %,且在已知成功组上不低于基线
p95 延迟不超过 ____ 秒
每次成功任务的 API 成本不超过 $ ____
每 100 个任务的重试与回退调用数不超过 ____
每个通过任务的人工修复时间不超过 ____ 分钟
每个长任务的催促次数(仅 Agent)不超过 ____
连续 ____ 天的一致性任何一天都没有一行不达标
一条可以执行的放量条件长这样:当每一行都在至少 ____ 个任务、连续 ____ 天内达标时,把该任务类别 5% 的流量切到候选;任何一行不达标的当天,切回 0%。 没有通用阈值。客服机器人和夜间重构任务不该共用一套标准。

按任务切换,并实测退路

现实的结果是一条路由策略,不是全局切换。把验收记录达标的任务类别按上面矩阵的顺序逐步切过去,其余留在 Opus 5。

Claude Opus 5.2 小流量验证与回退方案:多数流量保留在琥珀色基线路由,另设小流量评估分支和明确返回路径;这不是已上线的部署
Claude Opus 5.2 小流量验证与回退方案:多数流量保留在琥珀色基线路由,另设小流量评估分支和明确返回路径;这不是已上线的部署
退路需要单独测试。Anthropic 的退役页把 claude-opus-5 列为 Active,退役“不早于 2027 年 7 月 24 日”,并说明页面上的日期适用于 Anthropic 自营平台(Claude API、Claude Platform on AWS 和 Microsoft Foundry),Amazon Bedrock 和 Google Cloud 自行设定时间表。这是一个评测窗口,但它不保证你打算回退到的那条具体路由的容量、权限或运行状态。在任何小流量验证之前,先让真实流量走一遍你准备用的 Opus 5 回退路由,确认配额和权限,并演练一次把流量切回它的配置变更。

Opus 5 已经满足你的通过率、延迟和成本目标的地方,迁移没有实测收益的地方,或者你的日志还分不清主路由和回退调用的地方,就继续用 Opus 5。你在收集基线的时候,等待不是被动的;只有当交付因为一个没官宣的模型而停摆时,等待才是被动的。

EvoLink 的统一 API 把模型选择留在路由配置里而不是应用代码里,这让挑战者加得便宜、撤得也便宜。这套方案里没有任何一步需要今天就存在一条 Opus 5.2 路由。

查看当前 Claude Opus 5 路由 订阅 Claude Opus 5.2 API 上线提醒

常见问题

Claude Opus 5.2 官宣了吗?

截至 2026 年 9 月 18 日,我们在 Anthropic 的模型目录、发布说明、价格页和新闻中心里都没有找到它。最新的 Opus 是 Claude Opus 5。

Claude Opus 5.2 比 Claude Opus 5 更好吗?

没有基于证据的对比,因为不存在有文档、可调用的 Opus 5.2。社区报道描述了 Claude Code 里更快、不偷懒的输出,但没有模型标识符和度量。

用户说 Opus 5.2 修了什么?

速度、想太久、长任务偷懒、代码啰嗦或过度设计。这些是回放集的正确类别,也是说法,不是结果。

成本怎么比才公平?

用评测组的 API 总花费(含失败和重试)除以通过验收的任务数。比较这个数字,而不是总花费或标价;人工修复时间单独列出。

更新的 Opus 会不会更快吃掉我的额度或预算?

在能度量之前无从得知。已有用户反映 Opus 5 用量上升;而在 Opus 5 上,思考 token 按输出 token 计费,所以想得更多的模型在同样标价下花得更多。请在你的 effort 档位上,按每次成功任务度量输入、输出和缓存 token。Claude 应用里消费者套餐的额度,与 API 计费是两回事。

该等 Opus 5.2 再开项目吗?

不该。用 Claude Opus 5 做已承诺的交付,把模型选择留在配置里,收集将来会成为升级评测集的记录。

现在能用 claude-opus-5-2 这个模型 ID 吗?

不能。我们在任何 Anthropic 文档里都没有找到这个标识符。猜的 ID 会失败,更糟的是可能被某个第三方代理映射到一个无关的模型。

新 Opus 发布后,Opus 5 还能用吗?

Anthropic 把 claude-opus-5 列为 Active,在其自营平台上退役不早于 2027 年 7 月 24 日;Bedrock 和 Google Cloud 自行设定日期。这不保证任何一条具体的网关路由,所以要实测你计划使用的回退路由。

发布之后该怎么比较两者?

使用相同的提示词、工具、超时、effort 档位、上下文状态、重试规则和审核者。每个任务类别填一份验收记录,比较每次成功任务的成本,按任务类别逐步切换流量,并保留演练过的退路。

来源

官方来源最近一次核查于 2026 年 9 月 18 日。Anthropic 的事实来自官方文档;社区报道来自我们直接读到的 X 帖子、论坛帖子,以及一条经二手转述的 Reddit 帖,均已如此标注;成本算例使用虚构数字;EvoLink 路由状态独立且未核验。

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。