
Claude Fable 5 vs Fable 5.1:有哪些变化,值得升级吗?
Claude Fable 5 vs Fable 5.1:快速结论
| 工作负载 | 建议起始路由 | 原因 |
|---|---|---|
| 反复读取上下文的长周期 Agent | Fable 5.1 金丝雀 | 缓存读取便宜 75%,新版本面向长周期工作 |
| 仓库级编码或多步研究 | 评测 Fable 5.1 | 厂商报告能力提升,但必须由自己的轨迹确认 |
| 严重依赖强制工具的稳定 Fable 5 集成 | 完成迁移前保留 Fable 5 | Fable 5.1 拒绝强制 tool_choice 的 any 与 tool |
| 会编辑历史或跨模型继续会话 | 保留回退并重构历史处理 | Fable 5.1 的 thinking blocks 有更严格兼容规则 |
| 短、无缓存、延迟敏感请求 | 同时对比 Opus 5 | 标准价格未变,Fable 5.1 的官方相对延迟为 Slower |
已确认的规格和价格差异
| 项目 | Claude Fable 5 | Claude Fable 5.1 | 决策影响 |
|---|---|---|---|
| 生命周期 | Active 前代模型 | Active,当前最新 | 新的晋级决策应评测 5.1 |
| 上下文窗口 | 100 万 tokens | 100 万 tokens | 没有窗口扩展收益 |
| 最大输出 | 12.8 万 tokens | 12.8 万 tokens | 没有输出扩展收益 |
| 输入价格 | $10 / MTok | $10 / MTok | 标准价格无节省 |
| 输出价格 | $50 / MTok | $50 / MTok | 输出密集任务仍然昂贵 |
| 5 分钟缓存写入 | $12.50 / MTok | $12.50 / MTok | 不变 |
| 1 小时缓存写入 | $20 / MTok | $20 / MTok | 不变 |
| 缓存读取 | $1 / MTok | $0.25 / MTok | 实际命中缓存时降低 75% |
| Thinking | Adaptive | Adaptive,始终开启 | 通过 effort 控制深度并重测行为 |
| 知识截止 | 2026 年 1 月 | 2026 年 6 月 | 5.1 的官方知识基线更新 |
“便宜 25%”必须带限定词。Anthropic 估算一组历史典型工作负载可节省约 25%,高度 Agent 化任务最高约 45%。实际结果由缓存命中占比、输出、重试、工具调用、安全回退和人工复核共同决定。没有缓存读取时,官方输入与输出成本并未下降。
Fable 5.1 除价格外还改了什么?
Anthropic 表示新版本改善了长周期 Agent 编码、多步研究和文档密集型知识工作,并增加逐消息 effort、逐轮 system message、工具调用间进度更新、更低缓存读取成本和内容溯源。其中部分功能仍是 Beta,厂商 Benchmark 的提升也不等于你的业务分布一定获得相同增益。
评测 5.1 的核心理由,不是某个发布 Benchmark,而是它能否用更少返工完成更多可验收任务,同时把总成本和延迟控制在产品预算内。
三项破坏性变更
1. 强制工具选择可能报错
tool_choice: "tool" 强制指定工具,或用 tool_choice: "any" 要求必须调用工具。Fable 5.1 会拒绝这两种强制模式。应改为支持的自动选择或经过验证的应用层控制,并重测每条关键工具链。2. 旧模型无法读取 Fable 5.1 thinking blocks
如果回退将同一对话从 Fable 5.1 切换到更早的 Claude 模型,保留的 thinking 内容可能不兼容。跨模型回退必须按“历史合同”设计,不能只替换路由。
3. 编辑早期对话会使 thinking blocks 失效
执行脱敏、摘要或历史重写的应用不能继续回放已失效的 thinking 内容。需要覆盖对话压缩、用户编辑、脱敏、重试和灾难恢复流程。
比较成功任务成本,而不是只看 Token 单价
建议使用完整公式:
成功任务成本 = 输入 + 缓存写入 + 缓存读取 + 输出 + 工具 + 重试 + 回退 + 人工复核反复读取大型代码库或政策语料的 Agent,可能显著受益于更低缓存读取价格。短请求如果生成很长回答,几乎没有缓存输入可优惠,主要成本仍来自输出与复核。缓存命中 tokens 和成功任务结果必须进入同一份报表。
可回滚的 EvoLink 迁移方案

- 冻结 Fable 5 基线。 保存代表性 Prompt、工具轨迹、输出、延迟、用量、账单和评审决定。
- 离线回放。 使用相同输入、工具、effort 和成功标准运行 Fable 5.1,并区分厂商拒答、回退和模型质量。
- 影子生产流量。 暂不向用户展示 5.1 结果,比较工具选择、整条轨迹完成率、缓存行为和成本。
- 窄范围金丝雀。 只路由 5.1 已胜出的任务类型,并设置错误、p95 延迟和花费上限。
- 保留回滚。 在约定观察窗内稳定前,保留 Fable 5 或合格的 Opus 路由。
晋级评分卡
- 成功任务质量: 使用同一评审者和验收标准,仅在有实质改善或无回归时晋级。
- 长周期可靠性: 记录整条轨迹完成率、重复工具循环、失败恢复和状态丢失。
- 成本: 衡量每个成功任务总成本、缓存命中占比、输出量和人工复核。
- 延迟: 对比端到端 p50 与 p95,而不是一次演示。
- 实际服务表现: 确认返回模型、工具调用、用量记录、回退可见性和错误处理。
- 数据与安全: 重新确认实际渠道的数据保留、区域处理、安全机制和回退条款。
哪些情况暂时不应升级?
如果强制工具行为深度嵌入业务、对话历史会被改写、跨模型回退复用 thinking blocks,或受监管流程尚未完成政策审核,应暂时保留 Fable 5。如果现有路由已经通过产品门槛,而 5.1 没有带来可测量的成功任务增益,也没有必要迁移。
Anthropic 建议多数任务从 Opus 5 开始。Fable 5.1 应用于更高能力真正改变结果的任务,而不是成为所有常规流量的默认模型。
在 EvoLink 测试 Claude Fable 5.1 保留 Claude Fable 5 作为回退为什么 Fable 5 仍可能是正确路由
如果现有集成已经达到产品指标、依赖强制工具选择,或者还没有为只追加的 Thinking 历史做改造,Fable 5 仍是合理的稳定基线。已知的延迟分布、拒绝行为和经过验证的 fallback,不会因为出现新版本就失去价值。
迁移期间保留 Fable 5 不是长期停滞,而是建立对照组。必须固定 Prompt、工具、effort、评测人、重试策略和观察窗口,才能区分模型提升、流量变化和评测漂移。
同条件测试完整兼容面
| 测试面 | Fable 5 基线 | Fable 5.1 验证 |
|---|---|---|
| 工具选择 | 记录 auto、none、any、指定工具 | 移除强制模式并验证 strict Schema |
| Thinking 历史 | 保存 API 返回的 Block | 验证单向兼容与只追加重放 |
| Prompt 修改 | 记录 system、tools 和历史消息 | 检查前缀变化是否使 Block 失效 |
| Agent 循环 | 记录工具批次、重试与恢复 | 对比完成率、循环和进度更新 |
| Effort | 固定生产配置 | 按任务类别扫档,不能假设单一默认值 |
| 安全与 fallback | 记录拒绝类别和完成模型 | 确认最终模型及策略结果 |
| 成本 | 计量所有 token 与工具维度 | 同时统计 Cache Hit 和人工修正 |
应评测完整 Trace,而不是孤立回答。最昂贵的失败往往是看似合理的半成品:消耗多轮工具、进入人工 Review,最后才被拒绝。
常见升级错误
- 只替换模型 ID,忽略强制工具与 Thinking 历史不兼容。
- 把缓存读取降价说成所有任务统一省 25%;没有 Cache Hit 的输入输出并未降价。
- 用新 Prompt 对比旧生产 Trace,没有冻结工具、effort、评测与重试策略。
- 因单个 Benchmark 或一次 Demo 就全量上线。
- Canary 尚未跑完整观察窗口就移除 fallback。
- 忽略最终完成请求的模型,未记录安全 fallback 和返回身份。
- 只优化 Token 单价,不统计重试、工具、延迟和人工修改。
常见问题
Claude Fable 5.1 是 Fable 5 的直接替代品吗?
它是当前继任版本,但不是无风险的即插即用替代品。三项官方兼容性变化要求进行迁移测试。
Fable 5.1 比 Fable 5 便宜吗?
标准输入、输出价格不变。缓存读取便宜 75%,所以总节省取决于工作负载真正复用了多少缓存上下文。
工具调用发生了什么变化?
tool_choice 的 any 和 tool。工具密集流量迁移前必须验证受支持的选择方式。两个模型都是 100 万上下文吗?
是。二者都列出 100 万 tokens 上下文和 12.8 万 tokens 最大输出。
缓存密集 Agent 应该升级吗?
它很适合进入金丝雀评测,因为缓存读取价格只有原来的四分之一;但只有质量、延迟和服务表现也通过时才应放量。
可以在同一对话中途切换模型吗?
不能盲目切换。旧 Claude 模型无法读取 Fable 5.1 thinking blocks,跨模型回退必须显式管理会话历史。
Fable 5.1 应该承接全部生产流量吗?
不应该。应按任务价值和实测性能路由,常规流量可能更适合 Opus 5 或其他低成本模型。
在哪里追踪发布事实?
来源
- Anthropic Claude Fable 5.1 模型概览
- Anthropic Claude Fable 5.1 公告
- Anthropic Prompt Caching 文档
- Anthropic Claude Fable 5.1 Prompt 指南


