
Gemini 4 vs Claude Fable 5.1:长任务 Agent 怎么选?
状态与证据表
| 问题 | Gemini 4 | Claude Fable 5.1 | 安全决策 |
|---|---|---|---|
| 官方状态 | Google 确认已开始预训练(2026 年 7 月) | Anthropic 于 2026 年 9 月 1 日发布;标记为 Active (latest) | 把差距当作状态差距,不当作能力结论 |
| API model ID | 未公布 | claude-fable-5-1(Anthropic) | 未公布的 ID 绝不写进配置或代码 |
| 上下文与最大输出 | 未公布 | 100 万上下文;12.8 万最大输出(Anthropic) | 记录你的 trace 实际用掉多少窗口 |
| 输入模态 | 未公布 | 文本与图片输入,文本输出(Anthropic) | 测试前先列出每类工作负载需要哪些模态 |
| 思考控制 | 未公布 | 自适应思考常开;默认 effort high;相对延迟标为 Slower(Anthropic) | 每条 trace 记录 effort 设置,以后的路由要在同一设置下测 |
| 缓存计费结构 | 未公布 | 输入 $10 / 输出 $50 每百万 token;5 分钟缓存写入 $12.50;1 小时缓存写入 $20;缓存读取 $0.25 每百万 token(Anthropic 标价) | 双方都公布 TTL 和费率之前,缓存经济性无法比较 |
| Batch 可用性 | 未公布 | Anthropic 列出 Batch 输入与输出按标准价 5 折 | Standard 对 Standard,Batch 对 Batch |
| 文档化的破坏性变更 | 未公布 | Anthropic 迁移指南列出三项:强制 tool choice 报错、旧模型不兼容 5.1 thinking block、编辑早轮对话后 thinking block 失效 | 已公布的变更清单可以测;没公布的测不了 |
| EvoLink 路由 | 无已验证可调用路由;上线提醒开放中 | 已配置路由 claude-fable-5-1;价格见产品页 | 任何路由的第一个请求都要核验返回模型身份 |
Gemini 4 那一列是一份“可测量项清单”,不是批评。每个“未公布”单元格都对应你的评测框架里本该预留的一个字段,这样合同一公布就是填值,而不是重新设计。
哪些长任务值得评测
长任务 Agent 不是单一工作负载。团队路由到 Fable 5.1 的 trace 大多落在五类任务里,每类对“验收通过”的定义不同。基线按类记录;将来的 Gemini 4 路由也按类判断。
| 工作负载 | “验收通过”的含义 | 现在在 Fable 5.1 上记录什么 | Gemini 4 路由以后必须对齐什么 |
|---|---|---|---|
| 多文件仓库修复 | 测试通过、diff 经过评审、未触碰无关文件 | 读取与编辑的文件数、工具调用、重试、评审分钟数、每个验收通过修复的 token | 同一任务集、测试套件和评审 rubric |
| 多步研究与知识交付物 | 引用可解析、结构符合 brief、没有无依据的论断 | 抓取的来源数、被要求修改的次数、每份交付物的事实更正数 | 同一 brief 和事实核查流程 |
| 多小时工具循环 | 在停止条件上结束,最终状态有效 | 循环次数、失败工具调用、检查点、恢复事件、到终止的墙钟时间 | 同一工具、权限、重试预算和停止规则 |
| 长文档结构化抽取 | 输出通过 schema 校验;抽样字段与原文一致 | 文档长度、schema 失败数、重跑次数、固定样本上的字段准确率 | 同一文档、schema 和样本 |
| 客服多步工具流程 | 在政策范围内解决工单,无需人工升级 | 升级次数、错误工具调用、政策违规、处理时长 | 同一流程定义和政策检查 |
没有任何一行指名偏好的模型,因为不存在匹配运行。表格只是先固定“同一任务”在第二条路由出现时意味着什么。
上下文复用与缓存条件
长任务 Agent 每一轮都在重发同一份仓库地图、工具 schema 和指令,所以缓存计费主导 token 账单。这也是今天无法开始比较的部分。
Google 未公布 Gemini 4 的缓存 TTL、写入和读取费率、缓存作用域(自动前缀缓存还是显式缓存对象)以及最小可缓存大小。缺了这四个值就没有分母:5 分钟的缓存读取和 1 小时的缓存读取是两种产品,按请求的前缀缓存和多个 Agent 共享的命名缓存也是两种产品。不同 TTL、上下文作用域和 batch 模式不能混进一个数字里。
Fable 5.1 给了你可以照着记录的结构。Anthropic 文档写明:5 分钟缓存写入 $12.50 每百万 token,1 小时写入 $20 每百万 token,缓存读取 $0.25 每百万 token,Batch 输入与输出按标准价 5 折。每条 Fable trace 都记下:
- 选了哪个 TTL、为什么(轮次间隔在 5 分钟内,还是间隔长到值得用 1 小时写入);
- 缓存前缀大小,以及任务中途改了几次——前缀一变就要重新写入;
- 每轮的缓存读取 token 与新鲜输入 token 各是多少;
- 这条 trace 跑的是 Standard 还是 Batch,以及运行当时 Anthropic 价格页如何叠加 Batch 与缓存倍率。
重试、恢复与人工接管成本
这一层规格表上永远看不到,却是长任务 Agent 预算真正流失的地方。一条在人工解锁后第三次尝试才完成的 trace,和一次完成的 trace 成本并不相同。每条 trace 记录六类事件,每条带时间戳和 token 数:
- 循环检测。 同一工具调用带同一参数重复超过预先设定的阈值。记录停止规则触发前烧掉了多少轮。
- 失败的工具调用。 区分厂商侧错误、工具侧错误和模型侧的畸形调用。只有第三种是模型质量信号;前两种是基础设施成本,新路由同样要付。
- 检查点完整性。 验证每个保存的状态确实能恢复任务。恢复不了的检查点等于白费的输出加一次完整重跑。
- 中断后恢复。 限流、超时或运维暂停之后重建上下文花掉的 token,与首次运行的 token 分开计。
- Thinking block 失效。 Anthropic 迁移指南写明,编辑早轮对话会让保留的 Fable 5.1 thinking block 失效。任何为压缩或纠错而重写历史的框架都会触发;记录发生频率和重新思考的成本。Gemini 4 是否有对应规则,未公布。
- 人工接管。 评审者用于解锁、纠正或收尾任务的分钟数,以时间计,不让它消失在 API 总额里。
把这些作为 trace 记录上的字段存,不要单开一份事故日志;只有重试、恢复和评审分钟数与 token 挂在同一个任务 ID 上,按已验收任务计成本才有意义。
完整任务成本变量表
下面每个数字的分母都是完成并通过验收的任务。完成但评审未通过的任务计入支出(钱已经花了),但不进分母。API 支出与人工时间分列;分钟换算成钱只在汇报层做,费率由财务团队定。
| 变量 | 今天在 Fable 5.1 上如何记录 | Gemini 4 状态 |
|---|---|---|
| 输入 token | 每轮的新鲜(未缓存)输入,按任务汇总,取自 EvoLink 返回的用量计数 | 合同公布前未知 |
| 缓存写入 | 写入的 token 数,按 5 分钟与 1 小时 TTL 拆分,加上每任务的写入次数 | 合同公布前未知 |
| 缓存读取 | 每任务从缓存提供的 token 数;同时记命中率(缓存读取 / (缓存读取 + 新鲜输入)) | 合同公布前未知 |
| 输出 token | 最终答案加中间工具参数,按任务汇总 | 合同公布前未知 |
| 工具调用与外部成本 | 每任务的次数以及任何计量成本(搜索、代码执行、第三方 API) | 合同公布前未知 |
| 重试 | 首次之外的尝试,每次尝试的 token,挂在同一任务 ID 上 | 合同公布前未知 |
| 回退路由使用 | 是否有任何一轮由别的模型提供服务、是哪个,以返回的 model 字段核验 | 合同公布前未知 |
| 人工评审分钟数 | 每任务的评审者与运维时间,按分钟记 | 有路由后由你自己实测;不是供应商公布的数字 |
| 到验收的墙钟时间 | 任务开始到结果通过验收的时间,含等待和人工轮次 | 有路由后由你自己实测;不是供应商公布的数字 |
| 任务验收率 | 观察窗内每类工作负载的验收通过任务 / 尝试任务 | 有路由后由你自己实测;不是供应商公布的数字 |
按已验收任务计成本 = API 支出 ÷ 验收通过任务数,并与每个验收通过任务的评审分钟数并排汇报。一条路由压低了前者却抬高了后者,不叫降本,叫把成本挪到人身上。
完成质量验收
只对一个模型有效的验收标准是偏好,不是标准。验收要建得经得起换模型:
- 客观检查优先。 测试通过、schema 校验通过、引用可解析、diff 只触碰声明过的文件。二值结果,便宜到每条 trace 都能跑。
- 评审 rubric 其次。 每类工作负载一份简短固定的清单(正确性、完整性、安全性、是否遵循 brief),由不知道输出来自哪条路由的评审者打分。
- 重复运行。 每个任务跑多次,任务验收率以区间汇报,避免一次成功被当成能力。
- 不确定性汇报。 每个结果旁边都公布样本量、设置(effort、工具、TTL)和失败清单。没有样本量的比率不是证据。
rubric 要在任何 Gemini 4 访问权限出现之前写好;事后写的 rubric 会顺着新路由碰巧擅长的方向弯。
影子流量与回滚计划
Gemini 4 路由将来真的出现时,应当和任何新路由一样经过同样三个阶段,全程保留 Fable 5.1 作为有测量数据的基线。
- 回放(Replay)。 把记录下来的 Fable 5.1 trace 离线喂给候选路由;在完全相同的输入上比较任务验收率和按已验收任务计成本。
- 影子(Shadow)。 线上请求同时发给两条路由,返回 Fable 5.1 的答案,静默给候选打分。循环和工具错误在这一步暴露,用户不受影响。
- 金丝雀(Canary)。 先拿一类工作负载切一小部分流量;门槛在观察窗内持续达标才扩大。
晋级门槛在测试开始前定好:任务验收率不低于基线;到验收的 p95 墙钟时间在约定范围内;按已验收任务计成本(含重试和回退)不高于基线;该类工作负载在观察窗内零事故。
回滚触发:任一门槛连续失守达约定天数,或出现一次触及客户的事故。回滚是网关配置改动,不是代码发布——这正是模型选择应放在路由配置而非应用代码里的原因。
model 字段和用量计数,确认与配置的路由一致。在网关上,这能证明请求确实由你指定的模型处理,而不是被回退路由悄悄接手。任何新路由的第一个请求要做,影子阶段要持续做;结果记进成本表的“回退路由使用”字段。哪些结果不算进步
- 传闻中更大的 Gemini 4 上下文窗口,却拿不出完成的长任务。
- 更低的表面价格,被重试、恢复、更长输出或额外评审分钟数抵消。
- 泄漏的 benchmark 截图或第三方规格表,没有设置、样本量和可复现任务集。
- 顶着新名字,返回的却是旧模型或不透明回退。
- 一天的任务验收率优势,在重复运行或完整观察窗内消失。
这些否决规则现在就写,和验收 rubric 放在同一份文档里。跳过这一步的团队,往往会围着第一个令人兴奋的结果重新定义成功。
在 EvoLink 评测 Claude Fable 5.1 追踪 Gemini 4 API 可用状态常见问题
今天有人能证明 Gemini 4 跑 Agent 的成本低于 Claude Fable 5.1 吗?
不能。截至 2026 年 9 月 16 日,Google 没有公布 Gemini 4 的价格、缓存规则、上下文窗口或 API 入口,所以任何方向的成本说法都没有已公布的分母。现在记下你在 Fable 5.1 上按已验收任务计的成本,以后的说法才有东西可对照。
缓存价格能跨厂商直接比吗?
不能当单个数字比。缓存读取只有在 TTL、缓存作用域(前缀还是显式)、最小可缓存大小、Standard 还是 Batch 全部对齐时才可比。Anthropic 文档写明了 Fable 5.1 的 5 分钟与 1 小时写入档和读取费率;Gemini 4 这些一项都没公布。
失败的长任务成本怎么算?
把每次尝试、每次恢复、每一分钟评审都挂到同一个任务 ID 上。失败和未通过验收的任务留在总支出里,但不进验收通过任务的分母。每个验收通过任务的 API 支出和评审分钟数分别汇报,永远不合并。
Gemini 4 没公布的特性该怎么记?
建好字段,值填“截至 YYYY-MM-DD 未公布”。不要拿 Gemini 3.x 的值、泄漏数字或零去填。Google 公布合同后再替换占位值,并记下变更日期,让历史对比保持诚实。
测新路由的同时怎么保住已验证的 Claude 基线?
Fable 5.1 现在在 EvoLink 上能用吗?
claude-fable-5-1 的路由。把生产流量切过去之前,先在第一个请求上核验返回模型身份和用量计数,当前价格见 Claude Fable 5.1 产品页。网关可用不等于生产结论;结论来自你自己的回放、影子和金丝雀结果。来源
- Anthropic:Claude Fable 5.1 模型概览
- Anthropic:Claude Fable 5.1 迁移指南
- Anthropic:价格、缓存 TTL 与 Batch
- Anthropic:Claude Fable 5.1 发布公告
- Anthropic:Claude Fable 产品页
- Anthropic:模型弃用
- Google:Alphabet 2026 年 Q2 财报 CEO 致辞
- Google:Gemini 3.6 Flash 发布公告
- Google:Gemini API 模型目录
- EvoLink:Gemini 4 API 状态
- EvoLink:Claude Fable 5.1
- EvoLink:Gemini 4 发布追踪
- EvoLink:Claude Fable 5.1 vs GPT-6 Astra


