GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验
铜色与蓝色玻璃工作流搭配记忆模块和恢复回路,用于 Gemini 4 与 Claude Fable 5.1 对比
analysis

Gemini 4 vs Claude Fable 5.1:长任务 Agent 怎么选?

EvoLink 团队
EvoLink 团队
产品团队
2026年9月16日
22 分钟阅读
截至 2026 年 9 月 16 日,没有可以加入的 Gemini 4 路由:先留在 Claude Fable 5.1 上,把未来 Gemini 4 路由必须超过的基线记录下来。 截至 2026 年 9 月 16 日,Gemini 4 没有任何执行层证据可供长任务 Agent 团队拿来与 Claude Fable 5.1 对比。 Google 只确认 Gemini 4 已开始预训练;公开的 API 入口、model ID、价格、上下文数字、缓存规则和 benchmark 一项都没有。Claude Fable 5.1 有 Anthropic 已发布的模型合同,EvoLink 也已配置路由。所以对 Tech Lead 或 FinOps 负责人来说,要定的不是“哪个模型来跑我们的 Agent”,而是“现在要在 Fable 5.1 上记录什么,好让以后的 Gemini 4 路由有可对照的东西去证明自己”。今天先把长任务和上下文复用的基线记下来,再写清一条新路由拿到流量前必须过的门槛。
本文只负责一件事:这两个模型之间的长任务 Agent 选型。发布时间问题归 Gemini 4 发布追踪;当前 API 状态见 Gemini 4 页面;OpenAI 一侧在 Gemini 4 vs GPT-6 Astra;两个已发布旗舰的比较见 Claude Fable 5.1 vs GPT-6 Astra,那篇已有带价格的缓存算例,本文不再重复。

状态与证据表

问题Gemini 4Claude Fable 5.1安全决策
官方状态Google 确认已开始预训练(2026 年 7 月)Anthropic 于 2026 年 9 月 1 日发布;标记为 Active (latest)把差距当作状态差距,不当作能力结论
API model ID未公布claude-fable-5-1(Anthropic)未公布的 ID 绝不写进配置或代码
上下文与最大输出未公布100 万上下文;12.8 万最大输出(Anthropic)记录你的 trace 实际用掉多少窗口
输入模态未公布文本与图片输入,文本输出(Anthropic)测试前先列出每类工作负载需要哪些模态
思考控制未公布自适应思考常开;默认 effort high;相对延迟标为 Slower(Anthropic)每条 trace 记录 effort 设置,以后的路由要在同一设置下测
缓存计费结构未公布输入 $10 / 输出 $50 每百万 token;5 分钟缓存写入 $12.50;1 小时缓存写入 $20;缓存读取 $0.25 每百万 token(Anthropic 标价)双方都公布 TTL 和费率之前,缓存经济性无法比较
Batch 可用性未公布Anthropic 列出 Batch 输入与输出按标准价 5 折Standard 对 Standard,Batch 对 Batch
文档化的破坏性变更未公布Anthropic 迁移指南列出三项:强制 tool choice 报错、旧模型不兼容 5.1 thinking block、编辑早轮对话后 thinking block 失效已公布的变更清单可以测;没公布的测不了
EvoLink 路由无已验证可调用路由;上线提醒开放中已配置路由 claude-fable-5-1;价格见产品页任何路由的第一个请求都要核验返回模型身份

Gemini 4 那一列是一份“可测量项清单”,不是批评。每个“未公布”单元格都对应你的评测框架里本该预留的一个字段,这样合同一公布就是填值,而不是重新设计。

哪些长任务值得评测

长任务 Agent 不是单一工作负载。团队路由到 Fable 5.1 的 trace 大多落在五类任务里,每类对“验收通过”的定义不同。基线按类记录;将来的 Gemini 4 路由也按类判断。

工作负载“验收通过”的含义现在在 Fable 5.1 上记录什么Gemini 4 路由以后必须对齐什么
多文件仓库修复测试通过、diff 经过评审、未触碰无关文件读取与编辑的文件数、工具调用、重试、评审分钟数、每个验收通过修复的 token同一任务集、测试套件和评审 rubric
多步研究与知识交付物引用可解析、结构符合 brief、没有无依据的论断抓取的来源数、被要求修改的次数、每份交付物的事实更正数同一 brief 和事实核查流程
多小时工具循环在停止条件上结束,最终状态有效循环次数、失败工具调用、检查点、恢复事件、到终止的墙钟时间同一工具、权限、重试预算和停止规则
长文档结构化抽取输出通过 schema 校验;抽样字段与原文一致文档长度、schema 失败数、重跑次数、固定样本上的字段准确率同一文档、schema 和样本
客服多步工具流程在政策范围内解决工单,无需人工升级升级次数、错误工具调用、政策违规、处理时长同一流程定义和政策检查

没有任何一行指名偏好的模型,因为不存在匹配运行。表格只是先固定“同一任务”在第二条路由出现时意味着什么。

上下文复用与缓存条件

长任务 Agent 每一轮都在重发同一份仓库地图、工具 schema 和指令,所以缓存计费主导 token 账单。这也是今天无法开始比较的部分。

Google 未公布 Gemini 4 的缓存 TTL、写入和读取费率、缓存作用域(自动前缀缓存还是显式缓存对象)以及最小可缓存大小。缺了这四个值就没有分母:5 分钟的缓存读取和 1 小时的缓存读取是两种产品,按请求的前缀缓存和多个 Agent 共享的命名缓存也是两种产品。不同 TTL、上下文作用域和 batch 模式不能混进一个数字里。

Fable 5.1 给了你可以照着记录的结构。Anthropic 文档写明:5 分钟缓存写入 $12.50 每百万 token,1 小时写入 $20 每百万 token,缓存读取 $0.25 每百万 token,Batch 输入与输出按标准价 5 折。每条 Fable trace 都记下:

  • 选了哪个 TTL、为什么(轮次间隔在 5 分钟内,还是间隔长到值得用 1 小时写入);
  • 缓存前缀大小,以及任务中途改了几次——前缀一变就要重新写入;
  • 每轮的缓存读取 token 与新鲜输入 token 各是多少;
  • 这条 trace 跑的是 Standard 还是 Batch,以及运行当时 Anthropic 价格页如何叠加 Batch 与缓存倍率。
这些字段按 trace 记,不要按月记。等 Gemini 4 公布缓存合同,你能直接看出哪些 trace 够得上它的缓存条件,而不是拿两个描述不同对象的标价硬比。Fable 5.1 在 EvoLink 的费率见产品页

重试、恢复与人工接管成本

这一层规格表上永远看不到,却是长任务 Agent 预算真正流失的地方。一条在人工解锁后第三次尝试才完成的 trace,和一次完成的 trace 成本并不相同。每条 trace 记录六类事件,每条带时间戳和 token 数:

  1. 循环检测。 同一工具调用带同一参数重复超过预先设定的阈值。记录停止规则触发前烧掉了多少轮。
  2. 失败的工具调用。 区分厂商侧错误、工具侧错误和模型侧的畸形调用。只有第三种是模型质量信号;前两种是基础设施成本,新路由同样要付。
  3. 检查点完整性。 验证每个保存的状态确实能恢复任务。恢复不了的检查点等于白费的输出加一次完整重跑。
  4. 中断后恢复。 限流、超时或运维暂停之后重建上下文花掉的 token,与首次运行的 token 分开计。
  5. Thinking block 失效。 Anthropic 迁移指南写明,编辑早轮对话会让保留的 Fable 5.1 thinking block 失效。任何为压缩或纠错而重写历史的框架都会触发;记录发生频率和重新思考的成本。Gemini 4 是否有对应规则,未公布。
  6. 人工接管。 评审者用于解锁、纠正或收尾任务的分钟数,以时间计,不让它消失在 API 总额里。

把这些作为 trace 记录上的字段存,不要单开一份事故日志;只有重试、恢复和评审分钟数与 token 挂在同一个任务 ID 上,按已验收任务计成本才有意义。

完整任务成本变量表

下面每个数字的分母都是完成并通过验收的任务。完成但评审未通过的任务计入支出(钱已经花了),但不进分母。API 支出与人工时间分列;分钟换算成钱只在汇报层做,费率由财务团队定。

变量今天在 Fable 5.1 上如何记录Gemini 4 状态
输入 token每轮的新鲜(未缓存)输入,按任务汇总,取自 EvoLink 返回的用量计数合同公布前未知
缓存写入写入的 token 数,按 5 分钟与 1 小时 TTL 拆分,加上每任务的写入次数合同公布前未知
缓存读取每任务从缓存提供的 token 数;同时记命中率(缓存读取 / (缓存读取 + 新鲜输入))合同公布前未知
输出 token最终答案加中间工具参数,按任务汇总合同公布前未知
工具调用与外部成本每任务的次数以及任何计量成本(搜索、代码执行、第三方 API)合同公布前未知
重试首次之外的尝试,每次尝试的 token,挂在同一任务 ID 上合同公布前未知
回退路由使用是否有任何一轮由别的模型提供服务、是哪个,以返回的 model 字段核验合同公布前未知
人工评审分钟数每任务的评审者与运维时间,按分钟记有路由后由你自己实测;不是供应商公布的数字
到验收的墙钟时间任务开始到结果通过验收的时间,含等待和人工轮次有路由后由你自己实测;不是供应商公布的数字
任务验收率观察窗内每类工作负载的验收通过任务 / 尝试任务有路由后由你自己实测;不是供应商公布的数字

按已验收任务计成本 = API 支出 ÷ 验收通过任务数,并与每个验收通过任务的评审分钟数并排汇报。一条路由压低了前者却抬高了后者,不叫降本,叫把成本挪到人身上。

完成质量验收

只对一个模型有效的验收标准是偏好,不是标准。验收要建得经得起换模型:

  • 客观检查优先。 测试通过、schema 校验通过、引用可解析、diff 只触碰声明过的文件。二值结果,便宜到每条 trace 都能跑。
  • 评审 rubric 其次。 每类工作负载一份简短固定的清单(正确性、完整性、安全性、是否遵循 brief),由不知道输出来自哪条路由的评审者打分。
  • 重复运行。 每个任务跑多次,任务验收率以区间汇报,避免一次成功被当成能力。
  • 不确定性汇报。 每个结果旁边都公布样本量、设置(effort、工具、TTL)和失败清单。没有样本量的比率不是证据。

rubric 要在任何 Gemini 4 访问权限出现之前写好;事后写的 rubric 会顺着新路由碰巧擅长的方向弯。

影子流量与回滚计划

Gemini 4 路由将来真的出现时,应当和任何新路由一样经过同样三个阶段,全程保留 Fable 5.1 作为有测量数据的基线。

  1. 回放(Replay)。 把记录下来的 Fable 5.1 trace 离线喂给候选路由;在完全相同的输入上比较任务验收率和按已验收任务计成本。
  2. 影子(Shadow)。 线上请求同时发给两条路由,返回 Fable 5.1 的答案,静默给候选打分。循环和工具错误在这一步暴露,用户不受影响。
  3. 金丝雀(Canary)。 先拿一类工作负载切一小部分流量;门槛在观察窗内持续达标才扩大。

晋级门槛在测试开始前定好:任务验收率不低于基线;到验收的 p95 墙钟时间在约定范围内;按已验收任务计成本(含重试和回退)不高于基线;该类工作负载在观察窗内零事故。

回滚触发:任一门槛连续失守达约定天数,或出现一次触及客户的事故。回滚是网关配置改动,不是代码发布——这正是模型选择应放在路由配置而非应用代码里的原因。

“返回模型身份”核验,指的是读取每个响应里的 model 字段和用量计数,确认与配置的路由一致。在网关上,这能证明请求确实由你指定的模型处理,而不是被回退路由悄悄接手。任何新路由的第一个请求要做,影子阶段要持续做;结果记进成本表的“回退路由使用”字段。

哪些结果不算进步

  • 传闻中更大的 Gemini 4 上下文窗口,却拿不出完成的长任务。
  • 更低的表面价格,被重试、恢复、更长输出或额外评审分钟数抵消。
  • 泄漏的 benchmark 截图或第三方规格表,没有设置、样本量和可复现任务集。
  • 顶着新名字,返回的却是旧模型或不透明回退。
  • 一天的任务验收率优势,在重复运行或完整观察窗内消失。

这些否决规则现在就写,和验收 rubric 放在同一份文档里。跳过这一步的团队,往往会围着第一个令人兴奋的结果重新定义成功。

在 EvoLink 评测 Claude Fable 5.1 追踪 Gemini 4 API 可用状态

常见问题

今天有人能证明 Gemini 4 跑 Agent 的成本低于 Claude Fable 5.1 吗?

不能。截至 2026 年 9 月 16 日,Google 没有公布 Gemini 4 的价格、缓存规则、上下文窗口或 API 入口,所以任何方向的成本说法都没有已公布的分母。现在记下你在 Fable 5.1 上按已验收任务计的成本,以后的说法才有东西可对照。

缓存价格能跨厂商直接比吗?

不能当单个数字比。缓存读取只有在 TTL、缓存作用域(前缀还是显式)、最小可缓存大小、Standard 还是 Batch 全部对齐时才可比。Anthropic 文档写明了 Fable 5.1 的 5 分钟与 1 小时写入档和读取费率;Gemini 4 这些一项都没公布。

失败的长任务成本怎么算?

把每次尝试、每次恢复、每一分钟评审都挂到同一个任务 ID 上。失败和未通过验收的任务留在总支出里,但不进验收通过任务的分母。每个验收通过任务的 API 支出和评审分钟数分别汇报,永远不合并。

Gemini 4 没公布的特性该怎么记?

建好字段,值填“截至 YYYY-MM-DD 未公布”。不要拿 Gemini 3.x 的值、泄漏数字或零去填。Google 公布合同后再替换占位值,并记下变更日期,让历史对比保持诚实。

测新路由的同时怎么保住已验证的 Claude 基线?

候选路由跑回放、影子和金丝雀期间,Fable 5.1 路由保持配置并继续服务。测试前冻结任务集、rubric 和评审者,基线数字连同日期和设置一起存档;测试期间会动的基线不是基线。Anthropic 建议多数工作负载从 Claude Opus 5 起步,把 Fable 5.1 留给高难度推理或长周期任务,所以要写明你的基线到底是哪条 Claude 路由。
EvoLink 已配置名为 claude-fable-5-1 的路由。把生产流量切过去之前,先在第一个请求上核验返回模型身份和用量计数,当前价格见 Claude Fable 5.1 产品页。网关可用不等于生产结论;结论来自你自己的回放、影子和金丝雀结果。

来源

证据最后核验于 2026 年 9 月 16 日。Anthropic 事实来自 Anthropic 文档;Google 事实来自 Google 官方博客与 Gemini API 文档。Gemini 4 没有公开 API,EvoLink 也没有其路由。

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。