Skip to main content

这篇教程给你什么

“用贵模型规划、便宜模型执行”来省钱,你可能已经听过。这篇不重复讲道理,而是解决三件更实际的事:
  1. 五个主流工具全覆盖 —— Claude Code、Hermes、pi、Kilo Code、Cline,每个工具怎么配出这套分工,都给可直接复制的配置和一页可落地的接入文档。
  2. 账你自己能验证 —— 不是”我说帮你省了多少”,而是教你看 API 响应里的 cache_read 字段,亲手确认缓存到底命中没有、省了多少。
  3. 实测踩过的坑都告诉你 —— 五个工具的鉴权写法各不相同(抄错就是 401)、哪些开关不开会静默失败,这些都是真机跑出来的。

一、这套分工到底是什么

一句话:把”想清楚怎么做”和”把它做出来”交给不同的模型。
  • 规划(想清楚怎么做)——架构设计、拆解任务、审查方案,用能力最强的 Claude Fable 5。这部分 token 少,但最吃模型能力。
  • 执行(把它做出来)——按计划改文件、批量编辑、跑工具,用便宜的 Haiku / Sonnet。这部分 token 多,但不需要顶级模型。
大部分编程工作是”一点难推理,包在大量机械执行外面”。把机械执行从贵模型上挪走,账就下来了。
这个思路 Anthropic 官方也认可——Claude Code 内置的 /model opusplan 就是”规划用贵模型、执行自动降档”。本篇把它扩展成:规划用 Fable 5、执行用任意便宜模型,并且让这套分工在 Claude Code 之外的四个工具里也能复现。

二、五个工具,一套分工

这是本篇的主线。五个工具实现分工的形态各不相同,但目标一致:主/规划用 Fable 5,执行/辅助用便宜模型。 每个工具的完整接入步骤见对应集成指南(那是配置的唯一真源),本节只讲各自实现分工的关键。

Claude Code —— 分工颗粒度最细

Claude Code 走 Anthropic 原生线(https://direct.evolink.ai),有多种方式实现分工,从最简单到最灵活: ① 环境变量(最快)
② settings.json 持久化(全局或项目级,一项目一套分工)
③ Subagent 分工(颗粒度最细) —— 在 .claude/agents/ 下为执行型子代理单独指定便宜模型,主循环 Fable 5 负责规划、唤起子代理执行,token 大头落到便宜模型:
最常见的配置错误:只设了主模型,以为子代理会自动用便宜的。 子代理默认继承主模型——如果不在 .claude/agents/*.md 里显式写 model:,每一次子代理的工具调用都会按 Fable 5 的价格计费。分工要真正省钱,这一行不能漏。
其它方式:会话内 /model 随时切、/model opusplan 开官方混合模式、claude --model claude-fable-5 启动指定。

Hermes Agent —— 主模型 + 14 个辅助槽

主模型配 config.yamlmodel.default,把 14 个辅助槽(上下文压缩、会话标题、网页摘要等)逐个指向便宜模型,让轻量任务不占主模型成本。

pi —— 带价格的多模型清单

~/.pi/agent/models.json 里配好带价格的多模型清单,会话内用 /model 切换规划/执行模型。

Kilo Code —— 多配置档案切换

建多个 OpenAI Compatible 档案(default=Fable 5 规划 / budget=Haiku 执行),切档即切模型。

Cline —— Plan/Act 双模型开关

Plan(规划)用 Fable 5、Act(执行)用便宜模型,是最直观的分工形态。推荐用”单网关 + 多 Model ID”规避双模式静默回落问题。
为什么每个工具的配置都指向单独的文档页? 因为配置细节(base_url、模型 ID、鉴权写法)只应有一个权威出处。本教程讲”怎么分工省钱”,具体每一步以各集成指南为准——避免你在不同地方看到不一致的配置而踩坑。

⚠️ 五个工具的鉴权写法各不相同(抄错就是 401)

这是实测踩出来的、多数教程不会告诉你的细节。别把一个工具的 Key 写法抄到另一个: 最反直觉的一点:pi 要你手动开 Bearer(authHeader: true),而 Kilo / Cline 是裸 key、工具自动加 Bearer——正好相反。

三、账算得过来(而且你能自己验证)

单位:美元 / 百万 tokens。 省钱来自两个叠加的杠杆:分工(把大部分 token 落到便宜模型)+ 缓存命中(命中时输入按约 0.1× 计费)。第一个杠杆稳定,第二个——得看命中率,这也是本篇最该讲诚实的地方。

别人只给你结论,我们教你自己验证

网上很多文章会甩一个震撼数字(“省 80%”、“25降到25 降到 1.40”)。问题是:你没法确认自己这套配置到底省了没有。 缓存这个杠杆尤其如此——它只在命中时生效。 所以本篇给你一个可操作的验证方法:看 API 响应里的 cache_read 字段。 命中缓存时,这个字段会有实际数值;没命中就是 0。你自己跑一次就知道真相,不用信任何人的宣传。
关于缓存,我们把话说全:命中率不是稳定的。 实测发现:小上下文的规划场景,预热后缓存能稳定命中,0.1× 折扣拿得到;但上下文越大(几十 K 的大仓库场景),命中率明显下降,这个折扣会打折。所以:
  • 不要把”缓存 0.1ד当成无条件的整体降价。
  • 稳定省钱的是分工这个杠杆;缓存是锦上添花、且要靠命中
  • 用上面的 cache_read 方法验证你自己的真实场景,而不是照搬别人的数字。

一个诚实的前提:分工不是万能的

分工在能清晰拆解、模糊度高或长周期的任务上收益最大;对于简单、直接的任务,直接用一个便宜模型跑完可能更划算,多一层规划反而是过度设计。有基准测试(如 Fabio Akita 的三轮对比)就发现:某些任务上,单用一个强模型的质量/成本反而优于混合方案。 结论:分工是工具不是信仰。拆得清、活儿重的任务用它;琐碎任务别硬套。这也是为什么我们教你验证而不是让你盲信。

一笔具体的账

此处放一个可复制、数字有出处的成本对照示例;避免与竞品雷同的数字,用我们自己实测场景。

四、只想省钱、不想折腾分工?

如果你暂时不配分工,EvoLink 的 Claude 全系列同样是 9 折入口,配一个 base_url 就能用官方同款模型、直接打折。随时可以回到本教程按工具做分工,进一步降本。
各工具的完整接入步骤见 集成指南。本教程讲”分工省钱”的工作流,具体配置以各集成指南为准(文档是唯一真源)。