这篇教程给你什么
“用贵模型规划、便宜模型执行”来省钱,你可能已经听过。这篇不重复讲道理,而是解决三件更实际的事:- 五个主流工具全覆盖 —— Claude Code、Hermes、pi、Kilo Code、Cline,每个工具怎么配出这套分工,都给可直接复制的配置和一页可落地的接入文档。
- 账你自己能验证 —— 不是”我说帮你省了多少”,而是教你看 API 响应里的
cache_read字段,亲手确认缓存到底命中没有、省了多少。 - 实测踩过的坑都告诉你 —— 五个工具的鉴权写法各不相同(抄错就是 401)、哪些开关不开会静默失败,这些都是真机跑出来的。
一、这套分工到底是什么
一句话:把”想清楚怎么做”和”把它做出来”交给不同的模型。- 规划(想清楚怎么做)——架构设计、拆解任务、审查方案,用能力最强的 Claude Fable 5。这部分 token 少,但最吃模型能力。
- 执行(把它做出来)——按计划改文件、批量编辑、跑工具,用便宜的 Haiku / Sonnet。这部分 token 多,但不需要顶级模型。
这个思路 Anthropic 官方也认可——Claude Code 内置的
/model opusplan 就是”规划用贵模型、执行自动降档”。本篇把它扩展成:规划用 Fable 5、执行用任意便宜模型,并且让这套分工在 Claude Code 之外的四个工具里也能复现。二、五个工具,一套分工
这是本篇的主线。五个工具实现分工的形态各不相同,但目标一致:主/规划用 Fable 5,执行/辅助用便宜模型。 每个工具的完整接入步骤见对应集成指南(那是配置的唯一真源),本节只讲各自实现分工的关键。Claude Code —— 分工颗粒度最细
Claude Code 走 Anthropic 原生线(https://direct.evolink.ai),有多种方式实现分工,从最简单到最灵活:
① 环境变量(最快)
.claude/agents/ 下为执行型子代理单独指定便宜模型,主循环 Fable 5 负责规划、唤起子代理执行,token 大头落到便宜模型:
/model 随时切、/model opusplan 开官方混合模式、claude --model claude-fable-5 启动指定。
- 完整接入与排错 → Claude Code 集成指南
Hermes Agent —— 主模型 + 14 个辅助槽
主模型配config.yaml 的 model.default,把 14 个辅助槽(上下文压缩、会话标题、网页摘要等)逐个指向便宜模型,让轻量任务不占主模型成本。
- 完整接入与排错 → Hermes 集成指南
pi —— 带价格的多模型清单
在~/.pi/agent/models.json 里配好带价格的多模型清单,会话内用 /model 切换规划/执行模型。
- 完整接入与排错 → pi 集成指南
Kilo Code —— 多配置档案切换
建多个 OpenAI Compatible 档案(default=Fable 5 规划 / budget=Haiku 执行),切档即切模型。
- 完整接入与排错 → Kilo Code VS Code 教程或 Kilo Code CLI 教程
Cline —— Plan/Act 双模型开关
Plan(规划)用 Fable 5、Act(执行)用便宜模型,是最直观的分工形态。推荐用”单网关 + 多 Model ID”规避双模式静默回落问题。- 完整接入与排错 → Cline 集成指南
为什么每个工具的配置都指向单独的文档页? 因为配置细节(base_url、模型 ID、鉴权写法)只应有一个权威出处。本教程讲”怎么分工省钱”,具体每一步以各集成指南为准——避免你在不同地方看到不一致的配置而踩坑。
⚠️ 五个工具的鉴权写法各不相同(抄错就是 401)
这是实测踩出来的、多数教程不会告诉你的细节。别把一个工具的 Key 写法抄到另一个:
最反直觉的一点:pi 要你手动开 Bearer(
authHeader: true),而 Kilo / Cline 是裸 key、工具自动加 Bearer——正好相反。
三、账算得过来(而且你能自己验证)
实付价(EvoLink 统一 9 折)
单位:美元 / 百万 tokens。
省钱来自两个叠加的杠杆:分工(把大部分 token 落到便宜模型)+ 缓存命中(命中时输入按约 0.1× 计费)。第一个杠杆稳定,第二个——得看命中率,这也是本篇最该讲诚实的地方。
别人只给你结论,我们教你自己验证
网上很多文章会甩一个震撼数字(“省 80%”、“1.40”)。问题是:你没法确认自己这套配置到底省了没有。 缓存这个杠杆尤其如此——它只在命中时生效。 所以本篇给你一个可操作的验证方法:看 API 响应里的cache_read 字段。 命中缓存时,这个字段会有实际数值;没命中就是 0。你自己跑一次就知道真相,不用信任何人的宣传。
一个诚实的前提:分工不是万能的
分工在能清晰拆解、模糊度高或长周期的任务上收益最大;对于简单、直接的任务,直接用一个便宜模型跑完可能更划算,多一层规划反而是过度设计。有基准测试(如 Fabio Akita 的三轮对比)就发现:某些任务上,单用一个强模型的质量/成本反而优于混合方案。 结论:分工是工具不是信仰。拆得清、活儿重的任务用它;琐碎任务别硬套。这也是为什么我们教你验证而不是让你盲信。一笔具体的账
此处放一个可复制、数字有出处的成本对照示例;避免与竞品雷同的数字,用我们自己实测场景。