> ## Documentation Index
> Fetch the complete documentation index at: https://evolink.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# 五个工具，一套省钱分工，账你自己能验证

> Claude Code、Hermes、pi、Kilo Code、Cline —— 用 Claude Fable 5 规划、便宜模型执行，每个工具都有可落地的配置，每一分钱都能自己核对

## 这篇教程给你什么

"用贵模型规划、便宜模型执行"来省钱，你可能已经听过。这篇不重复讲道理，而是解决三件更实际的事：

1. **五个主流工具全覆盖** —— Claude Code、Hermes、pi、Kilo Code、Cline，每个工具怎么配出这套分工，都给可直接复制的配置和一页可落地的接入文档。
2. **账你自己能验证** —— 不是"我说帮你省了多少"，而是教你看 API 响应里的 `cache_read` 字段，亲手确认缓存到底命中没有、省了多少。
3. **实测踩过的坑都告诉你** —— 五个工具的鉴权写法各不相同（抄错就是 401）、哪些开关不开会静默失败，这些都是真机跑出来的。

## 一、这套分工到底是什么

一句话：**把"想清楚怎么做"和"把它做出来"交给不同的模型。**

* **规划**（想清楚怎么做）——架构设计、拆解任务、审查方案，用能力最强的 **Claude Fable 5**。这部分 token 少，但最吃模型能力。
* **执行**（把它做出来）——按计划改文件、批量编辑、跑工具，用便宜的 **Haiku / Sonnet**。这部分 token 多，但不需要顶级模型。

大部分编程工作是"一点难推理，包在大量机械执行外面"。把机械执行从贵模型上挪走，账就下来了。

<Note>
  这个思路 Anthropic 官方也认可——Claude Code 内置的 `/model opusplan` 就是"规划用贵模型、执行自动降档"。本篇把它扩展成：规划用 Fable 5、执行用任意便宜模型，并且让这套分工在 Claude Code 之外的四个工具里也能复现。
</Note>

## 二、五个工具，一套分工

这是本篇的主线。五个工具实现分工的形态各不相同，但目标一致：**主/规划用 Fable 5，执行/辅助用便宜模型。** 每个工具的完整接入步骤见对应集成指南（那是配置的唯一真源），本节只讲各自实现分工的关键。

### Claude Code —— 分工颗粒度最细

Claude Code 走 Anthropic 原生线（`https://direct.evolink.ai`），有多种方式实现分工，从最简单到最灵活：

**① 环境变量（最快）**

```bash theme={null}
export ANTHROPIC_BASE_URL=https://direct.evolink.ai
export ANTHROPIC_AUTH_TOKEN=你的EvoLink_API_Key
export ANTHROPIC_MODEL=claude-fable-5                        # 主/规划模型
export ANTHROPIC_SMALL_FAST_MODEL=claude-haiku-4-5-20251001  # 后台/轻量任务
```

**② settings.json 持久化**（全局或项目级，一项目一套分工）

```json theme={null}
{
  "env": {
    "ANTHROPIC_BASE_URL": "https://direct.evolink.ai",
    "ANTHROPIC_AUTH_TOKEN": "你的EvoLink_API_Key",
    "ANTHROPIC_MODEL": "claude-fable-5",
    "ANTHROPIC_SMALL_FAST_MODEL": "claude-haiku-4-5-20251001"
  }
}
```

**③ Subagent 分工（颗粒度最细）** —— 在 `.claude/agents/` 下为执行型子代理单独指定便宜模型，主循环 Fable 5 负责规划、唤起子代理执行，token 大头落到便宜模型：

```markdown theme={null}
---
name: executor
description: 执行型子代理，负责具体编码与工具调用
model: claude-haiku-4-5-20251001
---

（子代理的系统提示词……）
```

<Warning>
  **最常见的配置错误：只设了主模型，以为子代理会自动用便宜的。** 子代理默认继承主模型——如果不在 `.claude/agents/*.md` 里显式写 `model:`，每一次子代理的工具调用都会按 Fable 5 的价格计费。分工要真正省钱，这一行不能漏。
</Warning>

其它方式：会话内 `/model` 随时切、`/model opusplan` 开官方混合模式、`claude --model claude-fable-5` 启动指定。

* 完整接入与排错 → [Claude Code 集成指南](/docs/cn/integration-guide/claude-code-cli)

### Hermes Agent —— 主模型 + 14 个辅助槽

主模型配 `config.yaml` 的 `model.default`，把 14 个辅助槽（上下文压缩、会话标题、网页摘要等）逐个指向便宜模型，让轻量任务不占主模型成本。

* 完整接入与排错 → [Hermes 集成指南](/docs/cn/integration-guide/hermes)

### pi —— 带价格的多模型清单

在 `~/.pi/agent/models.json` 里配好带价格的多模型清单，会话内用 `/model` 切换规划/执行模型。

* 完整接入与排错 → [pi 集成指南](/docs/cn/integration-guide/pi)

### Kilo Code —— 多配置档案切换

建多个 OpenAI Compatible 档案（`default`=Fable 5 规划 / `budget`=Haiku 执行），切档即切模型。

* 完整接入与排错 → [Kilo Code VS Code 教程](/docs/cn/integration-guide/kilo-code-vscode)或 [Kilo Code CLI 教程](/docs/cn/integration-guide/kilo-code-cli)

### Cline —— Plan/Act 双模型开关

**Plan（规划）用 Fable 5、Act（执行）用便宜模型**，是最直观的分工形态。推荐用"单网关 + 多 Model ID"规避双模式静默回落问题。

* 完整接入与排错 → [Cline 集成指南](/docs/cn/integration-guide/cline)

<Note>
  **为什么每个工具的配置都指向单独的文档页？** 因为配置细节（base\_url、模型 ID、鉴权写法）只应有一个权威出处。本教程讲"怎么分工省钱"，具体每一步以各集成指南为准——避免你在不同地方看到不一致的配置而踩坑。
</Note>

### ⚠️ 五个工具的鉴权写法各不相同（抄错就是 401）

这是实测踩出来的、多数教程不会告诉你的细节。**别把一个工具的 Key 写法抄到另一个：**

| 工具          | 协议线          | Key 写法                                                         | 抄错的后果                             |
| ----------- | ------------ | -------------------------------------------------------------- | --------------------------------- |
| Claude Code | Anthropic 原生 | `ANTHROPIC_AUTH_TOKEN`（Bearer）或 `ANTHROPIC_API_KEY`（x-api-key） | —                                 |
| Hermes      | OpenAI 兼容    | `api_key` + 必填 `api_mode: chat_completions`                    | 漏 api\_mode → "no final response" |
| **pi**      | OpenAI 兼容    | 裸 key + **手动** `authHeader: true`                              | 漏了 → 401                          |
| **Kilo**    | OpenAI 兼容    | **裸 key，自动加 Bearer**                                           | 手填 `Bearer ` 前缀 → 双 Bearer → 401  |
| **Cline**   | OpenAI 兼容    | **裸 key，自动加 Bearer**，无尾空格                                      | 带前缀/空格 → 401                      |

**最反直觉的一点**：pi 要你**手动开** Bearer（`authHeader: true`），而 Kilo / Cline 是**裸 key、工具自动加** Bearer——正好相反。

## 三、账算得过来（而且你能自己验证）

### 实付价（EvoLink 统一 9 折）

单位：美元 / 百万 tokens。

| 模型                          | Input  | Output  | Cache Read | Cache Write | 上下文       | Max Out |
| --------------------------- | ------ | ------- | ---------- | ----------- | --------- | ------- |
| `claude-fable-5`            | \$9.00 | \$45.00 | \$0.90     | \$11.25     | 1,000,000 | 128,000 |
| `claude-sonnet-5`           | \$2.70 | \$13.50 | \$0.27     | \$3.375     | 1,000,000 | 64,000  |
| `claude-haiku-4-5-20251001` | \$0.90 | \$4.50  | \$0.09     | \$1.125     | 200,000   | 64,000  |

省钱来自两个叠加的杠杆：**分工**（把大部分 token 落到便宜模型）+ **缓存命中**（命中时输入按约 0.1× 计费）。第一个杠杆稳定，第二个——**得看命中率，这也是本篇最该讲诚实的地方。**

### 别人只给你结论，我们教你自己验证

网上很多文章会甩一个震撼数字（"省 80%"、"$25 降到 $1.40"）。问题是：**你没法确认自己这套配置到底省了没有。** 缓存这个杠杆尤其如此——它只在命中时生效。

所以本篇给你一个可操作的验证方法：**看 API 响应里的 `cache_read` 字段。** 命中缓存时，这个字段会有实际数值；没命中就是 0。你自己跑一次就知道真相，不用信任何人的宣传。

<Warning>
  **关于缓存，我们把话说全：命中率不是稳定的。** 实测发现：小上下文的规划场景，预热后缓存能稳定命中，0.1× 折扣拿得到；但**上下文越大（几十 K 的大仓库场景），命中率明显下降**，这个折扣会打折。所以：

  * 不要把"缓存 0.1×"当成无条件的整体降价。
  * 稳定省钱的是**分工**这个杠杆；缓存是**锦上添花、且要靠命中**。
  * 用上面的 `cache_read` 方法验证你自己的真实场景，而不是照搬别人的数字。
</Warning>

### 一个诚实的前提：分工不是万能的

分工在**能清晰拆解、模糊度高或长周期**的任务上收益最大；对于**简单、直接的任务**，直接用一个便宜模型跑完可能更划算，多一层规划反而是过度设计。有基准测试（如 Fabio Akita 的三轮对比）就发现：某些任务上，单用一个强模型的质量/成本反而优于混合方案。

**结论**：分工是工具不是信仰。拆得清、活儿重的任务用它；琐碎任务别硬套。这也是为什么我们教你**验证**而不是让你盲信。

### 一笔具体的账

> *此处放一个可复制、数字有出处的成本对照示例；避免与竞品雷同的数字，用我们自己实测场景。*

## 四、只想省钱、不想折腾分工？

如果你暂时不配分工，EvoLink 的 Claude 全系列同样是 9 折入口，配一个 base\_url 就能用官方同款模型、直接打折。随时可以回到本教程按工具做分工，进一步降本。

<Tip>
  各工具的完整接入步骤见 [集成指南](/docs/cn/integration-guide/claude-code-cli)。本教程讲"分工省钱"的工作流，具体配置以各集成指南为准（文档是唯一真源）。
</Tip>

<div style={{ height: "60vh" }} aria-hidden="true" />
