
Gemini 3.6 Flash 四个思考档实测:每一档到底花多少钱
minimal档比默认的medium档便宜 73.6%,在我们那九道贴近生产的题上正确率同样是 9/9。如果你从没设过这个参数,这是你手上最大的一根成本杠杆。- 在默认档,思考 token 占了整张账单的 75%(这里已经把输入 token 算进分母)。四个档的答案长度几乎不变,所以档位之间的钱几乎全花在思考上。
low档不是"给一个小额思考预算"。 九次结构化抽取全部只花了 0 个思考 token,这一类任务上它和minimal一样便宜;但在工具调用和改代码上它照样思考。low档往上,多给思考预算没换来更多正确答案。 加难那一轮,minimal/low/medium/high四档的成绩分别是 15 题里对 2、10、10、8。- 默认档不是错的,只是没有针对性。 在你还不知道自己流量长什么样的时候,
medium是个合理的中间值。一旦你知道了,这个档位值得显式设置。 - 所有公开跑分都跑在
high档,而 API 默认是medium。这是两张不同的账单,也是两个不同的延迟。
一句话选档
下面是同一套九道题跑一遍,每个档花了多少钱,以及这笔钱花在哪种活上才值。
| 档位 | 跑一遍的花费 | 相对默认档 | 什么时候用 |
|---|---|---|---|
minimal | $0.0158 | 便宜 73.6% | 抽取、分类、路由、代码定位与修改,以及只需要按剧本走完的工具链 |
low | $0.0232 | 便宜 61.2% | 上面这些,再加上"中途可能出状况、需要模型自己补救"的多步工具调用 |
medium(默认) | $0.0598 | — | 你还不知道自己的流量长什么样,或者活的形态杂到定不下来 |
high | $0.0653 | 贵 9.3% | 留着。我们这套题上多给的预算基本没花出去,加难那一轮它的成绩还低于 medium |
minimal 对你的负载是安全的,只能说明它对我们这套题是安全的——我们这套题长什么样,下面写得很清楚。全网都没拆开的那个数:答案 token 和思考 token
发布当天我们能找到的所有关于这个模型的价格分析,都把输出 token 当成一个数。但这一个数里装着两样行为完全不同的东西。把它们拆开,这次发布周围的大部分混乱就解释清楚了。
下面是我们那九道题跑一遍的结果,输出侧拆成"你能读到的 token"和"你读不到的 token"。
| 配置 | 答案 token | 思考 token | 思考占输出比 | 跑一遍花费 | 判对 | 平均延迟 |
|---|---|---|---|---|---|---|
3.6 Flash minimal | 1,162 | 0 | 0% | $0.0158 | 9/9 | 2.8s |
3.6 Flash low | 1,056 | 1,095 | 51% | $0.0232 | 9/9 | 3.3s |
3.6 Flash medium(默认) | 1,080 | 5,944 | 85% | $0.0598 | 9/9 | 5.1s |
3.6 Flash high | 1,092 | 6,679 | 86% | $0.0653 | 9/9 | 5.3s |
3.5 Flash medium | 1,078 | 5,827 | 84% | $0.0692 | 9/9 | 5.1s |
3.5 Flash high | 1,113 | 7,185 | 87% | $0.0818 | 9/9 | 5.7s |
3.5 Flash-Lite minimal(默认) | 977 | 0 | 0% | $0.0036 | 8/9 | 1.8s |
3.5 Flash-Lite high | 1,097 | 8,288 | 88% | $0.0249 | 9/9 | 4.2s |
先看答案 token 那一列。跨两个模型、四个思考档、八种配置,它始终在 977 到 1,162 之间,波动不到 20%;而且这一列的最大值恰好属于最便宜的那个配置。也就是说,不管先想多久,模型写出来的答案长度差不多。
再看思考 token 那一列,从 0 一直到 8,288。你账单上的钱就是在这一列里变化的。
为了让这件事变成具体的钱,下面把每跑一遍拆成三笔:输入花了多少、答案花了多少、思考花了多少。按 Gemini 3.6 Flash 的标准档标价折算,输入 $1.50 / 100 万 token,输出 $7.50 / 100 万 token。
| 档位 | 输入 | 答案 | 思考 | 合计 | 思考占整张账单 |
|---|---|---|---|---|---|
minimal | $0.0071 | $0.0087 | $0.0000 | $0.0158 | 0% |
low | $0.0071 | $0.0079 | $0.0082 | $0.0232 | 35% |
medium | $0.0071 | $0.0081 | $0.0446 | $0.0598 | 75% |
high | $0.0071 | $0.0082 | $0.0501 | $0.0653 | 77% |
在默认档上,你付的钱有四分之三买的是你看不见的推理,而这些推理在这套题上并没有改变答案的对错。这不是模型的缺陷。这是一个通用默认值撞上一个具体负载之后的正常结果。
这也解释了为什么"新模型到底省不省 token"在公开讨论里会得到互相矛盾的答案。这个说法讲的是输出 token;输出 token 的大头是思考 token;思考 token 的多少取决于思考档位;而几乎没有人说自己测的是哪一档。一份不写档位的测量结果,别人复现不了。
我们怎么测的
两轮,都在 2026-07-21 跑完,也就是两个模型发布当天。
minimal 档补跑 3 次,用来检验分拣结论稳不稳,这是另外 60 次调用。第二轮合计 190 次调用,花了 $1.34。- 调用经 OpenRouter 发出,服务方锁定 Google AI Studio,串行不并发。网关不暴露请求由哪个地域承接,所以我们写不出地域,也不编。
- 钱按 Google 标准档标价自己折算,不用网关自己报的费用。网关走的是折扣档路由,两者混用会让我们的数字和 Google 公布的价格对不上。
- 没有设任何采样参数。
temperature、top_p、top_k在 Gemini 3.x 上已废弃,传了会被收下然后静默忽略。设了不会改变任何结果,只会显得我们没读文档。如果你线上还在设这几个参数,这次发布的其余接口变更见我们的 Gemini 3.6 Flash 上线说明。 - 判分是规则判的,不是人工判的。正确率在这里是辅助指标,作用只有一个:排除"低档便宜是因为它在偷懒少干活"这种解释。
- 每一次调用的答案 token 和思考 token 都分开记录,上面那几张表才有可能做出来。
high 档三次分别返回 331、538、347 个思考 token。所以跑 3 次取平均,对成本数字是必要的,对正确率是多余的。而到了第二轮,题目落在模型能力边界上,这种稳定性就完全消失了——这件事我们当成一条结论来写,不是当脚注。为什么公开跑分回答不了这个问题
有一个有据可查的原因:现在流传的跑分,测的档位往往不是生产环境实际在跑的档位,而且来源常常不写这一点。
- Artificial Analysis 目前是唯一一家有完整分项的独立评测方,他们测的是
high档。而 API 默认是medium。 - Google 自己那张 Gemini 3.5 Flash-Lite 的成绩表是在
high档下跑的,而这个模型的 API 默认档是minimal。照默认配置用,跑的根本不是那张表描述的实验。 - Google 的对比表里,DeepSWE 那一行 Gemini 3.5 Flash 用的是
medium档、Gemini 3.6 Flash 用的是high档,同一行里的两个 Gemini 不是同档位比较。 - Google 通稿里"DeepSWE 上最高 65%"说的是 token 用量的降幅上限,不是得分。DeepSWE 的得分是 49%。
以上这些不代表公开数字是错的。它们只是在回答另一个问题,而不是"我实际跑的那一档要花我多少钱"。
第一轮:四个档在普通任务上的表现
三条结论,按重要性排序。
minimal 是完全不思考,不是少思考。 思考 token 返回的是精确的 0,不是一个小数字。在我们跑的所有 Gemini 3.6 Flash minimal 档调用里,102 次有 101 次思考 token 精确等于 0。剩下那一次古怪到值得单开一节,见下文。与此同时正确率没变,还是 9/9,中位延迟从 5.1 秒降到 2.8 秒。在这套题上,默认档买到的只有一张 3.8 倍的账单和一个慢一倍的响应。high 档只比 medium 档贵 9.3%,因为多给的预算基本没花出去:思考量只从 5,944 涨到 6,679。这是关于这九道题的事实,不是关于这个模型的事实。换成真正需要更多推理的活,这个差距会拉开。别把这个比例搬进你自己的预算。medium 档便宜 13.6%,high 档便宜 20.1%。但这笔钱几乎全部来自输出单价从 $9.00 降到 $7.50,而不是来自 token 变少:medium 档我们的计费输出 token 反而多了 1.7%,high 档才少了 6.4%。这个省幅在你那边成不成立,取决于你的输入输出比——因为输入价一分没降。这套算术怎么按负载形态逐类算,我们的 Gemini 3.5 Flash 成本计算用上一代模型做了逐例演算。low 档是会看菜下饭的,不是固定给一小份预算
这是我们没预料到的结果,也是本文最能直接拿去用的一条。
low 档上,Gemini 3.6 Flash 把思考量在三类任务上分配得很不均匀。下面是每跑一遍的思考 token:| 任务类型 | minimal | low | medium | high |
|---|---|---|---|---|
| 结构化抽取 | 0 | 0 | 2,673 | 2,916 |
| 多轮工具调用 | 0 | 549 | 1,797 | 1,914 |
| 代码定位与修改 | 0 | 546 | 1,474 | 1,849 |
low 档全部返回精确的 0 个思考 token。这一类任务它花 $0.00490,minimal 花 $0.00489,差 0.2%。而在工具调用和改代码上,同一个档位每道题花了 100 到 440 个思考 token。low 档会在抽取那部分收你接近 minimal 的价钱,同时给剩下那部分留着推理余量。你不需要把流量拆成两套配置去分别调档,就能拿到大部分的省钱效果。在我们这套题上,这个组合比默认档便宜 61.2%。low 档在抽取任务上永远不思考"的系统,先拿你自己的 prompt 验一遍再说。第二轮:质量到底在哪一档开始掉
第一轮回答不了质量问题,因为八个配置全是 9/9——九道题不够难,分不开四个档。于是我们把题加难,而拿回来的答案,和"档位越高越聪明"这个直觉不一样。
minimal 档有 17 道三次全对。这 17 道里包括:一张发票上三处数字打架、要重算才能裁决的题;三条交错的请求记录、要串成一条失败链路的题;两份条款冲突、要套用"签署在后者优先"这条元规则的题;多币种多周期的换算题;一个跨两个函数的缓存键 bug;一个只在第 3 次调用才显形的限流器 bug。这些它一个思考 token 都没花就做对了,而且三次全对。 同样这些题在 high 档上要花 1,100 到 6,900 个思考 token。minimal 档全部三次全对,其中还包括一条八步长的工具链。下面是六个配置在这 3 道题上的成绩,每格跑 5 次。
| 配置 | 第 1 题 | 第 2 题 | 第 3 题 | 合计 | 单次成本 |
|---|---|---|---|---|---|
3.6 Flash minimal | 1/5 | 0/5 | 1/5 | 2/15 | $0.00175 |
3.6 Flash low | 4/5 | 1/5 | 5/5 | 10/15 | $0.00553 |
3.6 Flash medium(默认) | 5/5 | 5/5 | 0/5 | 10/15 | $0.00674 |
3.6 Flash high | 5/5 | 2/5 | 1/5 | 8/15 | $0.00739 |
3.5 Flash-Lite minimal(默认) | 4/5 | 5/5 | 0/5 | 9/15 | $0.00068 |
3.5 Flash-Lite high | 2/5 | 5/5 | 3/5 | 10/15 | $0.00262 |
成本一列已剔除下一节讲的那次异常调用;含它在内的数字在那一节给出。
minimal 到 low。 15 题对 2 变成 15 题对 10。再往上这条线就平了,然后往下拐:10、10、8。medium 才达标,high 又掉回 5 次对 2 次。第 3 题完全反过来:low 档 5 次全对,medium 档 5 次全错,high 档 5 次对 1 次——思考给得越多,这道题反而做得越差,而且是在每格 5 次的重复下稳定地更差。low 之后,我们测到的档位差异比同一配置的跑间随机波动还小。minimal 档补跑 3 次之后,20 道里有 17 道干净地确认了;但有一道分拣判"挂"的题补跑回来是 3 次对 1 次,这正是我们说的漂移。Gemini 3.6 Flash 低档 vs Gemini 3.5 Flash-Lite
low 档跑一遍 $0.0232,Gemini 3.5 Flash-Lite 的 high 档 $0.0249,两者都是 9/9。Gemini 3.6 Flash 的 low 档更快,平均延迟 3.3 秒对 4.2 秒;而且它拿到这个成绩只花了 1,095 个思考 token,Flash-Lite 花了 8,288 个。high 单次 $0.00262,Gemini 3.6 Flash low 单次 $0.00553。在那套题上,更便宜的模型使劲想,用不到一半的钱拿到了同样的成绩。同一批数据里还有两条观察,在你把 Flash-Lite 定为默认之前值得知道。
minimal 档在一道题上以一种可复现的方式失败了。 那是一条三步通知链,它调完前两个工具就停下,不发最后那封通知,三次全挂,而且三次的失败形态完全一致。这是第一轮 216 次调用里唯一一处质量差异。它同时复现了 Google 自己写明的一条短板: 默认的 minimal 档不适合当自主子智能体用,因为它会过早终止工具调用。如果你拿 Flash-Lite 跑 agent,要么提档,要么预期这种失败。minimal 档拿了 15 题对 9,Gemini 3.6 Flash 的 minimal 档只有 15 题对 2。而在第一轮那条通知链上关系正好反过来:Gemini 3.6 Flash 的 minimal 档三次全过,Flash-Lite 的 minimal 档三次全挂。这里没有强弱排序,只有两种不同形状的失效——在一个模型的流量上验证过安全的档位,换到另一个模型上不会自动也安全。一个只观察到、机制待查的异常
minimal 档的调用返回了 62,916 个思考 token。minimal 档调用返回的都是精确的 0。这一次用了 5 个工具轮次,输出量接近模型 65,536 token 的输出上限,耗时 209 秒,花了 $0.48。这大约是该档位其余调用单次成本的 270 倍,也几乎就是该配置整轮 15 次调用总花费 $0.50 的全部。 它同时也是 minimal 档唯一一次把那道题做对。minimal 档做预算的人都是有影响的。我们不给机制解释,因为我们没有;编一个听起来专业的说法比什么都不说更糟。Google 的模型卡里确实把"偶发的响应缓慢"列在已知局限里,但我们没有把握把那句话和这次观察连起来。minimal 档,请设最大输出 token 上限和超时。 "通常花 0 个思考 token"和"不可能花思考 token"是两回事。什么活用什么档
这是本文最该被抄走的一张表。每一行都有上面两轮实测支撑,支撑的边界写在表下面。
| 任务形状 | 建议档位 | 依据 |
|---|---|---|
| 单轮抽取、分类、问答、代码定位与修改 | minimal | 20 道加难题里 17 道三次全对;成本只有默认档的 26% |
| 多步工具调用,但只需要按剧本走完,或只需要"拒绝执行" | minimal 够用 | 八步长链、找批量中的例外、越权拒绝、在两个数据源里选权威的,全部三次全对 |
| 多步工具调用,中途要补一个剧本里没有的动作(重试、回退、前置拦截) | 至少 low | minimal 在这类题上 15 题对 2,low 跳到 15 题对 10 |
| 同上,但要求稳定 | 没有哪一档能解决 | low/medium/high 分别是 10、10、8(满分 15),差异被跑间随机性淹没。这类任务要在应用层做重试和校验 |
| 一套配置里混跑多种活 | low | 它在我们的抽取任务上花 0 个思考 token,同时给别的活留了余量,整体比默认档便宜 61.2% |
| 还不知道自己的流量构成 | 先 medium,然后去测 | 默认档是个合理的起点。只有在你确认不需要它之后,它才算贵 |
medium 档比 3.5 Flash 多用还是少用思考 token"这个问题,独立测评站 aibenchy 测出多 66.2%,我们测出多 2.0%。他们跑的是 22 道简答基准题,我们跑的是抽取、工具调用和改代码。同一个问题在两套任务集上给出了方向相反的答案。这不是一桩需要判谁对错的争议,这本身就是结论:某个档位省不省 token,是你负载的属性,不是模型的属性。怎么在你自己的流量上测
四步,按"多快能拿到答案"排序。
-
今天就把思考 token 单独记下来,先别改任何配置。 Google 的 API 在
total_thought_tokens字段里返回这个数。如果你只记录输出 token 总数,等账单变了,你分不清是 prompt 退化了还是模型这周想得更多了。from google import genai from google.genai import types client = genai.Client() # 从环境变量读取 API key response = client.models.generate_content( model="gemini-3.6-flash", contents=prompt, config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig(thinking_level="minimal"), ), ) log.info( "level=minimal thinking_tokens=%s", response.usage_metadata.total_thought_tokens, )把思考 token 作为独立字段存在你现有的输出 token 指标旁边,同时把你传的档位也存下来。两个 token 数加在一起,就丢掉了唯一能告诉你"是哪一个变了"的信号。 -
显式设置档位,哪怕你就是要设成
medium。 一个继承来的默认值,等于一个没人做过的成本决策;而且默认值本身变动的时候,你的账单会跟着变。 -
拿一天的真实流量在
minimal和low上各重放一遍,然后拿输出和你现在的输出比,而不是和某个跑分比。在我们这套题上,这一步值 61% 到 74% 的账单——比这个档次里任何一次换模型的效果都大。 -
把工具调用那条路径单独判分。 那是我们唯一发现档位会改变正确率的地方;和抽取流量混在一起平均,会把它盖掉。
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.evolink.ai/v1",
api_key=os.environ["EVOLINK_API_KEY"],
)
for model in ("gemini-3.6-flash", "gemini-3.5-flash-lite"):
response = client.chat.completions.create(model=model, messages=messages)
record(model, response.usage)常见问题
medium。可选值是 minimal、low、medium、high。Gemini 3.5 Flash-Lite 的默认档是 minimal,所以两个模型开箱行为差别很大。minimal 是能设的最低档,Google 的文档把这个模型的思考描述为默认开启,不是一个能关掉的开关。实测上,minimal 在我们 102 次调用里有 101 次返回精确的 0 个思考 token,就计费而言在绝大多数请求上等同于关闭。剩下那一次的情况见上文——正因为有这一次,我们不会把它说成一个保证。minimal 比默认档便宜多少?
在我们那九道题上,每跑一遍便宜 73.6%,正确率同样是 9/9,延迟大约减半。你的比例取决于你的活在 medium 档上会让模型想多久,所以这个数字的用法是"值得去测一测",不是"拿去做预算"。minimal 到 low 在多步工具调用上确有一次真实跃升,15 题对 2 变成 15 题对 10。但 low 往上是 10、10、8,而且有一道题在更高档位上稳定地更差(每格 5 次重复)。至于单轮的重推理任务,minimal 一个思考 token 不花就做对了 20 道加难题里的 17 道。high 档。Google 那张 Flash-Lite 成绩表也是 high 档跑的,而该模型 API 默认是 minimal。如果你跑的是默认配置,那你跑的就不是那些数字所描述的配置。total_thought_tokens。把它作为一个独立字段记在输出 token 旁边,别加在一起——加在一起,以后成本变了你归不了因。参考来源
- Gemini 思考功能文档,Google:
thinking_level的取值、各模型默认档、"响应计费为输出 token 与思考 token 之和"的表述,以及total_thought_tokens字段 - Gemini API 模型文档,Google
- Gemini API 定价,Google
- Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber,Google,2026-07-21
- Gemini 3.6 Flash,Google DeepMind:模型已知局限
- Gemini 3.6 Flash and Gemini 3.5 Flash-Lite: Halving Time per Task,Artificial Analysis,2026-07-21
- aibenchy,独立的 22 题实测,2026-07-21
- EvoLink 一手实测,2026-07-21:两轮共 406 次调用,逐次记录保留


