MiniMax H3(海螺 3.0)已上线 EvoLink领 10 积分免费试
Gemini 3.6 Flash 四档思考级别形成逐级扩大的推理门
analysis

Gemini 3.6 Flash 四个思考档实测:每一档到底花多少钱

Jacey
Jacey
2026年7月22日
37 分钟阅读
Last verified: 2026-07-21。作者:EvoLink 模型研究团队。本文的数字来自我们在模型发布当天跑的 406 次 API 调用,测法在下文完整交代。EvoLink 为生产环境团队做 AI 模型基础设施,本文实测的模型也在其上运行。
先说结论
  • minimal 档比默认的 medium 档便宜 73.6%,在我们那九道贴近生产的题上正确率同样是 9/9。如果你从没设过这个参数,这是你手上最大的一根成本杠杆。
  • 在默认档,思考 token 占了整张账单的 75%(这里已经把输入 token 算进分母)。四个档的答案长度几乎不变,所以档位之间的钱几乎全花在思考上。
  • low 档不是"给一个小额思考预算"。 九次结构化抽取全部只花了 0 个思考 token,这一类任务上它和 minimal 一样便宜;但在工具调用和改代码上它照样思考。
  • low 档往上,多给思考预算没换来更多正确答案。 加难那一轮,minimallowmediumhigh 四档的成绩分别是 15 题里对 2、10、10、8。
  • 默认档不是错的,只是没有针对性。 在你还不知道自己流量长什么样的时候,medium 是个合理的中间值。一旦你知道了,这个档位值得显式设置。
  • 所有公开跑分都跑在 high,而 API 默认是 medium。这是两张不同的账单,也是两个不同的延迟。

一句话选档

思考档位是 Gemini 3.6 Flash 请求里最大的一个成本变量,比"选 3.6 Flash 还是 3.5 Flash"影响还大。原因是思考 token 按输出价计费,而在默认档下它的数量大约是答案 token 的六倍。

下面是同一套九道题跑一遍,每个档花了多少钱,以及这笔钱花在哪种活上才值。

档位跑一遍的花费相对默认档什么时候用
minimal$0.0158便宜 73.6%抽取、分类、路由、代码定位与修改,以及只需要按剧本走完的工具链
low$0.0232便宜 61.2%上面这些,再加上"中途可能出状况、需要模型自己补救"的多步工具调用
medium(默认)$0.0598你还不知道自己的流量长什么样,或者活的形态杂到定不下来
high$0.0653贵 9.3%留着。我们这套题上多给的预算基本没花出去,加难那一轮它的成绩还低于 medium
这张表有一件事说不了:它没法证明 minimal 对你的负载是安全的,只能说明它对我们这套题是安全的——我们这套题长什么样,下面写得很清楚。

全网都没拆开的那个数:答案 token 和思考 token

发布当天我们能找到的所有关于这个模型的价格分析,都把输出 token 当成一个数。但这一个数里装着两样行为完全不同的东西。把它们拆开,这次发布周围的大部分混乱就解释清楚了。

下面是我们那九道题跑一遍的结果,输出侧拆成"你能读到的 token"和"你读不到的 token"。

配置答案 token思考 token思考占输出比跑一遍花费判对平均延迟
3.6 Flash minimal1,16200%$0.01589/92.8s
3.6 Flash low1,0561,09551%$0.02329/93.3s
3.6 Flash medium(默认)1,0805,94485%$0.05989/95.1s
3.6 Flash high1,0926,67986%$0.06539/95.3s
3.5 Flash medium1,0785,82784%$0.06929/95.1s
3.5 Flash high1,1137,18587%$0.08189/95.7s
3.5 Flash-Lite minimal(默认)97700%$0.00368/91.8s
3.5 Flash-Lite high1,0978,28888%$0.02499/94.2s

先看答案 token 那一列。跨两个模型、四个思考档、八种配置,它始终在 977 到 1,162 之间,波动不到 20%;而且这一列的最大值恰好属于最便宜的那个配置。也就是说,不管先想多久,模型写出来的答案长度差不多。

再看思考 token 那一列,从 0 一直到 8,288。你账单上的钱就是在这一列里变化的。

为了让这件事变成具体的钱,下面把每跑一遍拆成三笔:输入花了多少、答案花了多少、思考花了多少。按 Gemini 3.6 Flash 的标准档标价折算,输入 $1.50 / 100 万 token,输出 $7.50 / 100 万 token。

档位输入答案思考合计思考占整张账单
minimal$0.0071$0.0087$0.0000$0.01580%
low$0.0071$0.0079$0.0082$0.023235%
medium$0.0071$0.0081$0.0446$0.059875%
high$0.0071$0.0082$0.0501$0.065377%

在默认档上,你付的钱有四分之三买的是你看不见的推理,而这些推理在这套题上并没有改变答案的对错。这不是模型的缺陷。这是一个通用默认值撞上一个具体负载之后的正常结果。

这也解释了为什么"新模型到底省不省 token"在公开讨论里会得到互相矛盾的答案。这个说法讲的是输出 token;输出 token 的大头是思考 token;思考 token 的多少取决于思考档位;而几乎没有人说自己测的是哪一档。一份不写档位的测量结果,别人复现不了。

我们怎么测的

两轮,都在 2026-07-21 跑完,也就是两个模型发布当天。

第一轮:四个档在普通生产任务上各花多少钱。 九道题,分三类各三道。结构化抽取(一张发票、一段日志、一个商品页的 HTML)。多轮工具调用(3–5 步,工具是模拟的)。代码定位与修改(给一段 bug 描述,要求产出能跑的补丁)。输入大约在 1,000 到 4,000 token 之间,也就是说这一轮覆盖的是常规请求体量,完全不覆盖长上下文场景。每道题在八种"模型 + 思考档"配置上各跑 3 次,共 216 次调用,花了 $1.03。
第二轮:质量到底在哪一档开始掉。 我们另写了 20 道刻意加难的题,覆盖矛盾裁决、跨条目关联、多步换算、跨函数 bug,以及更长的工具链。每道题先在最弱配置和最强配置上各跑 1 次做难度分拣——只有"最弱挂、最强过"的题才含有区分档位的信息,全对或全错的题说明不了任何问题。20 道里只有 3 道过了这一关。这 3 道在六种配置上各跑 5 次,共 90 次调用。之后我们把 20 道题全部在 minimal 档补跑 3 次,用来检验分拣结论稳不稳,这是另外 60 次调用。第二轮合计 190 次调用,花了 $1.34。
下面这些条件适用于本文每一个数字。
  • 调用经 OpenRouter 发出,服务方锁定 Google AI Studio,串行不并发。网关不暴露请求由哪个地域承接,所以我们写不出地域,也不编。
  • 钱按 Google 标准档标价自己折算,不用网关自己报的费用。网关走的是折扣档路由,两者混用会让我们的数字和 Google 公布的价格对不上。
  • 没有设任何采样参数。temperaturetop_ptop_k 在 Gemini 3.x 上已废弃,传了会被收下然后静默忽略。设了不会改变任何结果,只会显得我们没读文档。如果你线上还在设这几个参数,这次发布的其余接口变更见我们的 Gemini 3.6 Flash 上线说明
  • 判分是规则判的,不是人工判的。正确率在这里是辅助指标,作用只有一个:排除"低档便宜是因为它在偷懒少干活"这种解释。
  • 每一次调用的答案 token 和思考 token 都分开记录,上面那几张表才有可能做出来。
关于重复跑,有一点必须如实交代。 第一轮里,同一道题三次重复的正确率零处不一致——每个配置每一轮的判对结果都一样。但思考 token 的跑间波动有 6% 到 51%:某道代码题在 high 档三次分别返回 331、538、347 个思考 token。所以跑 3 次取平均,对成本数字是必要的,对正确率是多余的。而到了第二轮,题目落在模型能力边界上,这种稳定性就完全消失了——这件事我们当成一条结论来写,不是当脚注。

为什么公开跑分回答不了这个问题

有一个有据可查的原因:现在流传的跑分,测的档位往往不是生产环境实际在跑的档位,而且来源常常不写这一点。

  • Artificial Analysis 目前是唯一一家有完整分项的独立评测方,他们测的是 high 档。而 API 默认是 medium
  • Google 自己那张 Gemini 3.5 Flash-Lite 的成绩表是在 high 档下跑的,而这个模型的 API 默认档是 minimal。照默认配置用,跑的根本不是那张表描述的实验。
  • Google 的对比表里,DeepSWE 那一行 Gemini 3.5 Flash 用的是 medium 档、Gemini 3.6 Flash 用的是 high 档,同一行里的两个 Gemini 不是同档位比较。
  • Google 通稿里"DeepSWE 上最高 65%"说的是 token 用量的降幅上限,不是得分。DeepSWE 的得分是 49%。
被引用最多的那个效率数字也有类似的问题。Google 称新模型的输出 token 少了约 17%,这个数字是它引用 Artificial Analysis 的,Google 自己没测;而 AA 同一个页面上给出的绝对值(5,900 万对 7,500 万)算出来是 21.3%。两个数对不上,公开渠道没有解释,而且两者都没说测的是哪一档、跑的是什么任务集。我们在自己的工作里一律取更保守的 17%,并且把它当成一个算术输入,不当成一份测量结果。

以上这些不代表公开数字是错的。它们只是在回答另一个问题,而不是"我实际跑的那一档要花我多少钱"。

第一轮:四个档在普通任务上的表现

三条结论,按重要性排序。

minimal 是完全不思考,不是少思考。 思考 token 返回的是精确的 0,不是一个小数字。在我们跑的所有 Gemini 3.6 Flash minimal 档调用里,102 次有 101 次思考 token 精确等于 0。剩下那一次古怪到值得单开一节,见下文。与此同时正确率没变,还是 9/9,中位延迟从 5.1 秒降到 2.8 秒。在这套题上,默认档买到的只有一张 3.8 倍的账单和一个慢一倍的响应。
high 档只比 medium 档贵 9.3%,因为多给的预算基本没花出去:思考量只从 5,944 涨到 6,679。这是关于这九道题的事实,不是关于这个模型的事实。换成真正需要更多推理的活,这个差距会拉开。别把这个比例搬进你自己的预算。
新模型的每一档都比 3.5 Flash 的同档便宜medium 档便宜 13.6%,high 档便宜 20.1%。但这笔钱几乎全部来自输出单价从 $9.00 降到 $7.50,而不是来自 token 变少:medium 档我们的计费输出 token 反而多了 1.7%,high 档才少了 6.4%。这个省幅在你那边成不成立,取决于你的输入输出比——因为输入价一分没降。这套算术怎么按负载形态逐类算,我们的 Gemini 3.5 Flash 成本计算用上一代模型做了逐例演算。

low 档是会看菜下饭的,不是固定给一小份预算

这是我们没预料到的结果,也是本文最能直接拿去用的一条。

low 档上,Gemini 3.6 Flash 把思考量在三类任务上分配得很不均匀。下面是每跑一遍的思考 token:
任务类型minimallowmediumhigh
结构化抽取002,6732,916
多轮工具调用05491,7971,914
代码定位与修改05461,4741,849
三道抽取题、每道三次重复,low 档全部返回精确的 0 个思考 token。这一类任务它花 $0.00490,minimal 花 $0.00489,差 0.2%。而在工具调用和改代码上,同一个档位每道题花了 100 到 440 个思考 token。
这意味着什么: 如果你的流量是"抽取 + 多步任务"混在一起、共用一套模型配置,那么 low 档会在抽取那部分收你接近 minimal 的价钱,同时给剩下那部分留着推理余量。你不需要把流量拆成两套配置去分别调档,就能拿到大部分的省钱效果。在我们这套题上,这个组合比默认档便宜 61.2%。
边界要说清楚。 这是"一个档位在某一天、九道题上做了什么"的观察记录,不是 Google 描述过的模型行为。我们只报告观察到的现象,不声称知道背后的机制。如果你要做一个"赌 low 档在抽取任务上永远不思考"的系统,先拿你自己的 prompt 验一遍再说。

第二轮:质量到底在哪一档开始掉

第一轮回答不了质量问题,因为八个配置全是 9/9——九道题不够难,分不开四个档。于是我们把题加难,而拿回来的答案,和"档位越高越聪明"这个直觉不一样。

先说分拣阶段的结果,它本身就是一条结论。 20 道刻意加难的题里,minimal 档有 17 道三次全对。这 17 道里包括:一张发票上三处数字打架、要重算才能裁决的题;三条交错的请求记录、要串成一条失败链路的题;两份条款冲突、要套用"签署在后者优先"这条元规则的题;多币种多周期的换算题;一个跨两个函数的缓存键 bug;一个只在第 3 次调用才显形的限流器 bug。这些它一个思考 token 都没花就做对了,而且三次全对。 同样这些题在 high 档上要花 1,100 到 6,900 个思考 token。
所以思考档位买不到推理正确率,至少在这些题所处的难度区间里买不到。它买到的是另一样更窄的东西。
真正把四个档分开的那 3 道题,全部是多轮工具调用,而且形态一致:中途出了状况,模型必须自己补一个原计划里没有的动作。 一道要先拦截在途包裹才能改地址;一道要在收到限流响应后重试一次;一道要在加急运单打印失败后把原运单恢复回去。相反,"该拒绝就拒绝"(越权、政策不允许)和"在给出的选项里选对"(找出批量中的例外、改用备用接口、在两个数据源里选权威的)这两类题,minimal 档全部三次全对,其中还包括一条八步长的工具链。

下面是六个配置在这 3 道题上的成绩,每格跑 5 次。

配置第 1 题第 2 题第 3 题合计单次成本
3.6 Flash minimal1/50/51/52/15$0.00175
3.6 Flash low4/51/55/510/15$0.00553
3.6 Flash medium(默认)5/55/50/510/15$0.00674
3.6 Flash high5/52/51/58/15$0.00739
3.5 Flash-Lite minimal(默认)4/55/50/59/15$0.00068
3.5 Flash-Lite high2/55/53/510/15$0.00262

成本一列已剔除下一节讲的那次异常调用;含它在内的数字在那一节给出。

真正的跃升只有一处,就是从 minimallow 15 题对 2 变成 15 题对 10。再往上这条线就平了,然后往下拐:10、10、8。
逐题看比合计更乱。 第 1 题是干净的单调上升。第 2 题要到 medium 才达标,high 又掉回 5 次对 2 次。第 3 题完全反过来:low 档 5 次全对,medium 档 5 次全错,high 档 5 次对 1 次——思考给得越多,这道题反而做得越差,而且是在每格 5 次的重复下稳定地更差。
我们不解释为什么,因为我们不知道。 这组数据支持的是一个更窄、也更站得住的说法:在模型能力边界上的任务,档位不是一个能往上拧的质量旋钮。 过了 low 之后,我们测到的档位差异比同一配置的跑间随机波动还小。
这种不稳定本身是本文最能迁移到别处的一条发现。 第一轮 216 次调用里,同一道题三次重复的正确率零处不一致。第二轮里,表格中大多数格子是 1/5、2/5、4/5 这种中间值——同一个请求、同一个档位,发 5 次给出不同结果。所以任何"每个配置跑一次就宣布哪个档更好"的测评都不可信,这句话也包括我们自己那轮难度分拣,它按设计每个配置只跑了 1 次。我们把分拣过的题在 minimal 档补跑 3 次之后,20 道里有 17 道干净地确认了;但有一道分拣判"挂"的题补跑回来是 3 次对 1 次,这正是我们说的漂移。
这条给工程上的启示比选档建议更有用: 如果你的 agent 需要从意外状态里恢复,请把重试和校验做进应用层,把思考档位当成一个成本设置,而不是当成"让恢复变可靠"的那个东西。

Gemini 3.6 Flash 低档 vs Gemini 3.5 Flash-Lite

这组对比我们在公开渠道找不到任何数据,而它恰恰是一个在意成本的团队真正要做的选择:花差不多的钱,你是让更强的模型少想一点,还是让更便宜的模型使劲想?
第一轮上,两者花的钱几乎一样。 Gemini 3.6 Flash 的 low 档跑一遍 $0.0232,Gemini 3.5 Flash-Lite 的 high 档 $0.0249,两者都是 9/9。Gemini 3.6 Flash 的 low 档更快,平均延迟 3.3 秒对 4.2 秒;而且它拿到这个成绩只花了 1,095 个思考 token,Flash-Lite 花了 8,288 个。
第二轮那三道更难的工具调用题上,两者又打平了,都是 15 题对 10,但价格拉开了:Flash-Lite high 单次 $0.00262,Gemini 3.6 Flash low 单次 $0.00553。在那套题上,更便宜的模型使劲想,用不到一半的钱拿到了同样的成绩。
这两幅图哪一幅适用于你,取决于你的任务构成——这是老实话,不是和稀泥。这两个配置在我们两轮测试里都处在同一个成绩带上,但它们之间的价格关系在不同任务集上并不稳定。

同一批数据里还有两条观察,在你把 Flash-Lite 定为默认之前值得知道。

Flash-Lite 的默认 minimal 档在一道题上以一种可复现的方式失败了。 那是一条三步通知链,它调完前两个工具就停下,不发最后那封通知,三次全挂,而且三次的失败形态完全一致。这是第一轮 216 次调用里唯一一处质量差异。它同时复现了 Google 自己写明的一条短板: 默认的 minimal 档不适合当自主子智能体用,因为它会过早终止工具调用。如果你拿 Flash-Lite 跑 agent,要么提档,要么预期这种失败。
两个模型的最低档失效方式不同,谁也不是全面更强。 在第二轮那三道工具调用题上,Flash-Lite 的 minimal 档拿了 15 题对 9,Gemini 3.6 Flash 的 minimal 档只有 15 题对 2。而在第一轮那条通知链上关系正好反过来:Gemini 3.6 Flash 的 minimal 档三次全过,Flash-Lite 的 minimal 档三次全挂。这里没有强弱排序,只有两种不同形状的失效——在一个模型的流量上验证过安全的档位,换到另一个模型上不会自动也安全。

一个只观察到、机制待查的异常

第二轮里,有一次 minimal 档的调用返回了 62,916 个思考 token。
我们数据里其他所有 minimal 档调用返回的都是精确的 0。这一次用了 5 个工具轮次,输出量接近模型 65,536 token 的输出上限,耗时 209 秒,花了 $0.48。这大约是该档位其余调用单次成本的 270 倍,也几乎就是该配置整轮 15 次调用总花费 $0.50 的全部。 它同时也是 minimal 档唯一一次把那道题做对。
我们把它写出来,是因为它确实发生了,而且对任何按 minimal 档做预算的人都是有影响的。我们不给机制解释,因为我们没有;编一个听起来专业的说法比什么都不说更糟。Google 的模型卡里确实把"偶发的响应缓慢"列在已知局限里,但我们没有把握把那句话和这次观察连起来。
不解释机制也不影响这条运维结论:如果你在工具调用类任务上跑 minimal 档,请设最大输出 token 上限和超时。 "通常花 0 个思考 token"和"不可能花思考 token"是两回事。

什么活用什么档

这是本文最该被抄走的一张表。每一行都有上面两轮实测支撑,支撑的边界写在表下面。

任务形状建议档位依据
单轮抽取、分类、问答、代码定位与修改minimal20 道加难题里 17 道三次全对;成本只有默认档的 26%
多步工具调用,但只需要按剧本走完,或只需要"拒绝执行"minimal 够用八步长链、找批量中的例外、越权拒绝、在两个数据源里选权威的,全部三次全对
多步工具调用,中途要补一个剧本里没有的动作(重试、回退、前置拦截)至少 lowminimal 在这类题上 15 题对 2,low 跳到 15 题对 10
同上,但要求稳定没有哪一档能解决lowmediumhigh 分别是 10、10、8(满分 15),差异被跑间随机性淹没。这类任务要在应用层做重试和校验
一套配置里混跑多种活low它在我们的抽取任务上花 0 个思考 token,同时给别的活留了余量,整体比默认档便宜 61.2%
还不知道自己的流量构成medium,然后去测默认档是个合理的起点。只有在你确认不需要它之后,它才算贵
这张表的适用边界。 依据是我们自己出的 29 道题(9 道普通 + 20 道加难),输入都在约 4,000 token 以内。不覆盖长上下文,不覆盖多模态输入,不覆盖创意写作和开放式研究。 换一套任务集完全可能得到不同结论,而且我们手上就有直接证据:关于"Gemini 3.6 Flash 在 medium 档比 3.5 Flash 多用还是少用思考 token"这个问题,独立测评站 aibenchy 测出多 66.2%,我们测出多 2.0%。他们跑的是 22 道简答基准题,我们跑的是抽取、工具调用和改代码。同一个问题在两套任务集上给出了方向相反的答案。这不是一桩需要判谁对错的争议,这本身就是结论:某个档位省不省 token,是你负载的属性,不是模型的属性。

怎么在你自己的流量上测

四步,按"多快能拿到答案"排序。

  1. 今天就把思考 token 单独记下来,先别改任何配置。 Google 的 API 在 total_thought_tokens 字段里返回这个数。如果你只记录输出 token 总数,等账单变了,你分不清是 prompt 退化了还是模型这周想得更多了。
    from google import genai
    from google.genai import types
    
    client = genai.Client()  # 从环境变量读取 API key
    
    response = client.models.generate_content(
        model="gemini-3.6-flash",
        contents=prompt,
        config=types.GenerateContentConfig(
            thinking_config=types.ThinkingConfig(thinking_level="minimal"),
        ),
    )
    
    log.info(
        "level=minimal thinking_tokens=%s",
        response.usage_metadata.total_thought_tokens,
    )
    把思考 token 作为独立字段存在你现有的输出 token 指标旁边,同时把你传的档位也存下来。两个 token 数加在一起,就丢掉了唯一能告诉你"是哪一个变了"的信号。
  2. 显式设置档位,哪怕你就是要设成 medium 一个继承来的默认值,等于一个没人做过的成本决策;而且默认值本身变动的时候,你的账单会跟着变。
  3. 拿一天的真实流量在 minimallow 上各重放一遍,然后拿输出和你现在的输出比,而不是和某个跑分比。在我们这套题上,这一步值 61% 到 74% 的账单——比这个档次里任何一次换模型的效果都大。
  4. 把工具调用那条路径单独判分。 那是我们唯一发现档位会改变正确率的地方;和抽取流量混在一起平均,会把它盖掉。
想在多个模型上跑这组对比,通常意味着每家厂商单独接一套集成,而这笔集成成本正是团队干脆跳过这次测量最常见的原因。统一到一个兼容 OpenAI 接口的端点上就能把它去掉——跑不同轮次时,变的只有模型名。
import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.evolink.ai/v1",
    api_key=os.environ["EVOLINK_API_KEY"],
)

for model in ("gemini-3.6-flash", "gemini-3.5-flash-lite"):
    response = client.chat.completions.create(model=model, messages=messages)
    record(model, response.usage)
EvoLink 为生产环境团队做 AI 模型基础设施,这类测量正是它要解决的事情之一:用量按请求返回,你从第一次跑就能把答案和思考两列分开记。在哪里跑这组对比,远不如"把它跑了"重要。

常见问题

Gemini 3.6 Flash 的默认思考档是哪一档? medium。可选值是 minimallowmediumhigh。Gemini 3.5 Flash-Lite 的默认档是 minimal,所以两个模型开箱行为差别很大。
思考能完全关掉吗? minimal 是能设的最低档,Google 的文档把这个模型的思考描述为默认开启,不是一个能关掉的开关。实测上,minimal 在我们 102 次调用里有 101 次返回精确的 0 个思考 token,就计费而言在绝大多数请求上等同于关闭。剩下那一次的情况见上文——正因为有这一次,我们不会把它说成一个保证。
思考 token 要收费吗? 要,按输出价收。Google 文档写明:响应侧的计费是输出 token 与思考 token 之和。Gemini 3.6 Flash 的输出价是 $7.50 / 100 万 token,而默认档下思考 token 占输出的 85%,所以它是大多数账单的主体。
minimal 比默认档便宜多少? 在我们那九道题上,每跑一遍便宜 73.6%,正确率同样是 9/9,延迟大约减半。你的比例取决于你的活在 medium 档上会让模型想多久,所以这个数字的用法是"值得去测一测",不是"拿去做预算"
档位调高,模型会更准吗? 在我们测到的范围内,不可靠。从 minimallow 在多步工具调用上确有一次真实跃升,15 题对 2 变成 15 题对 10。但 low 往上是 10、10、8,而且有一道题在更高档位上稳定地更差(每格 5 次重复)。至于单轮的重推理任务,minimal 一个思考 token 不花就做对了 20 道加难题里的 17 道。
公开跑分用的是哪一档? Artificial Analysis 公布的是 high 档。Google 那张 Flash-Lite 成绩表也是 high 档跑的,而该模型 API 默认是 minimal如果你跑的是默认配置,那你跑的就不是那些数字所描述的配置。
怎么看一次请求用了多少思考 token? 读响应里的 total_thought_tokens。把它作为一个独立字段记在输出 token 旁边,别加在一起——加在一起,以后成本变了你归不了因。
思考档位会改变答案长度吗? 基本不会。跨两个模型、四个档、八种配置,我们这套题的答案 token 始终在 977 到 1,162 之间。档位改变的是模型回答前做了什么,不是它写了多长。

参考来源

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。