Kimi K3 现已上线查看 Kimi K3
Gemini 3.6 Flash 与 Gemini 3.5 Flash 的生产推理通道,用于对比速度和成本
对比

Gemini 3.6 Flash 对比 Gemini 3.5 Flash:生产环境该不该切?

Jacey
Jacey
创始人
2026年7月21日
25 分钟阅读
事实核对日期:2026-07-21。作者:Jacey,含我们在模型发布当天跑的 216 次 API 调用,测法在结果出现的那一节完整交代。EvoLink 是一个 API 网关,转发包括本文这两个模型在内的第三方模型。
一句话结论
  • 现在就切:如果你的账单里输出 token 占大头(多轮 agent、工具调用循环、长代码生成),实际省下 26% 到 29%。
  • 省得有限:如果你的流量偏输入重。按 20 个输入 token 对 1 个输出 token 算,只省 7.1%,因为输入价一分钱没降
  • 智能没涨:独立评测给出的智能指数是 50.1 对 50.2,属于持平。涨的是速度:输出从每秒 165 个 token 提到 304 个,平均每题耗时从 2.7 分钟降到 1.3 分钟。
  • 先测再切:知识密集型的问答、以及生成前端界面的活。这两类是现有证据指向相反方向的地方。
  • 思考档位对账单的影响比换模型更大:我们自己实测,从默认的 medium 档降到 minimal 档,单次任务成本降 73.6%,而在我们这套题上正确率一点没掉。不管你用哪个模型,这个档位都要显式设。
  • 切换不是改个模型名的事temperaturetop_ptop_k 现在传了会被静默忽略、不报错,thinking_budget 这个参数已经没了。

先给结论:按你的负载对号入座

这次升级值不值,几乎完全取决于两件事:你的流量里输入 token 和输出 token 的比例是多少;以及延迟现在是不是你的痛点。

你的负载判断为什么
多轮 agent、工具调用循环、长代码生成输出和思考 token 占大头,而降价只降在这一头
单任务耗时是当前主要抱怨的场景独立评测里每题耗时大约减半
知识密集型问答先影子跑一轮唯一一项能跨代直接比较的知识类分数是退的
前端 / UI 界面生成先影子跑一轮Google 自己写明了两条短板都在这里,且都有 prompt 层面的缓解办法
文档处理、RAG(约 20:1)不用急只省 7.1%,落在一个月正常波动的噪声里
如果你真正在纠结的是要不要改用 Gemini 3.5 Flash-Lite,那是另一个问题、另一个答案,我们写在 Gemini 3.6 Flash 与 3.5 Flash-Lite 选型对比 里。Flash-Lite 是低一个能力档次的产品线,不是你现在这个模型的新版本,所以下面这些数字对它一个都不适用。

到底改了什么

Gemini 3.6 Flash 不是新一代模型。它的模型卡写明"基于 Gemini 3.5 Flash",也就是说这是同一个底座上的一次后训练更新。这一个事实解释了后面绝大部分现象:能力横盘,而后训练和推理服务能改动的部分(速度、token 用量)动得很大。
下面这些参数取自 Google 的模型文档
  • 模型 ID: gemini-3.6-flash。只有一个稳定版,没有 preview 后缀,也没有日期戳,所以不存在选版本的问题。
  • 上下文: 输入 1,048,576 个 token、输出 65,536 个,与上一代相同。输入支持文本、图像、视频、音频和 PDF,输出只有文本
  • 默认思考档位: medium。可选 minimallowmediumhigh 四档。
  • 价格: 输入维持 100 万 token 1.50 美元。输出从 9.00 美元降到 7.50 美元,降幅 16.67%。缓存读取 0.15 美元。批量档和优先档见 Google 定价页
上面这些是跟本文这个决定有关的字段。完整的能力支持矩阵,以及针对新模型 ID 的第一个可跑通的请求,见我们的 Gemini 3.6 Flash 接入指南
有一个说法需要就地纠正,因为它正在传播:输入价没有涨。 gemini-3.5-flashgemini-3.6-flash 的输入价都是 100 万 token 1.50 美元。"偷偷涨价"这个说法,是拿更早一代 Flash 的价格记混了。

你的账单会变成什么样

按官方说法,有两件事同时在帮你省钱:输出单价降了 16.67%,同一个任务用掉的输出 token 也更少。两者叠加,输出这一项的支出降 30.8%。

这个数字是真的。它同时也是很多报道高估了省幅的原因:输入价没动。所以你的流量越偏输入重,这 30.8% 里你实际拿到的就越少。
Gemini 3.6 Flash 工作负载成本对比,展示输出重型 AI 任务为什么比输入重型流水线获得更多节省
Gemini 3.6 Flash 工作负载成本对比,展示输出重型 AI 任务为什么比输入重型流水线获得更多节省
Gemini 3.6 Flash 的降价主要发生在输出侧,因此生产成本改善取决于工作负载的输入与输出 token 比例。
输入:输出典型场景3.5 Flash3.6 Flash变化
20:1文档处理、RAG$39.00$36.23省 7.1%
5:1一般问答$16.50$13.72省 16.8%
1:1多轮 agent、开思考$10.50$7.72省 26.4%
1:3重推理、长代码生成$28.50$20.17省 29.2%

这张表的口径要说清楚:每一行把该场景折算成"在 3.5 Flash 上产出 100 万个输出 token",输入 token 按该行的比例配上,用标准档价格计算。计算假设是新模型少用 17% 输出 token、输入 token 不变。

那个 17% 的假设需要单独交代条件,因为整张表都建立在它上面。这个数字是 Google 引用的,不是 Google 自己测的,来源是 Artificial Analysis。而同一个页面上给出的绝对值是 5900 万对 7500 万 token,自己算出来是 21.3%。两个数字对不上,公开材料里没有解释。我们全程用了更保守的 17%,所以请把这张表当成省幅区间的下沿,不是承诺值。
还有一点:思考 token 是按输出价计费的。 这就是为什么 agent 那两行降得最多。在多轮 agent 上,思考预算不是账单里的零头,而是大头。
然后我们把这张表拿去实测了,结果表偏乐观。 我们那套任务的形态大约是 1 个输入 token 对 1.5 个计费输出 token,落在表里 1:1 和 1:3 两行之间,按表预测应该省 26% 到 29%。实测 medium 档省 13.6%、high 档省 20.1%。
差额全在那个 token 假设上。medium 档下,新模型的计费输出 token 不但没少 17%,反而多了 1.7%——省下来的钱几乎全部来自输出单价降了 16.67%,不是来自 token 变少。high 档倒是兑现了一部分,输出 token 少了 6.4%。测法和完整数字在下一节。
所以这张表要这么读:它是按官方口径算出来的账,我们那组数字才是一个真实负载跑出来的账。 如果你的活更像我们这种任务、而不像跑分题集,请按低的那个数做预算。

智能持平,速度约翻倍

Artificial Analysis 拿到了发布前的提前访问,目前是唯一一家有完整分项数据的独立评测方。他们的数字在 high 思考档下测得:
指标3.6 Flash3.5 Flash
智能指数 v4.150.150.2
Humanity's Last Exam(知识密集)38.3%40.2%
GPQA Diamond92.8%92.2%
SciCode52.7%53.1%
长上下文推理 AA-LCR69.7%69.3%
输出速度303.6 tok/s165.4 tok/s
首 token 延迟11.54 秒20.22 秒
平均每题耗时1.3 分钟2.7 分钟
平均每题成本$0.50$0.59
每一行都要带两个口径条件。第一,这是在 high 档下测的,而 API 默认档是 medium,照默认配置跑不是同一个实验。第二,速度和延迟是 72 小时中位数,而模型当天才发布,样本窗口不足一天,后续会变。

条件说清之后,图景是清楚的,而且这是一次取舍,不是退步。智能指数 50.1 对 50.2 属于持平。推理和长上下文两项小幅上行。唯一一项能跨代直接比较的知识密集型分数(Humanity's Last Exam)退了 1.9 个百分点。与此同时,输出速度涨了 84%,每题耗时大约减半。

所以,如果你想要的是更聪明的模型,这次升级不是为你准备的,继续用 gemini-3.5-flash 在这个维度上不吃亏。如果你想要的是同样质量的活用一半时间跑完、单位成本更低,那这次发布正好就是给你的。

至于知识密集那条,值得多做一步,不值得多担一分心。一项基准退 1.9 个百分点,是"该拿自己的评测集验一下"的信号,不是"这次别升"的理由。

思考档位对账单的影响,比换模型更大

上面所有公开数字测的都是 high 档,而 API 默认档是 medium。这个落差大到足以改变一个采购决定,所以我们在模型发布当天自己跑了一轮。
Gemini 3.6 Flash 思考档位逐级累积更多推理 token,而最终生产输出仍然紧凑
Gemini 3.6 Flash 思考档位逐级累积更多推理 token,而最终生产输出仍然紧凑
思考档位对计费输出的影响可能超过换模型本身,生产团队应显式设置并单独评测。
测法: 9 道题分三类——从发票、日志、商品 HTML 里做结构化抽取;对着模拟工具做 3 到 5 步的多轮工具调用;以及代码定位与修改,要求把一段 bug 描述变成能跑的补丁。输入在 1,000 到 4,000 token 之间,所以这一轮不覆盖长上下文场景。每道题在 8 个"模型 + 思考档"组合上各跑 3 次,共 216 次调用,经 OpenRouter 串行发出、服务方锁定 Google AI Studio。答案 token 和思考 token 分开记录,钱一律按 Google 标准档标价自己算,不用网关报的费用。没有设任何采样参数,因为它们已经不起作用了。
配置答案 token思考 token思考占比单次成本判对
3.6 Flash minimal1,16200%$0.01589/9
3.6 Flash low1,0561,09551%$0.02329/9
3.6 Flash medium(默认)1,0805,94485%$0.05989/9
3.6 Flash high1,0926,67986%$0.06539/9
3.5 Flash medium1,0785,82784%$0.06929/9
3.5 Flash high1,1137,18587%$0.08189/9

有三件事值得单独说。

思考 token 就是账单本身。mediumhigh 档,它占了输出侧全部计费量的 84% 到 87%,而答案长度在整张表上几乎不动。你选哪个模型,对成本的影响远小于你选哪一档。
minimal 档不是"少想一点",是"完全不想"。 思考 token 精确等于 0,单次成本比默认的 medium 档低 73.6%,而正确率同样是 9 比 9。如果你现在跑在 medium 档只是因为从没选过档,那这就是你手上最大的一个省钱开关,而且它在你已经在用的那个模型上就能拧。
high 档只比 medium 档贵 9.3%,因为多给的思考预算没花出去:思考量从 5,944 涨到 6,679 就到顶了。这是我们这套题的性质,不是模型的性质——题目更难时这个差距会拉开。

我们的数字和另一家独立实测对不上的地方

aibenchy 在发布后跑了 22 道短基准题,测出新模型在 medium 档贵 29.4%、在 high 档便宜 9.7%。我们测出两档都便宜,分别是 13.6% 和 20.1%。high 档的结论方向一致,medium 档正好相反,而原因就在一个数字上:他们测出新模型在 medium 档的思考量多了 66.2%,我们只多了 2.0%。
我们不打算说他们测错了。两套任务集对同一个问题给出了方向相反的答案,这件事本身就是结论:这个模型省不省 token,取决于你拿它跑什么活,不是模型的固有属性。 Google 通稿那句"少 17% 输出 token"既没说档位、也没说任务集,所以它在有的负载上兑现、有的不兑现。
这轮实测回答不了的问题: 9 道题对四个档来说都不够难,每个配置都是 9 比 9 全对。所以这些数字只支持"按成本怎么选档",不能告诉你质量从哪一档开始掉。 另外,同一道题重复跑三次,思考 token 的波动有 6% 到 51%,这也是上表取三次平均的原因。专门去找那个质量拐点的加难实测正在单独进行,出结果我们会回来更新这一页。
可操作的部分很简单:不管你用哪个模型,把思考档位显式写死,并且按你实际跑的那一档算钱,而不是按基准发布时用的那一档。

Google 自己写明的两条短板

Google 在 发布博文 里写明了两条具体短板,而且它们集中在同一个地方。
它倾向于先探索再动手改。 比起 3.5 Flash,新模型更愿意先跑一遍诊断脚本再改代码。在复杂任务上这会提高准确率;在简单前端任务上,它会多出你并不需要、也不想付钱的探索步骤。
在视觉效果上,人类评测员更偏好旧模型。 具体是在视觉布局和样式这一项上,评测员更喜欢早期模型的产出。Google 给出的缓解办法是:把设计规范写进 prompt,别把样式交给模型的默认判断。

模型卡的"已知局限"里还列了两条:会有幻觉;可能出现偶发的响应缓慢或超时。

这些都不构成"别升级"的理由,它们构成的是"按界面分开决策"的理由。如果你同时有一个 agent 层和一个 UI 生成层,那是两种负载、两套证据,没有哪条规矩要求它们必须跑同一个模型 ID。

切换不是改个模型名的事

这是最容易翻车的一段,也是"改一行模型名就完事"这类建议现在已经不成立的原因。从这次发布开始,并且官方明说"此后所有新模型"都适用,有几个参数的行为变了。 完整清单见 Google 的 API 变更日志,下面这几个是会悄无声息弄坏生产环境的。
temperaturetop_ptop_k 会被忽略,而且不报错。 官方文档写明未来的模型代次会返回 HTTP 400,但今天这些值只是被丢掉。如果你靠 temperature=0 来保证抽取或分类流水线的输出确定性,这个保证会在没有日志、没有异常、没有告警的情况下消失。 官方给的替代做法是把规则写进 system instruction。
这件事还有一个更隐蔽的版本值得排查:OpenRouter 的模型元数据至今仍把 temperaturetop_pseed 列为支持的参数,所以网关会照收你的值、照转给模型,而模型那头忽略它。今天还在调温度想改善输出质量的人,是在调一个空操作。
thinking_budget 换成了 thinking_level 原来的数字预算变成字符串枚举。两个一起传,返回 400。
另外三个小的。 candidate_count 在 Gemini 3.x 上不支持。请求的最后一条消息如果是 model 角色,返回 400,也就是不能再预填模型回合。每个 FunctionResponse 现在都必须带上 call_idname
逐行怎么改、官方的自动迁移工具怎么用、被替代的那些模型什么时候关停,见我们的 Gemini 3.6 Flash 迁移指南
这里要提醒一句:为更早那几次 Gemini 升级写的迁移指南,包括我们自己那篇 从 Gemini 3 Flash Preview 迁到 Gemini 3.5 Flash,都还在把采样参数当成可用的——因为在那一对模型上它们确实可用。上面这些废弃是从这一代才开始的。
关于怎么把两个模型放在一起对比,有个省事的做法:这两个模型 ID 都通过同一个兼容 OpenAI 格式的端点暴露在 EvoLink 上,你把 base_url 指向同一个网关、只换模型名,就能拿自己的 prompt 做 A/B,不必先搭第二套接入。上面那两个"先测再切"的问题(知识密集和 UI),用这个办法在自己的流量上验最快。

动手之前先测这四件事

公开数据把问题收窄了,剩下的四件事能把它关掉。

  1. 把答案 token 和思考 token 分开记。 只看总 token 说明不了账单为什么变,因为这两个模型之间行为不同的只是其中一项。
  2. 把思考档位显式钉死。 别不小心继承了默认的 medium,并且按你实际跑的那一档算钱,而不是按基准用的 high 档。在我们这套任务上,这件事比换模型更值钱——minimal 档比默认的 medium 档便宜 73.6%,正确率一样。你自己的活能不能扛住降档,要先验再说。
  3. 用你真实的 prompt 组合做影子跑,不要用基准题集。 如果你的流量偏知识密集,这一条尤其重要,因为那正是分数退了的那个维度。
  4. 切换前先全库搜一遍。temperaturetop_ptop_kthinking_budgetcandidate_count。前三个是静默失效,意味着你的测试会全绿,而输出会悄悄漂移

常见问题

Gemini 3.6 Flash 是不是改名的 Gemini 3.5 Pro? 发布后确实有这个猜测。社区里最高赞的回应否定了它,理由是没有任何迹象表明 Pro 被改了名,这就是 Flash 的一次升级。模型卡也支持这个读法:它写明基于 Gemini 3.5 Flash。我们记录这个猜测,但不采纳它。
gemini-3.5-flash 会被关停吗? Google 目前公布的关停日期是:gemini-2.5-flashgemini-2.5-flash-lite 在 2026-10-16,gemini-3.1-flash-lite 在 2027-05-07。2026-07-21 发布的这两个模型都没有公布关停日期。也就是说,没有一个已公布的截止日期在逼你现在做决定,你有时间把该测的测完。
输入价是不是涨了? 没有。两个模型的标准档输入价都是 100 万 token 1.50 美元。变的只有输出价,从 9.00 美元降到 7.50 美元。
还能用 temperature=0 保证输出确定性吗? 不能,而且这正是要盯的失效方式:参数会被接收然后忽略,不报错。把这个约束移到 system instruction 里,并且去校验输出,而不是校验请求。
RAG 场景切过去能明显省钱吗? 按大约 20 个输入 token 对 1 个输出 token 算,公开数字推出来是省 7.1%。省是真省,但很少,因为账单的输入那一半没变。而且请把 7.1% 当成上限而不是预期值:在我们自己的任务上,实际省幅低于同一套算法的预测,而且这一轮实测完全没有覆盖长上下文检索。做 RAG 的团队应该先把这次发布当成延迟改善,其次才是成本改善。
该用哪个模型 ID? gemini-3.6-flash。只有一个稳定版,没有 preview 后缀,也没有带日期戳的变体需要挑。

来源

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。