
Gemini 3.6 Flash 对比 Gemini 3.5 Flash:生产环境该不该切?
- 现在就切:如果你的账单里输出 token 占大头(多轮 agent、工具调用循环、长代码生成),实际省下 26% 到 29%。
- 省得有限:如果你的流量偏输入重。按 20 个输入 token 对 1 个输出 token 算,只省 7.1%,因为输入价一分钱没降。
- 智能没涨:独立评测给出的智能指数是 50.1 对 50.2,属于持平。涨的是速度:输出从每秒 165 个 token 提到 304 个,平均每题耗时从 2.7 分钟降到 1.3 分钟。
- 先测再切:知识密集型的问答、以及生成前端界面的活。这两类是现有证据指向相反方向的地方。
- 思考档位对账单的影响比换模型更大:我们自己实测,从默认的
medium档降到minimal档,单次任务成本降 73.6%,而在我们这套题上正确率一点没掉。不管你用哪个模型,这个档位都要显式设。 - 切换不是改个模型名的事:
temperature、top_p、top_k现在传了会被静默忽略、不报错,thinking_budget这个参数已经没了。
先给结论:按你的负载对号入座
这次升级值不值,几乎完全取决于两件事:你的流量里输入 token 和输出 token 的比例是多少;以及延迟现在是不是你的痛点。
| 你的负载 | 判断 | 为什么 |
|---|---|---|
| 多轮 agent、工具调用循环、长代码生成 | 切 | 输出和思考 token 占大头,而降价只降在这一头 |
| 单任务耗时是当前主要抱怨的场景 | 切 | 独立评测里每题耗时大约减半 |
| 知识密集型问答 | 先影子跑一轮 | 唯一一项能跨代直接比较的知识类分数是退的 |
| 前端 / UI 界面生成 | 先影子跑一轮 | Google 自己写明了两条短板都在这里,且都有 prompt 层面的缓解办法 |
| 文档处理、RAG(约 20:1) | 不用急 | 只省 7.1%,落在一个月正常波动的噪声里 |
到底改了什么
- 模型 ID:
gemini-3.6-flash。只有一个稳定版,没有 preview 后缀,也没有日期戳,所以不存在选版本的问题。 - 上下文: 输入 1,048,576 个 token、输出 65,536 个,与上一代相同。输入支持文本、图像、视频、音频和 PDF,输出只有文本。
- 默认思考档位:
medium。可选minimal、low、medium、high四档。 - 价格: 输入维持 100 万 token 1.50 美元。输出从 9.00 美元降到 7.50 美元,降幅 16.67%。缓存读取 0.15 美元。批量档和优先档见 Google 定价页。
gemini-3.5-flash 和 gemini-3.6-flash 的输入价都是 100 万 token 1.50 美元。"偷偷涨价"这个说法,是拿更早一代 Flash 的价格记混了。你的账单会变成什么样
按官方说法,有两件事同时在帮你省钱:输出单价降了 16.67%,同一个任务用掉的输出 token 也更少。两者叠加,输出这一项的支出降 30.8%。

| 输入:输出 | 典型场景 | 3.5 Flash | 3.6 Flash | 变化 |
|---|---|---|---|---|
| 20:1 | 文档处理、RAG | $39.00 | $36.23 | 省 7.1% |
| 5:1 | 一般问答 | $16.50 | $13.72 | 省 16.8% |
| 1:1 | 多轮 agent、开思考 | $10.50 | $7.72 | 省 26.4% |
| 1:3 | 重推理、长代码生成 | $28.50 | $20.17 | 省 29.2% |
这张表的口径要说清楚:每一行把该场景折算成"在 3.5 Flash 上产出 100 万个输出 token",输入 token 按该行的比例配上,用标准档价格计算。计算假设是新模型少用 17% 输出 token、输入 token 不变。
medium 档省 13.6%、high 档省 20.1%。medium 档下,新模型的计费输出 token 不但没少 17%,反而多了 1.7%——省下来的钱几乎全部来自输出单价降了 16.67%,不是来自 token 变少。high 档倒是兑现了一部分,输出 token 少了 6.4%。测法和完整数字在下一节。智能持平,速度约翻倍
high 思考档下测得:| 指标 | 3.6 Flash | 3.5 Flash |
|---|---|---|
| 智能指数 v4.1 | 50.1 | 50.2 |
| Humanity's Last Exam(知识密集) | 38.3% | 40.2% |
| GPQA Diamond | 92.8% | 92.2% |
| SciCode | 52.7% | 53.1% |
| 长上下文推理 AA-LCR | 69.7% | 69.3% |
| 输出速度 | 303.6 tok/s | 165.4 tok/s |
| 首 token 延迟 | 11.54 秒 | 20.22 秒 |
| 平均每题耗时 | 1.3 分钟 | 2.7 分钟 |
| 平均每题成本 | $0.50 | $0.59 |
high 档下测的,而 API 默认档是 medium,照默认配置跑不是同一个实验。第二,速度和延迟是 72 小时中位数,而模型当天才发布,样本窗口不足一天,后续会变。条件说清之后,图景是清楚的,而且这是一次取舍,不是退步。智能指数 50.1 对 50.2 属于持平。推理和长上下文两项小幅上行。唯一一项能跨代直接比较的知识密集型分数(Humanity's Last Exam)退了 1.9 个百分点。与此同时,输出速度涨了 84%,每题耗时大约减半。
至于知识密集那条,值得多做一步,不值得多担一分心。一项基准退 1.9 个百分点,是"该拿自己的评测集验一下"的信号,不是"这次别升"的理由。
思考档位对账单的影响,比换模型更大
high 档,而 API 默认档是 medium。这个落差大到足以改变一个采购决定,所以我们在模型发布当天自己跑了一轮。
| 配置 | 答案 token | 思考 token | 思考占比 | 单次成本 | 判对 |
|---|---|---|---|---|---|
3.6 Flash minimal | 1,162 | 0 | 0% | $0.0158 | 9/9 |
3.6 Flash low | 1,056 | 1,095 | 51% | $0.0232 | 9/9 |
3.6 Flash medium(默认) | 1,080 | 5,944 | 85% | $0.0598 | 9/9 |
3.6 Flash high | 1,092 | 6,679 | 86% | $0.0653 | 9/9 |
3.5 Flash medium | 1,078 | 5,827 | 84% | $0.0692 | 9/9 |
3.5 Flash high | 1,113 | 7,185 | 87% | $0.0818 | 9/9 |
有三件事值得单独说。
medium 和 high 档,它占了输出侧全部计费量的 84% 到 87%,而答案长度在整张表上几乎不动。你选哪个模型,对成本的影响远小于你选哪一档。minimal 档不是"少想一点",是"完全不想"。 思考 token 精确等于 0,单次成本比默认的 medium 档低 73.6%,而正确率同样是 9 比 9。如果你现在跑在 medium 档只是因为从没选过档,那这就是你手上最大的一个省钱开关,而且它在你已经在用的那个模型上就能拧。high 档只比 medium 档贵 9.3%,因为多给的思考预算没花出去:思考量从 5,944 涨到 6,679 就到顶了。这是我们这套题的性质,不是模型的性质——题目更难时这个差距会拉开。我们的数字和另一家独立实测对不上的地方
medium 档贵 29.4%、在 high 档便宜 9.7%。我们测出两档都便宜,分别是 13.6% 和 20.1%。high 档的结论方向一致,medium 档正好相反,而原因就在一个数字上:他们测出新模型在 medium 档的思考量多了 66.2%,我们只多了 2.0%。Google 自己写明的两条短板
模型卡的"已知局限"里还列了两条:会有幻觉;可能出现偶发的响应缓慢或超时。
切换不是改个模型名的事
temperature、top_p、top_k 会被忽略,而且不报错。 官方文档写明未来的模型代次会返回 HTTP 400,但今天这些值只是被丢掉。如果你靠 temperature=0 来保证抽取或分类流水线的输出确定性,这个保证会在没有日志、没有异常、没有告警的情况下消失。 官方给的替代做法是把规则写进 system instruction。temperature、top_p、seed 列为支持的参数,所以网关会照收你的值、照转给模型,而模型那头忽略它。今天还在调温度想改善输出质量的人,是在调一个空操作。thinking_budget 换成了 thinking_level。 原来的数字预算变成字符串枚举。两个一起传,返回 400。candidate_count 在 Gemini 3.x 上不支持。请求的最后一条消息如果是 model 角色,返回 400,也就是不能再预填模型回合。每个 FunctionResponse 现在都必须带上 call_id 和 name。base_url 指向同一个网关、只换模型名,就能拿自己的 prompt 做 A/B,不必先搭第二套接入。上面那两个"先测再切"的问题(知识密集和 UI),用这个办法在自己的流量上验最快。动手之前先测这四件事
公开数据把问题收窄了,剩下的四件事能把它关掉。
- 把答案 token 和思考 token 分开记。 只看总 token 说明不了账单为什么变,因为这两个模型之间行为不同的只是其中一项。
- 把思考档位显式钉死。 别不小心继承了默认的
medium,并且按你实际跑的那一档算钱,而不是按基准用的high档。在我们这套任务上,这件事比换模型更值钱——minimal档比默认的medium档便宜 73.6%,正确率一样。你自己的活能不能扛住降档,要先验再说。 - 用你真实的 prompt 组合做影子跑,不要用基准题集。 如果你的流量偏知识密集,这一条尤其重要,因为那正是分数退了的那个维度。
- 切换前先全库搜一遍。 搜
temperature、top_p、top_k、thinking_budget、candidate_count。前三个是静默失效,意味着你的测试会全绿,而输出会悄悄漂移。
常见问题
gemini-3.5-flash 会被关停吗?
Google 目前公布的关停日期是:gemini-2.5-flash 和 gemini-2.5-flash-lite 在 2026-10-16,gemini-3.1-flash-lite 在 2027-05-07。2026-07-21 发布的这两个模型都没有公布关停日期。也就是说,没有一个已公布的截止日期在逼你现在做决定,你有时间把该测的测完。temperature=0 保证输出确定性吗?
不能,而且这正是要盯的失效方式:参数会被接收然后忽略,不报错。把这个约束移到 system instruction 里,并且去校验输出,而不是校验请求。gemini-3.6-flash。只有一个稳定版,没有 preview 后缀,也没有带日期戳的变体需要挑。来源
- Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber,Google,2026-07-21
- Gemini API 模型文档,Google
- Gemini API 定价,Google
- Gemini API 变更日志,Google
- Using the latest Gemini models,Google
- Gemini 3.6 Flash,Google DeepMind
- Gemini 3.6 Flash(Gemini Enterprise Agent Platform),Google Cloud
- Gemini 3.6 Flash and Gemini 3.5 Flash-Lite: Halving Time per Task,Artificial Analysis,2026-07-21
- aibenchy,独立 22 题实测,2026-07-21
- Gemini 3.6 Flash 模型元数据,OpenRouter


