Seedance 2.5 已上线 EvoLink立即体验
两条 AI 光路穿过暗色生产网关
对比

Gemini 3.7 Flash vs Gemini 3.6 Flash:该升级吗?

EvoLink Team
EvoLink Team
Product Team
2026年8月14日
10 分钟阅读

结论先行

Gemini 3.7 Flash 的价格和 Gemini 3.6 Flash 完全一样。 输入、输出、缓存费率一致,同样的 1,048,576 token 上下文,同样的接口。所以这次决策异常干净:你只需要在迁移成本和能力提升之间权衡,不用为预算辩护。
如果你的负载是编码或多步 agent,那就升级——Google 公布的基准里这两块提升最大。如果你在跑 minimal thinking level 上的大批量分类或抽取,暂时留在 3.6,因为 3.7 已经没有这一档了;对这类流水线,老实说答案根本不是 3.7,而是 Gemini 3.5 Flash-Lite

下面这些,是拍板之前该验证的东西。

究竟改了什么

Gemini 3.7 Flash 不是新预训练的模型。Google 的 model card 把它描述为在 Gemini 3.6 Flash 推理底座上做的算法改进,两者发布只隔三周。这个定位对升级决策很关键:你该预期的是同一家族内部的行为漂移,而不是一个失败模式完全不同的新模型。
Google 公布的收益集中在三处——生产级编码(FrontierCode)、长周期软件工程(DeepSWE),以及 agent 执行(Terminal-bench、AutomationBench),其中 agent 类基准大约翻倍。完整数据和厂商自报口径的注意事项见 Gemini 3.7 Flash 发布解读;这些都是 Google 自己的数字,发布时还没有独立复现。
没变的部分:价格、上下文窗口、最大输出、支持的模态,以及你调用的接口。所以迁移基本就是换 model ID 加上清理参数。

3.6 到 3.7 能无痛迁移吗

不完全能。按 Google 官方迁移清单,有四处会断:

  • minimal thinking level 取消了。 现在只有 lowmedium(默认)和 high。往 Gemini API 传 minimal 会直接报错。
  • temperaturetop_ptop_kcandidate_count 必须从生成配置里去掉。
  • 数值型 thinking_budgetthinking_level 字符串取代。
  • 预填充的 model turn 必须移除。
在 EvoLink 上,仍然带 reasoning_effort: "none""minimal" 的请求将被自动降级为 low 而不是直接失败,所以你分批改调用点的时候,灰度迁移不会中途炸掉。

值得实测的行为变化

基准告诉你的是模型在别人的任务上进步了多少。下面这些,才是最可能出现在你自己任务上的变化:

单任务 token 消耗。 费率一样不等于账单一样。发布当天就有报告观察到 3.7 每个任务的 token 消耗高于 3.6——对一个被调得更爱推理的模型来说这很合理。thinking token 按输出价计费,所以在单 token 价格完全相同的前提下,想得更多的模型单任务反而更贵。要按被采纳的结果统计总 token,而不是按请求数统计。
你最便宜的那一档变贵了。 如果你原来跑 minimal,新的底线是 low。对大批量分类流水线来说,这点差价会在每一次调用上累积,也是 3.6 的负载最不该迁到 3.7 的头号原因。
指令遵循与事实准确度。 Google 称安全性和语气与 3.6 Flash 相当。但有一家独立追踪机构在发布时测到 3.7 的幻觉率更高。两者都不能替你的 prompt 下结论——但足够说明:推全量前先跑一遍自己的回归集。
agent 循环行为。 官方主打的说法是 agent 循环失败更少、卡住之后恢复得更好。如果你在跑 agent,这就是最该埋点的变化:统计重试次数、无效 tool call 和中途放弃的 run,而不只是看最终答案质量。

什么情况下留在 3.6 Flash 才是对的

  • 你依赖 minimal thinking。 先去评估 3.5 Flash-Lite,而不是在每次调用上都付 low 的底价。
  • 你的负载简单、对延迟敏感、量还大。 更多推理不是白送的,走 Lite 档通常更划算。
  • 你有一条验证过、已经冻结的流水线,编码和 agent 都不痛。 没有价格诱因的前提下,升级一个稳定系统,换来的主要是重新验证的工作量。
  • 你现在承受不起一个回归窗口。 两次发布只隔三周,说明下一个模型大概率也快了;把验证攒到一起做没有任何惩罚。

一套可复现的评测

暗色生产评测路线穿过验证关卡,并保留回滚通道
暗色生产评测路线穿过验证关卡,并保留回滚通道
既然价格完全一样,唯一值得回答的问题就是:在你的任务上,3.7 是不是每 token 完成得更好。四步:
  1. 冻结基线。 在 3.6 Flash 上采集 50–200 条真实请求,带完整埋点:输入 token、输出 token、thinking token、缓存命中、tool call 有效性、重试次数、人工修正次数。
  2. 在 3.7 上回放。 同样的 prompt、同样的工具、同样的 thinking level(把 minimal 显式映射成 low,这样你才知道自己在比什么)。一次只改一个变量。
  3. 让 3.7 当挑战者跑。 切一部分线上流量过去,比较任务采纳率和每个被采纳任务的总成本——别比单请求价格,那个按定义就是一样的。
  4. 提前定好推全量和回滚的阈值。 在看到结果之前,就先决定什么数字能让 3.7 转正、什么数字让你退回去。

两个模型会在同样的接口上以同样的价格继续提供,所以回滚就是改一个 model ID,没有任何商务代价。

把 3.6 和 3.7 并排放着,本来就是用网关的意义所在:一把 key、一个客户端、两个 model ID,随时切回来不花一分钱。挑战者那部分流量调 gemini-3.7-flash,生产流量继续走 gemini-3.6-flash,直到阈值达标为止。
含最新费率和代码示例的模型页:Gemini 3.7 Flash · Gemini 3.6 Flash · 全部 Gemini 模型

常见问题

Gemini 3.7 Flash 比 Gemini 3.6 Flash 更强吗?

按 Google 公布的基准是的,编码和 agent 执行上尤其明显。但这些是厂商自报数据,而且有独立追踪机构在发布时测到更高的幻觉率,所以换默认模型之前,请先在自己的任务上验证。

Gemini 3.7 Flash 比 3.6 Flash 贵吗?

不贵。两者共用同一份费率表,包括到 2026 年 12 月 31 日为止的首发优惠价。不过如果 3.7 单任务用掉的 token 更多,你的账单仍然可能变化,因为 thinking token 按输出价计费。

从 3.6 迁到 3.7 需要改代码吗?

主要就是换 model ID,另外要去掉 temperaturetop_ptop_kcandidate_count,把数值型 thinking_budget 换成 thinking_level 字符串,并移除预填充的 model turn。

minimal thinking level 被什么取代了?

3.7 Flash 的新底线是 low。如果你做的是对成本敏感的大批量分类和抽取,Gemini 3.5 Flash-Lite 通常比每次调用都付 low 更划算。

只跑简单对话或分类,需要升级吗?

一般不需要。提升集中在编码和多步 agent 上;简单的大批量任务用 Lite 档模型更合适。

可以同时跑 Gemini 3.7 Flash 和 3.6 Flash 吗?

可以。它们共用接口和价格,你可以切一部分流量给 3.7 当挑战者,回滚只需要改 model ID。

Gemini 3.6 Flash 会被下线吗?

Google 没有公布 Gemini 3.6 Flash 的退役时间。它仍与 3.7 Flash 一起以同样的价格提供。

距离价格调整还有多久?

两个模型的首发优惠价都适用到 2026 年 12 月 31 日,2027 年 1 月 1 日起转为标准价——所以升级决策和价格截止日期彼此独立。

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。