
Gemini 3.8 Flash vs 3.7 Flash:更高准确率还是更省 Token?

先说结论
不要因为一张基准图就全量迁移。应在代表性任务集上回放,保持思考档位与工具协议一致,然后比较交付通过率、输出与思考 Token、延迟、重试次数和审核时间。
官方基线:哪些条件完全相同?
截至 2026-09-03,Google 官方文档给出的基线如下。表中价格是有效至 2026-12-31 的 Google 介绍价;Google 还列出了 2027-01-01 起生效的更高标准价。EvoLink 账号的实际价格可能不同,计费应以后端实时返回或账号价格页为准。
| 维度 | Gemini 3.8 Flash | Gemini 3.7 Flash | 对决策的影响 |
|---|---|---|---|
| 模型 ID | gemini-3.8-flash | gemini-3.7-flash | 需要显式切换模型 |
| 介绍期输入价 | $0.75 / 百万 Token | $0.75 / 百万 Token | 没有单价优势 |
| 介绍期输出价 | $3.75 / 百万 Token | $3.75 / 百万 Token | Token 总量决定支出 |
| 介绍期缓存读取价 | $0.075 / 百万 Token | $0.075 / 百万 Token | 稳定前缀可降低重复输入成本 |
| 输入上下文 | 1,048,576 Token | 1,048,576 Token | 容量相同 |
| 最大输出 | 65,536 Token | 65,536 Token | 官方上限相同 |
| 输入模态 | 文本、图像、视频、音频、PDF | 文本、图像、视频、音频、PDF | 多模态输入范围相同 |
| 输出模态 | 文本 | 文本 | 两者都不是媒体生成模型 |
| 思考档位 | low、medium、high | low、medium、high | 必须在同档位对比 |
接口表面相同,让 3.8 与 3.7 并行评测很方便,但这并不意味着升级在经济上必然成立。
Gemini 3.8 Flash 到底改变了什么?
Google 把 3.8 Flash 定位为更强的 Flash 系列主力模型,覆盖编程、智能体工作流、知识工作和多模态理解。发布材料称其在编程及终端操作相关评测中获得提升。这些是厂商公布的信号,适合用来决定“优先测什么”,不能替代你自己的生产验收标准。
3.8 还沿用当前 Gemini 3 的请求约定:
- 在 EvoLink Gemini 原生接口中,Gemini 3.x 使用
generationConfig.thinkingConfig.thinkingLevel;thinkingBudget是 Gemini 2.5 的控制项,二者不能同时使用; - 支持
low、medium(默认)和high,不支持minimal,EvoLink 会将其自动降级为low; - EvoLink 说明自定义
temperature与topP不影响 Gemini 3.x 输出,topK会被忽略;temperature或topP越界会返回 400; - 请求不能以
model轮次结尾; - 函数响应必须回传相匹配的函数
id与name。
做 3.7 与 3.8 对比时也必须遵守这些规则。隐藏的参数差异很容易被误判成模型能力差异。
选择矩阵
| 工作负载 | 建议起点 | 原因 | 上线前要测什么 |
|---|---|---|---|
| 带严格测试的代码修改 | 把 3.8 作为挑战者测试 | Google 报告其在部分编程基准上分数更高;生产效果未知 | 测试通过率、审核修改、总 Token、延迟 |
| 多步工具智能体 | 把 3.8 作为挑战者测试 | Google 重点介绍了智能体基准;生产工具调用效果未知 | 有效调用、失败步骤、重试、完成率 |
| 文档与图表分析 | 两者并测 | 上下文与模态相同 | 引用准确率、提取错误、输出 Token |
| 已稳定的分类流水线 | 保留 3.7 作为对照 | Google 建议在计算效率优先时使用 3.7 | 漂移、每千个合格标签成本、P95 延迟 |
| 高并发摘要 | 保留当前模型作为对照 | EvoLink 尚无公开实测证明 3.8 在该场景有优势 | 压缩质量、输出长度、审核率 |
| 混合生产流量 | 同时路由 | 一个默认模型很难覆盖所有任务 | 分路由通过率、支出、回退频率 |
上表只用于分配评测候选,不预测胜负。在挑战者达到预先设定的验收、成本和延迟门槛前,应保留当前生产模型作为对照。
真正重要的指标:每个验收任务的成本
Token 价格只是生产成本的一部分,可以用下面的模型级口径:
每个验收任务成本 =(模型总支出 + 重试支出 + 人工审核成本)/ 验收任务数EvoLink 尚未发布能够证明 3.8 Flash 减少重试、审核工作或任务总成本的受控工作负载对比。上面的公式只是评测方法,不是实测结果。Google 已公布的“准确率更高、Token 消耗也更高”无法证明哪个模型完成生产任务时更便宜。
至少追踪以下指标:
- 验收通过率与首次成功率;
- 完整任务的输入、输出和思考 Token,包括所有重试;
- 缓存读取 Token 与缓存命中率;
- 有效与被拒绝的工具调用;
- 产出合格结果所需时间;
- 人工修改分钟数;
- 回退与回滚频率。
可复现的 3.8 vs 3.7 评测流程

- 冻结代表性任务集。 使用经过隐私处理的真实任务,覆盖简单、中位和高失败率案例。50 个任务足以发现明显回归,但正式切流需要更大的样本。
- 保持请求协议一致。 系统指令、工具、Schema、上下文、输出预算与思考档位全部相同。没有特殊原因时,可从
medium开始。 - 使用干净会话。 切换模型时不要复用模型专属缓存或状态,否则对比结果可能失真。
- 评估验收,不评估“看起来更好”。 在看到结果前先定义可执行测试、提取检查、引用规则或审核量表。
- 计算完整循环成本。 纳入思考输出、重试、回退调用与人工审核,而不只计算第一次响应。
- 默认切换前先灰度。 把少量、可观测的流量送到 3.8,并保留只改一个模型 ID 就能回到 3.7 的路径。
测试前写好晋级门槛,例如:关键错误不能显著增加;验收通过率达到预设提升;每个验收任务成本与 P95 延迟的涨幅不超过上限。
迁移与回滚清单
同系列模型切换也应当按行为版本发布来管理:
- API 的
model从gemini-3.7-flash改为gemini-3.8-flash;不要把页面路径gemini-3-8-flash当模型 ID。 - 检查旧客户端是否同时使用了两种 thinking 控制项、依赖被忽略的采样参数,或传入越界值。
- 把
minimal显式映射到经过测试的支持档位,通常是low,不要假设二者完全等价。 - 重新验证结构化输出与函数响应 Schema。
- 清除模型专属提示词缓存,并用干净状态开始迁移评测。
- 记录模型 ID、路由、思考档位、各类 Token、延迟、重试和验收结果。
- 在完整观察窗结束前,把 3.7 保留为显式回退路径。
model。它的运维价值在于受控选型与快速回滚,而不是承诺每次调用都获得最低成本。谁适合现在测试 3.8?
当 Google 重点介绍的编程、智能体或文档能力符合当前评测需求,而且团队已经采集 Token、延迟与验收指标时,可以启动受控的 3.8 挑战者测试。这是测试建议,不是升级结论。
如果任务稳定且量大、当前质量已经过线、计算效率是核心约束,或者暂时无法安排完整回归与灰度窗口,则先保留 3.7。
常见对比错误
- 因为介绍价低于未来标准价,就把 3.8 写成“更便宜”,却没有注明价格周期。
- 把每 Token 单价相同理解为每任务成本相同。
- 用 3.8 的
high与 3.7 的medium或low比较。 - 在不同模型之间复用模型专属缓存。
- 把厂商基准提升写成应用效果保证。
- 只评回答内容,不统计重试、审核时间和工具失败。
- 没有回滚阈值就替换生产默认模型。
常见问题
Gemini 3.8 Flash 比 3.7 Flash 更好吗?
公开证据没有给出总体胜者。Google 报告 3.8 Flash 的准确率更高,尤其强调部分编程与智能体基准,同时说明其 Token 消耗也更高。EvoLink 尚未发布能够把这些事实转化为任务级结论的受控工作负载结果。
Gemini 3.8 Flash 比 3.7 Flash 更贵吗?
截至 2026-12-31,两者的 Google 介绍期 Token 单价相同。如果 3.8 使用更多输出或思考 Token,单个任务仍可能更贵。EvoLink 实际费用应查询账号实时价格。
2027 年价格会怎样变化?
Google 列出的 2027-01-01 起标准价为:输入 $1.50 / 百万 Token、输出 $7.50 / 百万 Token、缓存读取 $0.15 / 百万 Token。届时应重新核对 Google 与 EvoLink 价格。
两款模型的上下文窗口不同吗?
没有差异。Google 为两者都记录了 1,048,576 Token 输入上限和 65,536 Token 最大输出。
Gemini 3.8 Flash 支持 minimal 思考档位吗?
low、medium 和 high,默认 medium。EvoLink 原生 API 参考说明,不支持的 minimal 会被自动降级为 low,因此请显式设置 low,不要依赖降级。从 3.7 切到 3.8 能继续复用缓存吗?
不要假设缓存内容可跨模型版本复用。应重新创建模型专属缓存,并用干净状态开始迁移评测。
应该立即用 3.8 替换 3.7 吗?
不应该自动替换。先回放并灰度,只在 3.8 达到预先设定的质量、成本和延迟门槛时,才针对对应工作负载晋级。
EvoLink 能在一套集成里路由两款模型吗?
gemini-3.8-flash。来源与核验说明
- Google:Gemini 3.8 Flash 发布说明
- Google AI for Developers:Gemini 3.8 Flash 模型文档
- Google AI for Developers:Gemini API 定价
- Google Cloud:Gemini 3.8 Flash 使用指南
- Google DeepMind:Gemini 3.8 Flash 模型卡
- EvoLink:Gemini 原生 API 参数参考
gemini-3.8-flash,生产切流前仍应验证账号对 3.8 的实时权限。

