Seedance 2.5 已上线 EvoLink立即体验
两条生产级 AI 路由,分别体现计算效率与更宽的推理路径
对比

Gemini 3.8 Flash vs 3.7 Flash:更高准确率还是更省 Token?

EvoLink Team
EvoLink Team
Product Team
2026年9月3日
16 分钟阅读

先说结论

Google 公布的证据只支持两个结论:Gemini 3.8 Flash 的报告准确率更高,同时 Token 消耗也更高;当计算效率优先时,Google 建议使用 Gemini 3.7 Flash。EvoLink 尚未发布能够证明不合格输出、工具失败、重试或人工修改减少的受控结果,因此本文不声称存在任务级成本胜者。
最容易被忽略的一点是:Google 为两款模型给出了相同的介绍期 Token 单价,但同时明确说明 3.8 Flash 在提高准确率的同时会消耗更多 Token。因此,“单价相同”并不等于“账单相同”。生产决策应该比较每个验收任务的总成本,而不是只看每百万 Token 价格。

不要因为一张基准图就全量迁移。应在代表性任务集上回放,保持思考档位与工具协议一致,然后比较交付通过率、输出与思考 Token、延迟、重试次数和审核时间。

官方基线:哪些条件完全相同?

截至 2026-09-03,Google 官方文档给出的基线如下。表中价格是有效至 2026-12-31 的 Google 介绍价;Google 还列出了 2027-01-01 起生效的更高标准价。EvoLink 账号的实际价格可能不同,计费应以后端实时返回或账号价格页为准。

维度Gemini 3.8 FlashGemini 3.7 Flash对决策的影响
模型 IDgemini-3.8-flashgemini-3.7-flash需要显式切换模型
介绍期输入价$0.75 / 百万 Token$0.75 / 百万 Token没有单价优势
介绍期输出价$3.75 / 百万 Token$3.75 / 百万 TokenToken 总量决定支出
介绍期缓存读取价$0.075 / 百万 Token$0.075 / 百万 Token稳定前缀可降低重复输入成本
输入上下文1,048,576 Token1,048,576 Token容量相同
最大输出65,536 Token65,536 Token官方上限相同
输入模态文本、图像、视频、音频、PDF文本、图像、视频、音频、PDF多模态输入范围相同
输出模态文本文本两者都不是媒体生成模型
思考档位lowmediumhighlowmediumhigh必须在同档位对比

接口表面相同,让 3.8 与 3.7 并行评测很方便,但这并不意味着升级在经济上必然成立。

Gemini 3.8 Flash 到底改变了什么?

Google 把 3.8 Flash 定位为更强的 Flash 系列主力模型,覆盖编程、智能体工作流、知识工作和多模态理解。发布材料称其在编程及终端操作相关评测中获得提升。这些是厂商公布的信号,适合用来决定“优先测什么”,不能替代你自己的生产验收标准。

对选型最关键的描述来自 Google 开发者指南:3.8 Flash 相比 3.7 Flash 准确率更高,但 Token 消耗也更高;当计算效率优先时,建议使用 3.7 Flash。 这条说明非常直接,也排除了“3.8 在所有场景都更便宜或更高效”的简单结论。

3.8 还沿用当前 Gemini 3 的请求约定:

  • 在 EvoLink Gemini 原生接口中,Gemini 3.x 使用 generationConfig.thinkingConfig.thinkingLevelthinkingBudget 是 Gemini 2.5 的控制项,二者不能同时使用;
  • 支持 lowmedium(默认)和 high,不支持 minimal,EvoLink 会将其自动降级为 low
  • EvoLink 说明自定义 temperaturetopP 不影响 Gemini 3.x 输出,topK 会被忽略;temperaturetopP 越界会返回 400;
  • 请求不能以 model 轮次结尾;
  • 函数响应必须回传相匹配的函数 idname

做 3.7 与 3.8 对比时也必须遵守这些规则。隐藏的参数差异很容易被误判成模型能力差异。

选择矩阵

工作负载建议起点原因上线前要测什么
带严格测试的代码修改把 3.8 作为挑战者测试Google 报告其在部分编程基准上分数更高;生产效果未知测试通过率、审核修改、总 Token、延迟
多步工具智能体把 3.8 作为挑战者测试Google 重点介绍了智能体基准;生产工具调用效果未知有效调用、失败步骤、重试、完成率
文档与图表分析两者并测上下文与模态相同引用准确率、提取错误、输出 Token
已稳定的分类流水线保留 3.7 作为对照Google 建议在计算效率优先时使用 3.7漂移、每千个合格标签成本、P95 延迟
高并发摘要保留当前模型作为对照EvoLink 尚无公开实测证明 3.8 在该场景有优势压缩质量、输出长度、审核率
混合生产流量同时路由一个默认模型很难覆盖所有任务分路由通过率、支出、回退频率

上表只用于分配评测候选,不预测胜负。在挑战者达到预先设定的验收、成本和延迟门槛前,应保留当前生产模型作为对照。

真正重要的指标:每个验收任务的成本

Token 价格只是生产成本的一部分,可以用下面的模型级口径:

每个验收任务成本 =(模型总支出 + 重试支出 + 人工审核成本)/ 验收任务数

EvoLink 尚未发布能够证明 3.8 Flash 减少重试、审核工作或任务总成本的受控工作负载对比。上面的公式只是评测方法,不是实测结果。Google 已公布的“准确率更高、Token 消耗也更高”无法证明哪个模型完成生产任务时更便宜。

至少追踪以下指标:

  • 验收通过率与首次成功率;
  • 完整任务的输入、输出和思考 Token,包括所有重试;
  • 缓存读取 Token 与缓存命中率;
  • 有效与被拒绝的工具调用;
  • 产出合格结果所需时间;
  • 人工修改分钟数;
  • 回退与回滚频率。

可复现的 3.8 vs 3.7 评测流程

对比合格结果、Token 用量、重试与回滚路径的生产评测闭环
对比合格结果、Token 用量、重试与回滚路径的生产评测闭环
  1. 冻结代表性任务集。 使用经过隐私处理的真实任务,覆盖简单、中位和高失败率案例。50 个任务足以发现明显回归,但正式切流需要更大的样本。
  2. 保持请求协议一致。 系统指令、工具、Schema、上下文、输出预算与思考档位全部相同。没有特殊原因时,可从 medium 开始。
  3. 使用干净会话。 切换模型时不要复用模型专属缓存或状态,否则对比结果可能失真。
  4. 评估验收,不评估“看起来更好”。 在看到结果前先定义可执行测试、提取检查、引用规则或审核量表。
  5. 计算完整循环成本。 纳入思考输出、重试、回退调用与人工审核,而不只计算第一次响应。
  6. 默认切换前先灰度。 把少量、可观测的流量送到 3.8,并保留只改一个模型 ID 就能回到 3.7 的路径。

测试前写好晋级门槛,例如:关键错误不能显著增加;验收通过率达到预设提升;每个验收任务成本与 P95 延迟的涨幅不超过上限。

迁移与回滚清单

同系列模型切换也应当按行为版本发布来管理:

  • API 的 modelgemini-3.7-flash 改为 gemini-3.8-flash;不要把页面路径 gemini-3-8-flash 当模型 ID。
  • 检查旧客户端是否同时使用了两种 thinking 控制项、依赖被忽略的采样参数,或传入越界值。
  • minimal 显式映射到经过测试的支持档位,通常是 low,不要假设二者完全等价。
  • 重新验证结构化输出与函数响应 Schema。
  • 清除模型专属提示词缓存,并用干净状态开始迁移评测。
  • 记录模型 ID、路由、思考档位、各类 Token、延迟、重试和验收结果。
  • 在完整观察窗结束前,把 3.7 保留为显式回退路径。
通过 EvoLink,可以把 Gemini 3.8 FlashGemini 3.7 Flash 放在同一套 API 集成后,按请求更改 model。它的运维价值在于受控选型与快速回滚,而不是承诺每次调用都获得最低成本。

谁适合现在测试 3.8?

当 Google 重点介绍的编程、智能体或文档能力符合当前评测需求,而且团队已经采集 Token、延迟与验收指标时,可以启动受控的 3.8 挑战者测试。这是测试建议,不是升级结论。

如果任务稳定且量大、当前质量已经过线、计算效率是核心约束,或者暂时无法安排完整回归与灰度窗口,则先保留 3.7。

只有完成评测后才考虑按工作负载路由:保留各现有路由作为对照,仅对达到书面门槛的任务类型晋级 3.8,并保留回滚路径。可在 Gemini 模型对比页 查看完整家族,也可以阅读 Gemini 3.8 Flash 接入指南 完成请求配置与灰度上线。

常见对比错误

  • 因为介绍价低于未来标准价,就把 3.8 写成“更便宜”,却没有注明价格周期。
  • 把每 Token 单价相同理解为每任务成本相同。
  • 用 3.8 的 high 与 3.7 的 mediumlow 比较。
  • 在不同模型之间复用模型专属缓存。
  • 把厂商基准提升写成应用效果保证。
  • 只评回答内容,不统计重试、审核时间和工具失败。
  • 没有回滚阈值就替换生产默认模型。

常见问题

Gemini 3.8 Flash 比 3.7 Flash 更好吗?

公开证据没有给出总体胜者。Google 报告 3.8 Flash 的准确率更高,尤其强调部分编程与智能体基准,同时说明其 Token 消耗也更高。EvoLink 尚未发布能够把这些事实转化为任务级结论的受控工作负载结果。

Gemini 3.8 Flash 比 3.7 Flash 更贵吗?

截至 2026-12-31,两者的 Google 介绍期 Token 单价相同。如果 3.8 使用更多输出或思考 Token,单个任务仍可能更贵。EvoLink 实际费用应查询账号实时价格。

2027 年价格会怎样变化?

Google 列出的 2027-01-01 起标准价为:输入 $1.50 / 百万 Token、输出 $7.50 / 百万 Token、缓存读取 $0.15 / 百万 Token。届时应重新核对 Google 与 EvoLink 价格。

两款模型的上下文窗口不同吗?

没有差异。Google 为两者都记录了 1,048,576 Token 输入上限和 65,536 Token 最大输出。

Gemini 3.8 Flash 支持 minimal 思考档位吗?

不支持。可用值是 lowmediumhigh,默认 medium。EvoLink 原生 API 参考说明,不支持的 minimal 会被自动降级为 low,因此请显式设置 low,不要依赖降级。

从 3.7 切到 3.8 能继续复用缓存吗?

不要假设缓存内容可跨模型版本复用。应重新创建模型专属缓存,并用干净状态开始迁移评测。

应该立即用 3.8 替换 3.7 吗?

不应该自动替换。先回放并灰度,只在 3.8 达到预先设定的质量、成本和延迟门槛时,才针对对应工作负载晋级。

可以。EvoLink 产品目录已经包含两条模型路由,可通过统一 API 显式选择模型。上线前仍应在账号中验证实时可用性与价格,并在观察期保留 3.7 回滚路径。EvoLink Gemini API 文档已在原生与 OpenAI 兼容两个端点的模型枚举中列出 gemini-3.8-flash

来源与核验说明

官方规格、价格与 EvoLink 请求规则已于 2026-09-03 复核。除非明确标注,基准描述均来自厂商;生产结果取决于具体工作负载。EvoLink 文档已在两个端点的模型枚举中列出 gemini-3.8-flash,生产切流前仍应验证账号对 3.8 的实时权限。

准备好把 AI 成本降低 89% 吗?

现在就开始使用 EvoLink,体验智能 API 路由的强大能力。