Seedance 2.5 已上线 EvoLink立即体验

Gemini 3.8 Flash API

Google-文本生成-$0.675 / 百万输入 Token 起$1.500 Google 介绍价-可用
100 万上下文6.5 万最大输出提示词缓存Chat + Gemini API
API 文档
生产路由在线
提供方
Google
模型
3.8 Flash
上下文窗口
1,048,576 Token
支持协议
Chat + Gemini

选择 Gemini 3.8 Flash

Gemini 3.8 Flash 是 Google 最新的 Flash 系列主力模型,适合编程、智能体工作流、知识工作与多模态推理;Google 报告其准确率高于 Gemini 3.7 Flash,并提供 100 万 Token 上下文。

Gemini 3.8 Flash

Google Flash 系列主力模型

已选择
$0.675 / 百万输入 Token 起$1.500 Google 介绍价gemini-3.8-flash
适用场景

可评测 Google 重点介绍的编程、多步智能体、文档与图表分析任务;EvoLink 尚未公布这些场景的任务成本或验收结果。

输入
$0.675 / 1M-55%
45.9 cr / 1M$1.500Google 介绍价
缓存读取
$0.068 / 1M-55%
4.6 cr / 1M$0.150Google 介绍价
输出
$3.375 / 1M-55%
229.5 cr / 1M$7.500Google 介绍价

Gemini 3.8 Flash 价格

用交互式价格计算器估算单次请求费用,并与 Google 当前介绍价对比。

3.8 Flash

Token 价格计算器

输入单次请求的 Token 组成。

单次请求预估

Gemini 3.8 Flash
预估价格
USD$0.0018
Credits0.1158
输入 Token0.0459 cr
缓存读取 Token0.001 cr
输出 Token0.0689 cr

预估最低消费:每次请求 0.01 Credits。

EvoLink 与 Google 直连对比

相同 Token 组合,使用默认分组价格。
-55%
EvoLink 预估$0.0018
Google 介绍价$0.0038
同 Token 组合预估节省$0.0021

预算参考

按当前 Token 组合估算可调用次数。
充值 Credits
$10
约 5872 次请求

快速测试

$50
约 29360 次请求

日常开发

$100
约 58721 次请求

生产评估

模型价格

Gemini 3.8 Flash

全部上下文长度
输入 Token
$0.675 / 1M-55%
45.9 cr / 1M$1.500Google 介绍价
缓存读取 Token
$0.068 / 1M-55%
4.6 cr / 1M$0.150Google 介绍价
输出 Token
$3.375 / 1M-55%
229.5 cr / 1M$7.500Google 介绍价

美元与 Credits 均按每百万 Token 展示。后端实时价格优先,Google 当前介绍价仅用于对比。

Gemini 3.8 Flash API:面向编程与智能体工作流

通过 EvoLink 统一 API 调用 Google 最新的 Flash 系列主力模型 Gemini 3.8 Flash。Google 报告其准确率高于 Gemini 3.7 Flash,同时 Token 消耗也更高;支持 1,048,576 Token 上下文、提示词缓存、结构化输出与工具调用,Google 介绍价为每百万输入 / 输出 Token $0.75 / $3.75(限时至 2026-12-31)。

Gemini 3.8 Flash
Gemini 3.8 Flash 适用场景

如何在生产模型栈中评测 Gemini 3.8 Flash

Google 将 Gemini 3.8 Flash 定位为面向编程、知识工作和多模态任务的更高准确率主力模型,同时明确说明其 Token 消耗高于 Gemini 3.7 Flash。Google 没有公布具体工作负载的任务总成本,EvoLink 也尚未发布受控对照结果,因此不能预先断言它能减少重试或人工返工。

编程与重构评测

Gemini 3.8 Flash 面向日常编程、原型开发和全栈重构,Google 报告其准确率高于 Gemini 3.7 Flash,但 Token 消耗也可能更高。评估时应看补丁采用率、总 Token、代码审查耗时和返工次数。

智能体工作流与编排

Google 重点介绍了多步编排、工具选择、结构化输出和代码执行。EvoLink 尚未测出这些工作流的任务完成率或总成本;评测时要在多轮请求中保留完整助手消息、工具调用 ID、参数和执行结果。

知识工作与多模态推理

适合在百万 Token 上下文中做文档分析、图表理解和多元素网页布局生成。但百万 Token 只是容量,塞入无关资料不会提升质量;检索和文档结构仍然决定回答效果。

什么时候该换别的模型

Gemini 3.5 Flash-Lite 的公开 Token 单价更低,适合纳入高并发分类与抽取任务的候选。不要基于未经验证的任务成本优势分配 3.8 Flash;应在相同验收标准下与现有路由对照。

官方发布证据

Google 已确认什么,EvoLink 尚未测出什么

Google 于 2026-09-02 发布 Gemini 3.8 Flash,并公布模型级基准与 Token 消耗说明。EvoLink 尚未发布 3.8 与 3.7 的受控工作负载对比,因此本页不声称它能减少重试、缩短智能体循环或降低任务总成本。

介绍期 Token 单价相同,官方基准分数更高

Google 为 3.8 Flash 与 3.7 Flash 列出相同的介绍期输入、输出和缓存读取单价,并报告 3.8 在重点编程与智能体基准上分数更高。Google 同时明确记录了更高的 Token 消耗;这些事实不能证明单个生产任务的账单更低。

官方基准不是跨供应商生产排名

Google 的发布结果覆盖选定基准,不能证明 3.8 Flash 在你的工作负载上优于所有 Pro 层或第三方模型。因此本页不作跨供应商胜负结论。

更高 Token 消耗是官方明确提示

Google 明确说明 3.8 Flash 在提高准确率的同时,比 3.7 Flash 使用更多 Token。仅凭公开 Token 单价,无法判断哪个模型完成任务的成本更低。

它是闭源、仅通过 API 提供的 Google 模型

Gemini 3.8 Flash 没有开放权重,无法本地自托管。只能通过 Gemini API 及 Google AI Studio、Antigravity 等平台,以及 EvoLink 这类统一网关调用——因此应按成本和稳定性路由,而不是考虑本地部署。

核心能力

官方能力及其评测边界

Google 已确认大上下文窗口、更高准确率和提示词缓存,但没有公布能够证明这些能力在 EvoLink 工作负载中降低任务总成本的数据。上下文容量本身也不能证明应用结果更好。

百万 Token 是工作空间,不是填充目标

1,048,576 Token 上下文可以在一次请求中保留相关代码、规格文档和历史工具结果。它能否改善应用结果仍需实测;无关输入同样消耗 Token,因此仍应先检索相关内容并压缩失去价值的上下文。

更高准确率,也可能消耗更多 Token

Google 明确说明 Gemini 3.8 Flash 相比 3.7 Flash 提高准确率的同时会增加 Token 消耗。请跟踪每个验收任务的总成本,判断结果改善能否抵消额外的输入、输出与思考 Token。

稳定前缀才能让提示词缓存真正省钱

仓库说明、系统提示词、参考资料和工具 Schema 保持稳定时,重复请求更容易形成缓存命中。频繁更换模型、提示词结构或关键配置,会增加长前缀重新处理的成本。

Gemini 3.8 Flash API 生产检查

正式接入 Gemini 3.8 Flash API 前必须确认的四件事

任务适合并不等于接入一定正确。上线前应确认模型标识、调用协议、参数变更和会话状态,避免把接入问题误判成模型能力问题。

01

使用准确的模型 ID:gemini-3.8-flash

在 EvoLink API 路由中把 model 设为 "gemini-3.8-flash"(带点)。带连字符的 gemini-3-8-flash 只是页面 URL,不是 API 的模型参数。

模型 ID
02

使用 OpenAI Chat Completions 或 Gemini 原生 API

EvoLink 通过兼容 OpenAI 的 /v1/chat/completions 与 Gemini 原生 generateContent 端点提供 Gemini 3.8 Flash,两种协议使用同一个 EvoLink API 密钥。

调用协议
03

注意参数层面的破坏性变更

EvoLink 原生接口文档规定:Gemini 3.x 使用 generationConfig.thinkingConfig.thinkingLevel;thinkingBudget 属于 Gemini 2.5,二者不能同时使用。自定义 temperature 与 topP 不影响 Gemini 3.x 输出,topK 会被忽略;temperature 或 topP 超出有效范围会返回 400。最后一轮消息的 role 不能是 model。

迁移
04

完整保留助手消息与工具状态

多轮智能体任务需要回传完整助手消息、工具调用 ID、参数和工具执行结果。只保留最终文本会破坏状态连续性,即使上下文窗口足够大,也可能导致后续步骤判断错误。

工具状态
生产成本评估

目前没有已验证的任务成本胜者

已确认的事实是:3.8 Flash 与 3.7 Flash 的 Google 介绍期 Token 单价相同;Google 报告 3.8 准确率更高,同时 Token 消耗也更高。EvoLink 尚未公布关于重试、交付通过、工具调用、总耗时或人工审核的受控对照数据。

首次成功率交付通过率重试次数输出 Token缓存命中率工具调用有效率得到可用结果的耗时人工修改量与回退频率

以上只是评测时需要采集的指标,不是 Gemini 3.8 Flash 已取得的结果。在用相同配置跑完同一批生产样本前,不应声称 3.8 能降低每个验收任务的成本;如果 3.7 Flash 或 Flash-Lite 的公开价格与计算特征已经满足任务,应继续使用现有路由。

完成生产评估后,再对比主流长上下文模型

EvoLink

先衡量更高准确率能否抵消 Gemini 3.8 Flash 的额外 Token 消耗,再结合价格、上下文、缓存方式与任务类型选择生产路由。

Gemini 3.8 Flash
输入 / 输出$0.675 / $3.375
上下文1M
缓存自动缓存读取
适用场景可评测 Google 重点介绍的编程、多步智能体、文档与图表分析任务;EvoLink 尚未公布这些场景的任务成本或验收结果。
Gemini 3.5 Flash Lite
输入 / 输出$0.3 / $2.5
上下文1M
缓存上下文缓存
适用场景公开 Token 单价更低,可用于对比分类、抽取与高并发任务。
Gemini 3.1 Pro
输入 / 输出$1.68 / $10.08
上下文1M
缓存上下文缓存
适用场景Pro 层对照路由,用于评测 Flash 系列难以满足的深度推理任务。

EvoLink 上的其他 Gemini 模型

Gemini 3.5 Flash

Gemini 3.5 Flash

3.5 系列 Flash 路由,可用于对比质量、延迟与 Token 用量。

查看模型
Gemini 3.5 Flash Lite

Gemini 3.5 Flash Lite

公开 Token 单价更低,可用于对比分类、抽取与高并发子智能体任务。

查看模型
Gemini 3.1 Pro

Gemini 3.1 Pro

Pro 层对照路由,用于评测更深度的推理任务。

查看模型
Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite

轻量级 3.1 路由,可用于对比成本敏感型高并发任务。

查看模型

其他文本模型

GPT-5.6

GPT-5.6

OpenAI 分层模型家族,可用于对比能力、延迟与成本路由。

查看模型
Claude Opus 4.8

Claude Opus 4.8

Anthropic 对照模型,可用于评测长时间编程智能体与高判断力审核。

查看模型
DeepSeek V4

DeepSeek V4

开源模型对照路由,可用于评测编程、推理与智能体任务。

查看模型
Kimi K3

Kimi K3

Moonshot 对照路由,可用于评测长上下文推理与多文档任务。

查看模型

面向生产团队的相关阅读

Gemini 3.8 Flash vs Gemini 3.7 Flash

Gemini 3.8 Flash vs Gemini 3.7 Flash

切换默认模型前,对比准确率、Token 消耗、介绍期价格和每个验收任务的真实成本。

阅读指南
Gemini 3.8 Flash API 怎么用

Gemini 3.8 Flash API 怎么用

完成首次请求,处理 Gemini 3 迁移规则,并加入监控、灰度和回滚控制。

阅读指南
对比 Gemini API 家族

对比 Gemini API 家族

在路由前先看清 3.8 Flash、3.5 Flash-Lite、3.7 Flash 与 3.1 Pro 在价格、上下文与任务适配上的差异。

阅读指南
Gemini 3.5 Flash-Lite API

Gemini 3.5 Flash-Lite API

Google 公开 Token 单价更低的 3.5 系列路由,可与 3.8 Flash 对比分类、抽取及高并发任务。

阅读指南
Gemini 3.7 Flash API

Gemini 3.7 Flash API

与 3.8 Flash 同价的上一代 Flash 模型;把生产流量切过去之前先做对比。

阅读指南
Gemini 3.1 Pro API

Gemini 3.1 Pro API

当任务需要超出 Flash 系列的更深推理时,升级到 Pro 层。

阅读指南

Gemini 3.8 Flash API 常见问题

Gemini 3.8 Flash API 现在可以调用吗?

可以。Gemini 3.8 Flash 已作为正式生产模型展示;页面在后端返回价格时优先使用该价格,否则以 Google 当前介绍价作为对比基准。

Gemini 3.8 Flash API 应该使用哪个模型 ID?

model 请填写 "gemini-3.8-flash"(带点)。带连字符的 gemini-3-8-flash 只是页面 URL,不是 API 的模型参数。

Gemini 3.8 Flash 支持哪些协议和 SDK?

EvoLink 文档说明,可在 direct.evolink.ai 使用兼容 OpenAI 的 Chat Completions 或 Gemini 原生 generateContent,并共用同一 API 密钥;两个端点的模型枚举都已列出 gemini-3.8-flash。发送流量前仍请在账号中确认实时路由。

Gemini 3.8 Flash API 真的支持完整的百万上下文吗?

是的——按 Google 官方文档,路由记录的是 1,048,576 输入 Token。更小的上限通常来自某个 Gemini 产品入口或客户端配置,而不是 API 模型本身。

百万 Token 上下文应该怎么使用?

保留真正相关的代码、文档和工具结果,同时配合检索、稳定缓存前缀与上下文压缩,不要为了用满窗口而加入无关内容。

Gemini 3.8 Flash 与 3.7 Flash、3.5 Flash-Lite 有什么区别?

Google 为 3.8 与 3.7 列出相同的介绍期 Token 单价,报告 3.8 在部分编程与智能体基准上分数更高,同时明确其 Token 消耗也更高。Google 为 3.5 Flash-Lite 列出的 Token 单价更低;具体工作负载结果仍需实测。

Gemini 3.8 Flash 如果 Token 用量更多,实际上更省钱吗?

单 Token 价格与 3.7 Flash 相同,但 Google 明确说明 3.8 Flash 在提高准确率的同时会消耗更多 Token。请比较自己工作负载中每个验收任务的总成本,不要预设单任务成本更低。

迁移到 Gemini 3.8 Flash 需要注意哪些参数规则?

EvoLink 原生接口中,Gemini 3.x 使用 generationConfig.thinkingConfig.thinkingLevel;thinkingBudget 属于 Gemini 2.5,不能与 thinkingLevel 同时使用。文档说明自定义 temperature 与 topP 不影响 Gemini 3.x 输出,topK 会被忽略;temperature 或 topP 超出有效范围会返回 400。最后一轮消息的 role 不能是 model。

Gemini 3.8 Flash 的 minimal 思考档位去哪了?

Google 为 Gemini 3.8 Flash 记录的可用档位是 low、medium(默认)和 high,不支持 minimal。EvoLink 原生 API 参考说明:传入不支持的 minimal 会被自动降级为 low,请求不会失败;为了可控,建议迁移时显式改为 low。Gemini 3.5 Flash-Lite 的公开 Token 单价更低,可继续作为高并发分类任务的对照路由。

Gemini 3.8 Flash 的思考 Token 怎么计费?

按 Google 定价,思考 Token 按输出价计费,因此推理越多,账单可能明显大于可见回答。请按任务设置合适的思考档位,并同时监控推理与最终答案 Token。

Gemini 3.8 Flash 能分析视频和音频吗?

可以。Google 文档记录了文本、图像、视频、音频和 PDF 输入以及文本输出,因此视频与音频理解属于可评测场景;它不支持图像生成、音频生成和 Live API 生成。

有 Gemini 3.7 Pro 吗?

没有。截至 3.8 Flash 发布,Google Pro 线最新模型仍是 gemini-3.1-pro-preview,官方渠道未宣布 3.5 或 3.7 Pro。

Gemini 3.8 Flash 的介绍价能持续多久?

Google 公布的介绍价为每百万输入 $0.75、输出 $3.75,限时至 2026-12-31;2027-01-01 起恢复标准价 $1.50 / $7.50。EvoLink 的当前价格请见本页价格模块。

Gemini 3.8 Flash 遵循指令比 3.7 Flash 更可靠吗?

Google 报告其整体准确率更高、Token 消耗也更高,但 EvoLink 尚未发布受控的指令遵循对比结果。投入生产前应使用代表性任务验证。

生产环境应该怎样评估 Gemini 3.8 Flash?

EvoLink 尚未公布对照结果。评测输入应包括首次成功率、交付通过率、重试、输出 Token、缓存命中、工具调用、总耗时、人工修改量和回退频率。