Gemini 3.8 Flash API
选择 Gemini 3.8 Flash
Gemini 3.8 Flash 是 Google 最新的 Flash 系列主力模型,适合编程、智能体工作流、知识工作与多模态推理;Google 报告其准确率高于 Gemini 3.7 Flash,并提供 100 万 Token 上下文。
Gemini 3.8 Flash
Google Flash 系列主力模型
gemini-3.8-flash可评测 Google 重点介绍的编程、多步智能体、文档与图表分析任务;EvoLink 尚未公布这些场景的任务成本或验收结果。
Gemini 3.8 Flash 价格
用交互式价格计算器估算单次请求费用,并与 Google 当前介绍价对比。
Token 价格计算器
输入单次请求的 Token 组成。单次请求预估
Gemini 3.8 Flash预估最低消费:每次请求 0.01 Credits。
EvoLink 与 Google 直连对比
相同 Token 组合,使用默认分组价格。预算参考
按当前 Token 组合估算可调用次数。快速测试
日常开发
生产评估
模型价格
| 模型 | 上下文 | 输入 Token | 缓存读取 Token | 输出 Token |
|---|---|---|---|---|
Gemini 3.8 Flashgemini-3.8-flash | 全部上下文长度 | $0.675 / 1M-55% 45.9 cr / 1M$1.500Google 介绍价 | $0.068 / 1M-55% 4.6 cr / 1M$0.150Google 介绍价 | $3.375 / 1M-55% 229.5 cr / 1M$7.500Google 介绍价 |
Gemini 3.8 Flash
全部上下文长度美元与 Credits 均按每百万 Token 展示。后端实时价格优先,Google 当前介绍价仅用于对比。
Gemini 3.8 Flash API:面向编程与智能体工作流
通过 EvoLink 统一 API 调用 Google 最新的 Flash 系列主力模型 Gemini 3.8 Flash。Google 报告其准确率高于 Gemini 3.7 Flash,同时 Token 消耗也更高;支持 1,048,576 Token 上下文、提示词缓存、结构化输出与工具调用,Google 介绍价为每百万输入 / 输出 Token $0.75 / $3.75(限时至 2026-12-31)。
如何在生产模型栈中评测 Gemini 3.8 Flash
Google 将 Gemini 3.8 Flash 定位为面向编程、知识工作和多模态任务的更高准确率主力模型,同时明确说明其 Token 消耗高于 Gemini 3.7 Flash。Google 没有公布具体工作负载的任务总成本,EvoLink 也尚未发布受控对照结果,因此不能预先断言它能减少重试或人工返工。
编程与重构评测
Gemini 3.8 Flash 面向日常编程、原型开发和全栈重构,Google 报告其准确率高于 Gemini 3.7 Flash,但 Token 消耗也可能更高。评估时应看补丁采用率、总 Token、代码审查耗时和返工次数。
智能体工作流与编排
Google 重点介绍了多步编排、工具选择、结构化输出和代码执行。EvoLink 尚未测出这些工作流的任务完成率或总成本;评测时要在多轮请求中保留完整助手消息、工具调用 ID、参数和执行结果。
知识工作与多模态推理
适合在百万 Token 上下文中做文档分析、图表理解和多元素网页布局生成。但百万 Token 只是容量,塞入无关资料不会提升质量;检索和文档结构仍然决定回答效果。
什么时候该换别的模型
Gemini 3.5 Flash-Lite 的公开 Token 单价更低,适合纳入高并发分类与抽取任务的候选。不要基于未经验证的任务成本优势分配 3.8 Flash;应在相同验收标准下与现有路由对照。
Google 已确认什么,EvoLink 尚未测出什么
Google 于 2026-09-02 发布 Gemini 3.8 Flash,并公布模型级基准与 Token 消耗说明。EvoLink 尚未发布 3.8 与 3.7 的受控工作负载对比,因此本页不声称它能减少重试、缩短智能体循环或降低任务总成本。
介绍期 Token 单价相同,官方基准分数更高
Google 为 3.8 Flash 与 3.7 Flash 列出相同的介绍期输入、输出和缓存读取单价,并报告 3.8 在重点编程与智能体基准上分数更高。Google 同时明确记录了更高的 Token 消耗;这些事实不能证明单个生产任务的账单更低。
官方基准不是跨供应商生产排名
Google 的发布结果覆盖选定基准,不能证明 3.8 Flash 在你的工作负载上优于所有 Pro 层或第三方模型。因此本页不作跨供应商胜负结论。
更高 Token 消耗是官方明确提示
Google 明确说明 3.8 Flash 在提高准确率的同时,比 3.7 Flash 使用更多 Token。仅凭公开 Token 单价,无法判断哪个模型完成任务的成本更低。
它是闭源、仅通过 API 提供的 Google 模型
Gemini 3.8 Flash 没有开放权重,无法本地自托管。只能通过 Gemini API 及 Google AI Studio、Antigravity 等平台,以及 EvoLink 这类统一网关调用——因此应按成本和稳定性路由,而不是考虑本地部署。
官方能力及其评测边界
Google 已确认大上下文窗口、更高准确率和提示词缓存,但没有公布能够证明这些能力在 EvoLink 工作负载中降低任务总成本的数据。上下文容量本身也不能证明应用结果更好。
百万 Token 是工作空间,不是填充目标
1,048,576 Token 上下文可以在一次请求中保留相关代码、规格文档和历史工具结果。它能否改善应用结果仍需实测;无关输入同样消耗 Token,因此仍应先检索相关内容并压缩失去价值的上下文。
更高准确率,也可能消耗更多 Token
Google 明确说明 Gemini 3.8 Flash 相比 3.7 Flash 提高准确率的同时会增加 Token 消耗。请跟踪每个验收任务的总成本,判断结果改善能否抵消额外的输入、输出与思考 Token。
稳定前缀才能让提示词缓存真正省钱
仓库说明、系统提示词、参考资料和工具 Schema 保持稳定时,重复请求更容易形成缓存命中。频繁更换模型、提示词结构或关键配置,会增加长前缀重新处理的成本。
正式接入 Gemini 3.8 Flash API 前必须确认的四件事
任务适合并不等于接入一定正确。上线前应确认模型标识、调用协议、参数变更和会话状态,避免把接入问题误判成模型能力问题。
使用准确的模型 ID:gemini-3.8-flash
在 EvoLink API 路由中把 model 设为 "gemini-3.8-flash"(带点)。带连字符的 gemini-3-8-flash 只是页面 URL,不是 API 的模型参数。
使用 OpenAI Chat Completions 或 Gemini 原生 API
EvoLink 通过兼容 OpenAI 的 /v1/chat/completions 与 Gemini 原生 generateContent 端点提供 Gemini 3.8 Flash,两种协议使用同一个 EvoLink API 密钥。
注意参数层面的破坏性变更
EvoLink 原生接口文档规定:Gemini 3.x 使用 generationConfig.thinkingConfig.thinkingLevel;thinkingBudget 属于 Gemini 2.5,二者不能同时使用。自定义 temperature 与 topP 不影响 Gemini 3.x 输出,topK 会被忽略;temperature 或 topP 超出有效范围会返回 400。最后一轮消息的 role 不能是 model。
完整保留助手消息与工具状态
多轮智能体任务需要回传完整助手消息、工具调用 ID、参数和工具执行结果。只保留最终文本会破坏状态连续性,即使上下文窗口足够大,也可能导致后续步骤判断错误。
目前没有已验证的任务成本胜者
已确认的事实是:3.8 Flash 与 3.7 Flash 的 Google 介绍期 Token 单价相同;Google 报告 3.8 准确率更高,同时 Token 消耗也更高。EvoLink 尚未公布关于重试、交付通过、工具调用、总耗时或人工审核的受控对照数据。
以上只是评测时需要采集的指标,不是 Gemini 3.8 Flash 已取得的结果。在用相同配置跑完同一批生产样本前,不应声称 3.8 能降低每个验收任务的成本;如果 3.7 Flash 或 Flash-Lite 的公开价格与计算特征已经满足任务,应继续使用现有路由。
完成生产评估后,再对比主流长上下文模型
EvoLink先衡量更高准确率能否抵消 Gemini 3.8 Flash 的额外 Token 消耗,再结合价格、上下文、缓存方式与任务类型选择生产路由。
| 模型 | Gemini 3.8 Flash | Gemini 3.5 Flash Lite | Gemini 3.1 Pro |
|---|---|---|---|
| 输入 / 输出 | $0.675 / $3.375 | $0.3 / $2.5 | $1.68 / $10.08 |
| 上下文 | 1M | 1M | 1M |
| 缓存 | 自动缓存读取 | 上下文缓存 | 上下文缓存 |
| 适用场景 | 可评测 Google 重点介绍的编程、多步智能体、文档与图表分析任务;EvoLink 尚未公布这些场景的任务成本或验收结果。 | 公开 Token 单价更低,可用于对比分类、抽取与高并发任务。 | Pro 层对照路由,用于评测 Flash 系列难以满足的深度推理任务。 |
EvoLink 上的其他 Gemini 模型




其他文本模型




面向生产团队的相关阅读




Gemini 3.8 Flash API 常见问题
Gemini 3.8 Flash API 现在可以调用吗?
可以。Gemini 3.8 Flash 已作为正式生产模型展示;页面在后端返回价格时优先使用该价格,否则以 Google 当前介绍价作为对比基准。
Gemini 3.8 Flash API 应该使用哪个模型 ID?
model 请填写 "gemini-3.8-flash"(带点)。带连字符的 gemini-3-8-flash 只是页面 URL,不是 API 的模型参数。
Gemini 3.8 Flash 支持哪些协议和 SDK?
EvoLink 文档说明,可在 direct.evolink.ai 使用兼容 OpenAI 的 Chat Completions 或 Gemini 原生 generateContent,并共用同一 API 密钥;两个端点的模型枚举都已列出 gemini-3.8-flash。发送流量前仍请在账号中确认实时路由。
Gemini 3.8 Flash API 真的支持完整的百万上下文吗?
是的——按 Google 官方文档,路由记录的是 1,048,576 输入 Token。更小的上限通常来自某个 Gemini 产品入口或客户端配置,而不是 API 模型本身。
百万 Token 上下文应该怎么使用?
保留真正相关的代码、文档和工具结果,同时配合检索、稳定缓存前缀与上下文压缩,不要为了用满窗口而加入无关内容。
Gemini 3.8 Flash 与 3.7 Flash、3.5 Flash-Lite 有什么区别?
Google 为 3.8 与 3.7 列出相同的介绍期 Token 单价,报告 3.8 在部分编程与智能体基准上分数更高,同时明确其 Token 消耗也更高。Google 为 3.5 Flash-Lite 列出的 Token 单价更低;具体工作负载结果仍需实测。
Gemini 3.8 Flash 如果 Token 用量更多,实际上更省钱吗?
单 Token 价格与 3.7 Flash 相同,但 Google 明确说明 3.8 Flash 在提高准确率的同时会消耗更多 Token。请比较自己工作负载中每个验收任务的总成本,不要预设单任务成本更低。
迁移到 Gemini 3.8 Flash 需要注意哪些参数规则?
EvoLink 原生接口中,Gemini 3.x 使用 generationConfig.thinkingConfig.thinkingLevel;thinkingBudget 属于 Gemini 2.5,不能与 thinkingLevel 同时使用。文档说明自定义 temperature 与 topP 不影响 Gemini 3.x 输出,topK 会被忽略;temperature 或 topP 超出有效范围会返回 400。最后一轮消息的 role 不能是 model。
Gemini 3.8 Flash 的 minimal 思考档位去哪了?
Google 为 Gemini 3.8 Flash 记录的可用档位是 low、medium(默认)和 high,不支持 minimal。EvoLink 原生 API 参考说明:传入不支持的 minimal 会被自动降级为 low,请求不会失败;为了可控,建议迁移时显式改为 low。Gemini 3.5 Flash-Lite 的公开 Token 单价更低,可继续作为高并发分类任务的对照路由。
Gemini 3.8 Flash 的思考 Token 怎么计费?
按 Google 定价,思考 Token 按输出价计费,因此推理越多,账单可能明显大于可见回答。请按任务设置合适的思考档位,并同时监控推理与最终答案 Token。
Gemini 3.8 Flash 能分析视频和音频吗?
可以。Google 文档记录了文本、图像、视频、音频和 PDF 输入以及文本输出,因此视频与音频理解属于可评测场景;它不支持图像生成、音频生成和 Live API 生成。
有 Gemini 3.7 Pro 吗?
没有。截至 3.8 Flash 发布,Google Pro 线最新模型仍是 gemini-3.1-pro-preview,官方渠道未宣布 3.5 或 3.7 Pro。
Gemini 3.8 Flash 的介绍价能持续多久?
Google 公布的介绍价为每百万输入 $0.75、输出 $3.75,限时至 2026-12-31;2027-01-01 起恢复标准价 $1.50 / $7.50。EvoLink 的当前价格请见本页价格模块。
Gemini 3.8 Flash 遵循指令比 3.7 Flash 更可靠吗?
Google 报告其整体准确率更高、Token 消耗也更高,但 EvoLink 尚未发布受控的指令遵循对比结果。投入生产前应使用代表性任务验证。
生产环境应该怎样评估 Gemini 3.8 Flash?
EvoLink 尚未公布对照结果。评测输入应包括首次成功率、交付通过率、重试、输出 Token、缓存命中、工具调用、总耗时、人工修改量和回退频率。