Kimi K3 现已上线查看 Kimi K3

Gemini 3.6 Flash API

Google-文本生成-$1.350 / 百万输入 Token 起$1.500 官方价格-可用
100 万上下文6.5 万默认输出提示词缓存Chat + Gemini API
API 文档
Production routeLive
提供方
Google
模型
3.6 Flash
上下文窗口
1,048,576 Token
支持协议
Chat + Gemini

选择 Gemini 3.6 Flash

Gemini 3.6 Flash 是 Google 最新的 Flash 系列高效主力模型,适合高性价比的编程、智能体工作流、知识工作与多模态推理,相比 Gemini 3.5 Flash 拥有更高的 Token 效率和 100 万 Token 上下文。

Gemini 3.6 Flash

Google Flash 系列高效主力模型

已选择
$1.350 / 百万输入 Token 起$1.500 官方价格gemini-3.6-flash
适用场景

生产级编程与全栈重构、多步智能体与编排、文档与图表分析,以及更高 Token 效率能降低单任务成本的大批量场景。

输入
$1.350 / 1M-10%
91.8 cr / 1M$1.500官方价格
缓存读取
$0.136 / 1M-10%
9.2 cr / 1M$0.150官方价格
输出
$6.750 / 1M-10%
459 cr / 1M$7.500官方价格

Gemini 3.6 Flash 价格

用交互式价格计算器估算单次请求费用。所有用户组统一使用 Gemini 3.6 Flash 官方价格。

3.6 Flash

Token 价格计算器

输入单次请求的 Token 组成。

单次请求预估

Gemini 3.6 Flash
官方统一价
USD$0.0035
Credits0.2314
输入 Token0.0918 cr
缓存读取 Token0.0019 cr
输出 Token0.1377 cr

每次请求最低消费 0.01 Credits。

EvoLink vs Google direct

Same token mix, default group price.
-10%
EvoLink estimate$0.0035
Google official$0.0038
You save$0.0004

预算参考

按当前 Token 组合估算可调用次数。
充值 Credits
$10
约 2938 次请求

快速测试

$50
约 14693 次请求

日常开发

$100
约 29386 次请求

生产评估

模型价格

Gemini 3.6 Flash

全部上下文长度
输入 Token
$1.350 / 1M-10%
91.8 cr / 1M$1.500官方价格
缓存读取 Token
$0.136 / 1M-10%
9.2 cr / 1M$0.150官方价格
输出 Token
$6.750 / 1M-10%
459 cr / 1M$7.500官方价格

美元与 Credits 均按每百万 Token 展示。后端实时价格优先,冻结的官方价格仅作为兜底。

Gemini 3.6 Flash API:面向编程与智能体的高效主力模型

通过 EvoLink 统一 API 调用 Google 最新的 Flash 系列主力模型 Gemini 3.6 Flash。相比 Gemini 3.5 Flash,它在编程、知识工作与多模态推理上表现更好、Token 效率更高,并支持 1,048,576 Token 上下文、提示词缓存、结构化输出与工具调用,官方价格为每百万输入 / 输出 Token $1.50 / $7.50。

Gemini 3.6 Flash
Gemini 3.6 Flash 适用场景

Gemini 3.6 Flash 适合放在生产模型栈的哪一层

新模型不应该因为参数更大就成为所有请求的默认选择。Gemini 3.6 Flash 更适合作为复杂任务路由:当百万上下文、持续推理或多步工具调用能够减少重试、模型交接和人工返工时,它的更高成本才有机会转化为更低的任务总成本。

高性价比的编程与重构

Gemini 3.6 Flash 面向日常编程、原型开发和全栈重构,相比 Gemini 3.5 Flash 使用更少 Token、更少调用次数,也是 Google Antigravity 的默认智能体模型。评估时应看补丁能否直接采用、代码审查耗时和返工次数,而不只是单段代码是否漂亮。

智能体工作流与编排

适合多步编排、工具选择、结构化输出和代码执行——更低的单次调用成本会在长链路智能体运行中不断累积。要在多轮请求中保留完整助手消息、工具调用 ID、参数和执行结果。

知识工作与多模态推理

适合在百万 Token 上下文中做文档分析、图表理解和多元素网页布局生成。但百万 Token 只是容量,塞入无关资料不会提升质量;检索和文档结构仍然决定回答效果。

什么时候该换别的模型

琐碎、对延迟敏感或超大批量的分类与抽取,通常更适合更便宜的 Gemini 3.5 Flash-Lite;最难的推理任务则交给 Pro 层模型。只有当 3.6 Flash 的效率确实降低了每个可交付任务的总成本时,才把流量升级到它。

首发信号

Gemini 3.6 Flash 首发反馈中的亮点与待验证项

Gemini 3.6 Flash 于 2026-07-21 发布。首发社区反馈应作为待验证的假设,在你自己的任务、工具链、预算和验收标准下复测,而不是当作已确定的评测结论。

Token 效率与更低输出成本是核心卖点

Google 与第三方 API 页面都强调更少 Token、更少调用、更少冗余;输出价格为每百万 $7.50,低于 Gemini 3.5 Flash 的 $9.00。在同一任务上,即使质量相当,这也能降低完成单个任务的总成本。

它是 Flash 系列主力模型,而非顶级工程模型

部分首发讨论认为它在高难度软件工程基准上落后于更大的前沿模型。如果你的工作是深度仓库重构或长时间自主编程,请先与 Pro 层或高端模型对比,再决定是否设为默认。

在你的提示词上验证输出规范与格式

有早期用户反馈某些任务上输出偏长或格式过多。请在代表性提示词上检查输出长度、指令遵循和工具调用规范,避免冗长悄悄推高输出成本。

它是闭源、仅通过 API 提供的 Google 模型

Gemini 3.6 Flash 没有开放权重,无法本地自托管。只能通过 Gemini API 及 Google AI Studio、Antigravity 等平台,以及 EvoLink 这类统一网关调用——因此应按成本和稳定性路由,而不是考虑本地部署。

核心能力

为什么 Gemini 3.6 Flash 能高效处理这些任务

当大上下文窗口、更高的 Token 效率和可复用的缓存前缀配合使用时,Gemini 3.6 Flash 最能发挥价值。单独追求上下文长度并不会自动提高结果质量,任务仍需要相关证据、清晰结构和合理的输出预算。

百万 Token 是工作空间,不是填充目标

1,048,576 Token 上下文可以同时保留相关代码、规格文档和历史工具结果,减少切块造成的信息损失。仍应先检索真正相关的内容,并及时压缩已经失去价值的上下文。

相比 3.5 Flash 更高的 Token 效率

Gemini 3.6 Flash 力求用更少轮次、更少 Token 完成多步工作流。成本优势来自更少的调用次数和更便宜的输出,因此应跟踪每个可交付任务的总 Token,而不是单次请求价格。

稳定前缀才能让提示词缓存真正省钱

仓库说明、系统提示词、参考资料和工具 Schema 保持稳定时,重复请求更容易形成缓存命中。频繁更换模型、提示词结构或关键配置,会增加长前缀重新处理的成本。

Gemini 3.6 Flash API 生产检查

正式接入 Gemini 3.6 Flash API 前必须确认的四件事

任务适合并不等于接入一定正确。上线前应确认模型标识、调用协议、参数变更和会话状态,避免把接入问题误判成模型能力问题。

01

使用准确的模型 ID:gemini-3.6-flash

在 EvoLink API 路由中把 model 设为 "gemini-3.6-flash"(带点)。带连字符的 gemini-3-6-flash 只是页面 URL,不是 API 的模型参数。

模型 ID
02

使用 OpenAI Chat Completions 或 Gemini 原生 API

EvoLink 通过兼容 OpenAI 的 /v1/chat/completions 与 Gemini 原生 generateContent 端点提供 Gemini 3.6 Flash,两种协议使用同一个 EvoLink API 密钥。

调用协议
03

注意参数层面的破坏性变更

自定义 temperature、top-K、top-P 会被忽略;自定义 frequency / presence penalty 会直接报错;最后一轮为 model 角色的请求会被拒绝。迁移旧的 Gemini 请求构造时需相应调整。

迁移
04

完整保留助手消息与工具状态

多轮智能体任务需要回传完整助手消息、工具调用 ID、参数和工具执行结果。只保留最终文本会破坏状态连续性,即使上下文窗口足够大,也可能导致后续步骤判断错误。

工具状态
生产成本评估

不要只比较 Token 单价,要比较完成任务的总成本

Gemini 3.6 Flash 的经济性,取决于它的效率能否在同一任务上减少 Token、调用次数、重试和人工返工。应使用同一批生产样本比较模型,而不是只看一次请求的输入价格。

首次成功率交付通过率重试次数输出 Token缓存命中率工具调用有效率得到可用结果的耗时人工修改量与回退频率

如果 Gemini 3.6 Flash 能用更少 Token 和更少审查交付可用结果,它更低的单价就会累积成真实的成本优势;如果在你最难的任务上质量下降,就把这些任务升级到 Pro 层模型,而把 3.6 Flash 用在高效的大多数场景。

完成生产评估后,再对比主流长上下文模型

EvoLink

先根据真实任务确认 Gemini 3.6 Flash 是否能减少重试和人工修改,再结合价格、上下文、缓存方式与任务类型选择生产路由。

Gemini 3.6 Flash
输入 / 输出$1.35 / $6.75
上下文1M
缓存自动缓存读取
适用场景生产级编程与全栈重构、多步智能体与编排、文档与图表分析,以及更高 Token 效率能降低单任务成本的大批量场景。
Gemini 3.5 Flash Lite
输入 / 输出$0.3 / $2.5
上下文1M
缓存上下文缓存
适用场景Pro 层 Gemini,面向 Flash 系列本就不擅长的最深度推理任务。
Gemini 3.1 Pro
输入 / 输出$1.68 / $10.08
上下文1M
缓存上下文缓存
适用场景Pro 层 Gemini,面向 Flash 系列本就不擅长的最深度推理任务。

EvoLink 上的其他 Gemini 模型

Gemini 3.5 Flash

Gemini 3.5 Flash

The previous-generation Flash workhorse that 3.6 Flash improves on for token efficiency and output cost.

查看模型
Gemini 3.5 Flash Lite

Gemini 3.5 Flash Lite

The cheapest, fastest 3.5-class route for classification, extraction, and high-throughput subagents.

查看模型
Gemini 3.1 Pro

Gemini 3.1 Pro

The Pro-tier step up when a task needs deeper reasoning than the Flash line can deliver.

查看模型
Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite

The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.

查看模型

Other text models

GPT-5.6

GPT-5.6

OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.

查看模型
Claude Opus 4.8

Claude Opus 4.8

Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.

查看模型
DeepSeek V4

DeepSeek V4

Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.

查看模型
Kimi K3

Kimi K3

Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.

查看模型

面向生产团队的相关阅读

Gemini 3.6 Flash release date & rollout

Gemini 3.6 Flash release date & rollout

What launched, the model ID, official pricing, and where the model is available.

阅读指南

Gemini 3.6 Flash API 常见问题

Gemini 3.6 Flash API 现在可以调用吗?

可以。Gemini 3.6 Flash 已作为正式生产模型展示,页面优先读取后端实时价格,并使用官方价格作为兜底。

Gemini 3.6 Flash API 应该使用哪个模型 ID?

model 请填写 "gemini-3.6-flash"(带点)。带连字符的 gemini-3-6-flash 只是页面 URL,不是 API 的模型参数。

Gemini 3.6 Flash 支持哪些协议和 SDK?

用兼容 OpenAI 的 Chat Completions 端点,或 Gemini 原生 generateContent 端点,均使用同一个 EvoLink API 密钥。该模型没有 Anthropic Messages 通道。

Gemini 3.6 Flash API 是百万上下文还是只有 256K?

EvoLink 路由记录的是 1,048,576 Token。更小的上限通常来自某个 Gemini 产品入口或客户端配置,而不是 API 模型本身。

百万 Token 上下文应该怎么使用?

保留真正相关的代码、文档和工具结果,同时配合检索、稳定缓存前缀与上下文压缩,不要为了用满窗口而加入无关内容。

Gemini 3.6 Flash 与 3.5 Flash、3.5 Flash-Lite 有什么区别?

3.6 Flash 是更新的主力模型,编程和 Token 效率优于 3.5 Flash(输出每百万 $7.50 对 $9.00)。3.5 Flash-Lite 则是更便宜、更快、面向分类与高并发任务的路由。

为什么 Gemini 3.6 Flash 比 3.5 Flash 更省钱?

它力求每个任务使用更少 Token、更少调用次数,且输出单价更低。应比较每个可交付任务的总 Token,而不只是单次请求单价。

迁移到 Gemini 3.6 Flash 需要注意哪些破坏性变更?

自定义 temperature、top-K、top-P 会被忽略;自定义 frequency / presence penalty 会报错;最后一轮为 model 角色的请求会被拒绝。

Gemini 3.6 Flash 的输出预算应该怎么设置?

根据任务难度限制最大输出,同时观察推理 Token 和最终答案 Token。65,536 Token 是容量上限,不是常规请求目标。

Gemini 3.6 Flash 适合实时请求和大批量调用吗?

最便宜、最低延迟的分类与抽取请建议用 Gemini 3.5 Flash-Lite;当编程与推理质量能抵消略高的单价时再用 3.6 Flash。

Gemini 3.6 Flash 与 GPT、Claude、GLM、DeepSeek 怎么选?

Gemini 3.6 Flash 侧重高效编程与智能体经济性;GPT 与 Claude 可作为前沿能力基线,GLM 与 DeepSeek 可作为成本敏感型开源基线。

生产环境应该怎样评估 Gemini 3.6 Flash?

比较首次成功率、交付通过率、重试、输出 Token、缓存命中、工具调用、总耗时、人工修改量和回退频率。