GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验

Gemini 3.7 Flash API

通过 EvoLink 统一对话 API 接入 Google 的 Gemini 3.7 Flash(也常被搜索为 Gemini 3.7)。集成前可先测试编程、多步 Agent、工具调用。

Google文本生成可用
$0.675 / 百万输入 Token 起$1.500 官方价限时-55%
API 文档
长上下文编程可配置思考提示词缓存Chat + Gemini API
生产路由已上线
上下文
1.05M 上下文 · 最大输出 65.5K
适用场景
编程、Agent 编排、文档分析
可输入
文本 + 图像
输出形态
文本 · JSON(结构化输出)· 工具调用

选择 Gemini 3.7 Flash

Gemini 3.7 Flash 是 Google 最新的 Flash 系列高效主力模型,适合高性价比的编程、智能体工作流、知识工作与多模态推理,相比 Gemini 3.6 Flash 拥有更高的 Token 效率和 100 万 Token 上下文。

Gemini 3.7 Flash

Google Flash 系列高效主力模型

已选择
模型 ID
gemini-3.7-flash
适合

生产级编程与全栈重构、多步智能体与编排、文档与图表分析,以及更高 Token 效率能降低单任务成本的大批量场景。

输入
$0.675 / 1M-55%
45.9 cr / 1M$1.500官方价
缓存读取
$0.068 / 1M-55%
4.6 cr / 1M$0.150官方价
输出
$3.375 / 1M-55%
229.5 cr / 1M$7.500官方价

所有费率按每百万 Token 计,同时显示美元与 Credits,以你账户当前的价格为准。

Gemini 3.7 Flash 价格

集成前先估算一次 Gemini 3.7 Flash 请求的费用。计算器按你账户的当前费率计算,官方价格仅作对照。

限时优惠 —— 下方费率含 Google 介绍价优惠,截止 2026 年 12 月 31 日(UTC+8)。2027 年 1 月 1 日起,按 Google 标准价(每百万输入 $1.500、输出 $7.500)恢复常规折扣。

请求费用计算器

输入一次请求的 Token 组合和 Google 搜索查询次数。

单次请求预估

Gemini 3.7 Flash
USD$0.0018
Credits0.1158

官方价预估 $0.0038 · 省 $0.0021(55%)

输入 Token0.0459 cr
缓存读取 Token0.001 cr
输出 Token0.0689 cr
Google 搜索0 cr

最低计费:每次请求 0.01 Credits。

预算指南

按当前 Token 用量和搜索查询次数估算可请求次数。
充值 Credits
$10
约 5613 次请求

快速测试

$50
约 29360 次请求

日常开发

$100
约 58721 次请求

生产评估

服务端工具费率

Gemini 3.x 按每条非空搜索查询计费,即使未返回来源也会收费;一次请求可能触发多次查询。Token 费用先计最低消费,再额外累加搜索费用。
  • Google 搜索$0.014/ 次查询0.952 cr / 次查询

Gemini 3.7 Flash API:面向编程与智能体的高效主力模型

通过 EvoLink 统一 API 调用 Google 最新的 Flash 系列主力模型 Gemini 3.7 Flash。相比 Gemini 3.6 Flash,它在编程、知识工作与多模态推理上表现更好、Token 效率更高,并支持 1,048,576 Token 上下文、提示词缓存、结构化输出与工具调用,官方介绍价为每百万输入 / 输出 Token $0.750 / $3.750(限时至 2026-12-31)。

Gemini 3.7 Flash 在 EvoLink 上以模型 ID gemini-3.7-flash 提供,支持 Chat Completions · Gemini 原生 API,和其他模型共用同一把 API 密钥与余额。它提供 1.05M 上下文窗口,最大输出 65.5K Token,并支持编程、多步 Agent、工具调用。

Gemini 3.7 Flash

Gemini 3.7 Flash 规格与能力

数字取自 EvoLink 路由配置;能力以 API 当前实际提供为准。

上下文窗口
1.05M Token
最大输出
65.5K Token
输入
文本 + 图像
输出
文本 · JSON(结构化输出)· 工具调用
推理
可配置推理强度
工具调用
函数调用,支持多步工具序列
提示缓存
自动缓存读取,享较低费率
服务端工具
Google 搜索,按搜索查询次数计费
协议
Chat Completions · Gemini 原生 API
模型 ID
gemini-3.7-flash

为什么 Gemini 3.7 Flash 能高效处理这些任务

当大上下文窗口、更高的 Token 效率和可复用的缓存前缀配合使用时,Gemini 3.7 Flash 最能发挥价值。单独追求上下文长度并不会自动提高结果质量,任务仍需要相关证据、清晰结构和合理的输出预算。

百万 Token 是工作空间,不是填充目标

1,048,576 Token 上下文可以同时保留相关代码、规格文档和历史工具结果,减少切块造成的信息损失。仍应先检索真正相关的内容,并及时压缩已经失去价值的上下文。

相比 3.6 Flash 更高的 Token 效率

Gemini 3.7 Flash 力求用更少轮次、更少 Token 完成多步工作流。成本优势来自更少的调用次数和更少的总 Token,因此应跟踪每个可交付任务的总 Token,而不是单次请求价格。

稳定前缀才能让提示词缓存真正省钱

仓库说明、系统提示词、参考资料和工具 Schema 保持稳定时,重复请求更容易形成缓存命中。频繁更换模型、提示词结构或关键配置,会增加长前缀重新处理的成本。

Gemini 3.7 Flash 适合放在生产模型栈的哪一层

新模型不应该因为参数更大就成为所有请求的默认选择。Gemini 3.7 Flash 更适合作为复杂任务路由:当百万上下文、持续推理或多步工具调用能够减少重试、模型交接和人工返工时,它的更高成本才有机会转化为更低的任务总成本。

高性价比的编程与重构

Gemini 3.7 Flash 面向日常编程、原型开发和全栈重构,相比 Gemini 3.6 Flash 使用更少 Token、更少调用次数,并可在 Google Antigravity 智能体环境中使用。评估时应看补丁能否直接采用、代码审查耗时和返工次数,而不只是单段代码是否漂亮。

智能体工作流与编排

适合多步编排、工具选择、结构化输出和代码执行——更低的单次调用成本会在长链路智能体运行中不断累积。要在多轮请求中保留完整助手消息、工具调用 ID、参数和执行结果。

知识工作与多模态推理

适合在百万 Token 上下文中做文档分析、图表理解和多元素网页布局生成。但百万 Token 只是容量,塞入无关资料不会提升质量;检索和文档结构仍然决定回答效果。

什么时候该换别的模型

琐碎、对延迟敏感或超大批量的分类与抽取,通常更适合更便宜的 Gemini 3.5 Flash-Lite;最难的推理任务则交给 Pro 层模型。只有当 3.7 Flash 的效率确实降低了每个可交付任务的总成本时,才把流量升级到它。

Gemini 3.7 Flash 首发反馈中的亮点与待验证项

Gemini 3.7 Flash 于 2026-08-13 发布。首发社区反馈应作为待验证的假设,在你自己的任务、工具链、预算和验收标准下复测,而不是当作已确定的评测结论。

与 3.6 Flash 同价,agentic 执行更强

Google 将 3.7 Flash 定位为 Gemini 3 家族的 agentic 主力:Google 称其为迄今最智能的编程与智能体主力模型,代码生成与终端执行有明显提升,价格与 Gemini 3.6 Flash 完全相同。在同一任务上,收益来自更少的重试和更短的智能体循环,而不是更低的单价。

它是 Flash 系列主力模型,而非顶级工程模型

部分首发讨论认为它在高难度软件工程基准上落后于更大的前沿模型。如果你的工作是深度仓库重构或长时间自主编程,请先与 Pro 层或高端模型对比,再决定是否设为默认。

在你的提示词上验证每任务 Token 用量

部分首发反馈观察到同一任务的 Token 用量高于 Gemini 3.6 Flash。请在代表性提示词上检查输出长度、指令遵循和工具调用规范,避免额外推理悄悄推高输出成本。

它是闭源、仅通过 API 提供的 Google 模型

Gemini 3.7 Flash 没有开放权重,无法本地自托管。只能通过 Gemini API 及 Google AI Studio、Antigravity 等平台,以及 EvoLink 这类统一网关调用——因此应按成本和稳定性路由,而不是考虑本地部署。

两种方式使用 Gemini 3.7 Flash:EvoLink API 或 Agent

产品后端与批量任务走 EvoLink API;编码与分析类工作可直接在 Codex、Claude、Gemini 里调用 Gemini 3.7 Flash。两条路径共用同一把 EvoLink API 密钥、余额、模型 ID 与请求记录。

方式一

用 EvoLink API 接入

适合:产品后端、批量任务、自动化流水线

向 EvoLink 发送 OpenAI 兼容的 Chat Completions(或 Anthropic Messages)请求,自行控制模型 ID、系统提示、输出预算、工具与结构化输出。

  1. 1在控制台创建 EvoLink API 密钥
  2. 2把 OpenAI 或 Anthropic SDK 的 base URL 指向 EvoLink,并选择上方显示的模型 ID
  3. 3先发一条有代表性的请求,从 usage 字段读取输入、缓存与输出 token
  4. 4按任务设置 max_tokens 与重试;多轮时保留 tool-call ID 与工具结果
方式二

用 Agent 调用

适合:在 Codex、Claude、Gemini 里做编码、评审与分析

把任务、要带入的材料和验收标准交给 Agent,由它组装请求、通过 EvoLink 调用 Gemini 3.7 Flash,并把回答连同 token 用量一起返回。

  1. 1在本地环境变量里配置 EVOLINK_API_KEY,不要写进代码或提示词
  2. 2描述任务、要带入的材料和期望的输出格式
  3. 3让 Agent 通过 EvoLink 调用 Gemini 3.7 Flash,并在发送前先展示请求
  4. 4让 Agent 汇报回答、token 用量和任何错误信息

Gemini 3.7 Flash API 代码示例与错误处理

这个示例是最短可运行的请求:一条 OpenAI 兼容的 Chat Completions 调用,带系统提示、用户消息和输出预算。完整参数与响应说明见 API 标签页。

查看完整 API 文档
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.7-flash",
    "messages": [
      { "role": "system", "content": "You are a precise assistant. Answer in JSON when asked." },
      { "role": "user", "content": "Classify the sentiment of each review below and return a JSON array:\n<reviews>" }
    ],
    "max_tokens": 1024,
    "temperature": 0.1
  }'

# The Gemini native API is available with the same model ID; see the docs
# for the request shape.
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens).

请求无效或参数不支持

对照 API 文档检查模型 ID、messages 数组和参数范围,去掉该路由不支持的字段。

鉴权或余额问题

检查 Authorization bearer token,并在控制台确认可用余额。

超出上下文长度

提示词 token 超过了 Gemini 3.7 Flash 的上下文窗口。裁剪或只检索相关材料,并复用缓存前缀。

触发限流(429)

退避并带抖动重试;用批处理或队列代替并发突发。

内容或工具调用被拒

重试前检查敏感内容、格式错误的 tool-call 参数和 JSON schema 不匹配。

正式接入 Gemini 3.7 Flash API 前必须确认的四件事

任务适合并不等于接入一定正确。上线前应确认模型标识、调用协议、参数变更和会话状态,避免把接入问题误判成模型能力问题。

01

使用准确的模型 ID:gemini-3.7-flash

在 EvoLink API 路由中把 model 设为 "gemini-3.7-flash"(带点)。带连字符的 gemini-3-7-flash 只是页面 URL,不是 API 的模型参数。

模型 ID
02

使用 OpenAI Chat Completions 或 Gemini 原生 API

EvoLink 通过兼容 OpenAI 的 /v1/chat/completions 与 Gemini 原生 generateContent 端点提供 Gemini 3.7 Flash,两种协议使用同一个 EvoLink API 密钥。

调用协议
03

注意参数层面的破坏性变更

按 Google 官方迁移清单:移除自定义 temperature、top-P、top-K 与 candidate_count;把数值型 thinking_budget 换成 thinking_level 字符串;并移除预填的 model 轮次。迁移旧的 Gemini 请求构造时需相应调整。

迁移
04

完整保留助手消息与工具状态

多轮智能体任务需要回传完整助手消息、工具调用 ID、参数和工具执行结果。只保留最终文本会破坏状态连续性,即使上下文窗口足够大,也可能导致后续步骤判断错误。

工具状态

重复长上下文可以利用提示词缓存

稳定不变的仓库说明、参考文档、系统提示词和工具 Schema 可形成可重复使用的缓存前缀;自动缓存读取命中时使用独立优惠价格。

100 万 Token 上下文与 6.5 万默认最大输出

可以在同一工作上下文中保留相关代码、规格、文档和智能体状态,但不要把上限当成目标。先检索真正相关的证据,并按照任务难度设置输出预算。

比较 Gemini 3.7 Flash 完成任务的总成本,不要只看 Token 单价

Gemini 3.7 Flash 的经济性,取决于它的效率能否在同一任务上减少 Token、调用次数、重试和人工返工。应使用同一批生产样本比较模型,而不是只看一次请求的输入价格。

首次成功率交付通过率重试次数输出 Token缓存命中率工具调用有效率得到可用结果的耗时人工修改量与回退频率

如果 Gemini 3.7 Flash 能用更少 Token 和更少审查交付可用结果,它更低的单价就会累积成真实的成本优势;如果在你最难的任务上质量下降,就把这些任务升级到 Pro 层模型,而把 3.7 Flash 用在高效的大多数场景。

完成生产评估后,再把 Gemini 3.7 Flash 与主流长上下文模型对比

EvoLink

先根据真实任务确认 Gemini 3.7 Flash 是否能减少重试和人工修改,再结合价格、上下文、缓存方式与任务类型选择生产路由。

Gemini 3.7 Flash
输入 / 输出$0.675 / $3.375
上下文1.05M
缓存自动缓存读取
适用场景生产级编程与全栈重构、多步智能体与编排、文档与图表分析,以及更高 Token 效率能降低单任务成本的大批量场景。
Gemini 3.5 Flash Lite
输入 / 输出$0.271 / $2.25
上下文1.05M
缓存上下文缓存
适用场景更便宜、更快的 3.5 系列路由,适合分类、抽取与高并发子智能体;困难任务再升级到 3.7 Flash。
Gemini 3.1 Pro
输入 / 输出$1.865 / $11.183
上下文1.05M
缓存上下文缓存
适用场景当任务需要超出 Flash 系列的更深推理时,升级到 Pro 层。

Gemini 模型家族

同一把 API 密钥、同一份余额,换档位不用改接入。

查看全部 Gemini 模型
Gemini 3.8 Flash

Gemini 3.8 Flash

最新一代 Flash 模型,适合更强的编程、推理与智能体工作负载。

查看模型
Gemini 3.6 Flash

Gemini 3.6 Flash

与 3.7 Flash 同价的上一代 Flash 模型;把生产流量切过去之前先做对比。

查看模型
Gemini 3.5 Flash Lite

Gemini 3.5 Flash Lite

更便宜、更快的 3.5 系列路由,适合分类、抽取与高并发子智能体;困难任务再升级到 3.7 Flash。

查看模型

Gemini 3.7 Flash 之外的其他文本模型

GPT-5.6

GPT-5.6

OpenAI 的分档前沿系列(Sol / Terra / Luna),按能力、延迟与成本灵活路由。

查看模型
Claude Opus 4.8

Claude Opus 4.8

Anthropic 的高端路由,适合长时间运行的智能体、复杂审阅与重判断工作。

查看模型
DeepSeek V4

DeepSeek V4

DeepSeek 的高性价比百万上下文路由,适合大批量编码、推理与智能体负载。

查看模型
Kimi K3

Kimi K3

Moonshot 的长上下文推理路由,适合仓库级编码与多文档工作。

查看模型

Gemini 3.7 Flash 延伸阅读

Gemini 3.7 Flash 发布与上线

Gemini 3.7 Flash 发布与上线

2026 年 8 月 13 日发布内容、gemini-3.7-flash 模型 ID、官方价格与可用平台一览。

阅读指南
Gemini 3.7 Flash vs Gemini 3.6 Flash

Gemini 3.7 Flash vs Gemini 3.6 Flash

同价、相隔三周——迁移清单、需要实测的行为变化,以及什么情况下该留在 3.6。

阅读指南
对比 Gemini API 家族

对比 Gemini API 家族

在路由前先看清 3.7 Flash、3.5 Flash-Lite、3.6 Flash 与 3.1 Pro 在价格、上下文与任务适配上的差异。

阅读指南
Gemini 3.5 Flash-Lite API

Gemini 3.5 Flash-Lite API

更便宜、更快的 3.5 系列路由,适合分类、抽取与高并发子智能体;困难任务再升级到 3.7 Flash。

阅读指南
Gemini 3.6 Flash API

Gemini 3.6 Flash API

与 3.7 Flash 同价的上一代 Flash 模型;把生产流量切过去之前先做对比。

阅读指南
Gemini 3.1 Pro API

Gemini 3.1 Pro API

当任务需要超出 Flash 系列的更深推理时,升级到 Pro 层。

阅读指南

Gemini 3.7 Flash API 常见问题

Gemini 3.7 Flash API 现在可以调用吗?

可以。Gemini 3.7 Flash 已作为正式生产模型展示,页面优先读取后端实时价格,并使用官方价格作为兜底。

Gemini 3.7 Flash API 应该使用哪个模型 ID?

model 请填写 "gemini-3.7-flash"(带点)。带连字符的 gemini-3-7-flash 只是页面 URL,不是 API 的模型参数。

Gemini 3.7 Flash 支持哪些协议和 SDK?

用兼容 OpenAI 的 Chat Completions 端点,或 Gemini 原生 generateContent 端点,均使用同一个 EvoLink API 密钥。该模型没有 Anthropic Messages 通道。

Gemini 3.7 Flash API 真的支持完整的百万上下文吗?

是的——按 Google 官方文档,路由记录的是 1,048,576 输入 Token。更小的上限通常来自某个 Gemini 产品入口或客户端配置,而不是 API 模型本身。

百万 Token 上下文应该怎么使用?

保留真正相关的代码、文档和工具结果,同时配合检索、稳定缓存前缀与上下文压缩,不要为了用满窗口而加入无关内容。

Gemini 3.7 Flash 与 3.6 Flash、3.5 Flash-Lite 有什么区别?

3.7 Flash 与 3.6 Flash 价格相同,但按 Google 公布的数据,在 FrontierCode、Terminal-bench 等编程与智能体基准上得分更高。3.5 Flash-Lite 仍是更便宜、更快、面向分类与高并发任务的路由。

Gemini 3.7 Flash 如果 Token 用量更多,实际上更省钱吗?

单 Token 价格与 3.6 Flash 相同。Google 称 3.7 Flash 能用更少轮次完成任务,但也有首发反馈观察到单任务 Token 用量更高。请在自己的工作负载上比较每个可交付任务的总 Token,而不是单次请求单价。

迁移到 Gemini 3.7 Flash 需要注意哪些破坏性变更?

按 Google 官方迁移清单:移除自定义 temperature、top-P、top-K 与 candidate_count;把数值型 thinking_budget 换成 thinking_level 字符串;并移除预填的 model 轮次。

Gemini 3.7 Flash 的 minimal 思考档位去哪了?

Google 已移除该档位:可用档位为 low、medium(默认)、high,向 Gemini API 传入 minimal 会报错。EvoLink 将把 reasoning_effort 为 none 或 minimal 的请求自动降级为 low,迁移代码不会失败。高并发分类管道建议改用 Gemini 3.5 Flash-Lite 作为低成本下限。

Gemini 3.7 Flash 的思考 Token 怎么计费?

按 Google 定价,思考 Token 按输出价计费,因此推理越多,账单可能明显大于可见回答。请按任务设置合适的思考档位,并同时监控推理与最终答案 Token。

Gemini 3.7 Flash 能分析视频和音频吗?

可以。模型接受文本、图像、视频、音频和 PDF 输入并输出文本,因此常被用于视频与音频理解类工作负载。不支持图像生成、音频生成和实时流式(Live API)。

有 Gemini 3.7 Pro 吗?

没有。截至 3.7 Flash 发布,Google Pro 线最新模型仍是 gemini-3.1-pro-preview,官方渠道未宣布 3.5 或 3.7 Pro。

Gemini 3.7 Flash 的介绍价能持续多久?

Google 公布的介绍价为每百万输入 $0.750、输出 $3.750,限时至 2026-12-31;2027-01-01 起恢复标准价 $1.500 / $7.500。EvoLink 的当前价格请见本页价格模块。

Gemini 3.7 Flash 遵循指令比 3.6 Flash 更可靠吗?

Google 报告其安全性与语气表现与 3.6 Flash 相近,但有一家独立评测机构在发布时测得更高的幻觉率。请先在自己的代表性任务上验证指令遵循与事实纪律,再投入生产。

生产环境应该怎样评估 Gemini 3.7 Flash?

比较首次成功率、交付通过率、重试、输出 Token、缓存命中、工具调用、总耗时、人工修改量和回退频率。