GPT Image 2.5 Flare 与 Sunburst 已上线 EvoLink立即体验

Gemini 3.5 Flash Lite API

通过 EvoLink 统一对话 API 接入 Google 的 Gemini 3.5 Flash Lite(也常被搜索为 Gemini 3.5 Flash-Lite)。集成前可先测试低延迟路由、结构化输出、工具调用。

Google文本生成可用
$0.271 / 百万输入 Token 起$0.300 官方价-10%
API 文档
低延迟推理工具调用结构化输出提示词缓存Chat + Gemini API
生产路由已上线
上下文
1.05M 上下文 · 最大输出 65.5K
适用场景
分类、抽取、路由、子 Agent
可输入
文本 + 图像
输出形态
文本 · JSON(结构化输出)· 工具调用

选择 Gemini 3.5 Flash Lite

Gemini 3.5 Flash Lite 是 Google 3.5 系列中最便宜、最快的模型,适合低延迟的分类、路由、抽取和轻量子智能体,拥有完整的 100 万 Token 上下文,价格为每百万 Token $0.300 / $2.500。

Gemini 3.5 Flash Lite

Google 3.5 系列最快、最具性价比的模型

已选择
模型 ID
gemini-3.5-flash-lite
适合

高并发分类与抽取、低延迟实时操作、聚焦型子智能体,以及速度和价格比最强推理更重要的成本敏感型场景。

输入
$0.271 / 1M-10%
18.4 cr / 1M$0.300官方价
缓存读取
$0.028 / 1M-7%
1.9 cr / 1M$0.030官方价
输出
$2.250 / 1M-10%
153 cr / 1M$2.500官方价

所有费率按每百万 Token 计,同时显示美元与 Credits,以你账户当前的价格为准。

Gemini 3.5 Flash Lite 价格

集成前先估算一次 Gemini 3.5 Flash Lite 请求的费用。计算器按你账户的当前费率计算,官方价格仅作对照。

请求费用计算器

输入一次请求的 Token 组合和 Google 搜索查询次数。

单次请求预估

Gemini 3.5 Flash Lite
USD$0.0010
Credits0.0647

官方价预估 $0.0011 · 省 $0.0002(10%)

输入 Token0.0184 cr
缓存读取 Token0.0004 cr
输出 Token0.0459 cr
Google 搜索0 cr

最低计费:每次请求 0.01 Credits。

预算指南

按当前 Token 用量和搜索查询次数估算可请求次数。
充值 Credits
$10
约 10510 次请求

快速测试

$50
约 52550 次请求

日常开发

$100
约 105100 次请求

生产评估

服务端工具费率

Gemini 3.x 按每条非空搜索查询计费,即使未返回来源也会收费;一次请求可能触发多次查询。Token 费用先计最低消费,再额外累加搜索费用。
  • Google 搜索$0.014/ 次查询0.952 cr / 次查询

Gemini 3.5 Flash Lite API:面向高并发、低成本、低延迟场景

通过 EvoLink 统一 API 调用 Google 3.5 系列中最便宜、最快的模型 Gemini 3.5 Flash Lite。它面向低延迟的分类、路由、抽取和轻量子智能体,支持 1,048,576 Token 上下文、提示词缓存、结构化输出与工具调用,官方价格为每百万输入 / 输出 Token $0.300 / $2.500。

Gemini 3.5 Flash Lite 在 EvoLink 上以模型 ID gemini-3.5-flash-lite 提供,支持 Chat Completions · Gemini 原生 API,和其他模型共用同一把 API 密钥与余额。它提供 1.05M 上下文窗口,最大输出 65.5K Token,并支持低延迟路由、结构化输出、工具调用。

Gemini 3.5 Flash Lite

Gemini 3.5 Flash Lite 规格与能力

数字取自 EvoLink 路由配置;能力以 API 当前实际提供为准。

上下文窗口
1.05M Token
最大输出
65.5K Token
输入
文本 + 图像
输出
文本 · JSON(结构化输出)· 工具调用
工具调用
函数调用,支持多步工具序列
提示缓存
自动缓存读取,享较低费率
服务端工具
Google 搜索,按搜索查询次数计费
协议
Chat Completions · Gemini 原生 API
模型 ID
gemini-3.5-flash-lite

为什么 Gemini 3.5 Flash Lite 能处理这些复杂任务

Gemini 3.5 Flash Lite 把低价、高速与完整的 100 万 Token 上下文和提示词缓存结合起来。它不是最强推理模型,价值在于以规模化的低成本快速完成简单任务。

最便宜的档位也有百万 Token 上下文

1,048,576 Token 上下文让最便宜的 3.5 系列模型也能一次处理长文档、转写稿或日志。检索和上下文压缩仍能降低成本,因为无关内容同样消耗 Token。

速度与吞吐优先于深度推理

约每秒 350 Token 的输出速度加上默认最小思考,Flash Lite 面向快速、大批量响应。把更重的推理配置和模型留给真正需要的请求。

提示词缓存进一步降低成本

稳定的系统提示词、说明和工具 Schema 会形成缓存命中,以独立的更低缓存价格读取。保持前缀顺序一致,让重复的高并发调用持续更便宜。

Gemini 3.5 Flash Lite 适合放在生产模型栈的哪一层

Google 把 Gemini 3.5 Flash Lite 定位为 3.5 系列中最快、最具性价比的模型。它最适合高并发、对延迟敏感的任务——低价和速度比最强推理更重要,少数困难请求再升级到更大的模型。

高并发分类与抽取

Gemini 3.5 Flash Lite 专为高并发分类、路由和 JSON 抽取设计。每百万 Token 仅 $0.300 / $2.500,可以在无需动用高端模型的场景下低成本处理大量请求。

低延迟、成本敏感的规模化

Google 称其输出速度约每秒 350 Token,适合实时界面操作、自动补全、内容审核等对延迟敏感的路径。评估时看每次请求的成本与速度,而不是榜单分数。

轻量、聚焦的子智能体

适合在更大的多智能体系统中执行聚焦子任务。它默认使用最小思考以换取速度;用于多步工具调用时,先验证智能体不会提前中止,再扩量。

什么时候该升级到更大的模型

深度仓库重构、长时间自主编程和高难度多步推理应交给 Gemini 3.6 Flash 或 Pro 层模型。用 Flash Lite 处理高并发的大多数,把困难的少数请求向上路由。

Gemini 3.5 Flash Lite 首发反馈中的亮点与待验证项

Gemini 3.5 Flash Lite 于 2026-07-21 发布,用于替代 Gemini 2.5 Flash。首发反馈应作为待验证的假设,在你自己的任务、工具链、预算和验收标准下复测。

性价比是核心卖点

每百万 Token 输入 $0.300、输出 $2.500,输出速度约每秒 350 Token,卖点是单位成本下的吞吐。在简单的大批量任务上,它可能以可接受的质量在总成本上胜过更贵的模型。

它替代 Gemini 2.5 Flash 及更轻的 3-Flash 场景

Google 将其定位为 Gemini 2.5 Flash 及较简单的 Gemini 3 Flash 任务的替代品。如果你正在使用这些模型,迁移前请用自己的提示词重新评测,确保质量和格式仍在容差内。

默认最小思考——多步智能体要验证

Flash Lite 默认最小思考以换取速度与成本。Google 指出最小思考可能导致多步任务提前中止工具调用,因此高并发上线前要测试智能体能否完成全部步骤。

它是闭源、仅通过 API 提供的 Google 模型

Gemini 3.5 Flash Lite 没有开放权重,无法本地自托管。只能通过 Gemini API 及 Google AI Studio 等平台,以及 EvoLink 这类统一网关调用——应按成本与延迟路由,而不是考虑本地部署。

两种方式使用 Gemini 3.5 Flash Lite:EvoLink API 或 Agent

产品后端与批量任务走 EvoLink API;编码与分析类工作可直接在 Codex、Claude、Gemini 里调用 Gemini 3.5 Flash Lite。两条路径共用同一把 EvoLink API 密钥、余额、模型 ID 与请求记录。

方式一

用 EvoLink API 接入

适合:产品后端、批量任务、自动化流水线

向 EvoLink 发送 OpenAI 兼容的 Chat Completions(或 Anthropic Messages)请求,自行控制模型 ID、系统提示、输出预算、工具与结构化输出。

  1. 1在控制台创建 EvoLink API 密钥
  2. 2把 OpenAI 或 Anthropic SDK 的 base URL 指向 EvoLink,并选择上方显示的模型 ID
  3. 3先发一条有代表性的请求,从 usage 字段读取输入、缓存与输出 token
  4. 4按任务设置 max_tokens 与重试;多轮时保留 tool-call ID 与工具结果
方式二

用 Agent 调用

适合:在 Codex、Claude、Gemini 里做编码、评审与分析

把任务、要带入的材料和验收标准交给 Agent,由它组装请求、通过 EvoLink 调用 Gemini 3.5 Flash Lite,并把回答连同 token 用量一起返回。

  1. 1在本地环境变量里配置 EVOLINK_API_KEY,不要写进代码或提示词
  2. 2描述任务、要带入的材料和期望的输出格式
  3. 3让 Agent 通过 EvoLink 调用 Gemini 3.5 Flash Lite,并在发送前先展示请求
  4. 4让 Agent 汇报回答、token 用量和任何错误信息

Gemini 3.5 Flash Lite API 代码示例与错误处理

这个示例是最短可运行的请求:一条 OpenAI 兼容的 Chat Completions 调用,带系统提示、用户消息和输出预算。完整参数与响应说明见 API 标签页。

查看完整 API 文档
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gemini-3.5-flash-lite",
    "messages": [
      { "role": "system", "content": "You are a precise assistant. Answer in JSON when asked." },
      { "role": "user", "content": "Classify the sentiment of each review below and return a JSON array:\n<reviews>" }
    ],
    "max_tokens": 1024,
    "temperature": 0.1
  }'

# The Gemini native API is available with the same model ID; see the docs
# for the request shape.
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens).

请求无效或参数不支持

对照 API 文档检查模型 ID、messages 数组和参数范围,去掉该路由不支持的字段。

鉴权或余额问题

检查 Authorization bearer token,并在控制台确认可用余额。

超出上下文长度

提示词 token 超过了 Gemini 3.5 Flash Lite 的上下文窗口。裁剪或只检索相关材料,并复用缓存前缀。

触发限流(429)

退避并带抖动重试;用批处理或队列代替并发突发。

内容或工具调用被拒

重试前检查敏感内容、格式错误的 tool-call 参数和 JSON schema 不匹配。

正式接入 Gemini 3.5 Flash Lite API 前必须确认的四件事

任务适合并不等于接入一定正确。上线前应确认模型标识、调用协议、参数变更,以及最小思考默认下的多步表现。

01

使用准确的模型 ID:gemini-3.5-flash-lite

在 EvoLink API 路由中把 model 设为 "gemini-3.5-flash-lite"(3.5 之间是点)。带连字符的 gemini-3-5-flash-lite 只是页面 URL,不是 API 的模型参数。

模型 ID
02

使用 OpenAI Chat Completions 或 Gemini 原生 API

EvoLink 通过兼容 OpenAI 的 /v1/chat/completions 与 Gemini 原生 generateContent 端点提供 Gemini 3.5 Flash Lite,两种协议使用同一个 EvoLink API 密钥。

调用协议
03

注意参数层面的破坏性变更

自定义 temperature、top-K、top-P 会被忽略;自定义 frequency / presence penalty 会直接报错;最后一轮为 model 角色的请求会被拒绝。

迁移
04

在最小思考默认下验证多步智能体

由于 Flash Lite 默认最小思考,请确认多步工具调用智能体能完成全部步骤而不提前停止。更难的推理应交给更大的模型,而不是过度调优这一个模型。

智能体

重复长上下文可以利用提示词缓存

稳定不变的仓库说明、参考文档、系统提示词和工具 Schema 可形成可重复使用的缓存前缀;自动缓存读取命中时使用独立优惠价格。

100 万 Token 上下文与 6.5 万默认最大输出

可以在同一工作上下文中保留相关代码、规格、文档和智能体状态,但不要把上限当成目标。先检索真正相关的证据,并按照任务难度设置输出预算。

比较 Gemini 3.5 Flash Lite 完成任务的总成本,不要只看 Token 单价

Gemini 3.5 Flash Lite 的优势在于其低价与速度能在高并发任务上达到你的质量门槛。用同一批任务评估,并把它处理不了的请求向上升级,而不是对所有流量都付高价。

首次成功率交付通过率重试次数输出 Token缓存命中率每秒 Token 数每千次请求成本升级到更大模型的比例

如果 Gemini 3.5 Flash Lite 在简单的大批量任务上达到你的质量门槛,其低价与速度使它成为最便宜的生产默认模型;只把它处理不了的请求路由到 Gemini 3.6 Flash 或 Pro 层模型。

完成生产评估后,再把 Gemini 3.5 Flash Lite 与主流长上下文模型对比

EvoLink

先根据真实任务确认 Gemini 3.5 Flash Lite 是否能减少重试和人工修改,再结合价格、上下文、缓存方式与任务类型选择生产路由。

Gemini 3.5 Flash Lite
输入 / 输出$0.271 / $2.25
上下文1.05M
缓存自动缓存读取
适用场景高并发分类与抽取、低延迟实时操作、聚焦型子智能体,以及速度和价格比最强推理更重要的成本敏感型场景。
Gemini 3.6 Flash
输入 / 输出$0.675 / $3.375
上下文1.05M
缓存上下文缓存
适用场景当任务需要比 Lite 层更强的编程或推理时,向上升级到这条主力路由。
Gemini 3.1 Pro
输入 / 输出$1.865 / $11.183
上下文1.05M
缓存上下文缓存
适用场景当任务需要 Flash 系列本就不擅长的最深度推理时,升级到 Pro 层。

Gemini 模型家族

同一把 API 密钥、同一份余额,换档位不用改接入。

查看全部 Gemini 模型
Gemini 3.8 Flash

Gemini 3.8 Flash

最新一代 Flash 模型,适合更强的编程、推理与智能体工作负载。

查看模型
Gemini 3.7 Flash

Gemini 3.7 Flash

较新的 Flash 模型,在快速高效的档位上提供更强推理。

查看模型
Gemini 3.6 Flash

Gemini 3.6 Flash

当任务需要比 Lite 层更强的编程或推理时,向上升级到这条主力路由。

查看模型

Gemini 3.5 Flash Lite 之外的其他文本模型

GPT-5.6

GPT-5.6

OpenAI 的分档前沿系列(Sol / Terra / Luna),按能力、延迟与成本灵活路由。

查看模型
Claude Opus 4.8

Claude Opus 4.8

Anthropic 的高端路由,适合长时间运行的智能体、复杂审阅与重判断工作。

查看模型
DeepSeek V4

DeepSeek V4

DeepSeek 的高性价比百万上下文路由,适合大批量编码、推理与智能体负载。

查看模型
Kimi K3

Kimi K3

Moonshot 的长上下文推理路由,适合仓库级编码与多文档工作。

查看模型

Gemini 3.5 Flash Lite 延伸阅读

对比 Gemini API 家族

对比 Gemini API 家族

在路由前先看清 3.5 Flash-Lite、3.6 Flash、3.5 Flash 与 3.1 Pro 在价格、速度、上下文与任务适配上的差异。

阅读指南
Gemini 3.6 Flash API

Gemini 3.6 Flash API

当任务需要比 Lite 层更强的编程或推理时,向上升级到这条主力路由。

阅读指南
Gemini 3.5 Flash API

Gemini 3.5 Flash API

介于 Flash-Lite 与 Pro 之间的中间 Flash 层,兼顾成本与能力。

阅读指南
Gemini 2.5 Flash API

Gemini 2.5 Flash API

Gemini 3.5 Flash-Lite 在价格与速度上替代的上一代模型。

阅读指南
Gemini 3.1 Pro API

Gemini 3.1 Pro API

当任务需要 Flash 系列本就不擅长的最深度推理时,升级到 Pro 层。

阅读指南

Gemini 3.5 Flash Lite API 常见问题

Gemini 3.5 Flash Lite API 现在可以调用吗?

可以。Gemini 3.5 Flash Lite 已作为正式生产模型展示,页面优先读取后端实时价格,并使用官方价格作为兜底。

Gemini 3.5 Flash Lite API 应该使用哪个模型 ID?

model 请填写 "gemini-3.5-flash-lite"(3.5 之间是点)。带连字符的 gemini-3-5-flash-lite 只是页面 URL,不是 API 的模型参数。

Gemini 3.5 Flash Lite 支持哪些协议和 SDK?

用兼容 OpenAI 的 Chat Completions 端点,或 Gemini 原生 generateContent 端点,均使用同一个 EvoLink API 密钥。该模型没有 Anthropic Messages 通道。

Gemini 3.5 Flash Lite API 是百万上下文还是只有 256K?

EvoLink 路由记录的是 1,048,576 Token。更小的上限通常来自某个 Gemini 产品入口或客户端配置,而不是 API 模型本身。

Gemini 3.5 Flash Lite 有多快、多便宜?

它是 Google 3.5 系列中最快、最具性价比的模型,价格为每百万 Token 输入 $0.300、输出 $2.500,输出速度约每秒 350 Token。单位成本下的吞吐是它的核心优势。

Gemini 3.5 Flash Lite 最适合做什么?

高并发分类、路由、JSON 抽取、低延迟界面操作和聚焦型子智能体。深度编程或高难度推理请升级到 Gemini 3.6 Flash 或 Pro 层模型。

Gemini 3.5 Flash Lite 与 3.5 Flash、3.6 Flash 有什么区别?

Flash Lite 是最便宜、最快、默认最小思考的档位;3.5 Flash 与 3.6 Flash 是能力更强、价格更高、面向编程与智能体的主力模型。

Gemini 3.5 Flash Lite 是否替代 Gemini 2.5 Flash?

Google 将其定位为 Gemini 2.5 Flash 及较简单 Gemini 3 Flash 场景的替代品。迁移前请用自己的提示词重新评测。

迁移时需要注意哪些破坏性变更?

自定义 temperature、top-K、top-P 会被忽略;自定义 frequency / presence penalty 会报错;最后一轮为 model 角色的请求会被拒绝。

Gemini 3.5 Flash Lite 适合实时请求和大批量调用吗?

适合——它正是为此设计的。它默认最小思考以换取速度,因此高并发上线前请验证多步智能体能完成全部步骤。

Gemini 3.5 Flash Lite 与 GPT、Claude、GLM、DeepSeek 怎么选?

按每千次请求成本和延迟,把它和其它便宜、快速的档位对比,而不是和高端推理模型比。它处理不了的请求再升级到更大的模型。

生产环境应该怎样评估 Gemini 3.5 Flash Lite?

比较每千次请求成本、每秒 Token 数、首次成功率、交付通过率、缓存命中,以及需要升级到更大模型的请求比例。