Kimi K3 の提供を開始しましたKimi K3 を見る

Gemini 3.5 Flash Lite API

Google-テキスト生成-$0.271 / 100万入力 Token から$0.300 公式料金-利用可能
100万コンテキストデフォルト出力 6.5万プロンプトキャッシュChat + Gemini API
API ドキュメント
Production routeLive
提供元
Google
モデル
Flash Lite
コンテキスト
1,048,576 Token
プロトコル
Chat + Gemini

Gemini 3.5 Flash Lite を選択

Google の 3.5 クラスで最も安く最も速いモデルで、低レイテンシの分類・ルーティング・抽出や軽量なエージェントのサブエージェント向けです。100万 Token のフルコンテキストを 100万 Token あたり $0.30 / $2.50 で利用できます。

Gemini 3.5 Flash Lite

Google の 3.5 クラスで最速・最も費用対効果の高いモデル

選択中
$0.271 / 100万入力 Token から$0.300 公式料金gemini-3.5-flash-lite
適した用途

高スループットの分類と抽出、低レイテンシのリアルタイム操作、目的を絞ったエージェントのサブエージェント、そして最大限の推論よりも速度と価格が重要なコスト重視のワークロード。

入力
$0.271 / 1M-10%
18.4 cr / 1M$0.300公式料金
キャッシュ読み取り
$0.028 / 1M-7%
1.9 cr / 1M$0.030公式料金
出力
$2.250 / 1M-10%
153 cr / 1M$2.500公式料金

Gemini 3.5 Flash Lite pricing

Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.5 Flash Lite rate.

Flash Lite

Token calculator

Enter the token mix for one request.

Estimated request cost

Gemini 3.5 Flash Lite
Official rate
USD$0.0010
Credits0.0647
Input tokens0.0184 cr
Cache read tokens0.0004 cr
Output tokens0.0459 cr

Minimum charge: 0.01 credits per request.

EvoLink vs Google direct

Same token mix, default group price.
-10%
EvoLink estimate$0.0010
Google official$0.0011
You save$0.0002

Budget guide

Approximate requests using the current token mix.
Add credits
$10
About 10510 requests

For quick testing

$50
About 52550 requests

For regular development

$100
About 105100 requests

For production evaluation

Model pricing

Gemini 3.5 Flash Lite

All context sizes
Input tokens
$0.271 / 1M-10%
18.4 cr / 1M$0.300official price
Cache read tokens
$0.028 / 1M-7%
1.9 cr / 1M$0.030official price
Output tokens
$2.250 / 1M-10%
153 cr / 1M$2.500official price

USD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.

高速・低コスト・高スループット向けの Gemini 3.5 Flash Lite API

EvoLink の統一 API から Google の 3.5 クラスで最も安く高速なモデル Gemini 3.5 Flash Lite を呼び出せます。低レイテンシの分類、ルーティング、抽出、軽量なエージェントのサブエージェント向けに設計され、1,048,576 Token コンテキスト、プロンプトキャッシュ、構造化出力、ツール利用に対応し、料金は 100 万 入力 / 出力 Token あたり $0.30 / $2.50 です。

Gemini 3.5 Flash Lite
Gemini 3.5 Flash Lite のユースケース

本番モデル構成で Gemini 3.5 Flash Lite が価値を発揮する場面

Google は Gemini 3.5 Flash Lite を、3.5 クラスで最速かつ最も費用対効果の高いモデルと位置づけています。最大の推論力よりも低価格と速度が重要な、高ボリュームでレイテンシに敏感なワークロードに最も適し、少数の難しいリクエストは大きなモデルへ引き上げられます。

高スループットの分類と抽出

Gemini 3.5 Flash Lite は高スループットの分類、ルーティング、JSON 抽出のために作られています。100 万 Token あたり $0.30 / $2.50 で、プレミアムモデルでは無駄になる場面でも大量のリクエストを安価に処理できます。

低レイテンシでコストに敏感なスケール

Google は出力を毎秒約 350 Token と報告しており、リアルタイム UI 操作、オートコンプリート、モデレーションなどレイテンシが重要な経路によく合います。ベンチマークの見出しではなく、リクエストごとのコストと速度を測定してください。

軽量で焦点を絞ったエージェントのサブエージェント

より大きなマルチエージェントシステムの中で焦点を絞ったタスクを実行するサブエージェントに向いています。速度のため既定で最小思考を使うため、多段のツール利用ではスケール前にエージェントが早期終了しないことを検証してください。

大きなモデルへ引き上げるべきとき

深いリポジトリのリファクタリング、長時間の自律コーディング、難しい多段推論は Gemini 3.6 Flash や Pro クラスのモデルが担います。Flash Lite は高ボリュームの大多数に使い、難しい少数だけを上位へルーティングします。

ローンチ時のシグナル

Gemini 3.5 Flash Lite への初期反応が示すことと、まだ証明が必要なこと

Gemini 3.5 Flash Lite は 2026-07-21 に Gemini 2.5 Flash の後継として公開されました。ローンチ時の反応は仮説として扱い、自分のタスク、ツール、予算、受け入れ基準で検証してください。

価格対性能が見出し

100 万 Token あたり入力 $0.30 / 出力 $2.50、毎秒約 350 Token で、魅力はドルあたりのスループットです。単純で高ボリュームな作業では、許容できる品質を保ちながら総コストでより高価なモデルを上回ることがあります。

Gemini 2.5 Flash と軽めの 3-Flash ワークロードを置き換える

Google はこれを Gemini 2.5 Flash と、より複雑でない Gemini 3 Flash タスクのドロップイン代替と位置づけています。現在これらを使っているなら、移行前に自分のプロンプトで再ベンチマークし、品質と書式が許容範囲に収まるか確認してください。

最小思考が既定 — 多段エージェントを検証

Flash Lite は速度とコストのため既定で最小思考を使います。Google は最小思考が多段タスクでツールの早期終了を招くことがあると指摘しているため、高スループットで展開する前にエージェントが完了することをテストしてください。

クローズドで API 経由のみの Google モデル

Gemini 3.5 Flash Lite にはオープンウェイトがなく、セルフホストできません。アクセスは Gemini API や Google AI Studio などのプラットフォーム、および EvoLink のような統一ゲートウェイ経由です。ローカル展開ではなく、コストとレイテンシでルーティングしてください。

中核機能

Gemini 3.5 Flash Lite がこれらのワークロードを処理できる理由

Gemini 3.5 Flash Lite は低価格と高速を、完全な 100 万 Token コンテキストとプロンプトキャッシュに組み合わせます。最大推論のモデルではなく、価値は単純な作業を大規模に速く安く行うことにあります。

最も安いティアでも 100 万 Token コンテキスト

1,048,576 Token のウィンドウにより、3.5 クラスで最も安いモデルでも長い文書、書き起こし、ログを一度に処理できます。無関係な入力も Token を消費するため、検索とコンテキスト圧縮は引き続きコストを下げます。

深い推論よりも速度とスループット

出力は毎秒約 350 Token、既定は最小思考で、Flash Lite は高速で高ボリュームな応答に最適化されています。より重い推論の設定やモデルは、本当に必要なリクエストのために残しておきます。

プロンプトキャッシュでさらにコスト削減

安定したシステムプロンプト、指示、ツールスキーマはキャッシュヒットを生み、専用の低いキャッシュ料金で読み取られます。プレフィックスの順序を一定に保ち、繰り返しの高ボリューム呼び出しを安価に維持します。

Gemini 3.5 Flash Lite API 本番チェック

Gemini 3.5 Flash Lite に本番トラフィックを送る前に確認すること

適切なワークロードでも、統合が誤った識別子を使う、非対応のパラメータを送る、最小思考の既定では得られない深い推論を前提にすると失敗します。品質を評価する前にリクエストの契約を確認してください。

01

正確なモデル ID gemini-3.5-flash-lite を使う

EvoLink API ルートでは model に "gemini-3.5-flash-lite"(3.5 の後にドット)を送ります。ハイフンの gemini-3-5-flash-lite はページ URL であって、API のモデルパラメータではありません。

モデル ID
02

OpenAI Chat Completions か Gemini ネイティブ API を使う

EvoLink は OpenAI 互換の /v1/chat/completions と Gemini ネイティブの generateContent エンドポイントで Gemini 3.5 Flash Lite を提供します。どちらのプロトコルでも同じ EvoLink API キーを使います。

プロトコル
03

破壊的なパラメータ変更に注意

独自の temperature、top-K、top-P は無視され、独自の frequency / presence penalty はエラーになり、最後のターンが model ロールのリクエストは拒否されます。古い Gemini のリクエストビルダーはそれに合わせて更新してください。

移行
04

最小思考の下で多段エージェントを検証

Flash Lite は既定で最小思考のため、多段のツール呼び出しエージェントが早期に停止せず各ステップを完了することを確認してください。より難しい推論はこのモデルを過度に調整するのではなく、より大きなモデルに任せます。

エージェント
本番コスト評価

Token 単価ではなく、採用できたタスクあたりのコストを比較

Gemini 3.5 Flash Lite は、その低価格と速度が高ボリュームの作業で品質基準を満たすときに勝ります。同一のタスクセットで評価し、すべてのトラフィックにプレミアム料金を払うのではなく、処理できないリクエストをエスカレーションします。

初回成功率採用できた成果物再試行回数出力 Tokenキャッシュヒット率毎秒 Token 数1,000 リクエストあたりのコストより大きなモデルへのエスカレーション率

Gemini 3.5 Flash Lite が単純で高ボリュームなタスクで品質基準を満たすなら、その低料金と速度により最も安い本番の既定モデルになります。処理できないリクエストだけを Gemini 3.6 Flash や Pro クラスのモデルへルーティングしてください。

実ワークロードの検証後に長文コンテキストモデルを比較

EvoLink

まず Gemini 3.5 Flash Lite が再試行とレビューを減らすか確認し、その後に料金、コンテキスト、キャッシュ、用途を比較して本番ルートを選びます。

Gemini 3.5 Flash Lite
入力 / 出力$0.271 / $2.25
コンテキスト1M
キャッシュ自動キャッシュ読み取り
適した用途高スループットの分類と抽出、低レイテンシのリアルタイム操作、目的を絞ったエージェントのサブエージェント、そして最大限の推論よりも速度と価格が重要なコスト重視のワークロード。
Gemini 3.6 Flash
入力 / 出力$1.5 / $7.5
コンテキスト1M
キャッシュコンテキストキャッシュ
適した用途タスクが Flash-Lite の最小思考の速度を超えたときにエスカレーションする、より大きな Gemini。
Gemini 3.1 Pro
入力 / 出力$1.68 / $10.08
コンテキスト1M
キャッシュコンテキストキャッシュ
適した用途タスクが Flash-Lite の最小思考の速度を超えたときにエスカレーションする、より大きな Gemini。

EvoLink の他の Gemini モデル

Gemini 3.6 Flash

Gemini 3.6 Flash

The workhorse to escalate to when a task needs stronger coding or reasoning than the Lite tier provides.

モデルを見る
Gemini 3.5 Flash

Gemini 3.5 Flash

The mid Flash tier between Flash-Lite and the Pro line, balancing cost and capability.

モデルを見る
Gemini 3.1 Pro

Gemini 3.1 Pro

The Pro-tier step up for the deepest reasoning tasks the Flash line is not built to handle.

モデルを見る
Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite

The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.

モデルを見る

Other text models

GPT-5.6

GPT-5.6

OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.

モデルを見る
Claude Opus 4.8

Claude Opus 4.8

Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.

モデルを見る
DeepSeek V4

DeepSeek V4

Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.

モデルを見る
Kimi K3

Kimi K3

Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.

モデルを見る

本番導入に役立つ関連記事

Gemini 3.6 Flash release date & rollout

Gemini 3.6 Flash release date & rollout

What launched, the model ID, official pricing, and where the model is available.

ガイドを読む

Gemini 3.5 Flash Lite API よくある質問

Gemini 3.5 Flash Lite API は EvoLink で利用できますか?

はい。本番モデルとして利用でき、ライブ料金と公式フォールバック料金に対応しています。

Gemini 3.5 Flash Lite API のモデル ID は何ですか?

model には "gemini-3.5-flash-lite"(3.5 の後にドット)を指定します。ハイフン区切りの gemini-3-5-flash-lite はページの URL であり、API のモデルパラメータではありません。

Gemini 3.5 Flash Lite ではどのプロトコルと SDK が使えますか?

OpenAI 互換の Chat Completions エンドポイント、または Gemini ネイティブの generateContent エンドポイントを、同じ EvoLink API キーで利用します。このモデルに Anthropic Messages ルートはありません。

Gemini 3.5 Flash Lite API は 1M コンテキストですか、それとも 256K ですか?

EvoLink ルートは 1,048,576 Token を記録します。より小さい上限は通常、特定の Gemini 製品面やクライアント設定によるもので、API モデル自体ではありません。

Gemini 3.5 Flash Lite はどれくらい速く、どれくらい安いですか?

Google の 3.5 クラスで最速・最も費用対効果の高いモデルで、100万 Token あたり入力 $0.30 / 出力 $2.50、出力速度は毎秒約 350 Token です。単位コストあたりのスループットが最大の利点です。

Gemini 3.5 Flash Lite は何に最も適していますか?

高スループットの分類、ルーティング、JSON 抽出、低レイテンシの UI 操作、目的を絞ったエージェントのサブエージェントです。深いコーディングや難しい推論には Gemini 3.6 Flash や Pro 層モデルにエスカレーションしてください。

Gemini 3.5 Flash Lite は 3.5 Flash や 3.6 Flash とどう違いますか?

Flash Lite は最も安く最も速い層で、デフォルトで最小思考です。3.5 Flash と 3.6 Flash は、コーディングやエージェント向けの、より高性能で高価格な主力モデルです。

Gemini 3.5 Flash Lite は Gemini 2.5 Flash を置き換えますか?

Google は Gemini 2.5 Flash や、より複雑でない Gemini 3 Flash のワークロードの置き換えとして位置づけています。移行前に自分のプロンプトで再評価してください。

移行時に対処すべき破壊的変更は何ですか?

カスタムの temperature、top-K、top-P は無視され、カスタムの frequency / presence penalty はエラーを返し、最後のターンが model ロールのリクエストは拒否されます。

Gemini 3.5 Flash Lite はリアルタイムや大量リクエストの既定として適していますか?

はい、まさにそのために作られています。速度のためにデフォルトで最小思考なので、高スループットで展開する前に、多段階のエージェントが各ステップを完了できることを検証してください。

Gemini 3.5 Flash Lite を GPT、Claude、GLM、DeepSeek とどう比較しますか?

プレミアムな推論モデルではなく、他の安く速い層と、1K リクエストあたりのコストとレイテンシで比較してください。処理できないリクエストはより大きなモデルにエスカレーションします。

本番評価では Gemini 3.5 Flash Lite の何を計測すべきですか?

1K リクエストあたりのコスト、毎秒 Token 数、初回成功率、採用された成果物、キャッシュヒット、そしてより大きなモデルへエスカレーションが必要になる頻度を計測します。