Gemini 3.5 Flash Lite API
Gemini 3.5 Flash Lite を選択
Google の 3.5 クラスで最も安く最も速いモデルで、低レイテンシの分類・ルーティング・抽出や軽量なエージェントのサブエージェント向けです。100万 Token のフルコンテキストを 100万 Token あたり $0.30 / $2.50 で利用できます。
Gemini 3.5 Flash Lite
Google の 3.5 クラスで最速・最も費用対効果の高いモデル
gemini-3.5-flash-lite高スループットの分類と抽出、低レイテンシのリアルタイム操作、目的を絞ったエージェントのサブエージェント、そして最大限の推論よりも速度と価格が重要なコスト重視のワークロード。
Gemini 3.5 Flash Lite pricing
Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.5 Flash Lite rate.
Token calculator
Enter the token mix for one request.Estimated request cost
Gemini 3.5 Flash LiteMinimum charge: 0.01 credits per request.
EvoLink vs Google direct
Same token mix, default group price.Budget guide
Approximate requests using the current token mix.For quick testing
For regular development
For production evaluation
Model pricing
| Model | Context | Input tokens | Cache read tokens | Output tokens |
|---|---|---|---|---|
Gemini 3.5 Flash Litegemini-3.5-flash-lite | All context sizes | $0.271 / 1M-10% 18.4 cr / 1M$0.300official price | $0.028 / 1M-7% 1.9 cr / 1M$0.030official price | $2.250 / 1M-10% 153 cr / 1M$2.500official price |
Gemini 3.5 Flash Lite
All context sizesUSD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.
高速・低コスト・高スループット向けの Gemini 3.5 Flash Lite API
EvoLink の統一 API から Google の 3.5 クラスで最も安く高速なモデル Gemini 3.5 Flash Lite を呼び出せます。低レイテンシの分類、ルーティング、抽出、軽量なエージェントのサブエージェント向けに設計され、1,048,576 Token コンテキスト、プロンプトキャッシュ、構造化出力、ツール利用に対応し、料金は 100 万 入力 / 出力 Token あたり $0.30 / $2.50 です。
本番モデル構成で Gemini 3.5 Flash Lite が価値を発揮する場面
Google は Gemini 3.5 Flash Lite を、3.5 クラスで最速かつ最も費用対効果の高いモデルと位置づけています。最大の推論力よりも低価格と速度が重要な、高ボリュームでレイテンシに敏感なワークロードに最も適し、少数の難しいリクエストは大きなモデルへ引き上げられます。
高スループットの分類と抽出
Gemini 3.5 Flash Lite は高スループットの分類、ルーティング、JSON 抽出のために作られています。100 万 Token あたり $0.30 / $2.50 で、プレミアムモデルでは無駄になる場面でも大量のリクエストを安価に処理できます。
低レイテンシでコストに敏感なスケール
Google は出力を毎秒約 350 Token と報告しており、リアルタイム UI 操作、オートコンプリート、モデレーションなどレイテンシが重要な経路によく合います。ベンチマークの見出しではなく、リクエストごとのコストと速度を測定してください。
軽量で焦点を絞ったエージェントのサブエージェント
より大きなマルチエージェントシステムの中で焦点を絞ったタスクを実行するサブエージェントに向いています。速度のため既定で最小思考を使うため、多段のツール利用ではスケール前にエージェントが早期終了しないことを検証してください。
大きなモデルへ引き上げるべきとき
深いリポジトリのリファクタリング、長時間の自律コーディング、難しい多段推論は Gemini 3.6 Flash や Pro クラスのモデルが担います。Flash Lite は高ボリュームの大多数に使い、難しい少数だけを上位へルーティングします。
Gemini 3.5 Flash Lite への初期反応が示すことと、まだ証明が必要なこと
Gemini 3.5 Flash Lite は 2026-07-21 に Gemini 2.5 Flash の後継として公開されました。ローンチ時の反応は仮説として扱い、自分のタスク、ツール、予算、受け入れ基準で検証してください。
価格対性能が見出し
100 万 Token あたり入力 $0.30 / 出力 $2.50、毎秒約 350 Token で、魅力はドルあたりのスループットです。単純で高ボリュームな作業では、許容できる品質を保ちながら総コストでより高価なモデルを上回ることがあります。
Gemini 2.5 Flash と軽めの 3-Flash ワークロードを置き換える
Google はこれを Gemini 2.5 Flash と、より複雑でない Gemini 3 Flash タスクのドロップイン代替と位置づけています。現在これらを使っているなら、移行前に自分のプロンプトで再ベンチマークし、品質と書式が許容範囲に収まるか確認してください。
最小思考が既定 — 多段エージェントを検証
Flash Lite は速度とコストのため既定で最小思考を使います。Google は最小思考が多段タスクでツールの早期終了を招くことがあると指摘しているため、高スループットで展開する前にエージェントが完了することをテストしてください。
クローズドで API 経由のみの Google モデル
Gemini 3.5 Flash Lite にはオープンウェイトがなく、セルフホストできません。アクセスは Gemini API や Google AI Studio などのプラットフォーム、および EvoLink のような統一ゲートウェイ経由です。ローカル展開ではなく、コストとレイテンシでルーティングしてください。
Gemini 3.5 Flash Lite がこれらのワークロードを処理できる理由
Gemini 3.5 Flash Lite は低価格と高速を、完全な 100 万 Token コンテキストとプロンプトキャッシュに組み合わせます。最大推論のモデルではなく、価値は単純な作業を大規模に速く安く行うことにあります。
最も安いティアでも 100 万 Token コンテキスト
1,048,576 Token のウィンドウにより、3.5 クラスで最も安いモデルでも長い文書、書き起こし、ログを一度に処理できます。無関係な入力も Token を消費するため、検索とコンテキスト圧縮は引き続きコストを下げます。
深い推論よりも速度とスループット
出力は毎秒約 350 Token、既定は最小思考で、Flash Lite は高速で高ボリュームな応答に最適化されています。より重い推論の設定やモデルは、本当に必要なリクエストのために残しておきます。
プロンプトキャッシュでさらにコスト削減
安定したシステムプロンプト、指示、ツールスキーマはキャッシュヒットを生み、専用の低いキャッシュ料金で読み取られます。プレフィックスの順序を一定に保ち、繰り返しの高ボリューム呼び出しを安価に維持します。
Gemini 3.5 Flash Lite に本番トラフィックを送る前に確認すること
適切なワークロードでも、統合が誤った識別子を使う、非対応のパラメータを送る、最小思考の既定では得られない深い推論を前提にすると失敗します。品質を評価する前にリクエストの契約を確認してください。
正確なモデル ID gemini-3.5-flash-lite を使う
EvoLink API ルートでは model に "gemini-3.5-flash-lite"(3.5 の後にドット)を送ります。ハイフンの gemini-3-5-flash-lite はページ URL であって、API のモデルパラメータではありません。
OpenAI Chat Completions か Gemini ネイティブ API を使う
EvoLink は OpenAI 互換の /v1/chat/completions と Gemini ネイティブの generateContent エンドポイントで Gemini 3.5 Flash Lite を提供します。どちらのプロトコルでも同じ EvoLink API キーを使います。
破壊的なパラメータ変更に注意
独自の temperature、top-K、top-P は無視され、独自の frequency / presence penalty はエラーになり、最後のターンが model ロールのリクエストは拒否されます。古い Gemini のリクエストビルダーはそれに合わせて更新してください。
最小思考の下で多段エージェントを検証
Flash Lite は既定で最小思考のため、多段のツール呼び出しエージェントが早期に停止せず各ステップを完了することを確認してください。より難しい推論はこのモデルを過度に調整するのではなく、より大きなモデルに任せます。
Token 単価ではなく、採用できたタスクあたりのコストを比較
Gemini 3.5 Flash Lite は、その低価格と速度が高ボリュームの作業で品質基準を満たすときに勝ります。同一のタスクセットで評価し、すべてのトラフィックにプレミアム料金を払うのではなく、処理できないリクエストをエスカレーションします。
Gemini 3.5 Flash Lite が単純で高ボリュームなタスクで品質基準を満たすなら、その低料金と速度により最も安い本番の既定モデルになります。処理できないリクエストだけを Gemini 3.6 Flash や Pro クラスのモデルへルーティングしてください。
実ワークロードの検証後に長文コンテキストモデルを比較
EvoLinkまず Gemini 3.5 Flash Lite が再試行とレビューを減らすか確認し、その後に料金、コンテキスト、キャッシュ、用途を比較して本番ルートを選びます。
| モデル | Gemini 3.5 Flash Lite | Gemini 3.6 Flash | Gemini 3.1 Pro |
|---|---|---|---|
| 入力 / 出力 | $0.271 / $2.25 | $1.5 / $7.5 | $1.68 / $10.08 |
| コンテキスト | 1M | 1M | 1M |
| キャッシュ | 自動キャッシュ読み取り | コンテキストキャッシュ | コンテキストキャッシュ |
| 適した用途 | 高スループットの分類と抽出、低レイテンシのリアルタイム操作、目的を絞ったエージェントのサブエージェント、そして最大限の推論よりも速度と価格が重要なコスト重視のワークロード。 | タスクが Flash-Lite の最小思考の速度を超えたときにエスカレーションする、より大きな Gemini。 | タスクが Flash-Lite の最小思考の速度を超えたときにエスカレーションする、より大きな Gemini。 |
EvoLink の他の Gemini モデル

Gemini 3.6 Flash
The workhorse to escalate to when a task needs stronger coding or reasoning than the Lite tier provides.
モデルを見る
Gemini 3.5 Flash
The mid Flash tier between Flash-Lite and the Pro line, balancing cost and capability.
モデルを見る
Gemini 3.1 Pro
The Pro-tier step up for the deepest reasoning tasks the Flash line is not built to handle.
モデルを見る
Gemini 3.1 Flash Lite
The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.
モデルを見るOther text models

GPT-5.6
OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.
モデルを見る
Claude Opus 4.8
Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.
モデルを見る
DeepSeek V4
Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.
モデルを見る
Kimi K3
Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.
モデルを見る本番導入に役立つ関連記事

Gemini 3.6 Flash release date & rollout
What launched, the model ID, official pricing, and where the model is available.
ガイドを読むGemini 3.5 Flash Lite API よくある質問
Gemini 3.5 Flash Lite API は EvoLink で利用できますか?
はい。本番モデルとして利用でき、ライブ料金と公式フォールバック料金に対応しています。
Gemini 3.5 Flash Lite API のモデル ID は何ですか?
model には "gemini-3.5-flash-lite"(3.5 の後にドット)を指定します。ハイフン区切りの gemini-3-5-flash-lite はページの URL であり、API のモデルパラメータではありません。
Gemini 3.5 Flash Lite ではどのプロトコルと SDK が使えますか?
OpenAI 互換の Chat Completions エンドポイント、または Gemini ネイティブの generateContent エンドポイントを、同じ EvoLink API キーで利用します。このモデルに Anthropic Messages ルートはありません。
Gemini 3.5 Flash Lite API は 1M コンテキストですか、それとも 256K ですか?
EvoLink ルートは 1,048,576 Token を記録します。より小さい上限は通常、特定の Gemini 製品面やクライアント設定によるもので、API モデル自体ではありません。
Gemini 3.5 Flash Lite はどれくらい速く、どれくらい安いですか?
Google の 3.5 クラスで最速・最も費用対効果の高いモデルで、100万 Token あたり入力 $0.30 / 出力 $2.50、出力速度は毎秒約 350 Token です。単位コストあたりのスループットが最大の利点です。
Gemini 3.5 Flash Lite は何に最も適していますか?
高スループットの分類、ルーティング、JSON 抽出、低レイテンシの UI 操作、目的を絞ったエージェントのサブエージェントです。深いコーディングや難しい推論には Gemini 3.6 Flash や Pro 層モデルにエスカレーションしてください。
Gemini 3.5 Flash Lite は 3.5 Flash や 3.6 Flash とどう違いますか?
Flash Lite は最も安く最も速い層で、デフォルトで最小思考です。3.5 Flash と 3.6 Flash は、コーディングやエージェント向けの、より高性能で高価格な主力モデルです。
Gemini 3.5 Flash Lite は Gemini 2.5 Flash を置き換えますか?
Google は Gemini 2.5 Flash や、より複雑でない Gemini 3 Flash のワークロードの置き換えとして位置づけています。移行前に自分のプロンプトで再評価してください。
移行時に対処すべき破壊的変更は何ですか?
カスタムの temperature、top-K、top-P は無視され、カスタムの frequency / presence penalty はエラーを返し、最後のターンが model ロールのリクエストは拒否されます。
Gemini 3.5 Flash Lite はリアルタイムや大量リクエストの既定として適していますか?
はい、まさにそのために作られています。速度のためにデフォルトで最小思考なので、高スループットで展開する前に、多段階のエージェントが各ステップを完了できることを検証してください。
Gemini 3.5 Flash Lite を GPT、Claude、GLM、DeepSeek とどう比較しますか?
プレミアムな推論モデルではなく、他の安く速い層と、1K リクエストあたりのコストとレイテンシで比較してください。処理できないリクエストはより大きなモデルにエスカレーションします。
本番評価では Gemini 3.5 Flash Lite の何を計測すべきですか?
1K リクエストあたりのコスト、毎秒 Token 数、初回成功率、採用された成果物、キャッシュヒット、そしてより大きなモデルへエスカレーションが必要になる頻度を計測します。