
Gemini 3.6 FlashのThinking Level別コスト実測
minimalは、9 つの本番想定タスクでmediumのデフォルト設定より 73.6% 低コストでした。正解数はどちらも 9/9 です。レベルを指定していない場合、これが最も大きなコスト削減余地です。- 入力トークンも含めると、
mediumでは思考トークンが請求総額の 75% を占めました。 回答長は 4 レベルでほとんど変わらないため、レベル間のコスト差のほぼすべてが思考トークンによるものです。 lowの思考予算は固定ではありません。 9 回の構造化抽出すべてで思考トークンが正確にゼロとなり、その部分のコストはminimalと同じでした。一方、ツール呼び出しやコードタスクでは思考トークンを使っています。lowより上のレベルで思考量を増やしても、難しいラウンドの正解数は増えませんでした。minimal、low、medium、highのスコアは、それぞれ 2、10、10、8/15 でした。- デフォルト設定が間違っているわけではなく、ワークロードに最適化されていないだけです。
mediumは、作業特性がまだ分からない段階での妥当な中間設定です。ワークロードの特性が分かったら、レベルを意図的に指定する価値があります。 - このモデルの公開されているベンチマークはすべて
highで実行されます。一方、API のデフォルトはmediumです。これらは異なる請求書と異なるレイテンシです。
レベル別の簡単な答え
同じ 9 つのタスクを 1 回ずつ実行したときの各レベルのコストと、そのコストが正当化できたタスクを示します。
| レベル | パスごとのコスト | medium デフォルトとの比較 | こんなときに使います |
|---|---|---|---|
minimal | $0.0158 | 73.6% 安くなります | 抽出、分類、ルーティング、コードの場所、スクリプトに従うだけで済むツールチェーン |
low | $0.0232 | 61.2% 安くなります | 同じ作業に加えて、モデルが何か問題が発生した場合に回復する必要がある場合の複数ステップのツール呼び出し |
medium (デフォルト) | $0.0598 | ベースライン | トラフィックの形状がまだわかっていないか、作業内容が多すぎて特定できない |
high | $0.0653 | 9.3% 高い | 用途を限定して使うべきです。私たちのタスクでは追加予算の大半が使われず、難しいラウンドのスコアは medium より低くなりました |
minimal があなたのワークロードにも適するとは言えません。私たちのタスクでは問題ありませんでしたが、その内容は以下で具体的に説明します。誰も公開しない数字: 思考トークンに対する回答トークン
発売日に見つけたこのモデルの価格比較はすべて、出力トークンを 1 つの数字として扱います。これにより、まったく似た動作をしない 2 つの量がマージされ、一度分離すると、このリリースに関する混乱のほとんどが解決されます。
これは 9 つのタスクを通過する 1 つのパスで、出力側が読み取り可能なトークンと読み取りできないトークンに分割されています。
| 構成 | 回答トークン | 思考トークン | 出力に占める思考の割合 | 1回あたりのコスト | 正答 | 平均レイテンシ |
|---|---|---|---|---|---|---|
3.6 Flash minimal | 1,162 | 0 | 0% | $0.0158 | 9/9 | 2.8s |
3.6 Flash low | 1,056 | 1,095 | 51% | $0.0232 | 9/9 | 3.3s |
3.6 Flash medium (デフォルト) | 1,080 | 5,944 | 85% | $0.0598 | 9/9 | 5.1s |
3.6 Flash high | 1,092 | 6,679 | 86% | $0.0653 | 9/9 | 5.3s |
3.5 Flash medium | 1,078 | 5,827 | 84% | $0.0692 | 9/9 | 5.1s |
3.5 Flash high | 1,113 | 7,185 | 87% | $0.0818 | 9/9 | 5.7s |
3.5 Flash-Lite minimal (デフォルト) | 977 | 0 | 0% | $0.0036 | 8/9 | 1.8s |
3.5 Flash-Lite high | 1,097 | 8,288 | 88% | $0.0249 | 9/9 | 4.2s |
まず、回答トークンの列を読んでください。 8 つの構成、2 つのモデル、および 4 つの思考レベルにわたって、977 トークンと 1,162 トークンの間に留まり、列の最大の数値が最も安価な構成に属します。モデルは、最初にどれだけ考えても、ほぼ同じ長さの答えを生成します。
次に、思考トークンの列を見てください。ゼロから 8,288 まで広がっています。これが請求額の全体像です。
これはお金と同じデータで、各パスを入力、答え、思考に対して支払った金額に分割しています。 Gemini 3.6 Flash の標準レベルのレート (入力トークン 100 万個あたり $1.50 および出力トークン 100 万個あたり $7.50) です。
| レベル | 入力 | 回答 | 思考 | 合計 | 料金全体に占める思考の割合 |
|---|---|---|---|---|---|
minimal | $0.0071 | $0.0087 | $0.0000 | $0.0158 | 0% |
low | $0.0071 | $0.0079 | $0.0082 | $0.0232 | 35% |
medium | $0.0071 | $0.0081 | $0.0446 | $0.0598 | 75% |
high | $0.0071 | $0.0082 | $0.0501 | $0.0653 | 77% |
デフォルト レベルでは、レベルによって答えが正しいかどうかに違いがなかったタスクについて、支払った金額の 4 分の 3 が、決して見ることのない推論に費やされます。それはモデルの欠陥ではありません。これは、汎用のデフォルトが特定のワークロードを満たすときに起こることです。
これは、「新しいモデルはトークンを節約しますか」という質問が公の場で矛盾した答えを受ける理由も説明します。この主張は出力トークンに関するもので、出力トークンは主に思考トークンであり、思考トークンの数は思考レベルに依存しますが、これについてはほとんど誰も述べていません。レベルが指定されていない測定は再現できません。
これをどのように測定したか
2 ラウンドは、両方のモデルがリリースされた日、2026-07-21 に実行されます。
minimal ですべての 20 タスクを 3 回再実行して、並べ替えが保持されているかどうかを確認しました。これは、別の 60 呼び出しです。ラウンド 2 は 190 呼び出しと $1.34. でした。- 呼び出しは Google AI Studio に固定されたプロバイダーを使用して OpenRouter を経由し、同時ではなくシリアルに送信されました。ゲートウェイはどのリージョンがリクエストを処理したかを公開しないため、それを明らかにすることはできません。
- コストは、ゲートウェイ自体の請求額からではなく、Google の標準階層の定価から計算されます。ゲートウェイは割引レベルでルートするため、この 2 つを混合すると、Google が公開している価格と比較できない数値になります。
- サンプリングパラメータが設定されていません。
temperature、top_p、およびtop_kは Gemini 3.x では非推奨であり、受け入れられてから無視されるため、これらを設定してもドキュメントを読んでいないことを暗示しながら何も変更されません。まだ運用環境で設定している場合は、このリリースの残りのインターフェイス変更については、Gemini 3.6 Flash リリース ガイド で説明されています。 - 採点は人間によるものではなく、ルールに基づいて行われます。ここでは正確性がサポート指標であり、安いレベルは静かに仕事量が少ないため安く見えるという説明を排除するために存在します。
- 回答トークンと思考トークンは API 呼び出しごとに個別に記録したため、上の表のように分けて比較できます。
high の 1 つのコード タスクは、3 つの同一のリクエストに対して 331、538、および 347 思考トークンを返しました。したがって、3 回の実行の平均はコストの数値には必要ですが、正確性の数値には不要です。ラウンド 2 では、タスクがモデルの実行可能範囲の端に位置し、その安定性は完全に失われます。これを脚注ではなく発見として扱います。公開されているベンチマークがこの質問に答えない理由
誰もこれを調べることができない理由が文書化されています。流通しているベンチマークの数値は、ほとんどの運用トラフィックが実行されないレベルで測定されており、情報筋がそのように述べていることはほとんどありません。
- Artificial Analysis は、現在、
highの考え方で測定された、このモデルの完全な内訳を含む唯一の独立した情報源です。 API のデフォルトはmediumです。 - Gemini 3.5 Flash-Lite の Google 独自の結果テーブルは
highの考え方に基づいて作成されましたが、そのモデルの API デフォルトはminimalです。デフォルト構成の実行は、表で説明されている実験ではありません。 - Google の比較表では、DeepSWE の行は、
mediumでは Gemini 3.5 Flash を実行し、highでは Gemini 3.6 Flash を実行するため、その行の 2 つの Gemini の数値は同レベルの比較ではありません。 - Google の見出し「DeepSWE で 65% まで」は、スコアではなく、トークン使用量の削減を指します。 DeepSWE スコアは 49% です。
だからといって、公表された数字が間違っているわけではありません。これにより、「実際に走るレベルでどれくらいの費用がかかるか」とは異なる質問に対する答えが得られます。
ラウンド 1: 通常作業のレベル
3 つの結果を重要な順序で示します。
minimal は「思考が少ない」のではなく、「まったく思考しない」ことを意味します。 思考トークンは、小さな値ではなく正確にゼロでした。Gemini 3.6 Flash で行った minimal の全実行では、102 回の呼び出しのうち 101 回で思考トークンが正確にゼロでした。唯一の例外は非常に奇妙だったため、以下に独立したセクションを設けています。同時に、正答率は 9 問中 9 問のままで、レイテンシの中央値は 5.1 秒から 2.8 秒に低下しました。このタスクセットでは、デフォルトレベルによって得られたのは 3.8 倍の請求額と 2 倍遅い応答だけでした。high のコストは medium よりも 9.3% のみです。 追加の予算はほとんど使用されなかったためです。思考は 5,944 から 6,679 トークンに上昇しました。これはこれら 9 つのタスクに関する事実であり、モデルに関するものではありません。本当により多くの推論が必要な仕事を与えれば、差はさらに広がります。この比率を独自の予測に持ち込まないでください。medium では 13.6%、high では 20.1% でした。その節約のほとんどすべては、トークン効率によるものではなく、100 万トークンあたりの出力価格の $9.00 から $7.50 への引き下げによるものです。 medium では、請求された出力トークンは古いモデルに対して 1.7% 上昇し、high では 6.4% 低下しました。トラフィックにも同じことが当てはまるかどうかは、入力対出力の比率によって異なります。これは、入力価格がまったく変化していないためです。また、Gemini 3.5 Flash コスト計算ツール では、古いモデルで実際に動作した例を使ってその算術計算を行っています。low は適応型であり、小規模な固定予算ではありません
これは私たちが予期していなかった結果であり、このページで最も直接役立つものです。
low では、Gemini 3.6 Flash が 3 つのタスク タイプにわたって不均等に思考を費やしました。パスごとの思考トークン:| タスクグループ | minimal | low | medium | high |
|---|---|---|---|---|
| 構造化された抽出 | 0 | 0 | 2,673 | 2,916 |
| マルチターンツール呼び出し | 0 | 549 | 1,797 | 1,914 |
| コードの場所と修復 | 0 | 546 | 1,474 | 1,849 |
low の思考トークンは正確にゼロでした。このグループのコストは low が $0.00490、minimal が $0.00489 で、差は 0.2% です。一方、ツール呼び出しとコード修復では、同じ low がタスクあたり 100〜440 の思考トークンを使いました。low は抽出部分を minimal に近いコストで処理しつつ、その他のタスクに思考の余力を残します。大部分の節約を得るためにトラフィックを 2 つの設定に分ける必要はありません。私たちのタスクセットでは、この組み合わせがデフォルトより 61.2% 低コストでした。low に依存するシステムを構築するつもりはありません。ラウンド 2: 品質が実際に損なわれる箇所
ラウンド 1 では、すべての構成が 9 点中 9 点を獲得したため、品質に関する質問に答えることができませんでした。 9 つのタスクは 4 つのレベルに分けるほど難しくはありませんでした。そこで私たちはレベルを難しくしましたが、返された答えはレベルが示唆するものではありませんでした。
minimal は 3 回中 3 回の試行で 17 を正しく取得しました。請求書の 3 つの数値が一致せず再計算する必要がある矛盾の解決、3 つのインターリーブされた要求レコードを 1 つの失敗チェーンに関連付け、矛盾する契約条項、複数通貨および複数期間に「後で署名した文書が勝つ」メタルールを適用する変換、2 つの関数にまたがるキャッシュ キーのバグ、および 3 回目の呼び出しでのみ発生するレート リミッターのバグです。思考トークンを 1 つも費やすことなく、それらすべてを解決しました。同じタスクのコストは、high での 1,100 と 6,900 の思考トークンの間です。したがって、少なくともこれらのタスクが占める範囲では、思考レベルによって推論の正しさは買えません。それが買うのはもっと狭いものです。
minimal で処理されました。6 つの構成がこれら 3 つのタスク (それぞれ 5 回の試行) でどのようにスコアを獲得したかを次に示します。
| 構成 | タスク 1 | タスク 2 | タスク 3 | 合計 | 1 回の API 呼び出しあたりのコスト |
|---|---|---|---|---|---|
3.6 Flash minimal | 1/5 | 0/5 | 1/5 | 2/15 | $0.00175 |
3.6 Flash low | 4/5 | 1/5 | 5/5 | 10/15 | $0.00553 |
3.6 Flash medium (デフォルト) | 5/5 | 5/5 | 0/5 | 10/15 | $0.00674 |
3.6 Flash high | 5/5 | 2/5 | 1/5 | 8/15 | $0.00739 |
3.5 Flash-Lite minimal (デフォルト) | 4/5 | 5/5 | 0/5 | 9/15 | $0.00068 |
3.5 Flash-Lite high | 2/5 | 5/5 | 3/5 | 10/15 | $0.00262 |
1 回の API 呼び出しあたりのコストからは、次のセクションで説明する 1 件の異常なリクエストを除外しています。それを含めた合計値は次のセクションに示します。
minimal から low です。 15 のうち 2 は 15 のうち 10 になります。その点を超えると、線は平坦になり、その後、10、10、8 と下に曲がります。medium が必要でしたが、high では 2/5 に低下しました。タスク 3 は完全に逆で、low は 5/5、medium は 0/5、high は 1/5 でした。思考量を増やすほど、このタスクの結果は 5 回の試行を通じて一貫して悪化しました。low を超えると、測定した差は、同一の実行間の変動よりも小さくなります。minimal で 3 回再実行すると、20 問中 17 問は明確に再現しました。一方、1 回の実行で失敗と判定された 1 問は、再実行では 1/3 の成功でした。これが、ここで説明しているばらつきです。工学的な結果は、レベルの推奨事項よりも役立ちます。エージェントが予期しない状態から回復する必要がある場合は、アプリケーションに再試行と検証を組み込んで、思考レベルを回復の信頼性を高めるものとしてではなく、コスト設定として扱います。
Gemini 3.6 Flash low 対 Gemini 3.5 Flash-Lite
この比較には、私たちが見つけることができたどこにも公開データはなく、コストを重視するチームが実際に直面している問題です。ほぼ同じ金額で、少し考えてより強力なモデルを実行しますか、それとも、よく考えてより安価なモデルを実行しますか?
low の Gemini 3.6 Flash はパスごとに $0.0232 でした。 high の Gemini 3.5 Flash-Lite は $0.0249. 両方とも 9 点中 9 点を獲得しました。 low での Gemini 3.6 Flash は、4.2 秒の平均レイテンシに対して 3.3 秒で高速であり、1,095 思考トークンでそのスコアに達しましたが、Flash-Lite では 8,288 が必要でした。high のコスト $0.00553. に対して呼び出しごとに $0.00262 このタスク セットでは、よく考えた安価なモデルのほうが、同じスコアの価格の半分以下でした。これら 2 つの図のうちどちらがあなたに当てはまるかは、タスクの組み合わせによって決まります。それが、回避策ではなく正直な答えです。 2 つの構成は、両方のラウンドで同じパフォーマンス帯域内にあります。それらの間の価格関係は、タスク セット間で安定していません。
同じデータからさらに 2 つの観測結果が得られます。どちらも、デフォルトの Flash-Lite を使用する前に知っておく価値があります。
minimal レベルは、特定の反復可能な方法で 1 つのタスクに失敗しました。 3 段階の通知チェーンでは、最初の 2 つのツールが呼び出され、3 回中 3 回、毎回同じ署名で通知を送信せずに停止しました。これが、ラウンド 1 のすべての 216 呼び出しにおける唯一の品質の違いでした。また、Google ドキュメント自体の制限も再現します。minimal のデフォルトは、ツール呼び出しが途中で終了するため、自律サブエージェントの使用には適さないと説明されています。 Flash-Lite をエージェントとして実行する場合は、レベルを上げるか、その失敗を予期してください。minimal の Flash-Lite は 15 のうち 9 点を獲得しましたが、Gemini 3.6 Flash の 15 は 2 点中スコアでした。ラウンド 1 の通知チェーンでは、その関係が逆転しました。minimal の Gemini 3.6 Flash は 3 回中 3 回合格しましたが、Flash-Lite は 3 回中 3 回失敗しました。ここには順序はなく、2 つの異なる障害形状のみであり、一方のモデルのトラフィックで安全なレベルが、もう一方のモデルでも自動的に安全になるわけではありません。説明できない異常が 1 つあります
minimal での 1 つの呼び出しにより 62,916 思考トークンが返されました。minimal 呼び出しはすべて、正確にゼロを返しました。この例では 5 つのツール ターンが使用され、モデルの 65,536-token 出力上限に近い出力が生成され、所要時間は 209 秒、コストは $0.48. でした。これは、そのレベルでの他の呼び出しのコストのおよそ 270 倍であり、その構成が 15-call ラウンド全体で費やした $0.50 のほぼすべてです。 minimal がその特定のタスクを正しく実行したのはこの時だけでした。minimal で予算を立てている人にとって重要であるためです。私たちはメカニズムを持っていないので、メカニズムを提供するつもりはありません。 Google のモデル カードには、モデルの既知の制限の中で時折応答が遅いことが記載されていますが、そのメモをこの観察と自信を持って結びつけることはできません。minimal を実行する場合は、出力トークンの最大制限とタイムアウトを設定します。通常、思考トークンを消費しないレベルは、何も消費できないレベルと同じではありません。タスクごとに選ぶべきレベル
以下が、実務で持ち帰るべき判断表です。各行は上の 2 ラウンドの結果に基づいており、その適用範囲は表の後で説明します。
| タスクの種類 | レベル | 理由 |
|---|---|---|
| シングルターンの抽出、分類、質問応答、コードの位置特定、修復 | minimal | 意図的に難しくした 20 問中 17 問が 3 回の試行すべてで成功。コストはデフォルトの 26% |
| 計画に従うだけ、またはアクションを拒否するだけの複数ステップのツール呼び出し | minimal で十分です | バッチ内の例外の検出、ポリシー違反のリクエストの拒否、信頼できるデータ ソースの選択という 8 つのステップのチェーンは、3 回中 3 回成功しました。 |
| モデルが計画にないアクション (再試行、ロールバック、プリエンプティブ インターセプト) を必要とする可能性がある場合に、複数ステップのツールを呼び出します。 | 少なくとも low | minimal は、まさにこれらに関して 2/15 をスコア付けしました。 low スコア 10/15 |
| 同じタスクだが、安定した成功が必要 | どのレベルでも解決できない | low、medium、high はそれぞれ 10、10、8/15。差は実行ごとのばらつきより小さいため、アプリケーション側で再試行と検証を行う |
| 1 つの設定で混合トラフィックを処理 | low | 抽出タスクでは思考トークンがゼロで、その他のタスク向けの余力も残しつつ、コストはデフォルトより 61.2% 低かった |
| タスクの構成比がまだ分からない | medium から始めて測定 | デフォルトは妥当な出発点。不要だと分かった後にのみ、割高な設定になる |
medium で Gemini 3.6 Flash が Gemini 3.5 Flash より多く思考トークンを使うかという問いに対し、aibenchy の独立テストでは 66.2% 多く、私たちのテストでは 2.0% 多いという結果でした。同じ問いでも、彼らの 22 件の短いベンチマーク問題と、私たちの抽出・ツール呼び出し・コードタスクは逆の答えを出しました。これは決着すべき論争ではなく、「思考レベルでトークンを節約できるかは、モデル自体ではなくワークロードの性質で決まる」という発見です。自分のトラフィックでこれを測定する
4 つのステップを、最も早く答えが得られる順序で示します。
-
何かを変更する前に、今すぐ思考トークンを個別に記録してください。 Google の API は、設定したレベルとともに
total_thought_tokensのカウントを返します。総出力トークンだけを追跡する場合、今週もっと真剣に考えようと決めたレベルからの即時回帰を区別することはできません。from google import genai from google.genai import types client = genai.Client() # reads the API key from the environment response = client.models.generate_content( model="gemini-3.6-flash", contents=prompt, config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig(thinking_level="minimal"), ), ) log.info( "level=minimal thinking_tokens=%s", response.usage_metadata.total_thought_tokens, )
medium に設定した場合でも、レベルを明示的に設定します。 継承されたデフォルトは、誰も行わなかったコストの決定です。また、デフォルトが変更されると請求書も変更される可能性があることを意味します。
3. **minimal および low で 1 日分の実際のトラフィックを再生し、出力をベンチマークではなく現在のトラフィックと比較します。私たちのタスクでは、その比較は請求額の 61% と 74% の間で価値があり、これはこの層で利用可能などのモデル スワップよりも大きな効果です。
4. ツール呼び出しパスを他のすべてとは別にグレード付けします。 レベル変更の正確性が見つかったのはここだけであり、抽出トラフィックと合わせて平均化すると、それが隠蔽されます。複数のモデルにわたってその比較を実行することは、通常、ベンダーごとに個別に統合することを意味し、チームが測定を完全にスキップする最も一般的な理由はその統合コストです。 1 つの OpenAI 互換エンドポイントを標準化するとそれが削除されるため、実行間で変更されるのはモデル文字列だけになります。
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.evolink.ai/v1",
api_key=os.environ["EVOLINK_API_KEY"],
)
for model in ("gemini-3.6-flash", "gemini-3.5-flash-lite"):
response = client.chat.completions.create(model=model, messages=messages)
record(model, response.usage)よくある質問
medium.選択可能な値は、minimal、low、medium、および high です。 Gemini 3.5 Flash-Lite のデフォルトは minimal であるため、2 つのモデルはそのままではまったく異なる動作をします。minimal は利用可能な最低の設定であり、Google のドキュメントでは、このモデルでは、スイッチをオフにするものではなく、デフォルトでオンになると考えられると説明されています。実際には、minimal は、102 呼び出しの 101 でまったくゼロの思考トークンを返したため、ほとんどのリクエストで課金目的ではオフとして動作します。 1 つの例外については上記に記載されているため、それを保証として説明しません。minimal はデフォルトよりどれくらい安くなりますか?
9 つのタスク セットでは、パスあたり 73.6% 安くなり、正確性は 9/9 と同じで、待ち時間は約半分でした。比率は、作業によってモデルが medium でどの程度思考するかによって決まります。そのため、それを予測するための数値としてではなく、測定する理由として扱います。minimal の 2/15 から low の 10/15 へ明確に改善しました。しかし low より上では、スコアが 10、10、8/15 となり、あるタスクでは各レベル 5 回の試行を通じて、高いレベルほど結果が悪化しました。推論量の多いシングルターンタスクでも、minimal は思考トークンを一切使わずに難問 20 問中 17 問を解きました。high で公開され、Google の Flash-Lite 結果テーブルも high で生成されましたが、そのモデルの API デフォルトは minimal です。デフォルトを実行すると、これらの数値が示す構成は実行されません。total_thought_tokens を読みます。出力トークンを加算するのではなく、出力トークンの隣に独自のフィールドとして記録します。そうしないと、後でコストの変更を帰属させることができなくなります。情報源
- Gemini 思考ドキュメント、Google、
thinking_level値、モデルごとのデフォルト、応答価格設定が出力トークンと思考トークンを合計するというステートメント、およびtotal_thought_tokensフィールド - Gemini API モデルのドキュメント、Google
- Gemini API の価格設定、Google
- Gemini 3.6 Flash、3.5 Flash-Lite、および 3.5 Flash Cyber の紹介、Google、2026-07-21
- 文書化されたモデルの制限については、Gemini 3.6 Flash、Google DeepMind
- Gemini 3.6 Flash および Gemini 3.5 Flash-Lite: タスクごとの時間の半減、Artificial Analysis、2026-07-21
- aibenchy、独立した 22-question テスト実行、2026-07-21
- EvoLink ファーストパーティ測定、2026-07-21: 406 コールは 2 ラウンドにわたり、コールごとの記録が保持されます。


