MiniMax H3(Hailuo 3)が EvoLink に登場無料10クレジットで試す
Gemini 3.6 Flashの4つのThinking Levelを段階的な推論ゲートで表現した図
analysis

Gemini 3.6 FlashのThinking Level別コスト実測

Jacey
Jacey
Founder
2026年7月22日
49 分
最終検証日: 2026-07-21。EvoLink モデル研究チームが執筆しました。このページの数値は、ローンチ当日に実行した 406 回の API 呼び出しに基づいています。測定方法は以下ですべて説明します。EvoLink は本番運用チーム向けの AI モデル基盤を構築しており、ここで測定したモデルもその基盤上で実行されています。
要点
  • minimal は、9 つの本番想定タスクで medium のデフォルト設定より 73.6% 低コストでした。正解数はどちらも 9/9 です。レベルを指定していない場合、これが最も大きなコスト削減余地です。
  • 入力トークンも含めると、medium では思考トークンが請求総額の 75% を占めました。 回答長は 4 レベルでほとんど変わらないため、レベル間のコスト差のほぼすべてが思考トークンによるものです。
  • low の思考予算は固定ではありません。 9 回の構造化抽出すべてで思考トークンが正確にゼロとなり、その部分のコストは minimal と同じでした。一方、ツール呼び出しやコードタスクでは思考トークンを使っています。
  • low より上のレベルで思考量を増やしても、難しいラウンドの正解数は増えませんでした。 minimallowmediumhigh のスコアは、それぞれ 2、10、10、8/15 でした。
  • デフォルト設定が間違っているわけではなく、ワークロードに最適化されていないだけです。 medium は、作業特性がまだ分からない段階での妥当な中間設定です。ワークロードの特性が分かったら、レベルを意図的に指定する価値があります。
  • このモデルの公開されているベンチマークはすべて high で実行されます。一方、API のデフォルトは medium です。これらは異なる請求書と異なるレイテンシです。

レベル別の簡単な答え

思考レベルは、Gemini 3.6 Flash リクエストにおける単一の最大のコスト変数であり、Gemini 3.6 Flash と Gemini 3.5 Flash の間の選択肢よりも大きくなります。思考トークンは出力レートで請求され、デフォルト設定ではその数が回答トークンの数をおよそ 6 対 1 上回ります。

同じ 9 つのタスクを 1 回ずつ実行したときの各レベルのコストと、そのコストが正当化できたタスクを示します。

レベルパスごとのコストmedium デフォルトとの比較こんなときに使います
minimal$0.015873.6% 安くなります抽出、分類、ルーティング、コードの場所、スクリプトに従うだけで済むツールチェーン
low$0.023261.2% 安くなります同じ作業に加えて、モデルが何か問題が発生した場合に回復する必要がある場合の複数ステップのツール呼び出し
medium (デフォルト)$0.0598ベースライントラフィックの形状がまだわかっていないか、作業内容が多すぎて特定できない
high$0.06539.3% 高い用途を限定して使うべきです。私たちのタスクでは追加予算の大半が使われず、難しいラウンドのスコアは medium より低くなりました
ただし、この表だけで minimal があなたのワークロードにも適するとは言えません。私たちのタスクでは問題ありませんでしたが、その内容は以下で具体的に説明します。

誰も公開しない数字: 思考トークンに対する回答トークン

発売日に見つけたこのモデルの価格比較はすべて、出力トークンを 1 つの数字として扱います。これにより、まったく似た動作をしない 2 つの量がマージされ、一度分離すると、このリリースに関する混乱のほとんどが解決されます。

これは 9 つのタスクを通過する 1 つのパスで、出力側が読み取り可能なトークンと読み取りできないトークンに分割されています。

構成回答トークン思考トークン出力に占める思考の割合1回あたりのコスト正答平均レイテンシ
3.6 Flash minimal1,16200%$0.01589/92.8s
3.6 Flash low1,0561,09551%$0.02329/93.3s
3.6 Flash medium (デフォルト)1,0805,94485%$0.05989/95.1s
3.6 Flash high1,0926,67986%$0.06539/95.3s
3.5 Flash medium1,0785,82784%$0.06929/95.1s
3.5 Flash high1,1137,18587%$0.08189/95.7s
3.5 Flash-Lite minimal (デフォルト)97700%$0.00368/91.8s
3.5 Flash-Lite high1,0978,28888%$0.02499/94.2s

まず、回答トークンの列を読んでください。 8 つの構成、2 つのモデル、および 4 つの思考レベルにわたって、977 トークンと 1,162 トークンの間に留まり、列の最大の数値が最も安価な構成に属します。モデルは、最初にどれだけ考えても、ほぼ同じ長さの答えを生成します。

次に、思考トークンの列を見てください。ゼロから 8,288 まで広がっています。これが請求額の全体像です。

これはお金と同じデータで、各パスを入力、答え、思考に対して支払った金額に分割しています。 Gemini 3.6 Flash の標準レベルのレート (入力トークン 100 万個あたり $1.50 および出力トークン 100 万個あたり $7.50) です。

レベル入力回答思考合計料金全体に占める思考の割合
minimal$0.0071$0.0087$0.0000$0.01580%
low$0.0071$0.0079$0.0082$0.023235%
medium$0.0071$0.0081$0.0446$0.059875%
high$0.0071$0.0082$0.0501$0.065377%

デフォルト レベルでは、レベルによって答えが正しいかどうかに違いがなかったタスクについて、支払った金額の 4 分の 3 が、決して見ることのない推論に費やされます。それはモデルの欠陥ではありません。これは、汎用のデフォルトが特定のワークロードを満たすときに起こることです。

これは、「新しいモデルはトークンを節約しますか」という質問が公の場で矛盾した答えを受ける理由も説明します。この主張は出力トークンに関するもので、出力トークンは主に思考トークンであり、思考トークンの数は思考レベルに依存しますが、これについてはほとんど誰も述べていません。レベルが指定されていない測定は再現できません。

これをどのように測定したか

2 ラウンドは、両方のモデルがリリースされた日、2026-07-21 に実行されます。

ラウンド 1: 通常の制作作業にかかるレベルのコスト 3 つずつ 3 つのグループに分かれた 9 つのタスク。請求書、ログ ファイル、製品ページの HTML からの構造化された抽出。シミュレートされた工具に対して 3 ~ 5 つのステップを必要とするマルチターン工具。コードの場所と修復。バグの説明が実行されるパッチになる必要があります。入力はおよそ 1,000 トークンと 4,000 トークンの間で実行されたため、これは通常のリクエスト サイズをカバーしており、ロングコンテキストの作業については何も述べていません。各タスクは、8 つのモデルおよび思考レベルの構成のそれぞれに対して 3 回実行されました: 216 呼び出し、$1.03.
第 2 ラウンド: 実際に品質が損なわれる場所。 私たちは 20 で、矛盾解決、レコード間の相関関係、複数ステップの単位変換、機能間のバグ、およびより長いツールチェーンをカバーする意図的に難しいタスクを作成しました。それぞれを最も弱い構成で 1 回実行し、最も強い構成で 1 回実行して、難易度ごとに並べ替えました。最も弱いタスクが失敗し、最も強いタスクが成功したタスクのみが、レベルが異なる場所に関する情報を保持します。 20 のうち 3 つが適格でした。これら 3 つは、90 呼び出しである 6 つの構成のそれぞれに対して 5 回実行されました。次に、minimal ですべての 20 タスクを 3 回再実行して、並べ替えが保持されているかどうかを確認しました。これは、別の 60 呼び出しです。ラウンド 2 は 190 呼び出しと $1.34. でした。
このページのすべての番号に適用される条件。
  • 呼び出しは Google AI Studio に固定されたプロバイダーを使用して OpenRouter を経由し、同時ではなくシリアルに送信されました。ゲートウェイはどのリージョンがリクエストを処理したかを公開しないため、それを明らかにすることはできません。
  • コストは、ゲートウェイ自体の請求額からではなく、Google の標準階層の定価から計算されます。ゲートウェイは割引レベルでルートするため、この 2 つを混合すると、Google が公開している価格と比較できない数値になります。
  • サンプリングパラメータが設定されていません。 temperaturetop_p、および top_k は Gemini 3.x では非推奨であり、受け入れられてから無視されるため、これらを設定してもドキュメントを読んでいないことを暗示しながら何も変更されません。まだ運用環境で設定している場合は、このリリースの残りのインターフェイス変更については、Gemini 3.6 Flash リリース ガイド で説明されています。
  • 採点は人間によるものではなく、ルールに基づいて行われます。ここでは正確性がサポート指標であり、安いレベルは静かに仕事量が少ないため安く見えるという説明を排除するために存在します。
  • 回答トークンと思考トークンは API 呼び出しごとに個別に記録したため、上の表のように分けて比較できます。
繰り返し実行に関する正直な制限が 1 つあります。 ラウンド 1 を通じて、タスクの 3 回の繰り返しの間で正確さが変わることはありませんでした。すべての構成は実行ごとに同じスコアでした。同じタスクとレベルでも、思考トークンの数は 6% と 51% の間で大きく異なりました。 high の 1 つのコード タスクは、3 つの同一のリクエストに対して 331、538、および 347 思考トークンを返しました。したがって、3 回の実行の平均はコストの数値には必要ですが、正確性の数値には不要です。ラウンド 2 では、タスクがモデルの実行可能範囲の端に位置し、その安定性は完全に失われます。これを脚注ではなく発見として扱います。

公開されているベンチマークがこの質問に答えない理由

誰もこれを調べることができない理由が文書化されています。流通しているベンチマークの数値は、ほとんどの運用トラフィックが実行されないレベルで測定されており、情報筋がそのように述べていることはほとんどありません。

  • Artificial Analysis は、現在、high の考え方で測定された、このモデルの完全な内訳を含む唯一の独立した情報源です。 API のデフォルトは medium です。
  • Gemini 3.5 Flash-Lite の Google 独自の結果テーブルは high の考え方に基づいて作成されましたが、そのモデルの API デフォルトは minimal です。デフォルト構成の実行は、表で説明されている実験ではありません。
  • Google の比較表では、DeepSWE の行は、medium では Gemini 3.5 Flash を実行し、high では Gemini 3.6 Flash を実行するため、その行の 2 つの Gemini の数値は同レベルの比較ではありません。
  • Google の見出し「DeepSWE で 65% まで」は、スコアではなく、トークン使用量の削減を指します。 DeepSWE スコアは 49% です。
最もよく引用される効率性に関する主張にも同様の問題があります。 Google は、独自の測定ではなく Artificial Analysis を引用して、新しいモデルで使用される出力トークンが約 17% 少ないと述べています。同じページで公開される絶対トークン数は、75 百万に対して 59 百万、21.3% になります。この 2 つの数字は公に照合されておらず、どちらも思考レベルやタスクセットについては言及していません。私たちは、その主張が私たちの仕事に登場する場合はどこでも、より保守的な 17% を使用し、それを測定ではなく算術への入力として扱います。

だからといって、公表された数字が間違っているわけではありません。これにより、「実際に走るレベルでどれくらいの費用がかかるか」とは異なる質問に対する答えが得られます。

ラウンド 1: 通常作業のレベル

3 つの結果を重要な順序で示します。

minimal は「思考が少ない」のではなく、「まったく思考しない」ことを意味します。 思考トークンは、小さな値ではなく正確にゼロでした。Gemini 3.6 Flash で行った minimal の全実行では、102 回の呼び出しのうち 101 回で思考トークンが正確にゼロでした。唯一の例外は非常に奇妙だったため、以下に独立したセクションを設けています。同時に、正答率は 9 問中 9 問のままで、レイテンシの中央値は 5.1 秒から 2.8 秒に低下しました。このタスクセットでは、デフォルトレベルによって得られたのは 3.8 倍の請求額と 2 倍遅い応答だけでした。
ここでは、high のコストは medium よりも 9.3% のみです。 追加の予算はほとんど使用されなかったためです。思考は 5,944 から 6,679 トークンに上昇しました。これはこれら 9 つのタスクに関する事実であり、モデルに関するものではありません。本当により多くの推論が必要な仕事を与えれば、差はさらに広がります。この比率を独自の予測に持ち込まないでください。
どちらの新モデル レベルも、Gemini 3.5 Flash の同等レベルよりも安く、 medium では 13.6%、high では 20.1% でした。その節約のほとんどすべては、トークン効率によるものではなく、100 万トークンあたりの出力価格の $9.00 から $7.50 への引き下げによるものです。 medium では、請求された出力トークンは古いモデルに対して 1.7% 上昇し、high では 6.4% 低下しました。トラフィックにも同じことが当てはまるかどうかは、入力対出力の比率によって異なります。これは、入力価格がまったく変化していないためです。また、Gemini 3.5 Flash コスト計算ツール では、古いモデルで実際に動作した例を使ってその算術計算を行っています。

low は適応型であり、小規模な固定予算ではありません

これは私たちが予期していなかった結果であり、このページで最も直接役立つものです。

low では、Gemini 3.6 Flash が 3 つのタスク タイプにわたって不均等に思考を費やしました。パスごとの思考トークン:
タスクグループminimallowmediumhigh
構造化された抽出002,6732,916
マルチターンツール呼び出し05491,7971,914
コードの場所と修復05461,4741,849
3 つの抽出タスクをそれぞれ 3 回実行したすべてのケースで、low の思考トークンは正確にゼロでした。このグループのコストは low が $0.00490、minimal が $0.00489 で、差は 0.2% です。一方、ツール呼び出しとコード修復では、同じ low がタスクあたり 100〜440 の思考トークンを使いました。
実務上の含意は明確です。1 つのモデル設定の背後に抽出タスクと複数ステップのタスクが混在する場合、low は抽出部分を minimal に近いコストで処理しつつ、その他のタスクに思考の余力を残します。大部分の節約を得るためにトラフィックを 2 つの設定に分ける必要はありません。私たちのタスクセットでは、この組み合わせがデフォルトより 61.2% 低コストでした。
スコープに関して 1 つ注意してください。これは、1 日に 9 つのタスクに対して 1 つの設定が実行したことを説明したものであり、Google が説明した動作を文書化したものではありません。観察結果を報告します。私たちは、それを生成するメカニズムを知っているとは主張しません。また、最初に独自のプロンプトと照合せずに抽出を考えずに low に依存するシステムを構築するつもりはありません。

ラウンド 2: 品質が実際に損なわれる箇所

ラウンド 1 では、すべての構成が 9 点中 9 点を獲得したため、品質に関する質問に答えることができませんでした。 9 つのタスクは 4 つのレベルに分けるほど難しくはありませんでした。そこで私たちはレベルを難しくしましたが、返された答えはレベルが示唆するものではありませんでした。

まず、ソート結果ですが、これ自体が発見です。 20 の意図的に困難なタスクのうち、minimal は 3 回中 3 回の試行で 17 を正しく取得しました。請求書の 3 つの数値が一致せず再計算する必要がある矛盾の解決、3 つのインターリーブされた要求レコードを 1 つの失敗チェーンに関連付け、矛盾する契約条項、複数通貨および複数期間に「後で署名した文書が勝つ」メタルールを適用する変換、2 つの関数にまたがるキャッシュ キーのバグ、および 3 回目の呼び出しでのみ発生するレート リミッターのバグです。思考トークンを 1 つも費やすことなく、それらすべてを解決しました。同じタスクのコストは、high での 1,100 と 6,900 の思考トークンの間です。

したがって、少なくともこれらのタスクが占める範囲では、思考レベルによって推論の正しさは買えません。それが買うのはもっと狭いものです。

レベルを分離した 3 つのタスクはすべてマルチターン ツール呼び出しであり、特定の形状を共有していました。つまり、途中で問題が発生し、モデルは元の計画にないアクションを追加する必要がありました。住所が変更される前に小包を傍受してください。レート制限応答後に 1 回再試行します。急ぎのラベルが印刷できなかった場合、出荷を元のラベルに戻します。行動を拒否する必要があるタスク、または提供されたオプションの中から正しく選択する必要があるタスクは、8 ステップの長さの 1 つのチェーンを含め、毎回 minimal で処理されました。

6 つの構成がこれら 3 つのタスク (それぞれ 5 回の試行) でどのようにスコアを獲得したかを次に示します。

構成タスク 1タスク 2タスク 3合計1 回の API 呼び出しあたりのコスト
3.6 Flash minimal1/50/51/52/15$0.00175
3.6 Flash low4/51/55/510/15$0.00553
3.6 Flash medium (デフォルト)5/55/50/510/15$0.00674
3.6 Flash high5/52/51/58/15$0.00739
3.5 Flash-Lite minimal (デフォルト)4/55/50/59/15$0.00068
3.5 Flash-Lite high2/55/53/510/15$0.00262

1 回の API 呼び出しあたりのコストからは、次のセクションで説明する 1 件の異常なリクエストを除外しています。それを含めた合計値は次のセクションに示します。

実際のステップアップは 1 つあり、それは minimal から low です。 15 のうち 2 は 15 のうち 10 になります。その点を超えると、線は平坦になり、その後、10、10、8 と下に曲がります。
タスク別に見ると、合計値ほど単純ではありません。 タスク 1 はレベルが上がるにつれて明確に改善しました。タスク 2 は安定した成功に medium が必要でしたが、high では 2/5 に低下しました。タスク 3 は完全に逆で、low は 5/5、medium は 0/5、high は 1/5 でした。思考量を増やすほど、このタスクの結果は 5 回の試行を通じて一貫して悪化しました。
理由はわかりませんので説明しません。このパターンが裏付けるのは、より限定的でより擁護可能な主張です。つまり、モデルの能力の限界にあるタスクでは、レベルは上げられる品質のダイヤルではありません。 low を超えると、測定した差は、同一の実行間の変動よりも小さくなります。
この不安定性こそ、最も一般化しやすい発見です。 ラウンド 1 では、216 回の呼び出しを通じて、同じタスクの繰り返し間で正解が変わることはありませんでした。ラウンド 2 では、表の大半のセルが 1/5 や 4/5 といった値です。同じリクエストを同じレベルで 5 回送っても、回答は一定しません。各構成を 1 回しか実行しない評価は、ノイズも結果として報告することになります。これは、設計上、各構成を 1 回だけ実行した私たちの難易度分類にも当てはまります。分類後のタスクを minimal で 3 回再実行すると、20 問中 17 問は明確に再現しました。一方、1 回の実行で失敗と判定された 1 問は、再実行では 1/3 の成功でした。これが、ここで説明しているばらつきです。

工学的な結果は、レベルの推奨事項よりも役立ちます。エージェントが予期しない状態から回復する必要がある場合は、アプリケーションに再試行と検証を組み込んで、思考レベルを回復の信頼性を高めるものとしてではなく、コスト設定として扱います。

Gemini 3.6 Flash low 対 Gemini 3.5 Flash-Lite

この比較には、私たちが見つけることができたどこにも公開データはなく、コストを重視するチームが実際に直面している問題です。ほぼ同じ金額で、少し考えてより強力なモデルを実行しますか、それとも、よく考えてより安価なモデルを実行しますか?

ラウンド1ではほぼ同じ費用がかかります。 low の Gemini 3.6 Flash はパスごとに $0.0232 でした。 high の Gemini 3.5 Flash-Lite は $0.0249. 両方とも 9 点中 9 点を獲得しました。 low での Gemini 3.6 Flash は、4.2 秒の平均レイテンシに対して 3.3 秒で高速であり、1,095 思考トークンでそのスコアに達しましたが、Flash-Lite では 8,288 が必要でした。
ラウンド 2 のより難しいツール呼び出しタスクでは、15 のうち 10 で再び同点になりましたが、価格は分かれました: Flash-Lite で high のコスト $0.00553. に対して呼び出しごとに $0.00262 このタスク セットでは、よく考えた安価なモデルのほうが、同じスコアの価格の半分以下でした。

これら 2 つの図のうちどちらがあなたに当てはまるかは、タスクの組み合わせによって決まります。それが、回避策ではなく正直な答えです。 2 つの構成は、両方のラウンドで同じパフォーマンス帯域内にあります。それらの間の価格関係は、タスク セット間で安定していません。

同じデータからさらに 2 つの観測結果が得られます。どちらも、デフォルトの Flash-Lite を使用する前に知っておく価値があります。

Flash-Lite のデフォルトの minimal レベルは、特定の反復可能な方法で 1 つのタスクに失敗しました。 3 段階の通知チェーンでは、最初の 2 つのツールが呼び出され、3 回中 3 回、毎回同じ署名で通知を送信せずに停止しました。これが、ラウンド 1 のすべての 216 呼び出しにおける唯一の品質の違いでした。また、Google ドキュメント自体の制限も再現します。minimal のデフォルトは、ツール呼び出しが途中で終了するため、自律サブエージェントの使用には適さないと説明されています。 Flash-Lite をエージェントとして実行する場合は、レベルを上げるか、その失敗を予期してください。
2 つのモデルの最低レベルは失敗の仕方が異なり、どちらも一様に強いわけではありません。 ラウンド 2 のツール呼び出しタスクでは、minimal の Flash-Lite は 15 のうち 9 点を獲得しましたが、Gemini 3.6 Flash の 15 は 2 点中スコアでした。ラウンド 1 の通知チェーンでは、その関係が逆転しました。minimal の Gemini 3.6 Flash は 3 回中 3 回合格しましたが、Flash-Lite は 3 回中 3 回失敗しました。ここには順序はなく、2 つの異なる障害形状のみであり、一方のモデルのトラフィックで安全なレベルが、もう一方のモデルでも自動的に安全になるわけではありません。

説明できない異常が 1 つあります

ラウンド 2 では、minimal での 1 つの呼び出しにより 62,916 思考トークンが返されました。
データ内の他の minimal 呼び出しはすべて、正確にゼロを返しました。この例では 5 つのツール ターンが使用され、モデルの 65,536-token 出力上限に近い出力が生成され、所要時間は 209 秒、コストは $0.48. でした。これは、そのレベルでの他の呼び出しのコストのおよそ 270 倍であり、その構成が 15-call ラウンド全体で費やした $0.50 のほぼすべてです。 minimal がその特定のタスクを正しく実行したのはこの時だけでした。
私たちがこれを報告しているのは、それが起こったことと、minimal で予算を立てている人にとって重要であるためです。私たちはメカニズムを持っていないので、メカニズムを提供するつもりはありません。 Google のモデル カードには、モデルの既知の制限の中で時折応答が遅いことが記載されていますが、そのメモをこの観察と自信を持って結びつけることはできません。
運用上の重要な点は説明するまでもありません。ツール呼び出し作業で minimal を実行する場合は、出力トークンの最大制限とタイムアウトを設定します。通常、思考トークンを消費しないレベルは、何も消費できないレベルと同じではありません。

タスクごとに選ぶべきレベル

以下が、実務で持ち帰るべき判断表です。各行は上の 2 ラウンドの結果に基づいており、その適用範囲は表の後で説明します。

タスクの種類レベル理由
シングルターンの抽出、分類、質問応答、コードの位置特定、修復minimal意図的に難しくした 20 問中 17 問が 3 回の試行すべてで成功。コストはデフォルトの 26%
計画に従うだけ、またはアクションを拒否するだけの複数ステップのツール呼び出しminimal で十分ですバッチ内の例外の検出、ポリシー違反のリクエストの拒否、信頼できるデータ ソースの選択という 8 つのステップのチェーンは、3 回中 3 回成功しました。
モデルが計画にないアクション (再試行、ロールバック、プリエンプティブ インターセプト) を必要とする可能性がある場合に、複数ステップのツールを呼び出します。少なくとも lowminimal は、まさにこれらに関して 2/15 をスコア付けしました。 low スコア 10/15
同じタスクだが、安定した成功が必要どのレベルでも解決できないlowmediumhigh はそれぞれ 10、10、8/15。差は実行ごとのばらつきより小さいため、アプリケーション側で再試行と検証を行う
1 つの設定で混合トラフィックを処理low抽出タスクでは思考トークンがゼロで、その他のタスク向けの余力も残しつつ、コストはデフォルトより 61.2% 低かった
タスクの構成比がまだ分からないmedium から始めて測定デフォルトは妥当な出発点。不要だと分かった後にのみ、割高な設定になる
この推奨の適用範囲。 根拠は私たちが設計した 29 タスクで、内訳は通常タスク 9 件、難しいタスク 20 件です。入力はすべて約 4,000 トークン未満でした。長文脈タスク、マルチモーダル入力、クリエイティブライティング、オープンエンドな調査は対象外です。タスクセットが異なれば、結果も異なって不思議ではありません。その直接的な例があります。medium で Gemini 3.6 Flash が Gemini 3.5 Flash より多く思考トークンを使うかという問いに対し、aibenchy の独立テストでは 66.2% 多く、私たちのテストでは 2.0% 多いという結果でした。同じ問いでも、彼らの 22 件の短いベンチマーク問題と、私たちの抽出・ツール呼び出し・コードタスクは逆の答えを出しました。これは決着すべき論争ではなく、「思考レベルでトークンを節約できるかは、モデル自体ではなくワークロードの性質で決まる」という発見です。

自分のトラフィックでこれを測定する

4 つのステップを、最も早く答えが得られる順序で示します。

  1. 何かを変更する前に、今すぐ思考トークンを個別に記録してください。 Google の API は、設定したレベルとともに total_thought_tokens のカウントを返します。総出力トークンだけを追跡する場合、今週もっと真剣に考えようと決めたレベルからの即時回帰を区別することはできません。
    from google import genai
    from google.genai import types
    
    client = genai.Client()  # reads the API key from the environment
    
    response = client.models.generate_content(
        model="gemini-3.6-flash",
        contents=prompt,
        config=types.GenerateContentConfig(
            thinking_config=types.ThinkingConfig(thinking_level="minimal"),
        ),
    )
    
    log.info(
        "level=minimal thinking_tokens=%s",
        response.usage_metadata.total_thought_tokens,
    )
思考カウントを既存の出力トークン メトリクスの横に独自のフィールドとして保存し、送信したレベルも一緒に保存します。 2 つのトークン数を合計すると、どちらが移動したかを示す唯一の信号が破棄されます。 2. medium に設定した場合でも、レベルを明示的に設定します。 継承されたデフォルトは、誰も行わなかったコストの決定です。また、デフォルトが変更されると請求書も変更される可能性があることを意味します。 3. **minimal および low で 1 日分の実際のトラフィックを再生し、出力をベンチマークではなく現在のトラフィックと比較します。私たちのタスクでは、その比較は請求額の 61% と 74% の間で価値があり、これはこの層で利用可能などのモデル スワップよりも大きな効果です。 4. ツール呼び出しパスを他のすべてとは別にグレード付けします。 レベル変更の正確性が見つかったのはここだけであり、抽出トラフィックと合わせて平均化すると、それが隠蔽されます。

複数のモデルにわたってその比較を実行することは、通常、ベンダーごとに個別に統合することを意味し、チームが測定を完全にスキップする最も一般的な理由はその統合コストです。 1 つの OpenAI 互換エンドポイントを標準化するとそれが削除されるため、実行間で変更されるのはモデル文字列だけになります。

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.evolink.ai/v1",
    api_key=os.environ["EVOLINK_API_KEY"],
)

for model in ("gemini-3.6-flash", "gemini-3.5-flash-lite"):
    response = client.chat.completions.create(model=model, messages=messages)
    record(model, response.usage)
EvoLink は実稼働チーム用の AI モデル インフラストラクチャであり、この種の測定はその目的の一部です。使用状況はリクエストごとにレポートされるため、最初の実行時から回答と思考の列を分離しておくことができます。比較をどこで実行するかは、比較をまったく実行しないことよりもはるかに重要ではありません。

よくある質問

Gemini 3.6 Flash のデフォルトの思考レベルは何ですか? medium.選択可能な値は、minimallowmedium、および high です。 Gemini 3.5 Flash-Lite のデフォルトは minimal であるため、2 つのモデルはそのままではまったく異なる動作をします。
思考を完全にオフにしてもいいですか? minimal は利用可能な最低の設定であり、Google のドキュメントでは、このモデルでは、スイッチをオフにするものではなく、デフォルトでオンになると考えられると説明されています。実際には、minimal は、102 呼び出しの 101 でまったくゼロの思考トークンを返したため、ほとんどのリクエストで課金目的ではオフとして動作します。 1 つの例外については上記に記載されているため、それを保証として説明しません。
思考トークンには課金されますか? はい、出力料金で課金されます。Google のドキュメントでは、応答の料金は出力トークンと思考トークンの合計とされています。Gemini 3.6 Flash の出力料金は 100 万トークンあたり $7.50 で、デフォルトレベルでは思考トークンが出力トークンの 85% に相当しました。そのため、思考トークンが請求額の大半を占めます。
minimal はデフォルトよりどれくらい安くなりますか? 9 つのタスク セットでは、パスあたり 73.6% 安くなり、正確性は 9/9 と同じで、待ち時間は約半分でした。比率は、作業によってモデルが medium でどの程度思考するかによって決まります。そのため、それを予測するための数値としてではなく、測定する理由として扱います。
思考レベルが高くなると、モデルはより正確になりますか? 私たちの測定範囲では、一貫して正確になるとは言えません。複数ステップのツール呼び出しでは、minimal の 2/15 から low の 10/15 へ明確に改善しました。しかし low より上では、スコアが 10、10、8/15 となり、あるタスクでは各レベル 5 回の試行を通じて、高いレベルほど結果が悪化しました。推論量の多いシングルターンタスクでも、minimal は思考トークンを一切使わずに難問 20 問中 17 問を解きました。
公開されているベンチマークはどの思考レベルを使用していますか? Artificial Analysis は high で公開され、Google の Flash-Lite 結果テーブルも high で生成されましたが、そのモデルの API デフォルトは minimal です。デフォルトを実行すると、これらの数値が示す構成は実行されません。
リクエストで使用された思考トークンの数を確認するにはどうすればよいですか? 応答から total_thought_tokens を読みます。出力トークンを加算するのではなく、出力トークンの隣に独自のフィールドとして記録します。そうしないと、後でコストの変更を帰属させることができなくなります。
思考レベルによって答えの長さは変わりますか? かろうじて。 2 つのモデルと 4 つのレベルをカバーする 8 つの構成にわたって、応答トークンはタスク セットのパスごとに 977 と 1,162 の間に留まりました。レベルによって、モデルがどれだけ書き込むかではなく、応答する前にモデルが何を行うかが変わります。

情報源

AIコストを89%削減する準備はできましたか?

今すぐEvoLinkを始めて、インテリジェントなAPIルーティングの力を体験してください。