GPT Image 2.5 Flare & Sunburst が EvoLink で利用可能にGPT Image 2.5 を試す
Gemini 4 vs Claude Fable 5.1 を表す、メモリタイルと復旧ループを持つ銅と青いガラスのワークフロー
analysis

Gemini 4 vs Claude Fable 5.1:長時間エージェントの選択

EvoLink Team
EvoLink Team
製品チーム
2026年9月16日
26 分
2026 年 9 月 16 日時点で、追加できる Gemini 4 ルートはありません。Claude Fable 5.1 を維持し、将来の Gemini 4 ルートが上回るべきベースラインを記録してください。 2026 年 9 月 16 日時点で、長時間エージェントを運用するチームが Claude Fable 5.1 と比較できる Gemini 4 の実行証拠は存在しません。 Google が確認したのは Gemini 4 の事前学習が開始されたことだけで、パブリック API のエントリ、モデル ID、料金、コンテキストの数値、キャッシュルール、ベンチマークはありません。Claude Fable 5.1 には Anthropic が公開した契約と、設定済みの EvoLink ルートがあります。したがって Tech Lead や FinOps 担当者にとっての判断は「どのモデルでエージェントを動かすべきか」ではなく、「後で Gemini 4 のルートが具体的に証明すべきものを持てるよう、今 Fable 5.1 で何を記録すべきか」です。今日、長時間タスクとコンテキスト再利用のベースラインを取り、新しいルートがトラフィックを得る前に通過すべきゲートを書き出してください。
本記事が担当するのは 1 つの判断、この 2 モデル間の長時間エージェントの選択です。リリースタイムラインの問いは Gemini 4 リリーストラッカー に、現在の API ステータスは Gemini 4 ページ に、OpenAI 側は Gemini 4 vs GPT-6 Astra に、そしてリリース済みの 2 つのフロンティアモデルの比較は Claude Fable 5.1 vs GPT-6 Astra にあり、そこには本記事で繰り返さない価格付きのキャッシュ計算例がすでに載っています。

ステータスと証拠の表

質問Gemini 4Claude Fable 5.1安全な判断
公式ステータスGoogle が事前学習を確認(2026 年 7 月)Anthropic が 2026 年 9 月 1 日にリリース。Active(latest)と表記ギャップはステータスのギャップであり、能力の判定ではないと扱う
API モデル ID未公表claude-fable-5-1(Anthropic)未公表の ID を設定やコードに決して置かない
コンテキストと最大出力未公表1M コンテキスト。最大出力 128K(Anthropic)トレースが実際にウィンドウのどれだけを消費するかを記録する
入力モダリティ未公表テキストと画像入力、テキスト出力(Anthropic)テスト前に各ワークロードが必要とするモダリティを列挙する
思考の制御未公表adaptive thinking 常時オン。デフォルト effort は high。相対レイテンシは Slower と表記(Anthropic)後のルートを同じ設定でテストできるよう、トレースごとに effort 設定を記録する
キャッシュ料金の構造未公表100 万トークンあたり入力 $10 / 出力 $50。5 分キャッシュ書き込み $12.50。1 時間キャッシュ書き込み $20。キャッシュ読み取り $0.25(Anthropic 定価)両側が TTL と料金を公開するまでキャッシュ経済性は比較できない
Batch の提供未公表Anthropic は Batch の入力と出力を標準の 50% と掲載Standard は Standard と、Batch は Batch と比較する
文書化された非互換変更未公表Anthropic の移行ガイドに 3 件:強制 tool choice のエラー、古いモデルと 5.1 thinking ブロックの非互換、以前のターン編集後の thinking ブロック無効化公開された非互換変更のリストはテスト可能で、存在しないものはテストできない
EvoLink ルート検証済みの呼び出し可能なルートなし。公開通知を受付中設定済みルート claude-fable-5-1。料金は製品ページどのルートでも最初のリクエストで返却モデル識別子を検証する

Gemini 4 の列は批判ではなく、測定できるものの一覧です。すべての「未公表」セルは、ハーネスにすでに枠があるべきフィールドで、契約が公開されたら再設計を強いられるのではなく値が埋まるようにしておきます。

評価に値する長時間タスクはどれか

長時間エージェントの仕事は 1 種類のワークロードではありません。チームが Fable 5.1 にルーティングするトレースの大半は 5 つのタスク種別でカバーでき、それぞれに「合格」の定義があります。種別ごとにベースラインを記録し、将来の Gemini 4 ルートも種別ごとに判定してください。

ワークロード「合格」の意味今 Fable 5.1 で記録すべきこと後に Gemini 4 ルートが揃えるべきもの
複数ファイルにわたるリポジトリ修復テストが通り、差分がレビューされ、無関係なファイルに触れていない読み書きしたファイル、ツール呼び出し、リトライ、レビュアーの所要時間(分)、合格修正あたりのトークン同じタスクセット、テストスイート、レビュアーのルーブリック
多段階のリサーチとナレッジ成果物引用が解決し、構成がブリーフに合い、裏づけのない主張がない取得したソース、要求された修正回数、成果物あたりの事実訂正同じブリーフとファクトチェックの手順
数時間に及ぶツールループ停止条件で終了し、最終状態が有効ループ回数、失敗したツール呼び出し、チェックポイント、再開イベント、終了までの実時間同じツール、権限、リトライ予算、停止ルール
長文ドキュメントからの構造化抽出出力がスキーマに適合し、サンプリングしたフィールドがソースと一致ドキュメント長、スキーマ失敗、再実行、固定サンプルでのフィールド精度同じドキュメント、スキーマ、サンプル
カスタマーサービスの多段階ツールフロー人によるエスカレーションなしにポリシー内でチケットが解決エスカレーション、誤ツール呼び出し、ポリシー違反、処理時間同じフロー定義とポリシーチェック

同条件の実行が存在しないため、どの行も推奨モデルを挙げていません。この表は、2 つ目のルートが利用可能になったとき「同じタスク」が何を意味するかを固定するだけです。

コンテキスト再利用とキャッシュ条件

長時間エージェントは毎ターン同じリポジトリマップ、ツールスキーマ、指示を再送するため、キャッシュ料金がトークン請求を支配します。同時に、比較の中で今日始められない部分でもあります。

Google は Gemini 4 のキャッシュ TTL、書き込みと読み取りの料金、キャッシュの範囲(自動プレフィックスキャッシュか明示的なキャッシュオブジェクトか)、最小キャッシュ可能サイズを公表していません。この 4 つの値がなければ分母がありません。5 分キャッシュの読み取りと 1 時間の読み取りは別の製品であり、リクエストごとのプレフィックスキャッシュと複数エージェントが共有する名前付きキャッシュも別の製品です。異なる TTL、コンテキスト範囲、バッチモードを 1 つの数字に混ぜることはできません。

Fable 5.1 は記録の枠組みを与えてくれます。Anthropic は 100 万トークンあたり 5 分キャッシュ書き込み $12.50、1 時間書き込み $20、キャッシュ読み取り $0.25、Batch は標準入力・出力の 50% と文書化しています。すべての Fable トレースについて次を記録してください。

  • どの TTL を選び、なぜか(5 分未満のターン間隔か、1 時間書き込みを正当化する間隔か)。
  • キャッシュ済みプレフィックスのサイズと、タスク途中で変わった頻度。プレフィックスが変わると新しい書き込みが発生する。
  • ターンごとのキャッシュ読み取りトークンと新規入力トークン。
  • トレースが Standard か Batch か、そして実行時点で Anthropic の料金ページが Batch とキャッシュ倍率をどう組み合わせていたか。
これらのフィールドは月単位ではなくトレース単位で保持してください。Gemini 4 がキャッシュ契約を公開したとき、異なる対象を記述する 2 つの定価を比べるのではなく、どのトレースがそのキャッシュの対象になり得るかが分かります。Fable 5.1 の EvoLink 料金は製品ページにあります。

リトライ、復旧、人による引き継ぎのコスト

これは仕様表には決して現れない層であり、長時間エージェントの予算の大半が実際に失われる場所です。人が詰まりを解消した後に 3 回目の試行で完了したトレースは、1 回で完了したトレースと同じコストではありません。トレースごとに 6 つのイベントを、タイムスタンプとトークン数とともに記録してください。

  1. ループ検出。 同じ引数の同じツール呼び出しが、事前に設定したしきい値を超えて繰り返されること。停止ルールが発動するまでに何ターン消費したかを記録する。
  2. 失敗したツール呼び出し。 プロバイダー側エラー、ツール側エラー、モデル側の不正な呼び出しを分ける。モデル品質のシグナルは 3 つ目だけで、他の 2 つは新しいルートも同様に払うインフラコスト。
  3. チェックポイントの整合性。 保存した各状態が実際にタスクを復元できるか検証する。再開できないチェックポイントは無駄な出力に加えて完全な再実行を意味する。
  4. 中断後の再開。 レート制限、タイムアウト、オペレーターの一時停止の後にコンテキストを再構築するために費やしたトークンを、初回実行トークンとは別に数える。
  5. thinking ブロックの無効化。 Anthropic の移行ガイドは、以前のターンを編集すると保持された Fable 5.1 の thinking ブロックが無効になると文書化している。圧縮や修正のために履歴を書き換えるフレームワークはこれを引き起こす。頻度と再思考のコストを記録する。Gemini 4 に同等のルールがあるかは公表されていない。
  6. 人による引き継ぎ。 タスクの詰まり解消、修正、仕上げに費やしたレビュアーの所要時間(分)を時間として記録し、API 合計の中に消えないようにする。

これらは別のインシデントログではなく、トレース記録のフィールドとして保存してください。合格タスク単価が意味を持つのは、リトライ、再開、レビュアーの所要時間(分)がトークンと同じタスク ID に載っているときだけです。

タスクの総コスト変数表

以下のすべての数値の分母は、完了して受け入れを通過したタスクです。完了したがレビューに落ちたタスクは支出には含まれます(支払ったので)が、分母には含まれません。API 支出と人の時間は別の列に置き、分数を金額に換算するのは報告層でのみ、財務チームが所有するレートで行います。

変数今日 Fable 5.1 で記録する方法Gemini 4 の状況
入力トークンターンごとの新規(非キャッシュ)入力を、EvoLink が返す usage カウンターからタスク単位で合計契約公開まで不明
キャッシュ書き込み書き込んだトークンを 5 分と 1 時間の TTL で分け、タスクごとの書き込み回数とともに契約公開まで不明
キャッシュ読み取りタスクごとにキャッシュから提供されたトークン。ヒット率(キャッシュ読み取り / (キャッシュ読み取り + 新規入力))も記録契約公開まで不明
出力トークン最終回答と中間のツール引数を、タスク単位で合計契約公開まで不明
ツール呼び出しと外部コストタスクごとの回数と、従量課金コスト(検索、コード実行、サードパーティ API)契約公開まで不明
リトライ初回以降の試行と試行ごとのトークンを、同じタスク ID に紐づけて契約公開まで不明
フォールバックルートの使用いずれかのターンが別モデルで提供されたか、どのモデルかを、返却された model フィールドで検証契約公開まで不明
人によるレビュー時間(分)タスクごとのレビュアーとオペレーターの時間を分数で記録ルートが存在すれば自分の実行で測定する値。ベンダーが公開する数値ではない
受け入れまでの実時間タスク開始から合格結果までの時間。待ち時間と人のターンを含むルートが存在すれば自分の実行で測定する値。ベンダーが公開する数値ではない
合格タスク率期間内のワークロード種別ごとの合格タスク数 / 試行タスク数ルートが存在すれば自分の実行で測定する値。ベンダーが公開する数値ではない

合格タスク単価は API 支出を合格タスク数で割ったもので、合格タスクあたりのレビュー分数と並べて報告します。前者を下げて後者を上げるルートはコストを削減したのではなく、コストを人に移しただけです。

完了品質の受け入れ

1 つのモデルにしか機能しない受け入れルーブリックは、ルーブリックではなく好みです。モデルが変わっても生き残る受け入れを構築してください。

  • 客観的なチェックを最初に。 テストが通る、スキーマが検証される、引用が解決する、差分が宣言したファイルのみに触れる。二値であり、すべてのトレースで安価に実行できる。
  • レビュアーのルーブリックを次に。 ワークロード種別ごとの短い固定チェックリスト(正確性、完全性、安全性、ブリーフへの準拠)を、どのルートが出力を生成したか知らないレビュアーが採点する。
  • 反復実行。 各タスクを複数回実行し、合格タスク率を範囲として報告する。1 回の成功を能力として昇格させないため。
  • 不確実性の報告。 すべての結果の隣にサンプルサイズ、設定(effort、ツール、TTL)、失敗リストを公開する。サンプルサイズのない率は証拠ではない。

ルーブリックは Gemini 4 へのアクセスが存在する前に書いてください。後から書けば、新しいルートが偶然得意なことに合わせて曲がります。

シャドートラフィックとロールバック計画

Gemini 4 のルートがいずれ存在したとき、それは他のあらゆる新ルートと同じ 3 段階を通って入るべきで、その間ずっと Fable 5.1 を測定済みベースラインとして保持します。

  1. リプレイ。 記録済みの Fable 5.1 トレースを候補にオフラインで与え、同一入力での合格タスク率と合格タスク単価を比較する。
  2. シャドー。 実リクエストを両ルートに送り、Fable 5.1 の回答を提供し、候補を静かに採点する。ユーザーに露出せずにループとツールエラーを表面化させる。
  3. カナリア。 1 つのワークロード種別を小さな割合でルーティングし、観測期間を通じてゲートが維持される場合のみ拡大する。

テスト開始前に設定する昇格ゲート:合格タスク率がベースライン以上、受け入れまでの p95 実時間が合意した範囲内、リトライとフォールバックを含む合格タスク単価がベースライン以下、期間内にそのワークロード種別でインシデントゼロ。

ロールバックのトリガー:いずれかのゲートが合意した連続日数にわたって失敗、または顧客に到達するインシデント 1 件。ロールバックはコードのデプロイではなくゲートウェイ設定の変更であり、それがモデル選択をアプリケーションコードではなくルーティング設定に置くべき理由です。

「返却モデル識別子」の検証とは、すべてのレスポンスの model フィールドと usage カウンターを読み、設定したルートと一致するか確認することです。ゲートウェイ上では、リクエストが要求したモデルで提供され、フォールバックに黙って置き換えられていないことを確認できます。新しいルートへの最初のリクエストで行い、シャドー中は継続的に行い、結果をコスト表のフォールバックルートのフィールドに記録してください。

進歩とはみなさないもの

  • 完了した長時間タスクの実績を伴わない、噂のより大きな Gemini 4 コンテキストウィンドウ。
  • リトライ、再開、より長い出力、追加のレビュー分数で相殺される、より低い見出し価格。
  • 設定、サンプルサイズ、再現可能なタスクセットのない、リークされたベンチマークのスクリーンショットやサードパーティの仕様表。
  • 新しい名前を掲げながら、古いモデルや不透明なフォールバックを返すルート。
  • 反復実行や観測期間全体で消える、1 日限りの合格タスク率の上振れ。

これらの却下ルールを今、受け入れルーブリックと同じドキュメントに書いてください。この手順を省くチームは、最初の刺激的な結果に合わせて成功を再定義しがちです。

EvoLink で Claude Fable 5.1 を評価 Gemini 4 API の提供状況を追跡

FAQ

エージェント用途で Gemini 4 のコストが Claude Fable 5.1 より低いと、今日誰かが証明できますか?

いいえ。2026 年 9 月 16 日時点で Google は Gemini 4 の料金、キャッシュルール、コンテキストウィンドウ、API エントリを公表していないため、どちらの方向のコスト主張にも公開された分母がありません。後の主張を照合できるよう、今 Fable 5.1 の合格タスク単価を記録してください。

キャッシュ料金をプロバイダー間で直接比較できますか?

単一の数字としては不可です。キャッシュ読み取りが比較可能になるのは、TTL、キャッシュ範囲(プレフィックスか明示的か)、最小キャッシュ可能サイズ、Standard か Batch かのモードがすべて一致したときだけです。Anthropic は Fable 5.1 の 5 分と 1 時間の書き込みティアと読み取り料金を文書化していますが、Gemini 4 はこれらのどれも公開していません。

失敗した長時間タスクのコストはどう数えますか?

すべての試行、再開、レビュアーの所要時間(分)を同じタスク ID に紐づけます。失敗した、または受け入れられなかったタスクは総支出には残りますが、合格タスクの分母には入れません。合格タスクあたりの API 支出と合格タスクあたりのレビュー分数は 2 つの数値として報告し、決して合算しません。

Gemini 4 が公開していない機能はどう記録すべきですか?

「[日付]時点で未公表」という値でフィールドを作ります。Gemini 3.x の値、リークされた数字、ゼロで埋めないでください。Google が契約を公開したらプレースホルダーを置き換え、変更日を記録して過去の比較が誠実なままになるようにします。

新しいルートをテストしながら、検証済みの Claude ベースラインを維持するには?

候補がリプレイ、シャドー、カナリアを通過する間、Fable 5.1 のルートを設定済みのまま稼働させ続けます。テスト前にタスクセット、ルーブリック、評価者を凍結し、ベースラインの数値を日付と設定とともに保存してください。テスト中に動くベースラインはベースラインではありません。Anthropic はほとんどのワークロードを Claude Opus 5 で始め、要求の厳しい推論や長時間の作業に Fable 5.1 を温存することを推奨しているので、ベースラインが実際にどの Claude ルートかを明記してください。
EvoLink には claude-fable-5-1 という名前の設定済みルートがあります。本番トラフィックをルーティングする前に、最初のリクエストで返却モデル識別子と usage カウンターを検証し、Claude Fable 5.1 製品ページで現在の料金を確認してください。ゲートウェイでの提供は本番判定ではなく、判定はあなた自身のリプレイ、シャドー、カナリアの結果から来ます。

情報源

証拠の最終確認日:2026 年 9 月 16 日。Anthropic の事実は Anthropic のドキュメントに、Google の事実は Google の公式ブログと Gemini API ドキュメントに基づきます。Gemini 4 にはパブリック API も EvoLink ルートもありません。

AIコストを89%削減する準備はできましたか?

今すぐEvoLinkを始めて、インテリジェントなAPIルーティングの力を体験してください。