
Gemini 4 vs Claude Fable 5.1:長時間エージェントの選択
ステータスと証拠の表
| 質問 | Gemini 4 | Claude Fable 5.1 | 安全な判断 |
|---|---|---|---|
| 公式ステータス | Google が事前学習を確認(2026 年 7 月) | Anthropic が 2026 年 9 月 1 日にリリース。Active(latest)と表記 | ギャップはステータスのギャップであり、能力の判定ではないと扱う |
| API モデル ID | 未公表 | claude-fable-5-1(Anthropic) | 未公表の ID を設定やコードに決して置かない |
| コンテキストと最大出力 | 未公表 | 1M コンテキスト。最大出力 128K(Anthropic) | トレースが実際にウィンドウのどれだけを消費するかを記録する |
| 入力モダリティ | 未公表 | テキストと画像入力、テキスト出力(Anthropic) | テスト前に各ワークロードが必要とするモダリティを列挙する |
| 思考の制御 | 未公表 | adaptive thinking 常時オン。デフォルト effort は high。相対レイテンシは Slower と表記(Anthropic) | 後のルートを同じ設定でテストできるよう、トレースごとに effort 設定を記録する |
| キャッシュ料金の構造 | 未公表 | 100 万トークンあたり入力 $10 / 出力 $50。5 分キャッシュ書き込み $12.50。1 時間キャッシュ書き込み $20。キャッシュ読み取り $0.25(Anthropic 定価) | 両側が TTL と料金を公開するまでキャッシュ経済性は比較できない |
| Batch の提供 | 未公表 | Anthropic は Batch の入力と出力を標準の 50% と掲載 | Standard は Standard と、Batch は Batch と比較する |
| 文書化された非互換変更 | 未公表 | Anthropic の移行ガイドに 3 件:強制 tool choice のエラー、古いモデルと 5.1 thinking ブロックの非互換、以前のターン編集後の thinking ブロック無効化 | 公開された非互換変更のリストはテスト可能で、存在しないものはテストできない |
| EvoLink ルート | 検証済みの呼び出し可能なルートなし。公開通知を受付中 | 設定済みルート claude-fable-5-1。料金は製品ページ | どのルートでも最初のリクエストで返却モデル識別子を検証する |
Gemini 4 の列は批判ではなく、測定できるものの一覧です。すべての「未公表」セルは、ハーネスにすでに枠があるべきフィールドで、契約が公開されたら再設計を強いられるのではなく値が埋まるようにしておきます。
評価に値する長時間タスクはどれか
長時間エージェントの仕事は 1 種類のワークロードではありません。チームが Fable 5.1 にルーティングするトレースの大半は 5 つのタスク種別でカバーでき、それぞれに「合格」の定義があります。種別ごとにベースラインを記録し、将来の Gemini 4 ルートも種別ごとに判定してください。
| ワークロード | 「合格」の意味 | 今 Fable 5.1 で記録すべきこと | 後に Gemini 4 ルートが揃えるべきもの |
|---|---|---|---|
| 複数ファイルにわたるリポジトリ修復 | テストが通り、差分がレビューされ、無関係なファイルに触れていない | 読み書きしたファイル、ツール呼び出し、リトライ、レビュアーの所要時間(分)、合格修正あたりのトークン | 同じタスクセット、テストスイート、レビュアーのルーブリック |
| 多段階のリサーチとナレッジ成果物 | 引用が解決し、構成がブリーフに合い、裏づけのない主張がない | 取得したソース、要求された修正回数、成果物あたりの事実訂正 | 同じブリーフとファクトチェックの手順 |
| 数時間に及ぶツールループ | 停止条件で終了し、最終状態が有効 | ループ回数、失敗したツール呼び出し、チェックポイント、再開イベント、終了までの実時間 | 同じツール、権限、リトライ予算、停止ルール |
| 長文ドキュメントからの構造化抽出 | 出力がスキーマに適合し、サンプリングしたフィールドがソースと一致 | ドキュメント長、スキーマ失敗、再実行、固定サンプルでのフィールド精度 | 同じドキュメント、スキーマ、サンプル |
| カスタマーサービスの多段階ツールフロー | 人によるエスカレーションなしにポリシー内でチケットが解決 | エスカレーション、誤ツール呼び出し、ポリシー違反、処理時間 | 同じフロー定義とポリシーチェック |
同条件の実行が存在しないため、どの行も推奨モデルを挙げていません。この表は、2 つ目のルートが利用可能になったとき「同じタスク」が何を意味するかを固定するだけです。
コンテキスト再利用とキャッシュ条件
長時間エージェントは毎ターン同じリポジトリマップ、ツールスキーマ、指示を再送するため、キャッシュ料金がトークン請求を支配します。同時に、比較の中で今日始められない部分でもあります。
Google は Gemini 4 のキャッシュ TTL、書き込みと読み取りの料金、キャッシュの範囲(自動プレフィックスキャッシュか明示的なキャッシュオブジェクトか)、最小キャッシュ可能サイズを公表していません。この 4 つの値がなければ分母がありません。5 分キャッシュの読み取りと 1 時間の読み取りは別の製品であり、リクエストごとのプレフィックスキャッシュと複数エージェントが共有する名前付きキャッシュも別の製品です。異なる TTL、コンテキスト範囲、バッチモードを 1 つの数字に混ぜることはできません。
Fable 5.1 は記録の枠組みを与えてくれます。Anthropic は 100 万トークンあたり 5 分キャッシュ書き込み $12.50、1 時間書き込み $20、キャッシュ読み取り $0.25、Batch は標準入力・出力の 50% と文書化しています。すべての Fable トレースについて次を記録してください。
- どの TTL を選び、なぜか(5 分未満のターン間隔か、1 時間書き込みを正当化する間隔か)。
- キャッシュ済みプレフィックスのサイズと、タスク途中で変わった頻度。プレフィックスが変わると新しい書き込みが発生する。
- ターンごとのキャッシュ読み取りトークンと新規入力トークン。
- トレースが Standard か Batch か、そして実行時点で Anthropic の料金ページが Batch とキャッシュ倍率をどう組み合わせていたか。
リトライ、復旧、人による引き継ぎのコスト
これは仕様表には決して現れない層であり、長時間エージェントの予算の大半が実際に失われる場所です。人が詰まりを解消した後に 3 回目の試行で完了したトレースは、1 回で完了したトレースと同じコストではありません。トレースごとに 6 つのイベントを、タイムスタンプとトークン数とともに記録してください。
- ループ検出。 同じ引数の同じツール呼び出しが、事前に設定したしきい値を超えて繰り返されること。停止ルールが発動するまでに何ターン消費したかを記録する。
- 失敗したツール呼び出し。 プロバイダー側エラー、ツール側エラー、モデル側の不正な呼び出しを分ける。モデル品質のシグナルは 3 つ目だけで、他の 2 つは新しいルートも同様に払うインフラコスト。
- チェックポイントの整合性。 保存した各状態が実際にタスクを復元できるか検証する。再開できないチェックポイントは無駄な出力に加えて完全な再実行を意味する。
- 中断後の再開。 レート制限、タイムアウト、オペレーターの一時停止の後にコンテキストを再構築するために費やしたトークンを、初回実行トークンとは別に数える。
- thinking ブロックの無効化。 Anthropic の移行ガイドは、以前のターンを編集すると保持された Fable 5.1 の thinking ブロックが無効になると文書化している。圧縮や修正のために履歴を書き換えるフレームワークはこれを引き起こす。頻度と再思考のコストを記録する。Gemini 4 に同等のルールがあるかは公表されていない。
- 人による引き継ぎ。 タスクの詰まり解消、修正、仕上げに費やしたレビュアーの所要時間(分)を時間として記録し、API 合計の中に消えないようにする。
これらは別のインシデントログではなく、トレース記録のフィールドとして保存してください。合格タスク単価が意味を持つのは、リトライ、再開、レビュアーの所要時間(分)がトークンと同じタスク ID に載っているときだけです。
タスクの総コスト変数表
以下のすべての数値の分母は、完了して受け入れを通過したタスクです。完了したがレビューに落ちたタスクは支出には含まれます(支払ったので)が、分母には含まれません。API 支出と人の時間は別の列に置き、分数を金額に換算するのは報告層でのみ、財務チームが所有するレートで行います。
| 変数 | 今日 Fable 5.1 で記録する方法 | Gemini 4 の状況 |
|---|---|---|
| 入力トークン | ターンごとの新規(非キャッシュ)入力を、EvoLink が返す usage カウンターからタスク単位で合計 | 契約公開まで不明 |
| キャッシュ書き込み | 書き込んだトークンを 5 分と 1 時間の TTL で分け、タスクごとの書き込み回数とともに | 契約公開まで不明 |
| キャッシュ読み取り | タスクごとにキャッシュから提供されたトークン。ヒット率(キャッシュ読み取り / (キャッシュ読み取り + 新規入力))も記録 | 契約公開まで不明 |
| 出力トークン | 最終回答と中間のツール引数を、タスク単位で合計 | 契約公開まで不明 |
| ツール呼び出しと外部コスト | タスクごとの回数と、従量課金コスト(検索、コード実行、サードパーティ API) | 契約公開まで不明 |
| リトライ | 初回以降の試行と試行ごとのトークンを、同じタスク ID に紐づけて | 契約公開まで不明 |
| フォールバックルートの使用 | いずれかのターンが別モデルで提供されたか、どのモデルかを、返却された model フィールドで検証 | 契約公開まで不明 |
| 人によるレビュー時間(分) | タスクごとのレビュアーとオペレーターの時間を分数で記録 | ルートが存在すれば自分の実行で測定する値。ベンダーが公開する数値ではない |
| 受け入れまでの実時間 | タスク開始から合格結果までの時間。待ち時間と人のターンを含む | ルートが存在すれば自分の実行で測定する値。ベンダーが公開する数値ではない |
| 合格タスク率 | 期間内のワークロード種別ごとの合格タスク数 / 試行タスク数 | ルートが存在すれば自分の実行で測定する値。ベンダーが公開する数値ではない |
合格タスク単価は API 支出を合格タスク数で割ったもので、合格タスクあたりのレビュー分数と並べて報告します。前者を下げて後者を上げるルートはコストを削減したのではなく、コストを人に移しただけです。
完了品質の受け入れ
1 つのモデルにしか機能しない受け入れルーブリックは、ルーブリックではなく好みです。モデルが変わっても生き残る受け入れを構築してください。
- 客観的なチェックを最初に。 テストが通る、スキーマが検証される、引用が解決する、差分が宣言したファイルのみに触れる。二値であり、すべてのトレースで安価に実行できる。
- レビュアーのルーブリックを次に。 ワークロード種別ごとの短い固定チェックリスト(正確性、完全性、安全性、ブリーフへの準拠)を、どのルートが出力を生成したか知らないレビュアーが採点する。
- 反復実行。 各タスクを複数回実行し、合格タスク率を範囲として報告する。1 回の成功を能力として昇格させないため。
- 不確実性の報告。 すべての結果の隣にサンプルサイズ、設定(effort、ツール、TTL)、失敗リストを公開する。サンプルサイズのない率は証拠ではない。
ルーブリックは Gemini 4 へのアクセスが存在する前に書いてください。後から書けば、新しいルートが偶然得意なことに合わせて曲がります。
シャドートラフィックとロールバック計画
Gemini 4 のルートがいずれ存在したとき、それは他のあらゆる新ルートと同じ 3 段階を通って入るべきで、その間ずっと Fable 5.1 を測定済みベースラインとして保持します。
- リプレイ。 記録済みの Fable 5.1 トレースを候補にオフラインで与え、同一入力での合格タスク率と合格タスク単価を比較する。
- シャドー。 実リクエストを両ルートに送り、Fable 5.1 の回答を提供し、候補を静かに採点する。ユーザーに露出せずにループとツールエラーを表面化させる。
- カナリア。 1 つのワークロード種別を小さな割合でルーティングし、観測期間を通じてゲートが維持される場合のみ拡大する。
テスト開始前に設定する昇格ゲート:合格タスク率がベースライン以上、受け入れまでの p95 実時間が合意した範囲内、リトライとフォールバックを含む合格タスク単価がベースライン以下、期間内にそのワークロード種別でインシデントゼロ。
ロールバックのトリガー:いずれかのゲートが合意した連続日数にわたって失敗、または顧客に到達するインシデント 1 件。ロールバックはコードのデプロイではなくゲートウェイ設定の変更であり、それがモデル選択をアプリケーションコードではなくルーティング設定に置くべき理由です。
model フィールドと usage カウンターを読み、設定したルートと一致するか確認することです。ゲートウェイ上では、リクエストが要求したモデルで提供され、フォールバックに黙って置き換えられていないことを確認できます。新しいルートへの最初のリクエストで行い、シャドー中は継続的に行い、結果をコスト表のフォールバックルートのフィールドに記録してください。進歩とはみなさないもの
- 完了した長時間タスクの実績を伴わない、噂のより大きな Gemini 4 コンテキストウィンドウ。
- リトライ、再開、より長い出力、追加のレビュー分数で相殺される、より低い見出し価格。
- 設定、サンプルサイズ、再現可能なタスクセットのない、リークされたベンチマークのスクリーンショットやサードパーティの仕様表。
- 新しい名前を掲げながら、古いモデルや不透明なフォールバックを返すルート。
- 反復実行や観測期間全体で消える、1 日限りの合格タスク率の上振れ。
これらの却下ルールを今、受け入れルーブリックと同じドキュメントに書いてください。この手順を省くチームは、最初の刺激的な結果に合わせて成功を再定義しがちです。
EvoLink で Claude Fable 5.1 を評価 Gemini 4 API の提供状況を追跡FAQ
エージェント用途で Gemini 4 のコストが Claude Fable 5.1 より低いと、今日誰かが証明できますか?
いいえ。2026 年 9 月 16 日時点で Google は Gemini 4 の料金、キャッシュルール、コンテキストウィンドウ、API エントリを公表していないため、どちらの方向のコスト主張にも公開された分母がありません。後の主張を照合できるよう、今 Fable 5.1 の合格タスク単価を記録してください。
キャッシュ料金をプロバイダー間で直接比較できますか?
単一の数字としては不可です。キャッシュ読み取りが比較可能になるのは、TTL、キャッシュ範囲(プレフィックスか明示的か)、最小キャッシュ可能サイズ、Standard か Batch かのモードがすべて一致したときだけです。Anthropic は Fable 5.1 の 5 分と 1 時間の書き込みティアと読み取り料金を文書化していますが、Gemini 4 はこれらのどれも公開していません。
失敗した長時間タスクのコストはどう数えますか?
すべての試行、再開、レビュアーの所要時間(分)を同じタスク ID に紐づけます。失敗した、または受け入れられなかったタスクは総支出には残りますが、合格タスクの分母には入れません。合格タスクあたりの API 支出と合格タスクあたりのレビュー分数は 2 つの数値として報告し、決して合算しません。
Gemini 4 が公開していない機能はどう記録すべきですか?
「[日付]時点で未公表」という値でフィールドを作ります。Gemini 3.x の値、リークされた数字、ゼロで埋めないでください。Google が契約を公開したらプレースホルダーを置き換え、変更日を記録して過去の比較が誠実なままになるようにします。
新しいルートをテストしながら、検証済みの Claude ベースラインを維持するには?
Fable 5.1 は今 EvoLink で利用できますか?
claude-fable-5-1 という名前の設定済みルートがあります。本番トラフィックをルーティングする前に、最初のリクエストで返却モデル識別子と usage カウンターを検証し、Claude Fable 5.1 製品ページで現在の料金を確認してください。ゲートウェイでの提供は本番判定ではなく、判定はあなた自身のリプレイ、シャドー、カナリアの結果から来ます。情報源
- Anthropic:Claude Fable 5.1 モデル概要
- Anthropic:Claude Fable 5.1 移行ガイド
- Anthropic:料金、キャッシュ TTL、Batch
- Anthropic:Claude Fable 5.1 発表
- Anthropic:Claude Fable 製品ページ
- Anthropic:モデルの非推奨化
- Google:Alphabet 2026 年第 2 四半期決算に関する CEO メッセージ
- Google:Gemini 3.6 Flash 発表
- Google:Gemini API モデルカタログ
- EvoLink:Gemini 4 API ステータス
- EvoLink:Claude Fable 5.1
- EvoLink:Gemini 4 リリーストラッカー
- EvoLink:Claude Fable 5.1 vs GPT-6 Astra


