MiniMax H3(Hailuo 3)が EvoLink に登場無料10クレジットで試す
Grok 4.6とGrok 4.5を推論、ツール信頼性、コスト、本番導入基準で比較
比較

Grok 4.6 vs Grok 4.5:ポストトレーニング強化で移行価値はある?

EvoLink Team
EvoLink Team
Product Team
2026年7月30日
36 分

Grok 4.6がGrok 4.5より優れた移行先だとは、まだ証明されていません。 現在報告されている中心的な変更は、教師ありファインチューニングと強化学習の強化です。モデル規模を拡大せずに推論の信頼性を高める可能性はありますが、Grok 4.6の公開後に同条件の本番テストを通過するまでは移行の根拠になりません。

EvoLinkユーザーは、Grok 4.5を測定可能な基準として残し、同じ条件で比較できる評価を準備するのが適切です。Grok 4.6への移行は、合格する成果物が増え、レイテンシ、ツール信頼性、コストが悪化しないワークロードに限定します。

公開予定日とAPIの最新状況は、Grok 4.6リリース追跡で確認できます。

決定の概要

現在の状況今取るべき判断理由
Grok 4.5が安定しており、合格基準を満たしているGrok 4.5を評価基準として維持するGrok 4.6には検証済みのAPI挙動も同条件の比較結果もない
計画ミスや指示からの逸脱で、コーディング/エージェントタスクが失敗している公開後、優先的にGrok 4.6を試すポストトレーニングの改善が最も表れやすい失敗パターンだから
Grok 4.6がAPIで利用可能になる前に本番モデルが必要現時点で検証済みのルートを使う予定日にすぎないリリースを待って、本番投入を止めるべきではない
コスト制約が厳しい料金公開と実測トークン量を待つGrok 4.6の商用条件が未公開だから
リプレイデータ、可観測性、フォールバックが不足しているまだ移行しない実際の改善とロールアウト時のばらつきを切り分けられない
Grok 4.6が品質、信頼性、レイテンシ、コストの必須基準を満たすワークロード単位で段階的に拡大する一括置換より、対象を限定した切り替えの方が安全だから

Grok 4.6とGrok 4.5について、現時点で何が分かっているのか

現時点の比較は非対称です。 Grok 4.5には公式モデルページ、APIモデルID、料金、コンテキストウィンドウ、xAIによる評価結果があります。一方、Grok 4.6で確認できるのは経営者による公開時期の見通しと、内容が食い違う二次情報だけです。

比較項目Grok 4.5Grok 4.6
公開状況公開済みで、公式文書あり公開予定だが、リリース済みとは公式文書に記載されていない
xAI API モデル IDgrok-4.5非公開
コンテキストウィンドウ500,000トークン非公開
入力価格100万トークンあたり2ドル非公開
出力価格100万トークンあたり6ドル非公開
推論制御設定可能非公開
公式の位置づけコーディング、エージェントタスク、ナレッジワーク非公開
公式ベンチマークxAIによる結果あり非公開
報告された変更現在のベースラインより強力な SFT と RL
パラメータ数現在の公式モデルカタログに記載なし二次情報が食い違っている
EvoLinkルート本記事では専用ルートを確認していない未検証

ここから「Grok 4.6の方が優れている」とは結論づけられません。言えるのは、報告されている改善点が本番運用上の弱点を狙っている一方、移行価値を証明するためのデータはまだないということです。

最大の比較ポイントは、パラメータ数ではなくポストトレーニング

Grok 4.6に関する初期報道はモデル規模に注目していました。しかし報道内容は食い違い、xAIもモデルカードを公開していません。したがって、パラメータ数は比較軸として不安定です。

より実用的な比較軸は、教師ありファインチューニングと強化学習を強化したという報道です。

  • 教師ありファインチューニング(SFT)は、望ましい挙動を示す選別済みの例からモデルを学習させます。
  • 強化学習(RL)は、報酬、評価器、その他のフィードバック信号に対してモデルの挙動を最適化します。

利用者にとって重要なのは学習手法の名称ではなく、観測可能な結果が変わるかどうかです。ポストトレーニングが改善されたなら、エージェントが計画を立て、制約を守り、ツールを選び、失敗から復旧し、停止タイミングを判断する場面でエラーが減るはずです。

この考え方から、Grok 4.6を評価する仮説を明確にできます。

ポストトレーニングの改善によって、合格するタスクの信頼性が高まる、または再試行が十分に減って本番成果が改善するなら、Grok 4.6を採用する価値があります。

報告された変更点をチームが測定できる指標に結び付けられるため、パラメータ数だけを比べるより有効な判断基準です。

Grok 4.5 がすでに提供しているもの

Grok 4.5は単なる仮の比較対象ではありません。xAIは、コーディング、エージェントタスク、ナレッジワーク向けの主力モデルと位置付けています。

公式モデルカタログには、次の仕様が記載されています。
  • モデルID:grok-4.5
  • コンテキストウィンドウ:50万トークン
  • 料金:入力100万トークンあたり2ドル、出力100万トークンあたり6ドル
  • 推論レベル:設定可能
  • 知識カットオフ:2026年2月1日

xAIは、Grok 4.5の出力速度を毎秒80トークンとし、DeepSWE、SWE Marathon、Terminal Bench 2.1、SWE Bench Proなどのエンジニアリング系ベンチマーク結果も公開しています。いずれもベンダー公表値です。本番ワークロード全般での絶対的な順位ではなく、検証可能な主張と現行基準として扱うべきです。

xAIによる評価Grok 4.5 の結果評価から分かること確立できないもの
DeepSWE 1.062.0%当該評価環境でのソフトウェア開発エージェント性能異なるツールや指示を使う非公開リポジトリでの成功率
DeepSWE 1.153.0%新しい版のエンジニアリングタスクへの感度単一ベンチマークだけで本番リプレイを代替できるかどうか
SWE Marathon pass@129.0%長時間のソフトウェアタスクにおける初回成功性能自社環境での再試行コスト、人手レビュー、副作用の安全性
Terminal Bench 2.183.3%ターミナル中心のタスク環境で作業する能力自社の権限設定、サンドボックス、ツール契約下での信頼性
SWE Bench Pro64.7%評価環境でのリポジトリ単位の問題解決能力レイテンシ、地域別キャパシティ、非公開コードの合格率

さらにxAIは、Grok 4.5のSWE Bench Pro評価で、出力速度が毎秒80トークン、平均出力が15,954トークンだったと報告しています。基準値としては有用ですが、速度やコストの総合順位にそのまま使うべきではありません。トークンスループット、タスク完了時間、合格成果物あたりのコストは、それぞれ別の指標です。

ベンチマーク間の差そのものにも意味があります。DeepSWEの一方で62.0%、別の版で53%という結果は、「コーディング性能が高い」だけでは移行基準として広すぎることを示します。4.5と4.6は、同じ評価環境、タスク分布、ツール権限、採点基準で比較してください。

Grok 4.5 の実務上の利点は、判断材料がすでに揃っていることです。 チームは公式モデルを呼び出し、使用量を観測し、リクエスト単価を計算して、今すぐ回帰テストの基準を作れます。

アップグレードを正当化するために Grok 4.6 で改善すべき点

アップグレードは、いくつかの応答がより印象的に見えるかどうかではなく、本番環境の結果に基づいて判断されるべきです。

移行の必須基準測定項目Grok 4.6に求める結果
採用可能な結果の品質実際の受け入れ条件に対する合格率隠れた回帰を増やさず、採用可能な成果物を増やす
指示の遵守制約違反と修復プロンプト長いタスクでの要件の欠落が少なくなる
ツールの信頼性無効な呼び出し、誤ったツール、重複呼び出し、復旧ツール関連の失敗を減らし、完了率を上げる
推論効率ターン数、出力トークン、ループ、再試行合格成果物あたりの処理量を減らす
レイテンシp50、p95、および承認された完了までの時間製品が許容できる遅延プロファイル
コストモデル、ツール、再試行、フォールバック、レビュー合格タスクあたりのコストが下がる、または増加を正当化できる
ルートの安定性エラー、スロットリング、ID、および容量代表的なトラフィック下での予測可能な動作
互換性リクエストフィールド、構造化出力、ツール移行を妨げる統合上の回帰がない
最も重要な数値は、トークンあたりの価格ではなく、承認されたタスクあたりのコストです:
cost per accepted task =
  model usage + tool usage + retries + fallback + review cost
  divided by accepted tasks

トークン単価が高くても、少ない試行で完了できれば総コストは下がる可能性があります。逆に、単価が安く見えても、レビューや再試行が増えれば実質コストは上がります。

再テストすべき互換性とAPI挙動

Grok 4.6の回答品質が高くても、リクエスト/レスポンス仕様との互換性を確認できるまでは、そのまま差し替えられるアップグレードではありません。現行のGrok 4.5文書から、再テストすべき具体的な基準を作れます。

Grok 4.5の基準移行リスクGrok 4.6との同条件テスト
reasoning_effortはlow、medium、highに対応し、文書上のデフォルトはhighデフォルトが変わると、レイテンシとトークン使用量が変化する可能性がある各レベルを固定し、合格結果、使用量、p95を比較する
推論を無効にできない低レイテンシ経路でも非推論モデルとは挙動が異なる可能性がある最小設定、最初のトークンまでの時間、完了までの総時間を確認する
presencePenaltyfrequencyPenaltystopは推論モデルで未対応共通リクエストビルダーが生成前に失敗する可能性がある本番と同じリクエストを送り、検証エラーを記録する
使用量にreasoning_tokensが含まれるフィールドが欠けるとコスト配賦が崩れる可能性があるAPI使用量と社内計測を照合する
暗号化された推論内容を後続ターンへ引き継げる状態を省略または変形すると、マルチターン挙動が回帰する可能性がある文書どおりの受け渡し方法で複数ターン会話を再現する
組み込みの検索/コードツールとカスタム関数呼び出しに対応テキスト品質だけでは、ツール選択や引数の正確さを判断できないタイムアウトとエラー復旧を含め、すべての本番ツールをテストする
構造化出力はJSON Schemaに対応するが、一部キーワードはベストエフォート構文上は正しくても、業務上の制約に違反する可能性があるモデル外でもスキーマ検証し、フィールド単位の失敗を比較する
同じプレフィックスにはプロンプトキャッシュを利用でき、xAIはx-grok-conv-idを推奨キャッシュ挙動がコールド/ウォーム時のレイテンシとコスト比較を歪める可能性があるコールドキャッシュ群とウォームキャッシュ群を分けて測定する

有効な比較には、実行コンテキスト全体の記録が必要です。 リクエストしたモデル、返されたモデル、リクエスト項目、推論レベル、キャッシュ状態、使用量、ツール実行履歴、検証結果を保存します。これらがなければ、品質向上の裏で統合上の回帰を見落とす可能性があります。

Grok 4.6を最初に試すべきワークロード

Grok 4.5ですでに測定可能な問題が出ている作業から始めます。報告されている改善点の効果を検出しやすくなるためです。

Grok 4.6を優先して試すケース

  • タスクの途中で制約を失うマルチステップコーディングエージェント。
  • 複数のファイルにわたる計画を必要とするリポジトリの変更。
  • 無効な呼び出しが繰り返されるか、回復が弱いツールのワークフロー。
  • Grok 4.5で何度も修正プロンプトが必要になる技術分析。
  • 非生産的な推論ループによって引き起こされる、トークンの使用量が多い長いタスク。

当面Grok 4.5を維持するケース

  • 高い合格率で安定している大量処理タスク。
  • すでに品質要件を満たしているレイテンシ重視の経路。
  • 既知の Grok 4.5 の動作に合わせて調整されたワークロード。
  • レビューが完了していない、規制されたフローまたは高リスクのフロー。
  • テスト済みのフォールバックが存在しないシステム。

目標は、すべてのリクエストを最新モデルへ送ることではありません。 新モデルを使う価値があるワークロードの境界を見つけることです。

Grok 4.5から4.6へ安全に移行するための評価計画

Grok 4.6とGrok 4.5を同条件で比較し、小規模検証から段階導入とフォールバックまで進める評価フロー
Grok 4.6とGrok 4.5を同条件で比較し、小規模検証から段階導入とフォールバックまで進める評価フロー

1. モデル ID と商用条件を確認する

品質をテストする前に、公式モデル情報、リクエストに指定するモデルID、APIが返すモデル、料金、対象地域、コンテキスト長、対応するリクエスト仕様を確認します。推測したIDを評価対象にしてはいけません。

2. 同条件のリプレイセットを作る

最初の判断には、本番を代表する20~50件のタスクを使います。次の種類を含めてください。

  • Grok 4.5で成功したタスク
  • 成功はするが、コストまたは処理時間が大きいタスク
  • 再試行が多いタスク
  • 既知の失敗ケース
  • 安全性に関わる、または取り消し不能なためオフライン検証に限定すべきケース

両モデルに同じタスク入力、ツール、権限、タイムアウト、合格判定を適用します。

見栄えのよい数件のプロンプトではなく、代表的な40件の実行履歴から始めます。 例えば、次のように構成できます。

実行履歴のグループ件数含める理由
既知の Grok 4.5 の成功例10すでに信頼できる作業の回帰を検出する
Grok 4.5の既知の失敗10報告されているポストトレーニングの変更が実際の弱点を改善するか確認する
複数ステップのツール実行8ツール選択、引数、復旧、重複実行を測る
構造化された出力タスク6スキーマとダウンストリームのパーサーの回帰を捕捉する
長いコンテキストまたはキャッシュに依存するタスク4コンテキスト処理をコールド/ウォーム レイテンシの影響から分離する
安全性または外部副作用のケース2明示的に承認されるまで、元に戻せない動作をオフラインに保つ

この配分は出発点であり、普遍的なベンチマークではありません。最終的な評価セットは本番件数と事業影響に応じて重み付けしてください。そうしなければ、発生頻度の低い重大障害が、件数の多い簡単なタスクに埋もれてしまいます。

3. 好みより先に必須条件を評価する

正確性、ツールの安全性、スキーマの有効性、重大な回帰は、合否を決める必須条件にします。文体の好みや小さなレイテンシ差は、その後に評価します。

平均スコアの高さで重大な失敗の増加を隠してはいけません。

判定表の例は次のとおりです。

必須条件判定ルールの例優先する理由
取り消し不能または安全性に関わるエラー新たな重大障害はゼロ1件の重大な誤動作が、多数の良好な回答を上回る損害になり得る
必要なスキーマGrok 4.5 の合格率とアプリケーションの SLO を満たすかそれを超える内容が正しい場合でも、無効な出力は次のシステムを破壊する可能性があります
ツールの実行間違ったツール、無効な引数、または重複した副作用の割合が増加しないエージェントの信頼性は実行の特性であり、散文のスコアではありません
合格結果既知の成功ケースを大きく悪化させず、対象の失敗群を改善移行を検討した理由に対して、実際に改善したことを示す
レイテンシ製品の既存の p95 SLO 内に留まります一般的なパーセンテージしきい値は実際のユーザー エクスペリエンスを無視します。
コスト成功した結果ごとにチームが受け入れたコスト内にとどまるトークン価格のみでは、再試行、ツール、レビューが省略されます

具体的なしきい値は、製品のSLOとリスクモデルから決めます。重要なのは、総合的な好みのスコアを計算する前に、重大な必須条件の合否を確定することです。

4. 小規模なカナリアテストを実行する

オフラインリプレイを通過したら、取り消し可能なワークロードの一部だけをGrok 4.6へ送ります。評価で最も明確な改善が見られたタスク分類から始めてください。

記録する項目:

  • リクエストしたモデルと返されたモデル
  • トークン使用量とツール呼び出し
  • 再試行とフォールバックの発生
  • レイテンシ
  • 検証失敗
  • 人手または自動判定による合否

5. ワークロードごとに段階的に拡張する

Grok 4.6をデフォルトにするのは、合意した必須条件を満たしたタスク分類だけにします。新しいルートが平常時とピーク時の両方で安定するまで、Grok 4.5をフォールバックとして残します。

外部に副作用を起こすエージェントでは、冪等性を確保したチェックポイントを使います。同じ処理を繰り返しても安全だと証明できない限り、途中まで実行した後に別モデルへフェイルオーバーしてはいけません。

Grok 4.5を一括置換しない、安全なルーティング方針

モデル更新を全体一括の切り替えにする必要はありません。段階的な方針なら、実績のあるルートを維持しながら判断材料を増やせます。

  1. Grok 4.5は、すでにSLOを満たすワークロードの安定したデフォルトとして維持します。
  2. Grok 4.6はシャドー実行またはオフラインリプレイで評価します。重複実行が外部へ副作用を起こさない場合に限ります。
  3. Grok 4.6には、まず失敗ケース群を割り当てます。4.5で指示遵守、ツール利用、推論に測定可能な問題があるタスク分類です。
  4. Grok 4.5は、容量不足やモデル固有エラーに対する明示的なフォールバックとして残します。ただし、取り消し不能なツール操作を始める前に限ります。
  5. 新しいモデルが合意された観察ウィンドウを通過した後、ワークロードごとにデフォルトのルーティングが変更されます
判断すべきなのは、4.6があらゆる用途で優れているかではありません。4.6がどのワークロードで勝ち、その改善にどれだけの価値があり、どのトラフィックを4.5に残すべきかです。

Grok 4.6は、現時点ではEvoLinkで検証済みのルートではありません。 xAIがAPIで利用できるモデルを公開し、EvoLinkが以下を検証した後にのみ、一般向けルートを追加します。

  • 正確なモデル ID。
  • ルートとリクエストの互換性。
  • 確認済みの料金
  • 対応する推論設定とツール挙動
  • エンドツーエンドで成功するリクエスト
  • 本番向けフォールバックと可観測性

検証後は、統合APIゲートウェイを使うことで、特定プロバイダーのルートをアプリケーションロジックへ直結せずにGrok 4.6を評価できます。モデル選択を設定として管理しながら、使用量、エラー、フォールバック判断を観測できます。

現在対応しているテキストワークロードでは、将来Grok 4.6ルートを追加する前に、EvoLink Smart Routerでルーティングとフォールバックの仕組みを検証できます。

それまでは、この節は将来の接続手順を示すものであり、現在利用できるという主張ではありません。

Grok 4.6を待てない場合はどうするか

導入期限が迫っているなら、Grok 4.6の予定日を待ってリリースを止めるのではなく、今すぐAPIで利用でき、検証可能なモデルを選ぶべきです。
EvoLinkのモデルカタログでは、現在利用できるルートをワークロード、コンテキスト、コスト、プロバイダー別に比較できます。ただし、それらを検証済みのGrok 4.6相当モデルとして紹介してはいけません。目的は導入を継続できる選択肢を示すことであり、Grokの比較記事を代替モデル一覧へ変えることではありません。

価格と API アクセス: 比較が不完全な理由

Grok 4.5には料金とAPI挙動の公式文書がありますが、Grok 4.6にはまだありません。

現時点では、同条件のコスト比較はできません。 評価式とログ項目は準備できますが、Grok 4.6が安い、高い、速い、効率的だと責任を持って判断できる材料はまだありません。

例えば、入力100万トークン、出力30万トークンを使うGrok 4.5の仮想リプレイバッチを考えます。xAIの公開料金では次の計算になります。

model usage = (1.0 × $2) + (0.3 × $6) = $3.80

そのバッチに20件のタスクがあり、16件が合格基準を満たした場合、合格タスク1件あたりの直接モデルコストは約0.24ドルです。

$3.80 ÷ 16 accepted tasks = $0.2375

これはEvoLinkの見積もりでも、Grok 4.6の料金予測でもありません。 ツール料金、再試行、フォールバック、キャッシュ効果、人手レビューは含めていません。目的は、コスト計算で何を分母にするかを示すことです。Grok 4.6の生成トークン単価が高くても、再試行が減り、合格タスクが16件から19件へ増えるなら、総合的には効率的なルートになり得ます。合格数が変わらなければ、追加料金を正当化するのは難しくなります。

Grok 4.6 が呼び出し可能になったら、以下を比較してください。

  • 正確なルートのプロバイダーとゲートウェイの価格。
  • 出力トークンに対する推論レベルの影響。
  • 対応している場合は、プロンプトキャッシュの挙動。
  • ツール料金。
  • 再試行とフォールバック。
  • 人間によるレビュー時間。
  • 1ドルあたりの合格タスク数。

検証済みルートができた後の正確な料金は、モデルページまたは料金ページで管理します。比較ページの役割は判断方法を説明することであり、陳腐化しやすい料金モジュールを重複させることではありません。

結論:アップグレードすべきか

Grok 4.6を試す準備は進めつつ、検証なしの移行は計画しないでください。

現時点で実測できる比較対象はGrok 4.5だけです。Grok 4.6がより良いルートになるのは、自社の失敗例や高コストな実行履歴を有意に改善し、同じ正確性、ツール、レイテンシ、信頼性、コスト基準を満たした場合です。

期待できる効果は全用途共通ではなく、ワークロードごとに異なるはずです。報告されているポストトレーニング改善が実際に効くなら、まず推論負荷の高いコーディングやエージェントタスクで優位性が表れるでしょう。安定しているGrok 4.5のワークロードは、データが置換を支持するまで維持できます。

これが本番移行の基準です。新バージョンだから採用するのではなく、測定結果によって本番トラフィックを割り当てます。

よくある質問

Grok 4.6 は Grok 4.5 より優れていますか?

まだ証明されていません。公開情報では教師ありファインチューニングと強化学習の強化が示されていますが、xAIはGrok 4.5と4.6を同条件で比較した結果を公開していません。

Grok 4.6 で予想される最大の改善点は何ですか?

最も重要とされる変更点は、ポストトレーニングの強化です。効果があるなら、指示遵守、ツール利用の信頼性、失敗からの復旧、推論効率の改善として表れるはずです。

Grok 4.6 と Grok 4.5 はどちらも 1.5T モデルですか?

それは公式には確認されていません。二次レポートは Grok 4.6 のパラメータ数に関して矛盾しており、現在の xAI モデル カタログはこの比較のパラメータ数を公開していません。

Grok 4.6 は API を通じて利用できますか?

2026 年 7 月 30 日時点の xAI の公開モデル カタログとリリース ノートによると、モデル ID、価格、およびアクセス範囲は公開されていません。

Grok 4.6 の価格は Grok 4.5 と同じですか?

不明です。xAIにおけるGrok 4.5の料金は、入力100万トークンあたり2ドル、出力100万トークンあたり6ドルです。この料金をGrok 4.6へそのまま当てはめてはいけません。

Grok 4.6はEvoLinkで利用できますか?

xAIがAPIルートを公開した後、EvoLinkは対応準備を進められます。EvoLinkがモデルID、料金、リクエスト挙動、エンドツーエンドの呼び出し成功を確認するまでは、利用可能とは案内しません。

既存の Grok 4.5 ワークロードはすぐにアップグレードする必要がありますか?

いいえ。代表的な実行履歴を再現し、品質と信頼性の必須基準を適用して、小規模なカナリアテストを行ってください。Grok 4.6で測定可能な改善が得られたワークロードだけを拡大します。

Grok 4.6を待てない場合、どのモデルを使うべきですか?

ワークロードと導入期限に合う、現時点で検証済みのルートを選びます。EvoLinkのモデルカタログなら、未公開のGrok 4.6と同等だと誤認させることなく、利用可能なモデルを比較できます。

情報源

AIコストを89%削減する準備はできましたか?

今すぐEvoLinkを始めて、インテリジェントなAPIルーティングの力を体験してください。