
Grok 4.6 vs Grok 4.5:ポストトレーニング強化で移行価値はある?
Grok 4.6がGrok 4.5より優れた移行先だとは、まだ証明されていません。 現在報告されている中心的な変更は、教師ありファインチューニングと強化学習の強化です。モデル規模を拡大せずに推論の信頼性を高める可能性はありますが、Grok 4.6の公開後に同条件の本番テストを通過するまでは移行の根拠になりません。
EvoLinkユーザーは、Grok 4.5を測定可能な基準として残し、同じ条件で比較できる評価を準備するのが適切です。Grok 4.6への移行は、合格する成果物が増え、レイテンシ、ツール信頼性、コストが悪化しないワークロードに限定します。
決定の概要
| 現在の状況 | 今取るべき判断 | 理由 |
|---|---|---|
| Grok 4.5が安定しており、合格基準を満たしている | Grok 4.5を評価基準として維持する | Grok 4.6には検証済みのAPI挙動も同条件の比較結果もない |
| 計画ミスや指示からの逸脱で、コーディング/エージェントタスクが失敗している | 公開後、優先的にGrok 4.6を試す | ポストトレーニングの改善が最も表れやすい失敗パターンだから |
| Grok 4.6がAPIで利用可能になる前に本番モデルが必要 | 現時点で検証済みのルートを使う | 予定日にすぎないリリースを待って、本番投入を止めるべきではない |
| コスト制約が厳しい | 料金公開と実測トークン量を待つ | Grok 4.6の商用条件が未公開だから |
| リプレイデータ、可観測性、フォールバックが不足している | まだ移行しない | 実際の改善とロールアウト時のばらつきを切り分けられない |
| Grok 4.6が品質、信頼性、レイテンシ、コストの必須基準を満たす | ワークロード単位で段階的に拡大する | 一括置換より、対象を限定した切り替えの方が安全だから |
Grok 4.6とGrok 4.5について、現時点で何が分かっているのか
現時点の比較は非対称です。 Grok 4.5には公式モデルページ、APIモデルID、料金、コンテキストウィンドウ、xAIによる評価結果があります。一方、Grok 4.6で確認できるのは経営者による公開時期の見通しと、内容が食い違う二次情報だけです。
| 比較項目 | Grok 4.5 | Grok 4.6 |
|---|---|---|
| 公開状況 | 公開済みで、公式文書あり | 公開予定だが、リリース済みとは公式文書に記載されていない |
| xAI API モデル ID | grok-4.5 | 非公開 |
| コンテキストウィンドウ | 500,000トークン | 非公開 |
| 入力価格 | 100万トークンあたり2ドル | 非公開 |
| 出力価格 | 100万トークンあたり6ドル | 非公開 |
| 推論制御 | 設定可能 | 非公開 |
| 公式の位置づけ | コーディング、エージェントタスク、ナレッジワーク | 非公開 |
| 公式ベンチマーク | xAIによる結果あり | 非公開 |
| 報告された変更 | 現在のベースライン | より強力な SFT と RL |
| パラメータ数 | 現在の公式モデルカタログに記載なし | 二次情報が食い違っている |
| EvoLinkルート | 本記事では専用ルートを確認していない | 未検証 |
ここから「Grok 4.6の方が優れている」とは結論づけられません。言えるのは、報告されている改善点が本番運用上の弱点を狙っている一方、移行価値を証明するためのデータはまだないということです。
最大の比較ポイントは、パラメータ数ではなくポストトレーニング
Grok 4.6に関する初期報道はモデル規模に注目していました。しかし報道内容は食い違い、xAIもモデルカードを公開していません。したがって、パラメータ数は比較軸として不安定です。
より実用的な比較軸は、教師ありファインチューニングと強化学習を強化したという報道です。
- 教師ありファインチューニング(SFT)は、望ましい挙動を示す選別済みの例からモデルを学習させます。
- 強化学習(RL)は、報酬、評価器、その他のフィードバック信号に対してモデルの挙動を最適化します。
利用者にとって重要なのは学習手法の名称ではなく、観測可能な結果が変わるかどうかです。ポストトレーニングが改善されたなら、エージェントが計画を立て、制約を守り、ツールを選び、失敗から復旧し、停止タイミングを判断する場面でエラーが減るはずです。
この考え方から、Grok 4.6を評価する仮説を明確にできます。
ポストトレーニングの改善によって、合格するタスクの信頼性が高まる、または再試行が十分に減って本番成果が改善するなら、Grok 4.6を採用する価値があります。
報告された変更点をチームが測定できる指標に結び付けられるため、パラメータ数だけを比べるより有効な判断基準です。
Grok 4.5 がすでに提供しているもの
Grok 4.5は単なる仮の比較対象ではありません。xAIは、コーディング、エージェントタスク、ナレッジワーク向けの主力モデルと位置付けています。
- モデルID:
grok-4.5 - コンテキストウィンドウ:50万トークン
- 料金:入力100万トークンあたり2ドル、出力100万トークンあたり6ドル
- 推論レベル:設定可能
- 知識カットオフ:2026年2月1日
xAIは、Grok 4.5の出力速度を毎秒80トークンとし、DeepSWE、SWE Marathon、Terminal Bench 2.1、SWE Bench Proなどのエンジニアリング系ベンチマーク結果も公開しています。いずれもベンダー公表値です。本番ワークロード全般での絶対的な順位ではなく、検証可能な主張と現行基準として扱うべきです。
| xAIによる評価 | Grok 4.5 の結果 | 評価から分かること | 確立できないもの |
|---|---|---|---|
| DeepSWE 1.0 | 62.0% | 当該評価環境でのソフトウェア開発エージェント性能 | 異なるツールや指示を使う非公開リポジトリでの成功率 |
| DeepSWE 1.1 | 53.0% | 新しい版のエンジニアリングタスクへの感度 | 単一ベンチマークだけで本番リプレイを代替できるかどうか |
| SWE Marathon pass@1 | 29.0% | 長時間のソフトウェアタスクにおける初回成功性能 | 自社環境での再試行コスト、人手レビュー、副作用の安全性 |
| Terminal Bench 2.1 | 83.3% | ターミナル中心のタスク環境で作業する能力 | 自社の権限設定、サンドボックス、ツール契約下での信頼性 |
| SWE Bench Pro | 64.7% | 評価環境でのリポジトリ単位の問題解決能力 | レイテンシ、地域別キャパシティ、非公開コードの合格率 |
さらにxAIは、Grok 4.5のSWE Bench Pro評価で、出力速度が毎秒80トークン、平均出力が15,954トークンだったと報告しています。基準値としては有用ですが、速度やコストの総合順位にそのまま使うべきではありません。トークンスループット、タスク完了時間、合格成果物あたりのコストは、それぞれ別の指標です。
ベンチマーク間の差そのものにも意味があります。DeepSWEの一方で62.0%、別の版で53%という結果は、「コーディング性能が高い」だけでは移行基準として広すぎることを示します。4.5と4.6は、同じ評価環境、タスク分布、ツール権限、採点基準で比較してください。
Grok 4.5 の実務上の利点は、判断材料がすでに揃っていることです。 チームは公式モデルを呼び出し、使用量を観測し、リクエスト単価を計算して、今すぐ回帰テストの基準を作れます。
アップグレードを正当化するために Grok 4.6 で改善すべき点
アップグレードは、いくつかの応答がより印象的に見えるかどうかではなく、本番環境の結果に基づいて判断されるべきです。
| 移行の必須基準 | 測定項目 | Grok 4.6に求める結果 |
|---|---|---|
| 採用可能な結果の品質 | 実際の受け入れ条件に対する合格率 | 隠れた回帰を増やさず、採用可能な成果物を増やす |
| 指示の遵守 | 制約違反と修復プロンプト | 長いタスクでの要件の欠落が少なくなる |
| ツールの信頼性 | 無効な呼び出し、誤ったツール、重複呼び出し、復旧 | ツール関連の失敗を減らし、完了率を上げる |
| 推論効率 | ターン数、出力トークン、ループ、再試行 | 合格成果物あたりの処理量を減らす |
| レイテンシ | p50、p95、および承認された完了までの時間 | 製品が許容できる遅延プロファイル |
| コスト | モデル、ツール、再試行、フォールバック、レビュー | 合格タスクあたりのコストが下がる、または増加を正当化できる |
| ルートの安定性 | エラー、スロットリング、ID、および容量 | 代表的なトラフィック下での予測可能な動作 |
| 互換性 | リクエストフィールド、構造化出力、ツール | 移行を妨げる統合上の回帰がない |
cost per accepted task =
model usage + tool usage + retries + fallback + review cost
divided by accepted tasksトークン単価が高くても、少ない試行で完了できれば総コストは下がる可能性があります。逆に、単価が安く見えても、レビューや再試行が増えれば実質コストは上がります。
再テストすべき互換性とAPI挙動
Grok 4.6の回答品質が高くても、リクエスト/レスポンス仕様との互換性を確認できるまでは、そのまま差し替えられるアップグレードではありません。現行のGrok 4.5文書から、再テストすべき具体的な基準を作れます。
| Grok 4.5の基準 | 移行リスク | Grok 4.6との同条件テスト |
|---|---|---|
reasoning_effortはlow、medium、highに対応し、文書上のデフォルトはhigh | デフォルトが変わると、レイテンシとトークン使用量が変化する可能性がある | 各レベルを固定し、合格結果、使用量、p95を比較する |
| 推論を無効にできない | 低レイテンシ経路でも非推論モデルとは挙動が異なる可能性がある | 最小設定、最初のトークンまでの時間、完了までの総時間を確認する |
presencePenalty、frequencyPenalty、stopは推論モデルで未対応 | 共通リクエストビルダーが生成前に失敗する可能性がある | 本番と同じリクエストを送り、検証エラーを記録する |
使用量にreasoning_tokensが含まれる | フィールドが欠けるとコスト配賦が崩れる可能性がある | API使用量と社内計測を照合する |
| 暗号化された推論内容を後続ターンへ引き継げる | 状態を省略または変形すると、マルチターン挙動が回帰する可能性がある | 文書どおりの受け渡し方法で複数ターン会話を再現する |
| 組み込みの検索/コードツールとカスタム関数呼び出しに対応 | テキスト品質だけでは、ツール選択や引数の正確さを判断できない | タイムアウトとエラー復旧を含め、すべての本番ツールをテストする |
| 構造化出力はJSON Schemaに対応するが、一部キーワードはベストエフォート | 構文上は正しくても、業務上の制約に違反する可能性がある | モデル外でもスキーマ検証し、フィールド単位の失敗を比較する |
同じプレフィックスにはプロンプトキャッシュを利用でき、xAIはx-grok-conv-idを推奨 | キャッシュ挙動がコールド/ウォーム時のレイテンシとコスト比較を歪める可能性がある | コールドキャッシュ群とウォームキャッシュ群を分けて測定する |
有効な比較には、実行コンテキスト全体の記録が必要です。 リクエストしたモデル、返されたモデル、リクエスト項目、推論レベル、キャッシュ状態、使用量、ツール実行履歴、検証結果を保存します。これらがなければ、品質向上の裏で統合上の回帰を見落とす可能性があります。
Grok 4.6を最初に試すべきワークロード
Grok 4.5ですでに測定可能な問題が出ている作業から始めます。報告されている改善点の効果を検出しやすくなるためです。
Grok 4.6を優先して試すケース
- タスクの途中で制約を失うマルチステップコーディングエージェント。
- 複数のファイルにわたる計画を必要とするリポジトリの変更。
- 無効な呼び出しが繰り返されるか、回復が弱いツールのワークフロー。
- Grok 4.5で何度も修正プロンプトが必要になる技術分析。
- 非生産的な推論ループによって引き起こされる、トークンの使用量が多い長いタスク。
当面Grok 4.5を維持するケース
- 高い合格率で安定している大量処理タスク。
- すでに品質要件を満たしているレイテンシ重視の経路。
- 既知の Grok 4.5 の動作に合わせて調整されたワークロード。
- レビューが完了していない、規制されたフローまたは高リスクのフロー。
- テスト済みのフォールバックが存在しないシステム。
目標は、すべてのリクエストを最新モデルへ送ることではありません。 新モデルを使う価値があるワークロードの境界を見つけることです。
Grok 4.5から4.6へ安全に移行するための評価計画

1. モデル ID と商用条件を確認する
品質をテストする前に、公式モデル情報、リクエストに指定するモデルID、APIが返すモデル、料金、対象地域、コンテキスト長、対応するリクエスト仕様を確認します。推測したIDを評価対象にしてはいけません。
2. 同条件のリプレイセットを作る
最初の判断には、本番を代表する20~50件のタスクを使います。次の種類を含めてください。
- Grok 4.5で成功したタスク
- 成功はするが、コストまたは処理時間が大きいタスク
- 再試行が多いタスク
- 既知の失敗ケース
- 安全性に関わる、または取り消し不能なためオフライン検証に限定すべきケース
両モデルに同じタスク入力、ツール、権限、タイムアウト、合格判定を適用します。
見栄えのよい数件のプロンプトではなく、代表的な40件の実行履歴から始めます。 例えば、次のように構成できます。
| 実行履歴のグループ | 件数 | 含める理由 |
|---|---|---|
| 既知の Grok 4.5 の成功例 | 10 | すでに信頼できる作業の回帰を検出する |
| Grok 4.5の既知の失敗 | 10 | 報告されているポストトレーニングの変更が実際の弱点を改善するか確認する |
| 複数ステップのツール実行 | 8 | ツール選択、引数、復旧、重複実行を測る |
| 構造化された出力タスク | 6 | スキーマとダウンストリームのパーサーの回帰を捕捉する |
| 長いコンテキストまたはキャッシュに依存するタスク | 4 | コンテキスト処理をコールド/ウォーム レイテンシの影響から分離する |
| 安全性または外部副作用のケース | 2 | 明示的に承認されるまで、元に戻せない動作をオフラインに保つ |
この配分は出発点であり、普遍的なベンチマークではありません。最終的な評価セットは本番件数と事業影響に応じて重み付けしてください。そうしなければ、発生頻度の低い重大障害が、件数の多い簡単なタスクに埋もれてしまいます。
3. 好みより先に必須条件を評価する
正確性、ツールの安全性、スキーマの有効性、重大な回帰は、合否を決める必須条件にします。文体の好みや小さなレイテンシ差は、その後に評価します。
平均スコアの高さで重大な失敗の増加を隠してはいけません。
判定表の例は次のとおりです。
| 必須条件 | 判定ルールの例 | 優先する理由 |
|---|---|---|
| 取り消し不能または安全性に関わるエラー | 新たな重大障害はゼロ | 1件の重大な誤動作が、多数の良好な回答を上回る損害になり得る |
| 必要なスキーマ | Grok 4.5 の合格率とアプリケーションの SLO を満たすかそれを超える | 内容が正しい場合でも、無効な出力は次のシステムを破壊する可能性があります |
| ツールの実行 | 間違ったツール、無効な引数、または重複した副作用の割合が増加しない | エージェントの信頼性は実行の特性であり、散文のスコアではありません |
| 合格結果 | 既知の成功ケースを大きく悪化させず、対象の失敗群を改善 | 移行を検討した理由に対して、実際に改善したことを示す |
| レイテンシ | 製品の既存の p95 SLO 内に留まります | 一般的なパーセンテージしきい値は実際のユーザー エクスペリエンスを無視します。 |
| コスト | 成功した結果ごとにチームが受け入れたコスト内にとどまる | トークン価格のみでは、再試行、ツール、レビューが省略されます |
具体的なしきい値は、製品のSLOとリスクモデルから決めます。重要なのは、総合的な好みのスコアを計算する前に、重大な必須条件の合否を確定することです。
4. 小規模なカナリアテストを実行する
オフラインリプレイを通過したら、取り消し可能なワークロードの一部だけをGrok 4.6へ送ります。評価で最も明確な改善が見られたタスク分類から始めてください。
記録する項目:
- リクエストしたモデルと返されたモデル
- トークン使用量とツール呼び出し
- 再試行とフォールバックの発生
- レイテンシ
- 検証失敗
- 人手または自動判定による合否
5. ワークロードごとに段階的に拡張する
Grok 4.6をデフォルトにするのは、合意した必須条件を満たしたタスク分類だけにします。新しいルートが平常時とピーク時の両方で安定するまで、Grok 4.5をフォールバックとして残します。
外部に副作用を起こすエージェントでは、冪等性を確保したチェックポイントを使います。同じ処理を繰り返しても安全だと証明できない限り、途中まで実行した後に別モデルへフェイルオーバーしてはいけません。
Grok 4.5を一括置換しない、安全なルーティング方針
モデル更新を全体一括の切り替えにする必要はありません。段階的な方針なら、実績のあるルートを維持しながら判断材料を増やせます。
- Grok 4.5は、すでにSLOを満たすワークロードの安定したデフォルトとして維持します。
- Grok 4.6はシャドー実行またはオフラインリプレイで評価します。重複実行が外部へ副作用を起こさない場合に限ります。
- Grok 4.6には、まず失敗ケース群を割り当てます。4.5で指示遵守、ツール利用、推論に測定可能な問題があるタスク分類です。
- Grok 4.5は、容量不足やモデル固有エラーに対する明示的なフォールバックとして残します。ただし、取り消し不能なツール操作を始める前に限ります。
- 新しいモデルが合意された観察ウィンドウを通過した後、ワークロードごとにデフォルトのルーティングが変更されます。
EvoLink 経由で Grok 4.6 にアクセスする方法
Grok 4.6は、現時点ではEvoLinkで検証済みのルートではありません。 xAIがAPIで利用できるモデルを公開し、EvoLinkが以下を検証した後にのみ、一般向けルートを追加します。
- 正確なモデル ID。
- ルートとリクエストの互換性。
- 確認済みの料金
- 対応する推論設定とツール挙動
- エンドツーエンドで成功するリクエスト
- 本番向けフォールバックと可観測性
検証後は、統合APIゲートウェイを使うことで、特定プロバイダーのルートをアプリケーションロジックへ直結せずにGrok 4.6を評価できます。モデル選択を設定として管理しながら、使用量、エラー、フォールバック判断を観測できます。
それまでは、この節は将来の接続手順を示すものであり、現在利用できるという主張ではありません。
Grok 4.6を待てない場合はどうするか
導入期限が迫っているなら、Grok 4.6の予定日を待ってリリースを止めるのではなく、今すぐAPIで利用でき、検証可能なモデルを選ぶべきです。価格と API アクセス: 比較が不完全な理由
Grok 4.5には料金とAPI挙動の公式文書がありますが、Grok 4.6にはまだありません。
現時点では、同条件のコスト比較はできません。 評価式とログ項目は準備できますが、Grok 4.6が安い、高い、速い、効率的だと責任を持って判断できる材料はまだありません。
例えば、入力100万トークン、出力30万トークンを使うGrok 4.5の仮想リプレイバッチを考えます。xAIの公開料金では次の計算になります。
model usage = (1.0 × $2) + (0.3 × $6) = $3.80そのバッチに20件のタスクがあり、16件が合格基準を満たした場合、合格タスク1件あたりの直接モデルコストは約0.24ドルです。
$3.80 ÷ 16 accepted tasks = $0.2375これはEvoLinkの見積もりでも、Grok 4.6の料金予測でもありません。 ツール料金、再試行、フォールバック、キャッシュ効果、人手レビューは含めていません。目的は、コスト計算で何を分母にするかを示すことです。Grok 4.6の生成トークン単価が高くても、再試行が減り、合格タスクが16件から19件へ増えるなら、総合的には効率的なルートになり得ます。合格数が変わらなければ、追加料金を正当化するのは難しくなります。
Grok 4.6 が呼び出し可能になったら、以下を比較してください。
- 正確なルートのプロバイダーとゲートウェイの価格。
- 出力トークンに対する推論レベルの影響。
- 対応している場合は、プロンプトキャッシュの挙動。
- ツール料金。
- 再試行とフォールバック。
- 人間によるレビュー時間。
- 1ドルあたりの合格タスク数。
検証済みルートができた後の正確な料金は、モデルページまたは料金ページで管理します。比較ページの役割は判断方法を説明することであり、陳腐化しやすい料金モジュールを重複させることではありません。
結論:アップグレードすべきか
Grok 4.6を試す準備は進めつつ、検証なしの移行は計画しないでください。現時点で実測できる比較対象はGrok 4.5だけです。Grok 4.6がより良いルートになるのは、自社の失敗例や高コストな実行履歴を有意に改善し、同じ正確性、ツール、レイテンシ、信頼性、コスト基準を満たした場合です。
期待できる効果は全用途共通ではなく、ワークロードごとに異なるはずです。報告されているポストトレーニング改善が実際に効くなら、まず推論負荷の高いコーディングやエージェントタスクで優位性が表れるでしょう。安定しているGrok 4.5のワークロードは、データが置換を支持するまで維持できます。
これが本番移行の基準です。新バージョンだから採用するのではなく、測定結果によって本番トラフィックを割り当てます。
よくある質問
Grok 4.6 は Grok 4.5 より優れていますか?
まだ証明されていません。公開情報では教師ありファインチューニングと強化学習の強化が示されていますが、xAIはGrok 4.5と4.6を同条件で比較した結果を公開していません。
Grok 4.6 で予想される最大の改善点は何ですか?
最も重要とされる変更点は、ポストトレーニングの強化です。効果があるなら、指示遵守、ツール利用の信頼性、失敗からの復旧、推論効率の改善として表れるはずです。
Grok 4.6 と Grok 4.5 はどちらも 1.5T モデルですか?
それは公式には確認されていません。二次レポートは Grok 4.6 のパラメータ数に関して矛盾しており、現在の xAI モデル カタログはこの比較のパラメータ数を公開していません。
Grok 4.6 は API を通じて利用できますか?
2026 年 7 月 30 日時点の xAI の公開モデル カタログとリリース ノートによると、モデル ID、価格、およびアクセス範囲は公開されていません。
Grok 4.6 の価格は Grok 4.5 と同じですか?
不明です。xAIにおけるGrok 4.5の料金は、入力100万トークンあたり2ドル、出力100万トークンあたり6ドルです。この料金をGrok 4.6へそのまま当てはめてはいけません。
Grok 4.6はEvoLinkで利用できますか?
xAIがAPIルートを公開した後、EvoLinkは対応準備を進められます。EvoLinkがモデルID、料金、リクエスト挙動、エンドツーエンドの呼び出し成功を確認するまでは、利用可能とは案内しません。
既存の Grok 4.5 ワークロードはすぐにアップグレードする必要がありますか?
いいえ。代表的な実行履歴を再現し、品質と信頼性の必須基準を適用して、小規模なカナリアテストを行ってください。Grok 4.6で測定可能な改善が得られたワークロードだけを拡大します。


