
GPT-6.1 SolとGPT-6 Solを比較:入出力単価は同じ、キャッシュ料金と移行条件が変更
noneがなくなり、ツール呼び出しにはResponsesが必要になります。Chat Completionsでツールを使っていたエージェントは、モデルIDの変更だけでは移行できません。GPT-6.1 SolとGPT-6 Solの主な違い
| 判断項目 | GPT-6 Sol | GPT-6.1 Sol | 既存エージェントへの影響 |
|---|---|---|---|
| 正式モデルID | gpt-6-sol | gpt-6.1-sol | バージョンを固定し、汎用Solエイリアスに依存しない |
| 入力 / 出力 | テキスト・画像 / テキスト | テキスト・画像 / テキスト | 新しい出力形式への対応は不要 |
| コンテキスト / 最大出力 | 1,050,000 / 128,000トークン | 同じ上限 | コンテキストは拡大していない |
| 知識のカットオフ | 2026年4月20日 | 2026年4月30日 | 新しい日付だけでは自社タスクの品質改善は証明できない |
| 推論強度 | none、low、medium、high、xhigh、max | low、medium、high、xhigh、max。none・minimalは非対応 | 候補の設定から非対応値を除く |
| Chat Completions関数呼び出し | noneのみ | 非対応 | ツール依存の処理を検証済みResponsesルートへ移す |
| Responsesツール呼び出し | 対応 | 対応 | ツールループとゲートウェイの動作は引き続き検証 |
| ストリーミング / 構造化出力 | OpenAIが記載 | OpenAIが記載 | プロバイダーの対応だけでは個別ルートの対応は証明できない |
mediumです。上限が同じなので、コンテキストサイズより互換性と受け入れタスクあたりのコストのほうが判断に役立ちます。公式の性能評価が示すこと
| 評価 | GPT-6 Solからの公表改善 | 条件と判断上の限界 |
|---|---|---|
| DeepSWE v1.1 | 旧モデルの最高スコアから+6.4パーセントポイント | 候補の推論強度と費用は低い。同じ推論強度での比較ではない |
| AutomationBench 1.0.6 | +4.8パーセントポイント | 同じmedium設定。複数段階のツール処理に関連 |
| OSWorld 2.0 | +7パーセントポイント、タスク費用は半分未満 | 最大推論強度。オフラインv2026.08.08セットでの部分報酬 |
この結果は複雑なコード変更や業務ツール処理を試す根拠になります。OSWorldの部分報酬はタスクへの進捗を測るため、自社の成功・失敗で判定する受け入れ率の代わりにはなりません。OpenAIは研究/API環境が本番ChatGPTと異なり得るとも説明しています。結果を引用する際は、評価環境、推論強度、コスト範囲を維持してください。
現在のモデルがすでに合格している定型業務では、発表だけで全面置き換えを正当化する根拠は弱くなります。以下の同一タスク比較で、どの改善が自社業務に移るかを確認します。この評価から自社の遅延、再試行率、EvoLink請求額を推測しないでください。
性能評価より先にエンドポイントを決める
実質的に異なる移行は3種類あります。ひとまとめにすると失敗の解釈が難しくなります。
| 現在の処理 | 候補の移行方法 | 最初の受け入れ確認 |
|---|---|---|
| ツールなしChat Completions、対応推論強度 | 6.1 Solの文書化されたツールなし仕様を試す | レスポンス解析、出力形式、実際に課金された使用量 |
noneでChat Completionsのツールを使用 | ツール処理をResponsesへ移し、対応推論強度を選択 | ツール要求、結果の関連付け、継続処理、再試行動作 |
| ツール付きResponses | 処理を維持し、新IDと対応推論強度を固定 | ツールループ全体、構造化結果、使用する場合はストリーミング・キャンセル |
noneを外すと、遅延、出力使用量、動作が変わり得ます。ツール依存の移行では、まずエンドポイント、推論強度、ツール定義、結果ID、継続処理を棚卸しします。次に、要求元の呼び出しと結果の関連付けを含め、ツールループをResponsesへ対応させます。成功した操作、失敗した操作、キャンセルした実行をサンドボックスで再生し、最終テキストだけでなく生成されたレコードを確認してください。クライアントが使用するなら構造化出力の解析とストリーミングも確認します。その後で品質を比較します。
互換性の失敗と、受け入れられないタスクを分けて記録してください。パイロット前に実際のゲートウェイルートの仕様と課金を検証し、旧モデル・エンドポイント・パーサーをまとめてロールバック設定として保持します。
キャッシュ読み取りの値下げはタスク全体の割引ではない
| トークン区分 | GPT-6 Sol、入力272K以下 | GPT-6.1 Sol、入力272K以下 | GPT-6.1 Sol、入力272K超 |
|---|---|---|---|
| 非キャッシュ入力 | $2.00 | $2.00 | $4.00 |
| キャッシュ読み取り | $0.20 | $0.10 | $0.20 |
| キャッシュ書き込み | $2.50 | $2.50 | $5.00 |
| 出力 | $10.00 | $10.00 | $15.00 |
6 Solからの直接の変化は、キャッシュ読み取り単価が50%低いことです。6.1 Sol自身の通常入力単価との比較では95%低くなります。いずれもタスク全体が50%または95%安くなるという意味ではありません。出力、非キャッシュ入力、キャッシュ書き込みは同じ割合で値下げされていません。
| 100万入力トークンのキャッシュ割合 | GPT-6 Sol入力+出力 | GPT-6.1 Sol入力+出力 | 直接の節約 |
|---|---|---|---|
| 40% | $1.20非キャッシュ + $0.08キャッシュ + $1.00出力 = $2.28 | $1.20 + $0.04 + $1.00 = $2.24 | $0.04 |
| 90% | $0.20非キャッシュ + $0.18キャッシュ + $1.00出力 = $1.38 | $0.20 + $0.09 + $1.00 = $1.29 | $0.09 |
この割合は仮定であり、測定済みヒット率でも、再利用したプロンプトが必ずキャッシュ対象になるという約束でもありません。候補の推論出力が増えたり再試行が1回増えたりすれば、例の節約額が相殺されます。逆に受け入れ率が上がれば、キャッシュ差より大きな価値が生まれる可能性があります。単価表だけで成功を宣言せず、両方を測定してください。
6つの実業務で同一タスク比較を行う

両モデルを実行する前に、最近のタスク、リポジトリのバージョン、受け入れルールを固定します。定型業務とともに、旧エージェントが失敗した例や人の介入が必要だった例を含めます。ツール権限と再試行上限を揃え、必要なエンドポイントや評価環境の変更を報告してください。完全に条件を統制した実験であるように扱わないことが重要です。
| 業務 | 入力と期待結果 | 受け入れ指標 | コスト・失敗指標 | 試験の優先順位 |
|---|---|---|---|---|
| 複数ファイルのバグ修正 | 固定リポジトリと問題 → パッチ | 無関係な変更なく必須テストを通過 | 再試行、手戻り、レビュー介入 | 失敗例やレビュー負担の重い変更から試す |
| PRレビュー | 固定差分と規約 → 指摘 | 確認済み不具合と許容範囲の誤検知 | 誤警報の確認時間 | 指摘増加がノイズになるなら基準モデルを維持 |
| コンテキスト再利用エージェント | 保存済み文脈と許可ツール → 完了タスク | 制約を保持し、重複する副作用なし | キャッシュ読み書きと推論出力 | 使用量で十分なキャッシュ読み取りを確認してから試す |
| 文書への質問 | 固定文書と質問 → 根拠ある回答 | 正確なフィールドと追跡可能な証拠 | 根拠のない結論とレビュー時間 | 単純検索だけでなく表や矛盾する根拠を試す |
| 業務ツール処理 | 目標とサンドボックスツール → 期待する最終レコード | 正しい順序とレコード状態 | 重複書き込みや結果の誤関連付け | モデル品質の前にツールループを検証 |
| 難しいタスクのエスカレーション | 固定タスクキュー → 受け入れ結果 | キュー全体で品質基準を達成 | 候補・エスカレーション・フォールバックの合計費用 | まず難しいタスク専用の経路を試す |
拒否ルールは実行前に決めます。業務処理なら最終回答が正しく見えても重複書き込みをすべて拒否できます。パッチにはエージェントが見えるテストだけでなく隠しテストが必要かもしれません。JSONとして正しいだけでは抽出フィールドの正確さは証明できません。
各試行でタスクID、モデル、エンドポイント、推論強度、ツール呼び出し、使用量、再試行、受け入れ、レビュー時間を記録します。サンプル数と同一タスクでの判定の食い違いを集計してください。少数のタスクで阻害要因は見つけられますが、母集団全体の確かな改善は証明できません。平均だけでなく個別の失敗も調べ、特に1件の長いタスクが請求を支配する場合に注意します。
受け入れタスクあたりのコストを比較し、段階的に切り替える
次の定義で集計します。
人のレビュー費用は、記録した単価で金額化するか、API費用とともにレビュー分数を報告します。一方のモデルだけ黙って省かないでください。受け入れが0件なら比率は定義できません。安い結果とせず、失敗した試験として記録します。
100タスクの完全な費用計算例
| 指標 | 6 Sol基準 | 6.1:キャッシュ | 6.1:手戻り減 | 6.1:出力・再試行 |
|---|---|---|---|---|
| 非キャッシュ入力 / 読み取り、百万トークン | 4 / 6 | 4 / 6 | 3.6 / 5.4 | 4.8 / 7.2 |
| キャッシュ書き込み / 出力、百万トークン | 0.4 / 1 | 0.4 / 1 | 0.36 / 0.9 | 0.48 / 1.8 |
| 追加の再試行回数 | 20 | 20 | 10 | 30 |
| トークン費用 | $20.20 | $19.60 | $17.64 | $29.52 |
| 仮定のツール費用 | $3.00 | $3.00 | $2.70 | $3.60 |
| レビュー分数 / 費用 | 240 / $120 | 240 / $120 | 180 / $90 | 300 / $150 |
| 試験総費用 | $143.20 | $142.60 | $110.34 | $183.12 |
| 100件中の受け入れ数 | 80 | 80 | 90 | 75 |
| 受け入れ1件あたり費用 | $1.79 | $1.78 | $1.23 | $2.44 |
4 × $2 + 6 × $0.20 + 0.4 × $2.50 + 1 × $10 = $20.20です。ツールとレビューを加えると、1件あたり$143.20 ÷ 80 = $1.79。手戻り減の情景は$110.34 ÷ 90 ≈ $1.23になります。動作が同じなら、キャッシュ値下げによる節約はこのキュー全体で$0.60にとどまります。手戻り減なら利益が大きくなり、出力・再試行・レビューが増えれば相殺されます。この例は6.1 Solの動作を予測しません。すべての仮定を同一タスクの使用量、受け入れ、レビュー記録で置き換え、EvoLinkの判断には検証済みゲートウェイ単価を使います。
候補の実行前にパイロット移行基準を決める
この評価表をコピーし、例の方針を自社サービス要件に置き換えてください。編集上の出発点であり、OpenAIの推奨や統計的保証ではありません。
| 指標 | 両モデルで記録する項目 | 基準の例 |
|---|---|---|
| 受け入れ数 | 受け入れ/割り当て数と同一タスクの判定差 | 候補は基準以上。重要タスクの悪化は別途レビュー |
| 実効コスト | 全試行費用 / 受け入れ数 | 事前合意した品質上乗せがない限り基準以下 |
| 遅延 | ツールと再試行を含む全体p95 | この例ではチーム設定の75秒以内 |
| ツールの正確性 | 誤操作、重複書き込み、最終レコード状態 | 試験中の重複・無許可書き込みは0件。1件でもパイロットを停止 |
| 仕様と課金 | 返されたモデルID、対応機能、使用量、実請求 | 本番トラフィック前に候補ルートで検証済み |
以下は架空の100タスク例の続きです。遅延と操作結果も追加の仮定です。
| 結果 | 根拠の例 | 次の行動 |
|---|---|---|
| 限定パイロット開始 | 受け入れ90対80、$1.23対$1.79、p95 70s、誤書き込みなし、ルート・課金確認済み | 5%など選んだ小集団を流し、拡大前に同じ基準を再確認 |
| オフライン評価を継続 | 必須基準の違反はないが、レビュー判定差で品質の結論が未確定 | 争点タスクを再採点して同一タスク集合を拡大。本番は基準モデルを維持 |
| 拒否・ロールバック | 受け入れ75件かつ$2.44、または重複・無許可書き込み | 基準設定に戻し、失敗した層を調べる |
ロールバックではモデル、エンドポイント、推論強度、ツールスキーマ、パーサーを一緒に復元します。別モデルで再試行する前に操作状態を確認し、重複する副作用を避けます。統一ゲートウェイはモデルの選択肢を維持できますが、ルート仕様と再試行の意味は別途確認が必要です。
GPT-6 Solを維持したほうがよい場合
ツール依存のクライアントが検証済みResponsesルートを使えない間、新しいルートの機能・請求が未検証の間、試験が品質・遅延基準を満たさない間は、基準モデルを維持します。キャッシュが少なく出力が多い処理では、直接の価格変更による利益は小さい場合があります。現在のモデルが定型業務を少ない手戻りで通過しているなら、全面移行より難しいタスクに絞った試験を優先します。
6.1 Solが新しいというだけで、6 Solを廃止済みと呼ばないでください。リファレンスは両モデルを区別していますが、本記事には旧ルートの終了に関する確定情報はありません。変更する理由が文書化されるまで、旧IDをそのまま選択可能に残してください。
FAQ
GPT-6.1 SolはGPT-6 Solより安いですか?
OpenAI Standardの短い入力帯では通常入力・出力の公表単価は変わらず、キャッシュ読み取りが半額です。タスク全体の費用はキャッシュ利用、出力、再試行、受け入れ結果に左右されます。EvoLink単価は別途検証が必要です。
モデルIDだけ変更して移行できますか?
noneでツールを使うChat Completionsエージェントには、エンドポイントと推論設定の移行が必要です。GPT-6.1 Solはnone推論に対応しますか?
low、medium、high、xhigh、maxで、既定はmediumです。noneもminimalも非対応です。新しいSolはコンテキストが大きくなりましたか?
いいえ。両リファレンスともコンテキスト1,050,000トークン、最大出力128,000です。共有コンテキスト予算を最大入力と混同しないでください。
EvoLink経由でGPT-6.1 Solを使えますか?
9月29日時点で、本記事はそのルート、対応機能、販売単価を検証していません。ゲートウェイ固有の設定を使う前に、現在のカタログとドキュメントを確認してください。
移行で最も役立つ指標は何ですか?
受け入れタスクあたりのコストに、品質、遅延、安全でない操作の拒否ルールを組み合わせます。失敗とフォールバック費用を含め、レビュー時間も明示します。レスポンスが成功して安くても、タスクを達成していなければ不十分です。
出典
- GPT-6.1 Solリファレンス — 新仕様と上限。
- GPT-6 Solリファレンス — 基準モデルの仕様と上限。
- OpenAI API料金 — Standard単価、キャッシュ費用、長い入力の条件。
- GPT-6.1 Solリリース発表 — 発表内容とベンダー評価。EvoLinkの再現実験ではありません。
公式出典は2026年9月29日に確認。業務例は説明用の計算と試験方法であり、測定済み使用量や節約保証ではありません。
