GPT Image 2.5 Flare & Sunburst が EvoLink で利用可能にGPT Image 2.5 を試す
GPT-6.1 SolとGPT-6 Solの移行評価ゲートで基準モデルと候補モデルを分けた編集用イラスト
比較

GPT-6.1 SolとGPT-6 Solを比較:入出力単価は同じ、キャッシュ料金と移行条件が変更

Jacey
Jacey
Founder
2026年9月29日
27 分
GPT-6 Solの通常入力・出力の公表単価で、複雑なタスクの性能向上を求めるなら、GPT-6.1 Solを評価する価値があります。コンテキストを再利用するエージェントでは特に有力な候補です。ただし、新しいツール・推論仕様が自社テストを通過するまで、GPT-6 Solを基準として残してください。 OpenAIの9月29日のリリースではキャッシュ読み取り単価が下がりますが、推論のnoneがなくなり、ツール呼び出しにはResponsesが必要になります。Chat Completionsでツールを使っていたエージェントは、モデルIDの変更だけでは移行できません。
本ガイドは既存のSol処理、受け入れテスト、実際の利用請求があるチーム向けです。EvoLinkのGPT-6 Solモデルページで現在のゲートウェイ基準を確認し、GPTコレクションで選択肢を広げられます。2026年9月29日時点で、EvoLink上のGPT-6.1 Solへのアクセス、機能対応、販売単価は本記事では未検証です。 以下はOpenAIの文書化された仕様と評価方法の比較であり、EvoLinkによる直接対決テストではありません。
GPT-6.1 Sol APIページでは、設定されたモデル、トークンの料金区分、接続方法を比較できます。カタログ掲載やフォールバック価格は実際のリクエスト成功や請求確定の証拠にはならないため、本番トラフィックを流す前に検証してください。

GPT-6.1 SolとGPT-6 Solの主な違い

判断項目GPT-6 SolGPT-6.1 Sol既存エージェントへの影響
正式モデルIDgpt-6-solgpt-6.1-solバージョンを固定し、汎用Solエイリアスに依存しない
入力 / 出力テキスト・画像 / テキストテキスト・画像 / テキスト新しい出力形式への対応は不要
コンテキスト / 最大出力1,050,000 / 128,000トークン同じ上限コンテキストは拡大していない
知識のカットオフ2026年4月20日2026年4月30日新しい日付だけでは自社タスクの品質改善は証明できない
推論強度none、low、medium、high、xhigh、maxlow、medium、high、xhigh、max。none・minimalは非対応候補の設定から非対応値を除く
Chat Completions関数呼び出しnoneのみ非対応ツール依存の処理を検証済みResponsesルートへ移す
Responsesツール呼び出し対応対応ツールループとゲートウェイの動作は引き続き検証
ストリーミング / 構造化出力OpenAIが記載OpenAIが記載プロバイダーの対応だけでは個別ルートの対応は証明できない
出典は公式のGPT-6 SolリファレンスとGPT-6.1 Solリファレンス。9月29日に確認しました。両モデルとも既定の推論強度はmediumです。上限が同じなので、コンテキストサイズより互換性と受け入れタスクあたりのコストのほうが判断に役立ちます。

公式の性能評価が示すこと

OpenAIのリリース発表は、GPT-6 Solから次の改善を報告しています。プロバイダーの評価であり、EvoLinkの測定ではありません。 パーセントポイントはスコアの絶対差で、相対的な改善率ではありません。
評価GPT-6 Solからの公表改善条件と判断上の限界
DeepSWE v1.1旧モデルの最高スコアから+6.4パーセントポイント候補の推論強度と費用は低い。同じ推論強度での比較ではない
AutomationBench 1.0.6+4.8パーセントポイント同じmedium設定。複数段階のツール処理に関連
OSWorld 2.0+7パーセントポイント、タスク費用は半分未満最大推論強度。オフラインv2026.08.08セットでの部分報酬

この結果は複雑なコード変更や業務ツール処理を試す根拠になります。OSWorldの部分報酬はタスクへの進捗を測るため、自社の成功・失敗で判定する受け入れ率の代わりにはなりません。OpenAIは研究/API環境が本番ChatGPTと異なり得るとも説明しています。結果を引用する際は、評価環境、推論強度、コスト範囲を維持してください。

現在のモデルがすでに合格している定型業務では、発表だけで全面置き換えを正当化する根拠は弱くなります。以下の同一タスク比較で、どの改善が自社業務に移るかを確認します。この評価から自社の遅延、再試行率、EvoLink請求額を推測しないでください。

性能評価より先にエンドポイントを決める

実質的に異なる移行は3種類あります。ひとまとめにすると失敗の解釈が難しくなります。

現在の処理候補の移行方法最初の受け入れ確認
ツールなしChat Completions、対応推論強度6.1 Solの文書化されたツールなし仕様を試すレスポンス解析、出力形式、実際に課金された使用量
noneでChat Completionsのツールを使用ツール処理をResponsesへ移し、対応推論強度を選択ツール要求、結果の関連付け、継続処理、再試行動作
ツール付きResponses処理を維持し、新IDと対応推論強度を固定ツールループ全体、構造化結果、使用する場合はストリーミング・キャンセル
2行目は接続方式の移行です。そのリクエストの失敗は、モデルの問題解決能力を示さない場合があります。旧仕様が単に非対応だからです。1行目でも、エンドポイントが同じままでnoneを外すと、遅延、出力使用量、動作が変わり得ます。

ツール依存の移行では、まずエンドポイント、推論強度、ツール定義、結果ID、継続処理を棚卸しします。次に、要求元の呼び出しと結果の関連付けを含め、ツールループをResponsesへ対応させます。成功した操作、失敗した操作、キャンセルした実行をサンドボックスで再生し、最終テキストだけでなく生成されたレコードを確認してください。クライアントが使用するなら構造化出力の解析とストリーミングも確認します。その後で品質を比較します。

互換性の失敗と、受け入れられないタスクを分けて記録してください。パイロット前に実際のゲートウェイルートの仕様と課金を検証し、旧モデル・エンドポイント・パーサーをまとめてロールバック設定として保持します。

キャッシュ読み取りの値下げはタスク全体の割引ではない

以下はOpenAI Standardの100万トークンあたりUSD単価で、EvoLinkの販売単価ではありません。比較を要約した表であり、現在のゲートウェイ単価は該当モデルページで確認します。
トークン区分GPT-6 Sol、入力272K以下GPT-6.1 Sol、入力272K以下GPT-6.1 Sol、入力272K超
非キャッシュ入力$2.00$2.00$4.00
キャッシュ読み取り$0.20$0.10$0.20
キャッシュ書き込み$2.50$2.50$5.00
出力$10.00$10.00$15.00
出典:OpenAI料金、2026年9月29日確認。プロンプトの入力が272Kトークンを超える場合、高い単価は超過分だけでなく、リクエスト全体の該当トークン区分に適用されます。Batch、Flex、Fast、地域別処理には別の条件があります。ここではStandardのみを使います。

6 Solからの直接の変化は、キャッシュ読み取り単価が50%低いことです。6.1 Sol自身の通常入力単価との比較では95%低くなります。いずれもタスク全体が50%または95%安くなるという意味ではありません。出力、非キャッシュ入力、キャッシュ書き込みは同じ割合で値下げされていません。

合計100万入力トークンと100,000出力トークンのリクエスト群を考えます。各リクエストは短い入力の料金帯に収まるものとします。 使用量報告で表のキャッシュ割合が確認されていると仮定し、この簡略例ではキャッシュ書き込み、ツール、失敗した試行、その他の処理割増を除外します。
100万入力トークンのキャッシュ割合GPT-6 Sol入力+出力GPT-6.1 Sol入力+出力直接の節約
40%$1.20非キャッシュ + $0.08キャッシュ + $1.00出力 = $2.28$1.20 + $0.04 + $1.00 = $2.24$0.04
90%$0.20非キャッシュ + $0.18キャッシュ + $1.00出力 = $1.38$0.20 + $0.09 + $1.00 = $1.29$0.09

この割合は仮定であり、測定済みヒット率でも、再利用したプロンプトが必ずキャッシュ対象になるという約束でもありません。候補の推論出力が増えたり再試行が1回増えたりすれば、例の節約額が相殺されます。逆に受け入れ率が上がれば、キャッシュ差より大きな価値が生まれる可能性があります。単価表だけで成功を宣言せず、両方を測定してください。

6つの実業務で同一タスク比較を行う

候補モデルを分離したまま既存タスクが制御、測定、段階的公開を通過する、GPT-6.1 Sol移行評価のイラスト
候補モデルを分離したまま既存タスクが制御、測定、段階的公開を通過する、GPT-6.1 Sol移行評価のイラスト
基準モデル、測定、公開段階を表す編集用イラストです。画像に測定済みモデル結果は含まれません。

両モデルを実行する前に、最近のタスク、リポジトリのバージョン、受け入れルールを固定します。定型業務とともに、旧エージェントが失敗した例や人の介入が必要だった例を含めます。ツール権限と再試行上限を揃え、必要なエンドポイントや評価環境の変更を報告してください。完全に条件を統制した実験であるように扱わないことが重要です。

業務入力と期待結果受け入れ指標コスト・失敗指標試験の優先順位
複数ファイルのバグ修正固定リポジトリと問題 → パッチ無関係な変更なく必須テストを通過再試行、手戻り、レビュー介入失敗例やレビュー負担の重い変更から試す
PRレビュー固定差分と規約 → 指摘確認済み不具合と許容範囲の誤検知誤警報の確認時間指摘増加がノイズになるなら基準モデルを維持
コンテキスト再利用エージェント保存済み文脈と許可ツール → 完了タスク制約を保持し、重複する副作用なしキャッシュ読み書きと推論出力使用量で十分なキャッシュ読み取りを確認してから試す
文書への質問固定文書と質問 → 根拠ある回答正確なフィールドと追跡可能な証拠根拠のない結論とレビュー時間単純検索だけでなく表や矛盾する根拠を試す
業務ツール処理目標とサンドボックスツール → 期待する最終レコード正しい順序とレコード状態重複書き込みや結果の誤関連付けモデル品質の前にツールループを検証
難しいタスクのエスカレーション固定タスクキュー → 受け入れ結果キュー全体で品質基準を達成候補・エスカレーション・フォールバックの合計費用まず難しいタスク専用の経路を試す

拒否ルールは実行前に決めます。業務処理なら最終回答が正しく見えても重複書き込みをすべて拒否できます。パッチにはエージェントが見えるテストだけでなく隠しテストが必要かもしれません。JSONとして正しいだけでは抽出フィールドの正確さは証明できません。

各試行でタスクID、モデル、エンドポイント、推論強度、ツール呼び出し、使用量、再試行、受け入れ、レビュー時間を記録します。サンプル数と同一タスクでの判定の食い違いを集計してください。少数のタスクで阻害要因は見つけられますが、母集団全体の確かな改善は証明できません。平均だけでなく個別の失敗も調べ、特に1件の長いタスクが請求を支配する場合に注意します。

受け入れタスクあたりのコストを比較し、段階的に切り替える

次の定義で集計します。

受け入れタスクあたりのコスト = 失敗、再試行、ツール、レビューを含む試験総費用 ÷ 受け入れタスク数。

人のレビュー費用は、記録した単価で金額化するか、API費用とともにレビュー分数を報告します。一方のモデルだけ黙って省かないでください。受け入れが0件なら比率は定義できません。安い結果とせず、失敗した試験として記録します。

100タスクの完全な費用計算例

以下の4列はすべて説明用の仮定で、観測したモデル結果ではありません。 各列は同じ100タスクのキューを表します。トークン合計には初回試行、再試行、失敗作業を含み、各リクエストはStandardの短い入力帯に収まります。4種類のトークンは別々に報告される課金区分として扱います。ツール費用は仮定の合計額、レビュー単価は説明用の社内レート$30/時間です。地域別やその他の処理割増は除きます。
指標6 Sol基準6.1:キャッシュ6.1:手戻り減6.1:出力・再試行
非キャッシュ入力 / 読み取り、百万トークン4 / 64 / 63.6 / 5.44.8 / 7.2
キャッシュ書き込み / 出力、百万トークン0.4 / 10.4 / 10.36 / 0.90.48 / 1.8
追加の再試行回数20201030
トークン費用$20.20$19.60$17.64$29.52
仮定のツール費用$3.00$3.00$2.70$3.60
レビュー分数 / 費用240 / $120240 / $120180 / $90300 / $150
試験総費用$143.20$142.60$110.34$183.12
100件中の受け入れ数80809075
受け入れ1件あたり費用$1.79$1.78$1.23$2.44
基準モデルのトークン費用は4 × $2 + 6 × $0.20 + 0.4 × $2.50 + 1 × $10 = $20.20です。ツールとレビューを加えると、1件あたり$143.20 ÷ 80 = $1.79。手戻り減の情景は$110.34 ÷ 90 ≈ $1.23になります。

動作が同じなら、キャッシュ値下げによる節約はこのキュー全体で$0.60にとどまります。手戻り減なら利益が大きくなり、出力・再試行・レビューが増えれば相殺されます。この例は6.1 Solの動作を予測しません。すべての仮定を同一タスクの使用量、受け入れ、レビュー記録で置き換え、EvoLinkの判断には検証済みゲートウェイ単価を使います。

候補の実行前にパイロット移行基準を決める

この評価表をコピーし、例の方針を自社サービス要件に置き換えてください。編集上の出発点であり、OpenAIの推奨や統計的保証ではありません。

指標両モデルで記録する項目基準の例
受け入れ数受け入れ/割り当て数と同一タスクの判定差候補は基準以上。重要タスクの悪化は別途レビュー
実効コスト全試行費用 / 受け入れ数事前合意した品質上乗せがない限り基準以下
遅延ツールと再試行を含む全体p95この例ではチーム設定の75秒以内
ツールの正確性誤操作、重複書き込み、最終レコード状態試験中の重複・無許可書き込みは0件。1件でもパイロットを停止
仕様と課金返されたモデルID、対応機能、使用量、実請求本番トラフィック前に候補ルートで検証済み

以下は架空の100タスク例の続きです。遅延と操作結果も追加の仮定です。

結果根拠の例次の行動
限定パイロット開始受け入れ90対80、$1.23対$1.79、p95 70s、誤書き込みなし、ルート・課金確認済み5%など選んだ小集団を流し、拡大前に同じ基準を再確認
オフライン評価を継続必須基準の違反はないが、レビュー判定差で品質の結論が未確定争点タスクを再採点して同一タスク集合を拡大。本番は基準モデルを維持
拒否・ロールバック受け入れ75件かつ$2.44、または重複・無許可書き込み基準設定に戻し、失敗した層を調べる
100タスクの試験で阻害要因は検出できますが、母集団全体での優位性やまれな操作失敗率は確定できません。個々の失敗を調べ、パイロットを監視します。旧GPT-6 Sol設定を使用可能に残し、GPTコレクションで難しいタスクの代替候補を選びます。フォールバックが候補の失敗を隠さないよう、実際に使ったモデルを保存してください。

ロールバックではモデル、エンドポイント、推論強度、ツールスキーマ、パーサーを一緒に復元します。別モデルで再試行する前に操作状態を確認し、重複する副作用を避けます。統一ゲートウェイはモデルの選択肢を維持できますが、ルート仕様と再試行の意味は別途確認が必要です。

GPT-6 Solを維持したほうがよい場合

ツール依存のクライアントが検証済みResponsesルートを使えない間、新しいルートの機能・請求が未検証の間、試験が品質・遅延基準を満たさない間は、基準モデルを維持します。キャッシュが少なく出力が多い処理では、直接の価格変更による利益は小さい場合があります。現在のモデルが定型業務を少ない手戻りで通過しているなら、全面移行より難しいタスクに絞った試験を優先します。

6.1 Solが新しいというだけで、6 Solを廃止済みと呼ばないでください。リファレンスは両モデルを区別していますが、本記事には旧ルートの終了に関する確定情報はありません。変更する理由が文書化されるまで、旧IDをそのまま選択可能に残してください。

日付とチャネル詳細はGPT-6.1 Solリリース記事を参照してください。本番切り替えでは、アクセスを検証した後に自社の同一タスク試験を行います。公式発表だけでゲートウェイの準備完了を判断しないでください。

FAQ

GPT-6.1 SolはGPT-6 Solより安いですか?

OpenAI Standardの短い入力帯では通常入力・出力の公表単価は変わらず、キャッシュ読み取りが半額です。タスク全体の費用はキャッシュ利用、出力、再試行、受け入れ結果に左右されます。EvoLink単価は別途検証が必要です。

モデルIDだけ変更して移行できますか?

互換性のあるツールなし処理なら、対応設定とレスポンス処理を確認した上で可能な場合があります。noneでツールを使うChat Completionsエージェントには、エンドポイントと推論設定の移行が必要です。

GPT-6.1 Solはnone推論に対応しますか?

いいえ。OpenAIが記載するのはlow、medium、high、xhigh、maxで、既定はmediumです。noneもminimalも非対応です。

新しいSolはコンテキストが大きくなりましたか?

いいえ。両リファレンスともコンテキスト1,050,000トークン、最大出力128,000です。共有コンテキスト予算を最大入力と混同しないでください。

EvoLink経由でGPT-6.1 Solを使えますか?

9月29日時点で、本記事はそのルート、対応機能、販売単価を検証していません。ゲートウェイ固有の設定を使う前に、現在のカタログとドキュメントを確認してください。

移行で最も役立つ指標は何ですか?

受け入れタスクあたりのコストに、品質、遅延、安全でない操作の拒否ルールを組み合わせます。失敗とフォールバック費用を含め、レビュー時間も明示します。レスポンスが成功して安くても、タスクを達成していなければ不十分です。

出典

公式出典は2026年9月29日に確認。業務例は説明用の計算と試験方法であり、測定済み使用量や節約保証ではありません。

AIコストを89%削減する準備はできましたか?

今すぐEvoLinkを始めて、インテリジェントなAPIルーティングの力を体験してください。