Seedance 2.5がEvoLinkで利用可能にSeedance 2.5を試す
コードパネルが API ゲートウェイを介して光る AI コアにつながる概念イラスト
guide

GPT-6 Astra API の使い方:最初の呼び出し、effort レベル、GPT-5.6 からの移行

EvoLink Team
EvoLink Team
Product Team
2026年9月5日
22 分
GPT-6 Astra は、難しいエンドツーエンドのコーディング、コンピュータ操作、リサーチ、エージェント作業向けの OpenAI の現行フラッグシップです。EvoLink ではモデル ID gpt-6-astra で、GPT-5.6 と同じ OpenAI 互換エンドポイントと API キーから、OpenAI 定価の 10% 引きで利用できます。
このガイドは統合のリファレンスです。3 言語での最初のリクエスト、このモデルにおける Chat Completions と Responses API の違い、推論 effort の選び方、既存の GPT-5.6 統合に必要な変更点、そして Astra があなたのワークロードで Sol より高くつくか安くなるかを決める 3 つの課金ルールを扱います。現在の EvoLink 料金、モデルカード、コスト計算機は GPT-6 Astra API ページをご覧ください。
提供元とゲートウェイの対応範囲。 以下のモデル機能は OpenAI の文書に基づきます。EvoLink は記載のエンドポイントを使用しますが、テキストリクエストの成功だけでは、画像入力、Batch/Flex/Fast、WebSocket ステアリング、非同期ツール、Pro モード、configuration_update、キャッシュオプション 30m の対応は確認できません。利用前に EvoLink の対象ルートで各機能を個別に検証してください。

クイックリファレンス

項目
モデル IDgpt-6-astra(OpenAI にも EvoLink にも gpt-6 エイリアスはなし)
エンドポイントhttps://api.evolink.ai/v1(OpenAI 互換)
API サーフェス(OpenAI)Responses、Chat Completions(ツール呼び出し非対応)、Batch。EvoLink の機能対応は別途検証が必要
コンテキストウィンドウ入力と出力で共有する 1,050,000 トークン。最大入力 922,000、最大出力 128,000
入力 / 出力テキストと画像を入力、テキストを出力
知識カットオフ2026年4月30日
推論 effortlowmediumhighxhighmaxnoneminimal は 400 を返す
削除されたパラメータtemperaturetop_plogprobs
プロンプトキャッシュ対応。キャッシュ書き込みは入力の 1.25 倍、TTL オプションは 30m
OpenAI 定価(入力 ≤ 272K)100万トークンあたり入力 $10 / キャッシュ $1 / キャッシュ書き込み $12.50 / 出力 $50
長文コンテキスト帯(入力 > 272K)リクエスト全体が入力とキャッシュ 2 倍、出力 1.5 倍
EvoLink 料金OpenAI 定価の 10% 引き。現在の数値は API ページ
非対応ファインチューニング、Realtime、Assistants、Embeddings、画像・音声生成

セットアップと最初のリクエスト

ダッシュボード → Keys でキーを作成します。同じキーで GPT-5.6、Claude、Gemini、GPT-6 Astra をルーティングできます。

ステップ 2:OpenAI SDK をインストールする

pip install openai        # Python
npm install openai        # Node.js

ステップ 3:最初のリクエストを送る

まず基本的な Responses リクエストから始めてください。OpenAI ではツール呼び出しに Responses が必要です。高度な Responses 機能は EvoLink の対象ルートで個別に検証する必要があります。

cURL:
curl https://api.evolink.ai/v1/responses \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "input": "キャッシュ読み取りとキャッシュ書き込みの違いを 1 段落で説明してください。",
    "reasoning": {"effort": "medium"}
  }'
Python:
from openai import OpenAI

client = OpenAI(
    api_key="your-evolink-api-key",
    base_url="https://api.evolink.ai/v1",
)

response = client.responses.create(
    model="gpt-6-astra",
    input="キャッシュ読み取りとキャッシュ書き込みの違いを 1 段落で説明してください。",
    reasoning={"effort": "medium"},
)

print(response.output_text)
print(response.model, response.usage)
Node.js:
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: "your-evolink-api-key",
  baseURL: "https://api.evolink.ai/v1",
});

const response = await client.responses.create({
  model: "gpt-6-astra",
  input: "キャッシュ読み取りとキャッシュ書き込みの違いを 1 段落で説明してください。",
  reasoning: { effort: "medium" },
});

console.log(response.output_text);
console.log(response.model, response.usage);
最初の呼び出しで response.modelresponse.usage を出力してください。返却されるモデル文字列は gpt-6-astra で、usage ブロックには入力、キャッシュ、推論、出力のトークン数が入ります。請求額との突き合わせにはこれが必要です。

Chat Completions でのテキストのみのリクエスト

Chat Completions は純粋なテキストリクエストに使えます。temperaturetop_ptools は渡さないでください:
response = client.chat.completions.create(
    model="gpt-6-astra",
    messages=[{"role": "user", "content": "この変更履歴を 3 つの箇条書きに要約してください:..."}],
    reasoning_effort="low",
)
print(response.choices[0].message.content)

Chat Completions と Responses API の違い

この表はテキストと画像の入力を含む OpenAI API の機能を示しています。EvoLink の対応表ではありません。画像入力と各オプション機能は対象ルートで検証してください。このモデルの Chat Completions はツール呼び出しに対応していません。
機能Chat CompletionsResponses API
テキスト入力、テキスト出力対応対応
画像入力対応対応
ストリーミング対応対応
構造化出力対応対応
プロンプトキャッシュ対応対応
Function / ツール呼び出し非対応対応
非同期ツール呼び出し非対応対応
ターン途中のステアリング(WebSocket 経由の response.steer非対応対応
キャッシュを保持したまま会話途中で effort を変更(configuration_update非対応対応
reasoning.mode: "pro"非対応対応
temperaturetop_plogprobs拒否拒否

エージェントループが今 Chat Completions にあるなら、Responses に移すか、Chat Completions でもツール呼び出しに対応している GPT-5.6 に留めてください。

Responses 特有の注意点:Zero Data Retention を有効にしている組織では previous_response_id が機能しません。会話履歴は input に明示的に含めてください。

推論 effort の選び方

Astra は 5 段階の effort を持ちます。OpenAI 自身のガイダンスは短く、以前のモデルで noneminimal を使っていたなら low から始めて比較せよ、というものです。リリース直後に移行ログを公開した開発者たちは、コーディング作業ではデフォルトの起点として medium に収束しました。これはコミュニティの報告であり、EvoLink の測定ではありません。
Effort向いている用途注意点
low抽出、分類、短い書き換え、GPT-5.6 で none で動かしていたもの推論トークンは発生する。無料枠ではない
mediumコーディングタスク、複数ステップのツール利用、ドキュメント作業のデフォルトサードパーティの実行では、low からの品質向上が大きく、コスト増は穏やか
highリポジトリ規模の変更、長いリサーチチェーン最初のトークンまでの時間とトークン消費が急増
xhighhigh で受け入れテストに落ちる難しいエージェントタスク高コスト。自社の評価セットで検証
max制約のない推論予算サードパーティの測定では最初のトークンまで数分。オフラインバッチ以外で見合うことは稀

OpenAI は次の 2 つの追加制御を文書化しています。EvoLink での対応は未検証のため、提供元 API の参考情報として扱ってください。

  • configuration_update を使うと、Responses の会話でプロンプトキャッシュを無効にせずにターン間で effort を変えられます。medium から始め、失敗したターンだけ上げてください。
  • reasoning.mode: "pro" は Responses API の別個の品質モードです。6 番目の effort ではなく、独立した評価候補として扱ってください。

Responses でリクエストごとに effort を設定する:

response = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "このモジュールをリファクタリングし、各変更を説明してください。"}],
    reasoning={"effort": "high"},
    max_output_tokens=8000,
)

Responses API でのツール呼び出し

関数ツールは Responses のフラットなツール形式を使います。モデルは function_call アイテムを返すことがあるので、実行して結果を function_call_output として返します。
tools = [{
    "type": "function",
    "name": "get_build_status",
    "description": "指定ブランチの最新 CI ビルドの状態を返す。",
    "parameters": {
        "type": "object",
        "properties": {"branch": {"type": "string"}},
        "required": ["branch"],
    },
}]

first = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "main ブランチはグリーンですか?そうでなければ失敗を要約してください。"}],
    tools=tools,
    reasoning={"effort": "medium"},
)

calls = [item for item in first.output if item.type == "function_call"]
outputs = []
for call in calls:
    # ここでツールを実行する
    outputs.append({
        "type": "function_call_output",
        "call_id": call.call_id,
        "output": '{"status": "failed", "step": "unit-tests", "log_url": "https://ci.example/123"}',
    })

second = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "main ブランチはグリーンですか?そうでなければ失敗を要約してください。"}]
          + list(first.output) + outputs,
    tools=tools,
    reasoning={"effort": "medium"},
)
print(second.output_text)
OpenAI は非同期ツール呼び出しも文書化しています。関数ツールに "async": true を指定すると、ツール実行中もモデルが推論を続けられます。EvoLink での対応は未検証です。同期ループの成功だけでは非同期呼び出しへの対応は確認できません。

構造化出力とストリーミング

構造化出力は両方のサーフェスで動きます。Responses では text.format で JSON Schema を渡します:
response = client.responses.create(
    model="gpt-6-astra",
    input="このテキストからモデル ID、コンテキストウィンドウ、出力上限を抽出してください:...",
    text={
        "format": {
            "type": "json_schema",
            "name": "model_spec",
            "schema": {
                "type": "object",
                "properties": {
                    "model_id": {"type": "string"},
                    "context_tokens": {"type": "integer"},
                    "max_output_tokens": {"type": "integer"},
                },
                "required": ["model_id", "context_tokens", "max_output_tokens"],
                "additionalProperties": False,
            },
            "strict": True,
        }
    },
    reasoning={"effort": "low"},
)
print(response.output_text)
ストリーミングはどちらのサーフェスでも stream=True です。高い effort では最初のトークンまで数十秒かかることがあるので、対話パスでは必ずストリーミングし、推論中は進捗を表示してください。

GPT-5.6 からの移行

次の表は OpenAI の移行要件です。EvoLink でトラフィックを切り替える前に、リクエストの各フィールドとオプション機能を検証してください。モデル ID の変更だけでは互換性を確認できません。

変更GPT-5.6GPT-6 Astra
モデル IDgpt-5.6-solgpt-5.6-terragpt-5.6-lunagpt-6-astra
サンプリングパラメータtemperaturetop_p を受け付ける削除する。残すとリクエストは 400 で失敗
推論 effort none / minimal受け付けるlow に置き換える
ツール呼び出しのサーフェスChat Completions または ResponsesResponses のみ
プロンプトキャッシュのオプションprompt_cache_retentionprompt_cache_options: {"ttl": "30m"}
Zero Data Retention 下の会話状態previous_response_id履歴を input で送る
Codex CLI最近のバージョンなら可0.153.0 以上

典型的な Chat Completions 呼び出しの diff:

 response = client.chat.completions.create(
-    model="gpt-5.6-sol",
+    model="gpt-6-astra",
     messages=messages,
-    temperature=0.2,
-    reasoning_effort="none",
+    reasoning_effort="low",
 )
挙動も変わります。OpenAI のガイダンスによると、Astra は複数ステップのタスクでより長く一貫性を保ち、確認の質問をより頻繁にし、AGENTS.md のようなファイル内の指示をより忠実に守り、リストと表を好みます。初期ユーザーは逆の失敗も報告しています:小さなチケットが非常に大きな diff になった、と。システムプロンプトで「最小限の変更」の指示を明示し、ロールバック用に GPT-5.6 をルーティング可能にしておいてください。
トラフィックを移す前に、同じ固定タスクセットを両モデルで実行してください。GPT-6 Astra と GPT-5.6 の比較に、合格タスク単価の式と出発点となるルーティング規則があります。

コストのルール:272K、キャッシュ、Batch と Flex

あるワークロードで Astra が Sol より高くつくか安くなるかは、3 つのルールで決まります。例は OpenAI 定価で計算しています。EvoLink の料金はそれより 10% 低く、API ページに掲載されています。

ルール 1:入力 272K トークン超で、リクエスト全体が再課金される

入力とキャッシュの単価は 2 倍、出力の単価は 1.5 倍になり、しきい値を超えた分だけでなくリクエスト全体に適用されます。

リクエスト入力コスト出力コスト(20K トークン)合計
入力 272,000 トークン272K × $10 = $2.7220K × $50 = $1.00$3.72
入力 280,000 トークン280K × $20 = $5.6020K × $75 = $1.50$7.10

8,000 トークン増えただけで請求額はほぼ倍になります。送信前にトークンを数え、帯域に近づいたらコンテキストを圧縮するか、長文コンテキスト単価が $8 / $30 の GPT-5.6 Sol にリクエストを回してください。

ルール 2:キャッシュは最初の再利用から元が取れる

キャッシュ書き込みは100万トークンあたり $12.50(入力の 1.25 倍)、キャッシュ読み取りは $1.00 です。共有プレフィックスをあと k 回送る場合:
  • キャッシュなし:プレフィックス100万トークンあたり 10 × (k + 1) ドル
  • キャッシュあり:12.50 + 1 × k
k = 1 で $20 対 $13.50 なので、最初の再利用でキャッシュが勝ち、その後は差が広がります。安定した内容(システムプロンプト、ツールスキーマ、参照ドキュメント)を入力の先頭に置き、30 分の TTL に注意してください。それより長く待機したセッションは書き込みを再度支払います。

ルール 3:Batch と Flex は半額

OpenAI では Batch と Flex は Standard の 50% です。オフライン評価、夜間処理、過去データの処理で検討できます。Fast は 2 倍の料金で、Astra のレイテンシ SLA はなく、EU データレジデンシでは利用できません。EvoLink での各モードの対応と課金は未検証です。対象ルートで確認する前に提供元の割引を EvoLink の見積もりに適用しないでください。

ルールを組み合わせる

以下は OpenAI の機能に基づく評価候補です。EvoLink 経由の Batch や configuration_update は、対象ルートの対応を検証してから使用してください。
ワークロード最も安価で安全な構成
対話型コーディングエージェント、コンテキスト 50K〜150KResponses、medium、キャッシュ有効、コンテキストは 272K 未満に維持
夜間のリポジトリ分析Batch、high、272K 未満のチャンク
大量の短い抽出Chat Completions、low。品質が許せば GPT-5.6 Terra / Luna
リトライを伴う長いリサーチチェーンResponses、medium から configuration_update で段階的に上げ、Sol へフォールバック

レート制限とフォールバック

OpenAI は Astra のレート制限を利用ティア別に公開しています。フルコンテキストのリクエスト 1 件が 1 分あたりのトークン予算を超え得るため、この数字は重要です。

OpenAI ティア1 分あたりリクエスト数1 分あたりトークン数
Tier 1500500,000
Tier 25,0001,000,000
Tier 35,0002,000,000
Tier 410,0004,000,000
Tier 515,00040,000,000

EvoLink では制限はアカウントごとに設定されます。負荷テストの前にダッシュボードを確認してください。明示的に扱うべき失敗モードは 3 つあります:

  1. リクエスト形式による 400。 temperaturetop_p、effort none、Chat Completions でのツール指定。リクエストを修正し、リトライしない。
  2. 429 または 5xx。 バックオフ付きでリトライし、その後同じキーで gpt-5.6-sol にフォールバック。タイムアウト、リトライ、フォールバックのガイドがこのパターンを扱っています。
  3. OpenAI の安全モニターによるタスク停止。 Astra は非同期のミスアライメント監視下で動作し、発火すると API タスクは停止します。ログを残し、運用者に通知し、ループさせずにフォールバックモデルへタスクを回してください。
def call_with_fallback(**kwargs):
    for model in ("gpt-6-astra", "gpt-5.6-sol"):
        try:
            return client.responses.create(model=model, **kwargs)
        except Exception as err:  # 本番では 429/5xx に絞る
            last = err
    raise last

FAQ

GPT-6 にはどのモデル ID を使いますか?

gpt-6-astra です。OpenAI にも EvoLink にも汎用の gpt-6 エイリアスはなく、同じ文字列が Chat Completions と Responses の両方で使えます。

Chat Completions で GPT-6 Astra のツールを使えますか?

使えません。OpenAI ではこのモデルのツール呼び出しは Responses のみですが、Chat Completions はテキストと画像の入力を受け付けます。EvoLink 経由の画像入力は対象ルートでの検証が必要です。

どの推論 effort から始めるべきですか?

コーディングやエージェントのタスクは medium、以前 none または minimal を使っていたタスクは low から始めてください。OpenAI は configuration_update によるタスクごとの引き上げを文書化しています。EvoLink 経由では対象ルートで検証してから使用してください。

GPT-6 Astra は temperature を受け付けますか?

受け付けません。temperaturetop_plogprobs は 400 を返します。リクエストから削除してください。

入力 272K トークンを超えるリクエストの課金は?

リクエスト全体が長文コンテキスト帯に移ります:入力とキャッシュは 2 倍、出力は 1.5 倍。先にトークンを数え、しきい値に近づいたら圧縮するか分割してください。

GPT-5.6 から移行するときに何が変わりますか?

モデル ID を変更し、temperaturetop_p を削除し、nonelow に置き換え、ツール呼び出しを Responses に移します。OpenAI はキャッシュオプションの変更も文書化しています。EvoLink のエンドポイントとキーは同じですが、移行前にキャッシュオプションと高度な機能を対象ルートで検証してください。

GPT-6 Astra は Amazon Bedrock にありますか?

2026年9月5日時点ではありません。OpenAI は Bedrock をチャネルとして挙げましたが、AWS の OpenAI モデルカードは GPT-5.6 止まりです。Azure Foundry は一般提供として掲載しています。リリーストラッカーは変化があれば更新します。
GPT-6 Astra API ページに、OpenAI 定価の 10% 引きのデフォルトグループ料金、長文コンテキスト帯、計算機があります。
EvoLink で GPT-6 Astra を呼び出す

出典

証拠の最終確認日:2026年9月5日。提供元の事実は OpenAI のドキュメントに基づき、コミュニティの effort 推奨は出典付きで、EvoLink の測定ではありません。現在の EvoLink 料金は API ページをご覧ください。

AIコストを89%削減する準備はできましたか?

今すぐEvoLinkを始めて、インテリジェントなAPIルーティングの力を体験してください。