Seedance 2.5가 EvoLink에 출시되었습니다Seedance 2.5 체험하기
코드 패널이 API 게이트웨이를 통해 빛나는 AI 코어에 연결되는 모습을 표현한 개념 일러스트
guide

GPT-6 Astra API 사용법: 첫 호출, effort 수준, GPT-5.6에서 마이그레이션

EvoLink Team
EvoLink Team
Product Team
2026년 9월 5일
24분 소요
GPT-6 Astra는 어려운 엔드투엔드 코딩, 컴퓨터 사용, 리서치, 에이전트 작업을 위한 OpenAI의 현행 플래그십입니다. EvoLink에서는 모델 ID gpt-6-astra로, GPT-5.6과 같은 OpenAI 호환 endpoint와 API 키를 사용하며, 가격은 OpenAI 정가보다 10% 낮습니다.
이 가이드는 연동 레퍼런스입니다. 세 가지 언어의 첫 요청, 이 모델에서 Chat Completions와 Responses API의 차이, 추론 effort 선택법, 기존 GPT-5.6 연동에 필요한 정확한 변경 사항, 그리고 여러분의 워크로드에서 Astra가 Sol보다 비싼지 싼지를 결정하는 세 가지 과금 규칙을 다룹니다. 현재 EvoLink 가격, 모델 카드, 비용 계산기는 GPT-6 Astra API 페이지를 참고하세요.
공급자와 게이트웨이의 지원 범위. 아래 모델 기능은 OpenAI 문서를 기준으로 합니다. EvoLink는 여기에 표시한 endpoint를 사용하지만, 텍스트 요청 성공만으로 이미지 입력, Batch/Flex/Fast, WebSocket 스티어링, 비동기 도구, Pro 모드, configuration_update, 캐시 옵션 30m의 지원을 확인할 수는 없습니다. 사용 전에 EvoLink의 해당 라우트에서 각 기능을 따로 검증하세요.

빠른 참조 카드

항목
모델 IDgpt-6-astra(OpenAI와 EvoLink 모두 gpt-6 alias 없음)
Endpointhttps://api.evolink.ai/v1(OpenAI 호환)
API 표면(OpenAI)Responses, Chat Completions(도구 호출 미지원), Batch; EvoLink 기능 지원은 별도 검증 필요
컨텍스트 윈도입력과 출력이 공유하는 1,050,000 토큰; 최대 입력 922,000; 최대 출력 128,000
입력 / 출력텍스트·이미지 입력, 텍스트 출력
지식 기준일2026년 4월 30일
추론 effortlow, medium, high, xhigh, max; noneminimal은 400 반환
제거된 파라미터temperature, top_p, logprobs
프롬프트 캐싱지원; 캐시 쓰기는 입력의 1.25배; TTL 옵션은 30m
OpenAI 정가(입력 ≤ 272K)100만 토큰당 입력 $10 / 캐시 $1 / 캐시 쓰기 $12.50 / 출력 $50
장문 컨텍스트 구간(입력 > 272K)전체 요청이 입력·캐시 2배, 출력 1.5배
EvoLink 가격OpenAI 정가보다 10% 낮음; 현재 수치는 API 페이지
미지원파인튜닝, Realtime, Assistants, Embeddings, 이미지·오디오 생성

설정과 첫 요청

대시보드 → Keys에서 키를 만드세요. 같은 키로 GPT-5.6, Claude, Gemini, GPT-6 Astra를 라우팅합니다.

2단계: OpenAI SDK 설치

pip install openai        # Python
npm install openai        # Node.js

3단계: 첫 요청 보내기

먼저 기본 Responses 요청으로 시작하세요. OpenAI에서는 도구 호출에 Responses가 필요하며, 고급 Responses 기능은 EvoLink 해당 라우트에서 별도로 검증해야 합니다.

cURL:
curl https://api.evolink.ai/v1/responses \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "gpt-6-astra",
    "input": "캐시 읽기와 캐시 쓰기의 차이를 한 문단으로 설명해 주세요.",
    "reasoning": {"effort": "medium"}
  }'
Python:
from openai import OpenAI

client = OpenAI(
    api_key="your-evolink-api-key",
    base_url="https://api.evolink.ai/v1",
)

response = client.responses.create(
    model="gpt-6-astra",
    input="캐시 읽기와 캐시 쓰기의 차이를 한 문단으로 설명해 주세요.",
    reasoning={"effort": "medium"},
)

print(response.output_text)
print(response.model, response.usage)
Node.js:
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: "your-evolink-api-key",
  baseURL: "https://api.evolink.ai/v1",
});

const response = await client.responses.create({
  model: "gpt-6-astra",
  input: "캐시 읽기와 캐시 쓰기의 차이를 한 문단으로 설명해 주세요.",
  reasoning: { effort: "medium" },
});

console.log(response.output_text);
console.log(response.model, response.usage);
첫 호출에서 response.modelresponse.usage를 출력하세요. 반환된 모델 문자열은 gpt-6-astra여야 하고, usage 블록에는 입력, 캐시, 추론, 출력 토큰이 표시됩니다. 청구서를 대조하려면 이 값이 필요합니다.

Chat Completions의 텍스트 전용 요청

Chat Completions는 순수 텍스트 요청에 사용할 수 있습니다. temperature, top_p, tools는 전달하지 마세요:
response = client.chat.completions.create(
    model="gpt-6-astra",
    messages=[{"role": "user", "content": "이 변경 로그를 세 줄로 요약해 주세요: ..."}],
    reasoning_effort="low",
)
print(response.choices[0].message.content)

Chat Completions vs Responses API

이 표는 텍스트 및 이미지 입력을 포함한 OpenAI API의 기능을 설명합니다. EvoLink 지원 표가 아니므로 이미지 입력과 각 선택 기능을 사용할 라우트에서 검증하세요. 이 모델의 Chat Completions는 도구 호출을 지원하지 않습니다.
기능Chat CompletionsResponses API
텍스트 입력, 텍스트 출력지원지원
이미지 입력지원지원
스트리밍지원지원
구조화 출력지원지원
프롬프트 캐싱지원지원
Function / 도구 호출미지원지원
비동기 도구 호출미지원지원
턴 중간 조정(WebSocket의 response.steer)미지원지원
캐시를 유지한 채 대화 중간에 effort 변경(configuration_update)미지원지원
reasoning.mode: "pro"미지원지원
temperature, top_p, logprobs거부거부

에이전트 루프가 지금 Chat Completions 위에 있다면 Responses로 옮기거나, Chat Completions에서도 도구 호출을 지원하는 GPT-5.6에 남겨 두세요.

Responses 특유의 주의점 하나: Zero Data Retention을 켠 조직에서는 previous_response_id가 동작하지 않습니다. 대화 이력은 input에 명시적으로 넣어 보내세요.

추론 effort 선택하기

Astra는 다섯 단계를 노출합니다. OpenAI의 지침은 짧습니다: 이전 모델에서 none이나 minimal을 썼다면 low에서 시작해 비교하라는 것입니다. 출시 직후 마이그레이션 기록을 공개한 개발자들은 코딩 작업의 기본 출발점으로 medium에 수렴했습니다. 이는 커뮤니티 보고이지 EvoLink 측정값이 아닙니다.
Effort적합한 용도주의할 점
low추출, 분류, 짧은 재작성, GPT-5.6에서 none으로 돌리던 모든 것여전히 추론 토큰이 발생; 무료 티어가 아님
medium코딩 작업, 다단계 도구 사용, 문서 작업의 기본값서드파티 실행에서 low 대비 품질 상승 폭이 크고 비용 상승은 완만
high저장소 규모 변경, 긴 리서치 체인첫 토큰까지 시간과 토큰 지출이 급증
xhighhigh가 수락 테스트에 실패하는 어려운 에이전트 작업비쌈; 자체 평가 세트로 검증
max제약 없는 추론 예산서드파티 측정에서 첫 토큰까지 수 분; 오프라인 배치 외에는 거의 수지가 맞지 않음

OpenAI는 두 가지 추가 제어 기능을 문서화했습니다. EvoLink에서의 지원은 아직 검증되지 않았으므로 다음 내용은 공급자 API 참고 정보로 사용하세요.

  • **configuration_update**를 쓰면 Responses 대화에서 프롬프트 캐시를 무효화하지 않고 턴 사이에 effort를 바꿀 수 있습니다. medium에서 시작하고, 실패한 턴만 올리세요.
  • **reasoning.mode: "pro"**는 Responses API의 별도 품질 모드입니다. 여섯 번째 effort 수준이 아니라 독립된 평가 후보로 취급하세요.

Responses에서 요청별로 effort를 설정하기:

response = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "이 모듈을 리팩터링하고 각 변경을 설명해 주세요."}],
    reasoning={"effort": "high"},
    max_output_tokens=8000,
)

Responses API에서 도구 호출

함수 도구는 Responses의 평면 도구 형식을 사용합니다. 모델이 function_call 항목을 반환할 수 있으니, 실행한 뒤 결과를 function_call_output으로 되돌려 보내세요.
tools = [{
    "type": "function",
    "name": "get_build_status",
    "description": "브랜치의 최신 CI 빌드 상태를 반환합니다.",
    "parameters": {
        "type": "object",
        "properties": {"branch": {"type": "string"}},
        "required": ["branch"],
    },
}]

first = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "main 브랜치가 통과 상태인가요? 아니라면 실패 원인을 요약해 주세요."}],
    tools=tools,
    reasoning={"effort": "medium"},
)

calls = [item for item in first.output if item.type == "function_call"]
outputs = []
for call in calls:
    # 여기서 도구를 실행하세요
    outputs.append({
        "type": "function_call_output",
        "call_id": call.call_id,
        "output": '{"status": "failed", "step": "unit-tests", "log_url": "https://ci.example/123"}',
    })

second = client.responses.create(
    model="gpt-6-astra",
    input=[{"role": "user", "content": "main 브랜치가 통과 상태인가요? 아니라면 실패 원인을 요약해 주세요."}]
          + list(first.output) + outputs,
    tools=tools,
    reasoning={"effort": "medium"},
)
print(second.output_text)
OpenAI는 비동기 도구 호출도 문서화했습니다. 함수 도구에 "async": true를 지정하면 도구 실행 중에도 모델이 추론을 계속할 수 있습니다. EvoLink 지원은 아직 검증되지 않았으며, 동기 루프 성공만으로 비동기 지원을 확인할 수는 없습니다.

구조화 출력과 스트리밍

구조화 출력은 두 표면 모두에서 동작합니다. Responses에서는 text.format으로 JSON 스키마를 전달합니다:
response = client.responses.create(
    model="gpt-6-astra",
    input="이 텍스트에서 모델 ID, 컨텍스트 윈도, 출력 한도를 추출해 주세요: ...",
    text={
        "format": {
            "type": "json_schema",
            "name": "model_spec",
            "schema": {
                "type": "object",
                "properties": {
                    "model_id": {"type": "string"},
                    "context_tokens": {"type": "integer"},
                    "max_output_tokens": {"type": "integer"},
                },
                "required": ["model_id", "context_tokens", "max_output_tokens"],
                "additionalProperties": False,
            },
            "strict": True,
        }
    },
    reasoning={"effort": "low"},
)
print(response.output_text)
스트리밍은 두 표면 모두 stream=True입니다. 높은 effort 수준에서는 첫 토큰까지 수십 초가 걸릴 수 있으니, 대화형 경로에서는 반드시 스트리밍하고 추론 중에는 진행 상황을 표시하세요.

GPT-5.6에서 마이그레이션

다음 표는 OpenAI의 마이그레이션 요구 사항입니다. EvoLink에서 트래픽을 옮기기 전에 요청 필드와 선택 기능을 각각 검증하세요. 모델 ID 변경만으로 호환성을 확인할 수는 없습니다.

변경GPT-5.6GPT-6 Astra
모델 IDgpt-5.6-sol, gpt-5.6-terra, gpt-5.6-lunagpt-6-astra
샘플링 파라미터temperature, top_p 허용제거; 남기면 요청이 400으로 실패
추론 effort none / minimal허용low로 매핑
도구 호출 표면Chat Completions 또는 ResponsesResponses 전용
프롬프트 캐시 옵션prompt_cache_retentionprompt_cache_options: {"ttl": "30m"}
Zero Data Retention 하의 대화 상태previous_response_id이력을 input으로 전송
Codex CLI최근 버전이면 가능0.153.0 이상

일반적인 Chat Completions 호출의 diff:

 response = client.chat.completions.create(
-    model="gpt-5.6-sol",
+    model="gpt-6-astra",
     messages=messages,
-    temperature=0.2,
-    reasoning_effort="none",
+    reasoning_effort="low",
 )
동작도 달라집니다. OpenAI의 지침에 따르면 Astra는 다단계 작업에서 더 오래 일관성을 유지하고, 명확화 질문을 더 자주 하며, AGENTS.md 같은 파일의 지시를 더 문자 그대로 따르고, 목록과 표를 선호합니다. 초기 사용자들은 반대의 실패도 보고했습니다: 작은 티켓이 매우 큰 diff로 변한 사례입니다. 시스템 프롬프트에 "최소 변경" 지시를 명시하고, 롤백을 위해 GPT-5.6을 라우팅 가능한 상태로 두세요.
트래픽을 옮기기 전에 같은 고정 작업 세트를 두 모델에서 실행하세요. GPT-6 Astra vs GPT-5.6 비교에 합격 작업당 비용 공식과 출발점이 되는 라우팅 규칙이 있습니다.

비용 규칙: 272K, 캐싱, Batch와 Flex

특정 워크로드에서 Astra가 Sol보다 비싼지 싼지는 세 가지 규칙이 결정합니다. 예시는 OpenAI 정가를 쓰며, EvoLink 요율은 10% 낮고 API 페이지에 있습니다.

규칙 1: 입력 272K 토큰을 넘으면 전체 요청의 가격이 다시 매겨진다

입력과 캐시 요율은 두 배가 되고 출력 요율은 1.5배가 되며, 임계값을 넘은 토큰만이 아니라 요청 전체에 적용됩니다.

요청입력 비용출력 비용(20K 토큰)합계
입력 272,000 토큰272K × $10 = $2.7220K × $50 = $1.00$3.72
입력 280,000 토큰280K × $20 = $5.6020K × $75 = $1.50$7.10

8천 토큰이 더해지자 청구액이 거의 두 배가 됩니다. 보내기 전에 토큰을 세고, 구간에 가까워지면 컨텍스트를 압축하거나, 장문 컨텍스트 요율이 $8 / $30인 GPT-5.6 Sol로 요청을 라우팅하세요.

규칙 2: 캐싱은 첫 재사용부터 이득이다

캐시 쓰기는 100만 토큰당 $12.50(입력의 1.25배), 캐시 읽기는 $1.00입니다. 공유 prefix를 k번 더 보낸다면:
  • 캐시 없음: prefix 100만 토큰당 10 × (k + 1) 달러
  • 캐시 있음: 12.50 + 1 × k
k = 1에서 $20 대 $13.50이므로, 캐싱은 첫 재사용에서 이기고 그 뒤로 격차가 벌어집니다. 안정적인 내용(시스템 프롬프트, 도구 스키마, 참조 문서)을 입력 앞부분에 두고, 30분 TTL에 유의하세요. 그보다 오래 유휴 상태인 세션은 쓰기 비용을 다시 냅니다.

규칙 3: Batch와 Flex는 절반 가격

OpenAI에서 Batch와 Flex는 Standard의 50%입니다. 오프라인 평가, 야간 처리, 과거 데이터 처리에 검토할 수 있습니다. Fast는 2배 요금이며 Astra의 지연 SLA가 없고 EU 데이터 레지던시에서는 사용할 수 없습니다. EvoLink에서 해당 모드의 지원과 과금은 아직 검증되지 않았습니다. 라우트별 확인 없이 공급자 할인을 EvoLink 비용 추정에 적용하지 마세요.

규칙을 합치면

다음 구성은 OpenAI 기능에 기반한 평가 후보입니다. EvoLink를 통한 Batch 또는 configuration_update는 해당 라우트의 지원을 검증한 뒤 사용하세요.
워크로드가장 저렴하고 안전한 설정
대화형 코딩 에이전트, 50K~150K 컨텍스트Responses, medium, 캐싱 켬, 컨텍스트 272K 미만 유지
야간 저장소 분석Batch, high, 272K 미만 청크
대규모 짧은 추출Chat Completions, low, 또는 품질이 허용하면 GPT-5.6 Terra / Luna
재시도가 있는 긴 리서치 체인Responses, medium에서 configuration_update로 상향, Sol로 fallback

Rate limit과 fallback

OpenAI는 Astra의 rate limit을 사용 등급별로 공개합니다. 전체 컨텍스트 요청 하나가 분당 토큰 예산을 넘을 수 있어서 이 수치가 중요합니다.

OpenAI 등급분당 요청 수분당 토큰 수
Tier 1500500,000
Tier 25,0001,000,000
Tier 35,0002,000,000
Tier 410,0004,000,000
Tier 515,00040,000,000

EvoLink에서는 한도가 계정별로 설정됩니다. 부하 테스트 전에 대시보드를 확인하세요. 명시적으로 처리해야 할 실패 유형이 세 가지 있습니다:

  1. 요청 형식으로 인한 400. temperature, top_p, effort none, 또는 Chat Completions의 도구. 요청을 고치고 재시도하지 마세요.
  2. 429 또는 5xx. 백오프로 재시도한 뒤 같은 키로 gpt-5.6-sol에 fallback하세요. 타임아웃, 재시도, fallback 가이드가 이 패턴을 다룹니다.
  3. OpenAI 안전 모니터가 중단한 작업. Astra는 비동기 오정렬 모니터링 아래 실행되며, 발동하면 API 작업이 멈춥니다. 로그를 남기고 운영자에게 알리며, 루프를 돌리는 대신 fallback 모델로 작업을 라우팅하세요.
def call_with_fallback(**kwargs):
    for model in ("gpt-6-astra", "gpt-5.6-sol"):
        try:
            return client.responses.create(model=model, **kwargs)
        except Exception as err:  # 프로덕션에서는 429/5xx로 좁히세요
            last = err
    raise last

FAQ

GPT-6에는 어떤 모델 ID를 쓰나요?

gpt-6-astra입니다. OpenAI와 EvoLink 모두 범용 gpt-6 alias가 없고, 같은 문자열이 Chat Completions와 Responses에서 동작합니다.

Chat Completions에서 GPT-6 Astra의 도구를 쓸 수 있나요?

아니요. OpenAI에서 이 모델의 도구 호출은 Responses 전용이며, Chat Completions는 텍스트와 이미지 입력을 받습니다. EvoLink를 통한 이미지 입력은 해당 라우트에서 검증해야 합니다.

어떤 추론 effort로 시작해야 하나요?

코딩과 에이전트 작업은 medium, 기존에 none 또는 minimal을 사용한 작업은 low로 시작하세요. OpenAI는 configuration_update를 통한 작업별 상향을 문서화했습니다. EvoLink에서는 라우트 검증 후 사용하세요.

GPT-6 Astra는 temperature를 받나요?

아니요. temperature, top_p, logprobs는 400을 반환합니다. 요청에서 제거하세요.

입력 272K 토큰을 넘는 요청은 어떻게 과금되나요?

전체 요청이 장문 컨텍스트 구간으로 넘어갑니다: 입력과 캐시 요율 2배, 출력 1.5배. 먼저 토큰을 세고, 임계값에 가까워지면 압축하거나 나누세요.

GPT-5.6에서 마이그레이션할 때 무엇이 바뀌나요?

모델 ID를 바꾸고, temperaturetop_p를 제거하고, nonelow로 매핑하고, 도구 호출을 Responses로 옮기세요. OpenAI는 캐시 옵션 변경도 문서화했습니다. EvoLink endpoint와 키는 같지만, 마이그레이션 전에 캐시 옵션과 고급 기능을 라우트에서 검증하세요.

GPT-6 Astra는 Amazon Bedrock에 있나요?

2026년 9월 5일 기준으로는 없습니다. OpenAI는 Bedrock을 채널로 언급했지만 AWS의 OpenAI 모델 카드는 여전히 GPT-5.6까지입니다. Azure Foundry는 정식 제공으로 등재했습니다. 출시 추적은 변동이 있으면 업데이트됩니다.
GPT-6 Astra API 페이지에 OpenAI 정가보다 10% 낮은 기본 그룹 요율, 장문 컨텍스트 구간, 계산기가 있습니다.
EvoLink에서 GPT-6 Astra 호출하기

참고 자료

근거는 2026년 9월 5일에 검토했습니다. 공급자 사실은 OpenAI 문서에 기반하며, 커뮤니티의 effort 권장 사항은 출처를 밝혔고 EvoLink 측정값이 아닙니다. 현재 EvoLink 가격은 API 페이지를 참고하세요.

AI 비용을 89% 절감할 준비가 되셨나요?

오늘 EvoLink를 시작하고 지능형 API 라우팅의 힘을 경험해보세요.