
GPT-6 Astra API 사용법: 첫 호출, effort 수준, GPT-5.6에서 마이그레이션

gpt-6-astra로, GPT-5.6과 같은 OpenAI 호환 endpoint와 API 키를 사용하며, 가격은 OpenAI 정가보다 10% 낮습니다.configuration_update, 캐시 옵션 30m의 지원을 확인할 수는 없습니다. 사용 전에 EvoLink의 해당 라우트에서 각 기능을 따로 검증하세요.빠른 참조 카드
| 항목 | 값 |
|---|---|
| 모델 ID | gpt-6-astra(OpenAI와 EvoLink 모두 gpt-6 alias 없음) |
| Endpoint | https://api.evolink.ai/v1(OpenAI 호환) |
| API 표면(OpenAI) | Responses, Chat Completions(도구 호출 미지원), Batch; EvoLink 기능 지원은 별도 검증 필요 |
| 컨텍스트 윈도 | 입력과 출력이 공유하는 1,050,000 토큰; 최대 입력 922,000; 최대 출력 128,000 |
| 입력 / 출력 | 텍스트·이미지 입력, 텍스트 출력 |
| 지식 기준일 | 2026년 4월 30일 |
| 추론 effort | low, medium, high, xhigh, max; none과 minimal은 400 반환 |
| 제거된 파라미터 | temperature, top_p, logprobs |
| 프롬프트 캐싱 | 지원; 캐시 쓰기는 입력의 1.25배; TTL 옵션은 30m |
| OpenAI 정가(입력 ≤ 272K) | 100만 토큰당 입력 $10 / 캐시 $1 / 캐시 쓰기 $12.50 / 출력 $50 |
| 장문 컨텍스트 구간(입력 > 272K) | 전체 요청이 입력·캐시 2배, 출력 1.5배 |
| EvoLink 가격 | OpenAI 정가보다 10% 낮음; 현재 수치는 API 페이지 |
| 미지원 | 파인튜닝, Realtime, Assistants, Embeddings, 이미지·오디오 생성 |
설정과 첫 요청
1단계: EvoLink API 키 발급
2단계: OpenAI SDK 설치
pip install openai # Python
npm install openai # Node.js3단계: 첫 요청 보내기
먼저 기본 Responses 요청으로 시작하세요. OpenAI에서는 도구 호출에 Responses가 필요하며, 고급 Responses 기능은 EvoLink 해당 라우트에서 별도로 검증해야 합니다.
curl https://api.evolink.ai/v1/responses \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gpt-6-astra",
"input": "캐시 읽기와 캐시 쓰기의 차이를 한 문단으로 설명해 주세요.",
"reasoning": {"effort": "medium"}
}'from openai import OpenAI
client = OpenAI(
api_key="your-evolink-api-key",
base_url="https://api.evolink.ai/v1",
)
response = client.responses.create(
model="gpt-6-astra",
input="캐시 읽기와 캐시 쓰기의 차이를 한 문단으로 설명해 주세요.",
reasoning={"effort": "medium"},
)
print(response.output_text)
print(response.model, response.usage)import OpenAI from "openai";
const client = new OpenAI({
apiKey: "your-evolink-api-key",
baseURL: "https://api.evolink.ai/v1",
});
const response = await client.responses.create({
model: "gpt-6-astra",
input: "캐시 읽기와 캐시 쓰기의 차이를 한 문단으로 설명해 주세요.",
reasoning: { effort: "medium" },
});
console.log(response.output_text);
console.log(response.model, response.usage);response.model과 response.usage를 출력하세요. 반환된 모델 문자열은 gpt-6-astra여야 하고, usage 블록에는 입력, 캐시, 추론, 출력 토큰이 표시됩니다. 청구서를 대조하려면 이 값이 필요합니다.Chat Completions의 텍스트 전용 요청
temperature, top_p, tools는 전달하지 마세요:response = client.chat.completions.create(
model="gpt-6-astra",
messages=[{"role": "user", "content": "이 변경 로그를 세 줄로 요약해 주세요: ..."}],
reasoning_effort="low",
)
print(response.choices[0].message.content)Chat Completions vs Responses API
| 기능 | Chat Completions | Responses API |
|---|---|---|
| 텍스트 입력, 텍스트 출력 | 지원 | 지원 |
| 이미지 입력 | 지원 | 지원 |
| 스트리밍 | 지원 | 지원 |
| 구조화 출력 | 지원 | 지원 |
| 프롬프트 캐싱 | 지원 | 지원 |
| Function / 도구 호출 | 미지원 | 지원 |
| 비동기 도구 호출 | 미지원 | 지원 |
턴 중간 조정(WebSocket의 response.steer) | 미지원 | 지원 |
캐시를 유지한 채 대화 중간에 effort 변경(configuration_update) | 미지원 | 지원 |
reasoning.mode: "pro" | 미지원 | 지원 |
temperature, top_p, logprobs | 거부 | 거부 |
에이전트 루프가 지금 Chat Completions 위에 있다면 Responses로 옮기거나, Chat Completions에서도 도구 호출을 지원하는 GPT-5.6에 남겨 두세요.
previous_response_id가 동작하지 않습니다. 대화 이력은 input에 명시적으로 넣어 보내세요.추론 effort 선택하기
none이나 minimal을 썼다면 low에서 시작해 비교하라는 것입니다. 출시 직후 마이그레이션 기록을 공개한 개발자들은 코딩 작업의 기본 출발점으로 medium에 수렴했습니다. 이는 커뮤니티 보고이지 EvoLink 측정값이 아닙니다.| Effort | 적합한 용도 | 주의할 점 |
|---|---|---|
low | 추출, 분류, 짧은 재작성, GPT-5.6에서 none으로 돌리던 모든 것 | 여전히 추론 토큰이 발생; 무료 티어가 아님 |
medium | 코딩 작업, 다단계 도구 사용, 문서 작업의 기본값 | 서드파티 실행에서 low 대비 품질 상승 폭이 크고 비용 상승은 완만 |
high | 저장소 규모 변경, 긴 리서치 체인 | 첫 토큰까지 시간과 토큰 지출이 급증 |
xhigh | high가 수락 테스트에 실패하는 어려운 에이전트 작업 | 비쌈; 자체 평가 세트로 검증 |
max | 제약 없는 추론 예산 | 서드파티 측정에서 첫 토큰까지 수 분; 오프라인 배치 외에는 거의 수지가 맞지 않음 |
OpenAI는 두 가지 추가 제어 기능을 문서화했습니다. EvoLink에서의 지원은 아직 검증되지 않았으므로 다음 내용은 공급자 API 참고 정보로 사용하세요.
- **
configuration_update**를 쓰면 Responses 대화에서 프롬프트 캐시를 무효화하지 않고 턴 사이에 effort를 바꿀 수 있습니다.medium에서 시작하고, 실패한 턴만 올리세요. - **
reasoning.mode: "pro"**는 Responses API의 별도 품질 모드입니다. 여섯 번째 effort 수준이 아니라 독립된 평가 후보로 취급하세요.
Responses에서 요청별로 effort를 설정하기:
response = client.responses.create(
model="gpt-6-astra",
input=[{"role": "user", "content": "이 모듈을 리팩터링하고 각 변경을 설명해 주세요."}],
reasoning={"effort": "high"},
max_output_tokens=8000,
)Responses API에서 도구 호출
function_call 항목을 반환할 수 있으니, 실행한 뒤 결과를 function_call_output으로 되돌려 보내세요.tools = [{
"type": "function",
"name": "get_build_status",
"description": "브랜치의 최신 CI 빌드 상태를 반환합니다.",
"parameters": {
"type": "object",
"properties": {"branch": {"type": "string"}},
"required": ["branch"],
},
}]
first = client.responses.create(
model="gpt-6-astra",
input=[{"role": "user", "content": "main 브랜치가 통과 상태인가요? 아니라면 실패 원인을 요약해 주세요."}],
tools=tools,
reasoning={"effort": "medium"},
)
calls = [item for item in first.output if item.type == "function_call"]
outputs = []
for call in calls:
# 여기서 도구를 실행하세요
outputs.append({
"type": "function_call_output",
"call_id": call.call_id,
"output": '{"status": "failed", "step": "unit-tests", "log_url": "https://ci.example/123"}',
})
second = client.responses.create(
model="gpt-6-astra",
input=[{"role": "user", "content": "main 브랜치가 통과 상태인가요? 아니라면 실패 원인을 요약해 주세요."}]
+ list(first.output) + outputs,
tools=tools,
reasoning={"effort": "medium"},
)
print(second.output_text)"async": true를 지정하면 도구 실행 중에도 모델이 추론을 계속할 수 있습니다. EvoLink 지원은 아직 검증되지 않았으며, 동기 루프 성공만으로 비동기 지원을 확인할 수는 없습니다.구조화 출력과 스트리밍
text.format으로 JSON 스키마를 전달합니다:response = client.responses.create(
model="gpt-6-astra",
input="이 텍스트에서 모델 ID, 컨텍스트 윈도, 출력 한도를 추출해 주세요: ...",
text={
"format": {
"type": "json_schema",
"name": "model_spec",
"schema": {
"type": "object",
"properties": {
"model_id": {"type": "string"},
"context_tokens": {"type": "integer"},
"max_output_tokens": {"type": "integer"},
},
"required": ["model_id", "context_tokens", "max_output_tokens"],
"additionalProperties": False,
},
"strict": True,
}
},
reasoning={"effort": "low"},
)
print(response.output_text)stream=True입니다. 높은 effort 수준에서는 첫 토큰까지 수십 초가 걸릴 수 있으니, 대화형 경로에서는 반드시 스트리밍하고 추론 중에는 진행 상황을 표시하세요.GPT-5.6에서 마이그레이션
다음 표는 OpenAI의 마이그레이션 요구 사항입니다. EvoLink에서 트래픽을 옮기기 전에 요청 필드와 선택 기능을 각각 검증하세요. 모델 ID 변경만으로 호환성을 확인할 수는 없습니다.
| 변경 | GPT-5.6 | GPT-6 Astra |
|---|---|---|
| 모델 ID | gpt-5.6-sol, gpt-5.6-terra, gpt-5.6-luna | gpt-6-astra |
| 샘플링 파라미터 | temperature, top_p 허용 | 제거; 남기면 요청이 400으로 실패 |
추론 effort none / minimal | 허용 | low로 매핑 |
| 도구 호출 표면 | Chat Completions 또는 Responses | Responses 전용 |
| 프롬프트 캐시 옵션 | prompt_cache_retention | prompt_cache_options: {"ttl": "30m"} |
| Zero Data Retention 하의 대화 상태 | previous_response_id | 이력을 input으로 전송 |
| Codex CLI | 최근 버전이면 가능 | 0.153.0 이상 |
일반적인 Chat Completions 호출의 diff:
response = client.chat.completions.create(
- model="gpt-5.6-sol",
+ model="gpt-6-astra",
messages=messages,
- temperature=0.2,
- reasoning_effort="none",
+ reasoning_effort="low",
)AGENTS.md 같은 파일의 지시를 더 문자 그대로 따르고, 목록과 표를 선호합니다. 초기 사용자들은 반대의 실패도 보고했습니다: 작은 티켓이 매우 큰 diff로 변한 사례입니다. 시스템 프롬프트에 "최소 변경" 지시를 명시하고, 롤백을 위해 GPT-5.6을 라우팅 가능한 상태로 두세요.비용 규칙: 272K, 캐싱, Batch와 Flex
규칙 1: 입력 272K 토큰을 넘으면 전체 요청의 가격이 다시 매겨진다
입력과 캐시 요율은 두 배가 되고 출력 요율은 1.5배가 되며, 임계값을 넘은 토큰만이 아니라 요청 전체에 적용됩니다.
| 요청 | 입력 비용 | 출력 비용(20K 토큰) | 합계 |
|---|---|---|---|
| 입력 272,000 토큰 | 272K × $10 = $2.72 | 20K × $50 = $1.00 | $3.72 |
| 입력 280,000 토큰 | 280K × $20 = $5.60 | 20K × $75 = $1.50 | $7.10 |
8천 토큰이 더해지자 청구액이 거의 두 배가 됩니다. 보내기 전에 토큰을 세고, 구간에 가까워지면 컨텍스트를 압축하거나, 장문 컨텍스트 요율이 $8 / $30인 GPT-5.6 Sol로 요청을 라우팅하세요.
규칙 2: 캐싱은 첫 재사용부터 이득이다
k번 더 보낸다면:- 캐시 없음: prefix 100만 토큰당
10 × (k + 1)달러 - 캐시 있음:
12.50 + 1 × k
k = 1에서 $20 대 $13.50이므로, 캐싱은 첫 재사용에서 이기고 그 뒤로 격차가 벌어집니다. 안정적인 내용(시스템 프롬프트, 도구 스키마, 참조 문서)을 입력 앞부분에 두고, 30분 TTL에 유의하세요. 그보다 오래 유휴 상태인 세션은 쓰기 비용을 다시 냅니다.규칙 3: Batch와 Flex는 절반 가격
OpenAI에서 Batch와 Flex는 Standard의 50%입니다. 오프라인 평가, 야간 처리, 과거 데이터 처리에 검토할 수 있습니다. Fast는 2배 요금이며 Astra의 지연 SLA가 없고 EU 데이터 레지던시에서는 사용할 수 없습니다. EvoLink에서 해당 모드의 지원과 과금은 아직 검증되지 않았습니다. 라우트별 확인 없이 공급자 할인을 EvoLink 비용 추정에 적용하지 마세요.
규칙을 합치면
configuration_update는 해당 라우트의 지원을 검증한 뒤 사용하세요.| 워크로드 | 가장 저렴하고 안전한 설정 |
|---|---|
| 대화형 코딩 에이전트, 50K~150K 컨텍스트 | Responses, medium, 캐싱 켬, 컨텍스트 272K 미만 유지 |
| 야간 저장소 분석 | Batch, high, 272K 미만 청크 |
| 대규모 짧은 추출 | Chat Completions, low, 또는 품질이 허용하면 GPT-5.6 Terra / Luna |
| 재시도가 있는 긴 리서치 체인 | Responses, medium에서 configuration_update로 상향, Sol로 fallback |
Rate limit과 fallback
OpenAI는 Astra의 rate limit을 사용 등급별로 공개합니다. 전체 컨텍스트 요청 하나가 분당 토큰 예산을 넘을 수 있어서 이 수치가 중요합니다.
| OpenAI 등급 | 분당 요청 수 | 분당 토큰 수 |
|---|---|---|
| Tier 1 | 500 | 500,000 |
| Tier 2 | 5,000 | 1,000,000 |
| Tier 3 | 5,000 | 2,000,000 |
| Tier 4 | 10,000 | 4,000,000 |
| Tier 5 | 15,000 | 40,000,000 |
EvoLink에서는 한도가 계정별로 설정됩니다. 부하 테스트 전에 대시보드를 확인하세요. 명시적으로 처리해야 할 실패 유형이 세 가지 있습니다:
- 요청 형식으로 인한 400.
temperature,top_p, effortnone, 또는 Chat Completions의 도구. 요청을 고치고 재시도하지 마세요. - 429 또는 5xx. 백오프로 재시도한 뒤 같은 키로
gpt-5.6-sol에 fallback하세요. 타임아웃, 재시도, fallback 가이드가 이 패턴을 다룹니다. - OpenAI 안전 모니터가 중단한 작업. Astra는 비동기 오정렬 모니터링 아래 실행되며, 발동하면 API 작업이 멈춥니다. 로그를 남기고 운영자에게 알리며, 루프를 돌리는 대신 fallback 모델로 작업을 라우팅하세요.
def call_with_fallback(**kwargs):
for model in ("gpt-6-astra", "gpt-5.6-sol"):
try:
return client.responses.create(model=model, **kwargs)
except Exception as err: # 프로덕션에서는 429/5xx로 좁히세요
last = err
raise lastFAQ
GPT-6에는 어떤 모델 ID를 쓰나요?
gpt-6-astra입니다. OpenAI와 EvoLink 모두 범용 gpt-6 alias가 없고, 같은 문자열이 Chat Completions와 Responses에서 동작합니다.Chat Completions에서 GPT-6 Astra의 도구를 쓸 수 있나요?
아니요. OpenAI에서 이 모델의 도구 호출은 Responses 전용이며, Chat Completions는 텍스트와 이미지 입력을 받습니다. EvoLink를 통한 이미지 입력은 해당 라우트에서 검증해야 합니다.
어떤 추론 effort로 시작해야 하나요?
medium, 기존에 none 또는 minimal을 사용한 작업은 low로 시작하세요. OpenAI는 configuration_update를 통한 작업별 상향을 문서화했습니다. EvoLink에서는 라우트 검증 후 사용하세요.GPT-6 Astra는 temperature를 받나요?
temperature, top_p, logprobs는 400을 반환합니다. 요청에서 제거하세요.입력 272K 토큰을 넘는 요청은 어떻게 과금되나요?
전체 요청이 장문 컨텍스트 구간으로 넘어갑니다: 입력과 캐시 요율 2배, 출력 1.5배. 먼저 토큰을 세고, 임계값에 가까워지면 압축하거나 나누세요.
GPT-5.6에서 마이그레이션할 때 무엇이 바뀌나요?
temperature와 top_p를 제거하고, none을 low로 매핑하고, 도구 호출을 Responses로 옮기세요. OpenAI는 캐시 옵션 변경도 문서화했습니다. EvoLink endpoint와 키는 같지만, 마이그레이션 전에 캐시 옵션과 고급 기능을 라우트에서 검증하세요.GPT-6 Astra는 Amazon Bedrock에 있나요?
GPT-6 Astra의 EvoLink 가격은 어디서 확인하나요?
참고 자료
- OpenAI: GPT-6 Astra 모델 문서
- OpenAI: GPT-6 Astra 모델 가이드(마이그레이션, 미지원 파라미터, Responses 전용 도구)
- OpenAI: 추론 가이드
- OpenAI: 프롬프트 캐싱 가이드
- OpenAI: Fast 모드 가이드
- OpenAI: rate limit 가이드
- OpenAI API 가격
- OpenAI: GPT-6 Astra 발표
- AWS: Amazon Bedrock의 OpenAI 모델 카드
- Shinsuke Kagawa: GPT-5.6 Sol에서 GPT-6 Astra로, medium effort부터 시작


