
GPT-6.1 Sol vs GPT-6 Sol: 입출력 요금은 같지만 캐시 비용과 전환 조건은 다릅니다
none 추론을 없애고 도구 호출에 Responses를 요구합니다. Chat Completions에서 도구를 쓰던 에이전트에는 모델 ID 교체 이상의 변경이 필요합니다.GPT-6.1 Sol과 GPT-6 Sol의 주요 차이
| 판단 항목 | GPT-6 Sol | GPT-6.1 Sol | 기존 에이전트에 생기는 변화 |
|---|---|---|---|
| 공식 모델 ID | gpt-6-sol | gpt-6.1-sol | 버전을 고정하고 일반 Sol 별칭에 의존하지 않기 |
| 입력 / 출력 | 텍스트·이미지 / 텍스트 | 텍스트·이미지 / 텍스트 | 새 출력 형식을 설계할 필요 없음 |
| 컨텍스트 / 최대 출력 | 1,050,000 / 128,000토큰 | 같은 상한 | 더 큰 컨텍스트 윈도우가 아님 |
| 지식 기준일 | 2026년 4월 20일 | 2026년 4월 30일 | 더 최근 기준일이 자체 작업의 품질 결과는 아님 |
| 추론 강도 | none, low, medium, high, xhigh, max | low, medium, high, xhigh, max; none, minimal 미지원 | 후보 설정에서 미지원 값을 제거 |
| Chat Completions 함수 호출 | none에서만 지원 | 미지원 | 도구 의존 작업을 검증된 Responses 경로로 이동 |
| Responses 도구 호출 | 지원 | 지원 | 도구 루프와 게이트웨이 동작은 계속 검증 |
| 스트리밍 / 구조화 출력 | OpenAI에 기재 | OpenAI에 기재 | 제공업체 지원만으로 개별 경로 지원을 입증할 수 없음 |
medium입니다. 상한이 같으므로 컨텍스트 크기보다 호환성과 승인 작업당 비용이 더 유용한 판단 기준입니다.공식 성능 근거가 말해 주는 것
| 평가 | GPT-6 Sol 대비 발표된 변화 | 조건과 판단 한계 |
|---|---|---|
| DeepSWE v1.1 | 기존 모델 최고 점수보다 +6.4퍼센트포인트 | 후보의 추론 강도와 비용이 낮았으며, 같은 강도 비교가 아님 |
| AutomationBench 1.0.6 | +4.8퍼센트포인트 | 같은 medium 설정. 여러 단계의 도구 작업과 관련 |
| OSWorld 2.0 | +7퍼센트포인트, 작업 비용은 절반 미만 | 최대 추론 강도. 오프라인 v2026.08.08 세트의 부분 보상 |
이 근거는 복잡한 코드 변경과 업무 도구 흐름을 시험 대상으로 삼을 이유가 됩니다. OSWorld의 부분 보상은 작업 진행 정도를 측정하므로, 자체 성공·실패 기준의 승인율로 대체할 수 없습니다. OpenAI는 연구/API 환경이 운영 ChatGPT와 다를 수 있다고도 설명합니다. 결과를 인용할 때 평가 환경, 추론 강도, 비용 범위를 유지하세요.
현재 모델이 이미 통과하는 일상 작업에는 전면 교체의 근거가 상대적으로 적습니다. 아래의 동일 작업 비교로 어떤 개선이 실제 작업에 적용되는지 확인하세요. 이 결과로 자체 지연 시간, 재시도율, EvoLink 청구액을 추정하면 안 됩니다.
성능 판단 전에 엔드포인트부터 결정하기
실질적으로 다른 전환은 세 가지입니다. 하나의 시험으로 합치면 실패를 해석하기 어려워집니다.
| 기존 작업 흐름 | 후보 경로 | 첫 승인 점검 |
|---|---|---|
| 도구 없는 Chat Completions, 지원 추론 강도 | 6.1 Sol의 문서화된 도구 없는 규약 시험 | 응답 파싱, 출력 형태, 실제 청구 사용량 |
none으로 Chat Completions 도구 사용 | 도구 흐름을 Responses로 바꾸고 지원 강도 선택 | 도구 요청, 결과 연결, 이어 실행, 재시도 동작 |
| 도구가 있는 Responses | 흐름을 유지하고 새 ID와 지원 강도 고정 | 전체 도구 루프, 구조화 결과, 사용 시 스트리밍·취소 |
none 제거는 지연, 출력 사용량, 동작을 바꿀 수 있습니다.도구 의존 전환에서는 먼저 엔드포인트, 강도, 도구 정의, 결과 식별자, 이어 실행 처리를 목록화하세요. 이후 요청한 호출과 결과를 연결하는 방식까지 포함해 도구 루프를 Responses에 맞춥니다. 성공한 도구 동작, 실패한 동작, 취소한 실행을 샌드박스에서 재생하고 최종 텍스트뿐 아니라 생성된 레코드도 확인하세요. 클라이언트에서 사용한다면 구조화 출력 파싱과 스트리밍도 점검합니다. 그 다음 품질을 비교하세요.
호환성 실패와 승인되지 않은 작업을 구분합니다. 시범 운영 전에 정확한 게이트웨이 경로의 규약과 청구를 검증하고, 기존 모델·엔드포인트·파서를 함께 복원 설정으로 유지하세요.
캐시 읽기 할인은 전체 작업 할인보다 작습니다
| 토큰 구분 | GPT-6 Sol, 입력 272K 이하 | GPT-6.1 Sol, 입력 272K 이하 | GPT-6.1 Sol, 입력 272K 초과 |
|---|---|---|---|
| 비캐시 입력 | $2.00 | $2.00 | $4.00 |
| 캐시 읽기 | $0.20 | $0.10 | $0.20 |
| 캐시 쓰기 | $2.50 | $2.50 | $5.00 |
| 출력 | $10.00 | $10.00 | $15.00 |
6 Sol 대비 직접 변화는 캐시 읽기 단가가 50% 낮아진다는 것입니다. 6.1 Sol 자체의 일반 입력 단가와 비교하면 캐시 읽기는 95% 저렴합니다. 어느 쪽도 전체 작업이 50% 또는 95% 저렴하다는 뜻이 아닙니다. 출력, 비캐시 입력, 캐시 쓰기에는 같은 인하가 적용되지 않았습니다.
| 100만 입력 토큰 중 캐시 비율 | GPT-6 Sol 입력 + 출력 | GPT-6.1 Sol 입력 + 출력 | 직접 절감 |
|---|---|---|---|
| 40% | $1.20 비캐시 + $0.08 캐시 + $1.00 출력 = $2.28 | $1.20 + $0.04 + $1.00 = $2.24 | $0.04 |
| 90% | $0.20 비캐시 + $0.18 캐시 + $1.00 출력 = $1.38 | $0.20 + $0.09 + $1.00 = $1.29 | $0.09 |
이 비율은 가정이며 측정된 적중률도, 재사용 프롬프트가 반드시 캐시 대상이 된다는 약속도 아닙니다. 후보의 추론 출력이 더 길거나 재시도가 한 번 늘면 예시의 절감액이 사라질 수 있습니다. 반대로 승인율 향상은 캐시 차이보다 큰 가치를 만들 수 있습니다. 토큰 단가표만으로 성공을 선언하지 말고 두 효과를 모두 측정하세요.
실제 작업 여섯 가지로 동일 작업 평가 구성하기

두 모델을 실행하기 전에 최근 작업, 저장소 버전, 승인 규칙을 고정하세요. 일상 작업과 함께 기존 에이전트가 실패하거나 사람이 개입한 사례도 포함합니다. 도구 권한과 재시도 한도를 동일하게 유지하고, 필요한 엔드포인트·평가 환경 변경은 보고하세요. 완벽하게 통제된 실험인 것처럼 다루지 않습니다.
| 작업 | 입력과 기대 결과 | 승인 신호 | 비용·실패 신호 | 시험 우선순위 |
|---|---|---|---|---|
| 여러 파일의 버그 수정 | 고정 저장소와 이슈 → 패치 | 무관한 변경 없이 필수 테스트 통과 | 재시도, 재작업, 검토자 개입 | 실패와 검토 부담이 큰 변경부터 시작 |
| PR 검토 | 고정 diff와 규칙 → 지적 사항 | 확인된 결함과 허용 가능한 오탐 | 잘못된 경고를 확인하는 시간 | 추가 지적이 검토 잡음을 늘리면 기준 유지 |
| 컨텍스트 재사용 에이전트 | 저장 맥락과 허용 도구 → 완료 작업 | 제약 유지, 중복 부작용 없음 | 캐시 읽기·쓰기와 추론 출력 | 사용량에서 충분한 캐시 읽기가 확인될 때 시험 |
| 문서 질문 | 고정 문서와 질문 → 근거 있는 답변 | 정확한 필드와 추적 가능한 근거 | 근거 없는 결론과 검토 시간 | 단순 검색뿐 아니라 표와 상충하는 증거도 시험 |
| 업무 도구 흐름 | 목표와 샌드박스 도구 → 기대 최종 레코드 | 올바른 순서와 레코드 상태 | 중복 쓰기 또는 잘못 연결된 도구 결과 | 모델 품질 판단 전에 도구 루프 검증 |
| 어려운 작업의 상위 경로 전환 | 고정 작업 대기열 → 승인 결과 | 전체 대기열에서 품질 기준 충족 | 후보·상위 경로·대체 모델 비용의 합 | 어려운 작업용 별도 경로부터 시험 |
거부 규칙은 실행 전에 정합니다. 예를 들어 업무 흐름은 최종 답변이 맞아 보여도 모든 중복 쓰기를 거부할 수 있습니다. 패치에는 에이전트가 볼 수 있는 테스트 외에 숨겨진 테스트도 필요할 수 있습니다. JSON이 유효하다는 사실만으로 추출 필드의 정확성을 입증할 수 없습니다.
모든 시도에서 작업 ID, 모델 식별자, 엔드포인트, 강도, 도구 호출, 사용량, 재시도, 승인 여부, 검토 시간을 기록합니다. 표본 크기와 동일 작업에서의 판단 차이를 요약하세요. 작은 작업 집합은 차단 요인을 찾을 수 있지만 전체 모집단의 신뢰할 만한 개선을 입증할 수는 없습니다. 평균뿐 아니라 개별 실패도 조사하며, 특히 하나의 장기 작업이 청구를 지배하는 경우 주의합니다.
승인 작업당 비용을 비교한 뒤 단계적으로 전환하기
다음 회계 정의를 사용합니다.
사람의 검토 비용을 명시하세요. 문서화한 요율로 계산하거나 API 비용과 검토 분수를 함께 보고합니다. 한 모델의 결과에서만 조용히 빼면 안 됩니다. 승인 작업이 없으면 비율은 정의되지 않습니다. 저렴한 결과로 보고하지 말고 실패한 시험으로 기록하세요.
100개 작업의 전체 비용 계산 예시
| 지표 | 6 Sol 기준 | 6.1: 캐시만 | 6.1: 재작업 감소 | 6.1: 출력·재시도 |
|---|---|---|---|---|
| 비캐시 입력 / 캐시 읽기, 백만 토큰 | 4 / 6 | 4 / 6 | 3.6 / 5.4 | 4.8 / 7.2 |
| 캐시 쓰기 / 출력, 백만 토큰 | 0.4 / 1 | 0.4 / 1 | 0.36 / 0.9 | 0.48 / 1.8 |
| 추가 재시도 횟수 | 20 | 20 | 10 | 30 |
| 토큰 요금 | $20.20 | $19.60 | $17.64 | $29.52 |
| 가정한 도구 요금 | $3.00 | $3.00 | $2.70 | $3.60 |
| 검토 분수 / 비용 | 240 / $120 | 240 / $120 | 180 / $90 | 300 / $150 |
| 시험 총비용 | $143.20 | $142.60 | $110.34 | $183.12 |
| 100개 중 승인 수 | 80 | 80 | 90 | 75 |
| 승인 작업당 비용 | $1.79 | $1.78 | $1.23 | $2.44 |
4 × $2 + 6 × $0.20 + 0.4 × $2.50 + 1 × $10 = $20.20입니다. 도구와 검토를 더하면 승인 작업당 $143.20 ÷ 80 = $1.79가 됩니다. 재작업 감소 시나리오는 $110.34 ÷ 90 ≈ $1.23입니다.동작이 같으면 캐시 인하로 이 대기열 전체에서 절약하는 금액은 $0.60뿐입니다. 재작업 감소는 더 큰 효과를 낼 수 있지만, 출력·재시도·검토 증가로 효과가 사라질 수 있습니다. 이 예시는 6.1 Sol의 동작을 예측하지 않습니다. 모든 가정을 동일 작업의 사용량·승인·검토 기록으로 대체하고 EvoLink 판단에는 검증된 게이트웨이 요금을 쓰세요.
후보 실행 전에 시범 운영 기준 정하기
이 평가표를 복사하고 예시 정책을 팀의 서비스 요구 사항으로 바꾸세요. 글에서 제안하는 출발점이며 OpenAI 권고나 통계적 보장이 아닙니다.
| 지표 | 두 모델에서 기록할 내용 | 기준 예시 |
|---|---|---|
| 승인 작업 | 승인/배정 작업과 동일 작업의 판단 차이 | 후보가 기준보다 낮지 않을 것. 중요 작업의 퇴행은 별도 검토 |
| 실효 비용 | 모든 시도 비용 / 승인 작업 | 사전 합의한 품질 추가 비용이 없다면 기준 이하 |
| 지연 | 도구·재시도를 포함한 종단 간 p95 | 이 예시에서는 팀이 정한 75초 예산 이내 |
| 도구 정확성 | 잘못된 동작, 중복 쓰기, 최종 레코드 상태 | 시험 중 중복·무단 쓰기 0건. 발생 시 시범 운영 차단 |
| 규약과 청구 | 반환 모델 식별자, 지원 기능, 사용량, 실제 요금 | 운영 트래픽 전에 후보 경로 검증 완료 |
아래 판단은 가상의 100개 작업 예시를 이어갑니다. 지연과 동작 결과 역시 추가 가정입니다.
| 결과 | 예시 근거 | 다음 행동 |
|---|---|---|
| 제한적 시범 운영 시작 | 승인 90 대 기준 80, $1.23 대 $1.79, p95 70s, 잘못된 쓰기 없음, 경로·청구 검증 | 5%처럼 선택한 소규모 집단에 전송하고 확대 전 같은 기준 재점검 |
| 오프라인 평가 계속 | 필수 기준 위반은 없으나 검토자 판단 차이로 품질 결론이 미확정 | 논쟁 작업을 재평가하고 동일 작업 집합 확대. 운영은 기준 모델 유지 |
| 거부 또는 복원 | 승인 75와 $2.44, 또는 중복·무단 쓰기 발생 | 기준 설정으로 복원하고 실패한 계층 진단 |
복원할 때 모델, 엔드포인트, 강도, 도구 스키마, 파서를 함께 되돌립니다. 다른 모델로 재시도하기 전에 동작 상태를 확인해 중복 부작용을 방지하세요. 통합 게이트웨이는 모델 선택지를 유지하는 데 도움이 되지만, 경로 규약과 재시도 의미는 별도 점검이 필요합니다.
GPT-6 Sol을 유지하는 편이 나은 경우
도구 의존 클라이언트가 검증된 Responses 경로를 사용할 수 없거나, 새 게이트웨이 기능·청구가 미검증이거나, 시험이 품질·지연 기준을 통과하지 못한다면 기준 모델을 유지합니다. 캐시가 적고 출력이 많은 작업은 직접 요금 변화의 혜택이 작을 수 있습니다. 현재 모델이 일상 작업을 적은 재작업으로 통과한다면 전면 전환보다 어려운 작업에 집중한 시험을 우선하세요.
6.1 Sol이 더 새롭다는 이유로 6 Sol을 지원 종료 모델이라 부르면 안 됩니다. 레퍼런스는 모델을 구분하지만 이 글에는 기존 경로의 종료 지침이 확인되어 있지 않습니다. 변경할 이유가 문서화될 때까지 정확한 기존 식별자를 선택 가능하게 유지하세요.
FAQ
GPT-6.1 Sol은 GPT-6 Sol보다 저렴한가요?
OpenAI Standard 짧은 입력 정가에서는 일반 입력·출력이 같고 캐시 읽기가 절반입니다. 전체 비용은 캐시 사용, 출력, 재시도, 승인 결과에 달려 있습니다. EvoLink 요금은 별도 확인이 필요합니다.
모델 ID만 바꿔 전환할 수 있나요?
none에서 도구를 쓰는 Chat Completions 에이전트는 엔드포인트와 추론 설정을 전환해야 합니다.GPT-6.1 Sol은 none 추론을 지원하나요?
low, medium, high, xhigh, max를 명시하며 기본값은 medium입니다. none과 minimal은 모두 미지원입니다.새 Sol의 컨텍스트 윈도우가 더 큰가요?
아닙니다. 두 레퍼런스 모두 컨텍스트 1,050,000토큰, 최대 출력 128,000토큰입니다. 공유 컨텍스트 예산을 최대 입력으로 혼동하지 마세요.
EvoLink에서 GPT-6.1 Sol을 사용할 수 있나요?
9월 29일 기준 이 글은 해당 경로, 지원 기능, 판매 요금을 검증하지 않았습니다. 게이트웨이별 설정을 사용하기 전에 현재 카탈로그와 문서를 확인하세요.
전환에서 가장 유용한 지표는 무엇인가요?
승인 작업당 비용에 품질, 지연, 위험 동작 거부 규칙을 함께 적용합니다. 실패·대체 모델 비용을 포함하고 검토 시간을 드러내세요. 응답이 성공하고 저렴해도 작업에 실패하면 충분하지 않습니다.
출처
- GPT-6.1 Sol 모델 레퍼런스 — 새 규약과 상한.
- GPT-6 Sol 모델 레퍼런스 — 기준 규약과 상한.
- OpenAI API 가격 — Standard 요금, 캐시 청구, 긴 입력 조건.
- GPT-6.1 Sol 출시 발표 — 출시 맥락과 제공업체 평가. EvoLink 재현 실험이 아님.
공식 출처는 2026년 9월 29일 확인했습니다. 작업 예시는 설명용 계산과 시험 방법이며 측정된 사용량이나 절감 보장이 아닙니다.

