GPT Image 2.5 Flare & Sunburst가 EvoLink에 출시되었습니다GPT Image 2.5 체험하기
메모리 타일과 복구 루프가 있는 구리색·파란 유리 워크플로로 Gemini 4 vs Claude Fable 5.1을 표현한 일러스트
analysis

Gemini 4 vs Claude Fable 5.1: 장기 실행 에이전트 선택

EvoLink Team
EvoLink Team
제품 팀
2026년 9월 16일
28분 소요
2026년 9월 16일 기준 추가할 수 있는 Gemini 4 라우트는 없습니다. Claude Fable 5.1을 유지하고, 향후 Gemini 4 라우트가 넘어야 할 기준선을 기록하세요. 2026년 9월 16일 현재, 장기 실행 에이전트 팀이 Claude Fable 5.1과 비교할 수 있는 Gemini 4 실행 근거는 없습니다. Google은 Gemini 4 사전 학습이 시작됐다는 것만 확인했습니다. 공개 API 항목, 모델 ID, 가격, 컨텍스트 수치, 캐시 규칙, 벤치마크가 모두 없습니다. Claude Fable 5.1에는 공개된 Anthropic 계약과 설정된 EvoLink 라우트가 있습니다. 따라서 Tech Lead나 FinOps 담당자의 결정은 "어떤 모델로 에이전트를 돌릴까"가 아니라 "나중에 Gemini 4 라우트가 증명할 구체적인 대상이 생기도록 지금 Fable 5.1에서 무엇을 기록할까"입니다. 오늘 장기 작업과 컨텍스트 재사용 기준선을 확보하고, 새 라우트가 트래픽을 얻기 전에 넘어야 할 게이트를 적어 두세요.
이 글은 한 가지 결정만 담당합니다: 두 모델 사이의 장기 실행 에이전트 선택입니다. 출시 타임라인 질문은 Gemini 4 출시 추적에, 현재 API 상태는 Gemini 4 페이지에, OpenAI 쪽은 Gemini 4 vs GPT-6 Astra에 있으며, 출시된 두 프런티어 모델의 비교는 Claude Fable 5.1 vs GPT-6 Astra에 있습니다. 그 글에 이미 가격이 붙은 캐시 계산 예시가 있으므로 이 글에서는 반복하지 않습니다.

상태 및 근거 표

질문Gemini 4Claude Fable 5.1안전한 결정
공식 상태Google이 사전 학습 확인(2026년 7월)Anthropic이 2026년 9월 1일 출시; Active(latest)로 표시격차를 능력 판정이 아니라 상태 격차로 취급
API 모델 ID미공개claude-fable-5-1(Anthropic)미공개 ID를 설정이나 코드에 절대 넣지 않기
컨텍스트 및 최대 출력미공개1M 컨텍스트; 128K 최대 출력(Anthropic)trace가 실제로 윈도의 어느 정도를 소비하는지 기록
입력 모달리티미공개텍스트·이미지 입력, 텍스트 출력(Anthropic)테스트 전에 각 워크로드에 필요한 모달리티 목록화
thinking 제어미공개adaptive thinking 항상 켜짐; 기본 effort high; 상대 지연은 Slower로 표기(Anthropic)나중 라우트를 같은 설정으로 테스트할 수 있도록 trace별 effort 설정 기록
캐시 가격 구조미공개100만 토큰당 입력 $10 / 출력 $50; 5분 캐시 쓰기 $12.50; 1시간 캐시 쓰기 $20; 캐시 읽기 100만 토큰당 $0.25(Anthropic 정가)양쪽이 TTL과 요율을 공개하기 전까지 캐시 경제성은 비교 불가
Batch 제공미공개Anthropic은 Batch 입력·출력을 표준의 50%로 표기Standard는 Standard와, Batch는 Batch와 비교
문서화된 비호환 변경미공개Anthropic 마이그레이션 가이드의 세 가지: 강제 tool choice 오류, 이전 모델과 5.1 thinking block 비호환, 이전 턴 편집 후 thinking block 무효화공개된 비호환 변경 목록은 테스트 가능하고, 없는 목록은 테스트 불가
EvoLink 라우트검증된 호출 가능 라우트 없음; 출시 알림 신청 가능설정된 라우트 claude-fable-5-1; 가격은 제품 페이지어떤 라우트든 첫 요청에서 반환 모델 신원 검증

Gemini 4 열은 비판이 아니라 측정할 수 있는 항목의 목록입니다. 모든 "미공개" 셀은 하네스에 이미 슬롯이 있어야 할 필드이며, 그래야 계약이 공개될 때 재설계 대신 값만 채워 넣을 수 있습니다.

평가할 가치가 있는 장기 실행 작업

장기 실행 에이전트 작업은 하나의 워크로드가 아닙니다. 팀이 Fable 5.1로 라우팅하는 trace 대부분은 다섯 가지 작업 유형으로 나뉘며, 각각 "합격"의 정의가 다릅니다. 유형별로 기준선을 기록하고, 향후 Gemini 4 라우트도 유형별로 판단하세요.

워크로드"합격"의 의미지금 Fable 5.1에서 기록할 것나중에 Gemini 4 라우트가 맞춰야 할 것
다중 파일 저장소 수리테스트 통과, diff 검토 완료, 무관한 파일 미변경읽고 편집한 파일, 도구 호출, 재시도, 검토에 소요된 시간(분), 합격 수정당 토큰같은 작업 세트, 테스트 스위트, 검토자 루브릭
다단계 리서치 및 지식 산출물인용이 확인되고, 구조가 브리프와 일치하고, 근거 없는 주장 없음가져온 출처, 요청된 수정, 산출물당 사실 수정같은 브리프와 사실 확인 절차
수 시간짜리 도구 루프유효한 최종 상태로 중지 조건에서 루프 종료루프 횟수, 실패한 도구 호출, 체크포인트, 재개 이벤트, 종료까지 실제 시간같은 도구, 권한, 재시도 예산, 중지 규칙
장문 문서 구조화 추출출력이 스키마를 통과하고, 샘플 필드가 원문과 일치문서 길이, 스키마 실패, 재실행, 고정 샘플의 필드 정확도같은 문서, 스키마, 샘플
고객 서비스 다단계 도구 플로사람 에스컬레이션 없이 정책 안에서 티켓 해결에스컬레이션, 잘못된 도구 호출, 정책 위반, 처리 시간같은 플로 정의와 정책 검사

동일 조건 실행이 없으므로 어느 행도 선호 모델을 명시하지 않습니다. 이 표는 두 번째 라우트가 생겼을 때 "같은 작업"이 무엇을 뜻할지만 고정합니다.

컨텍스트 재사용과 캐시 조건

장기 실행 에이전트는 매 턴 같은 저장소 맵, 도구 스키마, 지시문을 다시 보내므로 캐시 가격이 토큰 청구서를 지배합니다. 동시에 비교 중 오늘 시작할 수 없는 부분이기도 합니다.

Google은 Gemini 4의 캐시 TTL, 쓰기·읽기 요율, 캐시 범위(자동 접두부 캐싱 대 명시적 캐시 객체), 최소 캐시 가능 크기를 공개하지 않았습니다. 이 네 값이 없으면 분모가 없습니다. 5분 캐시 읽기는 1시간 읽기와 다른 제품이고, 요청별 접두부 캐시는 여러 에이전트가 공유하는 이름 있는 캐시와 다른 제품입니다. 서로 다른 TTL, 컨텍스트 범위, Batch 모드를 하나의 숫자로 섞을 수 없습니다.

Fable 5.1은 기록의 기준이 될 구조를 제공합니다. Anthropic은 100만 토큰당 5분 캐시 쓰기 $12.50, 1시간 쓰기 $20, 캐시 읽기 $0.25, 그리고 표준 입력·출력의 50%인 Batch를 문서화합니다. 모든 Fable trace에 대해 다음을 기록하세요:

  • 어떤 TTL을 왜 선택했는지(5분 이내 턴 간격, 또는 1시간 쓰기를 정당화한 공백);
  • 캐시된 접두부 크기와 작업 중 변경 빈도(접두부가 바뀌면 새 쓰기가 발생하므로);
  • 턴당 캐시 읽기 토큰 대 신규 입력 토큰;
  • trace가 Standard로 실행됐는지 Batch로 실행됐는지, 그리고 실행 시점에 Anthropic 가격 페이지가 Batch와 캐시 배율을 어떻게 결합했는지.
이 필드를 월별이 아니라 trace별로 유지하세요. Gemini 4가 캐시 계약을 공개하면, 서로 다른 대상을 설명하는 두 정가를 비교하는 대신 어떤 trace가 그 캐시의 대상이 되는지부터 알 수 있습니다. Fable 5.1의 EvoLink 요금은 제품 페이지에 있습니다.

재시도, 복구 및 사람의 개입 비용

사양표에는 절대 나오지 않지만 장기 실행 에이전트 예산의 대부분이 실제로 사라지는 층입니다. 사람이 막힌 부분을 풀어 준 뒤 세 번째 시도에서 완료된 trace는 한 번에 완료된 trace와 비용이 같지 않습니다. trace별로 여섯 가지 이벤트를 타임스탬프와 토큰 수와 함께 기록하세요:

  1. 루프 감지. 같은 인수의 같은 도구 호출이 미리 정한 임계값을 넘어 반복되는 것. 중지 규칙이 작동하기 전에 몇 턴을 소모했는지 기록합니다.
  2. 실패한 도구 호출. 공급자 측 오류, 도구 측 오류, 모델 측 잘못된 형식의 호출을 분리합니다. 세 번째만 모델 품질 신호이고, 나머지 둘은 새 라우트도 똑같이 지불할 인프라 비용입니다.
  3. 체크포인트 무결성. 저장된 각 상태가 실제로 작업을 복원할 수 있는지 검증합니다. 재개할 수 없는 체크포인트는 낭비된 출력에 전체 재실행이 더해진 것입니다.
  4. 중단 후 재개. rate limit, 타임아웃, 운영자 일시 중지 뒤 컨텍스트를 다시 구축하는 데 쓴 토큰을 첫 실행 토큰과 분리해 셉니다.
  5. thinking block 무효화. Anthropic 마이그레이션 가이드는 이전 턴을 편집하면 유지된 Fable 5.1 thinking block이 무효화된다고 문서화합니다. 압축이나 수정을 위해 히스토리를 다시 쓰는 프레임워크는 모두 이를 유발합니다. 얼마나 자주 발생하고 재사고 비용이 얼마인지 기록하세요. Gemini 4에 동등한 규칙이 있는지는 공개되지 않았습니다.
  6. 사람의 개입. 막힌 부분 해소, 수정, 작업 마무리에 쓴 검토에 소요된 시간(분)을 시간으로 기록해서 API 총액 안에 사라지지 않게 합니다.

이들을 별도의 사고 로그가 아니라 trace 레코드의 필드로 저장하세요. 재시도, 재개, 검토에 소요된 시간(분)이 토큰과 같은 작업 ID에 있어야만 합격 작업당 비용이 의미를 갖습니다.

전체 작업 비용 변수 표

아래 모든 수치의 분모는 완료되어 수락을 통과한 작업입니다. 완료됐지만 검토에 실패한 작업은 지출에는 포함되지만(비용을 지불했으므로) 분모에는 들어가지 않습니다. API 지출과 사람 시간은 별도 열에 두고, 분을 금액으로 바꾸는 것은 재무 팀이 소유한 단가로 보고 층에서만 하세요.

변수오늘 Fable 5.1에서 기록하는 방법Gemini 4 상태
입력 토큰EvoLink가 반환하는 usage 카운터로 턴당 신규(비캐시) 입력을 작업별로 합산계약 공개 전까지 알 수 없음
캐시 쓰기5분과 1시간 TTL로 나눈 쓰기 토큰과 작업당 쓰기 횟수계약 공개 전까지 알 수 없음
캐시 읽기작업당 캐시에서 제공된 토큰; 적중률(캐시 읽기 / (캐시 읽기 + 신규 입력))도 기록계약 공개 전까지 알 수 없음
출력 토큰최종 답변과 중간 도구 인수를 작업별로 합산계약 공개 전까지 알 수 없음
도구 호출 및 외부 비용작업당 호출 수와 계량 비용(검색, 코드 실행, 서드파티 API)계약 공개 전까지 알 수 없음
재시도첫 시도 이후의 시도 횟수와 시도별 토큰을 같은 작업 ID에 첨부계약 공개 전까지 알 수 없음
fallback 라우트 사용어떤 턴이 다른 모델로 처리됐는지와 어느 모델인지를 반환된 model 필드로 검증계약 공개 전까지 알 수 없음
사람 검토 분작업당 검토자 및 운영자 시간을 분으로 기록라우트가 생기면 직접 실행해 측정하는 값이며, 공급업체가 공개하는 수치가 아님
수락까지 실제 시간대기와 사람 턴을 포함한 작업 시작에서 합격 결과까지의 시간라우트가 생기면 직접 실행해 측정하는 값이며, 공급업체가 공개하는 수치가 아님
합격 작업률기간 내 워크로드 유형별 합격 작업 / 시도 작업라우트가 생기면 직접 실행해 측정하는 값이며, 공급업체가 공개하는 수치가 아님

합격 작업당 비용은 API 지출을 합격 작업 수로 나눈 값이며, 합격 작업당 검토 분과 나란히 보고합니다. 앞의 값을 낮추면서 뒤의 값을 높이는 라우트는 비용을 줄인 것이 아니라 사람에게 옮긴 것입니다.

완료 품질 수락

한 모델에서만 작동하는 수락 루브릭은 루브릭이 아니라 선호입니다. 모델이 바뀌어도 살아남도록 수락 기준을 만드세요:

  • 객관적 검사 먼저. 테스트 통과, 스키마 검증, 인용 확인, 선언된 파일만 변경한 diff. 이진 판정이고 모든 trace에 낮은 비용으로 실행할 수 있습니다.
  • 검토자 루브릭 다음. 워크로드 유형별 짧은 고정 체크리스트(정확성, 완전성, 안전성, 브리프 준수)를 어느 라우트가 출력을 만들었는지 모르는 검토자가 점수화합니다.
  • 반복 실행. 각 작업을 두 번 이상 실행하고 합격 작업률을 범위로 보고해서 한 번의 성공이 능력으로 승격되지 않게 합니다.
  • 불확실성 보고. 모든 결과 옆에 샘플 크기, 설정(effort, 도구, TTL), 실패 목록을 공개합니다. 샘플 크기 없는 비율은 근거가 아닙니다.

Gemini 4 액세스가 생기기 전에 루브릭을 작성하세요. 나중에 쓰면 새 라우트가 우연히 잘하는 것에 맞춰 휘어집니다.

섀도 트래픽 및 롤백 계획

Gemini 4 라우트가 언젠가 생기면, 다른 새 라우트와 같은 세 단계를 거쳐 들어와야 하며 Fable 5.1은 그동안 측정된 기준선으로 유지됩니다.

  1. 재생. 기록된 Fable 5.1 trace를 후보에 오프라인으로 입력하고 동일한 입력에서 합격 작업률과 합격 작업당 비용을 비교합니다.
  2. 섀도. 실 요청을 두 라우트에 보내되 Fable 5.1 답변을 서비스하고 후보는 조용히 점수화합니다. 사용자 노출 없이 루프와 도구 오류가 드러납니다.
  3. 카나리. 하나의 워크로드 유형을 작은 비율로 라우팅하고, 관찰 기간 동안 게이트가 유지될 때만 확대합니다.

테스트 시작 전에 정하는 승격 게이트: 합격 작업률이 기준선 이상; 수락까지 p95 실제 시간이 합의된 범위 이내; 재시도와 fallback을 포함한 합격 작업당 비용이 기준선 이하; 기간 내 해당 워크로드 유형의 사고 0건.

롤백 트리거: 어떤 게이트든 합의된 연속 일수 동안 실패하거나, 고객에게 도달한 사고 1건. 롤백은 코드 배포가 아니라 게이트웨이 설정 변경이며, 그래서 모델 선택은 애플리케이션 코드가 아니라 라우팅 설정에 있어야 합니다.

"반환 모델 신원" 검증은 모든 응답의 model 필드와 usage 카운터를 읽어 설정된 라우트와 일치하는지 확인하는 것입니다. 게이트웨이에서는 요청이 fallback으로 조용히 처리된 것이 아니라 요청한 모델로 처리됐음을 확인해 줍니다. 새 라우트의 첫 요청에서, 그리고 섀도 중에는 지속적으로 수행하고, 결과를 비용 표의 fallback 라우트 필드에 기록하세요.

진전으로 볼 수 없는 것

  • 완료된 장기 작업으로 뒷받침되지 않는, 소문 속 더 큰 Gemini 4 컨텍스트 윈도.
  • 재시도, 재개, 긴 출력, 추가 검토 분으로 상쇄되는 더 낮은 헤드라인 가격.
  • 설정, 샘플 크기, 재현 가능한 작업 세트가 없는 유출 벤치마크 스크린샷이나 서드파티 사양표.
  • 새 이름을 달고 이전 모델이나 불투명한 fallback을 반환하는 라우트.
  • 반복 실행이나 전체 관찰 기간에서 사라지는 하루짜리 합격 작업 우위.

이 기각 규칙을 지금, 수락 루브릭과 같은 문서에 적어 두세요. 이 단계를 건너뛰는 팀은 첫 번째 흥미로운 결과에 맞춰 성공을 재정의하는 경향이 있습니다.

EvoLink에서 Claude Fable 5.1 평가하기 Gemini 4 API 제공 현황 추적하기

FAQ

오늘 Gemini 4가 에이전트에서 Claude Fable 5.1보다 비용이 적게 든다고 누가 증명할 수 있나요?

아무도 할 수 없습니다. 2026년 9월 16일 현재 Google은 Gemini 4의 가격, 캐시 규칙, 컨텍스트 윈도, API 항목을 공개하지 않았으므로 어느 방향의 비용 주장에도 공개된 분모가 없습니다. 나중의 주장을 대조할 대상이 있도록 지금 Fable 5.1의 합격 작업당 비용을 기록하세요.

공급자 간 캐시 가격을 직접 비교할 수 있나요?

단일 숫자로는 안 됩니다. 캐시 읽기는 TTL, 캐시 범위(접두부 대 명시적), 최소 캐시 가능 크기, Standard 대 Batch 모드가 모두 일치할 때만 비교 가능합니다. Anthropic은 Fable 5.1의 5분 및 1시간 쓰기 등급과 읽기 요율을 문서화했고, Gemini 4는 이 중 어느 것도 공개하지 않았습니다.

실패한 장기 실행 작업의 비용은 어떻게 계산하나요?

모든 시도, 재개, 검토에 소요된 시간(분)을 같은 작업 ID에 첨부하세요. 실패했거나 수락되지 않은 작업은 총지출에는 남지만 합격 작업 분모에는 들어가지 않습니다. 합격 작업당 API 지출과 합격 작업당 검토 분을 두 개의 수치로, 절대 합치지 않고 보고하세요.

Gemini 4가 공개하지 않은 기능은 어떻게 기록하나요?

"[날짜] 기준 미공개"라는 값으로 필드를 만드세요. Gemini 3.x 값, 유출된 수치, 0으로 채우지 마세요. Google이 계약을 공개하면 자리표시 값을 교체하고 변경 날짜를 기록해서 과거 비교가 정직하게 유지되도록 하세요.

새 라우트를 테스트하면서 검증된 Claude 기준선을 어떻게 유지하나요?

후보가 재생, 섀도, 카나리를 거치는 동안 Fable 5.1 라우트를 설정된 상태로 유지하고 계속 서비스하세요. 테스트 전에 작업 세트, 루브릭, 평가자를 고정하고 기준선 수치를 날짜와 설정과 함께 저장하세요. 테스트 중에 움직이는 기준선은 기준선이 아닙니다. Anthropic은 대부분의 워크로드를 Claude Opus 5에서 시작하고 Fable 5.1은 까다로운 추론이나 장기 작업에 남겨 두라고 권장하므로, 기준선이 실제로 어떤 Claude 라우트인지 명시하세요.

Fable 5.1은 지금 EvoLink에서 사용할 수 있나요?

EvoLink에는 claude-fable-5-1이라는 이름의 설정된 라우트가 있습니다. 프로덕션 트래픽을 라우팅하기 전에 첫 요청에서 반환 모델 신원과 usage 카운터를 검증하고, 현재 가격은 Claude Fable 5.1 제품 페이지에서 확인하세요. 게이트웨이 제공 여부는 프로덕션 판정이 아니며, 판정은 여러분 자체의 재생, 섀도, 카나리 결과에서 나옵니다.

출처

근거는 2026년 9월 16일에 검토했습니다. Anthropic 사실은 Anthropic 문서에, Google 사실은 Google 공식 블로그와 Gemini API 문서에 기반합니다. Gemini 4에는 공개 API나 EvoLink 라우트가 없습니다.

AI 비용을 89% 절감할 준비가 되셨나요?

오늘 EvoLink를 시작하고 지능형 API 라우팅의 힘을 경험해보세요.