
Gemini 4 vs Claude Fable 5.1: 장기 실행 에이전트 선택
상태 및 근거 표
| 질문 | Gemini 4 | Claude Fable 5.1 | 안전한 결정 |
|---|---|---|---|
| 공식 상태 | Google이 사전 학습 확인(2026년 7월) | Anthropic이 2026년 9월 1일 출시; Active(latest)로 표시 | 격차를 능력 판정이 아니라 상태 격차로 취급 |
| API 모델 ID | 미공개 | claude-fable-5-1(Anthropic) | 미공개 ID를 설정이나 코드에 절대 넣지 않기 |
| 컨텍스트 및 최대 출력 | 미공개 | 1M 컨텍스트; 128K 최대 출력(Anthropic) | trace가 실제로 윈도의 어느 정도를 소비하는지 기록 |
| 입력 모달리티 | 미공개 | 텍스트·이미지 입력, 텍스트 출력(Anthropic) | 테스트 전에 각 워크로드에 필요한 모달리티 목록화 |
| thinking 제어 | 미공개 | adaptive thinking 항상 켜짐; 기본 effort high; 상대 지연은 Slower로 표기(Anthropic) | 나중 라우트를 같은 설정으로 테스트할 수 있도록 trace별 effort 설정 기록 |
| 캐시 가격 구조 | 미공개 | 100만 토큰당 입력 $10 / 출력 $50; 5분 캐시 쓰기 $12.50; 1시간 캐시 쓰기 $20; 캐시 읽기 100만 토큰당 $0.25(Anthropic 정가) | 양쪽이 TTL과 요율을 공개하기 전까지 캐시 경제성은 비교 불가 |
| Batch 제공 | 미공개 | Anthropic은 Batch 입력·출력을 표준의 50%로 표기 | Standard는 Standard와, Batch는 Batch와 비교 |
| 문서화된 비호환 변경 | 미공개 | Anthropic 마이그레이션 가이드의 세 가지: 강제 tool choice 오류, 이전 모델과 5.1 thinking block 비호환, 이전 턴 편집 후 thinking block 무효화 | 공개된 비호환 변경 목록은 테스트 가능하고, 없는 목록은 테스트 불가 |
| EvoLink 라우트 | 검증된 호출 가능 라우트 없음; 출시 알림 신청 가능 | 설정된 라우트 claude-fable-5-1; 가격은 제품 페이지 | 어떤 라우트든 첫 요청에서 반환 모델 신원 검증 |
Gemini 4 열은 비판이 아니라 측정할 수 있는 항목의 목록입니다. 모든 "미공개" 셀은 하네스에 이미 슬롯이 있어야 할 필드이며, 그래야 계약이 공개될 때 재설계 대신 값만 채워 넣을 수 있습니다.
평가할 가치가 있는 장기 실행 작업
장기 실행 에이전트 작업은 하나의 워크로드가 아닙니다. 팀이 Fable 5.1로 라우팅하는 trace 대부분은 다섯 가지 작업 유형으로 나뉘며, 각각 "합격"의 정의가 다릅니다. 유형별로 기준선을 기록하고, 향후 Gemini 4 라우트도 유형별로 판단하세요.
| 워크로드 | "합격"의 의미 | 지금 Fable 5.1에서 기록할 것 | 나중에 Gemini 4 라우트가 맞춰야 할 것 |
|---|---|---|---|
| 다중 파일 저장소 수리 | 테스트 통과, diff 검토 완료, 무관한 파일 미변경 | 읽고 편집한 파일, 도구 호출, 재시도, 검토에 소요된 시간(분), 합격 수정당 토큰 | 같은 작업 세트, 테스트 스위트, 검토자 루브릭 |
| 다단계 리서치 및 지식 산출물 | 인용이 확인되고, 구조가 브리프와 일치하고, 근거 없는 주장 없음 | 가져온 출처, 요청된 수정, 산출물당 사실 수정 | 같은 브리프와 사실 확인 절차 |
| 수 시간짜리 도구 루프 | 유효한 최종 상태로 중지 조건에서 루프 종료 | 루프 횟수, 실패한 도구 호출, 체크포인트, 재개 이벤트, 종료까지 실제 시간 | 같은 도구, 권한, 재시도 예산, 중지 규칙 |
| 장문 문서 구조화 추출 | 출력이 스키마를 통과하고, 샘플 필드가 원문과 일치 | 문서 길이, 스키마 실패, 재실행, 고정 샘플의 필드 정확도 | 같은 문서, 스키마, 샘플 |
| 고객 서비스 다단계 도구 플로 | 사람 에스컬레이션 없이 정책 안에서 티켓 해결 | 에스컬레이션, 잘못된 도구 호출, 정책 위반, 처리 시간 | 같은 플로 정의와 정책 검사 |
동일 조건 실행이 없으므로 어느 행도 선호 모델을 명시하지 않습니다. 이 표는 두 번째 라우트가 생겼을 때 "같은 작업"이 무엇을 뜻할지만 고정합니다.
컨텍스트 재사용과 캐시 조건
장기 실행 에이전트는 매 턴 같은 저장소 맵, 도구 스키마, 지시문을 다시 보내므로 캐시 가격이 토큰 청구서를 지배합니다. 동시에 비교 중 오늘 시작할 수 없는 부분이기도 합니다.
Google은 Gemini 4의 캐시 TTL, 쓰기·읽기 요율, 캐시 범위(자동 접두부 캐싱 대 명시적 캐시 객체), 최소 캐시 가능 크기를 공개하지 않았습니다. 이 네 값이 없으면 분모가 없습니다. 5분 캐시 읽기는 1시간 읽기와 다른 제품이고, 요청별 접두부 캐시는 여러 에이전트가 공유하는 이름 있는 캐시와 다른 제품입니다. 서로 다른 TTL, 컨텍스트 범위, Batch 모드를 하나의 숫자로 섞을 수 없습니다.
Fable 5.1은 기록의 기준이 될 구조를 제공합니다. Anthropic은 100만 토큰당 5분 캐시 쓰기 $12.50, 1시간 쓰기 $20, 캐시 읽기 $0.25, 그리고 표준 입력·출력의 50%인 Batch를 문서화합니다. 모든 Fable trace에 대해 다음을 기록하세요:
- 어떤 TTL을 왜 선택했는지(5분 이내 턴 간격, 또는 1시간 쓰기를 정당화한 공백);
- 캐시된 접두부 크기와 작업 중 변경 빈도(접두부가 바뀌면 새 쓰기가 발생하므로);
- 턴당 캐시 읽기 토큰 대 신규 입력 토큰;
- trace가 Standard로 실행됐는지 Batch로 실행됐는지, 그리고 실행 시점에 Anthropic 가격 페이지가 Batch와 캐시 배율을 어떻게 결합했는지.
재시도, 복구 및 사람의 개입 비용
사양표에는 절대 나오지 않지만 장기 실행 에이전트 예산의 대부분이 실제로 사라지는 층입니다. 사람이 막힌 부분을 풀어 준 뒤 세 번째 시도에서 완료된 trace는 한 번에 완료된 trace와 비용이 같지 않습니다. trace별로 여섯 가지 이벤트를 타임스탬프와 토큰 수와 함께 기록하세요:
- 루프 감지. 같은 인수의 같은 도구 호출이 미리 정한 임계값을 넘어 반복되는 것. 중지 규칙이 작동하기 전에 몇 턴을 소모했는지 기록합니다.
- 실패한 도구 호출. 공급자 측 오류, 도구 측 오류, 모델 측 잘못된 형식의 호출을 분리합니다. 세 번째만 모델 품질 신호이고, 나머지 둘은 새 라우트도 똑같이 지불할 인프라 비용입니다.
- 체크포인트 무결성. 저장된 각 상태가 실제로 작업을 복원할 수 있는지 검증합니다. 재개할 수 없는 체크포인트는 낭비된 출력에 전체 재실행이 더해진 것입니다.
- 중단 후 재개. rate limit, 타임아웃, 운영자 일시 중지 뒤 컨텍스트를 다시 구축하는 데 쓴 토큰을 첫 실행 토큰과 분리해 셉니다.
- thinking block 무효화. Anthropic 마이그레이션 가이드는 이전 턴을 편집하면 유지된 Fable 5.1 thinking block이 무효화된다고 문서화합니다. 압축이나 수정을 위해 히스토리를 다시 쓰는 프레임워크는 모두 이를 유발합니다. 얼마나 자주 발생하고 재사고 비용이 얼마인지 기록하세요. Gemini 4에 동등한 규칙이 있는지는 공개되지 않았습니다.
- 사람의 개입. 막힌 부분 해소, 수정, 작업 마무리에 쓴 검토에 소요된 시간(분)을 시간으로 기록해서 API 총액 안에 사라지지 않게 합니다.
이들을 별도의 사고 로그가 아니라 trace 레코드의 필드로 저장하세요. 재시도, 재개, 검토에 소요된 시간(분)이 토큰과 같은 작업 ID에 있어야만 합격 작업당 비용이 의미를 갖습니다.
전체 작업 비용 변수 표
아래 모든 수치의 분모는 완료되어 수락을 통과한 작업입니다. 완료됐지만 검토에 실패한 작업은 지출에는 포함되지만(비용을 지불했으므로) 분모에는 들어가지 않습니다. API 지출과 사람 시간은 별도 열에 두고, 분을 금액으로 바꾸는 것은 재무 팀이 소유한 단가로 보고 층에서만 하세요.
| 변수 | 오늘 Fable 5.1에서 기록하는 방법 | Gemini 4 상태 |
|---|---|---|
| 입력 토큰 | EvoLink가 반환하는 usage 카운터로 턴당 신규(비캐시) 입력을 작업별로 합산 | 계약 공개 전까지 알 수 없음 |
| 캐시 쓰기 | 5분과 1시간 TTL로 나눈 쓰기 토큰과 작업당 쓰기 횟수 | 계약 공개 전까지 알 수 없음 |
| 캐시 읽기 | 작업당 캐시에서 제공된 토큰; 적중률(캐시 읽기 / (캐시 읽기 + 신규 입력))도 기록 | 계약 공개 전까지 알 수 없음 |
| 출력 토큰 | 최종 답변과 중간 도구 인수를 작업별로 합산 | 계약 공개 전까지 알 수 없음 |
| 도구 호출 및 외부 비용 | 작업당 호출 수와 계량 비용(검색, 코드 실행, 서드파티 API) | 계약 공개 전까지 알 수 없음 |
| 재시도 | 첫 시도 이후의 시도 횟수와 시도별 토큰을 같은 작업 ID에 첨부 | 계약 공개 전까지 알 수 없음 |
| fallback 라우트 사용 | 어떤 턴이 다른 모델로 처리됐는지와 어느 모델인지를 반환된 model 필드로 검증 | 계약 공개 전까지 알 수 없음 |
| 사람 검토 분 | 작업당 검토자 및 운영자 시간을 분으로 기록 | 라우트가 생기면 직접 실행해 측정하는 값이며, 공급업체가 공개하는 수치가 아님 |
| 수락까지 실제 시간 | 대기와 사람 턴을 포함한 작업 시작에서 합격 결과까지의 시간 | 라우트가 생기면 직접 실행해 측정하는 값이며, 공급업체가 공개하는 수치가 아님 |
| 합격 작업률 | 기간 내 워크로드 유형별 합격 작업 / 시도 작업 | 라우트가 생기면 직접 실행해 측정하는 값이며, 공급업체가 공개하는 수치가 아님 |
합격 작업당 비용은 API 지출을 합격 작업 수로 나눈 값이며, 합격 작업당 검토 분과 나란히 보고합니다. 앞의 값을 낮추면서 뒤의 값을 높이는 라우트는 비용을 줄인 것이 아니라 사람에게 옮긴 것입니다.
완료 품질 수락
한 모델에서만 작동하는 수락 루브릭은 루브릭이 아니라 선호입니다. 모델이 바뀌어도 살아남도록 수락 기준을 만드세요:
- 객관적 검사 먼저. 테스트 통과, 스키마 검증, 인용 확인, 선언된 파일만 변경한 diff. 이진 판정이고 모든 trace에 낮은 비용으로 실행할 수 있습니다.
- 검토자 루브릭 다음. 워크로드 유형별 짧은 고정 체크리스트(정확성, 완전성, 안전성, 브리프 준수)를 어느 라우트가 출력을 만들었는지 모르는 검토자가 점수화합니다.
- 반복 실행. 각 작업을 두 번 이상 실행하고 합격 작업률을 범위로 보고해서 한 번의 성공이 능력으로 승격되지 않게 합니다.
- 불확실성 보고. 모든 결과 옆에 샘플 크기, 설정(effort, 도구, TTL), 실패 목록을 공개합니다. 샘플 크기 없는 비율은 근거가 아닙니다.
Gemini 4 액세스가 생기기 전에 루브릭을 작성하세요. 나중에 쓰면 새 라우트가 우연히 잘하는 것에 맞춰 휘어집니다.
섀도 트래픽 및 롤백 계획
Gemini 4 라우트가 언젠가 생기면, 다른 새 라우트와 같은 세 단계를 거쳐 들어와야 하며 Fable 5.1은 그동안 측정된 기준선으로 유지됩니다.
- 재생. 기록된 Fable 5.1 trace를 후보에 오프라인으로 입력하고 동일한 입력에서 합격 작업률과 합격 작업당 비용을 비교합니다.
- 섀도. 실 요청을 두 라우트에 보내되 Fable 5.1 답변을 서비스하고 후보는 조용히 점수화합니다. 사용자 노출 없이 루프와 도구 오류가 드러납니다.
- 카나리. 하나의 워크로드 유형을 작은 비율로 라우팅하고, 관찰 기간 동안 게이트가 유지될 때만 확대합니다.
테스트 시작 전에 정하는 승격 게이트: 합격 작업률이 기준선 이상; 수락까지 p95 실제 시간이 합의된 범위 이내; 재시도와 fallback을 포함한 합격 작업당 비용이 기준선 이하; 기간 내 해당 워크로드 유형의 사고 0건.
롤백 트리거: 어떤 게이트든 합의된 연속 일수 동안 실패하거나, 고객에게 도달한 사고 1건. 롤백은 코드 배포가 아니라 게이트웨이 설정 변경이며, 그래서 모델 선택은 애플리케이션 코드가 아니라 라우팅 설정에 있어야 합니다.
model 필드와 usage 카운터를 읽어 설정된 라우트와 일치하는지 확인하는 것입니다. 게이트웨이에서는 요청이 fallback으로 조용히 처리된 것이 아니라 요청한 모델로 처리됐음을 확인해 줍니다. 새 라우트의 첫 요청에서, 그리고 섀도 중에는 지속적으로 수행하고, 결과를 비용 표의 fallback 라우트 필드에 기록하세요.진전으로 볼 수 없는 것
- 완료된 장기 작업으로 뒷받침되지 않는, 소문 속 더 큰 Gemini 4 컨텍스트 윈도.
- 재시도, 재개, 긴 출력, 추가 검토 분으로 상쇄되는 더 낮은 헤드라인 가격.
- 설정, 샘플 크기, 재현 가능한 작업 세트가 없는 유출 벤치마크 스크린샷이나 서드파티 사양표.
- 새 이름을 달고 이전 모델이나 불투명한 fallback을 반환하는 라우트.
- 반복 실행이나 전체 관찰 기간에서 사라지는 하루짜리 합격 작업 우위.
이 기각 규칙을 지금, 수락 루브릭과 같은 문서에 적어 두세요. 이 단계를 건너뛰는 팀은 첫 번째 흥미로운 결과에 맞춰 성공을 재정의하는 경향이 있습니다.
EvoLink에서 Claude Fable 5.1 평가하기 Gemini 4 API 제공 현황 추적하기FAQ
오늘 Gemini 4가 에이전트에서 Claude Fable 5.1보다 비용이 적게 든다고 누가 증명할 수 있나요?
아무도 할 수 없습니다. 2026년 9월 16일 현재 Google은 Gemini 4의 가격, 캐시 규칙, 컨텍스트 윈도, API 항목을 공개하지 않았으므로 어느 방향의 비용 주장에도 공개된 분모가 없습니다. 나중의 주장을 대조할 대상이 있도록 지금 Fable 5.1의 합격 작업당 비용을 기록하세요.
공급자 간 캐시 가격을 직접 비교할 수 있나요?
단일 숫자로는 안 됩니다. 캐시 읽기는 TTL, 캐시 범위(접두부 대 명시적), 최소 캐시 가능 크기, Standard 대 Batch 모드가 모두 일치할 때만 비교 가능합니다. Anthropic은 Fable 5.1의 5분 및 1시간 쓰기 등급과 읽기 요율을 문서화했고, Gemini 4는 이 중 어느 것도 공개하지 않았습니다.
실패한 장기 실행 작업의 비용은 어떻게 계산하나요?
모든 시도, 재개, 검토에 소요된 시간(분)을 같은 작업 ID에 첨부하세요. 실패했거나 수락되지 않은 작업은 총지출에는 남지만 합격 작업 분모에는 들어가지 않습니다. 합격 작업당 API 지출과 합격 작업당 검토 분을 두 개의 수치로, 절대 합치지 않고 보고하세요.
Gemini 4가 공개하지 않은 기능은 어떻게 기록하나요?
"[날짜] 기준 미공개"라는 값으로 필드를 만드세요. Gemini 3.x 값, 유출된 수치, 0으로 채우지 마세요. Google이 계약을 공개하면 자리표시 값을 교체하고 변경 날짜를 기록해서 과거 비교가 정직하게 유지되도록 하세요.
새 라우트를 테스트하면서 검증된 Claude 기준선을 어떻게 유지하나요?
Fable 5.1은 지금 EvoLink에서 사용할 수 있나요?
claude-fable-5-1이라는 이름의 설정된 라우트가 있습니다. 프로덕션 트래픽을 라우팅하기 전에 첫 요청에서 반환 모델 신원과 usage 카운터를 검증하고, 현재 가격은 Claude Fable 5.1 제품 페이지에서 확인하세요. 게이트웨이 제공 여부는 프로덕션 판정이 아니며, 판정은 여러분 자체의 재생, 섀도, 카나리 결과에서 나옵니다.출처
- Anthropic: Claude Fable 5.1 모델 개요
- Anthropic: Claude Fable 5.1 마이그레이션 가이드
- Anthropic: 가격, 캐시 TTL 및 Batch
- Anthropic: Claude Fable 5.1 발표
- Anthropic: Claude Fable 제품 페이지
- Anthropic: 모델 지원 종료
- Google: Alphabet Q2 2026 실적 CEO 메시지
- Google: Gemini 3.6 Flash 발표
- Google: Gemini API 모델 카탈로그
- EvoLink: Gemini 4 API 상태
- EvoLink: Claude Fable 5.1
- EvoLink: Gemini 4 출시 추적
- EvoLink: Claude Fable 5.1 vs GPT-6 Astra


