MiniMax H3(Hailuo 3) EvoLink 출시무료 10크레딧으로 체험
Gemini 3.6 Flash의 네 가지 Thinking Level을 점점 커지는 추론 단계로 표현한 이미지
analysis

Gemini 3.6 Flash Thinking Level별 비용 실측

Jacey
Jacey
Founder
2026년 7월 22일
49분 소요
마지막 확인: 2026-07-21. EvoLink 모델 연구팀이 작성했습니다. 이 페이지의 숫자는 출시일에 실행한 406 API 호출에서 나온 것입니다. 그 방법은 아래에 자세히 설명되어 있습니다. EvoLink는 생산팀을 위한 AI 모델 인프라를 구축하고 여기에서 측정된 모델이 실행됩니다.
짧은 버전
  • minimal은 9개의 프로덕션 유사 작업에서 medium 기본값보다 73.6% 저렴했고, 정확도는 동일하게 9/9였습니다. 레벨을 따로 선택한 적이 없다면 이것이 가장 큰 비용 절감 여지입니다.
  • 입력 토큰까지 포함하면, medium에서 사고 토큰이 총 비용의 75%를 차지했습니다. 답변 길이는 네 레벨에서 거의 변하지 않았으므로, 레벨 간 비용 차이의 대부분은 사고 토큰에서 발생했습니다.
  • low는 고정된 사고 예산을 소비하지 않습니다. 9번의 구조화 추출 실행 모두에서 사고 토큰이 정확히 0이었고, 그 부분의 비용은 minimal과 같았습니다. 반면 도구 호출과 코드 작업에서는 사고 토큰을 사용했습니다.
  • low 위로 사고량을 늘려도 어려운 라운드의 정답 수는 늘지 않았습니다. minimal, low, medium, high의 점수는 각각 2, 10, 10, 8/15였습니다.
  • 기본값은 잘못된 것이 아니라 단지 대상이 지정되지 않았을 뿐입니다. medium는 알 수 없는 작업에 대한 합리적인 중간 설정입니다. 작업의 형태를 알게 되면 의도적으로 레벨을 설정할 가치가 있습니다.
  • 이 모델에 대해 게시된 모든 벤치마크는 high에서 실행됩니다. API 기본값은 medium입니다. 이는 청구서가 다르고 대기 시간이 다릅니다.

레벨별 짧은 대답

사고 레벨은 Gemini 3.6 Flash 요청의 가장 큰 단일 비용 변수이며, Gemini 3.6 Flash와 Gemini 3.5 Flash 중 어느 모델을 선택하는지보다도 영향이 큽니다. 사고 토큰은 출력 단가로 청구되며, 기본 설정에서는 답변 토큰보다 약 6배 많았습니다.

다음 표는 동일한 9개 작업을 한 번씩 실행했을 때 각 레벨의 비용과, 그 비용이 정당화된 작업 유형을 보여줍니다.

수준패스당 비용medium 기본값과 비교다음과 같은 경우에 사용하세요.
minimal$0.015873.6% 더 저렴스크립트만 따라야 하는 추출, 분류, 라우팅, 코드 위치 및 도구 체인
low$0.023261.2% 더 저렴동일한 작업에 모델이 잘못된 것으로부터 복구해야 할 수 있는 다단계 도구 호출
medium(기본값)$0.0598기준선트래픽의 형태를 아직 알지 못하거나 작업이 너무 다양하여 정확히 정의할 수 없습니다.
high$0.06539.3% 더 비쌈용도를 제한해 사용하세요. 우리 작업에서는 추가 예산이 대부분 사용되지 않았고, 어려운 라운드의 점수는 medium보다 낮았습니다
다만 이 표만으로 minimal이 여러분의 워크로드에도 적합하다고 보장할 수는 없습니다. 우리 작업에서는 문제가 없었고, 그 작업의 구성은 아래에서 정확히 설명합니다.

아무도 공개하지 않는 숫자: 생각 토큰에 대한 답변 토큰

출시일에 찾을 수 있는 이 모델의 모든 가격 비교는 출력 토큰을 하나의 숫자로 취급합니다. 이는 전혀 유사하지 않은 두 수량을 병합하고 일단 분리하면 이 릴리스와 관련된 대부분의 혼란이 해결됩니다.

다음은 출력 측이 읽을 수 있는 토큰과 읽을 수 없는 토큰으로 분할된 9개 작업을 한 번 통과하는 것입니다.

구성답변 토큰Thinking 토큰출력 중 Thinking 비중1회 실행당 비용정답평균 지연 시간
3.6 Flash minimal1,16200%$0.01589/92.8s
3.6 Flash low1,0561,09551%$0.02329/93.3s
3.6 Flash medium (기본값)1,0805,94485%$0.05989/95.1s
3.6 Flash high1,0926,67986%$0.06539/95.3s
3.5 Flash medium1,0785,82784%$0.06929/95.1s
3.5 Flash high1,1137,18587%$0.08189/95.7s
3.5 Flash-Lite minimal (기본값)97700%$0.00368/91.8s
3.5 Flash-Lite high1,0978,28888%$0.02499/94.2s

먼저 답변 토큰 열을 읽어보세요. 8가지 구성, 2가지 모델, 4가지 사고 수준에 걸쳐 977와 1,162 토큰 사이에 머물며 열에서 가장 높은 수치가 가장 저렴한 구성에 속합니다. 모델은 아무리 먼저 생각하더라도 대략 동일한 길이의 답변을 생성합니다.

이제 Thinking 토큰 열을 보세요. 0부터 8,288까지 분포합니다. 이것이 청구액의 전체 구조입니다.

여기에는 돈과 동일한 데이터가 있으며, 각 패스를 입력, 답변 및 사고에 대해 지불한 금액으로 Gemini 3.6 Flash의 표준 계층 요율(백만 입력 토큰당 $1.50 및 백만 출력 토큰당 $7.50)으로 나눕니다.

수준입력답변Thinking합계전체 비용 중 Thinking 비중
minimal$0.0071$0.0087$0.0000$0.01580%
low$0.0071$0.0079$0.0082$0.023235%
medium$0.0071$0.0081$0.0446$0.059875%
high$0.0071$0.0082$0.0501$0.065377%

기본 수준에서 지불하는 금액의 4분의 3은 답변이 올바른지 여부에 아무런 차이가 없는 수준의 작업에 대해 전혀 볼 수 없는 추론에 사용됩니다. 이는 모델의 결함이 아닙니다. 범용 기본값이 특정 작업 부하를 충족할 때 발생하는 현상입니다.

이는 또한 "새 모델이 토큰을 저장합니까?"가 공개적으로 모순되는 답변을 얻는 이유를 설명합니다. 주장은 출력 토큰에 관한 것이고, 출력 토큰은 대부분 사고 토큰이며, 사고 토큰 수는 사고 수준에 따라 달라지지만 거의 아무도 언급하지 않습니다. 명시된 수준이 없는 측정은 재현할 수 없습니다.

이를 측정한 방법

두 라운드는 두 모델이 모두 출시된 날인 2026-07-21에서 실행됩니다.

1라운드: 일반 생산 작업의 수준 비용. 3명씩 3개 그룹으로 구성된 9개 작업. 송장, 로그 파일 및 제품 페이지의 HTML에서 구조화된 추출입니다. 시뮬레이션된 도구에 대해 3~5단계를 호출하는 다중 회전 도구입니다. 버그 설명이 실행되는 패치가 되어야 하는 코드 위치 및 복구. 입력은 대략 1,000와 4,000 토큰 사이에서 실행되므로 이는 일반적인 요청 크기를 다루고 긴 컨텍스트 작업에 대해서는 아무 것도 나타내지 않습니다. 각 작업은 8가지 모델 및 사고 수준 구성 각각에 대해 3번 실행되었습니다: 216 호출, $1.03.
두 번째 라운드: 품질이 실제로 저하되는 부분. 우리는 모순 해결, 교차 레코드 상관 관계, 다단계 단위 변환, 교차 기능 버그 및 더 긴 도구 체인을 다루는 20 의도적으로 더 어려운 작업을 작성했습니다. 각각은 가장 약한 구성에서 한 번 실행되고 가장 강한 구성에서 한 번 실행되어 난이도별로 정렬되었습니다. 가장 약한 것이 실패한 작업과 가장 강한 것이 통과한 작업만이 레벨이 다른 위치에 대한 정보를 전달합니다. 20 중 3개가 자격을 갖추고 있습니다. 이 3개는 90 호출인 6개 구성 각각에 대해 5번 실행되었습니다. 그런 다음 minimal에서 모든 20 작업을 세 번 다시 실행하여 정렬이 유지되었는지 확인했습니다. 이는 또 다른 60 호출입니다. 두 번째 라운드는 190 호출과 $1.34.에 이르렀습니다.
이 페이지의 모든 번호에 적용되는 조건.
  • 호출은 Google AI Studio에 고정된 공급자와 함께 OpenRouter를 통해 진행되었으며 동시에 전송되지 않고 순차적으로 전송되었습니다. 게이트웨이는 요청을 처리한 지역을 공개하지 않으므로 이를 명시할 수 없습니다.
  • 비용은 게이트웨이 자체 청구 금액이 아닌 Google의 표준 등급 정가를 기준으로 계산됩니다. 할인된 계층의 게이트웨이 경로와 두 가지를 혼합하면 우리 수치가 Google에서 게시한 가격과 비교할 수 없게 됩니다.
  • 샘플링 매개변수가 설정되지 않았습니다. temperature, top_ptop_k는 Gemini 3.x에서 더 이상 사용되지 않으며 허용된 다음 무시됩니다. 따라서 이를 설정하면 문서를 읽지 않았다는 것을 암시하면서 아무것도 변경되지 않습니다. 아직 프로덕션 환경에서 설정한 경우 이번 릴리스의 나머지 인터페이스 변경 사항은 Gemini 3.6 Flash 릴리스 가이드에서 다룹니다.
  • 채점은 사람이 아닌 규칙을 기반으로 합니다. 정확성은 여기서 지원 측정항목으로, 저렴한 수준이 조용하게 작업을 덜 수행하기 때문에 저렴해 보인다는 설명을 배제하기 위해 제시됩니다.
  • 응답 토큰과 사고 토큰은 매 통화마다 별도로 기록되었으며, 이것이 위의 표를 가능하게 합니다.
반복 실행에 대한 한 가지 솔직한 제한 사항. 1라운드에서 작업을 세 번 반복해도 정확성은 전혀 달라지지 않았습니다. 모든 구성은 모든 실행에서 동일한 점수를 얻었습니다. 동일한 작업 및 레벨에 대해 생각 토큰 수는 6%와 51% 사이에서 매우 다양합니다. high의 한 코드 작업은 세 개의 동일한 요청에 대해 331, 538 및 347 사고 토큰을 반환했습니다. 따라서 비용 수치를 얻으려면 3회 이상의 평균을 구하는 것이 필요하지만 정확성 수치를 얻으려면 필요하지 않습니다. 작업이 모델이 수행할 수 있는 작업의 가장자리에 있는 두 번째 라운드에서는 안정성이 완전히 사라지며 이를 각주가 아닌 발견으로 처리합니다.

게시된 벤치마크가 이 질문에 답하지 않는 이유

아무도 이것을 찾을 수 없는 문서화된 이유가 있습니다. 유통 중인 벤치마크 수치는 대부분의 프로덕션 트래픽이 실행되지 않는 수준에서 측정되며 소스에서는 그렇게 말하는 경우가 거의 없습니다.

  • Artificial Analysis는 현재 high에서 측정된 이 모델의 전체 분석을 제공하는 유일한 독립 소스입니다. API 기본값은 medium입니다.
  • Gemini 3.5 Flash-Lite에 대한 Google 자체 결과 테이블은 high 생각으로 생성되었지만 해당 모델의 API 기본값은 minimal입니다. 기본 구성을 실행하는 것은 표에서 설명하는 실험이 아닙니다.
  • Google의 비교표에서 DeepSWE 행은 medium에서 Gemini 3.5 Flash를 실행하고 high에서 Gemini 3.6 Flash를 실행하므로 해당 행의 두 Gemini 수치는 동일한 수준의 비교가 아닙니다.
  • Google의 헤드라인 "DeepSWE에서 최대 65%"는 점수가 아닌 토큰 사용량 감소를 나타냅니다. DeepSWE 점수는 49%입니다.
가장 많이 인용되는 효율성 주장도 비슷한 문제를 안고 있습니다. Google은 자체 측정이 아닌 Artificial Analysis를 인용하여 새 모델이 약 17% 더 적은 출력 토큰을 사용한다고 밝혔습니다. 같은 페이지에 공개된 절대 토큰 수인 59백만 대 75백만을 계산하면 21.3%가 됩니다. 두 수치는 공개적으로 조정되지 않았으며 어느 쪽도 Thinking Level이나 작업 세트를 밝히지 않습니다. 우리는 이 주장을 사용할 때 더 보수적인 17%를 적용하고, 이를 측정값이 아니라 계산을 위한 입력값으로 취급합니다.

그 어느 것도 발표된 수치를 잘못된 것으로 만들지 않습니다. 이는 "내가 실제로 실행하는 수준에서 비용이 얼마나 들 것인가"와는 다른 질문에 답하게 만듭니다.

1라운드: 일반 작업 수준

세 가지 결과(중요한 순서대로)

minimal는 생각이 적다는 뜻이 아니라 전혀 생각하지 않는다는 뜻입니다. Thinking 토큰은 작은 수가 아니라 정확히 0으로 돌아왔습니다. Gemini 3.6 Flash에서 실행한 모든 minimal 요청 가운데 102회 중 101회가 정확히 0개의 Thinking 토큰을 반환했습니다. 유일한 예외는 너무 이상해서 아래에 별도 섹션으로 다룹니다. 동시에 정답은 9개 중 9개로 그대로였고, 중앙값 지연 시간은 5.1초에서 2.8초로 줄었습니다. 이 작업 세트에서 기본 수준이 추가로 가져온 것은 3.8배 더 큰 청구서와 두 배 느린 응답뿐이었습니다.
highmedium보다 9.3%만 더 비쌉니다. 추가 예산이 거의 사용되지 않았기 때문에 5,944에서 6,679 토큰으로 생각이 늘어났습니다. 이는 모델에 관한 것이 아니라 이 9가지 작업에 관한 사실입니다. 진정으로 더 많은 추론이 필요한 작업을 제공하면 격차가 넓어집니다. 이 비율을 자신의 예측에 적용하지 마십시오.
두 가지 새로운 모델 레벨 모두 Gemini 3.5 Flash의 동등한 레벨보다 저렴하게 판매되었습니다. medium의 13.6% 및 high의 20.1%입니다. 거의 모든 절약은 토큰 효율성이 아니라 백만 토큰당 $9.00에서 $7.50로의 출력 가격 인하에서 비롯됩니다. medium에서 청구된 출력 토큰은 실제로 이전 모델에 비해 1.7% 상승했고, high에서는 6.4% 하락했습니다. 트래픽에 대해 동일한 적용 여부는 입력 대 출력 비율에 따라 달라집니다. 입력 가격은 전혀 변하지 않았기 때문이며, 당사의 Gemini 3.5 Flash 비용 계산기는 이전 모델의 실제 사례를 통해 해당 산술을 안내합니다.

low는 적응형이며 더 작은 고정 예산이 아닙니다.

이는 우리가 예상하지 못한 결과이며, 이 페이지에서 가장 직접적으로 유용한 결과입니다.

low에서 Gemini 3.6 Flash는 세 가지 작업 유형에 걸쳐 고르지 않게 생각을 소비했습니다. 패스당 사고 토큰:
작업 그룹minimallowmediumhigh
구조화된 추출002,6732,916
다중 턴 도구 호출05491,7971,914
코드 위치 및 수리05461,4741,849
세 개의 추출 작업을 각각 세 번씩 실행한 모든 경우에서 low의 사고 토큰은 정확히 0이었습니다. 이 그룹의 비용은 low가 $0.00490, minimal이 $0.00489로, 차이는 0.2%였습니다. 반면 도구 호출과 코드 복구에서는 동일한 low 설정이 작업당 100∼440개의 사고 토큰을 사용했습니다.
실무적 함의는 다음과 같습니다. 하나의 모델 설정 뒤에 추출과 다단계 작업이 혼재한다면, low는 추출 비중에서 minimal에 가까운 비용을 유지하면서 나머지 작업을 위한 사고 여유를 남겨 둡니다. 절감 효과의 대부분을 얻기 위해 트래픽을 두 설정으로 나눌 필요는 없습니다. 우리 작업 세트에서 이 조합은 기본값보다 61.2% 저렴했습니다.
범위에 관한 주의 사항이 하나 있습니다. 이것은 하나의 설정이 하루 동안 9개 작업에서 보인 결과를 설명한 것이지, Google이 문서화한 동작이 아닙니다. 우리는 관찰 결과만 보고하며 그 원인이 되는 메커니즘을 안다고 주장하지 않습니다. 따라서 자체 프롬프트로 먼저 검증하지 않은 채, low가 추출 작업에서 절대 사고 토큰을 사용하지 않는다는 전제에 의존하는 시스템을 구축하지는 않을 것입니다.

두 번째 라운드: 품질이 실제로 저하되는 부분

모든 구성이 9점 만점에 9점을 받았기 때문에 1라운드에서는 품질 질문에 답할 수 없었습니다. 9개의 작업은 4개의 레벨을 분리할 만큼 어렵지 않았습니다. 그래서 더 어렵게 만들었고, 돌아온 답은 레벨이 암시하는 답이 아니었습니다.

먼저 정렬 결과 자체가 하나의 발견입니다. 의도적으로 어렵게 만든 20개 작업 중 17개를 minimal이 세 번의 시도 모두에서 정확히 해결했습니다. 여기에는 서로 맞지 않는 청구서의 세 숫자를 다시 계산해 모순을 푸는 작업, 뒤섞인 세 요청 기록을 하나의 실패 흐름으로 연결하는 작업, 충돌하는 계약 조항에 “나중에 서명된 문서가 우선한다”는 메타 규칙을 적용하는 작업, 여러 통화와 기간의 환산, 두 함수에 걸친 캐시 키 버그, 세 번째 호출에서만 나타나는 속도 제한 버그가 포함됩니다. minimal은 사고 토큰을 하나도 쓰지 않고 이 작업들을 해결했습니다. 같은 작업은 high에서 1,100~6,900개의 사고 토큰을 사용했습니다.

따라서 사고 수준은 추론의 정확성을 사지 않습니다. 적어도 이러한 작업이 차지하는 범위에서는 그렇지 않습니다. 그것이 사는 것은 더 좁은 것입니다.

레벨을 분리한 세 가지 작업은 모두 다중 회전 도구 호출이었고 특정 형태를 공유했습니다. 도중에 문제가 발생하고 모델은 원래 계획에 없었던 작업을 추가해야 합니다. 주소가 변경되기 전에 소포를 차단하십시오. 속도 제한 응답 후 한 번 재시도하세요. 긴급 배송이 인쇄에 실패한 후 배송물을 원래 라벨로 되돌립니다. 행동을 거부하거나 제공된 옵션 중에서 올바르게 선택해야 하는 작업은 8단계 길이의 체인 하나를 포함하여 매번 minimal에서 처리되었습니다.

다음은 3가지 작업(각각 5번 시도)에서 6가지 구성의 점수를 매긴 방법입니다.

구성작업 1작업 2작업 3합계API 호출당 비용
3.6 Flash minimal1/50/51/52/15$0.00175
3.6 Flash low4/51/55/510/15$0.00553
3.6 Flash medium (기본값)5/55/50/510/15$0.00674
3.6 Flash high5/52/51/58/15$0.00739
3.5 Flash-Lite minimal (기본값)4/55/50/59/15$0.00068
3.5 Flash-Lite high2/55/53/510/15$0.00262

호출당 비용은 다음 섹션에 설명된 하나의 비정상적인 요청을 제외합니다. 포함된 총계가 여기에 제공됩니다.

실제 단계는 정확히 하나이며, minimal에서 low까지입니다. 15 중 2개는 15 중 10개가 됩니다. 그 지점을 지나면 선은 평평하다가 아래로 구부러집니다: 10, 10, 8.
작업별로 그림이 총계보다 더 지저분합니다. 작업 1 레벨이 올라갈수록 깔끔하게 향상됩니다. 2 작업은 신뢰할 수 있으려면 medium가 필요하며 high에서는 5개 중 2개로 대체됩니다. 작업 3는 완전히 다른 방식으로 실행되어 low에서는 5점 만점에 5점, medium에서는 5점 만점에 0점, high에서는 5점 만점에 1점을 얻습니다. 더 많이 생각할수록 그 작업은 다섯 번의 시도에 걸쳐 지속적으로 더 악화되었습니다.
우리는 모르기 때문에 그 이유를 설명하지 않을 것입니다. 패턴이 지원하는 것은 더 좁고 더 방어 가능한 주장입니다. 모델 능력의 가장자리에 있는 작업에서 수준은 높일 수 있는 품질 다이얼이 아닙니다. low를 넘어서면 우리가 측정한 차이는 동일한 실행 간의 차이보다 작습니다.
이러한 불안정성 자체가 이 글에서 가장 널리 적용할 수 있는 발견입니다. 1라운드에서는 216번의 호출에 걸쳐 동일한 작업을 반복했을 때 정확도가 한 번도 달라지지 않았습니다. 2라운드에서는 표의 대부분 셀이 1/5이나 4/5 같은 값을 보였습니다. 같은 요청을 같은 레벨에서 다섯 번 보내도 답이 달라졌습니다. 각 구성을 한 번씩만 실행하는 사고 레벨 평가는 노이즈를 보고하게 됩니다. 설계상 구성별로 한 번씩 실행한 우리의 난이도 정렬 패스도 여기에 해당합니다. 정렬된 작업을 minimal에서 세 번 다시 실행했을 때 20개 중 17개는 명확하게 확인되었지만, 단일 패스에서 실패로 표시된 작업 중 하나는 세 번 중 한 번 성공했습니다. 이것이 바로 우리가 설명하는 변동입니다.

엔지니어링 결과는 수준 권장 사항보다 더 유용합니다. 에이전트가 예상치 못한 상태에서 복구해야 하는 경우 애플리케이션에 재시도 및 확인 기능을 구축하고 사고 수준을 복구를 안정적으로 만드는 요소가 아닌 비용 설정으로 처리하세요.

Gemini 3.6 Flash low 대 Gemini 3.5 Flash-Lite

이 비교는 우리가 찾을 수 있는 게시된 데이터가 없으며 비용에 민감한 팀이 실제로 직면하는 데이터입니다. 대략 동일한 비용으로 약간의 생각으로 더 강력한 모델을 실행합니까, 아니면 열심히 생각하는 더 저렴한 모델을 실행합니까?

1라운드에서는 비용이 거의 동일합니다. Gemini 3.6 Flash(low)는 패스당 $0.0232였습니다. Gemini 3.5 Flash-Lite(high)는 $0.0249.였습니다. 둘 다 9점 만점에 9점을 받았습니다. low의 Gemini 3.6 Flash는 4.2 평균 지연 시간에 비해 3.3초로 더 빨랐으며 Flash-Lite이 8,288을 필요로 하는 1,095 사고 토큰에서 해당 점수에 도달했습니다.
두 번째 라운드에서는 더 어려운 도구 호출 작업에서 15 중 10점으로 다시 동점을 이루었지만 가격은 분리되었습니다. high의 Flash-Lite 비용 $0.00553.에 대한 호출당 $0.00262 해당 작업 세트에서 열심히 생각하는 저렴한 모델은 동일한 점수에 대해 가격의 절반 미만이었습니다.

이 두 가지 그림 중 어떤 그림이 귀하에게 적용되는지는 귀하의 작업 조합에 따라 달라지며, 이것이 헤지라기보다는 솔직한 답변입니다. 두 가지 구성은 두 라운드 모두에서 동일한 성능 대역에 있습니다. 그들 사이의 가격 관계는 작업 세트 전체에서 안정적이지 않습니다.

동일한 데이터에서 두 개의 추가 관측값이 있습니다. 둘 다 기본적으로 Flash-Lite로 설정되기 전에 알아 둘 가치가 있습니다.

Flash-Lite의 기본 minimal 수준은 특정하고 반복 가능한 방식으로 하나의 작업에 실패했습니다. 3단계 알림 체인에서 처음 두 도구를 호출한 다음 3번 중 3번은 매번 동일한 서명을 사용하여 알림을 보내지 않고 중지되었습니다. 이것이 1라운드의 모든 216 호출에서 유일한 품질 차이였습니다. 이는 또한 Google 문서 자체의 제한 사항을 재현합니다. minimal 기본값은 도구 호출을 조기에 종료하기 때문에 자율 하위 에이전트 사용에 적합하지 않은 것으로 설명됩니다. Flash-Lite를 에이전트로 실행한다면 레벨을 높이거나 실패를 예상하세요.
두 모델의 가장 낮은 수준은 서로 다르게 실패하며 어느 쪽도 한결같이 강력하지 않습니다. 2라운드의 도구 호출 작업에서 minimal의 Flash-Lite는 15에서 9점을 얻었고, Gemini 3.6 Flash는 15에서 2점을 얻었습니다. 1라운드의 알림 체인에서 해당 관계는 반전되었습니다. minimal의 Gemini 3.6 Flash는 3번 중 3번을 통과했으며 Flash-Lite는 3번 중 3번 실패했습니다. 여기에는 순서가 없으며 두 가지 다른 실패 형태만 있으며 한 모델의 트래픽에서 안전한 수준이 다른 모델의 트래픽에서는 자동으로 안전하지 않습니다.

우리가 설명할 수 없는 한 가지 예외

두 번째 라운드에서는 minimal에서 한 번의 호출이 62,916 사고 토큰을 반환했습니다.
데이터의 다른 모든 minimal 호출은 정확히 0을 반환했습니다. 이 작업은 5번의 도구 회전을 사용하고 모델의 65,536-token 출력 한도에 가까운 출력을 생성했으며 209 초가 걸렸고 비용은 $0.48. 입니다. 이는 해당 수준에서 다른 호출의 대략 270 배이며 해당 구성이 전체 15-call 라운드에서 소비한 거의 모든 $0.50입니다. 또한 minimal가 특정 작업을 올바르게 수행한 유일한 시간이기도 했습니다.
우리는 이 일이 발생했고 예산을 책정하는 모든 사람에게 중요하기 때문에 minimal에서 이 사실을 보고하고 있습니다. 우리는 메커니즘이 없기 때문에 메커니즘을 제공하지 않을 것입니다. Google의 모델 카드에는 모델의 알려진 제한 사항 중 가끔 느린 응답이 나열되어 있지만 해당 메모를 이 관찰과 연결할 수는 없습니다.
운영상 시사점은 설명 없이 의미합니다. 도구 호출 작업에서 minimal를 실행하는 경우 최대 출력 토큰 제한과 시간 초과를 설정하세요. 일반적으로 사고 토큰을 전혀 쓰지 않는 레벨은 전혀 쓸 수 없는 레벨과 다릅니다.

작업별로 어떤 수준을 선택할 것인가

아래 표가 실무에서 가져갈 결론입니다. 각 행은 위의 두 라운드 결과에 근거하며, 그 근거의 한계는 표 아래에 명시했습니다.

작업 유형수준이유
단일 턴 추출, 분류, 질문 응답, 코드 위치 탐색 및 수정minimal의도적으로 어렵게 만든 20개 작업 중 17개가 세 번의 시도 모두에서 성공했으며, 비용은 기본값의 26%였습니다
계획을 따르거나 작업을 거부하기만 하면 되는 다단계 도구 호출minimal이면 충분합니다일괄적으로 예외를 찾고, 정책 위반 요청을 거부하고, 신뢰할 수 있는 데이터 소스를 선택하는 8단계 체인이 모두 3번 중 3번을 통과했습니다.
모델에 계획에 없는 작업(재시도, 롤백, 선제 차단)이 필요할 수 있는 다단계 도구 호출최소한 lowminimal는 정확히 이것에 대해 2/15 점수를 매겼습니다. low 득점 10/15
동일한 작업이지만 안정적인 성공이 필요한 경우어느 레벨도 해결하지 못함low, medium, high가 각각 10, 10, 8/15였습니다. 차이는 실행 간 변동보다 작으므로, 애플리케이션에서 재시도와 검증으로 처리해야 합니다
하나의 설정으로 혼합 트래픽을 처리하는 경우low추출 작업에서는 사고 토큰이 0이었고 나머지 작업을 위한 여유도 남겼으며, 비용은 기본값보다 61.2% 저렴했습니다
아직 트래픽의 작업 구성을 모르는 경우medium으로 시작해 측정기본값은 합리적인 시작점입니다. 필요 없다는 것을 확인한 후에만 비싼 설정이 됩니다
이 조언의 범위. 우리가 직접 설계한 29 작업, 9개의 일반 작업 및 20 하드 작업에 달려 있으며 모두 4,000 토큰에 대한 입력이 포함됩니다. 긴 맥락의 작업, 다양한 형태의 입력, 창의적 글쓰기 또는 개방형 연구는 다루지 않습니다. 다른 작업 세트는 합리적으로 다른 답변을 생성할 수 있으며 이에 대한 직접적인 증거가 있습니다. medium에서 Gemini 3.6 Flash가 Gemini 3.5 Flash보다 더 많거나 적은 사고 토큰을 사용하는지 여부에 대한 질문에 대해 aibenchy의 독립적 테스트에서는 66.2%를 더 많이 측정했고 우리는 2.0% 더 많이 측정했습니다. 22 짧은 벤치마크 질문과 추출, 도구 호출 및 코드 작업은 동일한 질문에 대해 반대되는 답변을 제공했습니다. 그것은 해결해야 할 분쟁이 아닙니다. 이는 레벨이 토큰을 절약하는지 여부는 모델이 아닌 워크로드의 속성이라는 결과입니다.

자신의 트래픽을 기준으로 이를 측정합니다.

가장 빠른 답변을 얻는 순서대로 4단계를 수행합니다.

  1. 무언가를 변경하기 전에 지금 생각 토큰을 별도로 기록하세요. Google의 API는 설정한 수준과 함께 total_thought_tokens에 개수를 반환합니다. 총 출력 토큰만 추적하면 이번 주에 더 열심히 생각하기로 결정한 수준에서 즉각적인 회귀를 알 수 없습니다.
    from google import genai
    from google.genai import types
    
    client = genai.Client()  # reads the API key from the environment
    
    response = client.models.generate_content(
        model="gemini-3.6-flash",
        contents=prompt,
        config=types.GenerateContentConfig(
            thinking_config=types.ThinkingConfig(thinking_level="minimal"),
        ),
    )
    
    log.info(
        "level=minimal thinking_tokens=%s",
        response.usage_metadata.total_thought_tokens,
    )
생각 횟수를 기존 출력 토큰 측정항목 옆에 자체 필드로 저장하고 함께 보낸 레벨을 저장합니다. 두 개의 토큰 수를 합산하면 어느 토큰이 움직였는지 알려주는 유일한 신호가 사라집니다. 2. medium로 설정하더라도 수준을 명시적으로 설정합니다. 상속된 기본값은 아무도 결정하지 않은 비용 결정입니다. 이는 또한 기본 설정이 변경되면 청구서도 이동할 수 있음을 의미합니다. 3. minimallow에서 하루 동안의 실제 트래픽을 재생하고 벤치마크가 아닌 현재 트래픽과 출력을 비교하세요. 우리 작업에서 해당 비교는 청구서의 61%와 74% 사이의 가치가 있었으며 이는 이 계층에서 사용할 수 있는 어떤 모델 교체보다 더 큰 효과입니다. 4. 다른 모든 것과 별도로 도구 호출 경로의 등급을 지정합니다. 레벨 변경 정확성을 찾은 유일한 곳이며 이를 추출 트래픽과 함께 평균화하면 숨겨집니다.

여러 모델에 걸쳐 비교를 실행한다는 것은 일반적으로 공급업체별로 별도의 통합을 의미하며, 통합 비용은 팀이 측정을 완전히 건너뛰는 가장 일반적인 이유입니다. 하나의 OpenAI 호환 엔드포인트를 표준화하면 이를 제거하므로 모델 문자열이 실행 간에 변경되는 유일한 항목이 됩니다.

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.evolink.ai/v1",
    api_key=os.environ["EVOLINK_API_KEY"],
)

for model in ("gemini-3.6-flash", "gemini-3.5-flash-lite"):
    response = client.chat.completions.create(model=model, messages=messages)
    record(model, response.usage)
EvoLink는 제작팀을 위한 AI 모델 인프라이며, 이러한 종류의 측정은 그 목적의 일부입니다. 요청별로 사용량이 보고되므로 답변과 사고 열을 첫 번째 실행과 별도로 유지할 수 있습니다. 비교를 실행하는 위치는 비교를 실행하는 것보다 훨씬 중요합니다.

FAQ

Gemini 3.6 Flash의 기본 사고 수준은 무엇입니까? medium. 선택 가능한 값은 minimal, low, mediumhigh입니다. 대신 Gemini 3.5 Flash-Lite의 기본값은 minimal이므로 두 모델은 기본적으로 매우 다르게 동작합니다.
생각을 완전히 끌 수 있나요? minimal는 사용 가능한 가장 낮은 설정이며 Google 문서에서는 이 모델에 대해 끄는 것이 아니라 기본적으로 켜져 있다고 생각하는 것을 설명합니다. 실제로 minimal는 102 호출의 101에서 정확히 0개의 사고 토큰을 반환했으므로 대부분의 요청에서 청구 목적으로 꺼진 것처럼 작동합니다. 한 가지 예외는 위에 문서화되어 있으므로 이를 보증으로 설명하지 않습니다.
생각 토큰에는 요금이 청구되나요? 네, 출력 단가로 청구됩니다. Google 문서에 따르면 응답 비용은 출력 토큰과 사고 토큰의 합입니다. Gemini 3.6 Flash의 출력 단가는 100만 토큰당 $7.50이고, 기본 레벨에서 사고 토큰은 출력 토큰의 85%에 해당했습니다. 따라서 대부분의 청구액에서 사고 토큰이 가장 큰 비중을 차지합니다.
기본값보다 minimal가 얼마나 저렴합니까? 9개 작업 세트에서는 패스당 73.6% 더 저렴하며 9개 중 9개는 동일하고 대기 시간은 거의 절반입니다. 비율은 작업이 medium에서 모델을 생각하게 만드는 정도에 따라 달라지므로 이를 예측할 숫자가 아닌 측정 이유로 취급하십시오.
사고 수준이 높을수록 모델이 더 정확해 집니까? 우리가 측정한 범위에서는 그렇지 않았습니다. 다단계 도구 호출에서 minimal의 2/15가 low의 10/15로 올라가는 명확한 단계는 있었습니다. 그러나 low 이상의 점수는 15점 만점에 10점, 10점, 8점이었고, 다섯 번의 시도에서 레벨이 높아질수록 점수가 더 나빠진 작업도 하나 있었습니다. 추론 비중이 큰 단일 턴 작업에서는 minimal이 사고 토큰을 하나도 사용하지 않고 어려운 문제 20개 중 17개를 해결했습니다.
게시된 벤치마크에서는 어떤 사고 수준을 사용합니까? Artificial Analysis는 high에 게시되고 Google의 Flash-Lite 결과 테이블도 high에서 생성되었으며 해당 모델의 API 기본값은 minimal입니다. 기본값을 실행하면 해당 숫자가 설명하는 구성이 실행되지 않습니다.
요청에 얼마나 많은 사고 토큰이 사용되었는지 어떻게 확인할 수 있나요? 응답에서 total_thought_tokens를 읽어보세요. 이를 함께 추가하는 대신 출력 토큰 옆에 자체 필드로 기록하십시오. 그렇지 않으면 나중에 비용 변경을 속성화할 수 없습니다.
사고 수준에 따라 답변 길이가 달라지나요? 간신히. 2개 모델과 4개 레벨을 포괄하는 8개 구성에서 응답 토큰은 작업 세트의 패스당 977와 1,162 사이에 유지되었습니다. 수준은 모델이 응답하기 전에 수행하는 작업을 변경하는 것이지, 얼마나 많이 쓰는지는 변경합니다.

출처

AI 비용을 89% 절감할 준비가 되셨나요?

오늘 EvoLink를 시작하고 지능형 API 라우팅의 힘을 경험해보세요.