Seedance 2.5가 EvoLink에 출시되었습니다Seedance 2.5 체험하기
어두운 프로덕션 게이트웨이를 통과하는 두 개의 AI 빛 라우트
비교

Gemini 3.7 Flash vs Gemini 3.6 Flash: 지금 업그레이드해야 할까

EvoLink Team
EvoLink Team
Product Team
2026년 8월 14일
14분 소요

결론부터

Gemini 3.7 Flash의 가격은 Gemini 3.6 Flash와 완전히 같습니다. input, output, cache 단가가 모두 같고 1,048,576 토큰 컨텍스트도 같으며 엔드포인트도 같습니다. 어느 쪽도 가격을 근거로 내세울 수 없다는 뜻입니다. 예산을 설득할 일이 없으니 판단은 유난히 깔끔합니다. 전환에 드는 노력과 성능만 저울에 올리면 됩니다.
워크로드가 코딩이나 멀티스텝 agent라면 업그레이드하세요. Google이 공개한 benchmark에서 개선 폭이 가장 큰 영역입니다. 반대로 minimal thinking level로 대량 분류나 추출을 돌리고 있다면 당분간 3.6에 남으십시오. 3.7에는 그 레벨이 더 이상 없습니다. 이런 파이프라인의 정답은 애초에 3.7이 아니라 Gemini 3.5 Flash-Lite입니다.

아래 내용은 결정을 확정하기 전에 검증해야 할 항목들입니다.

실제로 바뀐 것

Gemini 3.7 Flash는 새로 사전학습한 모델이 아닙니다. Google 모델 카드는 이를 Gemini 3.6 Flash의 추론 기반에 대한 알고리즘 개선으로 설명하며, 3주 뒤에 출시되었습니다. 이러한 위치 설정은 업그레이드 판단에서 중요합니다. 예상해야 할 것은 같은 계열 안에서의 동작 드리프트이지, 실패 양상이 다른 별개의 모델이 아닙니다.
Google이 밝힌 개선은 세 영역에 몰려 있습니다. 실무 코딩(FrontierCode), 장기 호흡의 소프트웨어 엔지니어링(DeepSWE), 그리고 agent 실행(Terminal-bench, AutomationBench)이며 agent benchmark는 대략 두 배로 올랐습니다. 전체 수치와 벤더 출처에 대한 단서 조항은 Gemini 3.7 Flash 출시 정리에 있습니다. 모두 Google 자체 수치이며, 출시 시점에는 독립적인 재현 검증이 없었습니다.
바뀌지 않은 것은 가격, 컨텍스트 윈도, 최대 출력, 지원 모달리티, 그리고 호출하는 엔드포인트입니다. 따라서 마이그레이션은 대부분 model ID 교체와 파라미터 정리로 끝납니다.

3.6에서 3.7로의 전환은 드롭인인가

그렇지는 않습니다. Google 공식 마이그레이션 체크리스트 기준으로 네 가지가 깨집니다.

  • minimal thinking level이 사라졌습니다. 사용 가능한 레벨은 low, medium(기본값), high입니다. Gemini API에 minimal을 보내면 오류가 납니다.
  • temperature, top_p, top_k, candidate_count는 제거해야 합니다. generation config에서 빼십시오.
  • 숫자형 thinking_budget이 문자열 thinking_level로 대체되었습니다.
  • 미리 채워 넣은 model 턴은 제거해야 합니다.
EvoLink에서는 reasoning_effort: "none" 또는 "minimal"을 계속 보내는 요청을 실패시키지 않고 low로 낮추도록 되어 있습니다. 덕분에 호출 지점을 순차적으로 고쳐 나가는 단계적 전환 중에도 트래픽이 중간에 끊기지 않습니다.

반드시 테스트해야 할 동작 변화

benchmark는 남의 태스크에서 어디가 좋아졌는지를 알려줄 뿐입니다. 실제 여러분의 태스크에서 드러날 가능성이 큰 변화는 다음과 같습니다.

태스크당 토큰 사용량. 요금표가 같다고 청구서가 같지는 않습니다. 출시 당일 보고 중에는 3.7이 3.6보다 태스크당 토큰을 더 많이 쓴다는 관측이 있었습니다. 더 많이 추론하도록 튜닝된 모델이라면 충분히 그럴듯한 이야기입니다. thinking 토큰은 output 단가로 과금되므로, 토큰당 가격이 같아도 더 많이 생각하는 모델은 태스크당 비용이 올라갈 수 있습니다. 측정 기준은 요청당이 아니라 채택된 결과 하나당 총 토큰이어야 합니다.
가장 싼 티어가 비싸졌습니다. minimal로 돌리고 있었다면 새 하한선은 low입니다. 대량 호출 분류 파이프라인에서는 이 차이가 모든 호출에 누적됩니다. 3.6 워크로드를 3.7로 옮기지 말아야 할 가장 흔한 이유가 바로 이것입니다.
지시 준수와 사실성. Google은 안전성과 톤이 3.6 Flash와 비슷하다고 보고합니다. 반면 한 독립 트래커는 출시 시점 3.7의 hallucination 비율이 더 높게 측정되었다고 밝혔습니다. 둘 다 여러분의 프롬프트에 대한 판정은 아닙니다. 프로덕션으로 승격하기 전에 자체 회귀 테스트 세트를 돌려야 할 근거로 보시면 됩니다.
agent 루프 동작. 핵심 주장은 agent 루프 실패가 줄고 막혔을 때의 회복이 나아졌다는 것입니다. agent를 운영한다면 계측할 가치가 있는 변화입니다. 최종 답변 품질만이 아니라 재시도 횟수, 잘못된 tool call, 중도 포기한 실행 수를 세어 보십시오.

3.6 Flash에 남는 편이 옳은 경우

  • minimal thinking에 의존하고 있다. 모든 호출마다 low 하한선을 지불하는 대신 3.5 Flash-Lite를 평가해 보십시오.
  • 작업이 단순하고 지연에 민감하며 호출량이 많다. 추론이 늘어나는 건 공짜가 아닙니다. 이런 조건에서는 Lite 티어 경로가 보통 유리합니다.
  • 검증을 마치고 동결한 파이프라인이 있고 코딩·agent 쪽 고통이 없다. 가격 유인이 없는 상황에서 안정적인 시스템을 업그레이드하면 남는 건 재검증 작업뿐입니다.
  • 지금 회귀 검증 기간을 낼 수 없다. 출시 간격이 3주라면 다음 모델도 곧 나올 가능성이 큽니다. 검증을 모아서 나중에 처리해도 손해가 없습니다.

재현 가능한 평가 절차

검증 게이트와 롤백 경로를 갖춘 다크 프로덕션 평가 라우트
검증 게이트와 롤백 경로를 갖춘 다크 프로덕션 평가 라우트
가격이 동일하므로 답할 가치가 있는 질문은 하나뿐입니다. 3.7이 토큰당 기준으로 여러분의 태스크를 더 잘 끝내는가. 네 단계입니다.
  1. 베이스라인을 동결합니다. 3.6 Flash에서 실제 요청 50~200건을 전체 텔레메트리와 함께 수집하십시오. input 토큰, output 토큰, thinking 토큰, cache 적중, tool call 유효성, 재시도, 사람이 손본 횟수까지 포함합니다.
  2. 3.7로 리플레이합니다. 같은 프롬프트, 같은 도구, 같은 thinking level(minimallow는 명시적으로 매핑해 무엇과 무엇을 비교하는지 분명히 하십시오). 변수는 한 번에 하나씩만 바꿉니다.
  3. 3.7을 챌린저로 태웁니다. 실 트래픽 일부를 라우팅해 태스크 채택률과 채택 태스크당 총비용으로 비교하십시오. 요청당 가격은 정의상 동일하므로 비교 대상이 아닙니다.
  4. 승격과 rollback 기준을 미리 정합니다. 3.7을 기본값으로 만들 숫자와 되돌릴 숫자를, 결과를 보기 전에 확정해 두십시오.

두 모델 모두 같은 엔드포인트에서 같은 가격으로 유지되므로, rollback은 model ID 변경 한 줄이며 상업적 대가가 없습니다.

EvoLink에서 두 모델을 함께 운영하기

3.6과 3.7을 나란히 두는 것이야말로 게이트웨이를 쓰는 이유입니다. 키 하나, 클라이언트 하나, model ID 둘, 그리고 되돌리는 데 비용이 들지 않는 스위치. 챌린저 구간에는 gemini-3.7-flash를 호출하고, 기준을 충족할 때까지 프로덕션은 gemini-3.6-flash로 계속 서비스하십시오.
최신 요금과 코드 예제는 모델 페이지에서 확인하십시오: Gemini 3.7 Flash · Gemini 3.6 Flash · 전체 Gemini 모델.

FAQ

Gemini 3.7 Flash가 Gemini 3.6 Flash보다 좋습니까?

Google이 공개한 benchmark 기준으로는 그렇습니다. 특히 코딩과 agent 실행에서 차이가 뚜렷합니다. 다만 벤더가 발표한 수치이고, 한 독립 트래커는 출시 시점에 더 높은 hallucination 비율을 측정했습니다. 기본 모델을 바꾸기 전에 자체 태스크로 검증하십시오.

Gemini 3.7 Flash가 3.6 Flash보다 비쌉니까?

아닙니다. 2026년 12월 31일까지 적용되는 도입 가격을 포함해 요금표가 동일합니다. 다만 3.7이 태스크당 토큰을 더 많이 쓰면 청구액은 달라질 수 있습니다. thinking 토큰이 output 단가로 과금되기 때문입니다.

3.6에서 3.7로 옮기려면 코드를 고쳐야 합니까?

대부분 model ID만 바꾸면 되고, 여기에 temperature, top_p, top_k, candidate_count 제거, 숫자형 thinking_budget을 문자열 thinking_level로 교체, 미리 채운 model 턴 제거가 더해집니다.

minimal thinking level은 무엇으로 대체됩니까?

3.7 Flash의 새 하한선은 low입니다. 비용에 민감하고 물량이 많은 분류·추출 작업이라면, 모든 호출에 low를 지불하기보다 Gemini 3.5 Flash-Lite가 대체로 더 나은 선택입니다.

단순한 챗봇이나 분류만 돌린다면 업그레이드해야 합니까?

대개 아닙니다. 개선은 코딩과 멀티스텝 agent에 집중되어 있고, 단순하고 물량이 많은 작업은 Lite 티어 모델이 더 적합합니다.

Gemini 3.7 Flash와 3.6 Flash를 동시에 운영할 수 있습니까?

가능합니다. 엔드포인트와 가격을 공유하므로 트래픽 일부를 챌린저로 3.7에 보내고, model ID만 바꿔 rollback할 수 있습니다.

Gemini 3.6 Flash는 지원이 종료됩니까?

Google은 Gemini 3.6 Flash의 종료 일정을 발표하지 않았습니다. 3.7 Flash와 함께 동일한 가격으로 계속 제공됩니다.

가격이 바뀌기까지 시간이 얼마나 남았습니까?

도입 요금은 두 모델 모두 2026년 12월 31일까지 적용되고 2027년 1월 1일부터 표준 요금으로 전환됩니다. 즉 업그레이드 판단과 가격 마감일은 서로 독립적인 문제입니다.

AI 비용을 89% 절감할 준비가 되셨나요?

오늘 EvoLink를 시작하고 지능형 API 라우팅의 힘을 경험해보세요.