
Gemini 3.6 Flash 대 Gemini 3.5 Flash: 프로덕션 워크로드를 옮겨야 할까?
- 지금 옮기십시오 — 청구서에서 출력 토큰이 대부분을 차지한다면. 에이전트 루프, 긴 코드 생성, 추론 중심 작업은 26%에서 29% 더 저렴한 구간에 들어옵니다.
- 작은 이득 — 트래픽이 입력 중심이라면. 출력 토큰 1개당 대략 입력 토큰 20개로 돌아가는 문서 파이프라인은 7.1%를 절약합니다. 입력 가격이 전혀 바뀌지 않았기 때문입니다.
- 지능은 제자리입니다. 독립 측정은 두 모델을 같은 지수에서 50.1과 50.2로 둡니다. 움직인 것은 속도입니다. 초당 출력 토큰 165개에서 304개로, 작업당 2.7분에서 1.3분으로.
- 먼저 테스트하십시오 — 워크로드가 지식 중심이거나 프런트엔드 UI를 생성한다면. 공개된 증거가 반대 방향을 가리키는 두 지점이 바로 그곳입니다.
- thinking 레벨이 모델보다 청구서를 더 크게 움직입니다. 우리 자체 테스트에서 기본
medium에서minimal로 낮추자 우리 작업 세트에서 정확도 손실 없이 패스 비용이 73.6% 줄었습니다. 어느 모델을 돌리든 의도적으로 설정하십시오. - 이것은 모델 문자열만 바꾸는 일이 아닙니다.
temperature,top_p,top_k는 이제 받아들여진 뒤 오류 없이 무시되며,thinking_budget은 더 이상 존재하지 않습니다.
핵심 결론: 워크로드별로
이 업그레이드의 가치는 거의 전적으로 두 가지에 달려 있습니다. 트래픽에서 입력 토큰 대 출력 토큰의 비율, 그리고 지연이 현재 불만거리인지 여부입니다.
| 당신의 워크로드 | 판정 | 이유 |
|---|---|---|
| 멀티턴 에이전트, 도구 호출 루프, 긴 코드 생성 | 옮긴다 | 출력과 thinking 토큰이 대부분을 차지하고, 가격이 내린 것은 그 부분뿐 |
| 작업 지연이 불만인 모든 경우 | 옮긴다 | 독립 측정에서 작업당 시간이 대략 절반으로 |
| 지식 중심 질의응답 | 먼저 섀도런 | 직접 비교 가능한 유일한 세대 간 지식 점수가 하락 |
| 프런트엔드·UI 생성 | 먼저 섀도런 | Google이 여기서 두 가지 구체적 퇴보를 문서화, 둘 다 프롬프트 수준의 해결책 있음 |
| 대략 20:1의 문서 처리·RAG | 서두를 것 없음 | 절감은 7.1%로, 평범한 한 달의 노이즈 범위 안 |
실제로 무엇이 바뀌었나
- 모델 ID:
gemini-3.6-flash. 안정 버전 하나, preview 접미사도 날짜 표기도 없으므로 별칭을 정할 일이 없습니다. - 컨텍스트: 입력 1,048,576 토큰, 출력 65,536 토큰으로 변동 없음. 입력은 텍스트·이미지·비디오·오디오·PDF, 출력은 텍스트만.
- 기본 thinking 레벨:
medium.minimal,low,medium,high중 선택 가능. - 가격: 입력은 100만 토큰당 $1.50으로 유지. 출력은 $9.00에서 $7.50으로, 16.67% 인하. 캐시 읽기는 100만당 $0.15. 배치 및 우선 등급은 Google 가격 페이지를 참고.
gemini-3.5-flash와 gemini-3.6-flash 모두 입력 100만 토큰당 $1.50을 청구합니다. '숨은 인상'이라는 주장은 더 이른 Flash 세대의 가격과 비교한 데서 나옵니다.청구서에는 어떤 일이 벌어지나
비용을 줄여 준다는 것이 두 가지 따로 있습니다. 출력 가격이 16.67% 낮고, 같은 작업에서 모델이 더 적은 출력 토큰을 쓴다고 보고됩니다. 둘을 곱하면 출력 측 지출은 30.8% 줄어듭니다.

| 입력:출력 비율 | 대표 워크로드 | 3.5 Flash | 3.6 Flash | 변화 |
|---|---|---|---|---|
| 20:1 | 문서 처리, RAG | $39.00 | $36.23 | 7.1% 저렴 |
| 5:1 | 일반 질의응답 | $16.50 | $13.72 | 16.8% 저렴 |
| 1:1 | thinking 켠 멀티턴 에이전트 | $10.50 | $7.72 | 26.4% 저렴 |
| 1:3 | 추론 중심 작업, 긴 코드 생성 | $28.50 | $20.17 | 29.2% 저렴 |
이 표는 이렇게 읽으십시오. 각 행은 하나의 워크로드를 3.5 Flash에서 출력 토큰 100만 개로 정규화하고, 입력 토큰은 명시된 비율로 설정하여, 표준 등급 가격으로 계산합니다. 신규 모델에서 출력 토큰 17% 감소, 입력 토큰 동일을 가정합니다.
medium thinking 레벨에서 13.6%, high에서 20.1%를 측정했습니다.medium에서 신규 모델은 이전 모델보다 출력 토큰을 17% 덜 쓴 것이 아니라 1.7% 더 청구했으므로, 우리가 얻은 절감은 거의 전부 토큰 효율이 아니라 출력 단가가 16.67% 내린 데서 왔습니다. high에서는 감소가 일부 나타나, 출력 토큰이 6.4% 줄었습니다. 측정 방법과 전체 숫자는 다음 절에 있습니다.그러니 표는 벤더 주장이 함의하는 산술로, 우리 수치는 하나의 실제 워크로드가 실제로 만들어낸 결과로 읽으십시오. 당신의 작업이 벤치마크 세트보다 우리 쪽을 더 닮았다면, 낮은 숫자로 계획하십시오.
같은 지능, 대략 두 배의 속도
high thinking 레벨에서 측정한 그들의 수치:| 지표 | 3.6 Flash | 3.5 Flash |
|---|---|---|
| 지능 지수 v4.1 | 50.1 | 50.2 |
| Humanity's Last Exam (지식 중심) | 38.3% | 40.2% |
| GPQA Diamond | 92.8% | 92.2% |
| SciCode | 52.7% | 53.1% |
| 장문맥 추론 (AA-LCR) | 69.7% | 69.3% |
| 출력 속도 | 303.6 tok/s | 165.4 tok/s |
| 첫 토큰까지 시간 | 11.54초 | 20.22초 |
| 문항당 평균 시간 | 1.3분 | 2.7분 |
| 문항당 평균 비용 | $0.50 | $0.59 |
high 레벨에서 측정되었지만 API 기본값은 medium**이므로, 기본 구성으로 돌리는 것은 같은 실험이 아닙니다. 둘째, 속도와 지연 수치는 72시간 중앙값인데 모델은 같은 날 출시되었으므로, 표본 창은 하루 미만이며 변동을 예상해야 합니다.그 점을 밝혀 두면, 그림은 분명하며 이는 퇴보가 아니라 맞교환입니다. 지능 지수 50.1 대 50.2는 반올림 차이입니다. 추론과 장문맥 점수는 소폭 올랐습니다. 두 세대에 걸쳐 직접 비교 가능한 유일한 지식 중심 점수인 Humanity's Last Exam은 1.9포인트 하락했습니다. 한편 출력 속도는 84% 올랐고 문항당 시간은 대략 절반이 되었습니다.
지식 중심에 관한 단서는 걱정 하나가 아니라 단계 하나를 더할 가치가 있습니다. 벤치마크 하나에서의 1.9포인트 이동은 이번 출시를 건너뛸 이유가 아니라, 당신 자신의 평가 세트를 확인하라는 신호입니다.
thinking 레벨이 모델보다 청구서를 더 크게 움직인다
high thinking 레벨을 서술하지만, API 기본값은 medium입니다. 그 격차는 구매 결정을 바꿀 만큼 크므로, 우리는 출시 당일 자체 테스트를 돌렸습니다.
| 구성 | 답변 토큰 | thinking 토큰 | thinking 비중 | 패스당 비용 | 정답 |
|---|---|---|---|---|---|
3.6 Flash minimal | 1,162 | 0 | 0% | $0.0158 | 9/9 |
3.6 Flash low | 1,056 | 1,095 | 51% | $0.0232 | 9/9 |
3.6 Flash medium (기본) | 1,080 | 5,944 | 85% | $0.0598 | 9/9 |
3.6 Flash high | 1,092 | 6,679 | 86% | $0.0653 | 9/9 |
3.5 Flash medium | 1,078 | 5,827 | 84% | $0.0692 | 9/9 |
3.5 Flash high | 1,113 | 7,185 | 87% | $0.0818 | 9/9 |
세 가지가 두드러집니다.
medium과 high에서 이들은 출력 측에서 지불하는 전체의 84%에서 87%를 차지합니다. 답변 길이는 표 전체에서 거의 움직이지 않습니다. 어느 모델을 고르느냐는, 어느 레벨을 고르느냐보다 비용에 훨씬 적게 영향을 줍니다.minimal은 '덜 생각하기'가 아니라 '생각하지 않기'입니다. thinking 토큰이 정확히 0으로 돌아왔고, 패스 비용은 기본 medium보다 73.6% 낮았으며, 점수는 똑같이 9분의 9였습니다. 레벨을 한 번도 고르지 않아서 medium에 있는 것이라면, 그것이 당신이 쓸 수 있는 가장 큰 비용 레버이며, 이미 돌리고 있는 그 모델에서 작동합니다.high는 medium보다 겨우 9.3% 더 들었습니다. 추가 예산이 쓰이지 않았기 때문입니다. thinking이 5,944 토큰에서 6,679로 올랐을 뿐입니다. 이는 모델이 아니라 이 작업들에 관한 사실입니다. 더 어려운 작업에서는 이 격차가 벌어집니다.우리 수치가 다른 독립 실측과 어긋나는 지점
medium에서 29.4% 더 비싸고 high에서 9.7% 더 싸다고 밝혔습니다. 우리는 두 레벨 모두에서 각각 13.6%와 20.1% 더 싸다고 봤습니다. high 결과는 방향이 일치하고, medium 결과는 정반대를 가리킵니다. 이유는 한 숫자에서 보입니다. 그들은 신규 모델이 medium에서 thinking을 66.2% 더 썼다고 측정했고, 우리는 2.0% 더 썼다고 측정했습니다.Google이 신규 모델이 더 못한다고 말하는 두 가지
모델 카드는 알려진 한계로 환각, 그리고 이따금 발생하는 느린 응답이나 타임아웃도 나열합니다.
전환은 모델 문자열을 바꾸는 일이 아니다
temperature, top_p, top_k는 무시되며, 오류는 발생하지 않습니다. Google 문서는 향후 모델 세대가 HTTP 400을 반환할 것이라고 명시하지만, 오늘은 그 값들이 그냥 버려집니다. 추출이나 분류 파이프라인을 결정론적으로 유지하려고 temperature=0에 의존한다면, 그 보장은 로그 한 줄도, 예외도, 알림도 없이 사라집니다. 대체 방법은 규칙을 system instruction에 넣는 것입니다.temperature, top_p, seed를 지원 파라미터로 나열하므로, 게이트웨이는 당신의 값을 받아 전달하고 모델은 그것을 무시합니다. 오늘 출력 품질을 개선하려고 temperature를 튜닝하는 사람은 no-op을 튜닝하고 있는 것입니다.thinking_budget은 thinking_level로 대체됩니다. 예전의 숫자형 예산이 문자열 열거형이 됩니다. 한 요청에 둘 다 보내면 400을 반환합니다.candidate_count는 Gemini 3.x에서 지원되지 않습니다. 마지막 메시지가 model 역할을 지닌 요청은 이제 400을 반환하며, 이로써 응답 프리필이 사라집니다. 그리고 이제 모든 FunctionResponse는 call_id와 name을 모두 지녀야 합니다.base_url을 하나의 게이트웨이로 지정하고 모델 문자열만 바꿔 두 번째 통합을 먼저 세우지 않고도 당신의 프롬프트로 A/B 할 수 있습니다. 그것이 위의 지식 중심·UI 질문을 당신 자신의 트래픽에 대해 답하는 가장 저렴한 방법입니다.스위치를 넘기기 전에
공개된 숫자들은 질문을 좁혀 줍니다. 네 가지 측정이 그것을 닫습니다.
- 답변 토큰과 thinking 토큰을 따로 기록하십시오. 총 토큰 지표는 청구서가 왜 움직였는지 알려 주지 못합니다. 두 구성요소 중 이 모델들 사이에서 다르게 행동하는 것은 하나뿐이기 때문입니다.
- thinking 레벨을 명시적으로 고정하십시오. 실수로
medium을 물려받지 말고, 공개 벤치마크가 쓴high레벨이 아니라 실제로 돌리는 레벨로 비용을 계산하십시오. 우리 작업 세트에서는 이것이 모델 변경보다 값어치가 있었습니다.minimal은 같은 정확도에서 기본medium보다 73.6% 저렴했습니다. 같은 결과를 가정하기 전에, 당신 자신의 작업이 그것을 견디는지 확인하십시오. - 벤치마크 세트가 아니라 당신의 실제 프롬프트 조합으로 섀도런하십시오. 트래픽이 지식 중심이라면 이것이 가장 중요합니다. 비교 가능한 점수가 하락한 유일한 축이 바로 그것이기 때문입니다.
- 전환하기 전에 grep 하십시오. 코드베이스에서
temperature,top_p,top_k,thinking_budget,candidate_count를 검색하십시오. 앞의 셋은 조용히 실패하므로, 테스트는 통과하고 출력은 드리프트합니다.
FAQ
gemini-3.5-flash는 종료되나요?
Google이 공지한 은퇴 날짜는 gemini-2.5-flash와 gemini-2.5-flash-lite가 2026-10-16, gemini-3.1-flash-lite가 2027-05-07입니다. 2026-07-21에 출시된 모델들에는 은퇴 날짜가 공지되지 않았습니다. 이 결정을 강제하는 공지된 마감일이 없으므로, 시간을 들여 측정할 수 있습니다.temperature=0을 계속 쓸 수 있나요?
아니요. 그리고 이것이 주시해야 할 실패 방식입니다. 이 파라미터는 오류 없이 받아들여진 뒤 무시됩니다. 제약을 system instruction으로 옮기고, 요청이 아니라 출력을 검증하십시오.gemini-3.6-flash입니다. 안정 버전이 하나뿐이며, preview 접미사도, 골라야 할 날짜 표기 변형도 없습니다.출처
- Introducing Gemini 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber, Google, 2026-07-21
- Gemini API 모델 문서, Google
- Gemini API 가격, Google
- Gemini API 변경 로그, Google
- Using the latest Gemini models, Google
- Gemini 3.6 Flash, Google DeepMind
- Gemini 3.6 Flash (Gemini Enterprise Agent Platform), Google Cloud
- Gemini 3.6 Flash and Gemini 3.5 Flash-Lite: Halving Time per Task, Artificial Analysis, 2026-07-21
- aibenchy, 독립 22문항 실측, 2026-07-21
- Gemini 3.6 Flash 모델 메타데이터, OpenRouter


