Seedance 2.5가 EvoLink에 출시되었습니다Seedance 2.5 체험하기
Gemini 3.5 Flash vs Gemini 3 Flash Preview: 가격, 컨텍스트, 마이그레이션 가이드
비교

Gemini 3.5 Flash vs Gemini 3 Flash Preview: 가격, 컨텍스트, 마이그레이션 가이드

EvoLink Team
EvoLink Team
Product Team
2026년 5월 20일
업데이트일 2026년 7월 18일
18분 소요
최종 확인일: 2026년 7월 18일. 아래 가격 및 기능 정보는 해당 날짜에 확인한 Google 공식 모델 문서와 EvoLink 플랫폼 데이터를 기반으로 합니다.
Google의 Gemini Flash 패밀리에는 현재 API로 사용할 수 있는 두 세대의 모델이 있습니다: Gemini 3.5 Flash(안정 버전)와 Gemini 3 Flash Preview입니다. 이미 Gemini 3 Flash Preview를 프로덕션에서 운영하고 있거나 새로운 Flash 모델을 검토하고 있다면, 단순히 "새 모델이 더 좋다"라고 결론 내릴 수 없습니다. 진짜 질문은 이것입니다: 여러분의 워크로드에서 기능 향상이 3배 가격 인상을 정당화할 수 있는가?

핵심 요약

  • Gemini 3 Flash Preview$0.50/$3.00 / 1M 토큰(입력/출력)으로 여전히 저렴한 선택입니다. 비용에 민감하고 대량 처리가 필요하며 Preview 상태를 수용할 수 있는 워크로드에 적합합니다.
  • Gemini 3.5 Flash$1.50/$9.00 / 1M 토큰이지만, 안정적인 GA 모델로서 추론, 함수 호출, 구조화된 출력이 강화되어 에이전트 워크플로우에 적합합니다.
  • 두 모델 모두 1M 토큰 컨텍스트 윈도우와 65,536 토큰 출력 상한을 공유합니다.
  • Model ID 변경 자체는 간단하지만 thinking, function response, multi-turn 동작, prompt는 달라질 수 있습니다. 트래픽을 옮기기 전에 실제 작업을 replay하고 성공한 작업당 비용을 측정하세요.

상세 비교 표

항목Gemini 3.5 FlashGemini 3 Flash Preview
Model IDgemini-3.5-flashgemini-3-flash-preview
상태안정 버전 (GA)Preview
입력 가격$1.50 / 1M tokens$0.50 / 1M tokens
출력 가격$9.00 / 1M tokens$3.00 / 1M tokens
캐시 히트 가격$0.15 / 1M tokens$0.05 / 1M tokens
오디오 입력 가격$1.50 / 1M tokens$1.00 / 1M tokens
컨텍스트 윈도우1,048,576 tokens1,048,576 tokens
출력 상한65,536 tokens65,536 tokens
멀티모달 입력Text, image, video, audio, PDFText, image, video, audio, PDF
함수 호출YesYes
구조화된 출력YesYes
코드 실행YesYes
Context cachingYesYes
Batch APIYesYes
Google Search groundingYesYes
내장 추론Yes (강화)Yes

Gemini 3 Flash Preview를 유지해야 하는 경우

다음 상황에서는 Gemini 3 Flash Preview가 여전히 좋은 선택입니다.

비용이 가장 중요한 경우

입력 $0.50, 출력 $3.00 / 1M 토큰으로, Gemini 3 Flash Preview는 Gemini 3.5 Flash보다 3배 저렴합니다. 분류, 추출, 포맷팅, 라우팅 등 이미 품질이 충분한 대량 처리 작업에서는 비용 차이가 빠르게 누적됩니다.
예시: 하루에 입력 10M 토큰, 출력 2M 토큰을 처리하는 파이프라인:
모델일일 입력 비용일일 출력 비용일일 합계월간 합계
Gemini 3 Flash Preview$5.00$6.00$11.00$330
Gemini 3.5 Flash$15.00$18.00$33.00$990

파이프라인 하나에서 월 $660 차이가 발생합니다.

Preview 상태를 수용할 수 있는 경우

가끔 API 동작이 변경되어도 문제없는 워크로드이고, 이미 Preview 모델 운영(버전 고정, 업데이트 후 테스트 등)에 익숙하다면, Gemini 3 Flash Preview를 유지하는 것이 불필요한 마이그레이션 비용을 절약합니다.

현재 품질이 합격 기준을 충족하는 경우

기존 Gemini 3 Flash Preview 연동이 스키마 유효성, 사실 정확도, 지연 시간, 재시도율에서 기준을 통과하고 있다면, 새 모델이 있다는 이유만으로 마이그레이션할 필요는 없습니다.

Gemini 3.5 Flash로 마이그레이션해야 하는 경우

다음 상황에서는 Gemini 3.5 Flash가 더 나은 선택입니다.

GA 수준의 안정성이 필요한 경우

Preview 모델은 버전 간 동작이 변경될 수 있습니다. Gemini 3.5 Flash는 안정적인 GA 모델로, 예기치 않은 리그레션을 감당할 수 없는 프로덕션 배포에 적합합니다.

에이전트 워크플로우에 더 강한 추론이 필요한 경우

Gemini 3.5 Flash는 강화된 내장 추론 기능을 포함합니다. 다단계 계획, 도구 선택, 복잡한 함수 호출 체인을 포함하는 에이전트 하위 단계에서 향상된 추론은 재시도율과 폴백 빈도를 줄여 토큰 가격 상승분을 상쇄할 수 있습니다.

구조화된 출력의 신뢰성이 중요한 경우

파이프라인이 엄격한 스키마 준수(JSON mode, 함수 호출 응답, 타입 지정 출력)에 의존하는 경우, Gemini 3.5 Flash의 개선된 구조화된 출력으로 검증 실패와 하위 오류 처리를 줄일 수 있습니다.

새 프로젝트를 처음부터 구축하는 경우

기존 Gemini 3 Flash Preview 연동이 없는 새 프로젝트에서는 처음부터 Gemini 3.5 Flash를 채택하여, 향후 폐기될 수 있는 Preview 모델 위에 구축하는 위험을 피할 수 있습니다.

마이그레이션 체크리스트

Gemini 3 Flash Preview에서 Gemini 3.5 Flash로 마이그레이션을 결정한 경우:

1. 모델 ID 업데이트

gemini-3-flash-preview → gemini-3.5-flash

EvoLink의 통합 API를 사용하고 있다면 요청의 model 파라미터만 변경하면 됩니다. 엔드포인트나 인증 변경은 필요 없습니다.

2. 예산 재추정

현재 Gemini 3 Flash Preview 지출에 약 3배를 곱해서 Gemini 3.5 Flash 비용을 추정하세요. 향상된 추론으로 재시도율이 낮아질 수 있는 워크로드에서는 그 절감분도 고려하세요.

3. 병렬 평가 수행

프로덕션 트래픽을 전환하기 전에 동일한 워크로드 샘플로 두 모델을 모두 실행하세요. 비교 항목:

  • 작업 성공률
  • 재시도율
  • 지연 시간 (첫 번째 토큰까지의 시간 및 전체 완료 시간)
  • 스키마 유효성
  • 성공한 작업당 비용

4. 모니터링 및 알림 업데이트

비용 알림과 예산 임계값을 새로운 가격 체계에 맞게 조정하세요.

5. 폴백 계획 수립

마이그레이션 기간 동안 Gemini 3 Flash Preview를 폴백 경로로 유지하세요. Gemini 3.5 Flash에서 할당량 압력이나 지연 시간 급등이 발생하면 코드 변경 없이 되돌릴 수 있습니다.

성공한 작업당 비용: 진정한 비교 기준

토큰 단가는 비용의 일부일 뿐입니다. Gemini 3.5 Flash가 여러분의 워크로드에서 재시도를 줄이고, 폴백을 줄이고, 첫 번째 시도 성공률을 높인다면, 실질적인 비용 차이는 줄어듭니다.

지표확인할 사항
요청당 토큰 비용직접적인 가격 차이
재시도율첫 번째 응답이 검증에 실패하는 빈도
폴백율Flash가 더 강력한 모델로 에스컬레이션하는 빈도
지연 시간첫 번째 토큰까지의 시간 및 전체 완료 시간
작업 성공률첫 번째 시도에서 수용 기준을 충족하는 비율
성공한 작업당 비용재시도, 폴백, 낭비된 토큰을 포함한 혼합 비용

토큰 단가가 3배 비싸더라도 첫 번째 시도에 성공하는 모델이, 2~3번 재시도가 필요한 모델보다 저렴할 수 있습니다.

Gemini 3.1 Flash-Lite는?

대용량 작업에서 Gemini 3.5 Flash의 비용이 맞지 않는다면 안정 버전인 Gemini 3.1 Flash-Lite($0.25/$1.50 / 1M 토큰)를 평가하세요. Gemini 3 Flash Preview를 영구적인 저가 계층으로 유지하는 것보다 장기 운영에 적합한 비용 우선 경로입니다.
모델입력출력적합한 용도
Gemini 3.1 Flash-Lite$0.25$1.50안정 버전, 대용량, 비용 최우선
Gemini 3 Flash Preview$0.50$3.00비용과 기능의 균형
Gemini 3.5 Flash$1.50$9.00GA 안정성 및 에이전트 워크플로우
gemini-3-flash-preview → gemini-3.5-flash

thinking 기본값 변화가 가장 중요합니다

Gemini 3 Flash Preview는 high, Gemini 3.5 Flash는 medium이 기본입니다. 같은 prompt에서도 품질, latency, token이 달라질 수 있습니다. 모두 high로 고정하지 말고 task class별 minimal, low, medium, high를 비교하세요. thinking_budgetthinking_level로 바꿉니다. Thought Preservation은 기본 활성화되어 multi-turn reasoning을 돕지만 token을 늘릴 수 있습니다.

route가 살아 있어도 Function calling은 실패할 수 있습니다

수동 FunctionResponse에는 원래 call의 id, 일치하는 name, 동일한 element 수가 필요합니다. SDK 자동 loop와 달리 자체 agent, queue, orchestrator는 contract test가 필요합니다.
contractfailure
id 누락결과를 원래 call에 연결하지 못함
name 불일치response 거부 또는 무시
개수 불일치multi-tool state 어긋남
thought context 손실반복 call 또는 후속 품질 저하

production replay와 rollout

text, structured output, multimodal, tool task를 같은 prompt, SDK, timeout, acceptance rule로 replay합니다. 성공률, p50/p95, input/output/thinking token, tool call, retry, fallback, 성공 작업당 비용을 측정하고 shadow에서 5–10% canary로 진행하세요.

흔한 마이그레이션 실수

  • Model ID만 바꾸고 SDK v2와 Interactions API를 검증하지 않음.
  • temperaturetop_ptop_k를 유지함.
  • high에서 medium으로 바뀐 기본값을 놓침.
  • FunctionResponse에 id/name을 넣지 않음.
  • token 가격만 보고 failure와 tool overuse를 세지 않음.

FAQ

Gemini 3.5 Flash는 Gemini 3 Flash Preview를 직접 대체할 수 있나요?

기능적으로는 그렇습니다. 두 모델 모두 동일한 입력 모달리티, 함수 호출, 구조화된 출력, context caching을 지원합니다. 다만 Gemini 3.5 Flash는 더 높은 가격의 GA 모델이고, Gemini 3 Flash Preview는 Preview 가격으로 계속 사용할 수 있습니다.

Gemini 3 Flash Preview는 폐기되나요?

2026년 7월 18일 기준, Google은 Gemini 3 Flash Preview의 폐기 날짜를 발표하지 않았습니다. 그러나 Preview 모델은 일반적으로 시간이 지나면 안정 버전으로 대체되는 경향이 있습니다. Gemini API 릴리스 노트에서 폐기 공지를 확인하세요.

EvoLink를 통해 두 모델 모두 사용할 수 있나요?

네. EvoLink의 통합 API는 두 모델 ID를 모두 지원합니다. 비용, 품질, 지연 시간 요구 사항에 따라 서로 다른 워크로드를 서로 다른 모델로 라우팅할 수 있으며, 별도의 제공업체 통합을 관리할 필요가 없습니다.

3배 가격 인상이 가치가 있나요?

워크로드에 따라 다릅니다. 대량 처리, 비용 민감 작업에서 Gemini 3 Flash Preview가 이미 품질 기준을 충족하는 경우 업그레이드가 정당화되지 않을 수 있습니다. 에이전트 워크플로우, 구조화된 출력 파이프라인, GA 안정성이 필요한 프로덕션 시스템에서는 추론과 신뢰성 향상이 비용 증가를 상쇄할 수 있습니다.

마이그레이션 전에 어떻게 테스트하나요?

프로덕션 워크로드의 대표적인 샘플로 두 모델을 모두 실행하세요. 작업 성공률, 재시도율, 지연 시간, 성공한 작업당 비용을 비교합니다. "새 모델이 전반적으로 더 낫다"는 가정이 아닌 실측 결과에 기반해 결정하세요.

Gemini 3.5 Flash는 Preview의 직접 대체인가요?

Model ID 변경만으로는 부족합니다. SDK v2, thinking_level, FunctionResponse, Thought Preservation, tool, 비용을 검증하세요.

latency나 token이 달라지는 이유는 무엇인가요?

thinking default, thought 보존, prompt 동작, tool call 수가 달라질 수 있기 때문입니다. 같은 trace로 다시 측정하세요.

rollout은 어떻게 해야 하나요?

shadow replay, 5–10% canary, 품질·latency·error·cost rollback threshold 순으로 진행하세요.

EvoLink에서 Gemini Flash 모델 비교

EvoLink는 Gemini 3.5 Flash와 Gemini 3 Flash Preview에 모두 액세스할 수 있는 통합 API를 제공합니다. 하나의 통합으로 라우팅, 폴백 동작, 워크로드 수준 비용을 테스트할 수 있습니다.

관련 글:

EvoLink에서 탐색:

Gemini 3.5 Flash와 Gemini 3 Flash Preview의 마이그레이션 호환 workflow
Gemini 3.5 Flash와 Gemini 3 Flash Preview의 마이그레이션 호환 workflow

출처

AI 비용을 89% 절감할 준비가 되셨나요?

오늘 EvoLink를 시작하고 지능형 API 라우팅의 힘을 경험해보세요.