Gemini 3.5 Flash Lite API
Gemini 3.5 Flash Lite 선택
Google 3.5 클래스에서 가장 저렴하고 빠른 모델로, 저지연 분류, 라우팅, 추출과 경량 에이전트 서브에이전트에 적합합니다. 100만 Token 전체 컨텍스트를 100만 Token당 $0.30 / $2.50로 제공합니다.
Gemini 3.5 Flash Lite
Google 3.5 클래스에서 가장 빠르고 비용 효율적인 모델
gemini-3.5-flash-lite고처리량 분류와 추출, 저지연 실시간 작업, 목적이 명확한 에이전트 서브에이전트, 그리고 최대 추론보다 속도와 가격이 더 중요한 비용 민감 워크로드.
Gemini 3.5 Flash Lite pricing
Estimate a request with the interactive pricing calculator. All user groups use the official Gemini 3.5 Flash Lite rate.
Token calculator
Enter the token mix for one request.Estimated request cost
Gemini 3.5 Flash LiteMinimum charge: 0.01 credits per request.
EvoLink vs Google direct
Same token mix, default group price.Budget guide
Approximate requests using the current token mix.For quick testing
For regular development
For production evaluation
Model pricing
| Model | Context | Input tokens | Cache read tokens | Output tokens |
|---|---|---|---|---|
Gemini 3.5 Flash Litegemini-3.5-flash-lite | All context sizes | $0.271 / 1M-10% 18.4 cr / 1M$0.300official price | $0.028 / 1M-7% 1.9 cr / 1M$0.030official price | $2.250 / 1M-10% 153 cr / 1M$2.500official price |
Gemini 3.5 Flash Lite
All context sizesUSD and credits are shown per 1M tokens. Live backend pricing takes priority over these frozen fallback rates.
빠르고 저렴한 고처리량 워크로드를 위한 Gemini 3.5 Flash Lite API
EvoLink 통합 API로 Google의 3.5 클래스에서 가장 저렴하고 빠른 모델인 Gemini 3.5 Flash Lite를 호출하세요. 저지연 분류, 라우팅, 추출과 경량 에이전트의 서브에이전트를 위해 설계되었으며, 1,048,576 토큰 컨텍스트, 프롬프트 캐싱, 구조화 출력, 도구 사용을 지원하고 가격은 100만 입력 / 출력 토큰당 $0.30 / $2.50입니다.
프로덕션 모델 스택에서 Gemini 3.5 Flash Lite가 자리를 얻는 지점
Google은 Gemini 3.5 Flash Lite를 3.5 클래스에서 가장 빠르고 비용 효율적인 모델로 포지셔닝합니다. 최대 추론보다 낮은 가격과 속도가 더 중요한, 대량이면서 지연에 민감한 작업에 가장 잘 맞으며, 소수의 어려운 요청은 더 큰 모델로 올려 보낼 수 있습니다.
고처리량 분류와 추출
Gemini 3.5 Flash Lite는 고처리량 분류, 라우팅, JSON 추출을 위해 만들어졌습니다. 100만 Token당 $0.30 / $2.50로, 프리미엄 모델이 낭비될 상황에서도 많은 요청을 저렴하게 처리할 수 있습니다.
저지연이면서 비용에 민감한 확장
Google은 출력이 초당 약 350 Token이라고 밝히며, 이는 실시간 UI 동작, 자동완성, 모더레이션 등 지연이 중요한 경로에 잘 맞습니다. 벤치마크 헤드라인이 아니라 요청당 비용과 속도를 측정하세요.
가볍고 초점이 좁은 에이전트의 서브에이전트
더 큰 멀티에이전트 시스템 안에서 초점이 좁은 작업을 수행하는 서브에이전트에 적합합니다. 속도를 위해 기본적으로 최소 사고를 사용하므로, 다단계 도구 사용에서는 확장하기 전에 에이전트가 조기에 종료하지 않는지 검증하세요.
더 큰 모델로 올려 보낼 시점
깊은 저장소 리팩터링, 장시간 자율 코딩, 어려운 다단계 추론은 Gemini 3.6 Flash나 Pro 등급 모델의 몫입니다. 대량의 다수 요청에는 Flash Lite를 쓰고, 어려운 소수만 위로 라우팅하세요.
Gemini 3.5 Flash Lite에 대한 초기 반응이 시사하는 점과 아직 입증이 필요한 점
Gemini 3.5 Flash Lite는 2026-07-21에 Gemini 2.5 Flash의 대체 모델로 출시되었습니다. 출시 시점의 반응은 가설로 다루고, 자신의 작업, 도구, 예산, 승인 기준에서 검증하세요.
가격 대비 성능이 핵심
100만 Token당 입력 $0.30 / 출력 $2.50에 초당 약 350 Token으로, 매력은 달러당 처리량입니다. 단순하고 대량인 작업에서는 허용 가능한 품질을 유지하며 총비용에서 더 비싼 모델을 앞설 수 있습니다.
Gemini 2.5 Flash와 더 가벼운 3-Flash 워크로드를 대체
Google은 이를 Gemini 2.5 Flash와 덜 복잡한 Gemini 3 Flash 작업의 드롭인 대체로 제시합니다. 지금 이를 사용 중이라면 마이그레이션 전에 자신의 프롬프트로 다시 벤치마크해 품질과 형식이 허용 범위에 있는지 확인하세요.
최소 사고가 기본값 — 다단계 에이전트를 검증
Flash Lite는 속도와 비용을 위해 기본적으로 최소 사고를 사용합니다. Google은 최소 사고가 다단계 작업에서 도구를 조기에 종료시킬 수 있다고 언급하므로, 고처리량으로 배포하기 전에 에이전트가 작업을 완료하는지 테스트하세요.
폐쇄형이며 API로만 제공되는 Google 모델
Gemini 3.5 Flash Lite는 오픈 웨이트가 없으며 자체 호스팅할 수 없습니다. 접근은 Gemini API와 Google AI Studio 같은 플랫폼, 그리고 EvoLink 같은 통합 게이트웨이를 통해 이루어집니다. 로컬 배포가 아니라 비용과 지연으로 라우팅하세요.
Gemini 3.5 Flash Lite가 이러한 워크로드를 처리할 수 있는 이유
Gemini 3.5 Flash Lite는 낮은 가격과 빠른 속도를 완전한 100만 Token 컨텍스트 및 프롬프트 캐싱과 결합합니다. 최대 추론 모델이 아니며, 가치는 단순한 작업을 대규모로 빠르고 저렴하게 처리하는 데 있습니다.
가장 저렴한 등급에서도 100만 Token 컨텍스트
1,048,576 Token 창은 3.5 클래스에서 가장 저렴한 모델도 긴 문서, 전사본, 로그를 한 번에 처리하게 합니다. 무관한 입력도 Token을 소비하므로 검색과 컨텍스트 압축은 여전히 비용을 낮춥니다.
깊은 추론보다 속도와 처리량
출력 초당 약 350 Token과 기본 최소 사고로 Flash Lite는 빠르고 대량인 응답에 최적화됩니다. 더 무거운 추론 설정과 모델은 정말 필요한 요청을 위해 남겨 두세요.
프롬프트 캐싱으로 비용을 더 절감
안정적인 시스템 프롬프트, 지침, 도구 스키마는 전용 저가 캐시 요금으로 읽히는 캐시 적중을 만듭니다. 프리픽스 순서를 일정하게 유지해 반복되는 대량 호출이 저렴하게 유지되도록 하세요.
Gemini 3.5 Flash Lite에 프로덕션 트래픽을 보내기 전에 확인할 사항
적합한 워크로드도 통합이 잘못된 식별자를 쓰거나, 지원되지 않는 파라미터를 보내거나, 최소 사고 기본값이 제공하지 않는 깊은 추론을 가정하면 실패할 수 있습니다. 품질을 평가하기 전에 요청 계약을 확인하세요.
정확한 모델 ID gemini-3.5-flash-lite 사용
EvoLink API 경로에서 model에 "gemini-3.5-flash-lite"(3.5 뒤에 점)를 보내세요. 하이픈이 있는 gemini-3-5-flash-lite는 페이지 URL일 뿐 API 모델 파라미터가 아닙니다.
OpenAI Chat Completions 또는 Gemini 네이티브 API 사용
EvoLink는 OpenAI 호환 /v1/chat/completions와 Gemini 네이티브 generateContent 엔드포인트로 Gemini 3.5 Flash Lite를 제공합니다. 두 프로토콜 모두 동일한 EvoLink API 키를 사용합니다.
호환성을 깨는 파라미터 변경에 주의
사용자 지정 temperature, top-K, top-P는 무시되고, 사용자 지정 frequency / presence penalty는 오류를 반환하며, 마지막 턴이 model 역할인 요청은 거부됩니다. 오래된 Gemini 요청 빌더를 그에 맞게 업데이트하세요.
최소 사고에서 다단계 에이전트 검증
Flash Lite는 기본적으로 최소 사고를 사용하므로, 다단계 도구 호출 에이전트가 조기에 멈추지 않고 각 단계를 완료하는지 확인하세요. 더 어려운 추론은 이 모델을 과도하게 조정하기보다 더 큰 모델에 맡기세요.
Token 단가가 아니라 승인된 작업당 비용을 비교
Gemini 3.5 Flash Lite는 낮은 가격과 속도가 대량 작업에서 품질 기준을 넘을 때 유리합니다. 동일한 작업 세트로 평가하고, 모든 트래픽에 프리미엄 요금을 내기보다 처리하지 못하는 요청을 에스컬레이션하세요.
Gemini 3.5 Flash Lite가 단순하고 대량인 작업에서 품질 기준을 넘으면, 낮은 요금과 속도 덕분에 가장 저렴한 프로덕션 기본값이 됩니다. 처리하지 못하는 요청만 Gemini 3.6 Flash나 Pro 등급 모델로 라우팅하세요.
실제 워크로드 검증 후 긴 컨텍스트 모델 비교
EvoLink먼저 Gemini 3.5 Flash Lite가 재시도와 리뷰 작업을 줄이는지 확인한 뒤 가격, 컨텍스트, 캐시, 업무 적합성을 비교해 프로덕션 경로를 선택합니다.
| 모델 | Gemini 3.5 Flash Lite | Gemini 3.6 Flash | Gemini 3.1 Pro |
|---|---|---|---|
| 입력 / 출력 | $0.271 / $2.25 | $1.5 / $7.5 | $1.68 / $10.08 |
| 컨텍스트 | 1M | 1M | 1M |
| 캐시 | 자동 캐시 읽기 | 컨텍스트 캐시 | 컨텍스트 캐시 |
| 적합한 용도 | 고처리량 분류와 추출, 저지연 실시간 작업, 목적이 명확한 에이전트 서브에이전트, 그리고 최대 추론보다 속도와 가격이 더 중요한 비용 민감 워크로드. | 작업이 Flash-Lite의 최소 사고 속도를 넘어설 때 상향 전환하는 더 큰 Gemini. | 작업이 Flash-Lite의 최소 사고 속도를 넘어설 때 상향 전환하는 더 큰 Gemini. |
EvoLink의 다른 Gemini 모델

Gemini 3.6 Flash
The workhorse to escalate to when a task needs stronger coding or reasoning than the Lite tier provides.
모델 보기
Gemini 3.5 Flash
The mid Flash tier between Flash-Lite and the Pro line, balancing cost and capability.
모델 보기
Gemini 3.1 Pro
The Pro-tier step up for the deepest reasoning tasks the Flash line is not built to handle.
모델 보기
Gemini 3.1 Flash Lite
The lightweight 3.1 route for high-volume, cost-sensitive, and low-latency workloads.
모델 보기Other text models

GPT-5.6
OpenAI’s tiered frontier family (Sol/Terra/Luna) for capability, latency, and cost-routing flexibility.
모델 보기
Claude Opus 4.8
Anthropic’s premium baseline for long-running coding agents and judgment-heavy review.
모델 보기
DeepSeek V4
Cost-sensitive open baseline for high-volume coding, reasoning, and agent workloads.
모델 보기
Kimi K3
Moonshot’s long-context reasoning route for repository-scale coding and multi-document work.
모델 보기프로덕션 팀을 위한 관련 자료

Gemini 3.6 Flash release date & rollout
What launched, the model ID, official pricing, and where the model is available.
가이드 읽기Gemini 3.5 Flash Lite API 자주 묻는 질문
EvoLink에서 Gemini 3.5 Flash Lite API를 사용할 수 있나요?
예. 실시간 백엔드 가격과 공식 폴백 가격을 제공하는 프로덕션 모델로 사용할 수 있습니다.
Gemini 3.5 Flash Lite API의 모델 ID는 무엇인가요?
model에 "gemini-3.5-flash-lite"(3.5 뒤에 점)를 지정하세요. 하이픈 형태의 gemini-3-5-flash-lite는 페이지 URL일 뿐 API 모델 파라미터가 아닙니다.
Gemini 3.5 Flash Lite에서는 어떤 프로토콜과 SDK를 사용할 수 있나요?
OpenAI 호환 Chat Completions 엔드포인트 또는 Gemini 네이티브 generateContent 엔드포인트를 동일한 EvoLink API 키로 사용하세요. 이 모델에는 Anthropic Messages 경로가 없습니다.
Gemini 3.5 Flash Lite API는 1M 컨텍스트인가요, 아니면 256K인가요?
EvoLink 경로는 1,048,576 Token을 기록합니다. 더 작은 한도는 대개 특정 Gemini 제품 표면이나 클라이언트 설정에서 비롯되며 API 모델 자체가 아닙니다.
Gemini 3.5 Flash Lite는 얼마나 빠르고 얼마나 저렴한가요?
Google 3.5 클래스에서 가장 빠르고 비용 효율적인 모델로, 100만 Token당 입력 $0.30 / 출력 $2.50이며 출력 속도는 초당 약 350 Token입니다. 비용 대비 처리량이 핵심 강점입니다.
Gemini 3.5 Flash Lite는 무엇에 가장 적합한가요?
고처리량 분류, 라우팅, JSON 추출, 저지연 UI 작업, 목적이 명확한 에이전트 서브에이전트입니다. 심층 코딩이나 어려운 추론에는 Gemini 3.6 Flash 또는 Pro 등급 모델로 상향 전환하세요.
Gemini 3.5 Flash Lite는 3.5 Flash 및 3.6 Flash와 어떻게 다른가요?
Flash Lite는 가장 저렴하고 빠른 등급이며 기본적으로 최소 사고를 사용합니다. 3.5 Flash와 3.6 Flash는 코딩과 에이전트를 위한 더 강력하고 가격이 높은 주력 모델입니다.
Gemini 3.5 Flash Lite는 Gemini 2.5 Flash를 대체하나요?
Google은 이를 Gemini 2.5 Flash 및 덜 복잡한 Gemini 3 Flash 워크로드의 대체품으로 포지셔닝합니다. 마이그레이션 전에 자체 프롬프트로 다시 평가하세요.
마이그레이션 시 처리해야 할 호환성 변경 사항은 무엇인가요?
사용자 지정 temperature, top-K, top-P는 무시되고, 사용자 지정 frequency / presence penalty는 오류를 반환하며, 마지막 턴이 model 역할인 요청은 거부됩니다.
Gemini 3.5 Flash Lite는 실시간 또는 대량 요청의 좋은 기본값인가요?
예, 바로 그 용도로 만들어졌습니다. 속도를 위해 기본적으로 최소 사고를 사용하므로, 고처리량으로 배포하기 전에 다단계 에이전트가 각 단계를 완료하는지 검증하세요.
Gemini 3.5 Flash Lite를 GPT, Claude, GLM, DeepSeek와 어떻게 비교하나요?
프리미엄 추론 모델이 아니라 다른 저렴하고 빠른 등급과 1K 요청당 비용 및 지연 시간으로 비교하세요. 처리할 수 없는 요청은 더 큰 모델로 상향 전환합니다.
프로덕션 평가에서 Gemini 3.5 Flash Lite의 무엇을 측정해야 하나요?
1K 요청당 비용, 초당 Token 수, 첫 시도 성공률, 채택된 결과물, 캐시 적중, 그리고 요청이 더 큰 모델로 상향 전환되어야 하는 빈도를 측정합니다.