Gemini 3.8 Flash API
Gemini 3.8 Flash 선택
코딩, 에이전트 워크플로, 지식 업무, 멀티모달 추론을 위한 Google의 최신 Flash 주력 모델입니다. Google은 Gemini 3.7 Flash보다 높은 정확도를 보고하며 100만 Token 컨텍스트를 제공합니다.
Gemini 3.8 Flash
Google Flash 등급 주력 모델
gemini-3.8-flash높은 작업 정확도가 추가 Token 사용을 정당화하는 프로덕션 코딩, 풀스택 리팩터링, 다단계 에이전트, 문서 및 차트 분석에 적합합니다.
Gemini 3.8 Flash 가격
대화형 가격 계산기로 요청 비용을 추정하고 EvoLink 요금을 Google의 현재 출시 프로모션 가격과 비교합니다.
Token 계산기
요청 한 건의 Token 구성을 입력하세요.예상 요청 비용
Gemini 3.8 Flash요청당 최소 청구액: 0.01 Credits.
EvoLink와 Google 직접 사용 비교
동일한 Token 구성, 기본 그룹 가격.예산 가이드
현재 Token 구성으로 가능한 대략적인 요청 수.빠른 테스트용
일상 개발용
프로덕션 평가용
모델 가격
| 모델 | 컨텍스트 | 입력 Token | 캐시 읽기 Token | 출력 Token |
|---|---|---|---|---|
Gemini 3.8 Flashgemini-3.8-flash | 모든 컨텍스트 크기 | $0.675 / 1M-55% 45.9 cr / 1M$1.500Google 출시 프로모션 가격 | $0.068 / 1M-55% 4.6 cr / 1M$0.150Google 출시 프로모션 가격 | $3.375 / 1M-55% 229.5 cr / 1M$7.500Google 출시 프로모션 가격 |
Gemini 3.8 Flash
모든 컨텍스트 크기USD와 Credits는 100만 Token 기준입니다. 백엔드 실시간 가격이 저장된 대체 요금보다 우선합니다.
코딩과 에이전트 워크플로를 위한 Gemini 3.8 Flash API
Google의 최신 Flash 주력 모델을 EvoLink 통합 API로 호출하세요. Google은 Gemini 3.7 Flash보다 높은 정확도와 함께 더 많은 Token 사용을 명시합니다. 1,048,576 Token 컨텍스트, 프롬프트 캐싱, 구조화 출력, 도구 사용을 지원하며 Google 출시 프로모션 가격은 입력 / 출력 100만 Token당 $0.75 / $3.75(2026년 12월 31일까지)입니다.
프로덕션 모델 스택에서 Gemini 3.8 Flash의 가치가 높은 영역
Google은 Gemini 3.8 Flash를 코딩, 지식 작업, 멀티모달 업무를 위한 정확도가 높은 주력 모델로 설명하면서 Gemini 3.7 Flash보다 Token 사용량이 늘어난다고 명시합니다. 더 높은 작업 성공률이 추가 Token 비용을 상쇄하는 프로덕션 업무에 적합합니다.
코딩과 리팩터링 평가
Gemini 3.8 Flash는 Gemini 3.7 Flash보다 높은 정확도가 보고되지만 Token 사용량이 늘 수 있습니다. 일상 코딩과 풀스택 리팩터링에서는 채택된 패치, 총 Token, 리뷰 시간을 측정하세요.
에이전트 워크플로와 오케스트레이션
Google은 다단계 오케스트레이션, 도구 선택, 구조화 출력, 코드 실행을 강조합니다. EvoLink는 이러한 워크플로의 작업 완료율이나 총비용을 측정하지 않았습니다. 테스트할 때는 턴 사이에 완전한 어시스턴트 메시지, 도구 호출 ID, 인자, 도구 결과를 유지하세요.
지식 작업과 멀티모달 추론
100만 Token 컨텍스트에서 문서 분석, 차트 해석, 여러 요소로 구성된 웹 레이아웃 생성에 사용하세요. 검색과 문서 구조는 여전히 중요하며, 100만 창이 있어도 무관한 컨텍스트가 유용해지지는 않습니다.
다른 경로가 더 나은 선택일 때
Gemini 3.5 Flash-Lite는 대량 분류·추출용으로 공개 Token 단가가 더 낮습니다. 작업 비용에서 유리할 것이라는 가정으로 3.8 Flash를 배정하지 말고, 같은 수용 기준에서 기존 경로와 비교하세요.
Google이 확인한 것과 EvoLink가 측정하지 않은 것
Google은 2026-09-02에 Gemini 3.8 Flash를 출시하고 모델 수준의 벤치마크와 Token 사용량에 관한 설명을 공개했습니다. EvoLink는 3.8과 3.7의 대조 워크로드 연구를 공개하지 않았으므로, 이 페이지는 재시도 감소, 에이전트 루프 단축, 작업 단위 비용 절감을 주장하지 않습니다.
동일한 출시 프로모션 Token 단가, 더 높은 공식 벤치마크 점수
Google은 3.8 Flash와 3.7 Flash에 동일한 입력, 출력, 캐시 읽기 프로모션 단가를 제시하고, 강조한 코딩·에이전트 벤치마크에서 3.8의 점수가 더 높다고 보고합니다. 동시에 Token 사용량 증가도 명시하므로, 이 사실만으로 프로덕션 작업의 청구액이 낮아진다고 볼 수 없습니다.
공식 벤치마크는 공급사 간 프로덕션 순위가 아님
Google의 출시 결과는 선별된 벤치마크를 설명할 뿐, 3.8 Flash가 여러분의 워크로드에서 모든 Pro 등급 또는 서드파티 모델을 이긴다는 것을 증명하지 않습니다. 따라서 이 페이지는 공급사 간 우열을 주장하지 않습니다.
Token 사용량 증가는 공식적인 주의 사항
Google은 3.8 Flash가 3.7 Flash보다 정확도를 높이는 대신 더 많은 Token을 사용한다고 명확히 밝힙니다. 공개된 Token 단가만으로는 완료된 작업당 어느 모델이 더 저렴한지 판단할 수 없습니다.
폐쇄형이며 API 전용인 Google 모델
Gemini 3.8 Flash는 오픈 웨이트가 없고 자체 호스팅할 수 없습니다. 접근은 Gemini API와 Google AI Studio, Antigravity, EvoLink 같은 통합 게이트웨이를 통해 이루어지므로, 로컬 배포가 아니라 비용과 안정성으로 라우팅하세요.
Gemini 3.8 Flash가 이런 워크로드를 처리할 수 있는 이유
Gemini 3.8 Flash는 넓은 컨텍스트 창, 높은 작업 정확도, 재사용 가능한 프롬프트 프리픽스가 함께 작동할 때 가장 유용합니다. 컨텍스트 용량만으로 답변이 좋아지지는 않으며, 관련 근거, 명확한 구조, 출력 예산이 필요합니다.
100만 Token은 작업 공간이지 채우기 위한 목표가 아님
1,048,576 Token 창은 관련 코드, 사양, 이전 도구 결과를 과도한 분할 없이 유지할 수 있습니다. 무관한 입력이 주의를 두고 경쟁하며 처리 비용을 높이므로 검색과 컨텍스트 압축은 여전히 중요합니다.
높은 정확도와 더 많은 Token 사용
Google은 Gemini 3.7 Flash보다 정확도가 높지만 Token 사용량도 늘어난다고 명시합니다. 채택 작업당 총비용을 추적해 결과 개선이 추가 Token을 상쇄하는지 확인하세요.
프롬프트 캐싱은 프리픽스가 안정적일 때 효과
저장소 지침, 시스템 프롬프트, 참조 자료, 도구 스키마는 순서가 일관될 때 가장 강한 캐시 기회를 만듭니다. 모델이나 프롬프트 구조를 자주 바꾸면 긴 프리픽스를 다시 처리해야 할 수 있습니다.
Gemini 3.8 Flash에 프로덕션 트래픽을 보내기 전에 확인할 것
적합한 워크로드도 통합이 잘못된 식별자를 쓰거나, 지원되지 않는 파라미터를 보내거나, 턴 사이에 에이전트 상태를 잃으면 실패할 수 있습니다. 모델 품질을 평가하기 전에 요청 표면과 대화 계약을 확인하세요.
정확한 모델 ID gemini-3.8-flash 사용
EvoLink API 경로에서 model에 "gemini-3.8-flash"(점 포함)를 보냅니다. 하이픈 형태인 gemini-3-8-flash는 페이지 URL일 뿐 API 모델 파라미터가 아닙니다.
OpenAI Chat Completions 또는 Gemini 네이티브 API 사용
EvoLink는 OpenAI 호환 /v1/chat/completions와 Gemini 네이티브 generateContent 엔드포인트로 Gemini 3.8 Flash를 제공합니다. 두 프로토콜 모두 같은 EvoLink API 키를 사용하세요.
호환성을 깨는 파라미터 변경에 유의
EvoLink 네이티브 요청에서 Gemini 3.x는 generationConfig.thinkingConfig.thinkingLevel을 사용합니다. thinkingBudget은 Gemini 2.5용이며 두 제어는 함께 사용할 수 없습니다. EvoLink 문서에 따르면 사용자 지정 temperature와 topP는 Gemini 3.x 출력에 영향을 주지 않고, topK는 무시되며, 범위를 벗어난 temperature나 topP 값은 400을 반환합니다. 대화의 마지막 턴은 role model을 사용할 수 없습니다.
어시스턴트와 도구 상태를 완전하게 다시 전달
멀티턴 에이전트는 완전한 어시스턴트 메시지, 도구 호출 ID, 인자, 도구 결과를 유지해야 합니다. 최종 텍스트만 남기면 상태 연속성이 깨져 컨텍스트 창이 충분히 커도 이후 단계가 실패할 수 있습니다.
작업 단위 비용 우위는 아직 확인되지 않음
확인된 사실은 3.8 Flash와 3.7 Flash가 Google의 동일한 출시 프로모션 Token 단가를 공유하며, Google이 3.8의 Token 사용량 증가와 정확도 향상을 명시한다는 것입니다. EvoLink는 재시도, 채택된 결과물, 도구 호출, 소요 시간, 사람의 리뷰에 대한 대조 결과를 공개하지 않았습니다.
이는 평가 입력 항목이지 Gemini 3.8 Flash에서 관측된 결과가 아닙니다. 같은 프로덕션 샘플을 같은 설정으로 테스트하기 전까지 3.8이 채택 작업당 비용을 낮춘다고 주장하지 마세요. 3.7이나 Flash-Lite의 공개 가격과 연산 프로필이 이미 워크로드에 맞는다면 그쪽을 선택하세요.
실제 워크로드 검증 후 긴 컨텍스트 모델 비교
EvoLink높은 정확도가 Gemini 3.8 Flash의 추가 Token 사용을 상쇄하는지 확인한 뒤 가격, 컨텍스트, 캐시, 업무 적합성을 비교해 프로덕션 경로를 선택합니다.
| 모델 | Gemini 3.8 Flash | Gemini 3.5 Flash Lite | Gemini 3.1 Pro |
|---|---|---|---|
| 입력 / 출력 | $0.675 / $3.375 | $0.3 / $2.5 | $1.68 / $10.08 |
| 컨텍스트 | 1M | 1M | 1M |
| 캐시 | 자동 캐시 읽기 | 컨텍스트 캐시 | 컨텍스트 캐시 |
| 적합한 용도 | 높은 작업 정확도가 추가 Token 사용을 정당화하는 프로덕션 코딩, 풀스택 리팩터링, 다단계 에이전트, 문서 및 차트 분석에 적합합니다. | 공개 Token 단가가 더 낮은 경로로, 분류·추출·고처리량 작업 비교에 사용합니다. | Flash 라인으로 부족한 깊은 추론 작업을 평가하는 Pro 등급 비교 경로입니다. |
EvoLink의 다른 Gemini 모델




기타 텍스트 모델




프로덕션 팀을 위한 관련 자료

Gemini 3.8 Flash vs Gemini 3.7 Flash
기본 모델을 바꾸기 전에 정확도, Token 사용량, 출시 프로모션 가격, 승인된 프로덕션 작업당 비용을 비교하세요.
가이드 읽기

Gemini API 제품군 비교
라우팅 전에 3.8 Flash, 3.5 Flash-Lite, 3.7 Flash, 3.1 Pro가 가격, 컨텍스트, 워크로드 적합성에서 어떻게 다른지 확인하세요.
가이드 읽기Gemini 3.5 Flash-Lite API
분류, 추출, 고처리량 서브에이전트를 위한 가장 저렴하고 빠른 3.5 계열 경로. 어려운 작업은 3.8 Flash로 상향하세요.
가이드 읽기
Gemini 3.8 Flash API 자주 묻는 질문
EvoLink에서 Gemini 3.8 Flash API를 사용할 수 있나요?
예. 프로덕션 모델로 등록되어 있습니다. 페이지는 백엔드 가격이 반환되면 이를 우선 사용하고, 없으면 현재 Google 출시 프로모션 가격을 비교 기준으로 사용합니다.
Gemini 3.8 Flash API에는 어떤 모델 ID를 사용해야 하나요?
모델로 "gemini-3.8-flash"(점 표기)를 전달하세요. 하이픈 표기 gemini-3-8-flash는 페이지 URL일 뿐 API 모델 파라미터가 아닙니다.
Gemini 3.8 Flash에서는 어떤 프로토콜과 SDK가 작동하나요?
EvoLink는 direct.evolink.ai에서 동일한 API Key로 OpenAI 호환 Chat Completions와 Gemini 네이티브 generateContent를 제공한다고 문서화하며, gemini-3.8-flash는 두 엔드포인트의 모델 enum에 모두 등록되어 있습니다. 실제 경로는 계정에서 확인하세요.
Gemini 3.8 Flash API는 정말 전체 1M 컨텍스트를 지원하나요?
예. Google 문서 기준으로 경로는 1,048,576 입력 Token을 기록합니다. 더 작은 한도는 보통 특정 Gemini 제품 화면이나 클라이언트 설정에서 비롯되며, API 모델 자체 때문이 아닙니다.
Gemini 3.8 Flash의 1M Token 컨텍스트 창은 어떻게 사용해야 하나요?
관련 코드, 문서, 도구 결과는 함께 유지하되, 기본적으로 창을 채우기보다 검색, 안정적인 캐시 프리픽스, 컨텍스트 압축을 사용하세요.
Gemini 3.8 Flash는 Gemini 3.7 Flash 및 3.5 Flash-Lite와 어떻게 다른가요?
Google은 3.8과 3.7에 동일한 출시 프로모션 Token 단가를 제시하고, 선별된 코딩·에이전트 벤치마크에서 3.8의 점수가 더 높다고 보고하며, 3.8의 Token 사용량이 더 많다고 명시합니다. 3.5 Flash-Lite에는 더 낮은 Token 단가를 제시합니다. 워크로드별 결과는 여전히 테스트가 필요합니다.
Gemini 3.8 Flash가 토큰을 더 많이 쓴다면 실제로 더 저렴한가요?
Token 단가는 Gemini 3.7 Flash와 동일하지만 Google은 정확도 향상과 함께 Token 사용량도 늘어난다고 명시합니다. 작업당 비용이 낮아진다고 가정하지 말고 자신의 워크로드에서 채택 작업당 총비용을 비교하세요.
Gemini 3.8 Flash로 마이그레이션할 때 처리해야 할 파라미터 규칙은 무엇인가요?
EvoLink 네이티브 요청에서 Gemini 3.x는 generationConfig.thinkingConfig.thinkingLevel을 사용합니다. thinkingBudget은 Gemini 2.5용이며 thinkingLevel과 함께 사용할 수 없습니다. EvoLink 문서에 따르면 사용자 지정 temperature와 topP는 Gemini 3.x 출력에 영향을 주지 않고, topK는 무시되며, 범위를 벗어난 temperature나 topP 값은 400을 반환합니다. 마지막 턴은 role model을 사용할 수 없습니다.
Gemini 3.8 Flash의 minimal 사고 수준은 어떻게 되었나요?
Google은 Gemini 3.8 Flash에 대해 low, medium(기본), high를 문서화하며 minimal은 지원되지 않습니다. EvoLink 네이티브 API 레퍼런스에 따르면 지원되지 않는 minimal은 자동으로 low로 하향되어 마이그레이션한 요청이 실패하지 않지만, 예측 가능한 제어를 위해 low를 명시적으로 설정하세요. Gemini 3.5 Flash-Lite는 공개 Token 단가가 더 낮아 대량 분류의 비교 경로로 계속 사용할 수 있습니다.
Gemini 3.8 Flash의 사고 Token은 어떻게 과금되나요?
Google 가격 기준으로 사고 Token은 출력 요금으로 과금되므로, 장황한 추론은 눈에 보이는 답변보다 청구액을 눈에 띄게 키울 수 있습니다. 작업에 맞는 사고 수준을 설정하고 추론 Token과 최종 답변 Token을 함께 모니터링하세요.
Gemini 3.8 Flash는 비디오와 오디오를 분석할 수 있나요?
예. 텍스트, 이미지, 비디오, 오디오, PDF 입력을 받아 텍스트를 출력하므로 비디오·오디오 이해 워크로드에 흔히 사용됩니다. 이미지, 오디오, 라이브 스트림 생성은 지원하지 않습니다.
Gemini 3.7 Pro가 있나요?
없습니다. 3.8 Flash 출시 시점 기준 Google Pro 라인의 최신 모델은 여전히 gemini-3.1-pro-preview이며, 공식 채널에서 3.5나 3.7 Pro는 발표되지 않았습니다.
Gemini 3.8 Flash의 출시 프로모션 가격은 언제까지 지속되나요?
Google은 100만 Token당 입력 $0.75, 출력 $3.75를 2026년 12월 31일까지의 프로모션 가격으로 안내하며, 2027년 1월 1일부터는 표준 요금 $1.50와 $7.50가 적용됩니다. 현재 EvoLink 요금은 이 페이지의 가격 섹션을 확인하세요.
Gemini 3.8 Flash는 3.7 Flash보다 지시를 더 안정적으로 따르나요?
Google은 전반적인 정확도 향상과 Token 사용량 증가를 보고하지만, EvoLink는 지시 준수에 대한 대조 비교를 공개하지 않았습니다. 프로덕션에 올리기 전에 대표 작업으로 테스트하세요.
프로덕션 평가에서 무엇을 측정해야 하나요?
첫 시도 성공률, 채택된 결과물, 재시도, 출력 Token, 캐시 적중률, 유효한 도구 호출, 소요 시간, 사람의 수정, 폴백 비율을 측정합니다.