프로덕션 라우트이 성공률은 플랫폼 측 가용성을 나타냅니다. 확인된 서버 오류(HTTP 500 / 빈 응답)만 실패로 집계됩니다. 사용자 측 문제(콘텐츠 검열, 잘못된 파라미터, 취소)와 속도 제한, 타임아웃, 인증 오류는 제외됩니다. 실제 트래픽이 들어오기 전에는 빈 구간이 가용으로 표시될 수 있습니다.라이브
비용 효율적인 코딩, 에이전트 워크플로, 지식 업무, 멀티모달 추론을 위한 Google의 최신 Flash 등급 주력 모델로, Gemini 3.6 Flash보다 향상된 토큰 효율과 100만 Token 컨텍스트 창을 제공합니다.
Gemini 3.7 Flash
Google Flash 등급 주력 모델
선택됨
모델 ID
gemini-3.7-flash
적합한 용도
프로덕션 코딩과 풀스택 리팩터링, 다단계 에이전트와 오케스트레이션, 문서 및 차트 분석, 그리고 향상된 토큰 효율이 완료 작업당 비용을 낮추는 대량 워크로드에 적합합니다.
입력
$0.675 / 1M-55%
45.9 cr / 1M$1.500공식 가격
캐시 읽기
$0.068 / 1M-55%
4.6 cr / 1M$0.150공식 가격
출력
$3.375 / 1M-55%
229.5 cr / 1M$7.500공식 가격
모든 요금은 100만 토큰 기준이며 USD와 크레딧으로 표시되고, 계정의 현재 가격을 반영합니다.
Gemini 3.7 Flash 요금
통합 전에 Gemini 3.7 Flash 요청 1건의 비용을 예상해 보세요. 계산기는 계정의 현재 요금을 사용하며 공식 가격은 비교용 참고 정보입니다.
기간 한정 — 아래 요금은 Google 출시 프로모션 가격이 반영된 것으로 2026년 12월 31일까지(UTC+8) 적용됩니다. 2027년 1월 1일부터는 Google 표준 요금(100만 Token당 입력 $1.500, 출력 $7.500)에 대한 기존 할인율로 돌아갑니다.
Gemini 3.x는 출처가 반환되지 않아도 비어 있지 않은 검색 쿼리마다 과금합니다. 요청 하나에서 여러 쿼리가 실행될 수 있습니다. 검색 요금은 토큰 최소 요금을 적용한 후 별도로 더해집니다.
Google 검색$0.014/ 쿼리·0.952 cr / 쿼리
비용 효율적인 코딩과 에이전트 워크플로를 위한 Gemini 3.7 Flash API
Google의 최신 Flash 등급 주력 모델을 EvoLink 통합 API로 호출하세요. Gemini 3.7 Flash는 Gemini 3.6 Flash보다 향상된 토큰 효율로 코딩, 지식 작업, 멀티모달 추론을 개선하며, 1,048,576 Token 컨텍스트, 프롬프트 캐싱, 구조화 출력, 도구 사용을 지원합니다. 가격은 Google 공식 출시 프로모션 가격으로 입력 / 출력 100만 Token당 $0.750 / $3.750(2026년 12월 31일까지 적용)입니다.
Gemini 3.7 Flash은(는) EvoLink에서 모델 ID gemini-3.7-flash로 Chat Completions · Gemini 네이티브 API를 통해 제공되며, 다른 모든 모델과 같은 API 키와 잔액을 사용합니다. 1.05M 컨텍스트 윈도우와 최대 65.5K 출력 토큰, 그리고 코딩, 다단계 에이전트, 도구 사용를 제공합니다.
Gemini 3.7 Flash 사양과 기능
숫자는 EvoLink 경로 설정에서 가져오며, 기능은 API가 현재 제공하는 범위입니다.
컨텍스트 윈도우
1.05M 토큰
최대 출력
65.5K 토큰
입력
텍스트 + 이미지
출력
텍스트 · JSON(구조화 출력) · 도구 호출
추론
추론 강도 설정 가능
도구 사용
여러 단계 도구 시퀀스를 지원하는 함수 호출
프롬프트 캐싱
자동 캐시 읽기, 더 낮은 요금
서버 측 도구
Google 검색, 검색 쿼리당 과금
프로토콜
Chat Completions · Gemini 네이티브 API
모델 ID
gemini-3.7-flash
Gemini 3.7 Flash가 이런 워크로드를 처리할 수 있는 이유
Gemini 3.7 Flash는 넓은 컨텍스트 창, 향상된 토큰 효율, 재사용 가능한 프롬프트 프리픽스가 함께 작동할 때 가장 유용합니다. 컨텍스트 용량만으로 답변이 좋아지지는 않으며, 워크로드에는 여전히 관련 근거, 명확한 구조, 출력 예산이 필요합니다.
100만 Token은 작업 공간이지 채우기 위한 목표가 아님
1,048,576 Token 창은 관련 코드, 사양, 이전 도구 결과를 과도한 분할 없이 유지할 수 있습니다. 무관한 입력이 주의를 두고 경쟁하며 처리 비용을 높이므로 검색과 컨텍스트 압축은 여전히 중요합니다.
3.6 Flash 대비 향상된 토큰 효율
Gemini 3.7 Flash는 다단계 워크플로를 더 적은 턴과 더 적은 토큰으로 완료하려 합니다. 비용 우위는 더 적은 모델 호출과 더 적은 총 토큰에서 나오므로, 단일 요청 가격이 아니라 채택 작업당 총 토큰을 추적하세요.
프롬프트 캐싱은 프리픽스가 안정적일 때 효과
저장소 지침, 시스템 프롬프트, 참조 자료, 도구 스키마는 순서가 일관될 때 가장 강한 캐시 기회를 만듭니다. 모델이나 프롬프트 구조를 자주 바꾸면 긴 프리픽스를 다시 처리해야 할 수 있습니다.
프로덕션 모델 스택에서 Gemini 3.7 Flash가 자리를 얻는 지점
Google은 Gemini 3.7 Flash를 주력 모델로 자리매김합니다. Gemini 3.6 Flash보다 크게 향상된 토큰 효율로 코딩, 지식 작업, 멀티모달 성능을 높입니다. 충분히 좋은 추론을 더 낮은 토큰 비용으로 얻는 편이 프리미엄 등급 비용을 지불하는 것보다 유리한 프로덕션 작업에 가장 잘 맞습니다.
비용 효율적인 코딩과 리팩터링
Gemini 3.7 Flash는 일상적인 코딩, 프로토타이핑, 풀스택 리팩터링을 Gemini 3.6 Flash보다 적은 토큰과 적은 호출로 처리하는 것을 목표로 합니다. Google의 Antigravity 에이전트 환경에서도 사용할 수 있습니다. 단일 스니펫 품질이 아니라 채택된 패치와 리뷰 시간으로 평가하세요.
에이전트 워크플로와 오케스트레이션
다단계 오케스트레이션, 도구 선택, 구조화 출력, 코드 실행에 적합하며, 호출당 낮은 비용이 긴 에이전트 실행에서 누적됩니다. 턴 사이에 완전한 어시스턴트 메시지, 도구 호출 ID, 인자, 도구 결과를 유지하세요.
지식 작업과 멀티모달 추론
100만 Token 컨텍스트에서 문서 분석, 차트 해석, 여러 요소로 구성된 웹 레이아웃 생성에 사용하세요. 검색과 문서 구조는 여전히 중요하며, 100만 창이 있어도 무관한 컨텍스트가 유용해지지는 않습니다.
다른 경로가 더 나은 선택일 때
사소하거나 지연에 민감하거나 초대량인 분류·추출은 보통 더 저렴한 Gemini 3.5 Flash-Lite가 적합합니다. 가장 어려운 추론은 Pro 등급 모델로 보내세요. 효율이 채택 작업당 비용을 실제로 낮출 때만 3.7 Flash로 상향하세요.
Gemini 3.7 Flash 초기 반응이 시사하는 것과 아직 증명이 필요한 것
Gemini 3.7 Flash는 2026-08-13에 출시되었습니다. 출시 당일 커뮤니티 반응은 확정된 벤치마크가 아니라, 자신의 작업, 도구, 예산, 수용 기준에서 검증할 가설로 다루세요.
3.6 Flash와 동일한 가격, 더 강력한 에이전트 실행
Google은 3.7 Flash를 Gemini 3 제품군의 에이전트 주력으로 자리매김하며, 코딩과 에이전트를 위한 역대 가장 뛰어난 주력 모델이라고 소개합니다. 코드 생성과 터미널 실행에서 뚜렷하게 향상되었으며, 가격은 Gemini 3.6 Flash와 완전히 동일합니다. 같은 워크로드에서의 이점은 토큰 단가가 아니라 재시도 감소와 짧아진 에이전트 루프에서 나옵니다.
Flash 등급 주력 모델이지 최상위 엔지니어링 모델은 아님
출시 당일 일부 논의는 어려운 소프트웨어 엔지니어링 벤치마크에서 더 큰 프런티어 모델에 뒤진다고 봅니다. 깊은 저장소 리팩터링이나 장시간 자율 코딩이 목적이라면, 기본값으로 삼기 전에 Pro 등급 또는 프리미엄 모델과 비교하세요.
자신의 프롬프트에서 작업당 Token 사용량을 검증
일부 출시 초기 피드백은 동일 작업에서 Gemini 3.6 Flash보다 높은 Token 사용량을 관찰했습니다. 대표 프롬프트에서 응답 길이, 지시 준수, 도구 호출 규율을 확인해 추가 추론이 출력 비용을 조용히 올리지 않도록 하세요.
폐쇄형이며 API 전용인 Google 모델
Gemini 3.7 Flash는 오픈 웨이트가 없고 자체 호스팅할 수 없습니다. 접근은 Gemini API와 Google AI Studio, Antigravity, EvoLink 같은 통합 게이트웨이를 통해 이루어지므로, 로컬 배포가 아니라 비용과 안정성으로 라우팅하세요.
Gemini 3.7 Flash을(를) 사용하는 두 가지 방법: EvoLink API 또는 Agent
프로덕트 백엔드와 배치 작업에는 EvoLink API를, 코딩·분석 워크플로에는 Codex, Claude, Gemini에서 Gemini 3.7 Flash을(를) 직접 호출하세요. 두 경로 모두 같은 EvoLink API 키, 잔액, 모델 ID, 요청 기록을 공유합니다.
방법 1
EvoLink API로 통합
적합한 용도: 프로덕트 백엔드, 배치 작업, 자동화 파이프라인
OpenAI 호환 Chat Completions(또는 Anthropic Messages) 요청을 EvoLink로 보내고 모델 ID, 시스템 프롬프트, 출력 예산, 도구, 구조화 출력을 직접 제어합니다.
1콘솔에서 EvoLink API 키를 만드세요
2OpenAI 또는 Anthropic SDK의 base URL을 EvoLink로 지정하고 위에 표시된 모델 ID를 선택하세요
3대표 요청을 한 번 보내고 usage 필드에서 입력·캐시·출력 토큰을 확인하세요
4작업별로 max_tokens와 재시도를 설정하고, 여러 턴에서는 tool-call ID와 결과를 유지하세요
curl -X POST https://api.evolink.ai/v1/chat/completions \
-H "Authorization: Bearer $EVOLINK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "gemini-3.7-flash",
"messages": [
{ "role": "system", "content": "You are a precise assistant. Answer in JSON when asked." },
{ "role": "user", "content": "Classify the sentiment of each review below and return a JSON array:\n<reviews>" }
],
"max_tokens": 1024,
"temperature": 0.1
}'
# The Gemini native API is available with the same model ID; see the docs
# for the request shape.
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens).
잘못된 요청 또는 지원하지 않는 파라미터
API 레퍼런스를 기준으로 모델 ID, messages 배열, 파라미터 범위를 확인하고 이 경로가 지원하지 않는 필드를 제거하세요.
인증 또는 잔액 문제
Authorization Bearer 토큰을 확인하고 콘솔에서 사용 가능한 잔액을 확인하세요.
컨텍스트 길이 초과
프롬프트 토큰이 Gemini 3.7 Flash의 컨텍스트 윈도우를 초과했습니다. 관련 근거만 잘라내거나 검색해 넣고 캐시된 프리픽스를 재사용하세요.
속도 제한(429)
지터를 두고 백오프 후 재시도하고, 병렬 버스트 대신 배치나 큐로 보내세요.
콘텐츠 또는 도구 호출 거부
재시도 전에 민감한 콘텐츠, 잘못된 tool-call 인자, JSON 스키마 불일치를 확인하세요.
Gemini 3.7 Flash에 프로덕션 트래픽을 보내기 전에 확인할 것
적합한 워크로드도 통합이 잘못된 식별자를 쓰거나, 지원되지 않는 파라미터를 보내거나, 턴 사이에 에이전트 상태를 잃으면 실패할 수 있습니다. 모델 품질을 평가하기 전에 요청 표면과 대화 계약을 확인하세요.
01
정확한 모델 ID gemini-3.7-flash 사용
EvoLink API 경로에서 model에 "gemini-3.7-flash"(점 포함)를 보냅니다. 하이픈 형태인 gemini-3-7-flash는 페이지 URL일 뿐 API 모델 파라미터가 아닙니다.
모델 ID
02
OpenAI Chat Completions 또는 Gemini 네이티브 API 사용
EvoLink는 OpenAI 호환 /v1/chat/completions와 Gemini 네이티브 generateContent 엔드포인트로 Gemini 3.7 Flash를 제공합니다. 두 프로토콜 모두 같은 EvoLink API 키를 사용하세요.
프로토콜
03
호환성을 깨는 파라미터 변경에 유의
Google 공식 마이그레이션 체크리스트에 따라 사용자 지정 temperature, top-P, top-K, candidate_count를 제거하고, 숫자형 thinking_budget을 thinking_level 문자열로 교체하며, 미리 채워진 model 턴을 제거하세요. 기존 Gemini 요청 빌더도 그에 맞게 수정합니다.
마이그레이션
04
어시스턴트와 도구 상태를 완전하게 다시 전달
멀티턴 에이전트는 완전한 어시스턴트 메시지, 도구 호출 ID, 인자, 도구 결과를 유지해야 합니다. 최종 텍스트만 남기면 상태 연속성이 깨져 컨텍스트 창이 충분히 커도 이후 단계가 실패할 수 있습니다.
도구 상태
Prompt caching for repeated long context
Automatic cache reads use a dedicated lower rate when stable repository instructions, reference documents, and tool schemas can be reused.
1M-token context with a 65K max output limit
Keep connected code, specifications, documents, and agent state in one working context. Treat the limit as capacity rather than a target: retrieve relevant evidence and set task-appropriate output budgets.
Gemini 3.7 Flash은 토큰 단가가 아니라 완료 작업당 비용으로 비교하세요
Gemini 3.7 Flash는 같은 워크로드에서 효율이 토큰, 모델 호출, 재시도, 사람의 재작업을 줄일 때 비용 면에서 이깁니다. 고립된 프롬프트 가격을 비교하는 대신 동일한 작업 세트로 평가하세요.
첫 시도 성공률채택된 결과물 비율재시도 횟수출력 Token캐시 적중률유효한 도구 호출채택 가능한 결과까지의 시간사람의 수정과 폴백 비율
Gemini 3.7 Flash가 더 적은 토큰과 더 적은 리뷰 노력으로 사용 가능한 결과를 낸다면, 높은 토큰 효율이 쌓여 실질적인 비용 우위가 됩니다. 가장 어려운 작업에서 품질이 떨어지면 그 작업은 Pro 등급 모델로 상향하고 3.7 Flash는 효율적인 다수 작업에 유지하세요.
워크로드 테스트 후 Gemini 3.7 Flash을 주요 롱컨텍스트 모델과 비교
EvoLink
먼저 Gemini 3.7 Flash가 재시도와 리뷰 작업을 줄이는지 확인한 뒤 가격, 컨텍스트, 캐시, 업무 적합성을 비교해 프로덕션 경로를 선택합니다.
예. 실시간 백엔드 가격과 공식 폴백 가격을 제공하는 프로덕션 모델로 사용할 수 있습니다.
Gemini 3.7 Flash API에는 어떤 모델 ID를 사용해야 하나요?
모델로 "gemini-3.7-flash"(점 표기)를 전달하세요. 하이픈 표기 gemini-3-7-flash는 페이지 URL일 뿐 API 모델 파라미터가 아닙니다.
Gemini 3.7 Flash에서는 어떤 프로토콜과 SDK가 작동하나요?
동일한 EvoLink API Key로 OpenAI 호환 Chat Completions 엔드포인트 또는 Gemini 네이티브 generateContent 엔드포인트를 사용하세요. 이 모델에는 Anthropic의 Messages API 경로가 없습니다.
Gemini 3.7 Flash API는 정말 전체 1M 컨텍스트를 지원하나요?
예. Google 문서 기준으로 경로는 1,048,576 입력 Token을 기록합니다. 더 작은 한도는 보통 특정 Gemini 제품 화면이나 클라이언트 설정에서 비롯되며, API 모델 자체 때문이 아닙니다.
Gemini 3.7 Flash의 1M Token 컨텍스트 창은 어떻게 사용해야 하나요?
관련 코드, 문서, 도구 결과는 함께 유지하되, 기본적으로 창을 채우기보다 검색, 안정적인 캐시 프리픽스, 컨텍스트 압축을 사용하세요.
Gemini 3.7 Flash는 Gemini 3.6 Flash 및 3.5 Flash-Lite와 어떻게 다른가요?
3.7 Flash는 3.6 Flash와 가격이 같지만, Google 발표 기준 FrontierCode, Terminal-bench 같은 코딩·에이전트 벤치마크에서 더 높은 공식 점수를 기록합니다. 3.5 Flash-Lite는 여전히 분류와 고처리량 작업을 위한 더 저렴하고 빠른 경로입니다.
Gemini 3.7 Flash가 토큰을 더 많이 쓴다면 실제로 더 저렴한가요?
토큰 단가는 Gemini 3.6 Flash와 동일합니다. Google은 3.7 Flash가 더 적은 턴으로 작업을 끝내도록 설계했다고 밝히지만, 일부 출시 초기 보고는 작업당 더 높은 토큰 사용량을 관찰했습니다. 요청당 요금이 아니라 자신의 워크로드에서 승인된 작업당 총 토큰을 비교하세요.
Gemini 3.7 Flash로 마이그레이션할 때 처리해야 할 호환성 변경 사항은 무엇인가요?
Google 공식 마이그레이션 체크리스트에 따라 생성 설정에서 사용자 지정 temperature, top-P, top-K, candidate_count를 제거하고, 숫자형 thinking_budget을 thinking_level 문자열로 교체하며, 미리 채워 둔 model 턴을 제거하세요.
Gemini 3.7 Flash의 minimal 사고 수준은 어떻게 되었나요?
Google이 제거했습니다. 사용 가능한 수준은 low, medium(기본), high이며, Gemini API에 minimal을 보내면 오류가 반환됩니다. EvoLink는 reasoning_effort의 none 또는 minimal을 low로 자동 하향해 마이그레이션된 요청이 실패하지 않도록 합니다. 대량 분류 파이프라인에는 더 저렴한 Gemini 3.5 Flash-Lite가 비용 하한선입니다.
Gemini 3.7 Flash의 사고 Token은 어떻게 과금되나요?
Google 가격 기준으로 사고 Token은 출력 요금으로 과금되므로, 장황한 추론은 눈에 보이는 답변보다 청구액을 눈에 띄게 키울 수 있습니다. 작업에 맞는 사고 수준을 설정하고 추론 Token과 최종 답변 Token을 함께 모니터링하세요.
Gemini 3.7 Flash는 비디오와 오디오를 분석할 수 있나요?
예. 텍스트, 이미지, 비디오, 오디오, PDF 입력을 받아 텍스트를 출력하므로 비디오·오디오 이해 워크로드에 흔히 사용됩니다. 이미지, 오디오, 라이브 스트림 생성은 지원하지 않습니다.
Gemini 3.7 Pro가 있나요?
없습니다. 3.7 Flash 출시 시점 기준 Google Pro 라인의 최신 모델은 여전히 gemini-3.1-pro-preview이며, 공식 채널에서 3.5나 3.7 Pro는 발표되지 않았습니다.
Gemini 3.7 Flash의 출시 프로모션 가격은 언제까지 지속되나요?
Google은 100만 Token당 입력 $0.750, 출력 $3.750를 2026년 12월 31일까지의 프로모션 가격으로 안내하며, 2027년 1월 1일부터는 표준 요금 $1.500와 $7.500가 적용됩니다. 현재 EvoLink 요금은 이 페이지의 가격 섹션을 확인하세요.
Gemini 3.7 Flash는 3.6 Flash보다 지시를 더 안정적으로 따르나요?
Google은 3.6 Flash와 비슷한 안전성과 톤을 보고하지만, 한 독립 평가 기관은 출시 시점에 더 높은 환각률을 측정했습니다. 프로덕션에 올리기 전에 자신의 대표 작업에서 지시 준수와 사실 정확성을 검증하세요.
프로덕션 평가에서 무엇을 측정해야 하나요?
첫 시도 성공률, 채택된 결과물, 재시도, 출력 Token, 캐시 적중률, 유효한 도구 호출, 소요 시간, 사람의 수정, 폴백 비율을 측정합니다.