
Gemini 3.6 Flash 완전 가이드: API, Thinking, 활용 사례와 프로덕션
Gemini 3.6 Flash 빠른 참조
| 항목 | 현재 정보 | 개발자 시사점 |
|---|---|---|
| 상태 | 2026년 7월 21일부터 GA | 통제된 프로덕션 평가 가능 |
| 모델 ID | gemini-3.6-flash | 초기 -tiered 라벨 사용 금지 |
| 입력 컨텍스트 | 1,048,576 토큰 | 미디어 해상도와 대화 기록은 계속 관리 |
| 최대 출력 | 65,536 토큰 | 필요하면 앱 수준에서 더 낮은 한도 설정 |
| 입력 | 텍스트, 이미지, 오디오, 비디오, PDF | 멀티모달 이해용이며 미디어 생성용이 아님 |
| 출력 | 텍스트 | 네이티브 이미지·오디오 생성 없음 |
| 기본 Thinking | medium | 기본값에서 시작해 실제 데이터로 조정 |
Gemini 3.6 Flash란 무엇이며 누구에게 적합한가?
Flash 계열의 속도와 확장 가능한 추론을 유지하지만 빠른 채팅보다 역할이 넓습니다. Google은 코딩 에이전트, 복잡한 도구 사용, 멀티모달 문서, 시각·공간 추론을 강조합니다. 따라서 수정 턴과 무관한 코드 변경을 줄이는지, 올바른 도구를 선택하는지, 적은 개입으로 작업을 끝까지 완료하는지를 평가해야 합니다.
모든 워크로드의 기본 답은 아닙니다. 대량 분류, 라우팅, 단순 추출은 Flash-Lite 계열이 더 적합할 수 있습니다. 최고 수준의 추론이 필요하면 Pro 계열을 검토해야 합니다. 이미지 생성, 네이티브 오디오 출력, 실시간 음성은 특화 모델이 필요합니다.
| 워크로드 | 먼저 평가할 모델 | 이유 |
|---|---|---|
| 코딩, 디버깅, 다단계 에이전트 | Gemini 3.6 Flash | 추론, 도구 사용, 응답 효율의 균형 |
| 단순 분류, 태깅, 라우팅 | Flash-Lite 계열 | 깊은 추론보다 처리량과 최저 비용 중요 |
| 어려운 조사·복잡한 추론 | Pro 계열 | 지연보다 추론 상한이 중요할 수 있음 |
| 이미지·오디오·실시간 음성 생성 | 특화 생성 또는 Live 모델 | 3.6 Flash는 텍스트만 출력 |
주요 독자는 앱 개발자, 에이전트 엔지니어, 플랫폼 팀, 제품 책임자, FinOps 담당자입니다. 각각 API 호환성, 도구 루프 완료, rollout/fallback, 사용자 수용도, 수락된 작업당 비용을 성공 지표로 봅니다.
공식 기능과 실무상의 한계
Google의 기능 목록은 upstream 모델을 설명합니다. Computer Use 같은 Preview 도구는 별도의 보안, 권한, 채널 검증이 필요하며 안정된 텍스트 생성과 동일하게 취급하면 안 됩니다.
| 기능 | 공식 상태 | 실무상의 한계 |
|---|---|---|
| Thinking | 지원 | 품질, 지연, 비용을 균형 있게 설정 |
| 시스템 지침 | 지원 | 애플리케이션 권한 부여를 대체하지 않음 |
| Structured Outputs | 지원 | 스키마와 비즈니스 규칙을 서버에서 검증 |
| Function Calling | 지원 | 도구 실행, 재시도, 부작용은 앱이 담당 |
| Code Execution | 지원 | 프로덕션 자격 증명과 비격리 시스템 차단 |
| Google Search / Maps | 지원 | 권한, 출처, 별도 요금 확인 |
| Context Caching | 지원 | 적중률과 저장 비용 측정 |
| URL Context | 지원 | 외부 페이지를 신뢰할 수 없는 입력으로 처리 |
| Computer Use | Preview | 환경 격리와 민감 작업 승인 필요 |
| Live API | 미지원 | 실시간 음성은 전용 Live 모델 사용 |
| Fine-tuning | 미지원 | 컨텍스트와 지침으로 동작 조정 |
같은 모델도 채널마다 노출 기능이 다를 수 있습니다. 모델 기능, 채널 passthrough, Usage, 청구를 각각 검증하세요.
요청 구조: 개발자가 가장 많이 쓰는 필드
| 필드 | 필수 | 목적 | 프로덕션 참고 사항 |
|---|---|---|---|
contents | 예 | 멀티턴 메시지와 멀티모달 콘텐츠 | 사용자 입력으로 끝내고 최종 model 턴을 미리 채우지 않기 |
systemInstruction | 아니요 | 역할, 규칙, 출력 경계 | 비밀이나 되돌릴 수 없는 권한을 넣지 않기 |
generationConfig | 아니요 | 출력 길이, Thinking, 구조화 출력 | 워크로드별 설정 유지 |
tools | 아니요 | Function Calling과 Code Execution | 인수와 응답을 스키마로 검증 |
safetySettings | 아니요 | 안전 정책 | 제품 위험 수준과 정렬 |
cachedContent | 아니요 | 캐시 컨텍스트 참조 | 캐시 적중률과 저장 비용 모니터링 |
우선 placeholder Base URL로 Google 네이티브 형식을 이해합니다. 채널 주소, 인증, 가격은 뒤에서 비교합니다.
curl "{BASE_URL}/v1beta/models/gemini-3.6-flash:generateContent" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"role":"user","parts":[{"text":"멱등 API를 세 가지 요점으로 설명하세요."}]}]}'generateContent를 streamGenerateContent로 바꾸고 Server-Sent Events가 필요하면 ?alt=sse를 붙입니다. 프록시 버퍼링, 연결 timeout, 중단 복구는 실제 serving에서 나타나므로 동기와 스트리밍을 따로 시험하세요.temperature, topP, topK를 튜닝 수단으로 의존하지 마세요. Gemini 3.x는 기본 샘플링에 최적화되어 필드가 무시될 수 있습니다. candidateCount > 1도 실패합니다. 여러 후보는 관측 가능한 별도 요청으로 전송합니다.Thinking Level: 품질, 지연, 비용의 균형
usageMetadata.thoughtsTokenCount에 나타나며 출력으로 청구됩니다.medium부터 시작하세요. 실제 작업에서 추론 부족이 확인될 때만 high로 올립니다. 분류, 추출, 단순 도구 라우팅은 낮은 수준을 시험할 수 있습니다. 모든 요청을 high로 설정하면 첫 토큰 시간, 비용, 불필요한 도구 작업이 늘 수 있습니다.| 작업 | 시작 수준 | 측정 항목 |
|---|---|---|
| 분류, 라우팅, 고정 필드 추출 | minimal | 지연, 스키마 준수, 오류율 |
| 문서 Q&A, 일반 코드 설명 | medium | 정확도, 인용 범위, 비용 |
| 디버깅, 수학, 다중 도구 | high | 완료율, 수정 턴, 도구 루프 |
| 사용자 대화 기능 | medium에서 시작해 낮추기 | P95 지연, 사용자 수용도 |
curl "{BASE_URL}/v1beta/models/gemini-3.6-flash:generateContent" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"role":"user","parts":[{"text":"이 동시성 코드의 경쟁 조건을 찾아 가장 작은 안전한 수정안을 제시하세요."}]}],"generationConfig":{"thinkingConfig":{"thinkingLevel":"high"},"maxOutputTokens":4096}}'thinkingLevel과 기존 thinkingBudget을 함께 보내면 요청이 실패합니다. 마이그레이션에서는 기존 필드를 먼저 제거한 뒤, 보이는 답변 길이가 아니라 성공한 작업당 비용으로 비교하세요.응답, 스트림, Usage에서 기록할 항목
candidates[].content.parts, 종료 신호는 finishReason에 있습니다. usageMetadata에는 promptTokenCount, candidatesTokenCount, thoughtsTokenCount, totalTokenCount가 포함될 수 있습니다.모델 ID/버전, 요청 시작·종료, HTTP, 종료 이유, 입력, 가시 출력, thought tokens, 도구 호출, 재시도, 비즈니스 수락 여부를 기록합니다. HTTP 성공 수보다 수락된 작업을 완료하는 비용이 중요한 지표입니다.
{
"candidates":[{"content":{"role":"model","parts":[{"text":"..."}]},"finishReason":"STOP"}],
"usageMetadata":{"promptTokenCount":1200,"candidatesTokenCount":480,"thoughtsTokenCount":320,"totalTokenCount":2000},
"modelVersion":"gemini-3.6-flash"
}이 예시는 가시 출력 480과 thought 320 모두 출력 측 비용에 포함합니다.
멀티모달 입력과 구조화 출력
parts 배열에 텍스트와 미디어를 섞을 수 있습니다. 원격 파일은 fileData, 작은 Base64 콘텐츠는 inlineData를 사용합니다. 내부 URL을 무제한으로 가져오지 못하도록 서버가 MIME, 크기, 권한, URL 출처를 검증해야 합니다.이미지, 차트, 인터페이스
문서 추출, 차트 해석, 시각 QA, UI 이해에 활용합니다. 필요한 영역, 필드, 출력 형식을 명시하세요. 낮은 해상도, 작은 라벨, 모호한 좌표를 실제 수락 세트로 시험합니다.
PDF와 긴 문서 분석
100만 토큰 컨텍스트는 계약서, 보고서, 기술 문서, 코드베이스에 유용하지만 정보 구조를 대체하지 않습니다. 인용을 요구하고 섹션 간 회상과 누락을 측정하세요. 큰 입력은 지연과 비용을 높이며 미디어 해상도도 토큰 사용을 바꿉니다.
오디오와 비디오 이해
가능하면 긴 미디어를 분할하고 시간 정보를 보존합니다. 이벤트 회상, 타임스탬프 정확도, 보인 내용과 들린 내용의 혼동을 평가하세요. 이는 이해 기능이지 네이티브 미디어 생성이 아닙니다.
Structured Output 예시
{
"contents":[{"role":"user","parts":[
{"text":"이 송장에서 공급업체, 날짜, 통화, 총액을 추출하세요."},
{"fileData":{"mimeType":"image/jpeg","fileUri":"https://example.com/invoice.jpg"}}
]}],
"generationConfig":{"responseMimeType":"application/json","responseSchema":{"type":"object","properties":{"vendor":{"type":"string"},"date":{"type":"string"},"currency":{"type":"string"},"total":{"type":"number"}},"required":["vendor","date","currency","total"]}}
}Structured Outputs는 파싱 오류를 줄이지만 사실을 검증하지는 않습니다. 금액, 날짜, 계정 ID의 범위, 형식, 근거를 서버에서 확인하고 계약과 결제는 사람이 검토해야 합니다.
Function Calling, Code Execution과 에이전트 워크플로
신뢰할 수 있는 도구 루프는 다섯 단계입니다. 모델이 구조화 호출을 제안하고, 앱이 인수를 검증·실행하고, 일치하는 FunctionResponse를 반환한 뒤 모델이 다음 행동 또는 최종 답을 생성합니다. 호출 ID, 도구, 인수, 결과, 지연을 보존하세요.
모델을 무제한 권한의 실행기로 취급하지 마세요. 도구를 부작용별로 분류합니다. 읽기는 보통 자동화 가능하고, 되돌릴 수 있는 쓰기는 멱등성과 롤백이 필요하며, 결제·게시·삭제·권한 변경은 명시적 사람 승인이 필요합니다.
| 에이전트 위험 | 제어 | 지표 |
|---|---|---|
| 도구 루프가 끝나지 않음 | 최대 턴, timeout, 누적 비용 상한 | 평균/P95 도구 호출 |
| 잘못 만든 인수 | JSON Schema, enum, 서버 검증 | 인수 거절률 |
| 무관한 코드 변경 | 파일 범위, 테스트, diff 리뷰 | 패치 수락률, 무관 변경률 |
| 외부 콘텐츠 인젝션 | Web·파일을 신뢰하지 않는 데이터로 처리 | 차단·미승인 작업 |
| 중복 쓰기 | 멱등 키, 트랜잭션, 상태 확인 | 중복 작업률 |
코딩 에이전트에는 실제 저장소 작업을 사용하세요. 버그 수정, 테스트 실행, 최소 diff 생성을 요청하고 첫 시도 성공, 테스트 통과, 수정 턴, 무관한 변경, 수락 패치당 비용을 측정합니다. 공급업체 벤치마크는 가설일 뿐입니다.
먼저 시험할 8가지 개발자 활용 사례
| 활용 사례 | 권장 설정 | 수락 지표 | 주요 위험 |
|---|---|---|---|
| 코딩 에이전트 | medium과high 비교 | 테스트, 패치 수락 | 무관 변경, 반복 수정 |
| 다중 도구 에이전트 | 도구, 턴, 총비용 제한 | 완료율, 도구 선택 | 중복, 과도한 권한 |
| 긴 PDF 분석 | 인용과 스키마 요구 | 인용 정확도, 누락률 | 컨텍스트 비용, 오귀속 |
| 이미지·차트 이해 | 영역, 필드, 형식 지정 | 필드·위치 정확도 | 저해상도, 시각 오독 |
| 비디오·오디오 이해 | 분할하고 시간 보존 | 이벤트 회상, 시간 정확도 | 미디어 토큰 증가 |
| 구조화 추출 | 스키마와 서버 검증 | 준수율, 재시도율 | 형식은 맞고 사실은 틀림 |
| 배치 분류·요약 | 낮은 Thinking부터 | 처리량, 작업당 비용 | 과도한 추론 |
| 사용자용 AI 기능 | Streaming, timeout, fallback | TTFT, P95, 수용도 | 피크 지연, 공급자 차이 |
모두 객관적으로 측정할 수 있습니다. “답이 좋아 보인다”는 수락 기준이 아니며, 워크로드별 기계 지표와 사람 평가표가 필요합니다.
Gemini 3.6 Flash를 사용하지 말아야 할 때
- 네이티브 이미지 또는 오디오 생성이 필요할 때.
- 실시간 음성에 네이티브 Live API가 필수일 때.
- Computer Use가 필요하지만 Preview 변경이나 사람 승인을 허용할 수 없을 때.
- 단순 대량 작업에서 최저 단가만 중요할 때.
- 결제, 삭제, 게시 등 민감 작업에 승인과 롤백이 없을 때.
- 실제 평가 세트 없이 공개 벤치마크에만 의존할 때.
- 현재 모델이 목표를 충족하고 3.6 Flash의 품질·지연·비용 개선이 측정되지 않을 때.
흔한 API 오류: 증상, 원인, 해결법
| 증상 | 가능한 원인 | 해결 및 검증 |
|---|---|---|
| HTTP 400 | 마지막 턴을 model로 미리 채움 | prefill 제거, 사용자 입력으로 종료 |
| Sampling 필드 무효 | temperature, topP, topK 포함 | 제거하고 Thinking과 지침 사용 |
| Thinking 설정 실패 | thinkingLevel과thinkingBudget 동시 사용 | thinkingLevel만 유지 |
| 다중 후보 실패 | candidateCount > 1 | 필드 제거 또는 1로 설정 |
| JSON 파싱 실패 | 프롬프트로 “JSON”만 요구 | responseMimeType과responseSchema 사용 |
| 도구를 너무 많이 호출 | Thinking이 높거나 규칙이 넓음 | 수준을 낮추고 도구·턴 제한 |
| 예상보다 높은 비용 | Thoughts, 기록, 재시도 누적 | 전체 Usage와 수락 작업 비용 저장 |
| 스트림 끊김 | 프록시 버퍼, timeout, 복구 부족 | SSE, heartbeat, 재연결, 멱등 retry 시험 |
오류가 나면 입력을 줄이기 전에 비식별 요청, HTTP 상태, 오류 응답, 모델 버전, 요청 ID를 보존하세요. 텔레메트리 없이 프롬프트만 바꾸면 원인 격리가 어렵고 비용이 계속 발생할 수 있습니다.
공식 가격과 실제 작업 비용
$1.50, 출력은 $7.50입니다. thought tokens도 출력으로 청구됩니다. 정가는 유용한 작업을 완료하는 비용의 출발점일 뿐입니다.실제 작업 비용
= 입력 토큰
+ 가시 출력과 thought tokens
+ 도구 또는 grounding
+ 캐시
+ 실패한 재시도입력 100,000, 가시 출력 6,000, thought 4,000이면:
100,000 / 1,000,000 × $1.50
+ 10,000 / 1,000,000 × $7.50
= $0.225전체 재시도는 비용을 거의 두 배로 만들 수 있습니다. 수락 결과당 비용으로 비교하고 잘못된 도구, 무관한 수정, 사람의 재작업 감소도 포함하세요.
평가에서 프로덕션까지: replay, canary, fallback
- 정상, 경계, 실패를 포함한 비식별 실제 작업을 샘플링합니다.
- 현재 모델의 품질, P50/P95, 토큰, 재시도, 사람 개입률을 기록합니다.
- 같은 입력을 오프라인 replay하고 리뷰어에게 모델 이름을 숨깁니다.
- 사용자에게 결과를 보내지 않는 shadow traffic으로 관찰합니다.
- 자동 중지 기준을 둔 작고 낮은 위험의 canary를 엽니다.
- 안정 모델을 fallback으로 유지하고 timeout·오류 경로를 훈련합니다.
- 수락 작업 비용, 지연, 안전이 함께 통과할 때만 트래픽을 늘립니다.

| 게이트 | 권장 통과 조건 |
|---|---|
| 호환성 | 알 수 없는 4xx 없음, 구조화/도구 응답 파싱 성공 |
| 품질 | 핵심 작업 수락률이 기준선 이상 |
| 지연 | P95가 예산 내, 중단 스트림 복구 |
| 비용 | 수락된 작업당 목표 충족 |
| 안전 | 미승인 도구 작업 없음, 민감 작업 승인 |
| 롤백 | 앱 릴리스 없이 fallback 가능 |
Google 직접 연결인가, AI API 애그리게이터인가?
모델이 평가를 통과하면 통합과 운영 복잡성을 누가 소유할지 결정해야 합니다. 시스템이 Gemini 전용인지, 팀이 공급자별 인증, 요청 차이, Usage, 청구, 마이그레이션을 장기 유지할지에 따라 둘 다 올바른 선택이 될 수 있습니다.
Google 직접 연결이 적합한 경우
- 제품이 Gemini만 사용할 예정입니다.
- 권한, 청구, 관측성이 이미 Google Cloud에 있습니다.
- 새 Google Preview 도구에 가장 먼저 접근해야 합니다.
- 플랫폼 팀이 할당량, 오류, 비용 분석, 재해 복구를 운영할 수 있습니다.
- 네이티브 인터페이스와의 강한 결합을 수용할 수 있습니다.
AI API 애그리게이터가 적합한 경우
- 한 제품이 작업별로 다른 모델을 선택합니다.
- 같은 평가 세트에서 품질, 지연, 비용을 비교합니다.
- 공급자별 계정, 키, 청구서를 피하고 싶습니다.
- 모델, 가격, 가용성 변화 때 전환 여지가 필요합니다.
- 새 모델에 기존 통합, 텔레메트리, rollout을 재사용합니다.
| 판단 영역 | 단일 공급자 직접 연결 | AI API 애그리게이터 |
|---|---|---|
| 새 모델 통합 | 별도 구축, 검증, 배포 | 기존 플랫폼 진입점과 평가 재사용 |
| API 키 | 공급자별 분산 | 한 플랫폼에서 중앙 관리 |
| Usage/청구 | 여러 콘솔 조정 | 호출과 지출을 함께 관측 |
| 모델 비교 | 공통 어댑터 구축 | 다중 모델 시험 유지 용이 |
| 마이그레이션 | 비즈니스 코드가 공급자에 결합 | 접근 계층 변경 감소 |
| 새 upstream 기능 | 보통 먼저 제공 | passthrough 검증 대기 |
모델 수만 보고 선택하지 마세요. 실제 호출 가능 여부, 명확한 ID/endpoint, 안정된 streaming, Usage의 thoughts, 추적 가능한 오류, 투명한 가격, 비지원 기능 표기를 확인해야 합니다.
EvoLink로 Gemini 3.6 Flash 사용하는 방법
EvoLink는 Google 네이티브 API 형식으로 Gemini 3.6 Flash를 제공합니다. 기존 네이티브 Gemini 요청 형식이라면 Base URL을 바꾸고 Bearer 인증으로 시작할 수 있습니다.
| 설정 | 값 |
|---|---|
| 모델 ID | gemini-3.6-flash |
| 권장 Base URL | https://direct.evolink.ai |
| 백업 Base URL | https://api.evolink.ai |
| 인증 | Authorization: Bearer YOUR_API_KEY |
| 동기 endpoint | /v1beta/models/gemini-3.6-flash:generateContent |
| 스트리밍 endpoint | /v1beta/models/gemini-3.6-flash:streamGenerateContent |
curl "https://direct.evolink.ai/v1beta/models/gemini-3.6-flash:generateContent" \
-H "Authorization: Bearer YOUR_API_KEY" \
-H "Content-Type: application/json" \
-d '{"contents":[{"role":"user","parts":[{"text":"멱등 API를 세 가지 요점으로 설명하세요."}]}]}'현재 EvoLink 기능 범위
| 기능 | 현재 경로 상태 | 통합 권장 사항 |
|---|---|---|
| Thinking | 지원 | thinkingConfig.thinkingLevel 사용 |
| Structured Outputs | 지원 | 서버에서 스키마 검증 유지 |
| Function Calling | 지원 | 호출 ID, 인수, 도구 결과 저장 |
| Code Execution | 지원 | 격리 환경과 제한된 권한 사용 |
| Context Caching | 지원 | 적중률과 저장 비용 관측 |
| Search / Maps / URL Context | 지원으로 문서화 | 프로덕션 전 권한, 결과, 청구 시험 |
| Computer Use | 현재 미지원 | Google Preview가 전달된다고 가정하지 않기 |
| Live API | 미지원 | 실시간 음성은 다른 경로 선택 |
EvoLink 가격: Google Standard보다 10% 저렴
| 항목 | Google Standard | EvoLink | 100만 토큰당 차이 |
|---|---|---|---|
| 입력 | $1.50 | $1.35 | $0.15 |
| 출력과 Thinking | $7.50 | $6.75 | $0.75 |
$0.2025입니다. 할인은 정가를 낮추지만 실제 경제성에는 Usage, 재시도, 작업 수락이 포함되어야 합니다.보안, 데이터, 규정 준수 체크리스트
API 키를 서버에 보관하고 업로드 데이터를 분류·최소화하며 Web, 파일, 도구에서 온 내용을 권한 정책을 덮어쓸 수 없는 신뢰하지 않는 입력으로 취급하세요.
도구를 읽기, 되돌릴 수 있는 쓰기, 고위험으로 분류합니다. 고위험 작업은 명시적 승인과 완전한 감사 기록이 필요합니다. 데이터 사용 정책도 다릅니다. Google 가격 페이지에 따르면 무료 등급 콘텐츠는 제품 개선에 사용될 수 있지만 유료 등급 콘텐츠는 그렇지 않습니다. 계약, 지역, 업종 요구 사항을 확인하세요.
자주 묻는 질문
Gemini 3.6 Flash는 공식 출시됐나요?
EvoLink에서 사용할 수 있나요?
gemini-3.6-flash를 Google 네이티브 형식으로 제공합니다. 권장은 https://direct.evolink.ai, 백업은 https://api.evolink.ai입니다.어떤 모델 ID를 사용해야 하나요?
gemini-3.6-flash를 사용하세요. 출시 전 gemini-3.6-flash-tiered 라벨은 사용하지 마세요.어떤 입출력 모달리티를 지원하나요?
텍스트, 이미지, 오디오, 비디오, PDF를 입력하고 텍스트를 출력합니다. 이미지·오디오 생성이나 Live API 모델은 아닙니다.
컨텍스트와 최대 출력 한도는 얼마인가요?
입력 1,048,576, 최대 출력 65,536 토큰입니다. 큰 한도가 있어도 해상도와 기록은 품질, 지연, 비용에 영향을 줍니다.
어떤 Thinking Level을 사용해야 하나요?
medium부터 시작하고 분류·추출에는 minimal, 어려운 코드·수학·다중 도구에는 high를 시험하세요. 완료율, 지연, thought 비용으로 결정합니다.thought tokens도 청구되나요?
usageMetadata.thoughtsTokenCount에서 확인할 수 있습니다.temperature, topP, topK가 작동하지 않는 이유는?
Gemini 3.x는 이 필드로 튜닝하도록 설계되지 않았고 현재 경로는 무시합니다. 명확한 지침, 출력 스키마, Thinking Level을 사용하세요.
candidateCount가 실패하는 이유는?
한 요청에서 여러 후보를 지원하지 않습니다. 1보다 큰 값은 실패하므로 별도 요청을 보내세요.
EvoLink에서 비용은 얼마인가요?
$1.35, 출력은 $6.75로 Google Standard의 90%입니다. Thoughts는 출력이며 도구와 재시도도 최종 비용을 바꿉니다.EvoLink 경로는 Computer Use를 지원하나요?
아니요. Google은 Preview로 제공하지만 현재 EvoLink 네이티브 경로는 지원하지 않습니다.
Gemini 3.5 Flash를 즉시 교체해야 하나요?
아니요. 실제 작업 replay, shadow traffic, 통제된 canary, 검증된 fallback을 수행하고 비용, 지연, 품질이 함께 통과할 때만 확대하세요.
출처와 업데이트 정책
- Google: Gemini 3.6 Flash 출시 발표
- Google: Gemini 3.6 Flash 모델 문서
- Google: Gemini 3 개발자 가이드
- Google: Gemini API 가격
기능, 가격, 경로, 파라미터 동작은 바뀔 수 있습니다. 프로덕션 전에 endpoint, Usage, 청구, streaming, 오류 처리를 자체 요청으로 시험하세요.


