Kimi K3가 출시되었습니다Kimi K3 살펴보기
Gemini 3.6 Flash를 프로덕션에 통합하고 평가하는 개발자 가이드
guide

Gemini 3.6 Flash 완전 가이드: API, Thinking, 활용 사례와 프로덕션

Jessie
Jessie
COO
2026년 7월 22일
31분 소요
빠른 결론: Gemini 3.6 Flash는 코딩 에이전트, 다단계 도구 사용, 긴 문서, 멀티모달 이해를 위한 GA 모델입니다. 실제 워크로드로 평가할 수 있지만 replay 테스트, canary 기준, fallback 훈련을 통과하기 전에는 모든 프로덕션 트래픽을 대체하면 안 됩니다. 통합 전에 모달리티 한계, Thinking 동작, API 변경점, 성공한 작업당 비용을 이해해야 합니다.
이 글은 출시 뉴스 요약이 아닙니다. 첫 요청을 구성하는 법, Thinking Level을 선택하는 법, 우선 시험할 워크로드, 실제 비용 계산, 안전한 롤백 경로를 유지한 배포를 설명합니다. 출시일과 채널별 제공 상태는 Gemini 3.6 Flash 출시 상태를 확인하세요.

Gemini 3.6 Flash 빠른 참조

항목현재 정보개발자 시사점
상태2026년 7월 21일부터 GA통제된 프로덕션 평가 가능
모델 IDgemini-3.6-flash초기 -tiered 라벨 사용 금지
입력 컨텍스트1,048,576 토큰미디어 해상도와 대화 기록은 계속 관리
최대 출력65,536 토큰필요하면 앱 수준에서 더 낮은 한도 설정
입력텍스트, 이미지, 오디오, 비디오, PDF멀티모달 이해용이며 미디어 생성용이 아님
출력텍스트네이티브 이미지·오디오 생성 없음
기본 Thinkingmedium기본값에서 시작해 실제 데이터로 조정

Gemini 3.6 Flash란 무엇이며 누구에게 적합한가?

Flash 계열의 속도와 확장 가능한 추론을 유지하지만 빠른 채팅보다 역할이 넓습니다. Google은 코딩 에이전트, 복잡한 도구 사용, 멀티모달 문서, 시각·공간 추론을 강조합니다. 따라서 수정 턴과 무관한 코드 변경을 줄이는지, 올바른 도구를 선택하는지, 적은 개입으로 작업을 끝까지 완료하는지를 평가해야 합니다.

모든 워크로드의 기본 답은 아닙니다. 대량 분류, 라우팅, 단순 추출은 Flash-Lite 계열이 더 적합할 수 있습니다. 최고 수준의 추론이 필요하면 Pro 계열을 검토해야 합니다. 이미지 생성, 네이티브 오디오 출력, 실시간 음성은 특화 모델이 필요합니다.

워크로드먼저 평가할 모델이유
코딩, 디버깅, 다단계 에이전트Gemini 3.6 Flash추론, 도구 사용, 응답 효율의 균형
단순 분류, 태깅, 라우팅Flash-Lite 계열깊은 추론보다 처리량과 최저 비용 중요
어려운 조사·복잡한 추론Pro 계열지연보다 추론 상한이 중요할 수 있음
이미지·오디오·실시간 음성 생성특화 생성 또는 Live 모델3.6 Flash는 텍스트만 출력

주요 독자는 앱 개발자, 에이전트 엔지니어, 플랫폼 팀, 제품 책임자, FinOps 담당자입니다. 각각 API 호환성, 도구 루프 완료, rollout/fallback, 사용자 수용도, 수락된 작업당 비용을 성공 지표로 봅니다.

공식 기능과 실무상의 한계

Google의 기능 목록은 upstream 모델을 설명합니다. Computer Use 같은 Preview 도구는 별도의 보안, 권한, 채널 검증이 필요하며 안정된 텍스트 생성과 동일하게 취급하면 안 됩니다.

기능공식 상태실무상의 한계
Thinking지원품질, 지연, 비용을 균형 있게 설정
시스템 지침지원애플리케이션 권한 부여를 대체하지 않음
Structured Outputs지원스키마와 비즈니스 규칙을 서버에서 검증
Function Calling지원도구 실행, 재시도, 부작용은 앱이 담당
Code Execution지원프로덕션 자격 증명과 비격리 시스템 차단
Google Search / Maps지원권한, 출처, 별도 요금 확인
Context Caching지원적중률과 저장 비용 측정
URL Context지원외부 페이지를 신뢰할 수 없는 입력으로 처리
Computer UsePreview환경 격리와 민감 작업 승인 필요
Live API미지원실시간 음성은 전용 Live 모델 사용
Fine-tuning미지원컨텍스트와 지침으로 동작 조정

같은 모델도 채널마다 노출 기능이 다를 수 있습니다. 모델 기능, 채널 passthrough, Usage, 청구를 각각 검증하세요.

요청 구조: 개발자가 가장 많이 쓰는 필드

필드필수목적프로덕션 참고 사항
contents멀티턴 메시지와 멀티모달 콘텐츠사용자 입력으로 끝내고 최종 model 턴을 미리 채우지 않기
systemInstruction아니요역할, 규칙, 출력 경계비밀이나 되돌릴 수 없는 권한을 넣지 않기
generationConfig아니요출력 길이, Thinking, 구조화 출력워크로드별 설정 유지
tools아니요Function Calling과 Code Execution인수와 응답을 스키마로 검증
safetySettings아니요안전 정책제품 위험 수준과 정렬
cachedContent아니요캐시 컨텍스트 참조캐시 적중률과 저장 비용 모니터링

우선 placeholder Base URL로 Google 네이티브 형식을 이해합니다. 채널 주소, 인증, 가격은 뒤에서 비교합니다.

curl "{BASE_URL}/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"role":"user","parts":[{"text":"멱등 API를 세 가지 요점으로 설명하세요."}]}]}'
스트리밍은 generateContentstreamGenerateContent로 바꾸고 Server-Sent Events가 필요하면 ?alt=sse를 붙입니다. 프록시 버퍼링, 연결 timeout, 중단 복구는 실제 serving에서 나타나므로 동기와 스트리밍을 따로 시험하세요.
temperature, topP, topK를 튜닝 수단으로 의존하지 마세요. Gemini 3.x는 기본 샘플링에 최적화되어 필드가 무시될 수 있습니다. candidateCount > 1도 실패합니다. 여러 후보는 관측 가능한 별도 요청으로 전송합니다.

Thinking Level: 품질, 지연, 비용의 균형

Thinking Level은 추론에 사용할 수 있는 깊이를 조절하며 고정 토큰 예산이 아닙니다. 어려운 작업은 더 많은 thought tokens를 쓰고, usageMetadata.thoughtsTokenCount에 나타나며 출력으로 청구됩니다.
medium부터 시작하세요. 실제 작업에서 추론 부족이 확인될 때만 high로 올립니다. 분류, 추출, 단순 도구 라우팅은 낮은 수준을 시험할 수 있습니다. 모든 요청을 high로 설정하면 첫 토큰 시간, 비용, 불필요한 도구 작업이 늘 수 있습니다.
작업시작 수준측정 항목
분류, 라우팅, 고정 필드 추출minimal지연, 스키마 준수, 오류율
문서 Q&A, 일반 코드 설명medium정확도, 인용 범위, 비용
디버깅, 수학, 다중 도구high완료율, 수정 턴, 도구 루프
사용자 대화 기능medium에서 시작해 낮추기P95 지연, 사용자 수용도
curl "{BASE_URL}/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"role":"user","parts":[{"text":"이 동시성 코드의 경쟁 조건을 찾아 가장 작은 안전한 수정안을 제시하세요."}]}],"generationConfig":{"thinkingConfig":{"thinkingLevel":"high"},"maxOutputTokens":4096}}'
thinkingLevel과 기존 thinkingBudget을 함께 보내면 요청이 실패합니다. 마이그레이션에서는 기존 필드를 먼저 제거한 뒤, 보이는 답변 길이가 아니라 성공한 작업당 비용으로 비교하세요.

응답, 스트림, Usage에서 기록할 항목

주요 결과는 candidates[].content.parts, 종료 신호는 finishReason에 있습니다. usageMetadata에는 promptTokenCount, candidatesTokenCount, thoughtsTokenCount, totalTokenCount가 포함될 수 있습니다.

모델 ID/버전, 요청 시작·종료, HTTP, 종료 이유, 입력, 가시 출력, thought tokens, 도구 호출, 재시도, 비즈니스 수락 여부를 기록합니다. HTTP 성공 수보다 수락된 작업을 완료하는 비용이 중요한 지표입니다.

{
  "candidates":[{"content":{"role":"model","parts":[{"text":"..."}]},"finishReason":"STOP"}],
  "usageMetadata":{"promptTokenCount":1200,"candidatesTokenCount":480,"thoughtsTokenCount":320,"totalTokenCount":2000},
  "modelVersion":"gemini-3.6-flash"
}

이 예시는 가시 출력 480과 thought 320 모두 출력 측 비용에 포함합니다.

멀티모달 입력과 구조화 출력

하나의 parts 배열에 텍스트와 미디어를 섞을 수 있습니다. 원격 파일은 fileData, 작은 Base64 콘텐츠는 inlineData를 사용합니다. 내부 URL을 무제한으로 가져오지 못하도록 서버가 MIME, 크기, 권한, URL 출처를 검증해야 합니다.

이미지, 차트, 인터페이스

문서 추출, 차트 해석, 시각 QA, UI 이해에 활용합니다. 필요한 영역, 필드, 출력 형식을 명시하세요. 낮은 해상도, 작은 라벨, 모호한 좌표를 실제 수락 세트로 시험합니다.

PDF와 긴 문서 분석

100만 토큰 컨텍스트는 계약서, 보고서, 기술 문서, 코드베이스에 유용하지만 정보 구조를 대체하지 않습니다. 인용을 요구하고 섹션 간 회상과 누락을 측정하세요. 큰 입력은 지연과 비용을 높이며 미디어 해상도도 토큰 사용을 바꿉니다.

오디오와 비디오 이해

가능하면 긴 미디어를 분할하고 시간 정보를 보존합니다. 이벤트 회상, 타임스탬프 정확도, 보인 내용과 들린 내용의 혼동을 평가하세요. 이는 이해 기능이지 네이티브 미디어 생성이 아닙니다.

Structured Output 예시

{
  "contents":[{"role":"user","parts":[
    {"text":"이 송장에서 공급업체, 날짜, 통화, 총액을 추출하세요."},
    {"fileData":{"mimeType":"image/jpeg","fileUri":"https://example.com/invoice.jpg"}}
  ]}],
  "generationConfig":{"responseMimeType":"application/json","responseSchema":{"type":"object","properties":{"vendor":{"type":"string"},"date":{"type":"string"},"currency":{"type":"string"},"total":{"type":"number"}},"required":["vendor","date","currency","total"]}}
}

Structured Outputs는 파싱 오류를 줄이지만 사실을 검증하지는 않습니다. 금액, 날짜, 계정 ID의 범위, 형식, 근거를 서버에서 확인하고 계약과 결제는 사람이 검토해야 합니다.

Function Calling, Code Execution과 에이전트 워크플로

신뢰할 수 있는 도구 루프는 다섯 단계입니다. 모델이 구조화 호출을 제안하고, 앱이 인수를 검증·실행하고, 일치하는 FunctionResponse를 반환한 뒤 모델이 다음 행동 또는 최종 답을 생성합니다. 호출 ID, 도구, 인수, 결과, 지연을 보존하세요.

모델을 무제한 권한의 실행기로 취급하지 마세요. 도구를 부작용별로 분류합니다. 읽기는 보통 자동화 가능하고, 되돌릴 수 있는 쓰기는 멱등성과 롤백이 필요하며, 결제·게시·삭제·권한 변경은 명시적 사람 승인이 필요합니다.

에이전트 위험제어지표
도구 루프가 끝나지 않음최대 턴, timeout, 누적 비용 상한평균/P95 도구 호출
잘못 만든 인수JSON Schema, enum, 서버 검증인수 거절률
무관한 코드 변경파일 범위, 테스트, diff 리뷰패치 수락률, 무관 변경률
외부 콘텐츠 인젝션Web·파일을 신뢰하지 않는 데이터로 처리차단·미승인 작업
중복 쓰기멱등 키, 트랜잭션, 상태 확인중복 작업률

코딩 에이전트에는 실제 저장소 작업을 사용하세요. 버그 수정, 테스트 실행, 최소 diff 생성을 요청하고 첫 시도 성공, 테스트 통과, 수정 턴, 무관한 변경, 수락 패치당 비용을 측정합니다. 공급업체 벤치마크는 가설일 뿐입니다.

먼저 시험할 8가지 개발자 활용 사례

활용 사례권장 설정수락 지표주요 위험
코딩 에이전트mediumhigh 비교테스트, 패치 수락무관 변경, 반복 수정
다중 도구 에이전트도구, 턴, 총비용 제한완료율, 도구 선택중복, 과도한 권한
긴 PDF 분석인용과 스키마 요구인용 정확도, 누락률컨텍스트 비용, 오귀속
이미지·차트 이해영역, 필드, 형식 지정필드·위치 정확도저해상도, 시각 오독
비디오·오디오 이해분할하고 시간 보존이벤트 회상, 시간 정확도미디어 토큰 증가
구조화 추출스키마와 서버 검증준수율, 재시도율형식은 맞고 사실은 틀림
배치 분류·요약낮은 Thinking부터처리량, 작업당 비용과도한 추론
사용자용 AI 기능Streaming, timeout, fallbackTTFT, P95, 수용도피크 지연, 공급자 차이

모두 객관적으로 측정할 수 있습니다. “답이 좋아 보인다”는 수락 기준이 아니며, 워크로드별 기계 지표와 사람 평가표가 필요합니다.

Gemini 3.6 Flash를 사용하지 말아야 할 때

  • 네이티브 이미지 또는 오디오 생성이 필요할 때.
  • 실시간 음성에 네이티브 Live API가 필수일 때.
  • Computer Use가 필요하지만 Preview 변경이나 사람 승인을 허용할 수 없을 때.
  • 단순 대량 작업에서 최저 단가만 중요할 때.
  • 결제, 삭제, 게시 등 민감 작업에 승인과 롤백이 없을 때.
  • 실제 평가 세트 없이 공개 벤치마크에만 의존할 때.
  • 현재 모델이 목표를 충족하고 3.6 Flash의 품질·지연·비용 개선이 측정되지 않을 때.

흔한 API 오류: 증상, 원인, 해결법

증상가능한 원인해결 및 검증
HTTP 400마지막 턴을 model로 미리 채움prefill 제거, 사용자 입력으로 종료
Sampling 필드 무효temperature, topP, topK 포함제거하고 Thinking과 지침 사용
Thinking 설정 실패thinkingLevelthinkingBudget 동시 사용thinkingLevel만 유지
다중 후보 실패candidateCount > 1필드 제거 또는 1로 설정
JSON 파싱 실패프롬프트로 “JSON”만 요구responseMimeTyperesponseSchema 사용
도구를 너무 많이 호출Thinking이 높거나 규칙이 넓음수준을 낮추고 도구·턴 제한
예상보다 높은 비용Thoughts, 기록, 재시도 누적전체 Usage와 수락 작업 비용 저장
스트림 끊김프록시 버퍼, timeout, 복구 부족SSE, heartbeat, 재연결, 멱등 retry 시험

오류가 나면 입력을 줄이기 전에 비식별 요청, HTTP 상태, 오류 응답, 모델 버전, 요청 ID를 보존하세요. 텔레메트리 없이 프롬프트만 바꾸면 원인 격리가 어렵고 비용이 계속 발생할 수 있습니다.

공식 가격과 실제 작업 비용

Google Standard 가격은 입력 100만 토큰당 $1.50, 출력은 $7.50입니다. thought tokens도 출력으로 청구됩니다. 정가는 유용한 작업을 완료하는 비용의 출발점일 뿐입니다.
실제 작업 비용
= 입력 토큰
+ 가시 출력과 thought tokens
+ 도구 또는 grounding
+ 캐시
+ 실패한 재시도

입력 100,000, 가시 출력 6,000, thought 4,000이면:

100,000 / 1,000,000 × $1.50
+ 10,000 / 1,000,000 × $7.50
= $0.225

전체 재시도는 비용을 거의 두 배로 만들 수 있습니다. 수락 결과당 비용으로 비교하고 잘못된 도구, 무관한 수정, 사람의 재작업 감소도 포함하세요.

평가에서 프로덕션까지: replay, canary, fallback

  1. 정상, 경계, 실패를 포함한 비식별 실제 작업을 샘플링합니다.
  2. 현재 모델의 품질, P50/P95, 토큰, 재시도, 사람 개입률을 기록합니다.
  3. 같은 입력을 오프라인 replay하고 리뷰어에게 모델 이름을 숨깁니다.
  4. 사용자에게 결과를 보내지 않는 shadow traffic으로 관찰합니다.
  5. 자동 중지 기준을 둔 작고 낮은 위험의 canary를 엽니다.
  6. 안정 모델을 fallback으로 유지하고 timeout·오류 경로를 훈련합니다.
  7. 수락 작업 비용, 지연, 안전이 함께 통과할 때만 트래픽을 늘립니다.
호환성, replay, canary, fallback을 포함한 Gemini 3.6 Flash 프로덕션 검증 흐름
호환성, replay, canary, fallback을 포함한 Gemini 3.6 Flash 프로덕션 검증 흐름
게이트권장 통과 조건
호환성알 수 없는 4xx 없음, 구조화/도구 응답 파싱 성공
품질핵심 작업 수락률이 기준선 이상
지연P95가 예산 내, 중단 스트림 복구
비용수락된 작업당 목표 충족
안전미승인 도구 작업 없음, 민감 작업 승인
롤백앱 릴리스 없이 fallback 가능

Google 직접 연결인가, AI API 애그리게이터인가?

모델이 평가를 통과하면 통합과 운영 복잡성을 누가 소유할지 결정해야 합니다. 시스템이 Gemini 전용인지, 팀이 공급자별 인증, 요청 차이, Usage, 청구, 마이그레이션을 장기 유지할지에 따라 둘 다 올바른 선택이 될 수 있습니다.

Google 직접 연결이 적합한 경우

  • 제품이 Gemini만 사용할 예정입니다.
  • 권한, 청구, 관측성이 이미 Google Cloud에 있습니다.
  • 새 Google Preview 도구에 가장 먼저 접근해야 합니다.
  • 플랫폼 팀이 할당량, 오류, 비용 분석, 재해 복구를 운영할 수 있습니다.
  • 네이티브 인터페이스와의 강한 결합을 수용할 수 있습니다.

AI API 애그리게이터가 적합한 경우

  • 한 제품이 작업별로 다른 모델을 선택합니다.
  • 같은 평가 세트에서 품질, 지연, 비용을 비교합니다.
  • 공급자별 계정, 키, 청구서를 피하고 싶습니다.
  • 모델, 가격, 가용성 변화 때 전환 여지가 필요합니다.
  • 새 모델에 기존 통합, 텔레메트리, rollout을 재사용합니다.
판단 영역단일 공급자 직접 연결AI API 애그리게이터
새 모델 통합별도 구축, 검증, 배포기존 플랫폼 진입점과 평가 재사용
API 키공급자별 분산한 플랫폼에서 중앙 관리
Usage/청구여러 콘솔 조정호출과 지출을 함께 관측
모델 비교공통 어댑터 구축다중 모델 시험 유지 용이
마이그레이션비즈니스 코드가 공급자에 결합접근 계층 변경 감소
새 upstream 기능보통 먼저 제공passthrough 검증 대기

모델 수만 보고 선택하지 마세요. 실제 호출 가능 여부, 명확한 ID/endpoint, 안정된 streaming, Usage의 thoughts, 추적 가능한 오류, 투명한 가격, 비지원 기능 표기를 확인해야 합니다.

EvoLink로 Gemini 3.6 Flash 사용하는 방법

EvoLink는 Google 네이티브 API 형식으로 Gemini 3.6 Flash를 제공합니다. 기존 네이티브 Gemini 요청 형식이라면 Base URL을 바꾸고 Bearer 인증으로 시작할 수 있습니다.

설정
모델 IDgemini-3.6-flash
권장 Base URLhttps://direct.evolink.ai
백업 Base URLhttps://api.evolink.ai
인증Authorization: Bearer YOUR_API_KEY
동기 endpoint/v1beta/models/gemini-3.6-flash:generateContent
스트리밍 endpoint/v1beta/models/gemini-3.6-flash:streamGenerateContent
EvoLink 대시보드에서 API 키를 만들고 서버 환경 변수나 Secret Manager에 저장하세요. 브라우저 코드, 모바일 번들, Git 저장소에는 두지 마세요.
curl "https://direct.evolink.ai/v1beta/models/gemini-3.6-flash:generateContent" \
  -H "Authorization: Bearer YOUR_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"contents":[{"role":"user","parts":[{"text":"멱등 API를 세 가지 요점으로 설명하세요."}]}]}'
기능현재 경로 상태통합 권장 사항
Thinking지원thinkingConfig.thinkingLevel 사용
Structured Outputs지원서버에서 스키마 검증 유지
Function Calling지원호출 ID, 인수, 도구 결과 저장
Code Execution지원격리 환경과 제한된 권한 사용
Context Caching지원적중률과 저장 비용 관측
Search / Maps / URL Context지원으로 문서화프로덕션 전 권한, 결과, 청구 시험
Computer Use현재 미지원Google Preview가 전달된다고 가정하지 않기
Live API미지원실시간 음성은 다른 경로 선택
항목Google StandardEvoLink100만 토큰당 차이
입력$1.50$1.35$0.15
출력과 Thinking$7.50$6.75$0.75
앞의 문서 에이전트 예시는 EvoLink에서 약 $0.2025입니다. 할인은 정가를 낮추지만 실제 경제성에는 Usage, 재시도, 작업 수락이 포함되어야 합니다.
Gemini 3.6 Flash를 10% 할인으로 테스트 EvoLink의 Gemini 모델 살펴보기

보안, 데이터, 규정 준수 체크리스트

API 키를 서버에 보관하고 업로드 데이터를 분류·최소화하며 Web, 파일, 도구에서 온 내용을 권한 정책을 덮어쓸 수 없는 신뢰하지 않는 입력으로 취급하세요.

도구를 읽기, 되돌릴 수 있는 쓰기, 고위험으로 분류합니다. 고위험 작업은 명시적 승인과 완전한 감사 기록이 필요합니다. 데이터 사용 정책도 다릅니다. Google 가격 페이지에 따르면 무료 등급 콘텐츠는 제품 개선에 사용될 수 있지만 유료 등급 콘텐츠는 그렇지 않습니다. 계약, 지역, 업종 요구 사항을 확인하세요.

자주 묻는 질문

Gemini 3.6 Flash는 공식 출시됐나요?

예. Google이 2026년 7월 21일 GA 모델로 출시했습니다. 채널 상태는 출시 상태 페이지를 확인하세요.

EvoLink에서 사용할 수 있나요?

예. EvoLink는 gemini-3.6-flash를 Google 네이티브 형식으로 제공합니다. 권장은 https://direct.evolink.ai, 백업은 https://api.evolink.ai입니다.

어떤 모델 ID를 사용해야 하나요?

gemini-3.6-flash를 사용하세요. 출시 전 gemini-3.6-flash-tiered 라벨은 사용하지 마세요.

어떤 입출력 모달리티를 지원하나요?

텍스트, 이미지, 오디오, 비디오, PDF를 입력하고 텍스트를 출력합니다. 이미지·오디오 생성이나 Live API 모델은 아닙니다.

컨텍스트와 최대 출력 한도는 얼마인가요?

입력 1,048,576, 최대 출력 65,536 토큰입니다. 큰 한도가 있어도 해상도와 기록은 품질, 지연, 비용에 영향을 줍니다.

어떤 Thinking Level을 사용해야 하나요?

medium부터 시작하고 분류·추출에는 minimal, 어려운 코드·수학·다중 도구에는 high를 시험하세요. 완료율, 지연, thought 비용으로 결정합니다.

thought tokens도 청구되나요?

예. 출력으로 청구되며 usageMetadata.thoughtsTokenCount에서 확인할 수 있습니다.

temperature, topP, topK가 작동하지 않는 이유는?

Gemini 3.x는 이 필드로 튜닝하도록 설계되지 않았고 현재 경로는 무시합니다. 명확한 지침, 출력 스키마, Thinking Level을 사용하세요.

candidateCount가 실패하는 이유는?

한 요청에서 여러 후보를 지원하지 않습니다. 1보다 큰 값은 실패하므로 별도 요청을 보내세요.

EvoLink에서 비용은 얼마인가요?

입력은 100만 토큰당 $1.35, 출력은 $6.75로 Google Standard의 90%입니다. Thoughts는 출력이며 도구와 재시도도 최종 비용을 바꿉니다.

아니요. Google은 Preview로 제공하지만 현재 EvoLink 네이티브 경로는 지원하지 않습니다.

Gemini 3.5 Flash를 즉시 교체해야 하나요?

아니요. 실제 작업 replay, shadow traffic, 통제된 canary, 검증된 fallback을 수행하고 비용, 지연, 품질이 함께 통과할 때만 확대하세요.

출처와 업데이트 정책

마지막 검증일은 2026년 7월 22일입니다. 상태, 사양, 기능, Google 정가는 공식 출처를 사용했습니다. EvoLink endpoint, 경로 기능, 할인 가격은 현재 제품 문서를 기준으로 하며 프로덕션 전 실제 청구로 확인해야 합니다.

기능, 가격, 경로, 파라미터 동작은 바뀔 수 있습니다. 프로덕션 전에 endpoint, Usage, 청구, streaming, 오류 처리를 자체 요청으로 시험하세요.

AI 비용을 89% 절감할 준비가 되셨나요?

오늘 EvoLink를 시작하고 지능형 API 라우팅의 힘을 경험해보세요.