GPT Image 2.5 Flare & Sunburst가 EvoLink에 출시되었습니다GPT Image 2.5 체험하기

GLM-5.3 Flash API

EvoLink 통합 채팅 API로 Z.ai의 GLM-5.3 Flash(GLM 5.3 Flash / Zhipu GLM-5.3 Flash(으)로도 검색됨)에 접근하세요. 통합 전에 이미지 입력, 긴 문서 분석, 다단계 에이전트을(를) 먼저 테스트할 수 있습니다.

Z.ai텍스트 생성사용 가능
입력 100만 토큰당 $0.150부터
API 문서
멀티모달 입력이미지 · 영상 · 파일 입력사고 상시 활성Chat + Messages
프로덕션 라우트라이브
컨텍스트
컨텍스트 1M · 최대 출력 131K
적합한 용도
대량 분류·추출, 스크린샷과 문서 이해, 정형 에이전트 단계
입력
텍스트 + 이미지
출력
텍스트 · JSON(구조화 출력) · 도구 호출

GLM-5.3 Flash 선택

5.3 세대에서 멀티모달을 기본 지원하는 모델입니다. 텍스트·이미지·영상·파일을 입력할 수 있고 가격은 GLM-5.3의 약 9분의 1이며, 컨텍스트는 동일한 100만 토큰에 사고 상시 활성, 도구 호출, 프롬프트 캐싱을 지원합니다.

GLM-5.3 Flash

Z.ai 멀티모달 대량 처리 모델

선택됨
모델 ID
glm-5.3-flash
적합한 용도

대량 분류와 정보 추출, 스크린샷·문서 이해, 영상과 파일 분석, 그리고 토큰 단가가 라우팅을 결정하는 정형 에이전트 단계.

입력
$0.150 / 1M10.2 cr / 1M
캐시 읽기
$0.031 / 1M2.1 cr / 1M
출력
$0.500 / 1M34 cr / 1M

모든 요금은 100만 토큰 기준이며 USD와 크레딧으로 표시되고, 계정의 현재 가격을 반영합니다.

GLM-5.3 Flash 요금

통합 전에 GLM-5.3 Flash 요청 1건의 비용을 예상해 보세요. 계산기는 계정의 현재 요금을 사용하며 공식 가격은 비교용 참고 정보입니다.

요청 계산기

요청 1건의 토큰 구성과 성공한 도구 호출 횟수을 입력하세요.

요청당 예상 비용

GLM-5.3 Flash
USD$0.0004
크레딧0.0209
입력 토큰0.0102 cr
캐시 읽기 토큰0.0005 cr
출력 토큰0.0102 cr

최소 과금: 요청당 0.01 크레딧.

예산 가이드

현재 토큰 구성 기준의 대략적인 요청 수.
크레딧 충전
$10
약 32535회 요청

빠른 테스트용

$50
약 162679회 요청

일반 개발용

$100
약 325358회 요청

프로덕션 평가용

서버 측 도구 요금

성공한 서버 측 호출만 호출당 과금됩니다. 실패한 시도에는 도구 요금이 없지만 토큰은 과금됩니다.
  • 웹 검색$0.010/ 회0.68 cr / 회

멀티모달과 대량 처리를 위한 GLM-5.3 Flash API

5.3 세대의 대량 처리 계층을 EvoLink 통합 API에서. 텍스트·이미지·영상·파일 입력을 GLM-5.3의 약 9분의 1 가격에 제공하며, 컨텍스트는 동일한 100만 토큰에 사고 상시 활성, 도구 호출, 프롬프트 캐싱을 지원합니다.

GLM-5.3 Flash은(는) EvoLink에서 모델 ID glm-5.3-flash로 Chat Completions · Responses · Anthropic Messages를 통해 제공되며, 다른 모든 모델과 같은 API 키와 잔액을 사용합니다. 1M 컨텍스트 윈도우와 최대 131K 출력 토큰, 그리고 이미지 입력, 긴 문서 분석, 다단계 에이전트를 제공합니다.

GLM-5.3 Flash

GLM-5.3 Flash 사양과 기능

숫자는 EvoLink 경로 설정에서 가져오며, 기능은 API가 현재 제공하는 범위입니다.

컨텍스트 윈도우
1M 토큰
최대 출력
131K 토큰
입력
텍스트 + 이미지
출력
텍스트 · JSON(구조화 출력) · 도구 호출
추론
항상 켜진 추론
도구 사용
여러 단계 도구 시퀀스를 지원하는 함수 호출
프롬프트 캐싱
자동 캐시 읽기, 더 낮은 요금
서버 측 도구
웹 검색, 성공한 호출당 과금
프로토콜
Chat Completions · Responses · Anthropic Messages
모델 ID
glm-5.3-flash

GLM-5.3 Flash가 이 정도 물량을 감당할 수 있는 이유

Flash는 5.3 세대의 플랫폼 특성을 그대로 유지하고 가격과 입력 방식만 바꿉니다. 이 조합이 Flash를 대체재가 아니라 기본값으로 만듭니다.

한 요청에 텍스트와 미디어 혼합

하나의 메시지가 지시문, 여러 이미지, 파일을 함께 담을 수 있어, 같은 판단에 속한 자료가 파이프라인에 흩어지지 않고 한 번의 호출 안에 남습니다.

동일한 100만 컨텍스트, 단일 요금

Flash는 짧은 컨텍스트 모델이 아닙니다. 100만 윈도우 전체를 단일 요금으로 쓸 수 있고 장문 컨텍스트 구간 요금도 없습니다. 이 가격대에서 대량 문서 작업이 현실적인 이유입니다.

입력의 일부에 불과한 캐시 읽기

안정적인 시스템 프롬프트와 도구 스키마는 긴 루프 내내 캐시 읽기 요율로 과금됩니다. 이미 저렴한 모델에서 이는 한 단계를 더 도는 한계 비용을 거의 0에 가깝게 만듭니다.

GLM-5.3 Flash는 프로덕션 스택의 어디에 속하나

Flash는 대량 처리를 전제로 한 가격입니다. 그래서 질문은 감당할 수 있는지가 아니라 정확도 기준을 넘는지입니다. 먼저 실행하고 실패한 것만 올리면, 플래그십과의 가격 차이가 여러분 편에서 일하기 시작합니다.

대량 분류와 정보 추출

티켓 라우팅, 태깅, 구조화 추출, 콘텐츠 분류가 전체 재실행 비용이 그것을 피하려는 엔지니어링 시간보다 저렴한 가격대에서 돌아갑니다. 배치 크기가 더 이상 제약이 아닙니다.

스크린샷과 문서 이해

UI 스크린샷, 스캔한 페이지, 도표를 image_url 블록으로 보내고 구조화된 출력을 받습니다. GLM-5.3에는 아예 없는 능력입니다. 플래그십은 텍스트 전용입니다.

영상과 파일 분석

영상과 파일 입력을 별도 파이프라인이 아니라 기본으로 받으므로, 하나의 요청이 혼합 자료를 담을 수 있고 전사 단계와 추론 단계로 쪼갤 필요가 없습니다.

더 큰 에이전트 안의 정형 단계

도구 결과 요약, 분기 결정, 출력 재정리 — 호출량은 많지만 난도는 높지 않은 단계들입니다. 플래그십은 추론 깊이가 실제로 결과를 좌우하는 단계를 위해 남겨 두세요.

GLM-5.3 Flash가 주는 것과 대신 요구하는 것

Flash는 윈도우가 작은 축소판 5.3이 아닙니다. 컨텍스트, 프로토콜, 캐싱이 모두 동일합니다. 다른 것은 두 가지이고, 그중 하나는 직접 측정해 볼 가치가 있습니다.

플래그십에 없는 기본 멀티모달 입력

텍스트, 이미지, 영상, 파일 모두 표준 messages 구조를 통해 들어갑니다. 이미지는 image_url 블록으로 공개 URL(공식 권장) 또는 Base64 데이터 URL을 쓰며, 한 장당 한 블록입니다.

플래그십의 약 9분의 1 가격

입력과 출력 모두 GLM-5.3 요율의 약 9분의 1이고 캐시 읽기는 더 저렴합니다. 이 차이는 청구서뿐 아니라 워크로드의 형태 자체를 바꿀 만큼 큽니다.

5.3 세대의 나머지와 동일한 사고 제약

여기서도 사고는 항상 활성이며 thinking.type: "disabled"는 거부됩니다. Z.ai는 Flash에 대해 추가로 clear_thinking: false를 권장하며, 이 파라미터는 그대로 전달됩니다.

미디어 토큰 집계는 직접 확인할 가치가 있음

이미지와 영상은 prompt_tokens에 집계되어 입력 요율로 과금되지만, 업스트림은 이미지당 토큰 환산 공식을 공개하지 않습니다. 대표 샘플을 실행해 반환된 usage를 읽고, 추정이 아니라 실측으로 배치 규모를 정하세요.

GLM-5.3 Flash을(를) 사용하는 두 가지 방법: EvoLink API 또는 Agent

프로덕트 백엔드와 배치 작업에는 EvoLink API를, 코딩·분석 워크플로에는 Codex, Claude, Gemini에서 GLM-5.3 Flash을(를) 직접 호출하세요. 두 경로 모두 같은 EvoLink API 키, 잔액, 모델 ID, 요청 기록을 공유합니다.

방법 1

EvoLink API로 통합

적합한 용도: 프로덕트 백엔드, 배치 작업, 자동화 파이프라인

OpenAI 호환 Chat Completions(또는 Anthropic Messages) 요청을 EvoLink로 보내고 모델 ID, 시스템 프롬프트, 출력 예산, 도구, 구조화 출력을 직접 제어합니다.

  1. 1콘솔에서 EvoLink API 키를 만드세요
  2. 2OpenAI 또는 Anthropic SDK의 base URL을 EvoLink로 지정하고 위에 표시된 모델 ID를 선택하세요
  3. 3대표 요청을 한 번 보내고 usage 필드에서 입력·캐시·출력 토큰을 확인하세요
  4. 4작업별로 max_tokens와 재시도를 설정하고, 여러 턴에서는 tool-call ID와 결과를 유지하세요
방법 2

Agent로 호출

적합한 용도: Codex, Claude, Gemini에서의 코딩·리뷰·분석 작업

작업, 포함할 입력, 수락 기준을 Agent에 전달하면 Agent가 요청을 구성해 EvoLink를 통해 GLM-5.3 Flash을(를) 호출하고 토큰 사용량과 함께 답변을 돌려줍니다.

  1. 1EVOLINK_API_KEY를 로컬 환경 변수에 설정하세요. 코드나 프롬프트에 넣지 마세요
  2. 2작업, 포함할 입력, 기대하는 출력 형식을 설명하세요
  3. 3Agent가 EvoLink를 통해 GLM-5.3 Flash을(를) 호출하고 전송 전에 요청을 보여주게 하세요
  4. 4Agent가 답변, 토큰 사용량, 오류 본문을 보고하게 하세요

GLM-5.3 Flash API 코드 예시와 오류 처리

이 예시는 가장 짧게 실행 가능한 요청입니다: 시스템 프롬프트, 사용자 메시지, 출력 예산을 포함한 OpenAI 호환 Chat Completions 호출. 전체 파라미터와 응답 레퍼런스는 API 탭을 여세요.

전체 API 문서 보기
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [
      { "role": "system", "content": "You extract structured data. Answer in JSON only." },
      { "role": "user", "content": [
        { "type": "text", "text": "List every line item on this receipt as JSON." },
        { "type": "image_url", "image_url": { "url": "https://example.com/receipt.jpg" } }
      ] }
    ],
    "max_tokens": 1024,
    "temperature": 0.1
  }'

# Reasoning is always on for the 5.3 generation: do not send
# thinking.type "disabled". The same model ID works on /v1/messages
# (Anthropic Messages). The response includes choices[0].message and
# a usage object; image and video input is counted in prompt_tokens.

잘못된 요청 또는 지원하지 않는 파라미터

API 레퍼런스를 기준으로 모델 ID, messages 배열, 파라미터 범위를 확인하고 이 경로가 지원하지 않는 필드를 제거하세요.

인증 또는 잔액 문제

Authorization Bearer 토큰을 확인하고 콘솔에서 사용 가능한 잔액을 확인하세요.

컨텍스트 길이 초과

프롬프트 토큰이 GLM-5.3 Flash의 컨텍스트 윈도우를 초과했습니다. 관련 근거만 잘라내거나 검색해 넣고 캐시된 프리픽스를 재사용하세요.

속도 제한(429)

지터를 두고 백오프 후 재시도하고, 병렬 버스트 대신 배치나 큐로 보내세요.

콘텐츠 또는 도구 호출 거부

재시도 전에 민감한 콘텐츠, 잘못된 tool-call 인자, JSON 스키마 불일치를 확인하세요.

물량을 GLM-5.3 Flash로 옮기기 전에 확인할 것

둘은 정확성 점검이고 둘은 비용 점검입니다. 미디어 토큰 점검은 가장 많은 팀이 건너뛰고 나중에 대량 배치에서 후회하는 항목입니다.

01

모델 ID로 glm-5.3-flash 사용

Chat Completions와 Anthropic Messages 모두 같은 ID를 쓰며 업스트림 이름과 정확히 일치합니다.

필수
02

thinking.type: "disabled" 모두 제거

5.3 세대 전체가 이를 거부합니다. 가장 저렴하고 빠른 경로에는 thinking.type: "enabled"와 reasoning_effort: "low"를 쓰세요.

파괴적 변경
03

실제 샘플로 미디어 토큰 측정

대표 이미지나 영상을 보내고 응답의 prompt_tokens를 읽어 건당 비용을 직접 산출한 뒤 배치 크기를 정하세요.

비용
04

GLM-5.3 에스컬레이션 규칙 정의

무엇을 Flash의 실패로 볼지, 실패 시 무엇을 촉발할지 미리 정하세요. 규칙이 없으면 팀은 아무것도 올리지 않아 오류를 내보내거나, 전부 올려 가격 이점을 잃습니다.

라우팅

캐시 읽기는 새 입력의 약 5분의 1

캐시에 적중한 입력은 별도의 낮은 요율로 과금되므로 안정적인 시스템 프롬프트와 도구 스키마는 긴 에이전트 루프에서도 저렴합니다. 업스트림이 캐시 생성 토큰을 반환하지 않아 캐시 쓰기 요금은 없습니다.

이미지·영상·파일 기본 입력 지원

이미지는 messages[].content[] 안의 image_url 블록으로 보내고, url에는 공개 주소(권장) 또는 Base64 데이터 URL을 넣습니다. 여러 장이면 이미지마다 블록을 추가하세요. 미디어는 prompt_tokens에 집계되어 입력 요율로 과금되므로, 대량 배치를 계획하기 전에 대표 샘플로 먼저 측정하세요.

GLM-5.3 Flash의 정확도 격차를 먼저 측정하고, 그다음 값을 매기세요

유용한 비교는 Flash 대 벤치마크가 아니라, 자신의 작업에서 Flash 대 GLM-5.3입니다. 열 번 중 아홉 번 Flash가 플래그십과 대등하다면, 둘 다 운영하며 열 번째만 올리는 편이 열 번 모두 플래그십으로 보내는 것보다 훨씬 저렴합니다.

첫 시도 성공률채택된 결과물GLM-5.3 에스컬레이션 비율요청당 미디어 토큰캐시 적중률출력 중 추론 토큰 비중채택 가능한 결과까지의 시간채택된 작업당 비용

정확도 격차를 가정하지 말고 값으로 환산하세요. 비용이 9분의 1인 모델은 대체로 맞기만 해도 "먼저 실행 후 에스컬레이션"이 전부를 플래그십으로 보내는 방식을 이깁니다. 다만 "대체로"는 벤치마크에서 물려받는 값이 아니라 자신의 워크로드에서 측정해야 하는 숫자입니다.

GLM-5.3, DeepSeek V4 Flash와 비교하세요

EvoLink

Flash는 5.3 세대의 대량 처리 계층입니다. 먼저 정확도 기준을 넘는지 확인하세요. 넘는다면 플래그십과의 가격 차이는 모든 정형 작업의 라우팅 방식을 바꿀 만큼 큽니다.

GLM-5.3 Flash
입력 / 출력$0.15 / $0.5
컨텍스트1M
캐싱캐시 읽기
적합한 용도대량 분류와 정보 추출, 스크린샷·문서 이해, 영상과 파일 분석, 그리고 토큰 단가가 라우팅을 결정하는 정형 에이전트 단계.
GLM-5.3
입력 / 출력$1.4 / $4.4
컨텍스트1M
캐싱캐시 읽기
적합한 용도5.3 플래그십. 텍스트 전용이고 가격은 약 9배지만, 어려운 추론에서 Flash가 정확도 기준에 못 미칠 때 올바른 에스컬레이션 대상입니다.
DeepSeek V4 Flash
입력 / 출력$0.442 / $1.324
컨텍스트1M
캐싱캐시 읽기
적합한 용도DeepSeek의 대량 처리 모델. 100만 컨텍스트에 캐시 읽기 가격이 매우 낮아 대량 텍스트 작업에서 가장 직접적인 비용 비교 대상입니다.

GLM 모델 제품군

같은 API 키와 잔액으로, 연동을 바꾸지 않고 티어를 전환할 수 있습니다.

GLM-5.3

GLM-5.3

Z.ai 플래그십 추론 모델

모델 보기
GLM-5.2

GLM-5.2

이전 세대 GLM 플래그십. 5.3 세대는 사고 비활성화를 더 이상 허용하지 않으므로, 그 기능에 의존하는 클라이언트에는 여전히 필요합니다.

모델 보기
GLM-5.5

GLM-5.5

EvoLink 관찰 목록에 오른 차기 GLM 플래그십입니다. 출시 당일 모델 ID, 가격, 라우트 검증 결과를 받으려면 알림에 등록하세요.

모델 보기

GLM-5.3 Flash 외 EvoLink의 다른 텍스트 모델

DeepSeek V4 Flash

DeepSeek V4 Flash

DeepSeek의 대량 처리 모델. 100만 컨텍스트에 캐시 읽기 가격이 매우 낮아 대량 텍스트 작업에서 가장 직접적인 비용 비교 대상입니다.

모델 보기
Gemini 3.7 Flash

Gemini 3.7 Flash

구글의 저비용 멀티모달 모델. 이미지와 문서 이해가 선택을 좌우할 때 벤더 간 비교 기준으로 유용합니다.

모델 보기
Kimi K3

Kimi K3

Moonshot의 장문맥 추론 라우트. 리포지토리 규모 코딩과 다중 문서 작업에 적합합니다.

모델 보기
GPT-5.6

GPT-5.6

OpenAI의 단계형 프런티어 제품군(Sol / Terra / Luna). 성능·지연·비용에 따라 유연하게 라우팅합니다.

모델 보기

GLM-5.3 Flash 관련 읽을거리

GLM-5.3 Flash vs GLM-5.3

GLM-5.3 Flash vs GLM-5.3

모달리티, 작업 난이도, 승인된 결과당 비용으로 라우트를 고르고 Flash-first 선택적 승격 정책을 설계합니다.

글 읽기
GLM-5.3 출시: 무엇이 나왔나

GLM-5.3 출시: 무엇이 나왔나

8월 14일 출시가 5.3 세대에 대해 확정한 사양, 모델 ID, 단계적 공개와 당시 아직 열려 있던 것.

글 읽기
GLM-5.3 vs GLM-5.2

GLM-5.3 vs GLM-5.2

베이스 모델은 동일하고 개선은 모두 사후 학습에서. 여기에 세대 전체에서 사고를 끌 수 없게 된 파괴적 변경까지.

글 읽기
GLM-5.3 vs Claude

GLM-5.3 vs Claude

어느 계열로 에이전트를 보낼지 정하기 전에 벤치마크, API 계약, 실제 가용성을 비교합니다.

글 읽기
GLM-5.3 사이버보안 벤치마크

GLM-5.3 사이버보안 벤치마크

CyberGym과 ExploitBench 수치가 Z.ai 자체 보고 기준으로 무엇을 주장하는지, 방어자는 어떻게 읽어야 하는지.

글 읽기
게이트웨이 하나로 코딩 CLI 3종

게이트웨이 하나로 코딩 CLI 3종

설정 파일 경로, 환경 변수, 그리고 여러 CLI를 단일 엔드포인트로 운영하기 위한 문제 해결 체크리스트.

글 읽기

GLM-5.3 Flash API 자주 묻는 질문

EvoLink에서 GLM-5.3 Flash API를 사용할 수 있나요?

예. GLM-5.3 Flash는 프로덕션 모델로 제공되며, Chat Completions와 Anthropic Messages 모두에서 사용할 수 있습니다.

어떤 모델 ID를 사용하나요?

두 엔드포인트 모두 glm-5.3-flash입니다. EvoLink의 모델명은 업스트림 이름과 정확히 일치합니다.

Flash는 어떤 입력을 받나요?

텍스트, 이미지, 영상, 파일입니다. 텍스트 전용인 GLM-5.3과의 가장 큰 차이입니다.

이미지는 어떻게 보내나요?

messages[].content[]에 image_url 블록을 넣고 url에 공개 주소(공식 권장) 또는 Base64 데이터 URL을 전달하세요. 여러 장이면 이미지마다 image_url 블록을 추가합니다.

이미지와 영상 입력은 어떻게 과금되나요?

미디어는 prompt_tokens에 집계되어 입력 요율로 과금되며 별도의 미디어 SKU는 없습니다. 업스트림이 이미지의 토큰 환산 공식을 공개하지 않으므로, 대량 배치를 계획하기 전에 대표 샘플을 실행해 반환된 usage를 확인하세요.

사고를 끌 수 있나요?

불가능합니다. 5.3 세대 전체가 항상 사고하며 thinking.type: "disabled"를 거부합니다. 가장 저렴하고 빠른 경로가 필요하면 thinking.type: "enabled"와 reasoning_effort: "low"를 사용하세요.

clear_thinking은 무엇이고 설정해야 하나요?

턴 사이에 이전 사고 내용을 지울지 제어합니다. Z.ai는 Flash에 대해 clear_thinking: false를 권장합니다. 이 파라미터는 그대로 전달되며 EvoLink가 고쳐 쓰지 않습니다.

Flash는 GLM-5.3보다 얼마나 저렴한가요?

입력과 출력 모두 약 9분의 1입니다. 이 차이는 보통 "먼저 Flash로 처리하고 수용 검사를 통과하지 못한 요청만 상위 모델로 올리는" 운영을 정당화할 만큼 큽니다.

프롬프트 캐싱은 어떻게 과금되나요?

캐시 읽기에는 별도 요율이 있으며 새 입력의 약 5분의 1입니다. 업스트림이 캐시 생성 토큰을 반환하지 않아 쓰기 요금은 없습니다. 계속 적중시키려면 프롬프트 프리픽스를 바이트 단위로 안정적으로 유지하세요.

컨텍스트 윈도우와 출력 한도는?

컨텍스트 1,000,000 토큰, 출력 최대 131,072 토큰이며 윈도우 전 구간이 단일 요금입니다. 장문 컨텍스트 구간 요금은 없습니다.

대량 작업의 기본 모델로 적합한가요?

적합합니다. 가격 자체가 그런 용도로 설계되었습니다. 분류, 추출, 정형 에이전트 단계, 문서·스크린샷 이해가 자연스러운 용도입니다. 더 깊은 추론이 결과를 측정 가능하게 바꿀 때만 GLM-5.3으로 올리세요.

프로덕션 평가에서 무엇을 측정해야 하나요?

첫 시도 성공률, 채택된 결과물, 재시도, 출력에서 추론 토큰이 차지하는 비율, 캐시 적중률, 요청당 미디어 토큰 수, 채택 가능한 결과까지의 시간, 그리고 GLM-5.3으로의 에스컬레이션 비율입니다.