GPT Image 2.5 Flare & Sunburst가 EvoLink에 출시되었습니다GPT Image 2.5 체험하기

GLM-5.3 API

EvoLink 통합 채팅 API로 Z.ai의 GLM-5.3(Zhipu GLM-5.3 / GLM 5.3(으)로도 검색됨)에 접근하세요. 통합 전에 긴 컨텍스트 코딩, 다단계 에이전트, 프롬프트 캐싱을(를) 먼저 테스트할 수 있습니다.

Z.ai텍스트 생성사용 가능
입력 100만 토큰당 $1.400부터
API 문서
상시 추론프롬프트 캐싱도구 호출Chat + Messages
프로덕션 라우트라이브
컨텍스트
컨텍스트 1M · 최대 출력 131K
적합한 용도
코딩 에이전트, 긴 작업 체인, 도구 중심 워크플로
입력
텍스트
출력
텍스트 · JSON(구조화 출력) · 도구 호출

GLM-5.3 선택

코딩 에이전트와 장기 엔지니어링 작업을 위한 Z.ai의 플래그십 추론 모델입니다. 100만 토큰 컨텍스트, 상시 활성 사고, 도구 호출, 프롬프트 캐싱을 지원하며 Chat Completions와 Anthropic Messages 양쪽에서 사용할 수 있습니다.

GLM-5.3

Z.ai 플래그십 추론 모델

선택됨
모델 ID
glm-5.3
적합한 용도

저장소 규모의 코딩 에이전트, 긴 작업 체인, 도구 사용이 많은 워크플로, 그리고 입력 대부분을 캐시 읽기가 담당하는 프리픽스 안정형 에이전트 루프.

입력
$1.400 / 1M95.2 cr / 1M
캐시 읽기
$0.261 / 1M17.7 cr / 1M
출력
$4.400 / 1M299.2 cr / 1M

모든 요금은 100만 토큰 기준이며 USD와 크레딧으로 표시되고, 계정의 현재 가격을 반영합니다.

GLM-5.3 요금

통합 전에 GLM-5.3 요청 1건의 비용을 예상해 보세요. 계산기는 계정의 현재 요금을 사용하며 공식 가격은 비교용 참고 정보입니다.

요청 계산기

요청 1건의 토큰 구성과 성공한 도구 호출 횟수을 입력하세요.

요청당 예상 비용

GLM-5.3
USD$0.0028
크레딧0.1886
입력 토큰0.0952 cr
캐시 읽기 토큰0.0036 cr
출력 토큰0.0898 cr

최소 과금: 요청당 0.01 크레딧.

예산 가이드

현재 토큰 구성 기준의 대략적인 요청 수.
크레딧 충전
$10
약 3605회 요청

빠른 테스트용

$50
약 18027회 요청

일반 개발용

$100
약 36055회 요청

프로덕션 평가용

서버 측 도구 요금

성공한 서버 측 호출만 호출당 과금됩니다. 실패한 시도에는 도구 요금이 없지만 토큰은 과금됩니다.
  • 웹 검색$0.010/ 회0.68 cr / 회

코딩 에이전트와 장기 엔지니어링을 위한 GLM-5.3 API

Z.ai의 플래그십 추론 모델을 입력 $1.40, 출력 $4.40(100만 토큰당)에 EvoLink 통합 API로 호출하세요. 모델 ID glm-5.3, 100만 토큰 컨텍스트, 상시 low/high/max 추론, 도구 호출과 프롬프트 캐싱을 지원합니다.

GLM-5.3은(는) EvoLink에서 모델 ID glm-5.3로 Chat Completions · Responses · Anthropic Messages를 통해 제공되며, 다른 모든 모델과 같은 API 키와 잔액을 사용합니다. 1M 컨텍스트 윈도우와 최대 131K 출력 토큰, 그리고 긴 컨텍스트 코딩, 다단계 에이전트, 프롬프트 캐싱를 제공합니다.

GLM-5.3

GLM-5.3 사양과 기능

숫자는 EvoLink 경로 설정에서 가져오며, 기능은 API가 현재 제공하는 범위입니다.

컨텍스트 윈도우
1M 토큰
최대 출력
131K 토큰
입력
텍스트
출력
텍스트 · JSON(구조화 출력) · 도구 호출
추론
항상 켜진 추론
도구 사용
여러 단계 도구 시퀀스를 지원하는 함수 호출
프롬프트 캐싱
자동 캐시 읽기, 더 낮은 요금
서버 측 도구
웹 검색, 성공한 호출당 과금
프로토콜
Chat Completions · Responses · Anthropic Messages
모델 ID
glm-5.3

GLM-5.3이 이런 작업을 감당할 수 있는 이유

세 가지 특성이 대부분을 담당합니다. 각 특성은 동시에 모델을 잘못 쓰는 방법도 암시하므로, 프로덕션 트래픽을 넘기기 전에 이해해 둘 가치가 있습니다.

100만 토큰 작업 컨텍스트, 단일 요금

장문 컨텍스트 구간 요금이 없습니다. 90만 번째 토큰의 요율은 1,000번째와 같습니다. 공격적으로 잘라내야 할 이유 하나는 사라지지만, 윈도우를 채우는 것이 공짜가 되거나 정확해지는 것은 아닙니다.

요청 본문의 바이트 단위 충실 전달

모델명을 제외하면 요청 본문이 업스트림에 그대로 도달하므로, GLM 고유 필드와 프롬프트 캐시 프리픽스 해시, 사고 서명이 두 엔드포인트 모두에서 보존됩니다.

출력 과금에 포함되는 추론 토큰

추론은 별도 항목이 아니라 completion 토큰 안에서 과금되므로, 131,072 토큰의 출력 상한은 추론과 최종 답변을 합친 상한입니다. 출력 예산은 상한이 아니라 작업 기준으로 설정하세요.

GLM-5.3을 프로덕션 모델 스택의 어디에 둘 것인가

GLM-5.3은 GLM-5.2보다 비싸고 Flash보다는 훨씬 비쌉니다. 가장 최신이라는 이유만으로 기본 경로가 되어서는 안 됩니다. 진짜 강점은 더 깊은 추론이 재시도나 사람의 수정 한 번을 실제로 줄여주는 작업입니다.

저장소 규모의 코딩

연관된 모듈, 테스트, 프로젝트 규약을 100만 토큰 컨텍스트에 함께 담아, 코딩 에이전트에 파일을 하나씩 넘기는 방식을 없앨 수 있습니다. 이득은 파일 간 수정이 서로 깨지지 않는 형태로 나타나며, 단일 파일 자동완성이 좋아지는 것과는 다릅니다.

긴 작업 체인

여러 단계를 도는 계획–실행–검증 루프가 가장 큰 이득을 봅니다. 초반의 추론 오류가 체인 전체로 번지기 때문입니다. 단계별 품질이 아니라 체인 완료율로 평가하세요.

도구 사용이 많은 에이전트

큰 도구 스키마와 긴 지시 블록이 캐시된 프리픽스 안에 들어가므로, 한 단계를 더 도는 한계 비용이 전체 입력 요율이 아니라 캐시 읽기 요율에 가까워집니다.

Anthropic 프로토콜 클라이언트에서 바로

/v1/messages로 가는 요청은 바이트 단위로 그대로 전달되어 프롬프트 캐시 프리픽스와 사고 서명이 보존됩니다. Claude 프로토콜 코딩 CLI는 변환 계층 없이 EvoLink를 가리키고 glm-5.3을 선택하면 됩니다.

GLM-5.3이 바꾼 것과 깨뜨린 것

GLM-5.3은 GLM-5.2를 그대로 대체하지 않습니다. 파라미터 변경 하나가 명백한 파괴적 변경이고 가격도 움직였습니다. 프로덕션 경로를 옮기기 전에 이 네 가지를 확인하세요.

파괴적 변경: 사고를 더 이상 끌 수 없음

GLM-5.3은 항상 사고하며 thinking.type: "disabled"를 거부합니다. GLM-5.2에서 마이그레이션한 클라이언트가 비활성 모드를 계속 보내면 그대로 실패합니다. 공식 대체는 thinking.type: "enabled"와 reasoning_effort: "low" 조합입니다.

추론 강도 3단계, 기본값은 max

reasoning_effort는 low, high, max를 받고 기본값은 max입니다. 출력 토큰에 추론 토큰이 포함되므로 이 단계는 비용에 직접 영향을 줍니다. 대량 정형 호출에서 기본값을 그대로 두는 것이 5.3에서 과다 지출하는 가장 흔한 경로입니다.

캐시 읽기가 이 페이지에서 가장 저렴한 지렛대

캐시 읽기 토큰은 새 입력의 약 5분의 1로 과금됩니다. 시스템 프롬프트와 도구 스키마가 입력의 대부분을 차지하는 긴 에이전트 루프에서는, 그 프리픽스를 바이트 단위로 안정시키는 것이 모델 선택 자체보다 청구서에 더 크게 작용합니다.

GLM-5.2보다 비싸고 할인 없음

5.3은 프로모션 할인 없이 업스트림 요율로 과금되므로 입력이 현재 GLM-5.2 요율보다 약 40% 높습니다. 추가된 추론이 측정 가능한 값어치를 하는 곳에만 5.3을 쓰고 나머지는 5.2나 Flash에 두세요.

GLM-5.3을(를) 사용하는 두 가지 방법: EvoLink API 또는 Agent

프로덕트 백엔드와 배치 작업에는 EvoLink API를, 코딩·분석 워크플로에는 Codex, Claude, Gemini에서 GLM-5.3을(를) 직접 호출하세요. 두 경로 모두 같은 EvoLink API 키, 잔액, 모델 ID, 요청 기록을 공유합니다.

방법 1

EvoLink API로 통합

적합한 용도: 프로덕트 백엔드, 배치 작업, 자동화 파이프라인

OpenAI 호환 Chat Completions(또는 Anthropic Messages) 요청을 EvoLink로 보내고 모델 ID, 시스템 프롬프트, 출력 예산, 도구, 구조화 출력을 직접 제어합니다.

  1. 1콘솔에서 EvoLink API 키를 만드세요
  2. 2OpenAI 또는 Anthropic SDK의 base URL을 EvoLink로 지정하고 위에 표시된 모델 ID를 선택하세요
  3. 3대표 요청을 한 번 보내고 usage 필드에서 입력·캐시·출력 토큰을 확인하세요
  4. 4작업별로 max_tokens와 재시도를 설정하고, 여러 턴에서는 tool-call ID와 결과를 유지하세요
방법 2

Agent로 호출

적합한 용도: Codex, Claude, Gemini에서의 코딩·리뷰·분석 작업

작업, 포함할 입력, 수락 기준을 Agent에 전달하면 Agent가 요청을 구성해 EvoLink를 통해 GLM-5.3을(를) 호출하고 토큰 사용량과 함께 답변을 돌려줍니다.

  1. 1EVOLINK_API_KEY를 로컬 환경 변수에 설정하세요. 코드나 프롬프트에 넣지 마세요
  2. 2작업, 포함할 입력, 기대하는 출력 형식을 설명하세요
  3. 3Agent가 EvoLink를 통해 GLM-5.3을(를) 호출하고 전송 전에 요청을 보여주게 하세요
  4. 4Agent가 답변, 토큰 사용량, 오류 본문을 보고하게 하세요

GLM-5.3 API 코드 예시와 오류 처리

이 예시는 가장 짧게 실행 가능한 요청입니다: 시스템 프롬프트, 사용자 메시지, 출력 예산을 포함한 OpenAI 호환 Chat Completions 호출. 전체 파라미터와 응답 레퍼런스는 API 탭을 여세요.

전체 API 문서 보기
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      { "role": "system", "content": "You are a senior engineer. Answer in JSON when asked." },
      { "role": "user", "content": "Review this diff and list risky changes as a JSON array:\n<diff>" }
    ],
    "reasoning_effort": "low",
    "max_tokens": 2048,
    "stream": true
  }'

# Reasoning is always on: reasoning_effort accepts low / high / max
# (default max) and thinking.type "disabled" is rejected.
# The same model ID works on /v1/messages (Anthropic Messages).
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens; completion tokens include reasoning).

잘못된 요청 또는 지원하지 않는 파라미터

API 레퍼런스를 기준으로 모델 ID, messages 배열, 파라미터 범위를 확인하고 이 경로가 지원하지 않는 필드를 제거하세요.

인증 또는 잔액 문제

Authorization Bearer 토큰을 확인하고 콘솔에서 사용 가능한 잔액을 확인하세요.

컨텍스트 길이 초과

프롬프트 토큰이 GLM-5.3의 컨텍스트 윈도우를 초과했습니다. 관련 근거만 잘라내거나 검색해 넣고 캐시된 프리픽스를 재사용하세요.

속도 제한(429)

지터를 두고 백오프 후 재시도하고, 병렬 버스트 대신 배치나 큐로 보내세요.

콘텐츠 또는 도구 호출 거부

재시도 전에 민감한 콘텐츠, 잘못된 tool-call 인자, JSON 스키마 불일치를 확인하세요.

프로덕션 트래픽을 GLM-5.3으로 보내기 전에 확인할 것

이 모델에서 나타나는 마이그레이션 문제는 다음 네 가지 점검으로 거의 다 잡힙니다. 앞의 둘은 명백한 실패이고, 뒤의 둘은 조용히 진행되는 비용 문제입니다.

01

모델 ID로 glm-5.3 사용

Chat Completions와 Anthropic Messages 모두 같은 ID를 쓰며 업스트림 이름과 정확히 일치합니다. 변환할 별칭이 없습니다.

필수
02

thinking.type: "disabled" 모두 제거

GLM-5.2 대비 유일한 명백한 파괴적 변경입니다. thinking.type: "enabled"와 reasoning_effort: "low"로 바꾸고 회귀 프롬프트를 다시 실행하세요.

파괴적 변경
03

reasoning_effort를 의도적으로 설정

기본값은 max입니다. 정형 호출과 지연에 민감한 호출을 low로 낮추고 채택률이 유지되는지 확인한 뒤 절감분을 계산하세요.

비용
04

캐시가 실제로 적중하는지 확인

반환된 usage에 캐시 토큰이 나타나는지 확인하세요. 호출 사이에 프리픽스가 달라지면 매 요청이 전체 입력 요율로 과금되지만, 응답 자체로는 알 수 없습니다.

비용

캐시 읽기는 새 입력의 약 5분의 1

캐시에 적중한 입력은 별도의 낮은 요율로 과금되므로, 안정적인 시스템 프롬프트와 저장소 규칙, 도구 스키마는 긴 에이전트 루프에서도 저렴하게 유지됩니다. 캐시 쓰기 요금은 없습니다. 업스트림이 캐시 생성 토큰을 반환하지 않기 때문입니다.

100만 토큰 컨텍스트와 131K 출력 상한

연관된 코드, 명세, 에이전트 상태를 하나의 작업 컨텍스트에 담을 수 있습니다. 상한은 용량이지 목표가 아닙니다. 필요한 것만 검색하고, 프리픽스를 안정적으로 유지해 캐시에 적중시키며, 작업에 맞는 출력 예산을 설정하세요.

GLM-5.3은 토큰 단가가 아니라 완료 작업당 비용으로 비교하세요

GLM-5.3은 GLM-5.2와 Flash보다 토큰당 비쌉니다. 그것은 각 모델이 실제로 출시할 만한 결과를 얼마나 자주 내놓는지와 함께 볼 때만 의미가 있습니다. 경로를 확정하기 전에 자신의 워크로드에서 일주일간 이 지표들을 추적하세요.

첫 시도 성공률채택된 결과물작업당 재시도 횟수출력 중 추론 토큰 비중캐시 적중률유효한 도구 호출채택 가능한 결과까지의 시간폴백 비율

토큰당 40% 비싸지만 세 번 중 한 번의 재시도를 없애는 경로는 실제로 더 저렴합니다. 40% 비싸면서 아무것도 바꾸지 못하는 경로는 그저 더 비싼 기본값일 뿐입니다. 이 둘을 구분하는 유일한 방법은 같은 작업에서 둘 다 측정하는 것입니다.

전환 전에 GLM-5.2, Kimi K3와 비교하세요

EvoLink

GLM-5.3은 GLM-5.2보다 비쌉니다. 실제로 답해야 할 질문은 재시도와 사람 손질이 줄어든 만큼이 그 차액을 메우는지입니다. 먼저 측정하고 그다음 프로덕션 경로를 정하세요.

GLM-5.3
입력 / 출력$1.4 / $4.4
컨텍스트1M
캐싱캐시 읽기
적합한 용도저장소 규모의 코딩 에이전트, 긴 작업 체인, 도구 사용이 많은 워크플로, 그리고 입력 대부분을 캐시 읽기가 담당하는 프리픽스 안정형 에이전트 루프.
GLM-5.2
입력 / 출력$1 / $3.5
컨텍스트1M
캐싱캐시 읽기
적합한 용도이전 세대 GLM 플래그십으로 토큰 단가는 여전히 더 저렴합니다. 5.3에서 측정 가능한 이득이 없는 작업, 그리고 사고 비활성화에 의존하는 클라이언트는 계속 이 모델을 쓰세요.
Kimi K3
입력 / 출력$3 / $15
컨텍스트1.05M
캐싱자동 캐시 읽기
적합한 용도Moonshot의 100만 컨텍스트 추론 모델. 장문 컨텍스트 코딩과 에이전트 작업에서 벤더 간 비교 기준으로 유용합니다.

GLM 모델 제품군

같은 API 키와 잔액으로, 연동을 바꾸지 않고 티어를 전환할 수 있습니다.

GLM-5.3

GLM-5.3

현재 모델

Z.ai 플래그십 추론 모델

GLM-5.2

GLM-5.2

이전 세대 GLM 플래그십으로 토큰 단가는 여전히 더 저렴합니다. 5.3에서 측정 가능한 이득이 없는 작업, 그리고 사고 비활성화에 의존하는 클라이언트는 계속 이 모델을 쓰세요.

모델 보기
GLM-5.3 Flash

GLM-5.3 Flash

같은 5.3 세대이면서 가격은 약 9분의 1이고, 이미지·영상·파일 입력을 기본 지원합니다. 대량 처리와 멀티모달 작업의 기본 선택지입니다.

모델 보기

GLM-5.3 외 EvoLink의 다른 텍스트 모델

Kimi K3

Kimi K3

Moonshot의 100만 컨텍스트 추론 모델. 장문 컨텍스트 코딩과 에이전트 작업에서 벤더 간 비교 기준으로 유용합니다.

모델 보기
DeepSeek V4 Pro

DeepSeek V4 Pro

비용에 민감한 장문 컨텍스트 기준선. 토큰 단가가 라우팅 결정을 좌우하는 대량 추론에 적합합니다.

모델 보기
GPT-5.6

GPT-5.6

OpenAI의 단계형 프런티어 제품군(Sol / Terra / Luna). 성능·지연·비용에 따라 유연하게 라우팅합니다.

모델 보기
Claude Opus 4.8

Claude Opus 4.8

Anthropic의 프리미엄 라우트. 장시간 에이전트, 복잡한 리뷰, 판단이 중요한 작업에 적합합니다.

모델 보기

GLM-5.3 관련 읽을거리

GLM-5.3 Flash vs GLM-5.3

GLM-5.3 Flash vs GLM-5.3

모달리티, 작업 난이도, 승인된 결과당 비용으로 라우트를 고르고 Flash-first 선택적 승격 정책을 설계합니다.

글 읽기
GLM-5.3 출시: 무엇이 나왔나

GLM-5.3 출시: 무엇이 나왔나

8월 14일 출시가 사양, 모델 ID, 단계적 공개에 대해 실제로 확정한 것과 당시 아직 열려 있던 것.

글 읽기
GLM-5.3 vs GLM-5.2

GLM-5.3 vs GLM-5.2

베이스 모델은 동일하고 개선은 모두 사후 학습에서. 여기에 사고를 끌 수 없게 된 파괴적 변경까지. 언제 5.2에 남아야 하는가.

글 읽기
GLM-5.3 vs Claude

GLM-5.3 vs Claude

코딩 에이전트를 어느 쪽으로 보낼지 정하기 전에 벤치마크, API 계약, 실제 가용성을 비교합니다.

글 읽기
GLM-5.3 사이버보안 벤치마크

GLM-5.3 사이버보안 벤치마크

CyberGym과 ExploitBench 수치가 Z.ai 자체 보고 기준으로 무엇을 주장하는지, 방어자는 어떻게 읽어야 하는지.

글 읽기
게이트웨이 하나로 코딩 CLI 3종

게이트웨이 하나로 코딩 CLI 3종

설정 파일 경로, 환경 변수, 그리고 여러 CLI를 단일 엔드포인트로 운영하기 위한 문제 해결 체크리스트.

글 읽기

GLM-5.3 API 자주 묻는 질문

EvoLink에서 GLM-5.3 API를 사용할 수 있나요?

예. GLM-5.3은 프로덕션 모델로 제공되며, Chat Completions와 Anthropic Messages 모두에서 사용할 수 있습니다.

어떤 모델 ID를 사용하나요?

두 엔드포인트 모두 glm-5.3입니다. EvoLink의 모델명은 업스트림 이름과 정확히 일치합니다.

OpenAI SDK나 Anthropic Messages를 계속 쓸 수 있나요?

예. 같은 API 키로 클라이언트를 EvoLink로 향하게 하고 glm-5.3을 지정하세요. 모델명을 제외하면 요청이 바이트 단위로 그대로 전달되므로 프롬프트 캐시 프리픽스와 사고 서명이 보존됩니다.

GLM-5.2처럼 사고를 끌 수 있나요?

불가능합니다. GLM-5.3은 항상 사고하며 thinking.type: "disabled"를 거부합니다. GLM-5.2에서 마이그레이션한다면 thinking.type: "enabled"와 reasoning_effort: "low" 조합으로 바꾸세요. 공식 대체 방안입니다.

reasoning_effort는 어떻게 고르나요?

기본값은 max입니다. 일상적인 수정, 분류, 지연에 민감한 호출에는 low를, 아키텍처 설계와 디버깅, 긴 작업 체인에는 high나 max를 쓰세요. 출력 토큰에 추론 토큰이 포함되므로 이 설정은 비용에 직접 영향을 줍니다.

GLM-5.3이 GLM-5.2보다 비싼 이유는?

GLM-5.3은 할인 없는 업스트림 요율이고 GLM-5.2는 프로모션 가격이라 입력이 약 40% 비쌉니다. 추가된 추론이 실제로 재시도를 줄이는 작업은 5.3으로, 그렇지 않으면 5.2나 GLM-5.3 Flash로 보내세요.

프롬프트 캐싱은 어떻게 과금되나요?

캐시 읽기에는 별도 요율이 있으며 새 입력의 약 5분의 1입니다. 업스트림이 캐시 생성 토큰을 반환하지 않아 쓰기 요금은 없습니다. 계속 적중시키려면 프롬프트 프리픽스를 바이트 단위로 안정적으로 유지하세요.

컨텍스트 윈도우와 출력 한도는?

컨텍스트 1,000,000 토큰, 출력 최대 131,072 토큰이며 윈도우 전 구간이 단일 요금입니다. 장문 컨텍스트 구간 요금은 없습니다.

GLM-5.3과 GLM-5.3 Flash 중 무엇을 쓸까요?

Flash는 약 9분의 1 가격이며 이미지·영상·파일 입력을 받습니다. 대량, 멀티모달, 정형 작업은 Flash로 시작하고, 더 깊은 추론이 필요하며 채택률이 차액을 정당화할 때 GLM-5.3으로 옮기세요.

GLM-5.3은 이미지를 처리하나요?

아니요, GLM-5.3은 텍스트 전용입니다. 이미지·영상·파일 입력에는 GLM-5.3 Flash를 사용하세요.

Claude, GPT, Kimi와 어떻게 비교하나요?

코딩 에이전트와 긴 작업 체인에서 "채택된 작업 하나당 비용"으로 GLM-5.3을 평가하고, Claude와 GPT는 성능 상한 기준으로, Kimi K3는 벤더 간 장문 컨텍스트 비교 대상으로 삼으세요.

프로덕션 평가에서 무엇을 측정해야 하나요?

첫 시도 성공률, 채택된 결과물, 재시도, 출력에서 추론 토큰이 차지하는 비율, 캐시 적중률, 유효한 도구 호출, 채택 가능한 결과까지의 시간, 폴백 비율입니다.