
GLM-5.3 vs GLM-5.2: 실제로 바뀐 것과 갈아탈 가치가 있는가?
팩트 체크: 실제로 확인된 것
| 항목 | GLM-5.2 | GLM-5.3 | 상태 |
|---|---|---|---|
| 베이스 모델 | — | GLM-5.2와 동일 | 공식 |
| 컨텍스트 / 최대 출력 | 1M / 128K | 1M / 128K | 공식 |
| 모달리티 | 텍스트 전용 | 텍스트 전용 (비전 없음) | 공식 |
| 모델 ID | glm-5.2 | glm-5.3 (공식 예제 기준) | 공식 |
Thinking 끄기 (disabled) | 지원 | 제거됨 | 공식 — 브레이킹 체인지 |
reasoning_effort | — | low / high / max | 공식 — 새 제어 |
| 토큰당 가격 | 100만 토큰당 $1.40 / 캐시 $0.26 / $4.40 | 미공개 | 미해결 |
| 오픈 웨이트 | 공개됨 (MIT 계열) | ~8월 28일 약속, 라이선스 미공표 | 단계적 |
| API 제공 | 운영 중 (Z.ai, BigModel, 애그리게이터, EvoLink) | 단계적; 출시 당일 토큰 단위 호출 불가 | 단계적 |
주장된 개선 — 팬이 아니라 구매자의 눈으로
출시 당일 숫자는 전부 Z.ai 공식 발표 수치(vendor-claimed; 독립 재현 없음)입니다. 패턴은 일관됩니다. 포스트 트레이닝 작업이 향한 곳은 에이전틱한 장기 코딩입니다.
| 벤치마크 | GLM-5.2 | GLM-5.3 | (사실이라면) 시사하는 것 |
|---|---|---|---|
| Terminal Bench 3.0 | 4.6 | 28.3 | 터미널/CLI 에이전트 동작의 대폭 개선 |
| SWE-Marathon v1.1 | 19.4 | 42.5 | 장기 작업 지속력이 대략 두 배 |
| DeepSWE v1.1 | 46.2 | 66.9 | 저장소 규모의 수정 품질 |
| FrontierSWE | 67.5 | 78.1 | Z.ai 자체 표 기준으로도 Claude Fable 5(88.2)에는 여전히 미달 |
| ExploitBench | 24.4 | 54.4 | 새로 생긴 사이버 능력; 클로즈드 모델이 여전히 앞섬 |
확인된 단 하나의 브레이킹 체인지
thinking.type: "disabled"를 받아들였지만, GLM-5.3는 받지 않습니다.{
"model": "glm-5.3",
"thinking": { "type": "enabled" },
"reasoning_effort": "max"
}통합이 지연에 민감한 경로(분류, 추출, 짧은 재작성)에 non-thinking 호출을 쓰고 있다면, 그 경로는 그대로 이식되지 않습니다. GLM-5.3 라우트에서의 선택지는 다음과 같습니다.
- 트래픽 재계층화 — 비추론 호출에는 더 저렴하고 빠른 모델(GLM-5.2 또는 다른 라우트)을 유지하고, 에이전틱 작업만 GLM-5.3로 보냅니다.
reasoning_effort: "low"를 가장 가까운 대체재로 사용하고, 지연과 토큰 오버헤드가 허용 범위인지 측정합니다.- 토큰당이 아니라 작업당 비용을 재측정 — 항상 켜진 thinking은 출력 토큰량을 바꾸므로, (만약 그렇게 출시되더라도) 토큰 단가가 같다고 청구서가 같지는 않습니다.
Coding Plan의 조용한 자동 라우팅이 중요한 이유도 여기에 있습니다. 구독 중이라면 여러분의 GLM-5.2 요청은 이미 매번 생각하는 모델을 거치고 있습니다. 8월 14일 이후 느껴진 동작 변화가 있다면, 유력한 설명은 이것입니다.
GLM-5.2가 이미 증명한 것 vs GLM-5.3가 증명해야 할 것
이 비대칭이 곧 결정입니다. GLM-5.2의 가치는 모든 운영상 미지수가 이미 실제 라우트에서 답을 얻었다는 데 있고, GLM-5.3는 베이스 모델이 같은데도 그 답 여러 개를 다시 원점으로 되돌립니다.
| GLM-5.2가 이미 증명한 것 (운영 중인 라우트에서) | GLM-5.3가 증명해야 할 것 (아직 없는 라우트에서) |
|---|---|
| 알려진 가격과 과금 동작 | 어떤 가격이든 존재하는지부터 |
| thinking 끄기를 포함한 안정된 요청 계약 | 새 계약: 항상 켜진 thinking, effort 레벨 |
| 프로덕션에서의 도구 호출, 캐싱, 구조화 출력 | 같은 기능의 라우트별 재검증 |
| 실제 부하에서의 지연과 429 동작 | 갓 배포된 인프라의 용량 |
| 셀프 호스팅용 MIT 계열 웨이트 | 웨이트(~8월 28일)와 미공표 라이선스 |
| 축적된 prompt/에이전트 튜닝 | 그 튜닝이 동작 변화를 견뎌 내는지 |
요컨대 GLM-5.2의 가치는 벤치마크 점수가 아니라 운영상 확실성이며, 갈아타는 것은 GLM-5.3가 실제 라우트에서 그 확실성을 다시 얻어 낼 때까지 그 일부를 포기하는 일입니다.
동작 변화 테스트 체크리스트
- Thinking 경로 회귀: 예전 non-thinking 워크로드를
reasoning_effort: "low"로 돌리고, thinking을 끈 GLM-5.2 대비 지연, 출력 토큰, 답변 안정성을 비교합니다. - Effort 레벨 스윕: 고정된 에이전틱 작업 세트를
low/high/max로 돌리고 레벨별 품질 대 토큰 비용을 기록합니다. Z.ai는 코딩에max를 권장합니다 — 여러분의 작업에서 그 토큰값을 하는지 검증하세요. - 장기 지속력: 가장 긴 다단계 에이전트 세션을 재생하고 중도 포기, 잘못된 도구 호출, 사람 개입 횟수를 셉니다 (주장된 개선이 사는 곳이 바로 여기입니다).
- 도구 호출 충실도: 스키마, 재시도, 오류 복구를 검증합니다 — 포스트 트레이닝은 다른 어떤 표면보다 도구 동작을 크게 바꿉니다.
- 수락 작업당 비용: (thinking 포함) 총 토큰을 리뷰를 통과한 작업 수로 나누고, GLM-5.2 기준선과 비교합니다.
- 자동 라우팅 감사 (Coding Plan 사용자): 품질 변화를 자신의 prompt 수정 탓으로 돌리기 전에, 최근 요청을 실제로 어떤 모델이 처리했는지 확인합니다.
갈아타면 안 되는 경우
다섯 가지 상황에서는 당분간 GLM-5.2에 남는 것이 맞습니다 — 첫 번째는 오늘 모든 토큰 과금 통합에 해당합니다.
- 아직 토큰 단위로 과금할 수 없습니다 — 공개 토큰당 라우트가 없으므로, 구독 밖에서는 "갈아타기" 자체가 현재 선택 가능한 옵션이 아닙니다.
- 워크로드가 thinking-off 동작에 의존하고, 여러분의 작업 구성에서 재계층화가 개선폭만큼의 가치가 없을 때.
- GLM-5.2 통합이 납품 진행 중일 때 — 안정적이고 가격이 있는 라우트는 경제성이 미공개인 주장된 개선을 언제나 이깁니다.
- 셀프 호스팅할 때 — 웨이트는 ~8월 28일까지 없고, 라이선스는 (GLM-5.2와 달리) 아직 알 수 없습니다. 공표되지 않은 조건을 중심으로 아키텍처를 설계하지 마세요.
- 비전이 필요할 때 — 두 모델 다 없습니다. 이번 업그레이드는 그것을 바꾸지 않습니다.
4단계 평가 계획 (지금 준비하고, 가격 공개일에 실행)
- 기준선을 동결하세요. 이번 주에 GLM-5.2 지표를 캡처하세요: 품질 통과율, 지연 백분위, 수락 작업당 비용, 도구 실패율. 라우트가 열린 뒤에는 "이전"을 깨끗하게 복원할 수 없습니다.
- 즉흥이 아니라 재생으로. 대표 작업 20–50개(최악의 반복 실패 포함)를 고정 스위트로 보관하세요. GLM-5.3 라우트가 호출 가능해지는 날 그대로 돌립니다.
- 챌린저 레인을 운영하세요. 실제 트래픽의 작고 위험이 낮은 조각을 같은 OpenAI 호환 계약 뒤에서 GLM-5.2와 나란히 GLM-5.3로 라우팅해, 전환이 설정 변경이 되게 하세요 — 기존 레인은 EvoLink의 운영 중인 GLM-5.2 라우트에서 돌립니다.
- 롤백 게이트와 함께 승격하세요. 수치화된 승격 기준(예: 수락 작업당 비용 ≥10% 개선, 도구 충실도 회귀 없음)을 정의하고, GLM-5.3가 그 기준을 2주간 유지할 때까지 GLM-5.2를 테스트된 fallback으로 유지하세요.
FAQ
지금 GLM-5.2에서 GLM-5.3로 갈아타야 하나요?
GLM-5.3는 GLM-5.2보다 큰 모델인가요?
아니요 — 같은 베이스 모델을 사용합니다. Z.ai는 모든 개선을 포스트 트레이닝에 귀속시키며 별도의 파라미터 수를 공개하지 않았습니다.
GLM-5.2와 GLM-5.3 사이의 브레이킹 체인지는 무엇인가요?
thinking.type: "disabled"는 GLM-5.2에서 동작했지만 GLM-5.3에서는 지원되지 않으며, reasoning_effort(low/high/max)가 새 제어 수단입니다.GLM-5.3는 GLM-5.2와 가격이 같을까요?
알 수 없습니다. GLM-5.2는 100만 토큰당 $1.40/$0.26/$4.40이지만, GLM-5.3는 공개된 가격이 없습니다. 같은 베이스라 비슷한 가격이 그럴듯하긴 하지만, 항상 켜진 thinking은 출력 토큰량 증가를 통해 실제 청구액을 올릴 수 있습니다.
벤치마크 개선은 진짜인가요?
Z.ai 공식 발표 수치이며 출시 당일 독립 재현은 없습니다 — 다만 Z.ai 자체 표가 여러 항목에서 Claude Fable 5에 뒤진다는 것까지 보여 주고 있어 솔직함은 있습니다. 확정된 사실이 아니라 여러분의 회귀 스위트가 검증할 가설로 취급하세요.
GLM-5.2처럼 GLM-5.3를 셀프 호스팅할 수 있나요?
아직 아닙니다. 웨이트는 출시 약 2주 후(2026년 8월 28일 전후) 공개가 약속되어 있고, 라이선스는 공표되지 않았습니다. GLM-5.2의 MIT 계열 조건이 자동으로 이어지지 않습니다.
GLM-5.3에 비전이 추가됐나요?
아니요. 두 모델 다 텍스트 전용이며, 멀티모달 작업은 Z.ai의 별도 GLM-V 라인에 남아 있습니다.
GLM 5.5 vs GLM-5.2는 어떻게 되나요?
참고 자료
- Z.ai — GLM-5.3 발표문 (베이스 모델, thinking 변경,
reasoning_effort, 벤치마크 표, 웨이트 일정) - BigModel — GLM-5.3 문서 (1M/128K, 기능 지원, API "곧 출시")
- Z.ai — 가격 (GLM-5.2 단가; 2026년 8월 14일 기준 GLM-5.3 항목 없음)
- Z.ai — GLM Coding Plan 문서 (자동 라우팅, 포인트 배수)
- EvoLink — GLM-5.3 출시 추적기 (채널별 제공 현황, 변경 기록)


