
GLM-5.3 사이버 보안 능력: 공식 벤치마크가 실제로 말하는 것
"Built to Code. Ready for Cyber Defense." — Z.ai가 주장하는 것
| 벤치마크 | GLM-5.3(벤더 주장) | GLM-5.2 | 유의점 |
|---|---|---|---|
| CyberGym | 84.5 | 77.2 | Z.ai 중국어 문서 본문은 83.5% — 두 개의 공식 수치가 존재 |
| ExploitBench | 54.4 | 24.4 | Z.ai 자체 표에 Mythos 5 = 78; 클로즈드 모델이 앞선다는 점을 Z.ai도 인정 |
이 숫자들을 읽을 때 붙잡아야 할 세 가지:
- 자체 베이스라인 기준의 도약은 실재합니다. 같은 베이스 네트워크를 공유하는 두 모델 사이에서 ExploitBench가 24.4 → 54.4로 움직인 것은 GLM-5.3 발표 전체에서 상대적으로 가장 큰 상승 폭입니다.
- 벤더 스스로 1위를 주장하지 않습니다. Z.ai의 표는 익스플로잇 지향 벤치마크에서 클로즈드 모델을 앞에 둡니다. GLM-5.3를 선도적 보안 모델이라 부르는 헤드라인은 Z.ai 자신보다 더 많은 것을 말하는 셈입니다.
- CyberGym 불일치는 공개되었을 뿐, 해소되지 않았습니다. 84.5(발표)와 83.5(중국어 문서 본문)는 둘 다 공식 수치입니다. Z.ai가 정리하기 전까지는 쌍으로 인용하세요.
왜 이번 출시는 "첫날 오픈소스"가 아닌가
GLM-5.2는 출시 당일 오픈 웨이트로 나왔습니다. GLM-5.3는 의도적으로 그렇게 하지 않았고 — Z.ai는 사이버 능력이 그 이유라고 말합니다. 발표에 따른 단계 계획은 다음과 같습니다.
- 오픈 웨이트는 약 2주 연기(2026년 8월 28일 전후)되며, 안전성 평가와 하드닝 작업을 거칩니다. 라이선스는 공표되지 않았습니다 — GLM-5.2의 조건이 이어진다고 가정하지 마세요.
- 토큰 과금 API 접근도 단계 개방입니다. 출시 당일 유일한 유료 경로는 GLM Coding Plan 구독이며, Z.ai 국제 가격 페이지에는 GLM-5.3 항목이 없고 BigModel(중국) API는 "coming soon"으로 표시되어 있습니다.
- 모델과 함께 Security Disclosure Ledger가 출범했습니다 — Z.ai에 따르면 모델이 발견한 취약점을 기록하는 공개 장부로, 발견이 조용한 악용이 아니라 조율된 공개(coordinated disclosure)로 흘러가게 하기 위한 것입니다.
보안 개발자들이 주목하는 이유
방어자를 위한 평가 프레임워크
- 공개된 약관이 있는 토큰 과금 API 엔드포인트 — Z.ai 가격 페이지에
glm-5.3항목이 추가되거나, BigModel API가 "coming soon"에서 호출 가능으로 전환되는 것. - 오픈 웨이트, 그리고 결정적으로 라이선스(Z.ai 자체 일정으로 ~8월 28일). 보안팀에게 라이선스는 평소보다 더 중요합니다. 격리된 랩 안에서 모델을 돌릴 수 있는지 자체를 결정하기 때문입니다.
- 트리아지 정확도와 오탐률. 실제로 쌓여 있는 보안 리포트와 정적 분석 결과를 넣어 보세요. 벤치마크 점수를 두 배로 올려도 큐를 오탐으로 채우는 모델은 순비용입니다.
- 수정 검증을 위한 익스플로잇 재현. 익스플로잇 능력의 방어적으로 정당한 용도: 보고된 취약점이 실재하는지 확인하고, 패치가 정말 그것을 막았는지 확인하는 것. 소유하거나 테스트 승인을 받은 시스템에서 모델의 재현이 충실한지 측정하세요.
- 리포트 품질. 공개(disclosure) 수준의 보고서 — 영향 버전, 근본 원인, 심각도 논증, 조치 방안 — 를 만들어내는가, 아니면 발견만 던지는가? 대부분의 팀에서 시간은 보고서 작성에 들어갑니다.
- 장시간 지평 거동. Z.ai의 ExploitGym 주장은 정확히 시간 예산이 늘수록 성능이 좋아진다는 내용입니다. 6시간짜리 에이전트 실행에 돈을 내기 전에, 자신의 과제에서 검증하세요.
- 승인 범위의 책임은 모델이 아니라 당신에게 있습니다. 침투 테스트와 취약점 연구에는 테스트 대상 시스템을 구체적으로 포괄하는 명시적 승인이 필요합니다. 모델의 "사이버 방어" 포지셔닝이 이를 대신하지 않습니다.
- 데이터 레지던시와 국경 간 이슈는 자체 평가가 필요합니다. GLM-5.3는 중국에 기반을 둔 제공사의 모델입니다. 보안 민감 코드나 취약점 데이터를 특정 엔드포인트로 라우팅하는 것이 자사 컴플라이언스 태세에 맞는지는 자체 법무·보안 검토가 답할 문제입니다. 웨이트가 공개된 뒤의 자체 호스팅은 이 계산을 바꿉니다 — 라이선스가 지켜봐야 할 사실인 또 하나의 이유입니다.
사이버 향상과 코딩 향상은 같은 이야기다
잘 언급되지 않는 디테일: GLM-5.3는 GLM-5.2와 베이스 모델을 공유하며, Z.ai는 "모든 향상이 포스트 트레이닝에서 나온다"고 명시합니다. 사이버 도약과 코딩 도약(Terminal Bench 3.0: 4.6 → 28.3, 벤더 주장)은 같은 네트워크에 대한 같은 포스트 트레이닝 투자에서 나왔습니다 — Z.ai의 설명은, 익스플로잇 분석이란 결국 적대적 코드 추론이며, 그래서 코딩 중심의 투자에서 사이버 능력이 "창발"했다는 것입니다.
reasoning_effort 컨트롤)도 포함됩니다. HN 스레드에서도 나온 회의적 해석은, 무거운 포스트 트레이닝이 벤치마크 과적합을 부른다는 것입니다. 이 논쟁의 유일한 해법은 독립 평가인데, 그것은 아직 존재하지 않습니다.오늘 실제로 할 수 있는 것
출시 당일 유료 입구는 하나뿐이고, 통합할 API도 없으며, 검증된 EvoLink 라우트도 없습니다 — 각각이 실무에서 무엇을 뜻하는지 정리합니다.
- 구독 접근은 지금 가능합니다. GLM Coding Plan(월 $18부터, 포인트제)은 모든 티어에서 GLM-5.3를 포함합니다 — 출시 당일 유일한 유료 경로입니다. 직접 만져 보기에는 좋지만, 토큰 과금 프로덕션 라우트는 아닙니다.
- 통합할 API는 아직 없습니다. 공개된 토큰 단가도, 확약된 API 일정도 없고, 8월 14일 기준 주요 애그리게이터 어디도 서비스하지 못합니다. 오늘 구축해야 한다면 GLM-5.2가 이 패밀리에서 가동 중이고 가격이 확정된 구성원입니다 — 모델 ID는 설정 가능하게 유지하세요.
- EvoLink는 GLM-5.3 라우트를 검증하지 않았습니다. 저희 입장: 실제 라우트에서 아이덴티티, 요청 거동, 과금, 폴백이 검증되기 전까지 모델은 "이용 가능"이 아닙니다. GLM-5.3는 그 검증 트랙에 올라 있으며, GLM-5.3 상태 페이지가 가용성이 가장 먼저 바뀌는 곳입니다. "검증됨"이 저희에게 무엇을 뜻하는지도 그곳에 적혀 있습니다.
FAQ
GLM-5.3의 사이버 보안 벤치마크는 실제로 무엇을 주장하나요?
Z.ai 자체 수치 기준: CyberGym 84.5(중국어 문서 본문에는 83.5%가 등장 — 두 수치 모두 공식), GLM-5.2는 77.2. ExploitBench는 54.4 대 24.4. 또한 Z.ai는 GLM-5.3가 ExploitGym 챌린지를 2시간에 105개, 6시간에 130개 해결했다고 보고합니다. 모두 출시 당일 기준 독립 재현이 없는 벤더 주장 수치입니다.
GLM-5.3가 보안 연구에 가장 좋은 모델인가요?
오늘은 그런 결론을 내릴 수 없습니다. GLM-5.3에 대한 독립적 보안 평가는 아직 없고, Z.ai 자체 표도 ExploitBench에서 클로즈드 모델이 앞선다고 보여줍니다(Mythos 5 = 78). 말할 수 있는 것: 벤더 수치로는 GLM-5.2 대비 큰 도약이며, 예정된 오픈 웨이트 덕분에 자체 호스팅 평가가 필요한 팀에게 후보가 된다는 것 — 라이선스가 확정되면 말입니다.
GLM-5.3를 해킹에 쓸 수 있나요?
GLM-5.3 웨이트는 왜 연기되었나요?
Z.ai에 따르면 웨이트는 출시 약 2주 뒤(2026년 8월 28일 전후), 안전성 평가와 하드닝을 거쳐 나옵니다 — GLM-5.2의 출시 당일 오픈소스화에서 의도적으로 바꾼 것으로, 동기는 모델의 사이버 능력입니다. 라이선스는 발표되지 않았습니다.
오늘 API로 GLM-5.3를 보안 업무에 쓸 수 있나요?
아니요. 출시 당일에는 공개 가격이 있는 토큰 과금 API가 없습니다 — GLM Coding Plan 구독과 ZCode뿐입니다. Z.ai 가격 페이지에는 GLM-5.3 항목이 없고, BigModel API는 "coming soon"이며, 주요 애그리게이터 어디도 아직 서비스하지 않습니다.
Security Disclosure Ledger란 무엇인가요?
발표에 따르면, Z.ai가 GLM-5.3와 함께 출범시킨 공개 장부로, 모델이 발견한 취약점을 기록합니다 — 모델이 찾은 결함이 사적으로 남지 않고 조율된 공개로 흘러가게 하려는 취지입니다. 방어자에게는 증거 스트림 역할도 합니다. 실제 등재 항목은 어떤 벤치마크 점수보다 강한 능력 증명이 될 것입니다.
GLM-5.3의 CyberGym 점수에 왜 84.5와 83.5가 둘 다 보이나요?
둘 다 Z.ai에서 나왔습니다. 84.5는 발표의 벤치마크 표에, 83.5%는 중국어 문서 본문에 등장합니다. 발행 시점 기준 이 불일치는 설명되지 않았습니다. 저희는 둘 다 인용하며, Z.ai가 정리하면 업데이트하겠습니다.
사이버 능력이 코딩 능력을 희생시키나요?
GLM-5.3는 EvoLink에서 쓸 수 있나요?
Sources
- Z.ai — GLM-5.3 발표: "Frontier Coding with Emergent Cyber Capabilities"
- BigModel — GLM-5.3 모델 문서
- Hacker News — 출시 당일 토론
- Unite.AI — 출시 보도
- EvoLink — GLM-5.3 출시 추적, GLM-5.3 vs GLM-5.2, GLM-5.3 상태 페이지


