Seedance 2.5가 EvoLink에 출시되었습니다Seedance 2.5 체험하기
육각형 표면의 약점을 드러내는 추상적 렌즈 — 방어 목적의 AI 지원 취약점 발견을 상징
model-analysis

GLM-5.3 사이버 보안 능력: 공식 벤치마크가 실제로 말하는 것

Jessie
Jessie
COO
2026년 8월 14일
25분 소요
사이버 보안 수치는 GLM-5.3 출시에서 단일 항목으로 가장 큰 능력 도약입니다 — 그리고 그 수치 하나하나가 Z.ai 자체 주장입니다. 벤더 수치 기준으로 GLM-5.3는 CyberGym에서 84.5를 기록해 GLM-5.2의 77.2와 대비됩니다(주의: Z.ai의 중국어 문서 본문에는 **83.5%**로 적혀 있습니다 — 두 개의 공식 수치가 유통되고 있으며, 저희는 둘 다 보고합니다). ExploitBench는 54.4 대 24.4 — 전작의 두 배가 넘습니다. Z.ai는 동시에 이것이 프런티어를 앞서는 것은 아니라는 점도 솔직히 인정합니다. 자체 비교표에서 ExploitBench의 Mythos 5는 78이고, 발표문 역시 클로즈드 모델이 앞서 있음을 인정합니다. 아래 내용 전체를 규정하는 사실이 두 가지 더 있습니다. 출시 당일 이 수치들에 대한 독립적 재현은 존재하지 않았고, 오늘 토큰 과금 API로 GLM-5.3를 호출할 수 없습니다 — 접근은 의도적으로 안전성 심사 뒤에 단계 배치되어 있습니다. 이 글은 주장이 실제로 무엇을 말하는지, 단계적 출시가 왜 중요한지, 그리고 실제 접근이 열린 뒤 방어자가 이 모델을 어떻게 평가해야 하는지를 풀어냅니다.
본론에 앞서 적용 범위부터 밝힙니다. 이 글은 방어적이고 승인된 보안 업무 — 수정을 목적으로 한 취약점 발견, 명시적 승인 하의 침투 테스트, 이슈 트리아지, 코드 감사 — 를 위해 쓰였습니다. Z.ai 스스로도 모델을 그렇게 포지셔닝합니다.

"Built to Code. Ready for Cyber Defense." — Z.ai가 주장하는 것

Z.ai가 GLM-5.3에 내건 출시 슬로건은 "Built to Code. Ready for Cyber Defense."입니다 — 프레임은 공격이 아니라 방어이며, 발표 제목부터 사이버 성과를 "창발적(emergent)"이라 부릅니다: "GLM-5.3: Frontier Coding with Emergent Cyber Capabilities". 주장된 수치는 모두 Z.ai 자체 벤치마크 표에서 나온 것입니다.
벤치마크GLM-5.3(벤더 주장)GLM-5.2유의점
CyberGym84.577.2Z.ai 중국어 문서 본문은 83.5% — 두 개의 공식 수치가 존재
ExploitBench54.424.4Z.ai 자체 표에 Mythos 5 = 78; 클로즈드 모델이 앞선다는 점을 Z.ai도 인정
Z.ai는 ExploitGym에서의 시간 스케일링 결과도 보고합니다. 자체 설명에 따르면 GLM-5.3는 2시간 예산 안에 105개, 6시간 안에 130개의 챌린지를 해결했으며, 작업 시간을 늘릴수록 취약점 분석 성능이 계속 향상된다는 증거로 제시됩니다. 위 표와 마찬가지로 출시 당일 기준 제3자 재현이 없는 벤더 보고 수치입니다.

이 숫자들을 읽을 때 붙잡아야 할 세 가지:

  1. 자체 베이스라인 기준의 도약은 실재합니다. 같은 베이스 네트워크를 공유하는 두 모델 사이에서 ExploitBench가 24.4 → 54.4로 움직인 것은 GLM-5.3 발표 전체에서 상대적으로 가장 큰 상승 폭입니다.
  2. 벤더 스스로 1위를 주장하지 않습니다. Z.ai의 표는 익스플로잇 지향 벤치마크에서 클로즈드 모델을 앞에 둡니다. GLM-5.3를 선도적 보안 모델이라 부르는 헤드라인은 Z.ai 자신보다 더 많은 것을 말하는 셈입니다.
  3. CyberGym 불일치는 공개되었을 뿐, 해소되지 않았습니다. 84.5(발표)와 83.5(중국어 문서 본문)는 둘 다 공식 수치입니다. Z.ai가 정리하기 전까지는 쌍으로 인용하세요.
출시 전체 그림 — 접근 채널, API 계약 변경, 사이버 밖의 모든 것 — 은 GLM-5.3 출시 추적을 참고하세요.

왜 이번 출시는 "첫날 오픈소스"가 아닌가

GLM-5.2는 출시 당일 오픈 웨이트로 나왔습니다. GLM-5.3는 의도적으로 그렇게 하지 않았고 — Z.ai는 사이버 능력이 그 이유라고 말합니다. 발표에 따른 단계 계획은 다음과 같습니다.

  • 오픈 웨이트는 약 2주 연기(2026년 8월 28일 전후)되며, 안전성 평가와 하드닝 작업을 거칩니다. 라이선스는 공표되지 않았습니다 — GLM-5.2의 조건이 이어진다고 가정하지 마세요.
  • 토큰 과금 API 접근도 단계 개방입니다. 출시 당일 유일한 유료 경로는 GLM Coding Plan 구독이며, Z.ai 국제 가격 페이지에는 GLM-5.3 항목이 없고 BigModel(중국) API는 "coming soon"으로 표시되어 있습니다.
  • 모델과 함께 Security Disclosure Ledger가 출범했습니다 — Z.ai에 따르면 모델이 발견한 취약점을 기록하는 공개 장부로, 발견이 조용한 악용이 아니라 조율된 공개(coordinated disclosure)로 흘러가게 하기 위한 것입니다.
벤치마크 수치를 어떻게 평가하든, 더 무게 있는 신호는 이쪽입니다. 전작을 Hugging Face로 직행시켰던 랩이, 익스플로잇 벤치마크 점수 때문에 이번 버전을 안전성 심사 뒤에 두기로 선택했다는 것. 보안팀에게 이 장부는 모델과 별개로 지켜볼 가치가 있습니다 — GLM-5.3가 정말 실제 취약점을 찾아내고 있다면, 증거가 가장 먼저 드러나는 곳이 거기이기 때문입니다.

보안 개발자들이 주목하는 이유

여기에는 실제 수요라는 배경이 있고, 출시 당일 Hacker News 스레드에서 확인할 수 있습니다. 토론에서 반복되는 주제는 미국 주요 모델 제공사들이 보안 유스케이스를 제한하는 데 대한 불만입니다. 한 HN 댓글 작성자는 직설적으로 이렇게 썼습니다: "American vendors won't let the peasantry use their best models for security work."(미국 벤더들은 서민이 최고 모델을 보안 업무에 쓰게 두지 않는다.) 같은 스레드의 다른 작성자는: "It's not like you will be allowed to use Fable...for anything cybersecurity-related."(어차피 Fable을… 사이버 보안 관련 용도로는 쓰게 해주지 않을 것이다.)
이를 읽는 방식에는 두 가지 단서가 필요합니다. 첫째, 이것들은 커뮤니티 댓글 — 어느 벤더의 실제 정책에 대해서든 검증된 사실이 아니라 정서입니다. 이용 정책에 대한 개인 경험은 제각각이고, 실제 집행은 포럼 인용문 하나보다 훨씬 미묘합니다. 둘째, 그럼에도 정서는 시장 신호입니다. 사이버 능력을 내세우는 오픈 웨이트 모델이, 소외감을 느끼는 보안 실무자들의 관심을 즉시 끄는 이유를 설명해 줍니다. GLM-5.3의 웨이트가 예정대로, 쓸 만한 라이선스와 함께 도착한다면, 방어적 보안팀이 호스팅 API 벤더와 이용 정책 협의 없이 통제된 환경에서 직접 돌릴 수 있는 현세대의 몇 안 되는 모델이 될 것입니다 — 단, Z.ai의 라이선스가 실제로 무엇을 명시할지에 달려 있으며, 그것은 오늘 시점에 미지수입니다.

방어자를 위한 평가 프레임워크

오늘은 GLM-5.3를 보안 업무용으로 평가할 수 없습니다. 호출 자체가 불가능하기 때문입니다. 할 수 있는 일은 무엇을 기다릴지, 그리고 접근이 열리면 무엇을 테스트할지 미리 정해 두는 것입니다.
기다릴 것:
  • 공개된 약관이 있는 토큰 과금 API 엔드포인트 — Z.ai 가격 페이지에 glm-5.3 항목이 추가되거나, BigModel API가 "coming soon"에서 호출 가능으로 전환되는 것.
  • 오픈 웨이트, 그리고 결정적으로 라이선스(Z.ai 자체 일정으로 ~8월 28일). 보안팀에게 라이선스는 평소보다 더 중요합니다. 격리된 랩 안에서 모델을 돌릴 수 있는지 자체를 결정하기 때문입니다.
테스트할 것 — 승인된 환경에서만:
  • 트리아지 정확도와 오탐률. 실제로 쌓여 있는 보안 리포트와 정적 분석 결과를 넣어 보세요. 벤치마크 점수를 두 배로 올려도 큐를 오탐으로 채우는 모델은 순비용입니다.
  • 수정 검증을 위한 익스플로잇 재현. 익스플로잇 능력의 방어적으로 정당한 용도: 보고된 취약점이 실재하는지 확인하고, 패치가 정말 그것을 막았는지 확인하는 것. 소유하거나 테스트 승인을 받은 시스템에서 모델의 재현이 충실한지 측정하세요.
  • 리포트 품질. 공개(disclosure) 수준의 보고서 — 영향 버전, 근본 원인, 심각도 논증, 조치 방안 — 를 만들어내는가, 아니면 발견만 던지는가? 대부분의 팀에서 시간은 보고서 작성에 들어갑니다.
  • 장시간 지평 거동. Z.ai의 ExploitGym 주장은 정확히 시간 예산이 늘수록 성능이 좋아진다는 내용입니다. 6시간짜리 에이전트 실행에 돈을 내기 전에, 자신의 과제에서 검증하세요.
컴플라이언스 유의사항 — 결론이 아니라 플래그입니다. 관할권과 조직에 따라 달라지기 때문입니다.
  • 승인 범위의 책임은 모델이 아니라 당신에게 있습니다. 침투 테스트와 취약점 연구에는 테스트 대상 시스템을 구체적으로 포괄하는 명시적 승인이 필요합니다. 모델의 "사이버 방어" 포지셔닝이 이를 대신하지 않습니다.
  • 데이터 레지던시와 국경 간 이슈는 자체 평가가 필요합니다. GLM-5.3는 중국에 기반을 둔 제공사의 모델입니다. 보안 민감 코드나 취약점 데이터를 특정 엔드포인트로 라우팅하는 것이 자사 컴플라이언스 태세에 맞는지는 자체 법무·보안 검토가 답할 문제입니다. 웨이트가 공개된 뒤의 자체 호스팅은 이 계산을 바꿉니다 — 라이선스가 지켜봐야 할 사실인 또 하나의 이유입니다.

사이버 향상과 코딩 향상은 같은 이야기다

잘 언급되지 않는 디테일: GLM-5.3는 GLM-5.2와 베이스 모델을 공유하며, Z.ai는 "모든 향상이 포스트 트레이닝에서 나온다"고 명시합니다. 사이버 도약과 코딩 도약(Terminal Bench 3.0: 4.6 → 28.3, 벤더 주장)은 같은 네트워크에 대한 같은 포스트 트레이닝 투자에서 나왔습니다 — Z.ai의 설명은, 익스플로잇 분석이란 결국 적대적 코드 추론이며, 그래서 코딩 중심의 투자에서 사이버 능력이 "창발"했다는 것입니다.

평가에 대한 실무적 함의: 여기서의 사이버 능력은 따로 떼어 도입할 수 있는 별도 파인튜닝 SKU가 아닙니다. 당신이 받게 되는 — 그리고 테스트해야 하는 — 것은 포스트 트레이닝된 모델 전체이며, GLM-5.2 대비 브레이킹 API 변경(상시 켜진 thinking, 새 reasoning_effort 컨트롤)도 포함됩니다. HN 스레드에서도 나온 회의적 해석은, 무거운 포스트 트레이닝이 벤치마크 과적합을 부른다는 것입니다. 이 논쟁의 유일한 해법은 독립 평가인데, 그것은 아직 존재하지 않습니다.

오늘 실제로 할 수 있는 것

출시 당일 유료 입구는 하나뿐이고, 통합할 API도 없으며, 검증된 EvoLink 라우트도 없습니다 — 각각이 실무에서 무엇을 뜻하는지 정리합니다.

  • 구독 접근은 지금 가능합니다. GLM Coding Plan(월 $18부터, 포인트제)은 모든 티어에서 GLM-5.3를 포함합니다 — 출시 당일 유일한 유료 경로입니다. 직접 만져 보기에는 좋지만, 토큰 과금 프로덕션 라우트는 아닙니다.
  • 통합할 API는 아직 없습니다. 공개된 토큰 단가도, 확약된 API 일정도 없고, 8월 14일 기준 주요 애그리게이터 어디도 서비스하지 못합니다. 오늘 구축해야 한다면 GLM-5.2가 이 패밀리에서 가동 중이고 가격이 확정된 구성원입니다 — 모델 ID는 설정 가능하게 유지하세요.
  • EvoLink는 GLM-5.3 라우트를 검증하지 않았습니다. 저희 입장: 실제 라우트에서 아이덴티티, 요청 거동, 과금, 폴백이 검증되기 전까지 모델은 "이용 가능"이 아닙니다. GLM-5.3는 그 검증 트랙에 올라 있으며, GLM-5.3 상태 페이지가 가용성이 가장 먼저 바뀌는 곳입니다. "검증됨"이 저희에게 무엇을 뜻하는지도 그곳에 적혀 있습니다.

FAQ

GLM-5.3의 사이버 보안 벤치마크는 실제로 무엇을 주장하나요?

Z.ai 자체 수치 기준: CyberGym 84.5(중국어 문서 본문에는 83.5%가 등장 — 두 수치 모두 공식), GLM-5.2는 77.2. ExploitBench는 54.4 대 24.4. 또한 Z.ai는 GLM-5.3가 ExploitGym 챌린지를 2시간에 105개, 6시간에 130개 해결했다고 보고합니다. 모두 출시 당일 기준 독립 재현이 없는 벤더 주장 수치입니다.

GLM-5.3가 보안 연구에 가장 좋은 모델인가요?

오늘은 그런 결론을 내릴 수 없습니다. GLM-5.3에 대한 독립적 보안 평가는 아직 없고, Z.ai 자체 표도 ExploitBench에서 클로즈드 모델이 앞선다고 보여줍니다(Mythos 5 = 78). 말할 수 있는 것: 벤더 수치로는 GLM-5.2 대비 큰 도약이며, 예정된 오픈 웨이트 덕분에 자체 호스팅 평가가 필요한 팀에게 후보가 된다는 것 — 라이선스가 확정되면 말입니다.

GLM-5.3를 해킹에 쓸 수 있나요?

Z.ai는 GLM-5.3를 사이버 방어용으로 포지셔닝했고, 출시 구조도 그에 맞춰 설계했습니다. API와 웨이트는 안전성 심사 뒤에 있고, 모델과 함께 공개 Security Disclosure Ledger가 출범해 발견을 조율된 공개로 유도합니다. 그러나 이것이 사용자 자신의 의무를 바꾸지는 않습니다 — 취약점 연구와 침투 테스트는 해당 시스템에 대한 명시적 승인이 있을 때만 합법이며, 오용의 책임은 도구가 아니라 운영자에게 있습니다. 이 글은 승인된 방어적 용도만 다룹니다.

GLM-5.3 웨이트는 왜 연기되었나요?

Z.ai에 따르면 웨이트는 출시 약 2주 뒤(2026년 8월 28일 전후), 안전성 평가와 하드닝을 거쳐 나옵니다 — GLM-5.2의 출시 당일 오픈소스화에서 의도적으로 바꾼 것으로, 동기는 모델의 사이버 능력입니다. 라이선스는 발표되지 않았습니다.

오늘 API로 GLM-5.3를 보안 업무에 쓸 수 있나요?

아니요. 출시 당일에는 공개 가격이 있는 토큰 과금 API가 없습니다 — GLM Coding Plan 구독과 ZCode뿐입니다. Z.ai 가격 페이지에는 GLM-5.3 항목이 없고, BigModel API는 "coming soon"이며, 주요 애그리게이터 어디도 아직 서비스하지 않습니다.

Security Disclosure Ledger란 무엇인가요?

발표에 따르면, Z.ai가 GLM-5.3와 함께 출범시킨 공개 장부로, 모델이 발견한 취약점을 기록합니다 — 모델이 찾은 결함이 사적으로 남지 않고 조율된 공개로 흘러가게 하려는 취지입니다. 방어자에게는 증거 스트림 역할도 합니다. 실제 등재 항목은 어떤 벤치마크 점수보다 강한 능력 증명이 될 것입니다.

GLM-5.3의 CyberGym 점수에 왜 84.5와 83.5가 둘 다 보이나요?

둘 다 Z.ai에서 나왔습니다. 84.5는 발표의 벤치마크 표에, 83.5%는 중국어 문서 본문에 등장합니다. 발행 시점 기준 이 불일치는 설명되지 않았습니다. 저희는 둘 다 인용하며, Z.ai가 정리하면 업데이트하겠습니다.

사이버 능력이 코딩 능력을 희생시키나요?

벤더의 설명에 따르면 아닙니다 — 오히려 반대입니다. GLM-5.3는 GLM-5.2의 베이스를 공유하고, 모든 향상은 포스트 트레이닝에서 나오며, Z.ai는 사이버 성과를 코딩 중심 투자에서 창발한 것으로 설명합니다. 표에서 코딩과 사이버 수치는 함께 올랐습니다. 둘 다 벤치마크 밖에서 유지되는지는 독립 테스트를 기다려야 합니다. 코딩 쪽 상세는 GLM-5.3 vs GLM-5.2 비교에서 다룹니다.

GLM-5.3는 EvoLink에서 쓸 수 있나요?

아직입니다. GLM-5.3는 EvoLink의 라우트 검증(아이덴티티, 과금 요청, 스트리밍·툴 테스트)을 통과하지 않았고, 검증은 Z.ai가 토큰 과금 API를 열어야 시작할 수 있습니다. GLM-5.3 상태 페이지를 지켜보세요 — 가용성 변화는 그곳에 가장 먼저 반영됩니다. 그동안은 GLM-5.2가 이 패밀리의 가동 중이고 가격 확정된 옵션입니다.

Sources


공개: 커버 이미지는 Nano Banana Pro로 생성한 일러스트이며 GLM-5.3의 모델 출력이 아닙니다. 이 글의 벤치마크 수치는 모두 벤더(Z.ai) 보고 수치로, 2026년 8월 14일 기준 독립 재현이 없습니다. 커뮤니티 인용문은 출처를 명시한 Hacker News 사용자 댓글로, 검증된 사실이 아닌 정서를 반영합니다. 이 글은 승인된 방어적 보안 용도만 다루며, 익스플로잇 방법 설명을 일절 포함하지 않습니다.

AI 비용을 89% 절감할 준비가 되셨나요?

오늘 EvoLink를 시작하고 지능형 API 라우팅의 힘을 경험해보세요.