GPT Image 2.5 Flare & Sunburst가 EvoLink에 출시되었습니다GPT Image 2.5 체험하기
육각형 표면의 약점을 드러내는 추상적 렌즈 — 방어 목적의 AI 지원 취약점 발견을 상징
model-analysis

GLM-5.3 사이버 보안: 벤치마크가 실제로 주장하는 것

Jessie
Jessie
COO
2026년 8월 14일
업데이트일 2026년 8월 27일
24분 소요
사이버 보안 수치는 GLM-5.3 출시에서 단일 항목으로 가장 큰 능력 도약입니다 — 그리고 그 수치 하나하나가 Z.ai 자체 주장입니다. 벤더 수치 기준으로 GLM-5.3는 CyberGym에서 84.5를 기록해 GLM-5.2의 77.2와 대비됩니다(주의: Z.ai의 중국어 문서 본문에는 **83.5%**로 적혀 있습니다 — 두 개의 공식 수치가 유통되고 있으며, 저희는 둘 다 보고합니다). ExploitBench는 54.4 대 24.4 — 전작의 두 배가 넘습니다. Z.ai는 동시에 이것이 프런티어를 앞서는 것은 아니라는 점도 솔직히 인정합니다. 자체 비교표에서 ExploitBench의 Mythos 5는 78이고, 발표문 역시 클로즈드 모델이 앞서 있음을 인정합니다. 아래 내용 전체를 규정하는 사실이 두 가지 더 있습니다. 첫째, 출시 당일 이 수치들에 대한 독립적 재현은 존재하지 않았습니다. 둘째, 토큰 과금 접근은 그 뒤 열렸습니다 — GLM-5.3는 현재 100만 토큰당 입력 $1.40 / 출력 $4.40으로 등재되어 있고, EvoLink에서 glm-5.3로 사용할 수 있습니다. 덕분에 통제된 방어적 평가가 가능해졌지만, 그렇다고 벤더 주장이 독립적 증거로 바뀌는 것은 아닙니다. 이 글은 주장이 실제로 무엇을 말하는지, 단계적 출시가 왜 중요했는지, 그리고 방어자가 이 모델을 어떻게 평가해야 하는지를 풀어냅니다.
본론에 앞서 적용 범위부터 밝힙니다. 이 글은 방어적이고 승인된 보안 업무 — 수정을 목적으로 한 취약점 발견, 명시적 승인 하의 침투 테스트, 이슈 트리아지, 코드 감사 — 를 위해 쓰였습니다. Z.ai 스스로도 모델을 그렇게 포지셔닝합니다.

"Built to Code. Ready for Cyber Defense." — Z.ai가 주장하는 것

Z.ai가 GLM-5.3에 내건 출시 슬로건은 "Built to Code. Ready for Cyber Defense."입니다 — 프레임은 공격이 아니라 방어이며, 발표 제목부터 사이버 성과를 "창발적(emergent)"이라 부릅니다: "GLM-5.3: Frontier Coding with Emergent Cyber Capabilities". 주장된 수치는 모두 Z.ai 자체 벤치마크 표에서 나온 것입니다.
벤치마크GLM-5.3(벤더 주장)GLM-5.2유의점
CyberGym84.577.2Z.ai 중국어 문서 본문은 83.5% — 두 개의 공식 수치가 존재
ExploitBench54.424.4Z.ai 자체 표에 Mythos 5 = 78; 클로즈드 모델이 앞선다는 점을 Z.ai도 인정
Z.ai는 ExploitGym에서의 시간 스케일링 결과도 보고합니다. 자체 설명에 따르면 GLM-5.3는 2시간 예산 안에 105개, 6시간 안에 130개의 챌린지를 해결했으며, 작업 시간을 늘릴수록 취약점 분석 성능이 계속 향상된다는 증거로 제시됩니다. 위 표와 마찬가지로 출시 당일 기준 제3자 재현이 없는 벤더 보고 수치입니다.

이 숫자들을 읽을 때 붙잡아야 할 세 가지:

  1. 자체 베이스라인 기준의 도약은 실재합니다. 같은 베이스 네트워크를 공유하는 두 모델 사이에서 ExploitBench가 24.4 → 54.4로 움직인 것은 GLM-5.3 발표 전체에서 상대적으로 가장 큰 상승 폭입니다.
  2. 벤더 스스로 1위를 주장하지 않습니다. Z.ai의 표는 익스플로잇 지향 벤치마크에서 클로즈드 모델을 앞에 둡니다. GLM-5.3를 선도적 보안 모델이라 부르는 헤드라인은 Z.ai 자신보다 더 많은 것을 말하는 셈입니다.
  3. CyberGym 불일치는 공개되었을 뿐, 해소되지 않았습니다. 84.5(발표)와 83.5(중국어 문서 본문)는 둘 다 공식 수치입니다. Z.ai가 정리하기 전까지는 쌍으로 인용하세요.
출시 전체 그림 — 접근 채널, API 계약 변경, 사이버 밖의 모든 것 — 은 GLM-5.3 출시 추적을 참고하세요.

왜 이번 출시는 "첫날 오픈소스"가 아닌가

GLM-5.2는 출시 당일 오픈 웨이트로 나왔습니다. GLM-5.3는 의도적으로 그렇게 하지 않았고 — Z.ai는 사이버 능력이 그 이유라고 말합니다. 발표에 따른 단계 계획은 다음과 같습니다.

  • 오픈 웨이트는 약 2주 연기(2026년 8월 28일 전후)되며, 안전성 평가와 하드닝 작업을 거칩니다. 라이선스는 공표되지 않았습니다 — GLM-5.2의 조건이 이어진다고 가정하지 마세요.
  • 토큰 과금 API 접근은 출시 시점에 단계 개방이었습니다. 지금은 가격이 공개되어 호출할 수 있습니다. 반면 오픈 웨이트 일정과 라이선스 조건은 여전히 별개의 문제로 남아 있습니다.
  • 모델과 함께 Security Disclosure Ledger가 출범했습니다 — Z.ai에 따르면 모델이 발견한 취약점을 기록하는 공개 장부로, 발견이 조용한 악용이 아니라 조율된 공개(coordinated disclosure)로 흘러가게 하기 위한 것입니다.
벤치마크 수치를 어떻게 평가하든, 더 무게 있는 신호는 이쪽입니다. 전작을 Hugging Face로 직행시켰던 랩이, 익스플로잇 벤치마크 점수 때문에 이번 버전을 안전성 심사 뒤에 두기로 선택했다는 것. 보안팀에게 이 장부는 모델과 별개로 지켜볼 가치가 있습니다 — GLM-5.3가 정말 실제 취약점을 찾아내고 있다면, 증거가 가장 먼저 드러나는 곳이 거기이기 때문입니다.

보안 개발자들이 주목하는 이유

여기에는 실제 수요라는 배경이 있고, 출시 당일 Hacker News 스레드에서 확인할 수 있습니다. 토론에서 반복되는 주제는 미국 주요 모델 제공사들이 보안 유스케이스를 제한하는 데 대한 불만입니다. 한 HN 댓글 작성자는 직설적으로 이렇게 썼습니다: "American vendors won't let the peasantry use their best models for security work."(미국 벤더들은 서민이 최고 모델을 보안 업무에 쓰게 두지 않는다.) 같은 스레드의 다른 작성자는: "It's not like you will be allowed to use Fable...for anything cybersecurity-related."(어차피 Fable을… 사이버 보안 관련 용도로는 쓰게 해주지 않을 것이다.)
이를 읽는 방식에는 두 가지 단서가 필요합니다. 첫째, 이것들은 커뮤니티 댓글 — 어느 벤더의 실제 정책에 대해서든 검증된 사실이 아니라 정서입니다. 이용 정책에 대한 개인 경험은 제각각이고, 실제 집행은 포럼 인용문 하나보다 훨씬 미묘합니다. 둘째, 그럼에도 정서는 시장 신호입니다. 사이버 능력을 내세우는 오픈 웨이트 모델이, 소외감을 느끼는 보안 실무자들의 관심을 즉시 끄는 이유를 설명해 줍니다. GLM-5.3의 웨이트가 예정대로, 쓸 만한 라이선스와 함께 도착한다면, 방어적 보안팀이 호스팅 API 벤더와 이용 정책 협의 없이 통제된 환경에서 직접 돌릴 수 있는 현세대의 몇 안 되는 모델이 될 것입니다 — 단, Z.ai의 라이선스가 실제로 무엇을 명시할지에 달려 있으며, 그것은 오늘 시점에 미지수입니다.

방어자를 위한 평가 프레임워크

이제 GLM-5.3는 API로 평가할 수 있습니다. 여기서 중요한 것은 여전히 외부 증거가 필요한 것과 승인된 자체 워크로드에서 안전하게 테스트할 수 있는 것을 갈라내는 일입니다.
기다릴 것:
  • 오픈 웨이트, 그리고 결정적으로 라이선스(Z.ai 자체 일정으로 ~8월 28일). 보안팀에게 라이선스는 평소보다 더 중요합니다. 격리된 랩 안에서 모델을 돌릴 수 있는지 자체를 결정하기 때문입니다.
  • 동일 조건의 독립 평가. 벤더 점수는 제3자가 하네스, 데이터셋, 통제 조건을 재현하기 전까지는 가설일 뿐입니다.
테스트할 것 — 승인된 환경에서만:
  • 트리아지 정확도와 오탐률. 실제로 쌓여 있는 보안 리포트와 정적 분석 결과를 넣어 보세요. 벤치마크 점수를 두 배로 올려도 큐를 오탐으로 채우는 모델은 순비용입니다.
  • 수정 검증을 위한 익스플로잇 재현. 익스플로잇 능력의 방어적으로 정당한 용도: 보고된 취약점이 실재하는지 확인하고, 패치가 정말 그것을 막았는지 확인하는 것. 소유하거나 테스트 승인을 받은 시스템에서 모델의 재현이 충실한지 측정하세요.
  • 리포트 품질. 공개(disclosure) 수준의 보고서 — 영향 버전, 근본 원인, 심각도 논증, 조치 방안 — 를 만들어내는가, 아니면 발견만 던지는가? 대부분의 팀에서 시간은 보고서 작성에 들어갑니다.
  • 장시간 지평 거동. Z.ai의 ExploitGym 주장은 정확히 시간 예산이 늘수록 성능이 좋아진다는 내용입니다. 6시간짜리 에이전트 실행에 돈을 내기 전에, 자신의 과제에서 검증하세요.
컴플라이언스 유의사항 — 결론이 아니라 플래그입니다. 관할권과 조직에 따라 달라지기 때문입니다.
  • 승인 범위의 책임은 모델이 아니라 당신에게 있습니다. 침투 테스트와 취약점 연구에는 테스트 대상 시스템을 구체적으로 포괄하는 명시적 승인이 필요합니다. 모델의 "사이버 방어" 포지셔닝이 이를 대신하지 않습니다.
  • 데이터 레지던시와 국경 간 이슈는 자체 평가가 필요합니다. GLM-5.3는 중국에 기반을 둔 제공사의 모델입니다. 보안 민감 코드나 취약점 데이터를 특정 엔드포인트로 라우팅하는 것이 자사 컴플라이언스 태세에 맞는지는 자체 법무·보안 검토가 답할 문제입니다. 웨이트가 공개된 뒤의 자체 호스팅은 이 계산을 바꿉니다 — 라이선스가 지켜봐야 할 사실인 또 하나의 이유입니다.

사이버 향상과 코딩 향상은 같은 이야기다

잘 언급되지 않는 디테일: GLM-5.3는 GLM-5.2와 베이스 모델을 공유하며, Z.ai는 "모든 향상이 포스트 트레이닝에서 나온다"고 명시합니다. 사이버 도약과 코딩 도약(Terminal Bench 3.0: 4.6 → 28.3, 벤더 주장)은 같은 네트워크에 대한 같은 포스트 트레이닝 투자에서 나왔습니다 — Z.ai의 설명은, 익스플로잇 분석이란 결국 적대적 코드 추론이며, 그래서 코딩 중심의 투자에서 사이버 능력이 "창발"했다는 것입니다.

평가에 대한 실무적 함의: 여기서의 사이버 능력은 따로 떼어 도입할 수 있는 별도 파인튜닝 SKU가 아닙니다. 당신이 받게 되는 — 그리고 테스트해야 하는 — 것은 포스트 트레이닝된 모델 전체이며, GLM-5.2 대비 브레이킹 API 변경(상시 켜진 thinking, 새 reasoning_effort 컨트롤)도 포함됩니다. HN 스레드에서도 나온 회의적 해석은, 무거운 포스트 트레이닝이 벤치마크 과적합을 부른다는 것입니다. 독립 평가가 나오면 참고하되, 실무적인 답은 여러분이 통제하는 리플레이 스위트에서 찾으세요.

오늘 API로 할 수 있는 것

현재 API 상태는 대기 계획이 아니라 실제 평가를 지원합니다.

  • 범위가 제한되고 승인된 데이터셋을 사용하세요. 팀이 소유하고 테스트가 명시적으로 허용된 과거 발견 사항이나 격리된 실험실 대상부터 시작하세요.
  • 모델 ID glm-5.3를 호출하세요. EvoLink GLM-5.3 페이지에서 현재 가격, 코드, 100만 토큰 컨텍스트와 지원되는 두 가지 API 프로토콜을 확인할 수 있습니다.
  • 전체 의사결정 경로를 기록하세요. Prompt 버전, 추론 수준, Token, 도구 호출, 오탐, 검토 결과와 수정 유용성을 저장하세요.
  • 사람의 승인 단계를 유지하세요. 생성된 보안 작업이 승인 범위를 벗어나지 않게 하고, 출력은 검토 하의 분류, 재현 및 수정 검증에만 사용하세요.

FAQ

GLM-5.3의 사이버 보안 벤치마크는 실제로 무엇을 주장하나요?

Z.ai 자체 수치 기준: CyberGym 84.5(중국어 문서 본문에는 83.5%가 등장 — 두 수치 모두 공식), GLM-5.2는 77.2. ExploitBench는 54.4 대 24.4. 또한 Z.ai는 GLM-5.3가 ExploitGym 챌린지를 2시간에 105개, 6시간에 130개 해결했다고 보고합니다. 모두 출시 당일 기준 독립 재현이 없는 벤더 주장 수치입니다.

GLM-5.3가 보안 연구에 가장 좋은 모델인가요?

오늘은 그런 결론을 내릴 수 없습니다. GLM-5.3에 대한 독립적 보안 평가는 아직 없고, Z.ai 자체 표도 ExploitBench에서 클로즈드 모델이 앞선다고 보여줍니다(Mythos 5 = 78). 말할 수 있는 것: 벤더 수치로는 GLM-5.2 대비 큰 도약이며, 예정된 오픈 웨이트 덕분에 자체 호스팅 평가가 필요한 팀에게 후보가 된다는 것 — 라이선스가 확정되면 말입니다.

GLM-5.3를 해킹에 쓸 수 있나요?

Z.ai는 GLM-5.3를 사이버 방어용으로 포지셔닝했고, 출시 구조도 그에 맞춰 설계했습니다. 접근은 단계적으로 열렸고, 모델과 함께 공개 Security Disclosure Ledger가 출범해 발견을 조율된 공개로 유도합니다. 그러나 이것이 사용자 자신의 의무를 바꾸지는 않습니다 — 취약점 연구와 침투 테스트는 해당 시스템에 대한 명시적 승인이 있을 때만 합법이며, 오용의 책임은 도구가 아니라 운영자에게 있습니다. 이 글은 승인된 방어적 용도만 다룹니다.

GLM-5.3 웨이트는 왜 연기되었나요?

Z.ai에 따르면 웨이트는 출시 약 2주 뒤(2026년 8월 28일 전후), 안전성 평가와 하드닝을 거쳐 나옵니다 — GLM-5.2의 출시 당일 오픈소스화에서 의도적으로 바꾼 것으로, 동기는 모델의 사이버 능력입니다. 라이선스는 발표되지 않았습니다.

오늘 API로 GLM-5.3를 보안 업무에 쓸 수 있나요?

네, 승인된 방어적 평가라면 가능합니다. 모델 ID는 glm-5.3이고, 공식 단가는 100만 토큰당 입력 $1.40, 캐시 입력 $0.26, 출력 $4.40입니다. 현재 라우트 가격과 코드는 EvoLink 모델 페이지에 있습니다.

Security Disclosure Ledger란 무엇인가요?

발표에 따르면, Z.ai가 GLM-5.3와 함께 출범시킨 공개 장부로, 모델이 발견한 취약점을 기록합니다 — 모델이 찾은 결함이 사적으로 남지 않고 조율된 공개로 흘러가게 하려는 취지입니다. 방어자에게는 증거 스트림 역할도 합니다. 실제 등재 항목은 어떤 벤치마크 점수보다 강한 능력 증명이 될 것입니다.

GLM-5.3의 CyberGym 점수에 왜 84.5와 83.5가 둘 다 보이나요?

둘 다 Z.ai에서 나왔습니다. 84.5는 발표의 벤치마크 표에, 83.5%는 중국어 문서 본문에 등장합니다. 발행 시점 기준 이 불일치는 설명되지 않았습니다. 저희는 둘 다 인용하며, Z.ai가 정리하면 업데이트하겠습니다.

사이버 능력이 코딩 능력을 희생시키나요?

벤더의 설명에 따르면 아닙니다 — 오히려 반대입니다. GLM-5.3는 GLM-5.2의 베이스를 공유하고, 모든 향상은 포스트 트레이닝에서 나오며, Z.ai는 사이버 성과를 코딩 중심 투자에서 창발한 것으로 설명합니다. 표에서 코딩과 사이버 수치는 함께 올랐습니다. 둘 다 벤치마크 밖에서 유지되는지는 독립 테스트를 기다려야 합니다. 코딩 쪽 상세는 GLM-5.3 vs GLM-5.2 비교에서 다룹니다.

GLM-5.3는 EvoLink에서 쓸 수 있나요?

네. EvoLink는 통합 API를 통해 모델 ID glm-5.3를 제공합니다. 현재 가격, 프로토콜과 마이그레이션 점검 사항은 GLM-5.3 모델 페이지에서 확인하세요. 라우트가 사용 가능하더라도 자체 승인 및 수용 기준은 계속 필요합니다.

Sources


공개: 커버 이미지는 Nano Banana Pro로 생성한 일러스트이며 GLM-5.3의 모델 출력이 아닙니다. 이 글의 벤치마크 수치는 모두 벤더(Z.ai) 보고 수치로, 출시 당일 기준 독립 재현이 없습니다. 사실 관계는 2026년 8월 26일에 마지막으로 검토했습니다. 커뮤니티 인용문은 출처를 명시한 Hacker News 사용자 댓글로, 검증된 사실이 아닌 정서를 반영합니다. 이 글은 승인된 방어적 보안 용도만 다루며, 익스플로잇 방법 설명을 일절 포함하지 않습니다.

AI 비용을 89% 절감할 준비가 되셨나요?

오늘 EvoLink를 시작하고 지능형 API 라우팅의 힘을 경험해보세요.