
GLM-5.3 のサイバーセキュリティ能力:ベンチマークは何を主張しているのか
glm-5.3 として利用できます。これで管理された防御的評価は実行可能になりましたが、それでベンダーの主張が独立した証拠に変わるわけではありません。本記事では、主張が実際に何を述べているのか、段階的リリースがなぜ重要だったのか、そして防御側がこのモデルをどう評価すべきかを解きほぐします。「Built to Code. Ready for Cyber Defense.」——Z.ai は何を主張しているか
| ベンチマーク | GLM-5.3(ベンダー申告) | GLM-5.2 | 留意点 |
|---|---|---|---|
| CyberGym | 84.5 | 77.2 | Z.ai の中国語ドキュメント本文は 83.5% と記載——2 つの公式数字が存在 |
| ExploitBench | 54.4 | 24.4 | Z.ai 自身の表で Mythos 5 = 78;クローズドモデルの先行を Z.ai も認める |
これらの数字を読む際に押さえておくべき点は 3 つあります。
- 自社ベースライン比のジャンプは本物。 同じベースネットワークを共有する 2 モデル間で ExploitBench が 24.4 → 54.4 に動いたのは、GLM-5.3 発表全体で相対的に最大の伸びです。
- ベンダー自身は首位を主張していない。 Z.ai の表は、エクスプロイト系ベンチマークでクローズドモデルを上位に置いています。GLM-5.3 を「セキュリティ最有力モデル」と呼ぶ見出しは、Z.ai 自身より多くを語っています。
- CyberGym の食い違いは開示されただけで、解消されていない。 84.5(発表)と 83.5(中国語ドキュメント本文)はどちらも公式数字です。Z.ai が整合させるまでは、両方を併記して引用すべきです。
なぜ今回は「初日オープンソース」ではないのか
GLM-5.2 はリリース当日にオープンウェイトで出荷されました。GLM-5.3 は意図的にそうしていません——そして Z.ai は、その理由がサイバー能力だと述べています。発表による段階計画は次のとおりです。
- オープンウェイトは約 2 週間延期(2026 年 8 月 28 日前後)。安全性評価と堅牢化の工程を経てからの公開です。ライセンスは未発表——GLM-5.2 の条件が引き継がれると想定しないでください。
- トークン課金 API はローンチ時点では段階公開でした。 現在は料金が公開され、呼び出せる状態です。一方で、オープンウェイトの時期とライセンス条件は別の問題として残っています。
- モデルと同時に Security Disclosure Ledger が始動。 Z.ai によれば、モデルが発見した脆弱性を記録する公開台帳で、発見が静かな悪用ではなく協調的開示に流れるようにするためのものです。
セキュリティ開発者が注目している理由
防御側の評価フレームワーク
- オープンウェイトと、決定的に重要なライセンス(Z.ai 自身のタイムラインで 8 月 28 日ごろ)。セキュリティチームにとってライセンスは通常以上に重要です。隔離ラボ内でモデルを動かせるかどうか自体を左右します。
- 独立した同一条件の評価。 ベンダーのスコアは、第三者がハーネス・データセット・統制条件を再現するまでは仮説にとどまります。
- トリアージ精度と誤検知率。 実際に積み上がっているセキュリティ報告と静的解析結果を投入する。ベンチマークスコアを倍にしても、キューを誤検知で溢れさせるモデルは正味コストです。
- 修正検証のためのエクスプロイト再現。 エクスプロイト能力の防御的に正当な使い道:報告された脆弱性が実在することの確認、パッチが本当にそれを塞いだことの確認。自組織が所有するか、テスト許可を得たシステム上で、モデルの再現が忠実かを測定します。
- レポート品質。 開示水準の報告書——影響バージョン、根本原因、深刻度の根拠、修正方法——を出せるのか、それとも発見だけか。多くのチームでは工数はレポート執筆に消えます。
- 長時間ホライズンの挙動。 Z.ai の ExploitGym の主張は、まさに時間予算に応じた性能向上についてのものです。6 時間のエージェント実行に費用を払う前に、自分のタスクで検証してください。
- 授権範囲の責任はあなたにあり、モデルにはありません。 ペネトレーションテストと脆弱性研究には、テスト対象システムを具体的にカバーする明示的な承認が必要です。モデルの「サイバー防御」ポジショニングはその代わりになりません。
- データ所在地と越境の論点は自組織で評価が必要。 GLM-5.3 は中国拠点のプロバイダーのモデルです。セキュリティ上センシティブなコードや脆弱性データを特定のエンドポイントに流すことが自社のコンプライアンス姿勢に適合するかは、自社の法務・セキュリティ審査が答えるべき問いです。ウェイト公開後のセルフホストはこの計算を変えます——ライセンスが注視すべき事実であるもう一つの理由です。
サイバーの伸びとコーディングの伸びは同じ物語
見過ごされがちなディテール:GLM-5.3 は GLM-5.2 とベースモデルを共有し、Z.ai は「すべての向上はポストトレーニング由来」と明言しています。サイバーのジャンプとコーディングのジャンプ(Terminal Bench 3.0:4.6 → 28.3、ベンダー申告)は、同じネットワークへの同じポストトレーニング投資から来ています——Z.ai の説明は、エクスプロイト分析は突き詰めれば敵対的なコード推論であり、だからコーディング特化の取り組みからサイバー能力が「創発」した、というものです。
reasoning_effort 制御)も含みます。HN スレッドでも出た懐疑的な読みは、重いポストトレーニングはベンチマーク過適合を招きやすいというもの。独立評価が出たら参照し、実務上の答えとしては自分の管理下にあるリプレイスイートを使ってください。今日 API でできること
現在の API は、待機計画ではなく実際の評価に使える状態です。
- 範囲を限定した、許可済みのデータセットを使う。 チームが所有し、テストを明示的に許可された過去の検出結果や隔離済みラボ環境から始めてください。
- モデル ID
glm-5.3を呼び出す。 EvoLink の GLM-5.3 ページで、現在の料金、コード、100 万トークンのコンテキスト、対応する 2 種類の API プロトコルを確認できます。 - 判断経路全体を記録する。 Prompt のバージョン、推論レベル、Token、ツール呼び出し、誤検知、レビュー結果、修正への有用性を保存してください。
- 人間の承認ゲートを維持する。 生成されたセキュリティ操作を許可範囲の外へ到達させず、出力はレビュー下でのトリアージ、再現、修正確認に限定してください。
FAQ
GLM-5.3 のサイバーセキュリティベンチマークは実際に何を主張している?
Z.ai 自身の数字では:CyberGym 84.5(中国語ドキュメント本文には 83.5% が登場——どちらも公式数字)、GLM-5.2 は 77.2。ExploitBench は 54.4 対 24.4。さらに Z.ai は、GLM-5.3 が ExploitGym の課題を 2 時間で 105 問、6 時間で 130 問解いたと報告しています。いずれもリリース当日時点で独立再現のないベンダー申告値です。
GLM-5.3 はセキュリティリサーチに最適なモデル?
今日その結論は導けません。GLM-5.3 の独立したセキュリティ評価はまだ存在せず、Z.ai 自身の表も ExploitBench でクローズドモデルの先行を示しています(Mythos 5 = 78)。言えるのは:ベンダー数字では GLM-5.2 からの大幅な伸びであること、そして計画中のオープンウェイトにより、セルフホスト評価が必要なチームの候補になり得ること——ライセンス次第ですが。
GLM-5.3 はハッキングに使える?
GLM-5.3 のウェイトはなぜ延期された?
Z.ai によれば、ウェイトはローンチの約 2 週間後(2026 年 8 月 28 日前後)、安全性評価と堅牢化を経て出荷されます——GLM-5.2 の当日オープンソース化からの意図的な変更で、動機はモデルのサイバー能力です。ライセンスは未発表です。
今日、API 経由で GLM-5.3 をセキュリティ業務に使える?
glm-5.3、公式単価は 100万トークンあたり入力 $1.40、キャッシュ入力 $0.26、出力 $4.40 です。現在のルート料金とコードは EvoLink のモデルページにあります。Security Disclosure Ledger とは?
発表によれば、Z.ai が GLM-5.3 と同時に立ち上げた、モデルが発見した脆弱性のための公開台帳です——モデルが見つけた欠陥を私蔵ではなく協調的開示に流すことを意図しています。防御側にとっては証拠のストリームも兼ねます。実在するエントリは、どんなベンチマークスコアよりも強い能力の証明になります。
GLM-5.3 の CyberGym スコアに 84.5 と 83.5 の両方が見えるのはなぜ?
どちらも Z.ai 発です。84.5 は発表のベンチマーク表に、83.5% は中国語ドキュメントの本文に現れます。公開時点でこの食い違いは説明されていません。当方は両方を引用し、Z.ai が整合させたら更新します。
サイバー能力はコーディング能力とトレードオフ?
GLM-5.3 は EvoLink で使える?
glm-5.3 を提供しています。現在の料金、プロトコル、移行時の確認事項は GLM-5.3 モデルページで確認できます。ルートが利用可能でも、独自の認可と受け入れ基準は引き続き必要です。Sources
- Z.ai——GLM-5.3 発表:「Frontier Coding with Emergent Cyber Capabilities」
- BigModel——GLM-5.3 モデルドキュメント
- Hacker News——リリース当日の議論
- Unite.AI——リリース報道
- EvoLink——GLM-5.3 リリーストラッカー、GLM-5.3 対 GLM-5.2、GLM-5.3 API ページ


