GPT Image 2.5 Flare & Sunburst が EvoLink で利用可能にGPT Image 2.5 を試す

GLM-5.3 API

Z.ai の GLM-5.3(Zhipu GLM-5.3 / GLM 5.3 とも検索されます)に EvoLink の統一チャット API からアクセス。統合前に長いコンテキストでのコーディング、複数ステップのエージェント、プロンプトキャッシュを試せます。

Z.aiテキスト生成利用可能
入力 100 万トークンあたり $1.400 から
API ドキュメント
常時推論プロンプトキャッシュツール呼び出しChat + Messages
本番ルート公開中
コンテキスト
コンテキスト 1M · 最大出力 131K
適した用途
コーディングエージェント、長いタスクチェーン、ツール多用ワークフロー
入力
テキスト
出力
テキスト · JSON(構造化出力)· ツール呼び出し

GLM-5.3 を選ぶ

コーディングエージェントと長期的なエンジニアリング作業に向けた Z.ai のフラッグシップ推論モデル。100 万トークンのコンテキスト、常時オンの思考、ツール呼び出し、プロンプトキャッシュに対応し、Chat Completions と Anthropic Messages の両方から利用できます。

GLM-5.3

Z.ai のフラッグシップ推論モデル

選択中
モデル ID
glm-5.3
適した用途

リポジトリ規模のコーディングエージェント、長いタスクチェーン、ツール中心のワークフロー、そして入力の大半をキャッシュ読み取りが担うプレフィックス安定型のエージェントループ。

入力
$1.400 / 1M95.2 cr / 1M
キャッシュ読み取り
$0.261 / 1M17.7 cr / 1M
出力
$4.400 / 1M299.2 cr / 1M

すべての料金は 100 万トークンあたりで、USD とクレジットの両方で表示され、お使いのアカウントの現在の価格を反映します。

GLM-5.3 の料金

統合前に GLM-5.3 の 1 リクエストあたりの費用を見積もれます。計算機はお使いのアカウントの現在の料金を使い、公式価格は比較用の参考として表示します。

リクエスト計算機

1 リクエスト分のトークン構成と成功したツール呼び出し回数を入力してください。

1 リクエストの推定費用

GLM-5.3
USD$0.0028
クレジット0.1886
入力トークン0.0952 cr
キャッシュ読み取りトークン0.0036 cr
出力トークン0.0898 cr

最低課金:1 リクエストあたり 0.01 クレジット。

予算の目安

現在のトークン構成でのおおよそのリクエスト数。
クレジットを追加
$10
約 3605 リクエスト

手早いテスト向け

$50
約 18027 リクエスト

日常的な開発向け

$100
約 36055 リクエスト

本番評価向け

サーバーサイドツールの料金

成功したサーバーサイド呼び出しのみ回数課金されます。失敗した試行にツール料金はかかりませんが、トークンは課金されます。
  • ウェブ検索$0.010/ 回0.68 cr / 回

コーディングエージェントと長期エンジニアリングのための GLM-5.3 API

Z.ai のフラッグシップ推論モデルを、入力 $1.40・出力 $4.40/100万トークンで EvoLink の統一 API から利用できます。モデル ID は glm-5.3。100万トークンのコンテキスト、常時 low/high/max 推論、ツール呼び出し、プロンプトキャッシュに対応します。

GLM-5.3 は EvoLink ではモデル ID glm-5.3 として Chat Completions · Responses · Anthropic Messages で提供され、他のモデルと同じ API キーと残高で使えます。1M のコンテキストウィンドウと最大 131K トークンの出力に加えて長いコンテキストでのコーディング、複数ステップのエージェント、プロンプトキャッシュを備えています。

GLM-5.3

GLM-5.3 の仕様と機能

数値は EvoLink のルート設定に基づき、機能は API が現在提供しているものです。

コンテキストウィンドウ
1M トークン
最大出力
131K トークン
入力
テキスト
出力
テキスト · JSON(構造化出力)· ツール呼び出し
推論
常時オンの推論
ツール利用
複数ステップのツール連携を含む Function Calling
プロンプトキャッシュ
自動キャッシュ読み取り(低価格)
サーバーサイドツール
ウェブ検索、成功した呼び出しごとに課金
プロトコル
Chat Completions · Responses · Anthropic Messages
モデル ID
glm-5.3

なぜ GLM-5.3 はこれらのワークロードを処理できるのか

主に 3 つの特性が効いています。それぞれが同時に「間違った使い方」も示唆しているため、本番トラフィックを流す前に理解しておく価値があります。

100 万トークンの作業コンテキストが一律料金

長コンテキストの段階価格はありません。90 万トークン目の単価は 1000 トークン目と同じです。これで積極的に切り詰める理由の 1 つは消えますが、ウィンドウを埋めることが無料になるわけでも、正確になるわけでもありません。

リクエストのバイト単位での忠実な転送

モデル名を除き、リクエストボディはそのまま上流に届きます。そのため GLM 固有フィールド、プロンプトキャッシュのプレフィックスハッシュ、思考署名が両エンドポイントで保持されます。

推論トークンは出力課金に含まれる

推論は別項目ではなく completion トークンの中で課金されるため、131,072 トークンの出力上限は推論と最終回答の合計に対する上限です。出力予算は上限ではなくタスクに応じて設定してください。

GLM-5.3 を本番モデルスタックのどこに置くか

GLM-5.3 は GLM-5.2 より高く、Flash よりはるかに高価です。最新だからという理由だけで既定ルートにすべきではありません。真価を発揮するのは、より深い推論がリトライや人手による修正を実際に 1 回減らせるタスクです。

リポジトリ規模のコーディング

関連するモジュール、テスト、プロジェクト規約を 100 万トークンのコンテキストにまとめて保持し、エージェントに 1 ファイルずつ渡す方式をやめられます。効果はファイル間の変更が壊れなくなる形で現れ、単一ファイルの補完が上手くなることではありません。

長いタスクチェーン

「計画・実行・検証」を何ステップも回すループが最も恩恵を受けます。序盤の推論ミスがチェーン全体に波及するためです。評価はステップ単位の品質ではなく、チェーン完了率で行ってください。

ツール呼び出しの多いエージェント

大きなツール定義と長い指示ブロックはキャッシュされたプレフィックスに収まるため、1 ステップ追加したときの限界コストは完全な入力料金ではなくキャッシュ読み取り料金に近づきます。

Anthropic プロトコルのクライアントから直接

/v1/messages 宛のリクエストはバイト単位でそのまま転送され、プロンプトキャッシュのプレフィックスと思考署名が保持されます。Claude プロトコルのコーディング CLI は変換層なしで EvoLink に向けて glm-5.3 を選択できます。

GLM-5.3 が変えたこと、そして壊したこと

GLM-5.3 は GLM-5.2 の無変更での置き換えではありません。パラメータの変更が 1 つ、明確な破壊的変更になっており、価格も動いています。本番ルートを切り替える前にこの 4 点を確認してください。

破壊的変更:思考を無効化できなくなった

GLM-5.3 は常に思考し、thinking.type: "disabled" を拒否します。GLM-5.2 から移行したクライアントが無効化モードを送り続けていると、そのまま失敗します。公式の代替は thinking.type: "enabled" と reasoning_effort: "low" の組み合わせです。

推論強度は 3 段階、既定値は max

reasoning_effort は low・high・max を受け付け、既定は max です。出力トークンに推論トークンが含まれるため、この段階設定はコストに直結します。大量の定型呼び出しで既定値を放置することが、5.3 で使いすぎる最も一般的な原因です。

キャッシュ読み取りがこのページで最も効くコスト削減手段

キャッシュ読み取りトークンは新規入力の約 5 分の 1 で課金されます。システムプロンプトとツール定義が入力の大半を占める長いエージェントループでは、そのプレフィックスをバイト単位で安定させることが、モデル選択そのものより請求額に効きます。

GLM-5.2 より高価で、割引なし

5.3 は割引なしの上流価格で課金されるため、入力は現行の GLM-5.2 料金より約 40% 高くなります。追加の推論が測定可能な価値を持つ用途にだけ 5.3 を振り向け、残りは 5.2 か Flash に置いてください。

GLM-5.3 を使う 2 つの方法:EvoLink API または Agent

プロダクトのバックエンドやバッチ処理には EvoLink API を、コーディングや分析のワークフローには Codex・Claude・Gemini から GLM-5.3 を直接呼び出せます。どちらも同じ EvoLink API キー、残高、モデル ID、リクエスト履歴を共有します。

方法 1

EvoLink API で統合する

向いている用途:プロダクトのバックエンド、バッチ処理、自動化パイプライン

OpenAI 互換の Chat Completions(または Anthropic Messages)リクエストを EvoLink に送り、モデル ID、システムプロンプト、出力予算、ツール、構造化出力を自分で制御します。

  1. 1コンソールで EvoLink API キーを作成する
  2. 2OpenAI または Anthropic の SDK の base URL を EvoLink に向け、上に表示されたモデル ID を選ぶ
  3. 3代表的なリクエストを 1 件送り、usage フィールドで入力・キャッシュ・出力トークンを確認する
  4. 4タスクごとに max_tokens と再試行を設定し、複数ターンでは tool-call の ID と結果を保持する
方法 2

Agent から呼び出す

向いている用途:Codex・Claude・Gemini でのコーディング、レビュー、分析

タスク、含める入力、受け入れ基準を Agent に渡すと、Agent がリクエストを組み立て、EvoLink 経由で GLM-5.3 を呼び出し、回答をトークン使用量とともに返します。

  1. 1EVOLINK_API_KEY をローカル環境変数に設定する(コードやプロンプトには書かない)
  2. 2タスク、含める入力、期待する出力形式を説明する
  3. 3EvoLink 経由で GLM-5.3 を呼び出し、送信前にリクエストを表示するよう Agent に指示する
  4. 4回答、トークン使用量、エラー本文を Agent に報告させる

GLM-5.3 API のコード例とエラー処理

この例は最短で実行できるリクエストです:システムプロンプト、ユーザーメッセージ、出力予算を含む OpenAI 互換の Chat Completions 呼び出し。パラメータとレスポンスの完全なリファレンスは API タブを開いてください。

完全な API ドキュメントを見る
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3",
    "messages": [
      { "role": "system", "content": "You are a senior engineer. Answer in JSON when asked." },
      { "role": "user", "content": "Review this diff and list risky changes as a JSON array:\n<diff>" }
    ],
    "reasoning_effort": "low",
    "max_tokens": 2048,
    "stream": true
  }'

# Reasoning is always on: reasoning_effort accepts low / high / max
# (default max) and thinking.type "disabled" is rejected.
# The same model ID works on /v1/messages (Anthropic Messages).
# The response includes choices[0].message and a usage object (prompt,
# cached, and completion tokens; completion tokens include reasoning).

無効なリクエストまたは未対応パラメータ

API リファレンスに照らしてモデル ID、messages 配列、パラメータ範囲を確認し、このルートが対応しないフィールドを削除してください。

認証または残高の問題

Authorization の Bearer トークンを確認し、コンソールで利用可能残高を確かめてください。

コンテキスト長の超過

プロンプトのトークンが GLM-5.3 のコンテキストウィンドウを超えています。必要な情報だけに絞るか検索で取り出し、キャッシュ済みプレフィックスを再利用してください。

レート制限(429)

バックオフとジッターを入れて再試行し、並列バーストではなくバッチやキューで送ってください。

コンテンツまたはツール呼び出しの拒否

再試行の前に、センシティブな内容、形式不正の tool-call 引数、JSON スキーマの不一致を確認してください。

本番トラフィックを GLM-5.3 に振り向ける前に確認すべきこと

このモデルで見られる移行時の問題は、次の 4 点でほぼ捕捉できます。最初の 2 つは明確なエラー、後の 2 つはエラーにならないコストの問題です。

01

モデル ID は glm-5.3 を使う

Chat Completions と Anthropic Messages で同じ ID が使え、上流の名称と完全に一致します。変換が必要な別名はありません。

必須
02

thinking.type: "disabled" をすべて削除する

GLM-5.2 からの唯一の明確な破壊的変更です。thinking.type: "enabled" と reasoning_effort: "low" に置き換え、回帰用プロンプトを再実行してください。

破壊的変更
03

reasoning_effort を意識的に設定する

既定値は max です。定型的な呼び出しやレイテンシ重視の呼び出しを low に下げ、採用率が維持されることを確認してから節約分を見込んでください。

コスト
04

キャッシュが実際にヒットしているか確認する

返ってきた usage にキャッシュトークンが現れているか確認します。呼び出し間でプレフィックスがずれていると、毎回完全な入力料金で課金されますが、レスポンス自体からは分かりません。

コスト

キャッシュ読み取りは新規入力の約 5 分の 1

キャッシュに当たった入力は専用の低料金で課金されるため、安定したシステムプロンプト、リポジトリ規約、ツール定義は長いエージェントループでも安価なままです。キャッシュ書き込みの料金はありません。上流がキャッシュ作成トークンを返さないためです。

100 万トークンのコンテキストと 131K の出力上限

関連するコード、仕様、エージェントの状態を 1 つの作業コンテキストにまとめられます。上限は容量であって目標ではありません。必要なものだけを取得し、プレフィックスを安定させてキャッシュに当て、タスクに応じた出力予算を設定してください。

GLM-5.3 はトークン単価ではなく完了タスクあたりのコストで比較する

GLM-5.3 のトークン単価は GLM-5.2 よりも Flash よりも高価です。それが意味を持つのは、各モデルが「実際に納品できる結果」をどれだけの頻度で出すかと合わせて見るときだけです。ルートを固定する前に、自分のワークロードでこれらの指標を 1 週間追跡してください。

初回成功率採用された成果物タスクあたりのリトライ回数出力に占める推論トークンの割合キャッシュヒット率有効なツール呼び出し採用可能な結果までの時間フォールバック率

トークン単価が 40% 高くても 3 回に 1 回のリトライを減らせるルートは、実際には安上がりです。40% 高いのに何も変わらないルートは、単に高価な既定値にすぎません。この 2 つを見分ける方法は、同じタスクで両方を計測することだけです。

切り替える前に GLM-5.2 と Kimi K3 と比べる

EvoLink

GLM-5.3 は GLM-5.2 より高価です。本当に問うべきは、リトライと人手修正の削減が自分のワークロードで差額を埋められるかどうかです。まず計測し、それから本番ルートを決めてください。

GLM-5.3
入力 / 出力$1.4 / $4.4
コンテキスト1M
キャッシュキャッシュ読み取り
最適な用途リポジトリ規模のコーディングエージェント、長いタスクチェーン、ツール中心のワークフロー、そして入力の大半をキャッシュ読み取りが担うプレフィックス安定型のエージェントループ。
GLM-5.2
入力 / 出力$1 / $3.5
コンテキスト1M
キャッシュキャッシュ読み取り
最適な用途前世代の GLM フラッグシップ。トークン単価は依然として安く、5.3 で測定可能な改善が出ないワークロードや、思考の無効化に依存するクライアントではこちらを使い続けてください。
Kimi K3
入力 / 出力$3 / $15
コンテキスト1.05M
キャッシュ自動キャッシュ読み取り
最適な用途Moonshot の 100 万コンテキスト推論モデル。長コンテキストのコーディングやエージェント作業でベンダー横断の比較基準として有用です。

GLM モデルファミリー

同じ API キーと残高のまま、統合を変えずにティアを切り替えられます。

GLM-5.3

GLM-5.3

現在のモデル

Z.ai のフラッグシップ推論モデル

GLM-5.2

GLM-5.2

前世代の GLM フラッグシップ。トークン単価は依然として安く、5.3 で測定可能な改善が出ないワークロードや、思考の無効化に依存するクライアントではこちらを使い続けてください。

モデルを見る
GLM-5.3 Flash

GLM-5.3 Flash

同じ 5.3 世代で価格は約 9 分の 1、さらに画像・動画・ファイル入力にネイティブ対応。大量処理とマルチモーダル用途の既定候補です。

モデルを見る

GLM-5.3 以外の EvoLink のテキストモデル

Kimi K3

Kimi K3

Moonshot の 100 万コンテキスト推論モデル。長コンテキストのコーディングやエージェント作業でベンダー横断の比較基準として有用です。

モデルを見る
DeepSeek V4 Pro

DeepSeek V4 Pro

コスト重視の長コンテキスト基準。トークン単価がルーティング判断を左右する大量推論向けです。

モデルを見る
GPT-5.6

GPT-5.6

OpenAI の段階制フロンティアファミリー(Sol / Terra / Luna)。性能・レイテンシ・コストで柔軟にルーティング。

モデルを見る
Claude Opus 4.8

Claude Opus 4.8

Anthropic のプレミアムルート。長時間動くエージェント、複雑なレビュー、判断の重い作業向け。

モデルを見る

GLM-5.3 の関連記事

GLM-5.3 Flash と GLM-5.3 の比較

GLM-5.3 Flash と GLM-5.3 の比較

モダリティ、難度、受け入れ済み結果当たりコストでルートを選び、Flash-first の選択的昇格方針を構築します。

記事を読む
GLM-5.3 リリース:何が提供されたか

GLM-5.3 リリース:何が提供されたか

8 月 14 日のリリースが仕様・モデル ID・段階的公開について実際に確定させたこと、そして当時まだ未確定だったこと。

記事を読む
GLM-5.3 と GLM-5.2 の比較

GLM-5.3 と GLM-5.2 の比較

ベースモデルは同一で、向上はすべて事後学習によるもの。加えて思考を無効化できなくなった破壊的変更。5.2 に留まるべき場面。

記事を読む
GLM-5.3 と Claude の比較

GLM-5.3 と Claude の比較

コーディングエージェントをどちらに振り向けるか決める前に、ベンチマーク・API 契約・実際の利用可否を比較。

記事を読む
GLM-5.3 のサイバーセキュリティベンチマーク

GLM-5.3 のサイバーセキュリティベンチマーク

CyberGym と ExploitBench の数値が Z.ai 自身の報告として何を主張しているか、防御側はどう読むべきか。

記事を読む
1 つのゲートウェイで 3 つのコーディング CLI

1 つのゲートウェイで 3 つのコーディング CLI

設定ファイルのパス、環境変数、そして複数の CLI を単一エンドポイント経由で動かすためのトラブルシューティング一覧。

記事を読む

GLM-5.3 API のよくある質問

EvoLink で GLM-5.3 API は使えますか?

はい。GLM-5.3 は本番モデルとして提供され、Chat Completions と Anthropic Messages の両方で利用できます。

どのモデル ID を使いますか?

両エンドポイントとも glm-5.3 です。EvoLink のモデル名は上流の名称と完全に一致します。

OpenAI SDK や Anthropic Messages をそのまま使えますか?

はい。同じ API キーでクライアントを EvoLink に向け、glm-5.3 を指定してください。モデル名以外はバイト単位でそのまま転送されるため、プロンプトキャッシュのプレフィックスや思考署名も保持されます。

GLM-5.2 のように思考を無効化できますか?

できません。GLM-5.3 は常に思考し、thinking.type: "disabled" を拒否します。GLM-5.2 から移行する場合は thinking.type: "enabled" と reasoning_effort: "low" の組み合わせに変更してください。これが公式の代替手段です。

reasoning_effort はどう選びますか?

既定値は max です。定型的な修正、分類、レイテンシ重視の呼び出しには low、アーキテクチャ設計やデバッグ、長いタスクチェーンには high か max を使います。出力トークンには推論トークンが含まれるため、この設定はコストに直結します。

なぜ GLM-5.3 は GLM-5.2 より高いのですか?

GLM-5.3 は割引なしの上流価格で、GLM-5.2 は優待価格のため、入力は約 40% 高くなります。追加の推論がリトライを実際に減らす用途では 5.3 に、そうでなければ 5.2 または GLM-5.3 Flash に振り分けてください。

プロンプトキャッシュはどう課金されますか?

キャッシュ読み取りには専用料金があり、新規入力の約 5 分の 1 です。上流がキャッシュ作成トークンを返さないため、書き込み料金はありません。継続してヒットさせるには、プロンプトのプレフィックスをバイト単位で安定させてください。

コンテキストウィンドウと出力上限は?

コンテキストは 1,000,000 トークン、出力は最大 131,072 トークンで、ウィンドウ全域が一律料金です。長コンテキストの段階価格はありません。

GLM-5.3 と GLM-5.3 Flash のどちらを使うべきですか?

Flash は約 9 分の 1 の価格で、画像・動画・ファイル入力にも対応します。大量処理、マルチモーダル、定型作業はまず Flash で始め、より深い推論が必要で採用率が差額に見合う場合に GLM-5.3 へ切り替えてください。

GLM-5.3 は画像を扱えますか?

いいえ、GLM-5.3 はテキスト専用です。画像・動画・ファイル入力には GLM-5.3 Flash を使ってください。

Claude・GPT・Kimi とはどう比較しますか?

コーディングエージェントと長いタスクチェーンでの「採用された成果 1 件あたりのコスト」で GLM-5.3 を評価し、Claude と GPT は能力の上限基準、Kimi K3 はベンダー横断の長コンテキスト比較として扱ってください。

本番評価では何を測るべきですか?

初回成功率、採用された成果物、リトライ回数、出力に占める推論トークンの割合、キャッシュヒット率、有効なツール呼び出し、採用可能な結果までの所要時間、フォールバック率です。