GPT Image 2.5 Flare & Sunburst が EvoLink で利用可能にGPT Image 2.5 を試す

GLM-5.3 Flash API

Z.ai の GLM-5.3 Flash(GLM 5.3 Flash / Zhipu GLM-5.3 Flash とも検索されます)に EvoLink の統一チャット API からアクセス。統合前に画像入力、長文ドキュメント分析、複数ステップのエージェントを試せます。

Z.aiテキスト生成利用可能
入力 100 万トークンあたり $0.150 から
API ドキュメント
マルチモーダル入力画像 · 動画 · ファイル入力思考は常時オンChat + Messages
本番ルート公開中
コンテキスト
コンテキスト 1M · 最大出力 131K
適した用途
大量分類・抽出、スクリーンショットと文書の理解、定型的なエージェント処理
入力
テキスト + 画像
出力
テキスト · JSON(構造化出力)· ツール呼び出し

GLM-5.3 Flash を選ぶ

5.3 世代でネイティブにマルチモーダル対応するモデルです。テキスト・画像・動画・ファイルを入力でき、価格は GLM-5.3 の約 9 分の 1。コンテキストは同じ 100 万トークンで、思考は常時オン、ツール呼び出しとプロンプトキャッシュにも対応します。

GLM-5.3 Flash

Z.ai のマルチモーダル大量処理モデル

選択中
モデル ID
glm-5.3-flash
適した用途

大量の分類・情報抽出、スクリーンショットや文書の理解、動画・ファイルの分析、そして単価がルーティングを左右する定型的なエージェント処理。

入力
$0.150 / 1M10.2 cr / 1M
キャッシュ読み取り
$0.031 / 1M2.1 cr / 1M
出力
$0.500 / 1M34 cr / 1M

すべての料金は 100 万トークンあたりで、USD とクレジットの両方で表示され、お使いのアカウントの現在の価格を反映します。

GLM-5.3 Flash の料金

統合前に GLM-5.3 Flash の 1 リクエストあたりの費用を見積もれます。計算機はお使いのアカウントの現在の料金を使い、公式価格は比較用の参考として表示します。

リクエスト計算機

1 リクエスト分のトークン構成と成功したツール呼び出し回数を入力してください。

1 リクエストの推定費用

GLM-5.3 Flash
USD$0.0004
クレジット0.0209
入力トークン0.0102 cr
キャッシュ読み取りトークン0.0005 cr
出力トークン0.0102 cr

最低課金:1 リクエストあたり 0.01 クレジット。

予算の目安

現在のトークン構成でのおおよそのリクエスト数。
クレジットを追加
$10
約 32535 リクエスト

手早いテスト向け

$50
約 162679 リクエスト

日常的な開発向け

$100
約 325358 リクエスト

本番評価向け

サーバーサイドツールの料金

成功したサーバーサイド呼び出しのみ回数課金されます。失敗した試行にツール料金はかかりませんが、トークンは課金されます。
  • ウェブ検索$0.010/ 回0.68 cr / 回

マルチモーダルと大量処理のための GLM-5.3 Flash API

5.3 世代の大量処理向け階層を EvoLink の統合 API で。テキスト・画像・動画・ファイルを入力でき、価格は GLM-5.3 の約 9 分の 1。コンテキストは同じ 100 万トークンで、思考は常時オン、ツール呼び出しとプロンプトキャッシュにも対応します。

GLM-5.3 Flash は EvoLink ではモデル ID glm-5.3-flash として Chat Completions · Responses · Anthropic Messages で提供され、他のモデルと同じ API キーと残高で使えます。1M のコンテキストウィンドウと最大 131K トークンの出力に加えて画像入力、長文ドキュメント分析、複数ステップのエージェントを備えています。

GLM-5.3 Flash

GLM-5.3 Flash の仕様と機能

数値は EvoLink のルート設定に基づき、機能は API が現在提供しているものです。

コンテキストウィンドウ
1M トークン
最大出力
131K トークン
入力
テキスト + 画像
出力
テキスト · JSON(構造化出力)· ツール呼び出し
推論
常時オンの推論
ツール利用
複数ステップのツール連携を含む Function Calling
プロンプトキャッシュ
自動キャッシュ読み取り(低価格)
サーバーサイドツール
ウェブ検索、成功した呼び出しごとに課金
プロトコル
Chat Completions · Responses · Anthropic Messages
モデル ID
glm-5.3-flash

なぜ GLM-5.3 Flash はこれだけの量を捌けるのか

Flash は 5.3 世代のプラットフォーム特性をそのまま保ち、価格と入力モダリティだけを変えています。この組み合わせが、Flash を「代替手段」ではなく「既定値」にしています。

1 回のリクエストでテキストとメディアを混在

1 つのメッセージに指示、複数の画像、ファイルをまとめて載せられるので、同じ判断に属する材料をパイプラインに分散させず 1 回の呼び出しに収められます。

同じ 100 万コンテキストが一律料金

Flash は短コンテキストモデルではありません。100 万の全ウィンドウが単一料金で使え、長コンテキストの段階価格もありません。この価格帯で大量の文書処理が現実的になるのはそのためです。

入力のごく一部で済むキャッシュ読み取り

安定したシステムプロンプトとツール定義は、長いループ全体でキャッシュ読み取り料金で課金されます。もともと安価なモデルでは、これが 1 ステップ追加の限界コストをほぼゼロに近づけます。

GLM-5.3 Flash を本番モデルスタックのどこに置くか

Flash は大量処理を前提とした価格設定なので、問題は「予算が足りるか」ではなく「精度基準を満たすか」です。まず Flash で処理し、失敗したものだけを上位に回せば、フラッグシップとの価格差が味方になります。

大量の分類と情報抽出

チケットの振り分け、タグ付け、構造化抽出、コンテンツの仕分け——全件やり直すコストが、やり直しを避けるための開発工数より安く済む価格帯です。バッチサイズが制約でなくなります。

スクリーンショットと文書の理解

UI のスクリーンショット、スキャン画像、図表を image_url ブロックとして送り、構造化された出力を受け取れます。これは GLM-5.3 にはまったくない能力です。フラッグシップはテキスト専用です。

動画とファイルの分析

動画とファイルの入力は別パイプラインではなくネイティブに受け付けられるため、1 回のリクエストで混在した材料を扱えます。「まず文字起こし、次に推論」と分割する必要がありません。

大きなエージェント内の定型ステップ

ツールの返り値の要約、分岐の判断、出力の整形——呼び出し量の大半を占めるが難易度は高くないステップです。フラッグシップは、推論の深さが本当に結果を左右するステップのために取っておきましょう。

GLM-5.3 Flash が与えるもの、そして確認を求めるもの

Flash は「ウィンドウの小さい簡易版 5.3」ではありません。コンテキスト、プロトコル、キャッシュはまったく同じです。異なるのは 2 点で、そのうち 1 点は自分で計測する価値があります。

フラッグシップにないネイティブなマルチモーダル入力

テキスト・画像・動画・ファイルはすべて標準の messages 構造を通ります。画像は image_url ブロックとして、公開 URL(公式推奨)または Base64 データ URL で、1 枚につき 1 ブロックずつ渡します。

フラッグシップの約 9 分の 1 の価格

入力も出力も GLM-5.3 料金の約 9 分の 1 で、キャッシュ読み取りはさらに安価です。この差は請求額だけでなく、ワークロードの設計そのものを変えるほどの大きさです。

推論に関する制約は 5.3 世代の他モデルと同じ

ここでも思考は常時オンで、thinking.type: "disabled" は拒否されます。Z.ai は Flash について追加で clear_thinking: false を推奨しており、このパラメータはそのまま透過されます。

メディアのトークン計上は自分で確認する価値がある

画像と動画は prompt_tokens に計上され入力料金で課金されますが、上流は画像 1 枚あたりのトークン換算式を公開していません。代表的なサンプルを実行し、返ってきた usage を読んで、推定値ではなく実測値でバッチ規模を決めてください。

GLM-5.3 Flash を使う 2 つの方法:EvoLink API または Agent

プロダクトのバックエンドやバッチ処理には EvoLink API を、コーディングや分析のワークフローには Codex・Claude・Gemini から GLM-5.3 Flash を直接呼び出せます。どちらも同じ EvoLink API キー、残高、モデル ID、リクエスト履歴を共有します。

方法 1

EvoLink API で統合する

向いている用途:プロダクトのバックエンド、バッチ処理、自動化パイプライン

OpenAI 互換の Chat Completions(または Anthropic Messages)リクエストを EvoLink に送り、モデル ID、システムプロンプト、出力予算、ツール、構造化出力を自分で制御します。

  1. 1コンソールで EvoLink API キーを作成する
  2. 2OpenAI または Anthropic の SDK の base URL を EvoLink に向け、上に表示されたモデル ID を選ぶ
  3. 3代表的なリクエストを 1 件送り、usage フィールドで入力・キャッシュ・出力トークンを確認する
  4. 4タスクごとに max_tokens と再試行を設定し、複数ターンでは tool-call の ID と結果を保持する
方法 2

Agent から呼び出す

向いている用途:Codex・Claude・Gemini でのコーディング、レビュー、分析

タスク、含める入力、受け入れ基準を Agent に渡すと、Agent がリクエストを組み立て、EvoLink 経由で GLM-5.3 Flash を呼び出し、回答をトークン使用量とともに返します。

  1. 1EVOLINK_API_KEY をローカル環境変数に設定する(コードやプロンプトには書かない)
  2. 2タスク、含める入力、期待する出力形式を説明する
  3. 3EvoLink 経由で GLM-5.3 Flash を呼び出し、送信前にリクエストを表示するよう Agent に指示する
  4. 4回答、トークン使用量、エラー本文を Agent に報告させる

GLM-5.3 Flash API のコード例とエラー処理

この例は最短で実行できるリクエストです:システムプロンプト、ユーザーメッセージ、出力予算を含む OpenAI 互換の Chat Completions 呼び出し。パラメータとレスポンスの完全なリファレンスは API タブを開いてください。

完全な API ドキュメントを見る
cURL
curl -X POST https://api.evolink.ai/v1/chat/completions \
  -H "Authorization: Bearer $EVOLINK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "glm-5.3-flash",
    "messages": [
      { "role": "system", "content": "You extract structured data. Answer in JSON only." },
      { "role": "user", "content": [
        { "type": "text", "text": "List every line item on this receipt as JSON." },
        { "type": "image_url", "image_url": { "url": "https://example.com/receipt.jpg" } }
      ] }
    ],
    "max_tokens": 1024,
    "temperature": 0.1
  }'

# Reasoning is always on for the 5.3 generation: do not send
# thinking.type "disabled". The same model ID works on /v1/messages
# (Anthropic Messages). The response includes choices[0].message and
# a usage object; image and video input is counted in prompt_tokens.

無効なリクエストまたは未対応パラメータ

API リファレンスに照らしてモデル ID、messages 配列、パラメータ範囲を確認し、このルートが対応しないフィールドを削除してください。

認証または残高の問題

Authorization の Bearer トークンを確認し、コンソールで利用可能残高を確かめてください。

コンテキスト長の超過

プロンプトのトークンが GLM-5.3 Flash のコンテキストウィンドウを超えています。必要な情報だけに絞るか検索で取り出し、キャッシュ済みプレフィックスを再利用してください。

レート制限(429)

バックオフとジッターを入れて再試行し、並列バーストではなくバッチやキューで送ってください。

コンテンツまたはツール呼び出しの拒否

再試行の前に、センシティブな内容、形式不正の tool-call 引数、JSON スキーマの不一致を確認してください。

量を GLM-5.3 Flash に振り向ける前に確認すべきこと

このうち 2 つは正しさの確認、2 つはコストの確認です。メディアトークンの確認は最も多くのチームが省略し、後で大量バッチで後悔する項目です。

01

モデル ID は glm-5.3-flash を使う

Chat Completions と Anthropic Messages で同じ ID が使え、上流の名称と完全に一致します。

必須
02

thinking.type: "disabled" をすべて削除する

5.3 世代全体がこれを拒否します。最も安く速い経路には thinking.type: "enabled" と reasoning_effort: "low" を使ってください。

破壊的変更
03

実サンプルでメディアトークンを計測する

代表的な画像や動画を送り、レスポンスの prompt_tokens を読んで 1 件あたりのコストを自分で算出してから、バッチサイズを決めてください。

コスト
04

GLM-5.3 へのエスカレーション規則を決める

何を Flash の失敗とみなし、失敗時に何を起こすかを事前に定義します。規則がないチームは、何もエスカレーションせず誤りをそのまま出すか、すべてエスカレーションして価格優位を失うかのどちらかになります。

ルーティング

キャッシュ読み取りは新規入力の約 5 分の 1

キャッシュに当たった入力は専用の低料金で課金されるため、安定したシステムプロンプトやツール定義は長いエージェントループでも安価なままです。上流がキャッシュ作成トークンを返さないため、キャッシュ書き込みの料金はありません。

画像・動画・ファイルをネイティブに入力

画像は messages[].content[] 内の image_url ブロックとして送信し、URL には公開アドレス(推奨)または Base64 データ URL を指定します。複数枚の場合は 1 枚につき 1 ブロックです。メディアは prompt_tokens に計上され入力料金で課金されるため、大量バッチを組む前に代表的なサンプルで実測してください。

GLM-5.3 Flash の精度差をまず測り、それから値段を付ける

有益な比較は「Flash 対ベンチマーク」ではなく「自分のタスクにおける Flash 対 GLM-5.3」です。10 回中 9 回で Flash がフラッグシップと並ぶなら、両方を使って 10 回目だけをエスカレーションするほうが、10 回すべてをフラッグシップに送るよりはるかに安く済みます。

初回成功率採用された成果物GLM-5.3 へのエスカレーション率リクエストあたりのメディアトークンキャッシュヒット率出力に占める推論トークンの割合採用可能な結果までの時間採用された成果 1 件あたりのコスト

精度差は仮定するのではなく値段を付けてください。コストが 9 分の 1 のモデルは、大半のケースで正しくありさえすれば、「まず実行、次にエスカレーション」がすべてをフラッグシップに送る方式に勝ちます。ただし「大半のケース」は、ベンチマークから引き継ぐものではなく、自分のワークロードで測るべき数字です。

GLM-5.3 と DeepSeek V4 Flash と比較する

EvoLink

Flash は 5.3 世代の大量処理向けの階層です。まず自分の精度基準を満たすかを確認してください。満たすのであれば、フラッグシップとの価格差は定型作業のルーティング方針を変えるのに十分です。

GLM-5.3 Flash
入力 / 出力$0.15 / $0.5
コンテキスト1M
キャッシュキャッシュ読み取り
最適な用途大量の分類・情報抽出、スクリーンショットや文書の理解、動画・ファイルの分析、そして単価がルーティングを左右する定型的なエージェント処理。
GLM-5.3
入力 / 出力$1.4 / $4.4
コンテキスト1M
キャッシュキャッシュ読み取り
最適な用途5.3 のフラッグシップ。テキスト専用で価格は約 9 倍ですが、難しい推論で Flash が精度基準に届かないときの適切なエスカレーション先です。
DeepSeek V4 Flash
入力 / 出力$0.442 / $1.324
コンテキスト1M
キャッシュキャッシュ読み取り
最適な用途DeepSeek の大量処理向けモデル。100 万コンテキストでキャッシュ読み取り価格が非常に安く、大量テキスト処理では最も直接的なコスト比較対象です。

GLM モデルファミリー

同じ API キーと残高のまま、統合を変えずにティアを切り替えられます。

GLM-5.3

GLM-5.3

Z.ai のフラッグシップ推論モデル

モデルを見る
GLM-5.2

GLM-5.2

前世代の GLM フラッグシップ。5.3 世代では思考の無効化ができなくなったため、その機能に依存するクライアントでは今も必要です。

モデルを見る
GLM-5.5

GLM-5.5

EvoLink のウォッチリストにある次期 GLM フラッグシップ。公開当日にモデル ID、料金、ルート検証結果を受け取れるよう通知に登録してください。

モデルを見る

GLM-5.3 Flash 以外の EvoLink のテキストモデル

DeepSeek V4 Flash

DeepSeek V4 Flash

DeepSeek の大量処理向けモデル。100 万コンテキストでキャッシュ読み取り価格が非常に安く、大量テキスト処理では最も直接的なコスト比較対象です。

モデルを見る
Gemini 3.7 Flash

Gemini 3.7 Flash

Google の低コストマルチモーダルモデル。画像や文書の理解が選定基準になる場合のベンダー横断の比較対象として有用です。

モデルを見る
Kimi K3

Kimi K3

Moonshot の長文脈推論ルート。リポジトリ規模のコーディングや複数文書の作業向け。

モデルを見る
GPT-5.6

GPT-5.6

OpenAI の段階制フロンティアファミリー(Sol / Terra / Luna)。性能・レイテンシ・コストで柔軟にルーティング。

モデルを見る

GLM-5.3 Flash の関連記事

GLM-5.3 Flash と GLM-5.3 の比較

GLM-5.3 Flash と GLM-5.3 の比較

モダリティ、難度、受け入れ済み結果当たりコストでルートを選び、Flash-first の選択的昇格方針を構築します。

記事を読む
GLM-5.3 リリース:何が提供されたか

GLM-5.3 リリース:何が提供されたか

8 月 14 日のリリースが 5.3 世代について確定させた仕様・モデル ID・段階的公開と、当時まだ未確定だったこと。

記事を読む
GLM-5.3 と GLM-5.2 の比較

GLM-5.3 と GLM-5.2 の比較

ベースモデルは同一で向上はすべて事後学習から。加えて世代全体で思考を無効化できなくなった破壊的変更。

記事を読む
GLM-5.3 と Claude の比較

GLM-5.3 と Claude の比較

どちらのファミリーにエージェントを振り向けるか決める前に、ベンチマーク・API 契約・実際の利用可否を比較。

記事を読む
GLM-5.3 のサイバーセキュリティベンチマーク

GLM-5.3 のサイバーセキュリティベンチマーク

CyberGym と ExploitBench の数値が Z.ai 自身の報告として何を主張しているか、防御側はどう読むべきか。

記事を読む
1 つのゲートウェイで 3 つのコーディング CLI

1 つのゲートウェイで 3 つのコーディング CLI

設定ファイルのパス、環境変数、そして複数の CLI を単一エンドポイント経由で動かすためのトラブルシューティング一覧。

記事を読む

GLM-5.3 Flash API のよくある質問

EvoLink で GLM-5.3 Flash API は使えますか?

はい。GLM-5.3 Flash は本番モデルとして提供され、Chat Completions と Anthropic Messages の両方で利用できます。

どのモデル ID を使いますか?

両エンドポイントとも glm-5.3-flash です。EvoLink のモデル名は上流の名称と完全に一致します。

Flash はどんな入力に対応していますか?

テキスト、画像、動画、ファイルです。テキスト専用の GLM-5.3 との最大の違いがここにあります。

画像はどう送りますか?

messages[].content[] に image_url ブロックを置き、url には公開アドレス(公式推奨)または Base64 データ URL を指定します。複数枚の場合は画像ごとに image_url ブロックを追加してください。

画像や動画の入力はどう課金されますか?

メディアは prompt_tokens に計上され、入力料金で課金されます。メディア専用の SKU はありません。上流は画像のトークン換算式を公開していないため、大量バッチを組む前に代表的なサンプルを実行し、返ってくる usage を確認してください。

思考を無効化できますか?

できません。5.3 世代は全体が常に思考し、thinking.type: "disabled" を拒否します。最も安く速い経路が必要な場合は thinking.type: "enabled" と reasoning_effort: "low" を使ってください。

clear_thinking とは何ですか、設定すべきですか?

ターン間で以前の思考内容を消すかどうかを制御します。Z.ai は Flash について clear_thinking: false を推奨しています。このパラメータはそのまま透過され、EvoLink は書き換えません。

Flash は GLM-5.3 よりどれくらい安いですか?

入力・出力とも約 9 分の 1 です。この差は通常、「まず Flash で処理し、受け入れ基準を満たさなかったリクエストだけを上位モデルに回す」という運用を正当化できるほど大きなものです。

プロンプトキャッシュはどう課金されますか?

キャッシュ読み取りには専用料金があり、新規入力の約 5 分の 1 です。上流がキャッシュ作成トークンを返さないため、書き込み料金はありません。継続してヒットさせるにはプロンプトのプレフィックスをバイト単位で安定させてください。

コンテキストウィンドウと出力上限は?

コンテキストは 1,000,000 トークン、出力は最大 131,072 トークンで、ウィンドウ全域が一律料金です。長コンテキストの段階価格はありません。

大量処理の既定モデルとして適していますか?

適しています。そのための価格設定です。分類、抽出、定型的なエージェント処理、文書やスクリーンショットの理解が自然な用途です。より深い推論が結果を明確に変える場合にだけ GLM-5.3 へエスカレーションしてください。

本番評価では何を測るべきですか?

初回成功率、採用された成果物、リトライ回数、出力に占める推論トークンの割合、キャッシュヒット率、リクエストあたりのメディアトークン量、採用可能な結果までの所要時間、そして GLM-5.3 へのエスカレーション率です。