Skip to main content
POST
BaseURL:デフォルトの BaseURL は https://direct.evolink.ai で、テキストモデルへの対応が優れており、長時間接続をサポートします。https://api.evolink.ai はマルチモーダルサービスの主力エンドポイントで、テキストモデルに対しては代替アドレスとして使用されます。
思考の切り替え。enabled は思考を有効にし、全モデルのデフォルトです。disabled で無効にできるのは glm-5.2 のみです。glm-5.3、glm-5.3-flash、glm-5.3-flashx は常に思考します。disabled はデフォルトの思考モードを維持するため、思考を無効にせず、強度を low に設定するものでもありません。強度を下げるには reasoning_effort=low を指定してください。glm-5.2 から 5.3 シリーズに切り替えた後は、thinking.type=disabled を残しても思考は有効で、思考トークンは出力として課金されます。
reasoning_effort: 推論強度。デフォルトは max。 glm-5.3 / glm-5.3-flash / glm-5.3-flashx の互換ルール minimal と none は 5.3 シリーズの思考を無効にしません。 思考トークンは出力として課金されます。認識されない値は互換変換せず、そのまま扱われます。表の値を使用してください。これらの互換ルールは glm-5.2 には適用されません。 glm-5.2 は max、xhigh、high、medium、low、minimal、none に対応します。xhigh は max、medium / low は high に相当し、minimal / none は思考を無効にできます。thinking.type=disabled でも無効にできます。プログラミングなど複雑なタスクには max を使用できます。
ユーザーメッセージの内容。
  • 文字列:プレーンテキスト。すべてのモデルが対応
  • コンテンツブロック配列:テキストと画像の混在。対応しているのは glm-5.3-flash と glm-5.3-flashx のみ
glm-5.3 や glm-5.2 に画像コンテンツブロックを渡すとエラーになります。

承認

Authorization
string
header
必須

##すべての API は Bearer Token 認証が必要です##

API キーの取得:

API キー管理ページにアクセスして API キーを取得してください

リクエストヘッダーに追加:

ボディ

application/json
model
enum<string>
デフォルト:glm-5.3
必須

呼び出すモデル:

利用可能なオプション:
glm-5.3,
glm-5.3-flash,
glm-5.3-flashx,
glm-5.2
例:

"glm-5.3"

messages
(System Message · object | User Message · object | Assistant Message · object | Tool Message · object)[]
必須

対話メッセージのリスト。現在の対話の完全な文脈情報を含みます

system、user、assistant、tool の 4 種類の役割に対応します。役割が異なるメッセージは異なるフィールド構造を持つため、対応する役割を選択して確認してください。少なくとも 1 件のメッセージを含む必要があり、システムメッセージまたはアシスタントメッセージのみで構成することはできません。

Minimum array length: 1
stream
boolean
デフォルト:false

ストリーミング出力モードを有効にするかどうか

  • false:モデルが完全なレスポンスを生成してから一括で返します(デフォルト)。短いテキストやバッチ処理に適しています
  • true:Server-Sent Events(SSE)でチャンクごとにリアルタイムに返します。チャットや長文に適しています。ストリーミング終了時に data: [DONE] を返します
例:

false

thinking
object

思考連鎖(Chain of Thought)を有効にするかどうかを制御します

reasoning_effort
enum<string>
デフォルト:max

推論強度。デフォルトは max。

glm-5.3 / glm-5.3-flash / glm-5.3-flashx の互換ルール

minimal と none は 5.3 シリーズの思考を無効にしません。 思考トークンは出力として課金されます。認識されない値は互換変換せず、そのまま扱われます。表の値を使用してください。これらの互換ルールは glm-5.2 には適用されません。

glm-5.2 は max、xhigh、high、medium、low、minimal、none に対応します。xhigh は max、medium / low は high に相当し、minimal / none は思考を無効にできます。thinking.type=disabled でも無効にできます。プログラミングなど複雑なタスクには max を使用できます。

利用可能なオプション:
max,
xhigh,
high,
medium,
low,
minimal,
none
例:

"max"

do_sample
boolean
デフォルト:true

サンプリング戦略を有効にするかどうか

  • true(デフォルト):temperature / top_p を用いてランダムサンプリングを行い、出力がより多様になります
  • false:常に確率が最も高い語彙を選択し(貪欲デコード)、出力がより定まります。この場合 temperature と top_p は無視されます

一貫性や再現性が必要なタスク(コード生成、翻訳など)には false の設定を推奨します

例:

true

temperature
number<float>
デフォルト:1

サンプリング温度。出力のランダム性と創造性を制御します

説明:

  • 範囲:[0.0, 1.0]、小数第 2 位まで
  • 高い値(例:0.8):よりランダムで独創性が高くなり、クリエイティブな執筆に適しています
  • 低い値(例:0.2):より安定して定まりやすくなり、事実に基づく質問応答やコード生成に適しています
  • デフォルト値:1.0

推奨:temperature と top_p を同時に調整しないでください

必須範囲: 0 <= x <= 1
例:

1

top_p
number<float>
デフォルト:0.95

核サンプリング(Nucleus Sampling)パラメータ。temperature サンプリングの代替手段です

説明:

  • 範囲:[0.01, 1.0]、小数第 2 位まで
  • モデルは累積確率が top_p に達する候補語彙のみを考慮します。例えば 0.1 は上位 10% の確率の語彙のみを考慮することを意味します
  • 小さい値ほど絞り込まれた一貫性のある出力になり、大きい値ほど多様性が増します
  • デフォルト値:0.95

推奨:temperature と top_p を同時に調整しないでください

必須範囲: 0.01 <= x <= 1
例:

0.95

max_tokens
integer

モデル出力の最大トークン数の上限

説明:

  • GLM シリーズは最大 131,072 tokens(128K)の出力に対応しています。1024 以上の設定を推奨します
  • thinking が有効な場合、思考連鎖のトークンもこの上限に含まれます
  • length を理由に生成が打ち切られた場合は、この値を上げてください
必須範囲: 1 <= x <= 131072
例:

1024

tools
(Function ツール · object | Web Search ツール(ウェブ検索) · object)[]

モデルが呼び出せるツールのリスト

説明:

  • 関数呼び出し(function)とウェブ検索(web_search)に対応
  • 関数は最大 128 個まで
  • このうち web_search は実際に検索が行われた場合に1 回ごとに別途課金されます。その他のツールに追加料金はかかりません
Maximum array length: 128
tool_choice
enum<string>
デフォルト:auto

モデルがどの関数を呼び出すかを選択する方法を制御します

説明:ツールの種類が function の場合のみ有効で、デフォルトかつ auto のみに対応します(ツールを呼び出すかどうかをモデルが自動で判断します)

利用可能なオプション:
auto
例:

"auto"

stop
string[]

停止ワードのリスト

説明:

  • モデルが生成テキスト中に指定した文字列に遭遇すると、ただちに生成を停止します(停止ワード自体は返却テキストに含まれません)
  • 現在は単一の停止ワードのみに対応し、形式は ["stop_word1"]、例えば ["Human:"] です
Maximum array length: 4
例:
response_format
object

モデルのレスポンス出力形式を指定します。デフォルトは text

説明:

  • { "type": "json_object" } で JSON モードを有効化すると、モデルは有効な JSON 形式のデータを返します。構造化データの抽出などのシナリオに適しています
  • JSON モードを使用する場合は、system または user メッセージで JSON 出力をはっきりと要求することを推奨します
request_id
string

リクエストの一意の識別子

説明:

  • ユーザー側から渡し、長さは 6〜64 文字です。一意性を確保するため UUID 形式を推奨します
  • 指定しない場合は、プラットフォームが自動で生成します
Required string length: 6 - 64
例:

"req-7f3a2c1e8b9d4f0a"

user_id
string

エンドユーザーの一意の識別子

説明:長さは 6〜128 文字です。機密情報を含まない一意の識別子の使用を推奨します。プラットフォームによる不正利用の監視と検出に役立ちます

Required string length: 6 - 128
例:

"user-abc123456"

レスポンス

チャット補完が正常に生成されました

id
string

タスク ID

例:

"chatcmpl-a6613b56-c61c-94ba-9a9f-43d4cdc7d77a"

object
enum<string>

レスポンスタイプ

利用可能なオプション:
chat.completion
例:

"chat.completion"

request_id
string

リクエスト ID(リクエストで request_id を指定した場合に返送されます)

例:

"req-7f3a2c1e8b9d4f0a"

created
integer

リクエストの作成時刻。Unix タイムスタンプ(秒)

例:

1777021417

model
string

モデル名

例:

"glm-5.3"

choices
object[]

モデルレスポンスのリスト

usage
object

呼び出し終了時に返却される Token 使用統計

ウェブ検索関連情報。web_search ツールを使用し検索がヒットした場合に返却されます

content_filter
object[]

コンテンツ安全関連情報