curl --request POST \
--url https://direct.evolink.ai/v1/messages \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"max_tokens": 1024,
"messages": [
{
"role": "user",
"content": "안녕하세요, 세계"
}
]
}
'{
"id": "msg_0842a705-9d0b-4eaa-b12d-09a4106326c5",
"type": "message",
"role": "assistant",
"model": "glm-5.3",
"content": [
{
"type": "thinking",
"thinking": "사용자가 한 단어로 인사해 달라고 요청했으니 \"Hi\"라고 답하면 됩니다.",
"signature": ""
},
{
"type": "text",
"text": "Hi."
}
],
"stop_reason": "end_turn",
"usage": {
"input_tokens": 18,
"output_tokens": 101,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"prompt_tokens_details": {
"cached_tokens": 0
}
}
}GLM 전체 모델 인터페이스 - Messages 전체 매개변수
- Anthropic Messages 프로토콜로 GLM 시리즈 모델을 호출하며,
model파라미터로 구체적인 모델을 선택합니다 - 요청 / 응답 구조는 Anthropic API와 동일합니다
- 시스템 프롬프트: 최상위
system으로 전달 - 사고 모드: 전 시리즈가 기본적으로 사고를 켜며 사고 내용은
content[type=thinking]block으로 반환됩니다.glm-5.2만thinking.type=disabled로 끌 수 있습니다 - 스트리밍 출력: SSE 이벤트 스트림
- 도구 호출: Anthropic
tool_use/tool_result흐름과 호환 - 이미지 입력: 지원하는 모델은
glm-5.3-flash및glm-5.3-flashx뿐이며, 자세한 내용은messages필드 설명을 참조하세요
curl --request POST \
--url https://direct.evolink.ai/v1/messages \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3",
"max_tokens": 1024,
"messages": [
{
"role": "user",
"content": "안녕하세요, 세계"
}
]
}
'{
"id": "msg_0842a705-9d0b-4eaa-b12d-09a4106326c5",
"type": "message",
"role": "assistant",
"model": "glm-5.3",
"content": [
{
"type": "thinking",
"thinking": "사용자가 한 단어로 인사해 달라고 요청했으니 \"Hi\"라고 답하면 됩니다.",
"signature": ""
},
{
"type": "text",
"text": "Hi."
}
],
"stop_reason": "end_turn",
"usage": {
"input_tokens": 18,
"output_tokens": 101,
"cache_creation_input_tokens": 0,
"cache_read_input_tokens": 0,
"prompt_tokens_details": {
"cached_tokens": 0
}
}
}https://direct.evolink.ai이며, 텍스트 모델과 장시간 연결을 더 잘 지원합니다. https://api.evolink.ai는 멀티모달 서비스의 기본 엔드포인트이자 텍스트 모델의 대체 주소 역할을 합니다.thinking 블록은 출력 토큰으로 과금되며 signature는 빈 문자열일 수 있습니다.glm-5.2:thinking.type=disabled로 사고를 끌 수 있습니다.glm-5.3/glm-5.3-flash/glm-5.3-flashx: 사고가 항상 켜져 있습니다.disabled를 보내도 기본 사고 모드와 출력 토큰 과금이 유지됩니다.
thinking.budget_tokens와 thinking.effort는 GLM 사고 수준을 설정하지 않습니다. 호환 값은 최상위 reasoning_effort 필드를 참고하세요. glm-5.2에서 사고를 끄던 설정은 5.3 시리즈로 바꾼 뒤에는 사고를 끄지 않습니다.reasoning_effort: 요청 최상위에 두는 GLM 사고 수준 호환 필드로 thinking 객체에 속하지 않습니다. 이 엔드포인트는 필드를 받지만 실제 사고 강도를 제어할 수 있다고 보장하지는 않습니다.
glm-5.3 / glm-5.3-flash / glm-5.3-flashx 호환 규칙
| 전달 값 | 호환 값 |
|---|---|
low / high / max | 해당 수준 유지 |
xhigh | max |
medium | high |
minimal / none | low, 사고 유지 |
minimal과 none은 5.3 시리즈의 사고를 끄지 않습니다. 사고 토큰은 출력으로 과금됩니다. 알 수 없는 값은 호환 변환 없이 원래 값을 유지하므로 표에 나온 값을 사용하세요. 이 규칙은 glm-5.2에는 적용되지 않습니다.
사고 강도를 조절하려면 Chat Completions의 reasoning_effort 또는 Responses의 reasoning.effort를 사용하세요.
glm-5.3-flash와 glm-5.3-flashx만 지원합니다. glm-5.3이나 glm-5.2에 이미지 블록을 보내면 모델이 이미지를 읽지 못해도 200이 반환될 수 있습니다. 이미지 이해가 필요하면 지원 모델을 선택하세요.인증
##모든 인터페이스는 Bearer Token 인증이 필요합니다##
API Key 발급:
API Key 관리 페이지에 방문하여 API Key를 발급받으세요
요청 헤더에 추가:
Authorization: Bearer YOUR_API_KEY
참고: EvoLink는 /v1/messages에 대해 일괄적으로 Bearer Token 인증을 사용합니다.
본문
호출할 모델:
| 모델 ID | 포지셔닝 | 사고 끄기 | 이미지 입력 |
|---|---|---|---|
glm-5.3 | 플래그십 모델, 복잡한 소프트웨어 엔지니어링과 에이전트 작업 능력이 전반적으로 향상; 1M 컨텍스트 | 끌 수 없음 | 미지원 |
glm-5.3-flash | 경량 멀티모달 모델, 비용이 매우 낮고 비전을 기본 지원; 1M 컨텍스트 | 끌 수 없음 | 지원 |
glm-5.3-flashx | 이미지 입력을 지원하는 멀티모달 모델, 1M 컨텍스트 | 끌 수 없음 | 지원 |
glm-5.2 | 이전 세대 플래그십, 복잡한 추론과 초장문 컨텍스트; 1M 컨텍스트 | 끌 수 있음(thinking.type=disabled) | 미지원 |
glm-5.3, glm-5.3-flash, glm-5.3-flashx, glm-5.2 "glm-5.3"
user와 assistant가 번갈아 나오는 대화 메시지입니다. 최소 1개가 필요하며 마지막 메시지는 보통 role=user입니다. 이전 메시지를 포함하면 여러 턴의 문맥을 사용할 수 있습니다.
이미지 입력: content 배열의 image 블록은 glm-5.3-flash와 glm-5.3-flashx만 지원합니다. glm-5.3과 glm-5.2에는 텍스트만 사용하세요. HTTP 200을 받아도 이미지 미지원 모델이 이미지를 읽었다는 뜻은 아닙니다.
1Show child attributes
Show child attributes
생성되는 내용 길이의 상한(토큰 수)
설명:
- GLM 시리즈는 최대 131,072 tokens(128K) 출력 길이를 지원하며
1024이상 설정을 권장합니다 - thinking으로 생성되는 토큰도 이 상한에 포함됩니다
- 상한에 도달하면 내용이 잘리고 응답은
stop_reason=max_tokens가 됩니다
1 <= x <= 1310721024
시스템 프롬프트로, AI의 역할과 동작을 설정하는 데 사용합니다
설명:
- 문자열 또는 콘텐츠 블록 배열을 지원합니다
- 최상위
system필드로 전달합니다(messages에 넣지 마세요) - 모델이 system 제약을 따릅니다
- 너무 긴 system은 잘릴 수 있습니다: 긴 컨텍스트가 필요하면
messages에 넣고, 모두system에 쌓지 마세요
"You are a helpful assistant."
샘플링 온도
설명:
- 값이 높을수록 출력이 더 발산적이고, 낮을수록 더 확정적입니다
- 권장 범위
[0, 1]
0 <= x <= 11
핵 샘플링 임계값
설명:
- 범위
[0, 1] - temperature와 top_p를 동시에 조정하지 않는 것을 권장합니다
0 <= x <= 10.9
확률이 가장 높은 K개의 token 중에서만 샘플링합니다(Anthropic 고유 파라미터)
설명:
- 값이 작을수록 출력이 더 확정적이고, 클수록 후보가 더 다양합니다
x >= 010
사용자 정의 중지 시퀀스: 생성이 그중 어느 문자열에라도 적중하면 중지합니다
설명:
- 적중 시 잘리며, 적중 지점 이전 내용은 정상적으로 반환됩니다
- 주의: 중지 시퀀스에 적중할 때 GLM 시리즈의
stop_reason은end_turn을 반환하며(Anthropic 표준인stop_sequence가 아님), 응답에도stop_sequence필드가 포함되지 않습니다. 클라이언트가stop_reason=="stop_sequence"로 적중을 판단한다면 별도 처리가 필요합니다
["\n\n"]
SSE로 스트리밍 반환할지 여부
true: Server-Sent Events 스트리밍 반환(표준 Anthropic 이벤트 시퀀스: message_start / content_block_start / content_block_delta / message_delta / message_stop)false: 완전한 응답 후 한 번에 반환(기본값)
false
사고 모드 설정입니다. 모든 모델에서 기본으로 켜져 있습니다. 응답의 thinking 블록은 출력 토큰으로 과금되며 signature는 빈 문자열일 수 있습니다.
- glm-5.2: thinking.type=disabled로 사고를 끌 수 있습니다.
- glm-5.3 / glm-5.3-flash / glm-5.3-flashx: 사고가 항상 켜져 있습니다. disabled를 보내도 기본 사고 모드와 출력 토큰 과금이 유지됩니다.
thinking.budget_tokens와 thinking.effort는 GLM 사고 수준을 설정하지 않습니다. 호환 값은 최상위 reasoning_effort 필드를 참고하세요. glm-5.2에서 사고를 끄던 설정은 5.3 시리즈로 바꾼 뒤에는 사고를 끄지 않습니다.
Show child attributes
Show child attributes
요청 최상위에 두는 GLM 사고 수준 호환 필드로 thinking 객체에 속하지 않습니다. 이 엔드포인트는 필드를 받지만 실제 사고 강도를 제어할 수 있다고 보장하지는 않습니다.
glm-5.3 / glm-5.3-flash / glm-5.3-flashx 호환 규칙
| 전달 값 | 호환 값 |
|---|---|
low / high / max | 해당 수준 유지 |
xhigh | max |
medium | high |
minimal / none | low, 사고 유지 |
minimal과 none은 5.3 시리즈의 사고를 끄지 않습니다. 사고 토큰은 출력으로 과금됩니다. 알 수 없는 값은 호환 변환 없이 원래 값을 유지하므로 표에 나온 값을 사용하세요. 이 규칙은 glm-5.2에는 적용되지 않습니다.
사고 강도를 조절하려면 Chat Completions의 reasoning_effort 또는 Responses의 reasoning.effort를 사용하세요.
max, xhigh, high, medium, low, minimal, none 도구 정의 목록
설명:
- Anthropic tool 정의 규범을 따릅니다
input_schema는 JSON Schema 객체를 사용합니다- 모델은 표준
tool_useblock을 반환하며,stop_reason=tool_use입니다
Show child attributes
Show child attributes
도구 선택 전략
Show child attributes
Show child attributes
요청 메타데이터
Show child attributes
Show child attributes
응답
메시지 객체
Anthropic 스타일의 메시지 응답
메시지 고유 ID(형식: msg_<uuid>)
응답 객체 유형
message assistant 실제 사용된 모델
"glm-5.3"
응답 콘텐츠 블록 목록
포함될 수 있는 block type:
thinking: 추론 과정(사고가 켜져 있을 때, 기본적으로 켜짐)text: 최종 답변 텍스트tool_use: 모델이 발생시킨 도구 호출
Show child attributes
Show child attributes
중지 사유
end_turn: 자연스러운 종료(stop_sequences에 적중할 때도 이 값을 반환)max_tokens: max_tokens 상한 도달tool_use: 모델이 도구 호출을 트리거
end_turn, max_tokens, tool_use Token 사용 통계(Anthropic 규범)
Show child attributes
Show child attributes