curl --request POST \
--url https://direct.evolink.ai/v1/responses \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3-flash",
"input": "한 문장으로 자신을 소개해 주세요.",
"max_output_tokens": 1024,
"reasoning": {
"effort": "low"
}
}
'{
"id": "response_demo",
"object": "response",
"created_at": 1789971757,
"model": "glm-5.3-flash",
"status": "completed",
"output": [
{
"type": "message",
"id": "message_demo",
"status": "completed",
"role": "assistant",
"content": [
{
"type": "output_text",
"text": "안녕하세요, GLM입니다. 대화, 글쓰기, 코딩을 도와드립니다.",
"annotations": []
}
]
}
],
"usage": {
"input_tokens": 17,
"output_tokens": 24,
"total_tokens": 41,
"input_tokens_details": {
"cached_tokens": 0
},
"output_tokens_details": {
"reasoning_tokens": 0
}
},
"error": null
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}GLM 전체 모델 인터페이스 - Responses 빠른 시작
model과 input으로 GLM을 호출합니다. 지원 모델은 glm-5.3, glm-5.3-flash, glm-5.3-flashx, glm-5.2입니다. 사고와 본문을 위한 여유를 두도록 max_output_tokens를 1024 이상으로 설정하는 것이 좋습니다.
추가 예시와 모델별 차이는 전체 매개변수 문서를 참고하세요.
curl --request POST \
--url https://direct.evolink.ai/v1/responses \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3-flash",
"input": "한 문장으로 자신을 소개해 주세요.",
"max_output_tokens": 1024,
"reasoning": {
"effort": "low"
}
}
'{
"id": "response_demo",
"object": "response",
"created_at": 1789971757,
"model": "glm-5.3-flash",
"status": "completed",
"output": [
{
"type": "message",
"id": "message_demo",
"status": "completed",
"role": "assistant",
"content": [
{
"type": "output_text",
"text": "안녕하세요, GLM입니다. 대화, 글쓰기, 코딩을 도와드립니다.",
"annotations": []
}
]
}
],
"usage": {
"input_tokens": 17,
"output_tokens": 24,
"total_tokens": 41,
"input_tokens_details": {
"cached_tokens": 0
},
"output_tokens_details": {
"reasoning_tokens": 0
}
},
"error": null
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}https://direct.evolink.ai이며, 텍스트 모델과 장시간 연결을 더 잘 지원합니다. https://api.evolink.ai는 멀티모달 서비스의 기본 엔드포인트이자 텍스트 모델의 대체 주소 역할을 합니다.reasoning_effort나 thinking 대신 중첩된 reasoning.effort를 사용합니다. 사고 사용량은 output_tokens에 포함됩니다. 간단한 작업에서 reasoning_tokens=0이 반환되어도 사고를 끌 수 있다는 뜻은 아닙니다.추론 강도이며 low를 권장합니다.glm-5.3 / glm-5.3-flash / glm-5.3-flashx 호환 규칙| 전달 값 | 실제 사고 수준 |
|---|---|
low / high / max | 해당 수준 유지 |
xhigh | max |
medium | high |
minimal / none | low, 사고 유지 |
minimal과 none은 5.3 시리즈의 사고를 끄지 않습니다. 사고 토큰은 출력으로 과금됩니다. 알 수 없는 값은 호환 변환 없이 원래 값을 유지하므로 표에 나온 값을 사용하세요. 이 규칙은 glm-5.2에는 적용되지 않습니다.이 엔드포인트에서 glm-5.2에 none을 보내도 사고 토큰이 생성될 수 있으므로 사고 끄기를 보장하지 않습니다.본문 읽기
순서가 있는 출력 항목입니다.type=message의 content에서 type=output_text인 항목의 text가 본문입니다. reasoning이 본문보다 먼저 올 수 있고 function_call 턴에는 본문이 없을 수도 있습니다. 항상 output[0]만 읽지 마세요.
응답 JSON을 response로 파싱한 후 다음과 같이 본문을 추출할 수 있습니다.
text = "".join(
part["text"]
for item in response.get("output", [])
if item.get("type") == "message"
for part in item.get("content", [])
if part.get("type") == "output_text"
)
print(text)
incomplete_details를 확인하세요. 매개변수 이름은 max_tokens가 아닌 max_output_tokens입니다.인증
Authorization 헤더에 Bearer YOUR_API_KEY를 전달하세요.
본문
GLM 모델을 선택합니다. 네 모델 모두 이 엔드포인트의 텍스트 입력을 지원하며 선택 기능은 모델마다 다릅니다.
| 모델 ID | 입력 | 추론 관련 참고 사항 |
|---|---|---|
glm-5.3 | 텍스트 | 실제 수준은 low / high / max입니다. 호환 값은 reasoning을 참고하세요. 사고를 끌 수 없습니다. |
glm-5.3-flash | 텍스트, 이미지 | glm-5.3과 같습니다. 이미지는 input_image를 사용합니다. |
glm-5.3-flashx | 텍스트, 이미지 | glm-5.3과 같습니다. 이미지는 input_image를 사용합니다. |
glm-5.2 | 텍스트 | none이어도 사고 토큰이 생성될 수 있으며 사고 끄기를 보장하지 않습니다. |
glm-5.3, glm-5.3-flash, glm-5.3-flashx, glm-5.2 "glm-5.3-flash"
필수입니다. 텍스트 문자열 또는 Responses 입력 항목 배열입니다. 배열에는 메시지, 모델 출력의 재전송 항목, function_call_output을 포함할 수 있습니다. 여러 턴의 대화에서는 매번 전체 기록을 보낼 수 있습니다. 시스템 프롬프트는 첫 번째 role=system 메시지에 두는 것이 좋습니다. 이미지는 input_image를 사용하며 glm-5.3-flash와 glm-5.3-flashx만 지원합니다. Chat Completions의 messages / image_url 블록 형식을 사용하지 마세요.
"한 문장으로 자신을 소개해 주세요."
이번 생성의 출력 토큰 상한으로, 사고 토큰도 포함합니다. 1024부터 작업에 맞게 조정하세요. 너무 작으면 사고 중에 한도를 소진하여 본문 없이 reasoning 항목만 반환될 수 있습니다. status와 incomplete_details를 확인하세요. 매개변수 이름은 max_tokens가 아닌 max_output_tokens입니다.
x >= 11024
SSE 스트리밍을 켭니다. 본문은 response.output_text.delta의 delta에서 읽습니다. 성공 종료 이벤트는 response.completed입니다. response.incomplete, response.failed 또는 error에서도 해당 턴을 종료하고 처리하세요. [DONE]이나 연결 종료만 기다리지 마세요.
Responses는 최상위 reasoning_effort나 thinking 대신 중첩된 reasoning.effort를 사용합니다. 사고 사용량은 output_tokens에 포함됩니다. 간단한 작업에서 reasoning_tokens=0이 반환되어도 사고를 끌 수 있다는 뜻은 아닙니다.
Show child attributes
Show child attributes
응답
생성이 완료되었거나 불완전한 결과가 반환되었습니다. status를 확인하세요. 스트리밍은 text/event-stream을 반환합니다.
이번 응답의 ID입니다. previous_response_id에 그대로 전달하세요.
"response_demo"
"response"생성 시간이며 Unix 초 단위입니다.
"glm-5.3-flash"
completed는 이번 턴의 생성 종료를 의미하며 도구 호출만 있을 수도 있습니다. incomplete는 출력이 불완전함을 뜻합니다. output과 error를 함께 확인하세요.
completed, incomplete, failed, in_progress, queued 순서가 있는 출력 항목입니다. type=message의 content에서 type=output_text인 항목의 text가 본문입니다. reasoning이 본문보다 먼저 올 수 있고 function_call 턴에는 본문이 없을 수도 있습니다. 항상 output[0]만 읽지 마세요.
Show child attributes
Show child attributes
선택적인 본문 집계 필드로, 없을 수 있습니다. 범용 클라이언트는 output을 순회해야 합니다.
Show child attributes
Show child attributes
응답 오류이며 성공 시 보통 null입니다.
Show child attributes
Show child attributes
Show child attributes
Show child attributes