Skip to main content
POST
BaseURL: 기본 BaseURL은 https://direct.evolink.ai이며, 텍스트 모델과 장시간 연결을 더 잘 지원합니다. https://api.evolink.ai는 멀티모달 서비스의 기본 엔드포인트이자 텍스트 모델의 대체 주소 역할을 합니다.
POST /v1/responses를 사용하고 model로 모델을 선택합니다. 필수 필드는 model과 input입니다. 예시에는 바로 시작할 수 있도록 출력 예산과 추론 강도도 설정되어 있습니다.
Responses는 최상위 reasoning_effortthinking 대신 중첩된 reasoning.effort를 사용합니다. 사고 사용량은 output_tokens에 포함됩니다. 간단한 작업에서 reasoning_tokens=0이 반환되어도 사고를 끌 수 있다는 뜻은 아닙니다.추론 강도이며 low를 권장합니다.glm-5.3 / glm-5.3-flash / glm-5.3-flashx 호환 규칙minimalnone은 5.3 시리즈의 사고를 끄지 않습니다. 사고 토큰은 출력으로 과금됩니다. 알 수 없는 값은 호환 변환 없이 원래 값을 유지하므로 표에 나온 값을 사용하세요. 이 규칙은 glm-5.2에는 적용되지 않습니다.이 엔드포인트에서 glm-5.2none을 보내도 사고 토큰이 생성될 수 있으므로 사고 끄기를 보장하지 않습니다.

본문 읽기

순서가 있는 출력 항목입니다. type=message의 content에서 type=output_text인 항목의 text가 본문입니다. reasoning이 본문보다 먼저 올 수 있고 function_call 턴에는 본문이 없을 수도 있습니다. 항상 output[0]만 읽지 마세요. 응답 JSON을 response로 파싱한 후 다음과 같이 본문을 추출할 수 있습니다.
이번 생성의 출력 토큰 상한으로, 사고 토큰도 포함합니다. 1024부터 작업에 맞게 조정하세요. 너무 작으면 사고 중에 한도를 소진하여 본문 없이 reasoning 항목만 반환될 수 있습니다. status와 incomplete_details를 확인하세요. 매개변수 이름은 max_tokens가 아닌 max_output_tokens입니다.
도구 호출, 이미지 입력, SSE 처리, 여러 턴의 대화는 전체 매개변수 문서를 참고하세요.

인증

Authorization
string
header
필수

Authorization 헤더에 Bearer YOUR_API_KEY를 전달하세요.

본문

application/json
model
enum<string>
기본값:glm-5.3-flash
필수

GLM 모델을 선택합니다. 네 모델 모두 이 엔드포인트의 텍스트 입력을 지원하며 선택 기능은 모델마다 다릅니다.

사용 가능한 옵션:
glm-5.3,
glm-5.3-flash,
glm-5.3-flashx,
glm-5.2
예시:

"glm-5.3-flash"

input
필수

필수입니다. 텍스트 문자열 또는 Responses 입력 항목 배열입니다. 배열에는 메시지, 모델 출력의 재전송 항목, function_call_output을 포함할 수 있습니다. 여러 턴의 대화에서는 매번 전체 기록을 보낼 수 있습니다. 시스템 프롬프트는 첫 번째 role=system 메시지에 두는 것이 좋습니다. 이미지는 input_image를 사용하며 glm-5.3-flash와 glm-5.3-flashx만 지원합니다. Chat Completions의 messages / image_url 블록 형식을 사용하지 마세요.

예시:

"한 문장으로 자신을 소개해 주세요."

max_output_tokens
integer

이번 생성의 출력 토큰 상한으로, 사고 토큰도 포함합니다. 1024부터 작업에 맞게 조정하세요. 너무 작으면 사고 중에 한도를 소진하여 본문 없이 reasoning 항목만 반환될 수 있습니다. status와 incomplete_details를 확인하세요. 매개변수 이름은 max_tokens가 아닌 max_output_tokens입니다.

필수 범위: x >= 1
예시:

1024

stream
boolean
기본값:false

SSE 스트리밍을 켭니다. 본문은 response.output_text.delta의 delta에서 읽습니다. 성공 종료 이벤트는 response.completed입니다. response.incomplete, response.failed 또는 error에서도 해당 턴을 종료하고 처리하세요. [DONE]이나 연결 종료만 기다리지 마세요.

reasoning
object

Responses는 최상위 reasoning_effort나 thinking 대신 중첩된 reasoning.effort를 사용합니다. 사고 사용량은 output_tokens에 포함됩니다. 간단한 작업에서 reasoning_tokens=0이 반환되어도 사고를 끌 수 있다는 뜻은 아닙니다.

응답

생성이 완료되었거나 불완전한 결과가 반환되었습니다. status를 확인하세요. 스트리밍은 text/event-stream을 반환합니다.

id
string

이번 응답의 ID입니다. previous_response_id에 그대로 전달하세요.

예시:

"response_demo"

object
string
Allowed value: "response"
created_at
integer

생성 시간이며 Unix 초 단위입니다.

model
string
예시:

"glm-5.3-flash"

status
enum<string>

completed는 이번 턴의 생성 종료를 의미하며 도구 호출만 있을 수도 있습니다. incomplete는 출력이 불완전함을 뜻합니다. output과 error를 함께 확인하세요.

사용 가능한 옵션:
completed,
incomplete,
failed,
in_progress,
queued
output
object[]

순서가 있는 출력 항목입니다. type=message의 content에서 type=output_text인 항목의 text가 본문입니다. reasoning이 본문보다 먼저 올 수 있고 function_call 턴에는 본문이 없을 수도 있습니다. 항상 output[0]만 읽지 마세요.

output_text
string

선택적인 본문 집계 필드로, 없을 수 있습니다. 범용 클라이언트는 output을 순회해야 합니다.

usage
object
error
object | null

응답 오류이며 성공 시 보통 null입니다.

incomplete_details
object
metadata
object | null