curl --request POST \
--url https://direct.evolink.ai/v1/responses \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3-flash",
"input": "Preséntate en una frase.",
"max_output_tokens": 1024,
"reasoning": {
"effort": "low"
}
}
'{
"id": "response_demo",
"object": "response",
"created_at": 1789971757,
"model": "glm-5.3-flash",
"status": "completed",
"output": [
{
"type": "message",
"id": "message_demo",
"status": "completed",
"role": "assistant",
"content": [
{
"type": "output_text",
"text": "Hola, soy GLM. Puedo ayudarte a conversar, escribir y programar.",
"annotations": []
}
]
}
],
"usage": {
"input_tokens": 17,
"output_tokens": 24,
"total_tokens": 41,
"input_tokens_details": {
"cached_tokens": 0
},
"output_tokens_details": {
"reasoning_tokens": 0
}
},
"error": null
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}Interfaz de todos los modelos GLM - Inicio rápido de Responses
Invoca GLM con model e input. Modelos admitidos: glm-5.3, glm-5.3-flash, glm-5.3-flashx y glm-5.2. Configura max_output_tokens en 1024 o más para dejar espacio para el razonamiento y la respuesta.
Consulta más ejemplos y diferencias entre modelos en la referencia completa.
curl --request POST \
--url https://direct.evolink.ai/v1/responses \
--header 'Authorization: Bearer <token>' \
--header 'Content-Type: application/json' \
--data '
{
"model": "glm-5.3-flash",
"input": "Preséntate en una frase.",
"max_output_tokens": 1024,
"reasoning": {
"effort": "low"
}
}
'{
"id": "response_demo",
"object": "response",
"created_at": 1789971757,
"model": "glm-5.3-flash",
"status": "completed",
"output": [
{
"type": "message",
"id": "message_demo",
"status": "completed",
"role": "assistant",
"content": [
{
"type": "output_text",
"text": "Hola, soy GLM. Puedo ayudarte a conversar, escribir y programar.",
"annotations": []
}
]
}
],
"usage": {
"input_tokens": 17,
"output_tokens": 24,
"total_tokens": 41,
"input_tokens_details": {
"cached_tokens": 0
},
"output_tokens_details": {
"reasoning_tokens": 0
}
},
"error": null
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}{
"error": {
"message": "<string>",
"type": "<string>",
"param": "<string>",
"code": "<string>"
}
}https://direct.evolink.ai, que ofrece mejor compatibilidad con los modelos de texto y las conexiones de larga duración. https://api.evolink.ai es el endpoint principal para los servicios multimodales y sirve como dirección de respaldo para los modelos de texto.reasoning.effort anidado, en lugar de reasoning_effort o thinking en el nivel superior. Los tokens de razonamiento están incluidos en output_tokens. Las tareas simples pueden devolver reasoning_tokens=0; eso no significa que se pueda desactivar el razonamiento.Intensidad de razonamiento; se recomienda low.Reglas de compatibilidad de glm-5.3 / glm-5.3-flash / glm-5.3-flashx| Valor enviado | Nivel efectivo de razonamiento |
|---|---|
low / high / max | Sin cambios |
xhigh | max |
medium | high |
minimal / none | low; el razonamiento sigue activo |
minimal y none no desactivan el razonamiento de la serie 5.3. Sus tokens se facturan como salida. Los valores desconocidos se mantienen sin conversión de compatibilidad; usa los valores indicados. Estas reglas no se aplican a glm-5.2.En este endpoint, glm-5.2 puede seguir produciendo tokens de razonamiento con none. Este valor no garantiza su desactivación.Leer la respuesta
Elementos de salida ordenados. Extrae text de las entradas content contype=output_text dentro de los elementos type=message. reasoning puede preceder a la respuesta y los turnos function_call pueden no tener texto. No leas siempre output[0].
Una vez analizado el JSON de respuesta en response, extrae el texto así:
text = "".join(
part["text"]
for item in response.get("output", [])
if item.get("type") == "message"
for part in item.get("content", [])
if part.get("type") == "output_text"
)
print(text)
max_output_tokens, no max_tokens.Autorizaciones
Envía Bearer YOUR_API_KEY en la cabecera Authorization.
Cuerpo
Elige un modelo GLM. Los cuatro admiten texto en este endpoint. Las funciones opcionales varían según el modelo.
| ID del modelo | Entrada | Notas de razonamiento |
|---|---|---|
glm-5.3 | Texto | Niveles efectivos: low / high / max; valores compatibles en reasoning. No se puede desactivar el razonamiento. |
glm-5.3-flash | Texto, imágenes | Igual que glm-5.3; usa input_image para las imágenes. |
glm-5.3-flashx | Texto, imágenes | Igual que glm-5.3; usa input_image para las imágenes. |
glm-5.2 | Texto | none puede seguir produciendo tokens de razonamiento y no garantiza su desactivación. |
glm-5.3, glm-5.3-flash, glm-5.3-flashx, glm-5.2 "glm-5.3-flash"
Obligatorio. Cadena de texto o array de elementos de entrada Responses. El array admite mensajes, elementos de salida del modelo reenviados y function_call_output. Para varios turnos, incluye el historial completo en cada solicitud. Coloca el prompt del sistema al principio como mensaje role=system. Las imágenes usan input_image, solo con glm-5.3-flash y glm-5.3-flashx. No uses el formato de bloques messages / image_url de Chat Completions.
"Preséntate en una frase."
Máximo de tokens de salida de esta generación, incluido el razonamiento. Empieza con 1024 y ajusta según la tarea. Un límite pequeño puede agotarse durante el razonamiento y devolver solo elementos reasoning, sin respuesta. Comprueba status e incomplete_details. El parámetro se llama max_output_tokens, no max_tokens.
x >= 11024
Activa el streaming SSE. Lee el texto en delta de response.output_text.delta. El evento final de éxito es response.completed. Finaliza el turno y gestiona también response.incomplete, response.failed o error. No esperes únicamente [DONE] o el cierre de la conexión.
Responses usa reasoning.effort anidado, en lugar de reasoning_effort o thinking en el nivel superior. Los tokens de razonamiento están incluidos en output_tokens. Las tareas simples pueden devolver reasoning_tokens=0; eso no significa que se pueda desactivar el razonamiento.
Show child attributes
Show child attributes
Respuesta
Generación terminada o resultado incompleto; comprueba status. En streaming se devuelve text/event-stream.
ID de esta respuesta. Pásalo sin cambios en previous_response_id.
"response_demo"
"response"Fecha de creación en segundos Unix.
"glm-5.3-flash"
completed indica que ha terminado la generación del turno, posiblemente solo con llamadas a herramientas. incomplete indica una salida incompleta. Comprueba output y error.
completed, incomplete, failed, in_progress, queued Elementos de salida ordenados. Extrae text de las entradas content con type=output_text dentro de los elementos type=message. reasoning puede preceder a la respuesta y los turnos function_call pueden no tener texto. No leas siempre output[0].
Show child attributes
Show child attributes
Texto de respuesta agregado opcional; puede faltar. Los clientes genéricos deben recorrer output.
Show child attributes
Show child attributes
Error de respuesta; normalmente null si la solicitud tiene éxito.
Show child attributes
Show child attributes
Show child attributes
Show child attributes