Skip to main content
POST
BaseURL: La BaseURL predeterminada es https://direct.evolink.ai, que ofrece mejor compatibilidad con los modelos de texto y las conexiones de larga duración. https://api.evolink.ai es el endpoint principal para los servicios multimodales y sirve como dirección de respaldo para los modelos de texto.
Usa POST /v1/responses y selecciona el modelo con model. Los campos mínimos obligatorios son model e input. Los ejemplos también configuran el presupuesto de salida y la intensidad de razonamiento para empezar.
Responses usa reasoning.effort anidado, en lugar de reasoning_effort o thinking en el nivel superior. Los tokens de razonamiento están incluidos en output_tokens. Las tareas simples pueden devolver reasoning_tokens=0; eso no significa que se pueda desactivar el razonamiento.Intensidad de razonamiento; se recomienda low.Reglas de compatibilidad de glm-5.3 / glm-5.3-flash / glm-5.3-flashxminimal y none no desactivan el razonamiento de la serie 5.3. Sus tokens se facturan como salida. Los valores desconocidos se mantienen sin conversión de compatibilidad; usa los valores indicados. Estas reglas no se aplican a glm-5.2.En este endpoint, glm-5.2 puede seguir produciendo tokens de razonamiento con none. Este valor no garantiza su desactivación.

Leer la respuesta

Elementos de salida ordenados. Extrae text de las entradas content con type=output_text dentro de los elementos type=message. reasoning puede preceder a la respuesta y los turnos function_call pueden no tener texto. No leas siempre output[0]. Una vez analizado el JSON de respuesta en response, extrae el texto así:
Máximo de tokens de salida de esta generación, incluido el razonamiento. Empieza con 1024 y ajusta según la tarea. Un límite pequeño puede agotarse durante el razonamiento y devolver solo elementos reasoning, sin respuesta. Comprueba status e incomplete_details. El parámetro se llama max_output_tokens, no max_tokens.
Consulta herramientas, imágenes, SSE y conversaciones de varios turnos en la referencia completa.

Autorizaciones

Authorization
string
header
requerido

Envía Bearer YOUR_API_KEY en la cabecera Authorization.

Cuerpo

application/json
model
enum<string>
predeterminado:glm-5.3-flash
requerido

Elige un modelo GLM. Los cuatro admiten texto en este endpoint. Las funciones opcionales varían según el modelo.

Opciones disponibles:
glm-5.3,
glm-5.3-flash,
glm-5.3-flashx,
glm-5.2
Ejemplo:

"glm-5.3-flash"

input
requerido

Obligatorio. Cadena de texto o array de elementos de entrada Responses. El array admite mensajes, elementos de salida del modelo reenviados y function_call_output. Para varios turnos, incluye el historial completo en cada solicitud. Coloca el prompt del sistema al principio como mensaje role=system. Las imágenes usan input_image, solo con glm-5.3-flash y glm-5.3-flashx. No uses el formato de bloques messages / image_url de Chat Completions.

Ejemplo:

"Preséntate en una frase."

max_output_tokens
integer

Máximo de tokens de salida de esta generación, incluido el razonamiento. Empieza con 1024 y ajusta según la tarea. Un límite pequeño puede agotarse durante el razonamiento y devolver solo elementos reasoning, sin respuesta. Comprueba status e incomplete_details. El parámetro se llama max_output_tokens, no max_tokens.

Rango requerido: x >= 1
Ejemplo:

1024

stream
boolean
predeterminado:false

Activa el streaming SSE. Lee el texto en delta de response.output_text.delta. El evento final de éxito es response.completed. Finaliza el turno y gestiona también response.incomplete, response.failed o error. No esperes únicamente [DONE] o el cierre de la conexión.

reasoning
object

Responses usa reasoning.effort anidado, en lugar de reasoning_effort o thinking en el nivel superior. Los tokens de razonamiento están incluidos en output_tokens. Las tareas simples pueden devolver reasoning_tokens=0; eso no significa que se pueda desactivar el razonamiento.

Respuesta

Generación terminada o resultado incompleto; comprueba status. En streaming se devuelve text/event-stream.

id
string

ID de esta respuesta. Pásalo sin cambios en previous_response_id.

Ejemplo:

"response_demo"

object
string
Allowed value: "response"
created_at
integer

Fecha de creación en segundos Unix.

model
string
Ejemplo:

"glm-5.3-flash"

status
enum<string>

completed indica que ha terminado la generación del turno, posiblemente solo con llamadas a herramientas. incomplete indica una salida incompleta. Comprueba output y error.

Opciones disponibles:
completed,
incomplete,
failed,
in_progress,
queued
output
object[]

Elementos de salida ordenados. Extrae text de las entradas content con type=output_text dentro de los elementos type=message. reasoning puede preceder a la respuesta y los turnos function_call pueden no tener texto. No leas siempre output[0].

output_text
string

Texto de respuesta agregado opcional; puede faltar. Los clientes genéricos deben recorrer output.

usage
object
error
object | null

Error de respuesta; normalmente null si la solicitud tiene éxito.

incomplete_details
object
metadata
object | null