> ## Documentation Index
> Fetch the complete documentation index at: https://evolink.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Interfaz de todos los modelos GLM - Referencia completa de Responses

> Invoca GLM en formato Responses para conversaciones de texto, streaming y llamadas a funciones. La comprensión de imágenes y la búsqueda web dependen del modelo. Los parámetros y las diferencias se explican a continuación.

<Note>
  **BaseURL**: La BaseURL predeterminada es `https://direct.evolink.ai`, que ofrece mejor compatibilidad con los modelos de texto y las conexiones de larga duración. `https://api.evolink.ai` es el endpoint principal para los servicios multimodales y sirve como dirección de respaldo para los modelos de texto.
</Note>

Invoca GLM en formato Responses para conversaciones de texto, streaming y llamadas a funciones. La comprensión de imágenes y la búsqueda web dependen del modelo. Los parámetros y las diferencias se explican a continuación.

## Modelos y diferencias de parámetros

Elige un modelo GLM. Los cuatro admiten texto en este endpoint. Las funciones opcionales varían según el modelo.

| ID del modelo    | Entrada         | Notas de razonamiento                                                                                                |
| ---------------- | --------------- | -------------------------------------------------------------------------------------------------------------------- |
| `glm-5.3`        | Texto           | Niveles efectivos: `low` / `high` / `max`; valores compatibles en reasoning. No se puede desactivar el razonamiento. |
| `glm-5.3-flash`  | Texto, imágenes | Igual que `glm-5.3`; usa `input_image` para las imágenes.                                                            |
| `glm-5.3-flashx` | Texto, imágenes | Igual que `glm-5.3`; usa `input_image` para las imágenes.                                                            |
| `glm-5.2`        | Texto           | `none` puede seguir produciendo tokens de razonamiento y no garantiza su desactivación.                              |

Responses usa `reasoning.effort` anidado, en lugar de `reasoning_effort` o `thinking` en el nivel superior. Los tokens de razonamiento están incluidos en output\_tokens. Las tareas simples pueden devolver `reasoning_tokens=0`; eso no significa que se pueda desactivar el razonamiento.

Intensidad de razonamiento; se recomienda low.

**Reglas de compatibilidad de `glm-5.3` / `glm-5.3-flash` / `glm-5.3-flashx`**

| Valor enviado          | Nivel efectivo de razonamiento      |
| ---------------------- | ----------------------------------- |
| `low` / `high` / `max` | Sin cambios                         |
| `xhigh`                | `max`                               |
| `medium`               | `high`                              |
| `minimal` / `none`     | `low`; el razonamiento sigue activo |

**`minimal` y `none` no desactivan el razonamiento de la serie 5.3.** Sus tokens se facturan como salida. Los valores desconocidos se mantienen sin conversión de compatibilidad; usa los valores indicados. Estas reglas no se aplican a glm-5.2.

En este endpoint, `glm-5.2` puede seguir produciendo tokens de razonamiento con none. Este valor no garantiza su desactivación.

## Prompts del sistema y conversaciones de varios turnos

`instructions`: Instrucciones del sistema. `glm-5.3-flash` admite este campo cuando input es una cadena. Si es un array de mensajes, coloca el prompt del sistema en el primer mensaje role=system.

```json theme={null}
{
  "model": "glm-5.3-flash",
  "input": [
    {
      "role": "system",
      "content": "Responde de forma concisa en español."
    },
    {
      "role": "user",
      "content": "Recuerda la contraseña RED-583"
    },
    {
      "role": "assistant",
      "content": "Recordado"
    },
    {
      "role": "user",
      "content": "¿Cuál es la contraseña? Responde solo con la contraseña."
    }
  ],
  "reasoning": {
    "effort": "low"
  },
  "max_output_tokens": 1024
}
```

Guarda la respuesta para referenciarla después. `glm-5.3-flash` y `glm-5.3-flashx` permiten continuar con `store=true` y previous\_response\_id. `glm-5.2` no admite la continuación mediante ID; `store=true` no la activa. Incluye el historial completo en input.

id de nivel superior de la respuesta anterior. `glm-5.3-flash` y `glm-5.3-flashx` lo admiten con `store=true` y el mismo modelo. Pasa el id de respuesta sin cambios, no el id de un elemento output. `glm-5.2` devuelve 400 para este campo. Si cambias de modelo, omítelo e incluye todo el historial en input.

## Respuestas en streaming

Activa el streaming SSE. Lee el texto en delta de response.output\_text.delta. El evento final de éxito es response.completed. Finaliza el turno y gestiona también `response.incomplete`, `response.failed` o error. No esperes únicamente \[DONE] o el cierre de la conexión.

| Evento                                                                    | Tratamiento                                                         |
| ------------------------------------------------------------------------- | ------------------------------------------------------------------- |
| `response.created` / `response.in_progress`                               | Comienza el turno.                                                  |
| `response.output_text.delta`                                              | Añade delta al texto de respuesta.                                  |
| `response.reasoning_text.delta` / `response.reasoning_summary_text.delta` | Separa el razonamiento del texto y admite ambas formas de evento.   |
| `response.output_item.done`                                               | Recoge el elemento de salida completo, como function\_call.         |
| `response.completed`                                                      | Ha terminado la generación; lee `response.output` y response.usage. |
| `response.incomplete` / `response.failed` / `error`                       | Gestiona el truncamiento o el error y termina el turno.             |

Deja de leer tras un evento final. HTTP 200 solo significa que se ha establecido el stream; comprueba el estado final del evento. Un turno con herramientas puede terminar con `response.completed` y seguir requiriendo que tu aplicación ejecute la función y envíe otra solicitud.

## Llamadas a funciones

Elige el ejemplo de función en el menú de solicitudes. Responses usa definiciones de función sin anidamiento:

```json theme={null}
{
  "type": "function",
  "name": "get_temperature",
  "description": "Devuelve la temperatura de la ciudad indicada",
  "parameters": {
    "type": "object",
    "properties": {
      "city": {
        "type": "string"
      }
    },
    "required": [
      "city"
    ],
    "additionalProperties": false
  }
}
```

1. Recorre `response.output` y recoge todos los elementos type=function\_call.
2. Analiza y valida la cadena JSON arguments y ejecuta cada función en tu aplicación.
3. Añade todo el output anterior al historial. Agrega un `function_call_output` por llamada, con el `call_id` original y un output de tipo cadena.
4. Envía el historial actualizado como input de la siguiente solicitud. El ejemplo de devolución de resultados muestra esta estructura.

<Note>
  `parallel_tool_calls`: Permite varias llamadas a herramientas por turno. false no garantiza una sola llamada a función. El cliente debe recorrer y procesar todos los function\_call.
</Note>

## Imágenes, búsqueda y salida JSON

Con `glm-5.3-flash` y `glm-5.3-flashx`, combina `input_text` e `input_image` en el array content del mensaje de usuario. Pasa una URL pública o Data URL Base64 en image\_url. Usa solo texto con `glm-5.3` y glm-5.2.

Declara `tools: [{"type":"web_search"}]`. La búsqueda se ejecuta en el servidor y devuelve elementos `web_search_call` y texto. Comprueba los elementos de salida para saber si se utilizó. Puede haber cargos por búsqueda además de los tokens; consulta el precio del modelo.

Para continuar después de una búsqueda, añade todo el `output` anterior, incluidos `web_search_call` y `message`, a `input` y después agrega tu nueva pregunta. Conserva los campos originales como `id`, `status` y `action`. El servidor ya ha ejecutado la búsqueda, por lo que no debes crear un `function_call_output` para `web_search_call`. Consulta el ejemplo de solicitud `web_search_history`.

`text.format.type`: Formato de salida: text para texto y `json_object` para un objeto JSON. Con `json_object`, pide JSON válido explícitamente en el prompt y analízalo y valídalo en el cliente. No se ofrecen restricciones estrictas de JSON Schema; `json_schema` o `strict=true` no garantizan una estructura concreta.

## Respuestas y uso

Elementos de salida ordenados. Extrae text de las entradas content con `type=output_text` dentro de los elementos type=message. reasoning puede preceder a la respuesta y los turnos `function_call` pueden no tener texto. No leas siempre output\[0].

`output_text`: Texto de respuesta agregado opcional; puede faltar. Los clientes genéricos deben recorrer output.

`output_text` en elementos message; puede ser `reasoning_text` en elementos reasoning. El razonamiento también puede devolverse mediante summary\_text. No supongas que todos los elementos reasoning tienen content.

* `usage.input_tokens`: Total de tokens de entrada, incluidos los que coinciden con la caché. `usage.input_tokens_details.cached_tokens`: Subconjunto de tokens de entrada encontrado en caché; no lo sumes de nuevo a input\_tokens. La caché de prefijos es automática y no requiere `cache_control` explícito. Usa el valor devuelto para conocer los aciertos.
* `usage.output_tokens`: Total de tokens de salida, incluido el razonamiento. `usage.output_tokens_details.reasoning_tokens`: Subconjunto de tokens de salida usado para razonar; no lo cuentes de nuevo en output\_tokens. Este detalle puede faltar o valer 0.

`status=incomplete` con `incomplete_details.reason=max_output_tokens` indica que se agotó el presupuesto. Puede haber razonamiento sin respuesta; aumenta el límite de salida.


## OpenAPI

````yaml es/api-manual/language-series/glm/responses/responses-reference.json POST /v1/responses
openapi: 3.1.0
info:
  title: Interfaz de todos los modelos GLM - Referencia completa de Responses
  description: >-
    Invoca la serie GLM de Zhipu mediante el formato Responses compatible con
    OpenAI. Admite glm-5.3, glm-5.3-flash, glm-5.3-flashx y glm-5.2. Las
    funciones opcionales varían según el modelo.
  license:
    name: MIT
  version: 1.0.0
servers:
  - url: https://direct.evolink.ai
    description: Producción (recomendado)
  - url: https://api.evolink.ai
    description: URL alternativa
security:
  - bearerAuth: []
tags:
  - name: Responses
    description: API GLM Responses
paths:
  /v1/responses:
    post:
      tags:
        - Responses
      summary: API GLM Responses (referencia completa)
      description: >-
        Invoca GLM en formato Responses para conversaciones de texto, streaming
        y llamadas a funciones. La comprensión de imágenes y la búsqueda web
        dependen del modelo. Los parámetros y las diferencias se explican a
        continuación.
      operationId: createGLMResponse
      requestBody:
        required: true
        content:
          application/json:
            schema:
              $ref: '#/components/schemas/ResponsesRequest'
            examples:
              basic:
                summary: Conversación de texto básica
                value:
                  model: glm-5.3-flash
                  input: Preséntate en una frase.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
              system_message:
                summary: Prompt del sistema y array de mensajes
                value:
                  model: glm-5.3-flash
                  input:
                    - role: system
                      content: Responde de forma concisa en español.
                    - role: user
                      content: ¿Qué es la búsqueda binaria?
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
              stream:
                summary: Salida SSE en streaming
                value:
                  model: glm-5.3-flash
                  input: Preséntate en una frase.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  stream: true
              history:
                summary: Conversación con historial
                value:
                  model: glm-5.3-flash
                  input:
                    - role: user
                      content: Recuerda la contraseña RED-583
                    - role: assistant
                      content: Recordado
                    - role: user
                      content: ¿Cuál es la contraseña? Responde solo con la contraseña.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
              function:
                summary: Llamada a función del lado del cliente
                value:
                  model: glm-5.3-flash
                  input: Consulta la temperatura en Pekín.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  tools:
                    - type: function
                      name: get_temperature
                      description: Devuelve la temperatura de la ciudad indicada
                      parameters:
                        type: object
                        properties:
                          city:
                            type: string
                        required:
                          - city
                        additionalProperties: false
                  tool_choice:
                    type: function
                    name: get_temperature
              function_result:
                summary: Devolver el resultado de una función
                description: >-
                  Sustituye el call_id del ejemplo por el valor real devuelto en
                  el turno anterior y conserva todo el output anterior.
                value:
                  model: glm-5.3-flash
                  input:
                    - role: user
                      content: Consulta la temperatura en Pekín.
                    - type: function_call
                      call_id: call_weather_demo
                      name: get_temperature
                      arguments: '{"city":"Pekín"}'
                    - type: function_call_output
                      call_id: call_weather_demo
                      output: '{"city":"Pekín","temperature":25}'
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  tools:
                    - type: function
                      name: get_temperature
                      description: Devuelve la temperatura de la ciudad indicada
                      parameters:
                        type: object
                        properties:
                          city:
                            type: string
                        required:
                          - city
                        additionalProperties: false
                  tool_choice: none
              web_search:
                summary: Búsqueda web del lado del servidor
                value:
                  model: glm-5.3-flash
                  input: >-
                    Usa la búsqueda web para encontrar el título de la página
                    principal de Python. Devuelve solo el título y el enlace a
                    la fuente.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  tools:
                    - type: web_search
                  tool_choice: required
              web_search_history:
                summary: Continuar después de una búsqueda web
                description: >-
                  En una solicitud real, sustituye los ejemplos web_search_call
                  y message por todos los elementos output originales de la
                  respuesta anterior y añade después tu nueva pregunta. Conserva
                  campos como id, status y action. No crees un
                  function_call_output para web_search_call.
                value:
                  model: glm-5.3-flash
                  input:
                    - role: user
                      content: >-
                        Usa la búsqueda web para encontrar el título de la
                        página principal de Python. Devuelve solo el título y el
                        enlace a la fuente.
                    - type: web_search_call
                      id: ws_search_demo
                      status: completed
                      action:
                        type: open_page
                        url: https://www.python.org
                    - type: message
                      id: msg_search_demo
                      status: completed
                      role: assistant
                      content:
                        - type: output_text
                          text: Welcome to Python.org — https://www.python.org
                          annotations: []
                    - role: user
                      content: >-
                        ¿Qué título de la página de inicio encontraste en el
                        turno anterior? Devuelve solo el título, sin volver a
                        buscar.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
              json_object:
                summary: Salida de objeto JSON
                value:
                  model: glm-5.3-flash
                  input: >-
                    Devuelve únicamente un objeto JSON válido con el campo city
                    igual a Beijing. Sin Markdown.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  text:
                    format:
                      type: json_object
              image:
                summary: Comprensión de imágenes (ejemplo Flash)
                description: El ejemplo es una Data URL de una imagen PNG roja.
                value:
                  model: glm-5.3-flash
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  input:
                    - role: user
                      content:
                        - type: input_text
                          text: >-
                            La imagen es de un solo color. Responde solo con su
                            color.
                        - type: input_image
                          image_url: >-
                            data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAAIAAAACACAIAAABMXPacAAABK0lEQVR4nO3RMQEAMAyAsLb+PW8y8hADHOybSEfraYDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANGOsDz+EB/5Uf+TQAAAAASUVORK5CYII=
              store:
                summary: Crear una respuesta para referenciarla después (Flash)
                value:
                  model: glm-5.3-flash
                  input: Recuerda la contraseña BLUE-728. Responde solo Recordado.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  store: true
              previous_response:
                summary: Referenciar la respuesta anterior (Flash)
                description: >-
                  Ejecuta primero el ejemplo que guarda una respuesta y asigna
                  su id de nivel superior a previous_response_id. glm-5.2 no
                  admite esta forma de continuar la conversación.
                value:
                  model: glm-5.3-flash
                  input: ¿Cuál era la contraseña? Responde solo con la contraseña.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  previous_response_id: ID de respuesta devuelto en el turno anterior
              flashx:
                summary: Invocar GLM-5.3-FlashX
                value:
                  model: glm-5.3-flashx
                  input: Preséntate en una frase.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
              vision_flashx:
                summary: Entrada de imagen de GLM-5.3-FlashX
                value:
                  model: glm-5.3-flashx
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  input:
                    - role: user
                      content:
                        - type: input_text
                          text: >-
                            La imagen es de un solo color. Responde solo con su
                            color.
                        - type: input_image
                          image_url: >-
                            data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAAIAAAACACAIAAABMXPacAAABK0lEQVR4nO3RMQEAMAyAsLb+PW8y8hADHOybSEfraYDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANGOsDz+EB/5Uf+TQAAAAASUVORK5CYII=
      responses:
        '200':
          description: >-
            Generación terminada o resultado incompleto; comprueba status. En
            streaming se devuelve text/event-stream.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ResponsesResponse'
              example:
                id: response_demo
                object: response
                created_at: 1789971757
                model: glm-5.3-flash
                status: completed
                output:
                  - type: message
                    id: message_demo
                    status: completed
                    role: assistant
                    content:
                      - type: output_text
                        text: >-
                          Hola, soy GLM. Puedo ayudarte a conversar, escribir y
                          programar.
                        annotations: []
                usage:
                  input_tokens: 17
                  output_tokens: 24
                  total_tokens: 41
                  input_tokens_details:
                    cached_tokens: 0
                  output_tokens_details:
                    reasoning_tokens: 0
                error: null
            text/event-stream:
              schema:
                type: string
              example: >+
                event: response.output_text.delta

                data:
                {"type":"response.output_text.delta","item_id":"message_demo","output_index":0,"content_index":0,"delta":"Hola"}


                event: response.completed

                data:
                {"type":"response.completed","response":{"id":"response_demo","object":"response","created_at":1789971757,"model":"glm-5.3-flash","status":"completed","output":[{"type":"message","id":"message_demo","status":"completed","role":"assistant","content":[{"type":"output_text","text":"Hola","annotations":[]}]}],"usage":{"input_tokens":17,"output_tokens":3,"total_tokens":20},"error":null}}

        '400':
          description: >-
            Parámetros no válidos: por ejemplo, falta input, reasoning tiene un
            formato incorrecto o el modelo no admite previous_response_id.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
        '401':
          description: La clave API no es válida o ha caducado.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
        '402':
          description: Créditos disponibles insuficientes.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
        '429':
          description: >-
            Se ha superado el límite de solicitudes. Reintenta aumentando el
            tiempo de espera.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
        '500':
          description: Error del servidor.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
        '503':
          description: Servicio no disponible temporalmente. Inténtalo más tarde.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
components:
  schemas:
    ResponsesRequest:
      type: object
      properties:
        model:
          type: string
          description: >-
            Elige un modelo GLM. Los cuatro admiten texto en este endpoint. Las
            funciones opcionales varían según el modelo.


            | ID del modelo | Entrada | Notas de razonamiento |

            | --- | --- | --- |

            | `glm-5.3` | Texto | Niveles efectivos: low / high / max; valores
            compatibles en reasoning. No se puede desactivar el razonamiento. |

            | `glm-5.3-flash` | Texto, imágenes | Igual que glm-5.3; usa
            input_image para las imágenes. |

            | `glm-5.3-flashx` | Texto, imágenes | Igual que glm-5.3; usa
            input_image para las imágenes. |

            | `glm-5.2` | Texto | none puede seguir produciendo tokens de
            razonamiento y no garantiza su desactivación. |
          enum:
            - glm-5.3
            - glm-5.3-flash
            - glm-5.3-flashx
            - glm-5.2
          default: glm-5.3-flash
          example: glm-5.3-flash
        input:
          description: >-
            Obligatorio. Cadena de texto o array de elementos de entrada
            Responses. El array admite mensajes, elementos de salida del modelo
            reenviados y function_call_output. Para varios turnos, incluye el
            historial completo en cada solicitud. Coloca el prompt del sistema
            al principio como mensaje role=system. Las imágenes usan
            input_image, solo con glm-5.3-flash y glm-5.3-flashx. No uses el
            formato de bloques messages / image_url de Chat Completions.
          oneOf:
            - type: string
            - type: array
              items:
                $ref: '#/components/schemas/InputItem'
          example: Preséntate en una frase.
        max_output_tokens:
          type: integer
          minimum: 1
          description: >-
            Máximo de tokens de salida de esta generación, incluido el
            razonamiento. Empieza con 1024 y ajusta según la tarea. Un límite
            pequeño puede agotarse durante el razonamiento y devolver solo
            elementos reasoning, sin respuesta. Comprueba status e
            incomplete_details. El parámetro se llama max_output_tokens, no
            max_tokens.
          example: 1024
        stream:
          type: boolean
          default: false
          description: >-
            Activa el streaming SSE. Lee el texto en delta de
            response.output_text.delta. El evento final de éxito es
            response.completed. Finaliza el turno y gestiona también
            response.incomplete, response.failed o error. No esperes únicamente
            [DONE] o el cierre de la conexión.
        reasoning:
          type: object
          properties:
            effort:
              type: string
              description: >-
                Intensidad de razonamiento; se recomienda low.


                **Reglas de compatibilidad de glm-5.3 / glm-5.3-flash /
                glm-5.3-flashx**


                | Valor enviado | Nivel efectivo de razonamiento |

                | --- | --- |

                | `low` / `high` / `max` | Sin cambios |

                | `xhigh` | `max` |

                | `medium` | `high` |

                | `minimal` / `none` | low; el razonamiento sigue activo |


                **minimal y none no desactivan el razonamiento de la serie
                5.3.** Sus tokens se facturan como salida. Los valores
                desconocidos se mantienen sin conversión de compatibilidad; usa
                los valores indicados. Estas reglas no se aplican a glm-5.2.


                En este endpoint, glm-5.2 puede seguir produciendo tokens de
                razonamiento con none. Este valor no garantiza su desactivación.
              enum:
                - max
                - xhigh
                - high
                - medium
                - low
                - minimal
                - none
              example: low
          description: >-
            Responses usa reasoning.effort anidado, en lugar de reasoning_effort
            o thinking en el nivel superior. Los tokens de razonamiento están
            incluidos en output_tokens. Las tareas simples pueden devolver
            reasoning_tokens=0; eso no significa que se pueda desactivar el
            razonamiento.
        instructions:
          type: string
          description: >-
            Instrucciones del sistema. glm-5.3-flash admite este campo cuando
            input es una cadena. Si es un array de mensajes, coloca el prompt
            del sistema en el primer mensaje role=system.
        tools:
          type: array
          items:
            $ref: '#/components/schemas/Tool'
          description: >-
            Admite herramientas function del lado del cliente y web_search del
            lado del servidor. Declara funciones con name / description /
            parameters al mismo nivel, sin anidarlas en un objeto function como
            en Chat Completions. Tu aplicación ejecuta function_call y devuelve
            el resultado. web_search se ejecuta en el servidor; las búsquedas
            realizadas pueden tener un coste por llamada además de los tokens.
            Consulta el precio del modelo.
        tool_choice:
          description: >-
            auto permite elegir al modelo; none desactiva las herramientas;
            required exige una llamada. Para una función concreta, usa
            {"type":"function","name":"get_temperature"}. La selección forzada
            no garantiza el mismo comportamiento en todas las combinaciones de
            modelos y herramientas.
          oneOf:
            - type: string
              enum:
                - auto
                - none
                - required
            - type: object
              properties:
                type:
                  type: string
                  const: function
                name:
                  type: string
              required:
                - type
                - name
          example: auto
        parallel_tool_calls:
          type: boolean
          description: >-
            Permite varias llamadas a herramientas por turno. false no garantiza
            una sola llamada a función. El cliente debe recorrer y procesar
            todos los function_call.
        text:
          type: object
          properties:
            format:
              type: object
              properties:
                type:
                  type: string
                  description: >-
                    Formato de salida: text para texto y json_object para un
                    objeto JSON. Con json_object, pide JSON válido
                    explícitamente en el prompt y analízalo y valídalo en el
                    cliente. No se ofrecen restricciones estrictas de JSON
                    Schema; json_schema o strict=true no garantizan una
                    estructura concreta.
                  enum:
                    - text
                    - json_object
                  example: json_object
              required:
                - type
          description: >-
            Formato de salida. Los ejemplos usan json_object; HTTP 200 no
            garantiza el cumplimiento de un esquema JSON.
        store:
          type: boolean
          description: >-
            Guarda la respuesta para referenciarla después. glm-5.3-flash y
            glm-5.3-flashx permiten continuar con store=true y
            previous_response_id. glm-5.2 no admite la continuación mediante ID;
            store=true no la activa. Incluye el historial completo en input.
        previous_response_id:
          type: string
          description: >-
            id de nivel superior de la respuesta anterior. glm-5.3-flash y
            glm-5.3-flashx lo admiten con store=true y el mismo modelo. Pasa el
            id de respuesta sin cambios, no el id de un elemento output. glm-5.2
            devuelve 400 para este campo. Si cambias de modelo, omítelo e
            incluye todo el historial en input.
          example: ID de respuesta devuelto en el turno anterior
        metadata:
          type: object
          additionalProperties:
            type: string
          description: >-
            Metadatos personalizados de cadenas clave-valor, disponibles en
            metadata de la respuesta. No incluyas claves secretas ni información
            sensible.
          example:
            conversation: demo
        temperature:
          type: number
          description: >-
            Parámetro de muestreo. El rango efectivo y el comportamiento
            dependen del modelo. No garantiza una salida determinista y se puede
            omitir en tareas de razonamiento.
        top_p:
          type: number
          description: >-
            Parámetro de muestreo. El rango efectivo y el comportamiento
            dependen del modelo. Normalmente se puede omitir.
      required:
        - model
        - input
    ResponsesResponse:
      type: object
      properties:
        id:
          type: string
          description: ID de esta respuesta. Pásalo sin cambios en previous_response_id.
          example: response_demo
        object:
          type: string
          const: response
        created_at:
          type: integer
          description: Fecha de creación en segundos Unix.
        model:
          type: string
          example: glm-5.3-flash
        status:
          type: string
          description: >-
            completed indica que ha terminado la generación del turno,
            posiblemente solo con llamadas a herramientas. incomplete indica una
            salida incompleta. Comprueba output y error.
          enum:
            - completed
            - incomplete
            - failed
            - in_progress
            - queued
        output:
          type: array
          items:
            $ref: '#/components/schemas/OutputItem'
          description: >-
            Elementos de salida ordenados. Extrae text de las entradas content
            con type=output_text dentro de los elementos type=message. reasoning
            puede preceder a la respuesta y los turnos function_call pueden no
            tener texto. No leas siempre output[0].
        output_text:
          type: string
          description: >-
            Texto de respuesta agregado opcional; puede faltar. Los clientes
            genéricos deben recorrer output.
        usage:
          $ref: '#/components/schemas/Usage'
        error:
          type:
            - object
            - 'null'
          description: Error de respuesta; normalmente null si la solicitud tiene éxito.
          additionalProperties: true
        incomplete_details:
          type: object
          properties:
            reason:
              type: string
              description: Detalles de una salida truncada, por ejemplo max_output_tokens.
        metadata:
          type:
            - object
            - 'null'
          additionalProperties:
            type: string
    ErrorResponse:
      type: object
      properties:
        error:
          type: object
          properties:
            message:
              type: string
            type:
              type: string
            param:
              type:
                - string
                - 'null'
            code:
              type:
                - string
                - integer
                - 'null'
      required:
        - error
    InputItem:
      description: >-
        Mensaje, resultado de función o elemento copiado sin cambios del output
        anterior. Para resultados de herramientas, usa el call_id devuelto y
        conserva los campos originales de los elementos de salida anteriores.
      oneOf:
        - $ref: '#/components/schemas/InputMessage'
        - $ref: '#/components/schemas/FunctionCallOutput'
        - type: object
          properties:
            type:
              type: string
              description: Tipo del elemento de salida reenviado.
              enum:
                - function_call
                - reasoning
                - web_search_call
            id:
              type: string
            call_id:
              type: string
            name:
              type: string
            arguments:
              type: string
              description: Argumentos codificados como cadena JSON.
            status:
              type: string
            action:
              type: object
              additionalProperties: true
              description: Acción de búsqueda o acceso a una página de web_search_call.
          required:
            - type
    Tool:
      oneOf:
        - type: object
          properties:
            type:
              type: string
              const: function
            name:
              type: string
            description:
              type: string
            parameters:
              type: object
              description: JSON Schema de los parámetros de la función.
            strict:
              type: boolean
              description: >-
                Opción de restricción de argumentos de función. El cliente debe
                seguir analizando y validando arguments antes de ejecutar la
                función.
          required:
            - type
            - name
            - parameters
        - type: object
          properties:
            type:
              type: string
              const: web_search
          required:
            - type
    OutputItem:
      type: object
      properties:
        type:
          type: string
          description: >-
            Tipos habituales: message, reasoning, function_call y
            web_search_call.
          enum:
            - message
            - reasoning
            - function_call
            - web_search_call
        id:
          type: string
        status:
          type: string
        role:
          type: string
        content:
          type: array
          items:
            type: object
            properties:
              type:
                type: string
              text:
                type: string
              annotations:
                type: array
                items:
                  type: object
          description: >-
            output_text en elementos message; puede ser reasoning_text en
            elementos reasoning.
        summary:
          type: array
          items:
            type: object
            properties:
              type:
                type: string
              text:
                type: string
          description: >-
            El razonamiento también puede devolverse mediante summary_text. No
            supongas que todos los elementos reasoning tienen content.
        call_id:
          type: string
          description: Identificador de la llamada a función para devolver su resultado.
        name:
          type: string
          description: Nombre de la función.
        arguments:
          type: string
          description: >-
            Argumentos de la función como cadena JSON. Analízalos y valídalos
            antes de ejecutarla.
        action:
          type: object
          additionalProperties: true
          description: Acción de búsqueda o acceso a una página de web_search_call.
      required:
        - type
    Usage:
      type: object
      properties:
        input_tokens:
          type: integer
          description: >-
            Total de tokens de entrada, incluidos los que coinciden con la
            caché.
        output_tokens:
          type: integer
          description: Total de tokens de salida, incluido el razonamiento.
        total_tokens:
          type: integer
          description: Suma de tokens de entrada y salida.
        input_tokens_details:
          type: object
          properties:
            cached_tokens:
              type: integer
              description: >-
                Subconjunto de tokens de entrada encontrado en caché; no lo
                sumes de nuevo a input_tokens. La caché de prefijos es
                automática y no requiere cache_control explícito. Usa el valor
                devuelto para conocer los aciertos.
        output_tokens_details:
          type: object
          properties:
            reasoning_tokens:
              type: integer
              description: >-
                Subconjunto de tokens de salida usado para razonar; no lo
                cuentes de nuevo en output_tokens. Este detalle puede faltar o
                valer 0.
    InputMessage:
      type: object
      properties:
        role:
          type: string
          enum:
            - system
            - user
            - assistant
        content:
          description: >-
            Cadena de texto o array de bloques de entrada. Al reenviar una
            salida assistant existente, puedes conservar sus bloques output_text
            sin cambios.
          oneOf:
            - type: string
            - type: array
              items:
                oneOf:
                  - $ref: '#/components/schemas/InputText'
                  - $ref: '#/components/schemas/InputImage'
                  - $ref: '#/components/schemas/OutputText'
      required:
        - role
        - content
    FunctionCallOutput:
      type: object
      properties:
        type:
          type: string
          const: function_call_output
        call_id:
          type: string
          description: call_id del function_call original.
        output:
          type: string
          description: Resultado de función, normalmente una cadena codificada en JSON.
      required:
        - type
        - call_id
        - output
    InputText:
      type: object
      properties:
        type:
          type: string
          const: input_text
        text:
          type: string
      required:
        - type
        - text
    InputImage:
      type: object
      properties:
        type:
          type: string
          const: input_image
        image_url:
          type: string
          description: >-
            URL pública de imagen o Data URL Base64, como
            data:image/png;base64,... para PNG. Solo glm-5.3-flash /
            glm-5.3-flashx admiten imágenes; usa solo texto con glm-5.3 y
            glm-5.2.
      required:
        - type
        - image_url
    OutputText:
      type: object
      properties:
        type:
          type: string
          const: output_text
        text:
          type: string
        annotations:
          type: array
          items:
            type: object
      required:
        - type
        - text
  securitySchemes:
    bearerAuth:
      type: http
      scheme: bearer
      description: Envía Bearer YOUR_API_KEY en la cabecera Authorization.

````