> ## Documentation Index
> Fetch the complete documentation index at: https://evolink.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# GLM Schnittstelle für alle Modelle - Responses vollständige Parameter

> Rufen Sie GLM im Responses-Format für Textgespräche, Streaming und Funktionsaufrufe auf. Bildverständnis und Websuche stehen je nach Modell zur Verfügung. Parameter und Modellunterschiede sind unten beschrieben.

<Note>
  **BaseURL**: Die Standard-BaseURL ist `https://direct.evolink.ai`, die Textmodelle und langlebige Verbindungen besser unterstützt. `https://api.evolink.ai` ist der primäre Endpunkt für multimodale Dienste und dient als Ausweichadresse für Textmodelle.
</Note>

Rufen Sie GLM im Responses-Format für Textgespräche, Streaming und Funktionsaufrufe auf. Bildverständnis und Websuche stehen je nach Modell zur Verfügung. Parameter und Modellunterschiede sind unten beschrieben.

## Modelle und Parameterunterschiede

Wählen Sie ein GLM-Modell. Alle vier unterstützen Text an diesem Endpunkt. Optionale Funktionen sind modellabhängig.

| Modell-ID        | Eingabe      | Hinweise zum Denken                                                                                         |
| ---------------- | ------------ | ----------------------------------------------------------------------------------------------------------- |
| `glm-5.3`        | Text         | Effektive Stufen: `low` / `high` / `max`; kompatible Werte unter reasoning. Denken ist nicht deaktivierbar. |
| `glm-5.3-flash`  | Text, Bilder | Wie `glm-5.3`; Bilder mit `input_image` übergeben.                                                          |
| `glm-5.3-flashx` | Text, Bilder | Wie `glm-5.3`; Bilder mit `input_image` übergeben.                                                          |
| `glm-5.2`        | Text         | `none` kann weiterhin Denk-Tokens erzeugen und garantiert keine Deaktivierung des Denkens.                  |

Responses verwendet `reasoning.effort` als verschachteltes Feld statt `reasoning_effort` oder `thinking` auf oberster Ebene. Denk-Tokens sind in `output_tokens` enthalten. Einfache Aufgaben können `reasoning_tokens=0` zurückgeben; daraus folgt nicht, dass Denken deaktivierbar ist.

Denkintensität; `low` wird empfohlen.

**Kompatibilitätsregeln für `glm-5.3` / `glm-5.3-flash` / `glm-5.3-flashx`**

| Übergebener Wert       | Effektive Denkstufe        |
| ---------------------- | -------------------------- |
| `low` / `high` / `max` | Unverändert                |
| `xhigh`                | `max`                      |
| `medium`               | `high`                     |
| `minimal` / `none`     | `low`; Denken bleibt aktiv |

**`minimal` und `none` deaktivieren das Denken der 5.3-Serie nicht.** Denk-Tokens werden als Ausgabe berechnet. Unbekannte Werte bleiben ohne Kompatibilitätszuordnung unverändert; verwenden Sie die aufgeführten Werte. Diese Zuordnungen gelten nicht für glm-5.2.

Bei diesem Endpunkt kann `glm-5.2` auch mit `none` Denk-Tokens erzeugen. Der Wert garantiert keine Deaktivierung des Denkens.

## System-Prompts und mehrere Gesprächsrunden

`instructions`: Systemanweisungen. `glm-5.3-flash` unterstützt dieses Feld bei input als String. Bei einem Nachrichtenarray gehört der System-Prompt in die erste Nachricht mit role=system.

```json theme={null}
{
  "model": "glm-5.3-flash",
  "input": [
    {
      "role": "system",
      "content": "Antworte kurz auf Deutsch."
    },
    {
      "role": "user",
      "content": "Merke dir das Kennwort RED-583"
    },
    {
      "role": "assistant",
      "content": "Gemerkt"
    },
    {
      "role": "user",
      "content": "Wie lautet das Kennwort? Antworte nur mit dem Kennwort."
    }
  ],
  "reasoning": {
    "effort": "low"
  },
  "max_output_tokens": 1024
}
```

Speichert die Antwort zur späteren Referenz. `glm-5.3-flash` und `glm-5.3-flashx` unterstützen mehrere Runden mit `store=true` und previous\_response\_id. `glm-5.2` unterstützt keine Fortsetzung per Antwort-ID; `store=true` aktiviert diese Funktion nicht. Senden Sie stattdessen den vollständigen Verlauf in input.

id der vorherigen Antwort auf oberster Ebene. `glm-5.3-flash` und `glm-5.3-flashx` unterstützen dies mit `store=true` und demselben Modell. Übergeben Sie die Antwort-ID unverändert, keine Element-ID aus output. `glm-5.2` gibt für dieses Feld 400 zurück. Für modellübergreifende Gespräche das Feld weglassen und den vollständigen Verlauf in input senden.

## Streaming-Antworten

Aktiviert SSE-Streaming. Lesen Sie den Antworttext aus delta in response.output\_text.delta. Der erfolgreiche Abschluss ist response.completed. Beenden und behandeln Sie die Runde auch bei `response.incomplete`, `response.failed` oder error. Warten Sie nicht ausschließlich auf \[DONE] oder das Schließen der Verbindung.

| Ereignis                                                                  | Verarbeitung                                                         |
| ------------------------------------------------------------------------- | -------------------------------------------------------------------- |
| `response.created` / `response.in_progress`                               | Die Gesprächsrunde beginnt.                                          |
| `response.output_text.delta`                                              | delta an den Antworttext anhängen.                                   |
| `response.reasoning_text.delta` / `response.reasoning_summary_text.delta` | Denktext vom Antworttext trennen; beide Ereignisformen unterstützen. |
| `response.output_item.done`                                               | Vollständiges Ausgabeelement sammeln, etwa function\_call.           |
| `response.completed`                                                      | Generierung beendet; `response.output` und `response.usage` lesen.   |
| `response.incomplete` / `response.failed` / `error`                       | Kürzungen oder Fehler behandeln und die Runde beenden.               |

Beenden Sie das Lesen nach einem Abschlussereignis. HTTP 200 bedeutet nur, dass der Stream aufgebaut wurde; prüfen Sie den endgültigen Ereignisstatus. Eine Werkzeugrunde kann mit `response.completed` enden, obwohl Ihre Anwendung noch eine Funktion ausführen und eine weitere Anfrage senden muss.

## Funktionsaufrufe

Wählen Sie das Funktionsbeispiel im Anfragemenü. Responses verwendet flache Funktionsdefinitionen:

```json theme={null}
{
  "type": "function",
  "name": "get_temperature",
  "description": "Liefert die Temperatur der angegebenen Stadt",
  "parameters": {
    "type": "object",
    "properties": {
      "city": {
        "type": "string"
      }
    },
    "required": [
      "city"
    ],
    "additionalProperties": false
  }
}
```

1. `response.output` durchlaufen und alle Elemente mit `type=function_call` sammeln.
2. Den JSON-String arguments parsen und validieren, danach die Funktionen in Ihrer Anwendung ausführen.
3. Das gesamte vorherige output an den Verlauf anhängen. Für jeden Aufruf ein `function_call_output` mit ursprünglicher `call_id` und output als String ergänzen.
4. Den aktualisierten Verlauf als input der nächsten Anfrage senden. Das Beispiel zur Ergebnisrückgabe zeigt diese Struktur.

<Note>
  `parallel_tool_calls`: Erlaubt mehrere Werkzeugaufrufe pro Runde. false garantiert nicht genau einen Funktionsaufruf. Clients sollten alle function\_call-Elemente durchlaufen und verarbeiten.
</Note>

## Bilder, Suche und JSON-Ausgabe

Bei `glm-5.3-flash` und `glm-5.3-flashx` können `input_text` und `input_image` im content-Array einer Benutzernachricht gemischt werden. `image_url` enthält eine öffentliche Bild-URL oder Base64 Data URL. Für `glm-5.3` und `glm-5.2` nur Text verwenden.

Deklarieren Sie `tools: [{"type":"web_search"}]`. Die Suche läuft auf dem Server und liefert web\_search\_call-Elemente sowie Antworttext. Die Ausgabeelemente zeigen, ob gesucht wurde. Zusätzlich zu Tokenkosten können Gebühren pro Suche anfallen; es gelten die Modellpreise.

Um das Gespräch nach einer Suche fortzusetzen, hängen Sie das gesamte vorherige `output` einschließlich `web_search_call` und `message` an `input` an und fügen anschließend Ihre neue Frage hinzu. Behalten Sie die ursprünglichen Felder wie `id`, `status` und `action` bei. Die Suche wurde bereits vom Server ausgeführt; erstellen Sie daher für `web_search_call` kein `function_call_output`. Siehe das Anfragebeispiel `web_search_history`.

`text.format.type`: Ausgabeformat: text für Klartext, `json_object` für ein JSON-Objekt. Fordern Sie bei `json_object` im Prompt ausdrücklich gültiges JSON an und parsen und validieren Sie es im Client. Strikte JSON-Schema-Vorgaben werden nicht angeboten; `json_schema` oder `strict=true` garantieren keine vorgegebene Struktur.

## Antworten und Nutzung

Geordnete Ausgabeelemente. Lesen Sie text aus content-Einträgen mit `type=output_text` innerhalb von Elementen mit type=message. reasoning kann vor dem Antworttext stehen; function\_call-Runden können ohne Antworttext enden. Lesen Sie nicht immer output\[0].

`output_text`: Optional zusammengefasster Antworttext; das Feld kann fehlen. Allgemeine Clients sollten output durchlaufen.

`output_text` in message-Elementen; gegebenenfalls `reasoning_text` in reasoning-Elementen. Denktext kann auch als `summary_text` zurückkommen. Nicht jedes reasoning-Element besitzt content.

* `usage.input_tokens`: Gesamte Eingabe-Tokens einschließlich Cache-Treffern. `usage.input_tokens_details.cached_tokens`: Im Cache gefundener Teil der Eingabe-Tokens; nicht nochmals zu `input_tokens` addieren. Präfix-Caching erfolgt automatisch und benötigt kein explizites cache\_control. Maßgeblich ist der zurückgegebene Trefferwert.
* `usage.output_tokens`: Gesamte Ausgabe-Tokens einschließlich Denk-Tokens. `usage.output_tokens_details.reasoning_tokens`: Für das Denken verwendeter Teil der Ausgabe-Tokens; nicht nochmals zu `output_tokens` zählen. Diese Angabe kann fehlen oder 0 sein.

`status=incomplete` mit `incomplete_details.reason=max_output_tokens` bedeutet, dass das Budget aufgebraucht ist. Es kann Denktext ohne Antwort geben; erhöhen Sie das Ausgabelimit.


## OpenAPI

````yaml de/api-manual/language-series/glm/responses/responses-reference.json POST /v1/responses
openapi: 3.1.0
info:
  title: GLM Schnittstelle für alle Modelle - Responses vollständige Parameter
  description: >-
    Rufen Sie die GLM-Serie von Zhipu im OpenAI-kompatiblen Responses-Format
    auf. Unterstützt glm-5.3, glm-5.3-flash, glm-5.3-flashx und glm-5.2.
    Optionale Funktionen hängen vom Modell ab.
  license:
    name: MIT
  version: 1.0.0
servers:
  - url: https://direct.evolink.ai
    description: Produktion (empfohlen)
  - url: https://api.evolink.ai
    description: Alternative URL
security:
  - bearerAuth: []
tags:
  - name: Responses
    description: GLM Responses API
paths:
  /v1/responses:
    post:
      tags:
        - Responses
      summary: GLM Responses API (vollständige Referenz)
      description: >-
        Rufen Sie GLM im Responses-Format für Textgespräche, Streaming und
        Funktionsaufrufe auf. Bildverständnis und Websuche stehen je nach Modell
        zur Verfügung. Parameter und Modellunterschiede sind unten beschrieben.
      operationId: createGLMResponse
      requestBody:
        required: true
        content:
          application/json:
            schema:
              $ref: '#/components/schemas/ResponsesRequest'
            examples:
              basic:
                summary: Grundlegendes Textgespräch
                value:
                  model: glm-5.3-flash
                  input: Stelle dich in einem Satz vor.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
              system_message:
                summary: System-Prompt und Nachrichtenarray
                value:
                  model: glm-5.3-flash
                  input:
                    - role: system
                      content: Antworte kurz auf Deutsch.
                    - role: user
                      content: Was ist binäre Suche?
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
              stream:
                summary: SSE-Streaming-Ausgabe
                value:
                  model: glm-5.3-flash
                  input: Stelle dich in einem Satz vor.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  stream: true
              history:
                summary: Mehrere Gesprächsrunden mit Verlauf
                value:
                  model: glm-5.3-flash
                  input:
                    - role: user
                      content: Merke dir das Kennwort RED-583
                    - role: assistant
                      content: Gemerkt
                    - role: user
                      content: Wie lautet das Kennwort? Antworte nur mit dem Kennwort.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
              function:
                summary: Clientseitiger Funktionsaufruf
                value:
                  model: glm-5.3-flash
                  input: Frage die Temperatur in Peking ab.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  tools:
                    - type: function
                      name: get_temperature
                      description: Liefert die Temperatur der angegebenen Stadt
                      parameters:
                        type: object
                        properties:
                          city:
                            type: string
                        required:
                          - city
                        additionalProperties: false
                  tool_choice:
                    type: function
                    name: get_temperature
              function_result:
                summary: Funktionsergebnis zurücksenden
                description: >-
                  Ersetzen Sie call_id im Beispiel durch den tatsächlich
                  zurückgegebenen Wert der vorherigen Runde und behalten Sie
                  deren vollständiges output bei.
                value:
                  model: glm-5.3-flash
                  input:
                    - role: user
                      content: Frage die Temperatur in Peking ab.
                    - type: function_call
                      call_id: call_weather_demo
                      name: get_temperature
                      arguments: '{"city":"Peking"}'
                    - type: function_call_output
                      call_id: call_weather_demo
                      output: '{"city":"Peking","temperature":25}'
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  tools:
                    - type: function
                      name: get_temperature
                      description: Liefert die Temperatur der angegebenen Stadt
                      parameters:
                        type: object
                        properties:
                          city:
                            type: string
                        required:
                          - city
                        additionalProperties: false
                  tool_choice: none
              web_search:
                summary: Serverseitige Websuche
                value:
                  model: glm-5.3-flash
                  input: >-
                    Suche im Web nach dem Titel der Python-Startseite. Gib nur
                    den Titel und den Quellenlink zurück.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  tools:
                    - type: web_search
                  tool_choice: required
              web_search_history:
                summary: Gespräch nach einer Websuche fortsetzen
                description: >-
                  Ersetzen Sie bei einer tatsächlichen Anfrage die Beispiele für
                  web_search_call und message durch sämtliche ursprünglichen
                  output-Einträge der vorherigen Antwort und hängen Sie dann
                  Ihre neue Frage an. Behalten Sie Felder wie id, status und
                  action bei. Erstellen Sie für web_search_call kein
                  function_call_output.
                value:
                  model: glm-5.3-flash
                  input:
                    - role: user
                      content: >-
                        Suche im Web nach dem Titel der Python-Startseite. Gib
                        nur den Titel und den Quellenlink zurück.
                    - type: web_search_call
                      id: ws_search_demo
                      status: completed
                      action:
                        type: open_page
                        url: https://www.python.org
                    - type: message
                      id: msg_search_demo
                      status: completed
                      role: assistant
                      content:
                        - type: output_text
                          text: Welcome to Python.org — https://www.python.org
                          annotations: []
                    - role: user
                      content: >-
                        Welchen Titel der Startseite hast du in der vorherigen
                        Runde gefunden? Gib nur den Titel zurück, ohne erneut zu
                        suchen.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
              json_object:
                summary: Ausgabe als JSON-Objekt
                value:
                  model: glm-5.3-flash
                  input: >-
                    Gib ausschließlich ein gültiges JSON-Objekt mit dem Feld
                    city und dem Wert Beijing aus. Kein Markdown.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  text:
                    format:
                      type: json_object
              image:
                summary: Bildverständnis (Flash-Beispiel)
                description: Das Beispiel enthält eine Data URL für ein rotes PNG-Bild.
                value:
                  model: glm-5.3-flash
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  input:
                    - role: user
                      content:
                        - type: input_text
                          text: Das Bild ist einfarbig. Antworte nur mit der Farbe.
                        - type: input_image
                          image_url: >-
                            data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAAIAAAACACAIAAABMXPacAAABK0lEQVR4nO3RMQEAMAyAsLb+PW8y8hADHOybSEfraYDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANGOsDz+EB/5Uf+TQAAAAASUVORK5CYII=
              store:
                summary: Antwort zur späteren Referenz erstellen (Flash)
                value:
                  model: glm-5.3-flash
                  input: Merke dir das Kennwort BLUE-728. Antworte nur mit Gemerkt.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  store: true
              previous_response:
                summary: Vorherige Antwort referenzieren (Flash)
                description: >-
                  Führen Sie zuerst das Beispiel zum Speichern einer Antwort
                  aus. Setzen Sie dann previous_response_id auf deren id auf
                  oberster Ebene. glm-5.2 unterstützt diese Fortsetzung nicht.
                value:
                  model: glm-5.3-flash
                  input: Wie lautete das Kennwort? Antworte nur mit dem Kennwort.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  previous_response_id: Antwort-ID aus der vorherigen Runde
              flashx:
                summary: GLM-5.3-FlashX aufrufen
                value:
                  model: glm-5.3-flashx
                  input: Stelle dich in einem Satz vor.
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
              vision_flashx:
                summary: 'GLM-5.3-FlashX: Bildeingabe'
                value:
                  model: glm-5.3-flashx
                  max_output_tokens: 1024
                  reasoning:
                    effort: low
                  input:
                    - role: user
                      content:
                        - type: input_text
                          text: Das Bild ist einfarbig. Antworte nur mit der Farbe.
                        - type: input_image
                          image_url: >-
                            data:image/png;base64,iVBORw0KGgoAAAANSUhEUgAAAIAAAACACAIAAABMXPacAAABK0lEQVR4nO3RMQEAMAyAsLb+PW8y8hADHOybSEfraYDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANwBqANQBrANYArAFYA7AGYA3AGoA1AGsA1gCsAVgDsAZgDcAagDUAawDWAKwBWAOwBmANGOsDz+EB/5Uf+TQAAAAASUVORK5CYII=
      responses:
        '200':
          description: >-
            Generierung abgeschlossen oder Ergebnis unvollständig; status
            prüfen. Streaming liefert text/event-stream.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ResponsesResponse'
              example:
                id: response_demo
                object: response
                created_at: 1789971757
                model: glm-5.3-flash
                status: completed
                output:
                  - type: message
                    id: message_demo
                    status: completed
                    role: assistant
                    content:
                      - type: output_text
                        text: >-
                          Hallo, ich bin GLM und helfe bei Gesprächen, Texten
                          und Programmieraufgaben.
                        annotations: []
                usage:
                  input_tokens: 17
                  output_tokens: 24
                  total_tokens: 41
                  input_tokens_details:
                    cached_tokens: 0
                  output_tokens_details:
                    reasoning_tokens: 0
                error: null
            text/event-stream:
              schema:
                type: string
              example: >+
                event: response.output_text.delta

                data:
                {"type":"response.output_text.delta","item_id":"message_demo","output_index":0,"content_index":0,"delta":"Hallo"}


                event: response.completed

                data:
                {"type":"response.completed","response":{"id":"response_demo","object":"response","created_at":1789971757,"model":"glm-5.3-flash","status":"completed","output":[{"type":"message","id":"message_demo","status":"completed","role":"assistant","content":[{"type":"output_text","text":"Hallo","annotations":[]}]}],"usage":{"input_tokens":17,"output_tokens":3,"total_tokens":20},"error":null}}

        '400':
          description: >-
            Ungültige Anfrageparameter, etwa fehlendes input, fehlerhafte
            reasoning-Einstellungen oder ein Modell ohne Unterstützung für
            previous_response_id.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
        '401':
          description: Der API-Schlüssel ist ungültig oder abgelaufen.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
        '402':
          description: Nicht genügend verfügbares Guthaben.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
        '429':
          description: >-
            Anfragelimit überschritten. Mit zunehmender Wartezeit erneut
            versuchen.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
        '500':
          description: Serverfehler.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
        '503':
          description: >-
            Der Dienst ist vorübergehend nicht verfügbar. Später erneut
            versuchen.
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
components:
  schemas:
    ResponsesRequest:
      type: object
      properties:
        model:
          type: string
          description: >-
            Wählen Sie ein GLM-Modell. Alle vier unterstützen Text an diesem
            Endpunkt. Optionale Funktionen sind modellabhängig.


            | Modell-ID | Eingabe | Hinweise zum Denken |

            | --- | --- | --- |

            | `glm-5.3` | Text | Effektive Stufen: low / high / max; kompatible
            Werte unter reasoning. Denken ist nicht deaktivierbar. |

            | `glm-5.3-flash` | Text, Bilder | Wie glm-5.3; Bilder mit
            input_image übergeben. |

            | `glm-5.3-flashx` | Text, Bilder | Wie glm-5.3; Bilder mit
            input_image übergeben. |

            | `glm-5.2` | Text | none kann weiterhin Denk-Tokens erzeugen und
            garantiert keine Deaktivierung des Denkens. |
          enum:
            - glm-5.3
            - glm-5.3-flash
            - glm-5.3-flashx
            - glm-5.2
          default: glm-5.3-flash
          example: glm-5.3-flash
        input:
          description: >-
            Erforderlich. Textstring oder Array von Responses-Eingabeelementen.
            Arrays unterstützen Nachrichten, zurückgesendete Modellausgaben und
            function_call_output. Senden Sie für mehrere Gesprächsrunden jeweils
            den vollständigen Verlauf. Setzen Sie den System-Prompt an den
            Anfang als Nachricht mit role=system. Bilder verwenden input_image,
            nur mit glm-5.3-flash und glm-5.3-flashx. Verwenden Sie nicht das
            messages-/image_url-Blockformat von Chat Completions.
          oneOf:
            - type: string
            - type: array
              items:
                $ref: '#/components/schemas/InputItem'
          example: Stelle dich in einem Satz vor.
        max_output_tokens:
          type: integer
          minimum: 1
          description: >-
            Maximale Ausgabe-Tokens dieser Generierung einschließlich
            Denk-Tokens. Beginnen Sie bei 1024 und passen Sie den Wert an die
            Aufgabe an. Ein zu kleines Budget kann bereits beim Denken
            aufgebraucht werden, sodass nur reasoning-Elemente ohne Antworttext
            entstehen. Prüfen Sie status und incomplete_details. Der Parameter
            heißt max_output_tokens, nicht max_tokens.
          example: 1024
        stream:
          type: boolean
          default: false
          description: >-
            Aktiviert SSE-Streaming. Lesen Sie den Antworttext aus delta in
            response.output_text.delta. Der erfolgreiche Abschluss ist
            response.completed. Beenden und behandeln Sie die Runde auch bei
            response.incomplete, response.failed oder error. Warten Sie nicht
            ausschließlich auf [DONE] oder das Schließen der Verbindung.
        reasoning:
          type: object
          properties:
            effort:
              type: string
              description: >-
                Denkintensität; low wird empfohlen.


                **Kompatibilitätsregeln für glm-5.3 / glm-5.3-flash /
                glm-5.3-flashx**


                | Übergebener Wert | Effektive Denkstufe |

                | --- | --- |

                | `low` / `high` / `max` | Unverändert |

                | `xhigh` | `max` |

                | `medium` | `high` |

                | `minimal` / `none` | low; Denken bleibt aktiv |


                **minimal und none deaktivieren das Denken der 5.3-Serie
                nicht.** Denk-Tokens werden als Ausgabe berechnet. Unbekannte
                Werte bleiben ohne Kompatibilitätszuordnung unverändert;
                verwenden Sie die aufgeführten Werte. Diese Zuordnungen gelten
                nicht für glm-5.2.


                Bei diesem Endpunkt kann glm-5.2 auch mit none Denk-Tokens
                erzeugen. Der Wert garantiert keine Deaktivierung des Denkens.
              enum:
                - max
                - xhigh
                - high
                - medium
                - low
                - minimal
                - none
              example: low
          description: >-
            Responses verwendet reasoning.effort als verschachteltes Feld statt
            reasoning_effort oder thinking auf oberster Ebene. Denk-Tokens sind
            in output_tokens enthalten. Einfache Aufgaben können
            reasoning_tokens=0 zurückgeben; daraus folgt nicht, dass Denken
            deaktivierbar ist.
        instructions:
          type: string
          description: >-
            Systemanweisungen. glm-5.3-flash unterstützt dieses Feld bei input
            als String. Bei einem Nachrichtenarray gehört der System-Prompt in
            die erste Nachricht mit role=system.
        tools:
          type: array
          items:
            $ref: '#/components/schemas/Tool'
          description: >-
            Unterstützt clientseitige function-Werkzeuge und serverseitiges
            web_search. Funktionen werden mit flachen Feldern name / description
            / parameters definiert, nicht als verschachteltes function-Objekt
            wie bei Chat Completions. Ihre Anwendung führt function_call aus und
            sendet Ergebnisse zurück. web_search läuft auf dem Server;
            tatsächliche Suchen können neben Tokens auch pro Aufruf berechnet
            werden. Es gelten die Modellpreise.
        tool_choice:
          description: >-
            auto lässt das Modell wählen; none deaktiviert Werkzeuge; required
            verlangt einen Werkzeugaufruf. Für eine bestimmte Funktion:
            {"type":"function","name":"get_temperature"}. Das Verhalten einer
            erzwungenen Auswahl ist nicht für alle Modell-Werkzeug-Kombinationen
            gleich garantiert.
          oneOf:
            - type: string
              enum:
                - auto
                - none
                - required
            - type: object
              properties:
                type:
                  type: string
                  const: function
                name:
                  type: string
              required:
                - type
                - name
          example: auto
        parallel_tool_calls:
          type: boolean
          description: >-
            Erlaubt mehrere Werkzeugaufrufe pro Runde. false garantiert nicht
            genau einen Funktionsaufruf. Clients sollten alle
            function_call-Elemente durchlaufen und verarbeiten.
        text:
          type: object
          properties:
            format:
              type: object
              properties:
                type:
                  type: string
                  description: >-
                    Ausgabeformat: text für Klartext, json_object für ein
                    JSON-Objekt. Fordern Sie bei json_object im Prompt
                    ausdrücklich gültiges JSON an und parsen und validieren Sie
                    es im Client. Strikte JSON-Schema-Vorgaben werden nicht
                    angeboten; json_schema oder strict=true garantieren keine
                    vorgegebene Struktur.
                  enum:
                    - text
                    - json_object
                  example: json_object
              required:
                - type
          description: >-
            Ausgabeformat. Beispiele verwenden json_object; HTTP 200 garantiert
            keine Einhaltung eines JSON-Schemas.
        store:
          type: boolean
          description: >-
            Speichert die Antwort zur späteren Referenz. glm-5.3-flash und
            glm-5.3-flashx unterstützen mehrere Runden mit store=true und
            previous_response_id. glm-5.2 unterstützt keine Fortsetzung per
            Antwort-ID; store=true aktiviert diese Funktion nicht. Senden Sie
            stattdessen den vollständigen Verlauf in input.
        previous_response_id:
          type: string
          description: >-
            id der vorherigen Antwort auf oberster Ebene. glm-5.3-flash und
            glm-5.3-flashx unterstützen dies mit store=true und demselben
            Modell. Übergeben Sie die Antwort-ID unverändert, keine Element-ID
            aus output. glm-5.2 gibt für dieses Feld 400 zurück. Für
            modellübergreifende Gespräche das Feld weglassen und den
            vollständigen Verlauf in input senden.
          example: Antwort-ID aus der vorherigen Runde
        metadata:
          type: object
          additionalProperties:
            type: string
          description: >-
            Benutzerdefinierte Metadaten als String-Schlüssel-Wert-Paare,
            abrufbar in metadata der Antwort. Keine Schlüssel oder vertraulichen
            Daten eintragen.
          example:
            conversation: demo
        temperature:
          type: number
          description: >-
            Sampling-Parameter. Gültiger Bereich und Wirkung hängen vom Modell
            ab. Garantiert keine deterministische Ausgabe und kann bei
            Denkaufgaben entfallen.
        top_p:
          type: number
          description: >-
            Sampling-Parameter. Gültiger Bereich und Wirkung hängen vom Modell
            ab. Kann üblicherweise entfallen.
      required:
        - model
        - input
    ResponsesResponse:
      type: object
      properties:
        id:
          type: string
          description: ID dieser Antwort. Unverändert als previous_response_id übergeben.
          example: response_demo
        object:
          type: string
          const: response
        created_at:
          type: integer
          description: Erstellungszeit in Unix-Sekunden.
        model:
          type: string
          example: glm-5.3-flash
        status:
          type: string
          description: >-
            completed beendet die Generierung dieser Runde, gegebenenfalls nur
            mit Werkzeugaufrufen. incomplete kennzeichnet eine unvollständige
            Ausgabe. Prüfen Sie output und error.
          enum:
            - completed
            - incomplete
            - failed
            - in_progress
            - queued
        output:
          type: array
          items:
            $ref: '#/components/schemas/OutputItem'
          description: >-
            Geordnete Ausgabeelemente. Lesen Sie text aus content-Einträgen mit
            type=output_text innerhalb von Elementen mit type=message. reasoning
            kann vor dem Antworttext stehen; function_call-Runden können ohne
            Antworttext enden. Lesen Sie nicht immer output[0].
        output_text:
          type: string
          description: >-
            Optional zusammengefasster Antworttext; das Feld kann fehlen.
            Allgemeine Clients sollten output durchlaufen.
        usage:
          $ref: '#/components/schemas/Usage'
        error:
          type:
            - object
            - 'null'
          description: Antwortfehler; bei Erfolg normalerweise null.
          additionalProperties: true
        incomplete_details:
          type: object
          properties:
            reason:
              type: string
              description: Details bei gekürzter Ausgabe, etwa max_output_tokens.
        metadata:
          type:
            - object
            - 'null'
          additionalProperties:
            type: string
    ErrorResponse:
      type: object
      properties:
        error:
          type: object
          properties:
            message:
              type: string
            type:
              type: string
            param:
              type:
                - string
                - 'null'
            code:
              type:
                - string
                - integer
                - 'null'
      required:
        - error
    InputItem:
      description: >-
        Nachricht, Funktionsergebnis oder unverändert aus dem vorherigen output
        übernommenes Element. Verwenden Sie für Werkzeugergebnisse die
        zurückgegebene call_id und behalten Sie die ursprünglichen Felder
        vorheriger Ausgabeelemente bei.
      oneOf:
        - $ref: '#/components/schemas/InputMessage'
        - $ref: '#/components/schemas/FunctionCallOutput'
        - type: object
          properties:
            type:
              type: string
              description: Typ des zurückgesendeten Ausgabeelements.
              enum:
                - function_call
                - reasoning
                - web_search_call
            id:
              type: string
            call_id:
              type: string
            name:
              type: string
            arguments:
              type: string
              description: Argumente als JSON-kodierter String.
            status:
              type: string
            action:
              type: object
              additionalProperties: true
              description: Such- oder Seitenaufrufaktion von web_search_call.
          required:
            - type
    Tool:
      oneOf:
        - type: object
          properties:
            type:
              type: string
              const: function
            name:
              type: string
            description:
              type: string
            parameters:
              type: object
              description: JSON-Schema für Funktionsparameter.
            strict:
              type: boolean
              description: >-
                Option zur Einschränkung von Funktionsargumenten. Clients müssen
                arguments vor der Ausführung weiterhin parsen und validieren.
          required:
            - type
            - name
            - parameters
        - type: object
          properties:
            type:
              type: string
              const: web_search
          required:
            - type
    OutputItem:
      type: object
      properties:
        type:
          type: string
          description: >-
            Übliche Typen: message, reasoning, function_call und
            web_search_call.
          enum:
            - message
            - reasoning
            - function_call
            - web_search_call
        id:
          type: string
        status:
          type: string
        role:
          type: string
        content:
          type: array
          items:
            type: object
            properties:
              type:
                type: string
              text:
                type: string
              annotations:
                type: array
                items:
                  type: object
          description: >-
            output_text in message-Elementen; gegebenenfalls reasoning_text in
            reasoning-Elementen.
        summary:
          type: array
          items:
            type: object
            properties:
              type:
                type: string
              text:
                type: string
          description: >-
            Denktext kann auch als summary_text zurückkommen. Nicht jedes
            reasoning-Element besitzt content.
        call_id:
          type: string
          description: Kennung des Funktionsaufrufs zum Zurücksenden des Ergebnisses.
        name:
          type: string
          description: Funktionsname.
        arguments:
          type: string
          description: >-
            Funktionsargumente als JSON-String. Vor der Ausführung parsen und
            validieren.
        action:
          type: object
          additionalProperties: true
          description: Such- oder Seitenaufrufaktion von web_search_call.
      required:
        - type
    Usage:
      type: object
      properties:
        input_tokens:
          type: integer
          description: Gesamte Eingabe-Tokens einschließlich Cache-Treffern.
        output_tokens:
          type: integer
          description: Gesamte Ausgabe-Tokens einschließlich Denk-Tokens.
        total_tokens:
          type: integer
          description: Summe aus Eingabe- und Ausgabe-Tokens.
        input_tokens_details:
          type: object
          properties:
            cached_tokens:
              type: integer
              description: >-
                Im Cache gefundener Teil der Eingabe-Tokens; nicht nochmals zu
                input_tokens addieren. Präfix-Caching erfolgt automatisch und
                benötigt kein explizites cache_control. Maßgeblich ist der
                zurückgegebene Trefferwert.
        output_tokens_details:
          type: object
          properties:
            reasoning_tokens:
              type: integer
              description: >-
                Für das Denken verwendeter Teil der Ausgabe-Tokens; nicht
                nochmals zu output_tokens zählen. Diese Angabe kann fehlen oder
                0 sein.
    InputMessage:
      type: object
      properties:
        role:
          type: string
          enum:
            - system
            - user
            - assistant
        content:
          description: >-
            Textstring oder Array von Eingabeinhaltsblöcken. Beim Zurücksenden
            einer bestehenden assistant-Ausgabe können deren output_text-Blöcke
            unverändert bleiben.
          oneOf:
            - type: string
            - type: array
              items:
                oneOf:
                  - $ref: '#/components/schemas/InputText'
                  - $ref: '#/components/schemas/InputImage'
                  - $ref: '#/components/schemas/OutputText'
      required:
        - role
        - content
    FunctionCallOutput:
      type: object
      properties:
        type:
          type: string
          const: function_call_output
        call_id:
          type: string
          description: call_id des ursprünglichen function_call.
        output:
          type: string
          description: Funktionsergebnis, üblicherweise als JSON-kodierter String.
      required:
        - type
        - call_id
        - output
    InputText:
      type: object
      properties:
        type:
          type: string
          const: input_text
        text:
          type: string
      required:
        - type
        - text
    InputImage:
      type: object
      properties:
        type:
          type: string
          const: input_image
        image_url:
          type: string
          description: >-
            Öffentliche Bild-URL oder Base64 Data URL, z. B.
            data:image/png;base64,... für PNG. Nur glm-5.3-flash /
            glm-5.3-flashx unterstützen Bilder; verwenden Sie für glm-5.3 und
            glm-5.2 nur Text.
      required:
        - type
        - image_url
    OutputText:
      type: object
      properties:
        type:
          type: string
          const: output_text
        text:
          type: string
        annotations:
          type: array
          items:
            type: object
      required:
        - type
        - text
  securitySchemes:
    bearerAuth:
      type: http
      scheme: bearer
      description: Übergeben Sie Bearer YOUR_API_KEY im Authorization-Header.

````