> ## Documentation Index
> Fetch the complete documentation index at: https://evolink.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Qwen3.8-Max-Preview - Responses-Schnittstelle

> > 🚧 **Dieses Modell ist noch nicht verfügbar, bleiben Sie gespannt**

- Qwen3.8-Max-Preview über das OpenAI-Responses-Protokoll aufrufen
- **Flexible Eingabe**: `input` kann ein String oder ein Nachrichten-Array im Chat-Format sein (unterstützt Multimodalität `input_text` / `input_image`)
- **Mehrstufige Gespräche**: `previous_response_id` übergeben, um die vorherige Antwort zu verknüpfen; der Server kombiniert den Kontext automatisch (die Antwort-`id` ist 7 Tage gültig)
- **Sitzungs-Caching**: mit dem Header `x-dashscope-session-cache: enable` (Standard disable) aktivieren, Treffer siehe `usage.input_tokens_details.cached_tokens`
- **Denkintensität**: über `reasoning.effort` gesteuert
- **Streaming-Ausgabe**: bei `stream=true` als Responses-Ereignisse (`response.output_text.delta` / `response.completed` usw.) zurückgegeben

<Note>
  **BaseURL**: Die Standard-BaseURL ist `https://direct.evolink.ai`, die Textmodelle und langlebige Verbindungen besser unterstützt. `https://api.evolink.ai` ist der primäre Endpunkt für multimodale Dienste; verwenden Sie diese Adresse bei Eingaben mit Bild.

  **Sitzungs-Caching**: Die Responses-Schnittstelle aktiviert serverseitiges Sitzungs-Caching über den Header `x-dashscope-session-cache: enable`, um Latenz und Kosten bei mehreren Runden zu senken.
</Note>


## OpenAPI

````yaml de/api-manual/language-series/qwen3.8-max-preview/qwen3.8-max-preview-responses.json POST /v1/responses
openapi: 3.1.0
info:
  title: Qwen3.8-Max-Preview - Responses-Schnittstelle
  description: >-
    OpenAI-Responses-kompatible Schnittstelle von Tongyi Qianwen
    Qwen3.8-Max-Preview (`/v1/responses`).


    **Vorteile gegenüber Chat Completions**:

    - **Vereinfachte Kontextverwaltung**: über `previous_response_id` wird die
    vorherige Runde verknüpft, ohne den vollständigen Verlauf manuell
    zusammenzusetzen

    - **Integrierte Werkzeuge**: Websuche, Webseiten-Extraktion,
    Code-Interpreter usw.

    - **Bequemes Sitzungs-Caching**: mit dem Header `x-dashscope-session-cache:
    enable` cacht der Server den Gesprächskontext automatisch und senkt Latenz
    und Kosten bei mehreren Runden


    **Fähigkeiten**: Multimodale Eingabe (Text + Bild), Steuerung der
    Denkintensität (`reasoning.effort`), Streaming-Ausgabe.
  license:
    name: MIT
  version: 1.0.0
servers:
  - url: https://direct.evolink.ai
    description: >-
      Produktionsumgebung (empfohlen, bessere Unterstützung für dauerhafte
      Verbindungen bei Textmodellen)
  - url: https://api.evolink.ai
    description: Haupt-Adresse für Multimodalität (bei Eingaben mit Bild verwenden)
security:
  - bearerAuth: []
tags: []
paths:
  /v1/responses:
    post:
      summary: Qwen3.8-Max-Preview Responses-Schnittstelle (OpenAI-kompatibel)
      description: >-
        > 🚧 **Dieses Modell ist noch nicht verfügbar, bleiben Sie gespannt**


        - Qwen3.8-Max-Preview über das OpenAI-Responses-Protokoll aufrufen

        - **Flexible Eingabe**: `input` kann ein String oder ein
        Nachrichten-Array im Chat-Format sein (unterstützt Multimodalität
        `input_text` / `input_image`)

        - **Mehrstufige Gespräche**: `previous_response_id` übergeben, um die
        vorherige Antwort zu verknüpfen; der Server kombiniert den Kontext
        automatisch (die Antwort-`id` ist 7 Tage gültig)

        - **Sitzungs-Caching**: mit dem Header `x-dashscope-session-cache:
        enable` (Standard disable) aktivieren, Treffer siehe
        `usage.input_tokens_details.cached_tokens`

        - **Denkintensität**: über `reasoning.effort` gesteuert

        - **Streaming-Ausgabe**: bei `stream=true` als Responses-Ereignisse
        (`response.output_text.delta` / `response.completed` usw.) zurückgegeben
      operationId: createResponseQwen38MaxPreview
      parameters:
        - name: x-dashscope-session-cache
          in: header
          required: false
          schema:
            type: string
            enum:
              - enable
              - disable
            default: disable
          description: >-
            Schalter für Sitzungs-Caching. Bei `enable` cacht der Server den
            Gesprächskontext automatisch, um Latenz und Kosten bei mehrstufiger
            Inferenz zu senken.
      requestBody:
        required: true
        content:
          application/json:
            schema:
              $ref: '#/components/schemas/ResponseRequest'
            examples:
              basic:
                summary: Grundlegender Aufruf (String-Eingabe)
                value:
                  model: qwen3.8-max-preview
                  input: Was kannst du tun?
              multi_turn:
                summary: Mehrstufiges Gespräch (previous_response_id)
                value:
                  model: qwen3.8-max-preview
                  input: Worin unterscheidet es sich von GBDT?
                  previous_response_id: resp_xxxxxxxx
              multimodal:
                summary: Multimodale Eingabe (Bild)
                value:
                  model: qwen3.8-max-preview
                  input:
                    - role: user
                      content:
                        - type: input_text
                          text: Beschreibe dieses Bild
                        - type: input_image
                          image_url: https://example.com/image.jpg
      responses:
        '200':
          description: Erfolgreich generiert
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ResponseObject'
        '400':
          description: Ungültige Anfrageparameter
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
              example:
                error:
                  code: 400
                  message: Invalid request parameters
                  type: invalid_request_error
        '401':
          description: Nicht autorisiert, ungültiges oder abgelaufenes Token
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
              example:
                error:
                  code: 401
                  message: Invalid or expired token
                  type: authentication_error
        '402':
          description: Unzureichendes Guthaben
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
              example:
                error:
                  code: 402
                  message: Insufficient credits
                  type: insufficient_quota
        '429':
          description: Zu viele Anfragen (Ratenbegrenzung)
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
        '500':
          description: Interner Serverfehler
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
components:
  schemas:
    ResponseRequest:
      type: object
      required:
        - model
        - input
      properties:
        model:
          type: string
          enum:
            - qwen3.8-max-preview
          example: qwen3.8-max-preview
          description: Name des Chat-Modells
        input:
          description: >-
            Modelleingabe. Kann ein String (Klartext) oder ein Nachrichten-Array
            im Chat-Format sein (unterstützt Multimodalität `input_text` /
            `input_image`).
          oneOf:
            - type: string
            - type: array
              items:
                $ref: '#/components/schemas/InputItem'
        instructions:
          type: string
          description: >-
            Wird als Systemanweisung an den Anfang des Kontexts eingefügt. Bei
            Verwendung von `previous_response_id` werden die `instructions` der
            vorherigen Runde nicht in diese Runde übernommen.
        previous_response_id:
          type: string
          description: >-
            Eindeutige ID der vorherigen Antwort (die Antwort-`id`, 7 Tage
            gültig). Dient zum Verknüpfen mehrstufiger Gespräche; der Server
            ruft Eingabe und Ausgabe dieser Runde automatisch ab und kombiniert
            sie als Kontext.
        max_output_tokens:
          type: integer
          description: >-
            Maximale Anzahl der Token für den in diesem Aufruf generierten
            Ausgabeinhalt (einschließlich Denken).
        reasoning:
          type: object
          description: Denksteuerung.
          properties:
            effort:
              type: string
              enum:
                - low
                - medium
                - high
              description: Denkintensität
        store:
          type: boolean
          description: >-
            Ob diese Antwort gespeichert wird.


            - `true` (Standard): kann über `previous_response_id` referenziert
            werden

            - `false`: wird nicht gespeichert und kann später nicht referenziert
            werden
          default: true
        stream:
          type: boolean
          description: Ob als Responses-Ereignisse gestreamt zurückgegeben wird.
          default: false
        temperature:
          type: number
          description: Sampling-Temperatur, Wertebereich `[0, 2]`.
          minimum: 0
          maximum: 2
        top_p:
          type: number
          description: Nucleus-Sampling-Parameter, Wertebereich `(0, 1]`.
          minimum: 0
          maximum: 1
        tools:
          type: array
          description: >-
            Werkzeugliste. Unterstützt integrierte Werkzeuge (`web_search`
            Websuche, `web_extractor` Webseiten-Extraktion, `code_interpreter`
            Code-Interpreter) und benutzerdefinierte `function`.
          items:
            $ref: '#/components/schemas/Tool'
    ResponseObject:
      type: object
      properties:
        id:
          type: string
          description: >-
            Eindeutige ID dieser Antwort (7 Tage gültig, kann als
            `previous_response_id` dienen)
          example: resp_xxxxxxxx
        object:
          type: string
          example: response
        status:
          type: string
          description: Antwortstatus
          example: completed
        model:
          type: string
          example: qwen3.8-max-preview
        output:
          type: array
          description: >-
            Array von Ausgabe-Elementen (enthält `message` / `reasoning` /
            integrierte Werkzeugaufrufe usw.)
          items:
            type: object
        usage:
          $ref: '#/components/schemas/Usage'
    ErrorResponse:
      type: object
      properties:
        error:
          type: object
          properties:
            code:
              type: integer
              description: HTTP-Status-Fehlercode
            message:
              type: string
              description: Fehlerbeschreibung
            type:
              type: string
              description: Fehlertyp
            param:
              type: string
              description: Name des betroffenen Parameters
    InputItem:
      type: object
      description: Eingabenachrichten-Element (Chat-Format).
      properties:
        role:
          type: string
          enum:
            - user
            - assistant
            - system
          description: Nachrichtenrolle
        content:
          description: >-
            Nachrichteninhalt. Als Klartext einen String übergeben; bei
            Multimodalität ein Array von Content-Parts übergeben.
          oneOf:
            - type: string
            - type: array
              items:
                $ref: '#/components/schemas/InputContentPart'
    Tool:
      type: object
      description: >-
        Werkzeugdefinition. Integrierte Werkzeuge müssen nur `type` deklarieren;
        benutzerdefinierte function benötigen Name und Parameter-Schema.
      required:
        - type
      properties:
        type:
          type: string
          enum:
            - web_search
            - web_extractor
            - code_interpreter
            - function
          description: Werkzeugtyp
        name:
          type: string
          description: Funktionsname, wenn `type=function`
        parameters:
          type: object
          description: Parameter-JSON-Schema, wenn `type=function`
    Usage:
      type: object
      description: Statistik zur Token-Nutzung.
      properties:
        input_tokens:
          type: integer
          description: Anzahl der Eingabe-Token
          example: 45
        output_tokens:
          type: integer
          description: Anzahl der Ausgabe-Token (einschließlich Denken)
          example: 63
        total_tokens:
          type: integer
          description: Gesamtzahl der Token
          example: 108
        input_tokens_details:
          type: object
          description: Aufschlüsselung der Eingabe-Token
          properties:
            cached_tokens:
              type: integer
              description: >-
                Anzahl der aus dem Sitzungs-Cache gelieferten Eingabe-Token
                (Cache-Lesen)
              example: 0
        output_tokens_details:
          type: object
          description: Aufschlüsselung der Ausgabe-Token
          properties:
            reasoning_tokens:
              type: integer
              description: Anzahl der Token des Denkprozesses
              example: 0
        prompt_tokens_details:
          type: object
          description: >-
            Cache-Details, die nach Aktivierung des Sitzungs-Cachings
            zurückgegeben werden
          properties:
            cached_tokens:
              type: integer
              description: Anzahl der aus dem Cache gelieferten Token
              example: 0
            cache_creation_input_tokens:
              type: integer
              description: >-
                Anzahl der in diesem Aufruf neu erstellten Cache-Token
                (Cache-Schreiben)
              example: 0
    InputContentPart:
      type: object
      description: Responses-Eingabe-Content-Part, dessen Typ über `type` deklariert wird.
      required:
        - type
      properties:
        type:
          type: string
          enum:
            - input_text
            - input_image
          description: |-
            Inhaltstyp

            - `input_text`: Text
            - `input_image`: Bild
        text:
          type: string
          description: Textinhalt, wenn `type=input_text`
        image_url:
          type: string
          description: >-
            Bild-URL, wenn `type=input_image`, oder eine mit `data:` beginnende
            base64-data-URL
  securitySchemes:
    bearerAuth:
      type: http
      scheme: bearer
      description: >-
        ##Alle APIs erfordern eine Bearer-Token-Authentifizierung##


        **API-Schlüssel abrufen**:


        Besuchen Sie die
        [API-Schlüsselverwaltung](https://evolink.ai/dashboard/keys), um Ihren
        API-Schlüssel abzurufen


        **Zum Anfrage-Header hinzufügen**:

        ```

        Authorization: Bearer YOUR_API_KEY

        ```

````