> ## Documentation Index
> Fetch the complete documentation index at: https://evolink.ai/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Qwen3.8-Max-Preview - Vollständige Parameterdokumentation

> > 🚧 **Dieses Modell ist noch nicht verfügbar, bleiben Sie gespannt**

- Qwen3.8-Max-Preview über das OpenAI-Chat-Completions-Protokoll aufrufen
- **Mehrstufige Gespräche**: unterstützt Einzel- oder mehrstufige Kontextgespräche
- **System-Prompt**: über eine `role=system`-Nachricht Rolle und Verhalten der KI festlegen
- **Multimodale Eingabe**: `content` übergibt ein Array von Content-Parts, unterstützt `text` / `image_url` / `input_audio` / `video_url`
- **Kontext-Caching**: an einem Content-Part `cache_control` hinzufügen, um explizites Caching zu deklarieren; Trefferinformationen siehe Antwort `usage.prompt_tokens_details`
- **Denkmodus**: mit `enable_thinking=true` aktivieren, Denkinhalte werden über `reasoning_content` zurückgegeben
- **Streaming-Ausgabe**: bei `stream=true` blockweise über SSE zurückgegeben

<Note>
  **BaseURL**: Die Standard-BaseURL ist `https://direct.evolink.ai`, die Textmodelle und langlebige Verbindungen besser unterstützt. `https://api.evolink.ai` ist der primäre Endpunkt für multimodale Dienste; verwenden Sie diese Adresse bei Eingaben mit Bild / Audio / Video.
</Note>


## OpenAPI

````yaml de/api-manual/language-series/qwen3.8-max-preview/qwen3.8-max-preview-chat.json POST /v1/chat/completions
openapi: 3.1.0
info:
  title: Qwen3.8-Max-Preview Vollständige Parameterdokumentation (OpenAI-kompatibel)
  description: >-
    API-Referenz für die Qwen3.8-Max-Preview Chat-Schnittstelle von Tongyi
    Qianwen (OpenAI-Chat-Completions-kompatibel).


    **Modellfähigkeiten**:

    - Kontextlänge: **1.000.000 Token** (1M)

    - Denkmodus: über `enable_thinking` aktiviert, Denkinhalte werden über
    `reasoning_content` zurückgegeben

    - Multimodale Eingabe: `content` unterstützt gemischte Anordnung von Text +
    Bild / Audio / Video

    - Kontext-Caching: unterstützt explizites Caching (`cache_control`) und
    implizites Caching, Treffer senken die Kosten erheblich

    - Werkzeugaufrufe: unterstützt Function Calling

    - Streaming-Ausgabe: unterstützt SSE-Streaming
  license:
    name: MIT
  version: 1.0.0
servers:
  - url: https://direct.evolink.ai
    description: >-
      Produktionsumgebung (empfohlen, bessere Unterstützung für dauerhafte
      Verbindungen bei Textmodellen)
  - url: https://api.evolink.ai
    description: >-
      Haupt-Adresse für Multimodalität (bei Eingaben mit Bild / Audio / Video
      verwenden)
security:
  - bearerAuth: []
tags: []
paths:
  /v1/chat/completions:
    post:
      summary: Qwen3.8-Max-Preview Chat-Schnittstelle (OpenAI-kompatibel)
      description: >-
        > 🚧 **Dieses Modell ist noch nicht verfügbar, bleiben Sie gespannt**


        - Qwen3.8-Max-Preview über das OpenAI-Chat-Completions-Protokoll
        aufrufen

        - **Mehrstufige Gespräche**: unterstützt Einzel- oder mehrstufige
        Kontextgespräche

        - **System-Prompt**: über eine `role=system`-Nachricht Rolle und
        Verhalten der KI festlegen

        - **Multimodale Eingabe**: `content` übergibt ein Array von
        Content-Parts, unterstützt `text` / `image_url` / `input_audio` /
        `video_url`

        - **Kontext-Caching**: an einem Content-Part `cache_control` hinzufügen,
        um explizites Caching zu deklarieren; Trefferinformationen siehe Antwort
        `usage.prompt_tokens_details`

        - **Denkmodus**: mit `enable_thinking=true` aktivieren, Denkinhalte
        werden über `reasoning_content` zurückgegeben

        - **Streaming-Ausgabe**: bei `stream=true` blockweise über SSE
        zurückgegeben
      operationId: createChatCompletionQwen38MaxPreview
      requestBody:
        required: true
        content:
          application/json:
            schema:
              $ref: '#/components/schemas/ChatCompletionRequest'
            examples:
              basic:
                summary: Grundlegendes Textgespräch
                value:
                  model: qwen3.8-max-preview
                  messages:
                    - role: system
                      content: You are a helpful assistant.
                    - role: user
                      content: Hallo, stell dich bitte vor
              multimodal:
                summary: Multimodale Eingabe (Bild)
                value:
                  model: qwen3.8-max-preview
                  messages:
                    - role: user
                      content:
                        - type: text
                          text: Beschreibe den Inhalt dieses Bildes
                        - type: image_url
                          image_url:
                            url: https://example.com/image.jpg
              explicit_cache:
                summary: Explizites Caching (cache_control)
                value:
                  model: qwen3.8-max-preview
                  messages:
                    - role: system
                      content:
                        - type: text
                          text: <stabiler System-Prompt mit über 1024 Token ……>
                          cache_control:
                            type: ephemeral
                    - role: user
                      content: Beantworte die Frage auf Grundlage des obigen Kontexts
      responses:
        '200':
          description: Chat erfolgreich generiert
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ChatCompletionResponse'
        '400':
          description: Ungültige Anfrageparameter
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
              example:
                error:
                  code: 400
                  message: Invalid request parameters
                  type: invalid_request_error
        '401':
          description: Nicht autorisiert, ungültiges oder abgelaufenes Token
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
              example:
                error:
                  code: 401
                  message: Invalid or expired token
                  type: authentication_error
        '402':
          description: Unzureichendes Guthaben
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
              example:
                error:
                  code: 402
                  message: Insufficient credits
                  type: insufficient_quota
        '429':
          description: Zu viele Anfragen (Ratenbegrenzung)
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
              example:
                error:
                  code: 429
                  message: Rate limit exceeded
                  type: rate_limit_error
        '500':
          description: Interner Serverfehler
          content:
            application/json:
              schema:
                $ref: '#/components/schemas/ErrorResponse'
              example:
                error:
                  code: 500
                  message: Internal server error
                  type: server_error
components:
  schemas:
    ChatCompletionRequest:
      type: object
      required:
        - model
        - messages
      properties:
        model:
          type: string
          description: Name des Chat-Modells
          enum:
            - qwen3.8-max-preview
          example: qwen3.8-max-preview
        messages:
          type: array
          description: >-
            Liste der Gesprächsnachrichten, unterstützt mehrstufige Gespräche.
            Die Nachrichtenfeldstruktur unterscheidet sich je nach Rolle (system
            / user / assistant / tool); bitte wählen Sie die entsprechende Rolle
            aus.
          items:
            oneOf:
              - $ref: '#/components/schemas/SystemMessage'
              - $ref: '#/components/schemas/UserMessage'
              - $ref: '#/components/schemas/AssistantRequestMessage'
              - $ref: '#/components/schemas/ToolMessage'
        enable_thinking:
          type: boolean
          description: >-
            Ob der Tiefdenkmodus aktiviert wird


            - `true`: Das Modell gibt den Denkprozess aus, zurückgegeben über
            `reasoning_content`

            - `false` (Standard): Der Denkprozess wird nicht ausgegeben


            > Hinweis: Einige Modelle geben bei nicht gestreamten Aufrufen
            Denkinhalte nur zurück, wenn dies explizit auf `true` gesetzt ist.
          default: false
        temperature:
          type: number
          description: >-
            Sampling-Temperatur, steuert die Zufälligkeit der Ausgabe.
            Niedrigere Werte sind bestimmter, höhere Werte vielfältiger.
            Wertebereich `[0, 2]`. Es wird empfohlen, temperature und top_p
            nicht gleichzeitig anzupassen.
          minimum: 0
          maximum: 2
        top_p:
          type: number
          description: >-
            Nucleus-Sampling-Parameter (Nucleus Sampling), das aus den Token mit
            der höchsten kumulativen Wahrscheinlichkeit sampelt. Wertebereich
            `(0, 1]`. Es wird empfohlen, temperature und top_p nicht
            gleichzeitig anzupassen.
          minimum: 0
          maximum: 1
        max_completion_tokens:
          type: integer
          description: >-
            Obergrenze für die Länge des generierten Inhalts (Anzahl Token),
            **einschließlich Gedankenkette und Antwort**. Für Denkmodelle wird
            dieser Parameter empfohlen. Standard- und Maximalwert entsprechen
            der maximalen Ausgabelänge des Modells; bei Überschreitung wird mit
            `finish_reason=length` vorzeitig gestoppt.
        max_tokens:
          type: integer
          description: >-
            Veralteter Parameter zur Begrenzung der Generierungslänge.


            > **Veraltet**: Für neue Integrationen bitte `max_completion_tokens`
            verwenden. Dieser Parameter begrenzt nur den Antwortteil (ohne
            Gedankenkette).
        stream:
          type: boolean
          description: >-
            Ob die Antwort als Stream zurückgegeben wird.


            - `true`: blockweise über SSE (Server-Sent Events) zurückgegeben

            - `false` (Standard): die vollständige Antwort wird auf einmal
            zurückgegeben
          default: false
        stream_options:
          type: object
          description: Optionen für die Streaming-Antwort, nur bei `stream=true` wirksam.
          properties:
            include_usage:
              type: boolean
              description: >-
                Bei `true` wird vor dem Ende des Streams zusätzlich ein
                Datenblock zurückgegeben, der nur `usage` enthält.
        tools:
          type: array
          description: >-
            Liste der Werkzeugdefinitionen für Function Calling. Jedes Werkzeug
            muss Name, Beschreibung und Parameter-Schema definieren.
          items:
            $ref: '#/components/schemas/Tool'
    ChatCompletionResponse:
      type: object
      properties:
        id:
          type: string
          description: Eindeutige Kennung dieses Gesprächs
          example: chatcmpl-xxxxxxxx
        object:
          type: string
          example: chat.completion
        created:
          type: integer
          description: Erstellungszeit (Unix-Sekunden)
          example: 1735120033
        model:
          type: string
          example: qwen3.8-max-preview
        choices:
          type: array
          items:
            $ref: '#/components/schemas/Choice'
        usage:
          $ref: '#/components/schemas/Usage'
    ErrorResponse:
      type: object
      properties:
        error:
          type: object
          properties:
            code:
              type: integer
              description: HTTP-Status-Fehlercode
            message:
              type: string
              description: Fehlerbeschreibung
            type:
              type: string
              description: Fehlertyp
            param:
              type: string
              description: Name des betroffenen Parameters
    SystemMessage:
      type: object
      title: System Message
      required:
        - role
        - content
      properties:
        role:
          type: string
          enum:
            - system
          description: Nachrichtenrolle, fest auf `system`
        content:
          description: >-
            Systemanweisung. Als Klartext einen String übergeben; zum
            Deklarieren von explizitem Caching ein Array von Content-Parts
            übergeben.
          oneOf:
            - type: string
            - type: array
              items:
                $ref: '#/components/schemas/ContentPart'
    UserMessage:
      type: object
      title: User Message
      required:
        - role
        - content
      properties:
        role:
          type: string
          enum:
            - user
          description: Nachrichtenrolle, fest auf `user`
        content:
          description: >-
            Inhalt der Benutzernachricht.


            - Als Klartext direkt einen String übergeben

            - Bei Multimodalität oder explizitem Caching ein Array von
            Content-Parts übergeben, unterstützt `text` / `image_url` /
            `input_audio` / `video_url`
          oneOf:
            - type: string
            - type: array
              items:
                $ref: '#/components/schemas/ContentPart'
    AssistantRequestMessage:
      type: object
      title: Assistant Message
      required:
        - role
      properties:
        role:
          type: string
          enum:
            - assistant
          description: Nachrichtenrolle, fest auf `assistant`
        content:
          description: >-
            Inhalt der bisherigen Assistant-Antworten. Kann ein String oder ein
            Array von Content-Parts sein.
          oneOf:
            - type: string
            - type: array
              items:
                $ref: '#/components/schemas/ContentPart'
        tool_calls:
          type: array
          description: >-
            Liste der vom Assistant in der vorherigen Runde initiierten
            Werkzeugaufrufe (zum Auffüllen des Function-Calling-Verlaufs).
          items:
            type: object
    ToolMessage:
      type: object
      title: Tool Message
      required:
        - role
        - content
        - tool_call_id
      properties:
        role:
          type: string
          enum:
            - tool
          description: Nachrichtenrolle, fest auf `tool` (Werkzeugausführungsergebnis)
        content:
          description: >-
            Inhalt des Werkzeugausführungsergebnisses. Kann ein String oder ein
            Array von Content-Parts sein.
          oneOf:
            - type: string
            - type: array
              items:
                $ref: '#/components/schemas/ContentPart'
        tool_call_id:
          type: string
          description: Zugehörige Werkzeugaufruf-ID
    Tool:
      type: object
      description: Werkzeugdefinition für Function Calling.
      required:
        - type
        - function
      properties:
        type:
          type: string
          enum:
            - function
          description: Werkzeugtyp, fest auf `function`
        function:
          type: object
          required:
            - name
          properties:
            name:
              type: string
              description: Funktionsname
            description:
              type: string
              description: Beschreibung des Funktionszwecks
            parameters:
              type: object
              description: JSON-Schema der Funktionsparameter
    Choice:
      type: object
      properties:
        index:
          type: integer
          example: 0
        message:
          $ref: '#/components/schemas/AssistantMessage'
        finish_reason:
          type: string
          description: |-
            Grund für den Stopp

            - `stop`: normales Ende
            - `length`: Obergrenze von `max_completion_tokens` erreicht
            - `tool_calls`: Werkzeugaufruf erforderlich
          example: stop
    Usage:
      type: object
      description: Statistik zur Token-Nutzung.
      properties:
        prompt_tokens:
          type: integer
          description: Anzahl der Eingabe-Token
          example: 3019
        completion_tokens:
          type: integer
          description: Anzahl der Ausgabe-Token (einschließlich Denken)
          example: 104
        total_tokens:
          type: integer
          description: Gesamtzahl der Token
          example: 3123
        completion_tokens_details:
          type: object
          description: Aufschlüsselung der Ausgabe-Token
          properties:
            reasoning_tokens:
              type: integer
              description: Anzahl der Token des Denkprozesses
              example: 0
        prompt_tokens_details:
          type: object
          description: Cache-Aufschlüsselung der Eingabe-Token
          properties:
            cached_tokens:
              type: integer
              description: Anzahl der aus dem Cache gelieferten Eingabe-Token (Cache-Lesen)
              example: 2048
            cache_creation_input_tokens:
              type: integer
              description: >-
                Anzahl der in diesem Aufruf neu erstellten Cache-Token
                (Cache-Schreiben, wird bei explizitem Caching zurückgegeben)
              example: 0
    ContentPart:
      type: object
      description: >-
        Multimodales Content-Part, dessen Typ über `type` deklariert wird; nur
        die zum Typ passenden Felder ausfüllen. An jedem Part kann
        `cache_control` zum Deklarieren von explizitem Caching angehängt werden.
      required:
        - type
      properties:
        type:
          type: string
          enum:
            - text
            - image_url
            - input_audio
            - video_url
          description: |-
            Inhaltstyp

            - `text`: Textblock
            - `image_url`: Bildeingabe
            - `input_audio`: Audioeingabe
            - `video_url`: Videodateieingabe
        text:
          type: string
          description: Textinhalt, wenn `type=text`
        image_url:
          type: object
          description: >-
            Bildeingabe (wenn `type=image_url`). Unterstützt JPEG / PNG / GIF /
            WEBP.
          required:
            - url
          properties:
            url:
              type: string
              description: Bild-URL oder eine mit `data:` beginnende base64-data-URL
            detail:
              type: string
              description: |-
                Bildanalysegenauigkeit

                - `low`: niedrige Genauigkeit, verbraucht weniger Token
                - `high`: hohe Genauigkeit, feinere Erkennung
                - `auto` (Standard): wird vom Modell automatisch entschieden
              enum:
                - low
                - high
                - auto
              default: auto
        input_audio:
          type: object
          description: Audioeingabe (wenn `type=input_audio`).
          required:
            - data
            - format
          properties:
            data:
              type: string
              description: Audio-URL oder eine mit `data:` beginnende base64-data-URL
            format:
              type: string
              description: Audioformat, z.B. `mp3`, `wav` usw.
        video_url:
          type: object
          description: Videodateieingabe (wenn `type=video_url`).
          required:
            - url
          properties:
            url:
              type: string
              description: Video-Datei-URL oder eine mit `data:` beginnende base64-data-URL
        cache_control:
          type: object
          description: >-
            Explizite Cache-Markierung. Das System erstellt / trifft
            Cache-Blöcke, indem es von der Position dieser Markierung aus
            rückwärts geht.


            - Minimale cachebare Länge **1024 Token**, Gültigkeit **5 Minuten**
            (wird bei Treffer zurückgesetzt)

            - Maximal **4** Cache-Markierungen pro Anfrage

            - Schließt sich mit implizitem Caching gegenseitig aus, pro Anfrage
            wird nur eine Art angewendet


            Treffer- / Erstellungsinformationen siehe Antwort
            `usage.prompt_tokens_details`.
          required:
            - type
          properties:
            type:
              type: string
              enum:
                - ephemeral
              description: Cache-Typ, fest auf `ephemeral` (5-minütiger temporärer Cache)
    AssistantMessage:
      type: object
      description: Antwortnachricht des Assistant.
      properties:
        role:
          type: string
          example: assistant
        content:
          type: string
          description: Antworttext
          example: Hallo! Ich bin Tongyi Qianwen Qwen3.8-Max-Preview.
        reasoning_content:
          type: string
          description: >-
            Inhalt des Denkprozesses (wird bei `enable_thinking=true`
            zurückgegeben)
        tool_calls:
          type: array
          description: Liste der vom Modell initiierten Werkzeugaufrufe
          items:
            type: object
  securitySchemes:
    bearerAuth:
      type: http
      scheme: bearer
      description: >-
        ##Alle APIs erfordern eine Bearer-Token-Authentifizierung##


        **API-Schlüssel abrufen**:


        Besuchen Sie die
        [API-Schlüsselverwaltung](https://evolink.ai/dashboard/keys), um Ihren
        API-Schlüssel abzurufen


        **Zum Anfrage-Header hinzufügen**:

        ```

        Authorization: Bearer YOUR_API_KEY

        ```

````