Qwen3.8-Max-Preview - Vollständige Parameterdokumentation
🚧 Dieses Modell ist noch nicht verfügbar, bleiben Sie gespannt
- Qwen3.8-Max-Preview über das OpenAI-Chat-Completions-Protokoll aufrufen
- Mehrstufige Gespräche: unterstützt Einzel- oder mehrstufige Kontextgespräche
- System-Prompt: über eine
role=system-Nachricht Rolle und Verhalten der KI festlegen - Multimodale Eingabe:
contentübergibt ein Array von Content-Parts, unterstützttext/image_url/input_audio/video_url - Kontext-Caching: an einem Content-Part
cache_controlhinzufügen, um explizites Caching zu deklarieren; Trefferinformationen siehe Antwortusage.prompt_tokens_details - Denkmodus: mit
enable_thinking=trueaktivieren, Denkinhalte werden überreasoning_contentzurückgegeben - Streaming-Ausgabe: bei
stream=trueblockweise über SSE zurückgegeben
https://direct.evolink.ai, die Textmodelle und langlebige Verbindungen besser unterstützt. https://api.evolink.ai ist der primäre Endpunkt für multimodale Dienste; verwenden Sie diese Adresse bei Eingaben mit Bild / Audio / Video.Autorisierungen
##Alle APIs erfordern eine Bearer-Token-Authentifizierung##
API-Schlüssel abrufen:
Besuchen Sie die API-Schlüsselverwaltung, um Ihren API-Schlüssel abzurufen
Zum Anfrage-Header hinzufügen:
Body
Name des Chat-Modells
qwen3.8-max-preview "qwen3.8-max-preview"
Liste der Gesprächsnachrichten, unterstützt mehrstufige Gespräche. Die Nachrichtenfeldstruktur unterscheidet sich je nach Rolle (system / user / assistant / tool); bitte wählen Sie die entsprechende Rolle aus.
- System Message
- User Message
- Assistant Message
- Tool Message
Ob der Tiefdenkmodus aktiviert wird
true: Das Modell gibt den Denkprozess aus, zurückgegeben überreasoning_contentfalse(Standard): Der Denkprozess wird nicht ausgegeben
Hinweis: Einige Modelle geben bei nicht gestreamten Aufrufen Denkinhalte nur zurück, wenn dies explizit auf
truegesetzt ist.
Sampling-Temperatur, steuert die Zufälligkeit der Ausgabe. Niedrigere Werte sind bestimmter, höhere Werte vielfältiger. Wertebereich [0, 2]. Es wird empfohlen, temperature und top_p nicht gleichzeitig anzupassen.
0 <= x <= 2Nucleus-Sampling-Parameter (Nucleus Sampling), das aus den Token mit der höchsten kumulativen Wahrscheinlichkeit sampelt. Wertebereich (0, 1]. Es wird empfohlen, temperature und top_p nicht gleichzeitig anzupassen.
0 <= x <= 1Obergrenze für die Länge des generierten Inhalts (Anzahl Token), einschließlich Gedankenkette und Antwort. Für Denkmodelle wird dieser Parameter empfohlen. Standard- und Maximalwert entsprechen der maximalen Ausgabelänge des Modells; bei Überschreitung wird mit finish_reason=length vorzeitig gestoppt.
Veralteter Parameter zur Begrenzung der Generierungslänge.
Veraltet: Für neue Integrationen bitte
max_completion_tokensverwenden. Dieser Parameter begrenzt nur den Antwortteil (ohne Gedankenkette).
Ob die Antwort als Stream zurückgegeben wird.
true: blockweise über SSE (Server-Sent Events) zurückgegebenfalse(Standard): die vollständige Antwort wird auf einmal zurückgegeben
Optionen für die Streaming-Antwort, nur bei stream=true wirksam.
Liste der Werkzeugdefinitionen für Function Calling. Jedes Werkzeug muss Name, Beschreibung und Parameter-Schema definieren.
Antwort
Chat erfolgreich generiert