Qwen3.8-Max-Preview - Documentation complète des paramètres
🚧 Ce modele n’est pas encore disponible, restez a l’ecoute
- Appelez Qwen3.8-Max-Preview avec le protocole OpenAI Chat Completions
- Conversation multi-tour : prend en charge la conversation contextuelle à un ou plusieurs tours
- Prompt système : définissez le rôle et le comportement de l’IA via un message
role=system - Entrée multimodale :
contentreçoit un tableau de content part, prenant en chargetext/image_url/input_audio/video_url - Mise en cache du contexte : ajoutez
cache_controlsur un content part pour déclarer un cache explicite ; voir les correspondances dans la réponseusage.prompt_tokens_details - Mode réflexion : activé avec
enable_thinking=true, le contenu de réflexion est renvoyé viareasoning_content - Sortie en streaming : lorsque
stream=true, le retour se fait bloc par bloc via SSE
https://direct.evolink.ai, qui offre une meilleure prise en charge des modèles de texte et des connexions longues ; https://api.evolink.ai est l’adresse principale multimodale, à utiliser en cas d’entrée image / audio / vidéo.Autorisations
##Toutes les API nécessitent une authentification Bearer Token##
Obtenir une clé API :
Visitez la Page de gestion des clés API pour obtenir votre clé API
Ajouter à l'en-tête de requête :
Corps
Nom du modèle de conversation
qwen3.8-max-preview "qwen3.8-max-preview"
Liste des messages de conversation, prend en charge la conversation multi-tour. Les champs de message diffèrent selon le rôle (system / user / assistant / tool), veuillez sélectionner le rôle correspondant pour les consulter.
- System Message
- User Message
- Assistant Message
- Tool Message
Activer ou non la réflexion approfondie
true: le modèle produit son processus de réflexion, renvoyé viareasoning_contentfalse(par défaut) : ne produit pas le processus de réflexion
Remarque : certains modèles nécessitent de définir explicitement
trueen appel non-streaming pour renvoyer le contenu de réflexion.
Température d'échantillonnage, contrôle le caractère aléatoire de la sortie. Les valeurs plus basses sont plus déterministes, les plus élevées plus variées. Plage [0, 2]. Il est recommandé de ne pas ajuster temperature et top_p en même temps.
0 <= x <= 2Paramètre d'échantillonnage nucleus (Nucleus Sampling), échantillonne parmi les premiers tokens cumulant la probabilité. Plage (0, 1]. Il est recommandé de ne pas ajuster temperature et top_p en même temps.
0 <= x <= 1Limite supérieure de longueur du contenu généré (nombre de tokens), incluant la chaîne de réflexion et la réponse. Ce paramètre est recommandé pour les modèles de réflexion. La valeur par défaut et la valeur maximale correspondent à la longueur de sortie maximale du modèle ; au-delà, la génération s'arrête prématurément avec finish_reason=length.
Ancien paramètre de limitation de longueur de génération.
Déprécié : pour les nouvelles intégrations, utilisez plutôt
max_completion_tokens. Ce paramètre ne limite que la partie réponse (hors chaîne de réflexion).
Renvoyer ou non la réponse en streaming.
true: retour bloc par bloc via SSE (Server-Sent Events)false(par défaut) : renvoie la réponse complète en une seule fois
Options de réponse en streaming, valides uniquement lorsque stream=true.
Liste de définitions d'outils, utilisée pour Function Calling. Chaque outil doit définir un nom, une description et un schéma de paramètres.
Réponse
Génération de la conversation réussie