Qwen3.8-Max-Preview - Interface Responses
🚧 Ce modele n’est pas encore disponible, restez a l’ecoute
- Appelez Qwen3.8-Max-Preview avec le protocole OpenAI Responses
- Entrée flexible :
inputpeut recevoir une chaîne, ou un tableau de messages au format Chat (prenant en charge le multimodalinput_text/input_image) - Conversation multi-tour : passez
previous_response_idpour associer la réponse du tour précédent, le serveur combine automatiquement le contexte (l’idde réponse est valable 7 jours) - Mise en cache de session : activée en ajoutant
x-dashscope-session-cache: enableà l’en-tête de requête (disable par défaut), voir les correspondances dansusage.input_tokens_details.cached_tokens - Intensité de réflexion : contrôlée via
reasoning.effort - Sortie en streaming : lorsque
stream=true, le retour suit les événements Responses (response.output_text.delta/response.completed, etc.)
https://direct.evolink.ai, qui offre une meilleure prise en charge des modèles de texte et des connexions longues ; https://api.evolink.ai est l’adresse principale multimodale, à utiliser en cas d’entrée image.Mise en cache de session : l’interface Responses active la mise en cache de session côté serveur via l’en-tête de requête x-dashscope-session-cache: enable afin de réduire la latence et le coût des tours multiples.Autorisations
##Toutes les API nécessitent une authentification Bearer Token##
Obtenir une clé API :
Visitez la Page de gestion des clés API pour obtenir votre clé API
Ajouter à l'en-tête de requête :
En-têtes
Interrupteur de mise en cache de session. Défini sur enable, le serveur met automatiquement en cache le contexte de conversation pour réduire la latence et le coût de l'inférence multi-tour.
enable, disable Corps
Nom du modèle de conversation
qwen3.8-max-preview "qwen3.8-max-preview"
Entrée du modèle. Peut recevoir une chaîne (texte brut), ou un tableau de messages au format Chat (prenant en charge le multimodal input_text / input_image).
Inséré au début du contexte en tant qu'instruction système. Lors de l'utilisation de previous_response_id, les instructions du tour précédent ne sont pas transmises au tour actuel.
ID unique de la réponse du tour précédent (l'id de réponse, valable 7 jours). Utilisé pour associer une conversation multi-tour, le serveur récupère et combine automatiquement l'entrée et la sortie de ce tour comme contexte.
Nombre maximal de tokens du contenu de sortie généré cette fois (réflexion incluse).
Contrôle de la réflexion.
Stocker ou non cette réponse.
true(par défaut) : peut être référencée parprevious_response_idfalse: non stockée, ne peut pas être référencée ultérieurement
Renvoyer ou non un flux d'événements Responses.
Température d'échantillonnage, plage [0, 2].
0 <= x <= 2Paramètre d'échantillonnage nucleus, plage (0, 1].
0 <= x <= 1Liste d'outils. Prend en charge les outils intégrés (web_search recherche web, web_extractor extraction de pages web, code_interpreter interpréteur de code) ainsi que les function personnalisées.
Réponse
Génération réussie
ID unique de cette réponse (valable 7 jours, peut servir de previous_response_id)
"resp_xxxxxxxx"
"response"
Statut de la réponse
"completed"
"qwen3.8-max-preview"
Tableau d'éléments de sortie (contenant message / reasoning / appels d'outils intégrés, etc.)
Statistiques d'utilisation des tokens.