Qwen3.8 Max API
Choisir Qwen3.8 Max
Une route de raisonnement premium accessible via trois protocoles API, conçue pour le code à l’échelle d’un dépôt, les longs documents, les grands corpus de preuves, les agents de longue durée et les tâches complexes profitant d’un contexte de 1 048 576 tokens.
Qwen3.8 Max
Modèle phare Max d’Alibaba Tongyi Qwen
qwen3.8-maxIngénierie sur un dépôt complet, synthèse multi-document, agents riches en outils via Chat, Responses ou Messages et tâches difficiles où moins de retries et de corrections justifient une route premium.
Tarifs de Qwen3.8 Max
Estimez une requête avec le calculateur interactif. Tous les groupes utilisent le tarif Qwen3.8 Max basé sur le coût.
Calculateur de tokens
Saisissez la composition en tokens d’une requête.Une requête utilise un seul mode. Explicite : envoyez cache_control, créez le cache à 125 % du tarif d’entrée puis payez 10 % à chaque hit. Implicite : rien à envoyer, aucune écriture facturée et hits à 20 %.
Coût estimé de la requête
Qwen3.8 MaxFacturation minimale : 0,01 crédit par requête.
Guide de budget
Nombre approximatif de requêtes avec la composition actuelle.Pour un test rapide
Pour le développement courant
Pour l’évaluation en production
Tarifs du modèle
| Modèle | Contexte | Tokens d’entrée | Tokens de sortie | Écriture du cache | Lecture · implicite | Lecture · explicite |
|---|---|---|---|---|---|---|
Qwen3.8 Maxqwen3.8-max | Toutes les longueurs de contexte | $1.765 / 1M120 cr / 1M$1.765 tarif officiel | $5.295 / 1M360 cr / 1M$5.295 tarif officiel | $2.206 / 1M150 cr / 1M$2.206 tarif officiel | $0.353 / 1M24 cr / 1M$0.353 tarif officiel | $0.177 / 1M12 cr / 1M$0.177 tarif officiel |
Qwen3.8 Max
Toutes les longueurs de contexteLes USD et crédits sont indiqués par million de tokens. L’écriture ne concerne que le cache explicite. Une requête utilise une lecture explicite ou implicite, jamais les deux. Les tarifs live du backend priment sur ces valeurs de secours.
Tarifs des outils intégrés
Les outils intégrés sont facturés en plus des tokens et uniquement lorsque l’outil s’exécute réellement : une requête sans recherche ne paie rien de tout cela. Anthropic Messages ignore les outils intégrés en amont, donc rien ne s’exécute et rien n’est facturé.
API Qwen3.8 Max pour le raisonnement long contexte et les agents
Accédez au modèle phare Max d’Alibaba Tongyi Qwen via l’API unifiée EvoLink. Qwen3.8 Max sert le même modèle avec OpenAI Chat Completions, OpenAI Responses et Anthropic Messages en byte passthrough complet, une fenêtre de 1 048 576 tokens, un raisonnement contrôlable et un cache de prompts explicite ou implicite pour l’ingénierie à l’échelle d’un dépôt, les longs documents et les workflows d’outils multi-étapes.

La place de Qwen3.8 Max dans une pile de modèles en production
Un modèle phare ne doit pas devenir la route par défaut pour chaque requête. Il est surtout pertinent lorsque le contexte long, le raisonnement continu ou les chaînes d’outils réduisent reprises, transferts et corrections humaines.
Code à l’échelle d’un dépôt
Utilisez-le lorsque la tâche dépend de documents d’architecture, de services liés, de l’historique des tests, de grands diffs et de contraintes réparties entre fichiers. Mesurez les correctifs acceptés et le temps de revue plutôt que la qualité d’un extrait isolé.
Analyse de longs documents
Conservez spécifications, études, contrats, journaux et preuves liées dans un même contexte. La recherche d’information et la structure restent essentielles : une fenêtre 1M ne rend pas le contenu hors sujet utile.
Agents avec outils sur trois protocoles
Adapté à la sélection d’outils multi-étapes, aux sorties structurées et aux actions externes répétées via Chat, Responses ou Messages. Préservez messages, thinking, IDs d’appel, arguments et résultats entre les tours.
Quand préférer un modèle plus léger
Chat court, classification, réécriture, extraction simple et actions UI sensibles à la latence ont rarement besoin du raisonnement maximal ou d’un contexte 1M. Gardez-les sur une route moins chère et n’escaladez que si la difficulté le justifie.
Ce qui distingue Qwen3.8 Max sur EvoLink
Il s’agit de capacités contractuelles de la route EvoLink, pas de conclusions de benchmark. Vérifiez latence, qualité et comportement du cache sur vos tâches avant d’en faire une route par défaut.
Byte passthrough sur trois protocoles
OpenAI Chat, OpenAI Responses et Anthropic Messages atteignent le même modèle par byte passthrough : thinking, signatures et marqueurs de cache ne sont pas re-sérialisés avec perte dans le gateway.
Cache de prompts explicite et implicite
cache_control marque les préfixes réutilisables avec des lectures à 10 % du tarif d’entrée ; le cache implicite agit automatiquement à 20 %. Les deux modes sont exclusifs par requête et le gateway conserve les marqueurs.
Effort de raisonnement contrôlable
Le raisonnement est actif en xhigh par défaut et réglable sur medium ou low avec reasoning_effort. Le gateway transmet le champ sans forcer son état. N’envoyez pas reasoning_effort et thinking_budget ensemble.
Le thinking doit être rejoué entre les tours
preserve_thinking est actif par défaut. Chaque reasoning_content de l’assistant doit être renvoyé inchangé et ne peut pas être fusionné dans content. Le raisonnement rejoué est facturé en tokens d’entrée.
Pourquoi Qwen3.8 Max peut traiter ces charges
La valeur vient de la combinaison du contexte long, du raisonnement continu et des préfixes réutilisables. La capacité seule n’améliore pas une réponse : preuves pertinentes, structure claire et budget de sortie restent nécessaires.
1M tokens comme espace de travail, pas comme cible
La fenêtre de 1 048 576 tokens conserve code, spécifications et résultats d’outils liés sans découpage excessif. Retrieval et compactage restent importants, car le contenu inutile consomme attention et coût.
Le raisonnement continu exige un budget de sortie
Les tokens de raisonnement et de réponse finale comptent dans l’usage. Traitez la limite comme une capacité, pas comme une longueur normale, et fixez un budget adapté avec reasoning_effort.
Le cache est rentable avec des préfixes stables
Instructions du dépôt, prompts système, références et schémas d’outils offrent le meilleur potentiel si leur ordre reste stable. Des changements fréquents peuvent imposer de retraiter le long préfixe.
Function calling, outils intégrés et Structured Output
Qwen répertorie function calling, outils intégrés et Structured Output pour le modèle de production. Validez le comportement exact des outils et schémas via la route EvoLink avant d’augmenter le trafic.
Ce qu’il faut vérifier avant d’envoyer du trafic de production
Une charge adaptée peut échouer à cause d’un mauvais identifiant, d’un champ maximum incorrect ou d’un état d’agent perdu. Vérifiez la surface de requête avant d’évaluer la qualité du modèle.
Utiliser l’ID qwen3.8-max
La route EvoLink utilise qwen3.8-max pour Chat Completions, Responses et Anthropic Messages.
Utiliser le bon champ maximum par endpoint
Chat utilise max_completion_tokens, Responses max_output_tokens et Anthropic Messages exige max_tokens. Un mauvais champ peut être ignoré ou rejeté upstream.
Rejouer thinking et état des outils au complet
Les agents multi-tours doivent conserver messages, blocs thinking et signature, IDs d’appel, arguments et résultats. Garder uniquement le texte final rompt la continuité d’état.
Renvoyer reasoning_content à chaque tour
preserve_thinking est actif par défaut. Chaque reasoning_content de l’assistant doit être renvoyé inchangé et ne peut pas être fusionné dans content. Ces tokens sont facturés en entrée.
Créer les caches explicites via Chat ou Messages
Les lectures fonctionnent sur les trois protocoles, mais créer un grand cache explicite avec Responses est la voie upstream la moins fiable. Marquez les préfixes cache_control via Chat Completions ou Anthropic Messages, puis lisez-les depuis tout protocole.
Comparer le coût par tâche acceptée, pas seulement le prix du token
Qwen3.8 Max ne justifie une route premium que s’il réduit découpage, retries, chaînes d’outils en échec ou reprise humaine sur la même charge. Comparez des ensembles de tâches identiques.
Si le modèle fournit des résultats utilisables avec moins de retries et de revue, un tarif au coût peut réduire le coût total. Sinon, gardez la charge sur une route plus légère.
Comparer les modèles à long contexte après des tests métier
EvoLinkVérifiez d’abord si Qwen3.8 Max réduit retries et temps de revue sur vos tâches. Comparez ensuite tarifs, contexte, cache et adéquation pour choisir la route de production.
| Modèle | Qwen3.8 Max | Claude Opus 5 | Kimi K3 |
|---|---|---|---|
| Entrée / sortie | $1.765 / $5.295 | $4.75 / $23.75 | $3 / $15 |
| Contexte | 1M | 1M | 1M |
| Cache | Explicite + implicite | Lecture + écriture | Lecture + écriture |
| Idéal pour | Ingénierie sur un dépôt complet, synthèse multi-document, agents riches en outils via Chat, Responses ou Messages et tâches difficiles où moins de retries et de corrections justifient une route premium. | Référence premium pour les agents de code longue durée, les revues complexes et les workflows exigeant beaucoup de jugement. | Route Moonshot à long contexte pour les grands dépôts et le raisonnement multi-document à un tarif intermédiaire. |
Modèles associés

Claude Opus 5
Référence premium pour les agents de code longue durée, les revues complexes et les workflows exigeant beaucoup de jugement.
Voir le modèle
Kimi K3
Route Moonshot à long contexte pour les grands dépôts et le raisonnement multi-document à un tarif intermédiaire.
Voir le modèle
DeepSeek V4
Référence économique pour le code, le raisonnement et les agents à fort volume avec un contexte 1M.
Voir le modèle
GPT-5.6
Les niveaux Sol, Terra et Luna permettent de comparer capacités, latence et souplesse de routage par coût.
Voir le modèleGuides sur la sortie, les preuves et l’intégration de Qwen3.8 Max

Sortie et fonctions de Qwen3.8 Max
Distinguez version de production, canaux précoces, capacités officielles et statut des poids ouverts.
Lire le guide
Preuves de benchmark Qwen3.8 Max
Examinez résultats officiels, preuves tierces et plan de tests de production EvoLink.
Lire le guide
Qwen3.8 Max vs Qwen3.7 Max
Choisissez entre maintien, canary ou migration grâce à une checklist réversible.
Lire le guide
Qwen3.8 Max vs Kimi K3
Comparez code, agents, long contexte, coût et rôles principal, challenger et fallback.
Lire le guideFAQ sur l’API Qwen3.8 Max
Quel est l’ID du modèle pour l’API Qwen3.8 Max ?
Utilisez qwen3.8-max sur EvoLink pour Chat Completions, Responses et Anthropic Messages.
Quels protocoles API sont pris en charge ?
OpenAI Chat Completions, OpenAI Responses et Anthropic Messages. Les trois servent le même modèle avec un byte passthrough complet.
Quel champ de tokens maximum utiliser ?
Chat utilise max_completion_tokens, Responses max_output_tokens et Anthropic Messages exige max_tokens. Le champ natif de l’endpoint reste le choix le plus sûr.
Le modèle prend-il en charge un contexte de 1M tokens ?
La route EvoLink expose une fenêtre de 1 048 576 tokens. Utilisez-la pour des fichiers, documents et états d’agent réellement liés, sans chercher à la remplir par défaut.
Comment fonctionne le raisonnement ?
Il est actif par défaut et contrôlé par reasoning_effort : xhigh, medium ou low. N’envoyez pas reasoning_effort et thinking_budget ensemble. Le gateway conserve les blocs thinking et signature sur Messages.
Faut-il renvoyer reasoning_content dans un échange multi-tour ?
Oui. preserve_thinking est actif par défaut. Chaque reasoning_content de l’assistant doit être renvoyé inchangé et ne peut pas être fusionné dans content. Ces tokens sont facturés en entrée.
Comment fonctionne le cache et combien coûte-t-il ?
Le cache explicite via cache_control et le cache implicite automatique sont pris en charge, avec un seul mode par requête. Les hits explicites coûtent 10 %, les implicites 20 %. L’écriture explicite coûte 125 % de l’entrée ; l’implicite n’a pas de coût d’écriture séparé.
Puis-je utiliser le SDK OpenAI ou Anthropic Messages ?
Oui. Gardez la même clé API EvoLink, sélectionnez qwen3.8-max et utilisez Chat Completions, Responses ou Anthropic Messages.
Est-ce un bon choix par défaut pour le temps réel ou le haut volume ?
Généralement pas sans test. Le raisonnement maximal et les longues sorties augmentent latence et coût des tâches simples. Gardez chat court, classification et extraction légère sur une route plus petite.
Comment le modèle est-il facturé ?
Entrée, sortie, écriture et lecture du cache sont facturées au coût, avec un tarif explicite et un tarif implicite pour la lecture. Les tarifs live du backend sont prioritaires.