Seedance 2.5 est disponible sur EvoLinkEssayer Seedance 2.5

Qwen3.8 Max API

Alibaba Qwen-Génération de texte-à partir de $1.765 / 1M tokens d’entrée$1.765 tarif officiel-Disponible
Contexte 1MRaisonnement contrôlableFunction calling + sortie structuréeCache explicite + impliciteChat + Responses + Messages
Documentation API
Route de productionActive
Fournisseur
Alibaba Qwen
Modèle
Qwen3.8 Max
Fenêtre de contexte
1 048 576 tokens
Protocoles
Chat · Responses · Messages

Choisir Qwen3.8 Max

Une route de raisonnement premium accessible via trois protocoles API, conçue pour le code à l’échelle d’un dépôt, les longs documents, les grands corpus de preuves, les agents de longue durée et les tâches complexes profitant d’un contexte de 1 048 576 tokens.

Qwen3.8 Max

Modèle phare Max d’Alibaba Tongyi Qwen

Sélectionné
À partir de $1.765 / 1M tokens d’entrée$1.765 tarif officielqwen3.8-max
Idéal pour

Ingénierie sur un dépôt complet, synthèse multi-document, agents riches en outils via Chat, Responses ou Messages et tâches difficiles où moins de retries et de corrections justifient une route premium.

Entrée
$1.765 / 1M120 cr / 1M$1.765 tarif officiel
Sortie
$5.295 / 1M360 cr / 1M$5.295 tarif officiel
Écriture du cache
$2.206 / 1M150 cr / 1M$2.206 tarif officiel
Lecture du cache · implicite
$0.353 / 1M24 cr / 1M$0.353 tarif officiel
Lecture du cache · explicite
$0.177 / 1M12 cr / 1M$0.177 tarif officiel

Tarifs de Qwen3.8 Max

Estimez une requête avec le calculateur interactif. Tous les groupes utilisent le tarif Qwen3.8 Max basé sur le coût.

Qwen3.8 Max

Calculateur de tokens

Saisissez la composition en tokens d’une requête.
Mode de lecture du cache

Une requête utilise un seul mode. Explicite : envoyez cache_control, créez le cache à 125 % du tarif d’entrée puis payez 10 % à chaque hit. Implicite : rien à envoyer, aucune écriture facturée et hits à 20 %.

Coût estimé de la requête

Qwen3.8 Max
Tarif au coût
USD$0.0035
Credits0.2328
Tokens d’entrée0.12 cr
Tokens d’écriture du cache0 cr
Tokens de lecture du cache · Implicite0.0048 cr
Tokens de sortie0.108 cr

Facturation minimale : 0,01 crédit par requête.

Guide de budget

Nombre approximatif de requêtes avec la composition actuelle.
Ajouter des crédits
$10
Environ 2920 requêtes

Pour un test rapide

$50
Environ 14604 requêtes

Pour le développement courant

$100
Environ 29209 requêtes

Pour l’évaluation en production

Tarifs du modèle

Qwen3.8 Max

Toutes les longueurs de contexte
Tokens d’entrée
$1.765 / 1M120 cr / 1M$1.765 tarif officiel
Tokens de sortie
$5.295 / 1M360 cr / 1M$5.295 tarif officiel
Écriture du cache
$2.206 / 1M150 cr / 1M$2.206 tarif officiel
Lecture · implicite
$0.353 / 1M24 cr / 1M$0.353 tarif officiel
Lecture · explicite
$0.177 / 1M12 cr / 1M$0.177 tarif officiel

Les USD et crédits sont indiqués par million de tokens. L’écriture ne concerne que le cache explicite. Une requête utilise une lecture explicite ou implicite, jamais les deux. Les tarifs live du backend priment sur ces valeurs de secours.

Tarifs des outils intégrés

Recherche web · turboChat
$0.0005 par appel0.03 cr par appel
Recherche web · maxChat
$0.0006 par appel0.04 cr par appel
Outil de recherche webResponses
$0.0006 par appel0.04 cr par appel
Recherche texte vers imageResponses
$0.0036 par appel0.24 cr par appel
Recherche image vers imageResponses
$0.0071 par appel0.48 cr par appel
Analyse PDFChat
$0.0030 par page0.2 cr par page

Les outils intégrés sont facturés en plus des tokens et uniquement lorsque l’outil s’exécute réellement : une requête sans recherche ne paie rien de tout cela. Anthropic Messages ignore les outils intégrés en amont, donc rien ne s’exécute et rien n’est facturé.

API Qwen3.8 Max pour le raisonnement long contexte et les agents

Accédez au modèle phare Max d’Alibaba Tongyi Qwen via l’API unifiée EvoLink. Qwen3.8 Max sert le même modèle avec OpenAI Chat Completions, OpenAI Responses et Anthropic Messages en byte passthrough complet, une fenêtre de 1 048 576 tokens, un raisonnement contrôlable et un cache de prompts explicite ou implicite pour l’ingénierie à l’échelle d’un dépôt, les longs documents et les workflows d’outils multi-étapes.

Qwen3.8 Max
Cas d’usage de Qwen3.8 Max

La place de Qwen3.8 Max dans une pile de modèles en production

Un modèle phare ne doit pas devenir la route par défaut pour chaque requête. Il est surtout pertinent lorsque le contexte long, le raisonnement continu ou les chaînes d’outils réduisent reprises, transferts et corrections humaines.

Code à l’échelle d’un dépôt

Utilisez-le lorsque la tâche dépend de documents d’architecture, de services liés, de l’historique des tests, de grands diffs et de contraintes réparties entre fichiers. Mesurez les correctifs acceptés et le temps de revue plutôt que la qualité d’un extrait isolé.

Analyse de longs documents

Conservez spécifications, études, contrats, journaux et preuves liées dans un même contexte. La recherche d’information et la structure restent essentielles : une fenêtre 1M ne rend pas le contenu hors sujet utile.

Agents avec outils sur trois protocoles

Adapté à la sélection d’outils multi-étapes, aux sorties structurées et aux actions externes répétées via Chat, Responses ou Messages. Préservez messages, thinking, IDs d’appel, arguments et résultats entre les tours.

Quand préférer un modèle plus léger

Chat court, classification, réécriture, extraction simple et actions UI sensibles à la latence ont rarement besoin du raisonnement maximal ou d’un contexte 1M. Gardez-les sur une route moins chère et n’escaladez que si la difficulté le justifie.

Signaux de protocole et de cache

Ce qui distingue Qwen3.8 Max sur EvoLink

Il s’agit de capacités contractuelles de la route EvoLink, pas de conclusions de benchmark. Vérifiez latence, qualité et comportement du cache sur vos tâches avant d’en faire une route par défaut.

Byte passthrough sur trois protocoles

OpenAI Chat, OpenAI Responses et Anthropic Messages atteignent le même modèle par byte passthrough : thinking, signatures et marqueurs de cache ne sont pas re-sérialisés avec perte dans le gateway.

Cache de prompts explicite et implicite

cache_control marque les préfixes réutilisables avec des lectures à 10 % du tarif d’entrée ; le cache implicite agit automatiquement à 20 %. Les deux modes sont exclusifs par requête et le gateway conserve les marqueurs.

Effort de raisonnement contrôlable

Le raisonnement est actif en xhigh par défaut et réglable sur medium ou low avec reasoning_effort. Le gateway transmet le champ sans forcer son état. N’envoyez pas reasoning_effort et thinking_budget ensemble.

Le thinking doit être rejoué entre les tours

preserve_thinking est actif par défaut. Chaque reasoning_content de l’assistant doit être renvoyé inchangé et ne peut pas être fusionné dans content. Le raisonnement rejoué est facturé en tokens d’entrée.

Capacités clés

Pourquoi Qwen3.8 Max peut traiter ces charges

La valeur vient de la combinaison du contexte long, du raisonnement continu et des préfixes réutilisables. La capacité seule n’améliore pas une réponse : preuves pertinentes, structure claire et budget de sortie restent nécessaires.

1M tokens comme espace de travail, pas comme cible

La fenêtre de 1 048 576 tokens conserve code, spécifications et résultats d’outils liés sans découpage excessif. Retrieval et compactage restent importants, car le contenu inutile consomme attention et coût.

Le raisonnement continu exige un budget de sortie

Les tokens de raisonnement et de réponse finale comptent dans l’usage. Traitez la limite comme une capacité, pas comme une longueur normale, et fixez un budget adapté avec reasoning_effort.

Le cache est rentable avec des préfixes stables

Instructions du dépôt, prompts système, références et schémas d’outils offrent le meilleur potentiel si leur ordre reste stable. Des changements fréquents peuvent imposer de retraiter le long préfixe.

Function calling, outils intégrés et Structured Output

Qwen répertorie function calling, outils intégrés et Structured Output pour le modèle de production. Validez le comportement exact des outils et schémas via la route EvoLink avant d’augmenter le trafic.

Contrôles de production de l’API Qwen3.8 Max

Ce qu’il faut vérifier avant d’envoyer du trafic de production

Une charge adaptée peut échouer à cause d’un mauvais identifiant, d’un champ maximum incorrect ou d’un état d’agent perdu. Vérifiez la surface de requête avant d’évaluer la qualité du modèle.

01

Utiliser l’ID qwen3.8-max

La route EvoLink utilise qwen3.8-max pour Chat Completions, Responses et Anthropic Messages.

ID du modèle
02

Utiliser le bon champ maximum par endpoint

Chat utilise max_completion_tokens, Responses max_output_tokens et Anthropic Messages exige max_tokens. Un mauvais champ peut être ignoré ou rejeté upstream.

Endpoints
03

Rejouer thinking et état des outils au complet

Les agents multi-tours doivent conserver messages, blocs thinking et signature, IDs d’appel, arguments et résultats. Garder uniquement le texte final rompt la continuité d’état.

État des outils
04

Renvoyer reasoning_content à chaque tour

preserve_thinking est actif par défaut. Chaque reasoning_content de l’assistant doit être renvoyé inchangé et ne peut pas être fusionné dans content. Ces tokens sont facturés en entrée.

Replay du thinking
05

Créer les caches explicites via Chat ou Messages

Les lectures fonctionnent sur les trois protocoles, mais créer un grand cache explicite avec Responses est la voie upstream la moins fiable. Marquez les préfixes cache_control via Chat Completions ou Anthropic Messages, puis lisez-les depuis tout protocole.

Cache
Économie de production

Comparer le coût par tâche acceptée, pas seulement le prix du token

Qwen3.8 Max ne justifie une route premium que s’il réduit découpage, retries, chaînes d’outils en échec ou reprise humaine sur la même charge. Comparez des ensembles de tâches identiques.

Réussite au premier essaiLivrables acceptésNombre de retriesTokens de sortieTaux de cache hitAppels d’outils validesDélai jusqu’au résultat acceptéCorrection humaine et fallback

Si le modèle fournit des résultats utilisables avec moins de retries et de revue, un tarif au coût peut réduire le coût total. Sinon, gardez la charge sur une route plus légère.

Comparer les modèles à long contexte après des tests métier

EvoLink

Vérifiez d’abord si Qwen3.8 Max réduit retries et temps de revue sur vos tâches. Comparez ensuite tarifs, contexte, cache et adéquation pour choisir la route de production.

Qwen3.8 Max
Entrée / sortie$1.765 / $5.295
Contexte1M
CacheExplicite + implicite
Idéal pourIngénierie sur un dépôt complet, synthèse multi-document, agents riches en outils via Chat, Responses ou Messages et tâches difficiles où moins de retries et de corrections justifient une route premium.
Claude Opus 5
Entrée / sortie$4.75 / $23.75
Contexte1M
CacheLecture + écriture
Idéal pourRéférence premium pour les agents de code longue durée, les revues complexes et les workflows exigeant beaucoup de jugement.
Kimi K3
Entrée / sortie$3 / $15
Contexte1M
CacheLecture + écriture
Idéal pourRoute Moonshot à long contexte pour les grands dépôts et le raisonnement multi-document à un tarif intermédiaire.

Modèles associés

Claude Opus 5

Claude Opus 5

Référence premium pour les agents de code longue durée, les revues complexes et les workflows exigeant beaucoup de jugement.

Voir le modèle
Kimi K3

Kimi K3

Route Moonshot à long contexte pour les grands dépôts et le raisonnement multi-document à un tarif intermédiaire.

Voir le modèle
DeepSeek V4

DeepSeek V4

Référence économique pour le code, le raisonnement et les agents à fort volume avec un contexte 1M.

Voir le modèle
GPT-5.6

GPT-5.6

Les niveaux Sol, Terra et Luna permettent de comparer capacités, latence et souplesse de routage par coût.

Voir le modèle

Guides sur la sortie, les preuves et l’intégration de Qwen3.8 Max

Sortie et fonctions de Qwen3.8 Max

Sortie et fonctions de Qwen3.8 Max

Distinguez version de production, canaux précoces, capacités officielles et statut des poids ouverts.

Lire le guide
Preuves de benchmark Qwen3.8 Max

Preuves de benchmark Qwen3.8 Max

Examinez résultats officiels, preuves tierces et plan de tests de production EvoLink.

Lire le guide
Qwen3.8 Max vs Qwen3.7 Max

Qwen3.8 Max vs Qwen3.7 Max

Choisissez entre maintien, canary ou migration grâce à une checklist réversible.

Lire le guide
Qwen3.8 Max vs Kimi K3

Qwen3.8 Max vs Kimi K3

Comparez code, agents, long contexte, coût et rôles principal, challenger et fallback.

Lire le guide

FAQ sur l’API Qwen3.8 Max

Quel est l’ID du modèle pour l’API Qwen3.8 Max ?

Utilisez qwen3.8-max sur EvoLink pour Chat Completions, Responses et Anthropic Messages.

Quels protocoles API sont pris en charge ?

OpenAI Chat Completions, OpenAI Responses et Anthropic Messages. Les trois servent le même modèle avec un byte passthrough complet.

Quel champ de tokens maximum utiliser ?

Chat utilise max_completion_tokens, Responses max_output_tokens et Anthropic Messages exige max_tokens. Le champ natif de l’endpoint reste le choix le plus sûr.

Le modèle prend-il en charge un contexte de 1M tokens ?

La route EvoLink expose une fenêtre de 1 048 576 tokens. Utilisez-la pour des fichiers, documents et états d’agent réellement liés, sans chercher à la remplir par défaut.

Comment fonctionne le raisonnement ?

Il est actif par défaut et contrôlé par reasoning_effort : xhigh, medium ou low. N’envoyez pas reasoning_effort et thinking_budget ensemble. Le gateway conserve les blocs thinking et signature sur Messages.

Faut-il renvoyer reasoning_content dans un échange multi-tour ?

Oui. preserve_thinking est actif par défaut. Chaque reasoning_content de l’assistant doit être renvoyé inchangé et ne peut pas être fusionné dans content. Ces tokens sont facturés en entrée.

Comment fonctionne le cache et combien coûte-t-il ?

Le cache explicite via cache_control et le cache implicite automatique sont pris en charge, avec un seul mode par requête. Les hits explicites coûtent 10 %, les implicites 20 %. L’écriture explicite coûte 125 % de l’entrée ; l’implicite n’a pas de coût d’écriture séparé.

Puis-je utiliser le SDK OpenAI ou Anthropic Messages ?

Oui. Gardez la même clé API EvoLink, sélectionnez qwen3.8-max et utilisez Chat Completions, Responses ou Anthropic Messages.

Est-ce un bon choix par défaut pour le temps réel ou le haut volume ?

Généralement pas sans test. Le raisonnement maximal et les longues sorties augmentent latence et coût des tâches simples. Gardez chat court, classification et extraction légère sur une route plus petite.

Comment le modèle est-il facturé ?

Entrée, sortie, écriture et lecture du cache sont facturées au coût, avec un tarif explicite et un tarif implicite pour la lecture. Les tarifs live du backend sont prioritaires.