Kimi K3 est maintenant disponibleDécouvrir Kimi K3
Laboratoire abstrait de preuves pour les benchmarks Qwen3.8 de code, raisonnement, multimodal et agents
benchmark

Benchmark Qwen3.8 : ce qui est confirmé et reste à tester

Jessie
Jessie
COO
21 juillet 2026
10 min de lecture
Réponse rapide : il n’existe pas encore de scorecard Qwen3.8 complète et reproductible. Le tableau officiel complet et une réplication indépendante étendue manquent. EvoLink n’a pas exécuté son propre benchmark API, faute de route de production Qwen3.8.
La bonne question n'est pas « Quel est le rang de Qwen3.8 ? », mais « Quelle preuve est assez fiable pour changer une décision de routage ? ». La page Qwen3.8 Max suit la disponibilité EvoLink ; voici le gate à franchir avant d'envoyer du trafic réel.
Attention au nom : Qwen3.8 Max Preview n’est pas Qwen3-8B. Les scores de l’ancien modèle 8B ne constituent pas une preuve sur Qwen3.8.

Cette page peut qualifier les faits et limites documentés. Elle ne peut pas conclure que Qwen3.8 bat globalement Fable 5, GPT-5.6, Kimi K3 ou Qwen3.7 Max.

État actuel des preuves

NiveauDisponible ?Ce qu'il permetCe qu'il ne permet pas
Statut et fonctions officielsOuiID, canal, raisonnement/vision/texteClassement global
Positionnement de lancement QwenOuiHypothèses et concurrents à testerVictoire indépendante
Tests tiers par chargeLimitésObservations sur une tâche et une routeCapacité générale
Large couverture indépendanteInsuffisanteFutur comparatif transversalConclusion définitive aujourd'hui

Une fonctionnalité documentée n'est pas un score, et un classement fournisseur n'est pas une preuve indépendante.

Ce que Qwen affirme officiellement

DéclarationHypothèse utileConclusion dangereuse
2,4 billions de paramètresTester si l'échelle améliore les tâches difficilesPlus de paramètres garantit mieux.
Positionnement proche de la frontièreInclure Fable, GPT, Kimi et Qwen3.7Qwen3.8 est indépendamment deuxième.
Orientation code et travail complexeTester dépôts et longues boucles d'outilsQwen3.8 est le meilleur pour coder.
Projet Open WeightsPréparer serving et reproductibilitéLes poids seront identiques à la Preview hébergée.

L'absence de nombre de paramètres actifs et de détails d'architecture empêche aussi d'inférer coût d'inférence, latence, mémoire ou calcul par token.

Ce que révèle un premier test tiers

Trilogy AI a comparé Qwen3.8 Max et Kimi K3 sur l'architecture d'un dépôt de 269 fichiers. En revue aveugle, Kimi a obtenu 83/100 et Qwen 80/100. Kimi a terminé plus vite avec moins de tokens ; Qwen a produit des frontières système plus propres et de meilleures métadonnées de replay.

Signal utile, mais périmètre étroit : une seule tâche, peu de données de variance et une dépendance possible au client, aux outils, au niveau de raisonnement et à la route. La conclusion prudente est que Kimi a gagné de peu ce test précis, tandis que Qwen a montré des forces de conception à reproduire ailleurs.

Le canal d’accès fait partie du résultat : l’essai Qwen cité utilisait le Token Plan international dans un harnais de code interactif, tandis que Kimi passait par un abonnement Kimi Code. Le score 83 contre 80 compare donc deux parcours de bout en bout datés, pas deux API de production interchangeables. Une réplication solide doit figer les entrées, noter séparément les affirmations et la structure, distinguer modèle et route, publier latence et tokens avec la qualité, anonymiser la revue si possible et montrer l’analyse des échecs.

Les preuves encore manquantes

Divulgation complète des benchmarks officiels

Un tableau fournisseur exploitable doit préciser version du modèle, réglage de raisonnement, accès aux outils, politique de prompt, nombre d’essais, méthode de notation et configuration des concurrents. Sans le harnais, un score reste difficile à reproduire.

Couverture de code reproductible

Il faut plusieurs dépôts, langages, types de tâches et répétitions. Tests exécutables, lint, build et défauts injectés sont plus solides qu'une appréciation de style.

Fiabilité des agents

Mesurez appels d'outils valides, reprise après échec, boucles, dérive des consignes, critères d'arrêt et intervention humaine sur de longues sessions.

Qualité en contexte long

Une fenêtre déclarée ne garantit pas son utilisation. Testez rappel, contradictions, sensibilité à la position et citations à 64K, 256K, 512K et à la taille réellement utile.

Grounding multimodal

Séparez OCR, localisation visuelle, raisonnement et extraction structurée. Comptez détails manqués et hallucinés.

Économie de production

Ajoutez à la latence et aux tokens la longueur des sorties, les retries, fallback, temps de revue et réparation des défauts.

Stabilité de la route et cycle de vie

Une Preview peut évoluer pendant la période d’observation. Chaque essai doit enregistrer l’ID exact, la date, le canal, la région, le client et la configuration afin qu’une répétition ne mesure pas silencieusement une autre Preview.

Droits d’accès reproductibles

Un benchmark n’est pas reproductible en production si la clé testée ne peut pas alimenter légalement ou techniquement la charge cible. Consignez séparément l’évaluation interactive, la régression automatisée, le backend applicatif et le trafic batch autorisés.

Cadre de benchmark Qwen3.8 allant des tâches figées aux répétitions et gates de production
Cadre de benchmark Qwen3.8 allant des tâches figées aux répétitions et gates de production

Pourquoi les benchmarks publics échouent souvent en production

Un score mélange modèle, route, cache, outils, retries et notation. Une équipe de production doit mesurer ces facteurs séparément, surtout pour les agents avec état, reprise et critères d’arrêt.

Angle mort du benchmarkÉchec de production masquéMeilleure mesure
Qualité en une seule réponsePlan correct, implémentation casséeTâche acceptée de bout en bout
Prompt idéalFragilité sur les entrées réellesTaux de réussite sur variantes de prompt
Aucun échec d’outilBoucle après un mauvais appelReprise après échec injecté
Un seul essaiForte variance et format instableEssais répétés et intervalle de confiance
Prix du token seulAppel bon marché mais nombreux retriesCoût par tâche acceptée
Contexte maximalMauvais rappel dans une longue entréeRappel avec position des preuves contrôlée
Note de réponse finaleAffirmations sans preuve cachées dans un texte fluideAudit des preuves affirmation par affirmation

Ces angles morts comptent particulièrement pour un modèle de code et d’agents : l’utilité dépend de l’état, des outils, de la reprise et de l’arrêt correct, pas seulement de la dernière réponse.

Ce protocole ne sera exécuté qu’après l’arrivée d’une route API admissible en production. Ce n’est ni un résultat publié ni une raison de financer maintenant un grand test Token Plan.

1. Figer des charges réelles

Après l’arrivée de l’API, commencez par un petit pilote et n’élargissez qu’avec des preuves utiles. Documentez entrées, outils, budget temps, critères et gravité des erreurs.

CatégorieTest minimalSignal d’acceptation
Code dans un dépôtCorrection de bug et fonction transverseTests réussis, aucune modification parasite
Agent de codeTâche longue avec plusieurs outilsAppels corrects, aucune boucle non résolue
RaisonnementDécision technique en plusieurs étapesRésultat correct et hypothèses traçables
Contexte longRecherche de preuves dans dépôt ou documentsPreuves exactes avec sources
Compréhension visuelleCapture, graphique ou documentExtraction ancrée, faible taux d’invention
Données/productivitéAnalyse de tableau et rapport exploitableExactitude numérique et livrable utilisable
Charge courantePetite tâche fréquenteGain mesurable de la route frontier

2. Choisir des baselines pertinentes

Qwen3.7 Max pour la génération précédente stable, Kimi K3 pour le challenger long contexte, et la route Claude ou GPT réellement utilisée sur les tâches difficiles.

3. Enregistrer les conditions

Conservez ID exact, route, date, niveau de raisonnement, system prompt, permissions d'outils, préparation du contexte, sampling et retries. Un résultat nommé seulement « Qwen3.8 » n'est pas reproductible.

4. Répéter et évaluer en aveugle

Effectuez au moins trois essais pour les tâches non déterministes. Utilisez tests et validateurs quand c'est possible, et une grille fixe en revue aveugle pour le subjectif.

5. Mesurer de bout en bout

DimensionMesures
QualitéAcceptation, tests, erreurs factuelles, score de grille
FiabilitéErreurs, outils/JSON invalides, boucles, interventions
Latencep50, p95, temps jusqu'au résultat accepté
EfficacitéEntrée, cache, sortie, raisonnement, outils
CoûtModèle, retries, fallback, revue, réparation
accepted_task_cost = model_usage + retries + fallback + reviewer_time + defect_repair

6. Attribuer un rôle de routage

RôlePreuve requise
Route par défautAcceptation, latence et coût stables sur trafic courant
Spécialiste du codeAvantage clair sur dépôts et outils
Spécialiste contexte longMeilleur rappel et cohérence aux tailles réelles
Escalade qualitéMeilleure acceptation des tâches difficiles
Liste de suivi uniquementAucune route de production, aucun prix ou signal API reproductible

Avant activation et validation d'une route EvoLink, « liste de suivi uniquement » est le rôle correct.

Lire un nouveau score Qwen3.8

Demandez qui l'a publié, quelle version et route ont été utilisées, le niveau de raisonnement, les outils disponibles, le nombre d'essais, la reproductibilité des prompts, la proximité avec votre produit et la présence de latence, tokens, retries et échecs. Sans ces champs, marquez le résultat comme directionnel.

Action recommandée

Le guide fonctions et sortie fixe les faits actuels, Qwen3.8 vs Kimi K3 compare le challenger disponible et Qwen3.8 vs Qwen3.7 Max prépare le replay de migration. Rejoignez la page d'accès anticipé pour les mises à jour de route et tarifs.

FAQ

Quel est le score de benchmark Qwen3.8 ?

Il n'existe pas de score global unique et fiable. Positionnement Qwen, tableaux incomplets et faible réplication ne suffisent pas.

Qwen3.8 est-il juste derrière Fable 5 ?

C'est le positionnement du fournisseur, pas un classement universel indépendant.

Qwen3.8 a-t-il été testé indépendamment ?

Oui, sur quelques charges dont le dépôt de 269 fichiers. Elles sont utiles mais trop étroites pour classer globalement le modèle.

Qwen3.8 est-il bon pour le code ?

Le code est un cas majeur du lancement, mais les équipes doivent tester dépôts, outils, reprise, tests et revue.

Comment le comparer à Kimi K3 ?

Entrées figées, mêmes permissions, grille identique, plusieurs essais et mesures séparées de qualité, latence, tokens, intervention et coût.

Les Credits Token Plan permettent-ils un benchmark coût ?

Seulement pour la consommation de l'expérimentation par abonnement, pas comme tarif API général face à un prix par token.

Quelles baselines inclure ?

Qwen3.7 Max, Kimi K3 et la route Claude ou GPT réellement routable par votre produit.

Quand Qwen3.8 est-il prêt pour la production ?

Lorsque route, ID, prix, limites, comportement et fallback sont vérifiés, et que les tests répétés atteignent votre seuil d'acceptation.

Sources

Prêt à réduire vos coûts IA de 89 % ?

Commencez avec EvoLink dès aujourd'hui et découvrez la puissance du routage intelligent des API.