
Claude Opus 5.2 vs Claude Opus 5 : que tester en premier ?
La décision en un coup d’œil
| Question | Claude Opus 5 | « Claude Opus 5.2 » | Que faire maintenant |
|---|---|---|---|
| Nom officiel ? | Oui, sorti le 24 juillet 2026 | Non ; une étiquette de la communauté | À surveiller, pas à inscrire sur la feuille de route |
| ID d’API documenté ? | claude-opus-5 | Aucun trouvé dans la documentation Anthropic, les listes des SDK ni les builds de Claude Code | Ne mettez pas un ID deviné dans la configuration |
| Prix et limites documentés ? | 5 $ / 25 $ par MTok ; 1M de contexte ; 128K de sortie | Inconnus | Budgétez sur la base d’Opus 5 |
| Peut-on mener des tests appariés aujourd’hui ? | Oui, via les canaux documentés | Aucun candidat appelable | Figez dès maintenant la référence et le jeu de replay |
| Que rapportent les utilisateurs ? | « Paresseux », réfléchit trop, réclame un « continue » sur les tâches longues | "Way faster", sortie propre, "not lazy" (Claude Code uniquement) | Convertissez chaque témoignage en test mesurable |
| Fallback si vous basculez un jour ? | Indiqué comme actif, retrait « au plus tôt le 24 juillet 2027 » sur les plateformes exploitées par Anthropic | Sans objet | Vérifiez la route EvoLink précise vers laquelle vous reviendriez |
Il n’y a pas de gagnant, puisqu’une seule colonne correspond à un produit documenté. Ce que cette comparaison produit d’utile, ce sont les preuves qu’un successeur devra apporter.
Claude Opus 5.2 vs Opus 5 : différences connues et inconnues
La vue d’ensemble des modèles d’Anthropic, sa page des tarifs, ses notes de version et le changelog de Claude Code documentent Claude Opus 5 et rien de plus récent dans la gamme Opus. Depuis le 14 septembre, plusieurs comptes X affirment que Claude Code route une partie des requêtes Opus 5 vers un build plus récent. Aucun post ne contient d’identifiant ni de trace de requête, les témoignages divergent sur les applications et les offres concernées, et Anthropic n’a pas réagi.
- le «
claude-opus-5-2.yamlde Foundry » est une entrée d’un registre communautaire dont les valeurs sont celles d’Opus 5 ; - les « cinq niveaux d’effort, dont xhigh et max » sont l’échelle documentée d’Opus 5 aujourd’hui ;
- un « Opus 5.1 » a fait l’objet de rumeurs en août et n’est jamais sorti sous ce nom ;
- demander au modèle qui est « Tibo » revient à lire du texte généré, pas une identité de modèle.
Ce que rapportent les utilisateurs, et ce qui vaudrait preuve
| Témoignage de la communauté (Claude Code, 14–17 septembre) | Le reproche fait à Opus 5 auquel il répond | Ce qui vaudrait preuve |
|---|---|---|
| "way faster" / réfléchit moins à l’excès | Longue réflexion avant la sortie aux efforts high et xhigh | Même jeu de tâches, même niveau d’effort : temps écoulé et tokens de sortie par tâche acceptée, sur plusieurs jours |
| "not lazy", aime mener des tâches plus longues | S’arrête en cours de tâche et demande à l’utilisateur de continuer | Relances de l’utilisateur par tâche longue terminée ; taux d’achèvement sans intervention |
| "really clean output" (X) ; code moins boursouflé ou sur-conçu (un fil Reddit que nous n’avons pu lire que de seconde main) | Implémentations sur-conçues ou verbeuses | Taille du diff par rapport au périmètre demandé ; retouches du relecteur par changement accepté |
| Meilleur sur les tâches visuelles et 3D et "getting close to Astra-level", même si l’auteur du post place toujours Astra devant | Travail visuel et spatial plus faible | Tâches visuelles appariées avec une grille d’évaluation fixe, si cette charge compte pour vous |
| Un utilisateur de forum a rapporté l’avoir eu un soir, puis l’avoir perdu de nouveau | Pas un reproche ; un avertissement | Toute amélioration doit tenir sur plusieurs jours et plusieurs versions du CLI avant de devenir une référence |
Quelle amélioration justifie une bascule, tâche par tâche
« Meilleur » n’a pas le même sens d’une charge de travail à l’autre. Décidez, par classe de tâches, ce que vous mesurez en premier et quelle ampleur d’amélioration justifierait le travail de migration. Les seuils vous appartiennent ; le tableau indique seulement où regarder.
| Classe de tâches | À mesurer en premier | À surveiller aussi | Une amélioration qui justifie la bascule |
|---|---|---|---|
| Questions-réponses interactives et chat | Délai p50 et p95 avant la première réponse utile | Taux d’acceptation, tokens de sortie | La latence passe de « les utilisateurs le remarquent » à « ils ne le remarquent plus », sans baisse de l’acceptation |
| Code à l’échelle d’un dépôt | Taux de réussite des tests sur les changements acceptés | Taille du diff par rapport au périmètre demandé ; temps de retouche du relecteur | Davantage de changements passent les tests du premier coup, et les diffs restent dans les fichiers demandés |
| Agents de longue durée | Taux d’achèvement sans intervention humaine | Relances par tâche, récupération après erreur d’outil, total de tokens par tâche terminée | Les tâches qui exigeaient un « continue » ou un sauvetage se terminent désormais sans surveillance, sans explosion des tokens |
| Extraction structurée | Taux de réussite du parsing ou de la validation de schéma | Nombre de nouvelles tentatives, coût par enregistrement valide | Moins de sorties invalides, à coût par enregistrement valide égal ou inférieur |
| Traitement de documents par lots | Coût par document accepté | Débit dans la fenêtre du batch, taux de hits de cache | Un coût par document accepté plus bas, l’échéance restant tenue |
Si une classe de tâches ne pose aujourd’hui aucun problème mesurable sur Opus 5, elle n’a aucune raison de bouger, quels que soient les scores du nouveau modèle ailleurs.
Ce que Claude Opus 5 offre déjà
Opus 5 est le côté mesurable de cette comparaison :
- ID de modèle d’API
claude-opus-5, un snapshot figé sans date ; - 5 $ en entrée et 25 $ en sortie par million de tokens ; écritures de cache à 6,25 $ (5 minutes) et 10 $ (1 heure) ; lectures de cache à 0,50 $ ; batch à moitié prix ; mode rapide en research preview à 10 $ / 50 $, sur l’API Claude uniquement ;
- contexte de 1M de tokens, sans variante plus petite ; 128K de sortie maximale ;
- thinking adaptatif activé par défaut ; effort low, medium, high (par défaut), xhigh, max ; le thinking ne peut être désactivé qu’à high ou en dessous ;
- les tokens de thinking sont facturés comme des tokens de sortie et comptent dans
max_tokens.
Ce que les versions précédentes d’Opus ont changé, classé par impact
Tous les changements d’une version ne cassent pas une intégration. Distinguer les trois types vous dit quoi retester.
| Version | Date | Changement incompatible documenté | Changement de coût ou de comportement | Nouvelle capacité |
|---|---|---|---|---|
| Opus 4.6 | 5 févr. 2026 | — | Introduction du thinking adaptatif | 1M de contexte ; 128K de sortie ; compaction du contexte |
| Opus 4.7 | 16 avr. 2026 | Des valeurs non par défaut de temperature, top_p, top_k renvoient une erreur 400 | Nouveau tokenizer : le même texte compte pour davantage de tokens | Effort xhigh ; vision à plus haute résolution |
| Opus 4.8 | 28 mai 2026 | — | — | Mode rapide ; progrès en agentique et en raisonnement |
| Opus 5 | 24 juil. 2026 | Thinking activé par défaut ; désactiver le thinking en xhigh ou max renvoie une erreur 400 | Les tokens de thinking facturés en sortie augmentent le volume de sortie aux mêmes tarifs ; réponses par défaut plus longues | Minimum de cache de 512 tokens ; changement d’outils en cours de conversation (bêta) |
Contrôles de compatibilité avant toute bascule
| Surface | Que vérifier | Pourquoi |
|---|---|---|
| Identifiant du modèle | L’ID est documenté par Anthropic ou par le canal cloud que vous utilisez ; Bedrock et Google Cloud ont leurs propres formats | Une chaîne devinée peut échouer ou être associée par un proxy à un modèle sans rapport |
| Thinking et effort | Rejouez votre matrice d’effort ; testez le chemin de désactivation et le comportement de l’erreur 400 | Opus 5 a changé les deux ; les valeurs par défaut peuvent encore bouger |
| Décompte des tokens | Remesurez les tokens d’entrée, de sortie et de cache par tâche | Les changements de tokenizer et de thinking modifient la facture à prix catalogue inchangé |
| Paramètres d’échantillonnage | Cherchez dans la configuration (grep) les paramètres que le modèle rejette | La 4.7 a transformé les valeurs d’échantillonnage non par défaut en erreurs |
| Sortie structurée et outils | Rejouez les parsers et la validation de schéma ; injectez des pannes d’outils | Les notes d’Anthropic sur Opus 5 indiquent que le code qui lit content[0].text doit sélectionner les blocs par type, car une réponse peut commencer par des blocs de thinking |
| Fallback | Journalisez chaque fois qu’un fallback a servi la requête et faites-en un bras d’expérience explicite | Des résultats mêlant plusieurs modèles contaminent la comparaison |
Sur l’identité : journaliser le champ model renvoyé, l’ID de requête, l’usage et la facture est nécessaire, mais ce n’est pas une preuve indépendante des poids sous-jacents, puisque chacun de ces champs est fourni par un serveur ou un proxy. Ce que vous pouvez établir, c’est la cohérence entre la correspondance d’ID documentée, les métadonnées renvoyées, des relevés amont de confiance et la facturation. Cela suffit à rendre une substitution traçable, et c’est l’objectif pratique.
L’évaluation appariée
1. Figez la référence Opus 5
Consignez les prompts, les outils, le niveau d’effort, l’état du contexte, le taux de tâches acceptées, le temps écoulé, les tokens d’entrée et de sortie, l’usage du cache, les nouvelles tentatives, le temps de relecture et les cas d’échec connus. Incluez les sessions où Opus 5 vous a demandé de « continuer » ou a sur-conçu un changement : ce sont précisément les affirmations des témoignages, et il vous faut les chiffres « avant ».
2. Constituez trois groupes de replay
- des tâches dont la réussite est connue, pour détecter les régressions ;
- des échecs connus d’Opus 5 (paresse, verbosité, excès de réflexion), pour mesurer la valeur de remplacement ;
- des tâches frontière qui exigent aujourd’hui un humain ou une autre route.

3. N’ajoutez le candidat que lorsqu’il est une route documentée et cohérente
Un candidat entre dans le harness lorsque son ID est publié par Anthropic ou par votre canal cloud, qu’une requête authentifiée réussit, que les métadonnées renvoyées concordent avec la correspondance documentée et que l’usage se rapproche du prix publié. Utilisez ensuite les mêmes prompts, outils, timeouts, politique d’effort, règles de nouvelle tentative et relecteurs que pour la référence.
Un exemple de coût chiffré
Le chiffre qui décide d’une bascule n’est pas la dépense totale. C’est ce que vous payez pour chaque tâche qui passe l’acceptation :
Coût d’API par tâche acceptée = dépense d’API totale du groupe d’évaluation ÷ tâches ayant passé l’acceptationTout ce que le groupe a consommé va au numérateur : tentatives échouées, nouvelles tentatives et appels de fallback compris. Comptez les écritures et les lectures de cache telles qu’elles sont réellement facturées. Les tokens de thinking sont déjà facturés comme des tokens de sortie : ne les ajoutez pas une seconde fois. Gardez le temps de relecture humaine dans sa propre colonne plutôt que de le convertir en dollars d’API.
| Groupe de référence | Groupe candidat | |
|---|---|---|
| Tâches tentées | 100 | 100 |
| Dépense d’API totale, échecs et nouvelles tentatives compris | 12,00 $ | 14,00 $ |
| Tâches ayant passé l’acceptation | 80 | 95 |
| Coût d’API par tâche acceptée | 12,00 $ ÷ 80 = 0,150 $ | 14,00 $ ÷ 95 = 0,147 $ |
| Tâches qu’une personne doit encore corriger ou refaire | 20 | 5 |
Le groupe candidat a dépensé 2,00 $ de plus et reste pourtant légèrement moins cher par tâche acceptée, parce qu’une plus grande part de sa dépense a produit du travail utilisable. L’effet le plus important est sur la dernière ligne : quinze tâches de moins reviennent à une personne. Le cas inverse est tout aussi réel. Si le candidat avait dépensé 16,00 $ pour 85 réussites, son coût par tâche acceptée serait de 0,188 $, et le surcroît de qualité devrait justifier un coût unitaire supérieur de 25 %. Faites la division avant de lire les chiffres mis en avant.
Une fiche d’acceptation à remplir
Des critères vagues comme « nettement meilleur » ou « la latence tient » ne se vérifient pas. Écrivez le seuil avant l’exécution, à partir de l’exigence métier de la classe de tâches, puis consignez ce qui s’est passé. Recopiez ce tableau une fois par classe de tâches.
| Champ | Votre seuil (fixé avant l’exécution) | Résultat de référence | Résultat du candidat | Atteint ? |
|---|---|---|---|---|
| Classe de tâches et groupe de replay | — | |||
| Taille de l’échantillon (tâches tentées) | minimum : ____ | |||
| Taux de réussite (réussies ÷ tentées) | au moins ____ % et pas inférieur à la référence sur le groupe des réussites connues | |||
| Latence p95 | au plus ____ s | |||
| Coût d’API par tâche acceptée | au plus ____ $ | |||
| Nouvelles tentatives et appels de fallback pour 100 tâches | au plus ____ | |||
| Temps de correction humaine par tâche acceptée | au plus ____ min | |||
| Relances par tâche longue (agents uniquement) | au plus ____ | |||
| Cohérence sur ____ jours | aucun seuil manqué, quel que soit le jour |
Basculez tâche par tâche, et testez le chemin du retour
L’issue réaliste est une politique de routage, pas une bascule globale. Déplacez les classes de tâches qui ont validé leur fiche, dans l’ordre de la matrice ci-dessus, et laissez le reste sur Opus 5.

claude-opus-5 comme actif, avec un retrait « au plus tôt le 24 juillet 2027 », et précise que ses dates s’appliquent aux plateformes exploitées par Anthropic (l’API Claude, Claude Platform sur AWS et Microsoft Foundry), tandis qu’Amazon Bedrock et Google Cloud fixent leurs propres calendriers. C’est une fenêtre d’évaluation. Cela ne garantit ni la capacité, ni les autorisations, ni le statut de la route précise sur laquelle vous vous replieriez. Avant tout canary, envoyez du trafic réel sur la route de fallback Opus 5 que vous comptez utiliser, confirmez les quotas et les autorisations, et répétez le changement de configuration qui y ramène le trafic.Gardez Opus 5 là où il atteint déjà vos objectifs de taux de réussite, de latence et de coût, là où une migration n’apporte aucun gain mesuré, ou là où votre journalisation ne sait pas encore distinguer les appels primaires des appels de fallback. Attendre n’est pas passif tant que vous collectez des références ; cela ne le devient que lorsqu’une livraison est bloquée pour un modèle qui n’a pas été annoncé.
L’API unifiée d’EvoLink garde le choix du modèle dans la configuration de routage plutôt que dans le code applicatif, ce qui rend un challenger peu coûteux à ajouter comme à retirer. Rien dans ce plan n’exige qu’une route Opus 5.2 existe aujourd’hui.
Consulter la route Claude Opus 5 actuelle Recevoir l’alerte de lancement de l’API Claude Opus 5.2FAQ
Claude Opus 5.2 a-t-il été annoncé ?
Au 18 septembre 2026, nous n’en avons trouvé aucune mention dans le catalogue de modèles, les notes de version, la page des tarifs ni la newsroom d’Anthropic. L’Opus le plus récent est Claude Opus 5.
Claude Opus 5.2 est-il meilleur que Claude Opus 5 ?
Aucune comparaison fondée sur des preuves n’est possible, puisqu’il n’existe aucun Opus 5.2 documenté et appelable. Les témoignages de la communauté décrivent des réponses plus rapides et moins paresseuses dans Claude Code, sans identifiant de modèle ni mesures.
Que corrigerait Opus 5.2, d’après les utilisateurs ?
La vitesse, l’excès de réflexion, la paresse sur les tâches longues et le code verbeux ou sur-conçu. Ce sont les bonnes catégories pour un jeu de replay, et ce sont des affirmations, pas des résultats.
Comment comparer les coûts équitablement ?
Divisez la dépense d’API totale du groupe d’évaluation, échecs et nouvelles tentatives compris, par le nombre de tâches ayant passé l’acceptation. Comparez ce chiffre, et non la dépense totale ou le prix catalogue, et rapportez à part le temps de correction humaine.
Un Opus plus récent épuisera-t-il plus vite mon quota ou mon budget ?
On l’ignore tant qu’on ne peut pas le mesurer. Certains utilisateurs signalent déjà une consommation plus élevée avec Opus 5, et sur Opus 5 les tokens de thinking sont facturés comme des tokens de sortie : un modèle qui réfléchit davantage coûte donc plus cher au même prix catalogue. Mesurez les tokens d’entrée, de sortie et de cache par tâche acceptée, à votre niveau d’effort. Les quotas des offres grand public dans les applications Claude sont une question distincte de la facturation de l’API.
Faut-il attendre Opus 5.2 avant de démarrer un projet ?
Non. Utilisez Claude Opus 5 pour les livraisons engagées, gardez le choix du modèle dans la configuration, et collectez les traces qui deviendront votre évaluation de mise à niveau.
Puis-je utiliser l’ID de modèle claude-opus-5-2 dès maintenant ?
Non. Nous n’avons trouvé cet identifiant dans aucune documentation d’Anthropic. Un ID deviné échouera ou, pire, sera associé par un proxy tiers à un modèle sans rapport.
Opus 5 restera-t-il disponible si un nouvel Opus sort ?
claude-opus-5 comme actif, avec un retrait au plus tôt le 24 juillet 2027 sur les plateformes qu’il exploite ; Bedrock et Google Cloud fixent leurs propres dates. Cela ne garantit aucune route de gateway en particulier : testez la route de fallback que vous comptez utiliser.Comment comparer les deux après une sortie ?
Utilisez les mêmes prompts, outils, timeouts, niveaux d’effort, état du contexte, règles de nouvelle tentative et relecteurs. Remplissez une fiche d’acceptation par classe de tâches, comparez le coût par tâche acceptée, et déplacez le trafic par classe de tâches avec un chemin du retour déjà répété.
Sources
- Anthropic : vue d’ensemble des modèles
- Anthropic : ID de modèle et versionnement, dont « Model weights versus serving infrastructure »
- Anthropic : nouveautés de Claude Opus 5 (changements incompatibles et facturation des tokens de thinking)
- Anthropic : paramètre effort
- Anthropic : tarifs
- Anthropic : dépréciations de modèles (périmètre des plateformes, dépréciations de paramètres)
- Anthropic : Introducing Claude Opus 4.7
- Anthropic : Introducing Claude Opus 4.8
- Anthropic : Introducing Claude Opus 5
- X : @notjazii, 14 septembre 2026
- X : @pankajkumar_dev, 15 septembre 2026
- EvoLink : Claude Opus 5.2, date de sortie
- EvoLink : disponibilité de l’API Claude Opus 5.2
- EvoLink : Claude Opus 5


