GPT Image 2.5 Flare & Sunburst sont disponibles sur EvoLinkEssayer GPT Image 2.5
Concept d’évaluation Claude Opus 5.2 vs Claude Opus 5 : deux canaux de lumière d’égale intensité, l’un ambre, l’autre bleu glacier, entrent au crépuscule dans un portique de mesure transparent, tandis qu’une boucle de verre revient en arrière pour figurer le chemin de rollback
model-comparison

Claude Opus 5.2 vs Claude Opus 5 : que tester en premier ?

EvoLink Team
EvoLink Team
Équipe produit
17 septembre 2026
Mis à jour le 18 septembre 2026
21 min de lecture
Réponse courte : continuez à utiliser Claude Opus 5 et commencez à le mesurer sérieusement. Au 18 septembre 2026, « Claude Opus 5.2 » n’existe que dans des posts de la communauté : nous n’avons trouvé pour lui ni modèle, ni ID de modèle, ni prix, ni spécification, ni benchmark dans la documentation d’Anthropic. Il n’y a donc rien à comparer, hormis des témoignages de réponses plus rapides et moins « paresseuses » dans Claude Code, et aucune route vers laquelle basculer. Ce que vous pouvez faire dès maintenant, c’est transformer ces témoignages en une évaluation prête le jour où une vraie version mineure apparaîtra, et capable de vous dire, chiffres à l’appui, si le changement mérite votre trafic.
Ce guide s’adresse aux équipes qui font déjà tourner Opus 5 en production. Les preuves derrière les signalements de routage, y compris le « slug Foundry » retracé, sont dans Claude Opus 5.2 : date de sortie ; la disponibilité par canal, l’ID de modèle et le statut des prix se trouvent sur la page de l’API Claude Opus 5.2. La question, distincte, de la génération suivante est traitée dans Claude Opus 6 vs Claude Opus 5.

La décision en un coup d’œil

QuestionClaude Opus 5« Claude Opus 5.2 »Que faire maintenant
Nom officiel ?Oui, sorti le 24 juillet 2026Non ; une étiquette de la communautéÀ surveiller, pas à inscrire sur la feuille de route
ID d’API documenté ?claude-opus-5Aucun trouvé dans la documentation Anthropic, les listes des SDK ni les builds de Claude CodeNe mettez pas un ID deviné dans la configuration
Prix et limites documentés ?5 $ / 25 $ par MTok ; 1M de contexte ; 128K de sortieInconnusBudgétez sur la base d’Opus 5
Peut-on mener des tests appariés aujourd’hui ?Oui, via les canaux documentésAucun candidat appelableFigez dès maintenant la référence et le jeu de replay
Que rapportent les utilisateurs ?« Paresseux », réfléchit trop, réclame un « continue » sur les tâches longues"Way faster", sortie propre, "not lazy" (Claude Code uniquement)Convertissez chaque témoignage en test mesurable
Fallback si vous basculez un jour ?Indiqué comme actif, retrait « au plus tôt le 24 juillet 2027 » sur les plateformes exploitées par AnthropicSans objetVérifiez la route EvoLink précise vers laquelle vous reviendriez

Il n’y a pas de gagnant, puisqu’une seule colonne correspond à un produit documenté. Ce que cette comparaison produit d’utile, ce sont les preuves qu’un successeur devra apporter.

Claude Opus 5.2 vs Opus 5 : différences connues et inconnues

La vue d’ensemble des modèles d’Anthropic, sa page des tarifs, ses notes de version et le changelog de Claude Code documentent Claude Opus 5 et rien de plus récent dans la gamme Opus. Depuis le 14 septembre, plusieurs comptes X affirment que Claude Code route une partie des requêtes Opus 5 vers un build plus récent. Aucun post ne contient d’identifiant ni de trace de requête, les témoignages divergent sur les applications et les offres concernées, et Anthropic n’a pas réagi.

Quatre éléments qui circulent avec ces signalements sont traités en détail dans le suivi de sortie et seulement résumés ici :
  • le « claude-opus-5-2.yaml de Foundry » est une entrée d’un registre communautaire dont les valeurs sont celles d’Opus 5 ;
  • les « cinq niveaux d’effort, dont xhigh et max » sont l’échelle documentée d’Opus 5 aujourd’hui ;
  • un « Opus 5.1 » a fait l’objet de rumeurs en août et n’est jamais sorti sous ce nom ;
  • demander au modèle qui est « Tibo » revient à lire du texte généré, pas une identité de modèle.
Un fait officiel compte pour tout ce qui suit. La documentation de versionnement d’Anthropic indique que les poids d’un modèle sont fixes pour un ID donné, qu’une version mise à jour est publiée « sous un nouvel ID de modèle », et que l’infrastructure de service, par exemple le routeur de requêtes et la logique d’échantillonnage, peut évoluer et constitue « la cause la plus probable » d’un écart de comportement sous un ID stable. Une session plus rapide sous le même nom n’est donc pas, à elle seule, un nouveau modèle. Cela signifie aussi qu’une vraie version mineure arriverait sous un nouvel ID que vous choisiriez d’adopter, et c’est ce qui rend possible une évaluation contrôlée.

Ce que rapportent les utilisateurs, et ce qui vaudrait preuve

Les témoignages s’accordent sur ce qui a changé, ce qui en fait un cahier de tests exploitable même s’ils ne prouvent rien au sujet d’un modèle.
Témoignage de la communauté (Claude Code, 14–17 septembre)Le reproche fait à Opus 5 auquel il répondCe qui vaudrait preuve
"way faster" / réfléchit moins à l’excèsLongue réflexion avant la sortie aux efforts high et xhighMême jeu de tâches, même niveau d’effort : temps écoulé et tokens de sortie par tâche acceptée, sur plusieurs jours
"not lazy", aime mener des tâches plus longuesS’arrête en cours de tâche et demande à l’utilisateur de continuerRelances de l’utilisateur par tâche longue terminée ; taux d’achèvement sans intervention
"really clean output" (X) ; code moins boursouflé ou sur-conçu (un fil Reddit que nous n’avons pu lire que de seconde main)Implémentations sur-conçues ou verbeusesTaille du diff par rapport au périmètre demandé ; retouches du relecteur par changement accepté
Meilleur sur les tâches visuelles et 3D et "getting close to Astra-level", même si l’auteur du post place toujours Astra devantTravail visuel et spatial plus faibleTâches visuelles appariées avec une grille d’évaluation fixe, si cette charge compte pour vous
Un utilisateur de forum a rapporté l’avoir eu un soir, puis l’avoir perdu de nouveauPas un reproche ; un avertissementToute amélioration doit tenir sur plusieurs jours et plusieurs versions du CLI avant de devenir une référence

Quelle amélioration justifie une bascule, tâche par tâche

« Meilleur » n’a pas le même sens d’une charge de travail à l’autre. Décidez, par classe de tâches, ce que vous mesurez en premier et quelle ampleur d’amélioration justifierait le travail de migration. Les seuils vous appartiennent ; le tableau indique seulement où regarder.

Classe de tâchesÀ mesurer en premierÀ surveiller aussiUne amélioration qui justifie la bascule
Questions-réponses interactives et chatDélai p50 et p95 avant la première réponse utileTaux d’acceptation, tokens de sortieLa latence passe de « les utilisateurs le remarquent » à « ils ne le remarquent plus », sans baisse de l’acceptation
Code à l’échelle d’un dépôtTaux de réussite des tests sur les changements acceptésTaille du diff par rapport au périmètre demandé ; temps de retouche du relecteurDavantage de changements passent les tests du premier coup, et les diffs restent dans les fichiers demandés
Agents de longue duréeTaux d’achèvement sans intervention humaineRelances par tâche, récupération après erreur d’outil, total de tokens par tâche terminéeLes tâches qui exigeaient un « continue » ou un sauvetage se terminent désormais sans surveillance, sans explosion des tokens
Extraction structuréeTaux de réussite du parsing ou de la validation de schémaNombre de nouvelles tentatives, coût par enregistrement valideMoins de sorties invalides, à coût par enregistrement valide égal ou inférieur
Traitement de documents par lotsCoût par document acceptéDébit dans la fenêtre du batch, taux de hits de cacheUn coût par document accepté plus bas, l’échéance restant tenue

Si une classe de tâches ne pose aujourd’hui aucun problème mesurable sur Opus 5, elle n’a aucune raison de bouger, quels que soient les scores du nouveau modèle ailleurs.

Ce que Claude Opus 5 offre déjà

Opus 5 est le côté mesurable de cette comparaison :

  • ID de modèle d’API claude-opus-5, un snapshot figé sans date ;
  • 5 $ en entrée et 25 $ en sortie par million de tokens ; écritures de cache à 6,25 $ (5 minutes) et 10 $ (1 heure) ; lectures de cache à 0,50 $ ; batch à moitié prix ; mode rapide en research preview à 10 $ / 50 $, sur l’API Claude uniquement ;
  • contexte de 1M de tokens, sans variante plus petite ; 128K de sortie maximale ;
  • thinking adaptatif activé par défaut ; effort low, medium, high (par défaut), xhigh, max ; le thinking ne peut être désactivé qu’à high ou en dessous ;
  • les tokens de thinking sont facturés comme des tokens de sortie et comptent dans max_tokens.
Sur EvoLink, la page Claude Opus 5 répertorie la route actuelle. Vérifiez l’ID documenté, le champ model renvoyé, l’usage et la facturation avec votre propre clé avant d’en faire une référence.

Ce que les versions précédentes d’Opus ont changé, classé par impact

Tous les changements d’une version ne cassent pas une intégration. Distinguer les trois types vous dit quoi retester.

VersionDateChangement incompatible documentéChangement de coût ou de comportementNouvelle capacité
Opus 4.65 févr. 2026Introduction du thinking adaptatif1M de contexte ; 128K de sortie ; compaction du contexte
Opus 4.716 avr. 2026Des valeurs non par défaut de temperature, top_p, top_k renvoient une erreur 400Nouveau tokenizer : le même texte compte pour davantage de tokensEffort xhigh ; vision à plus haute résolution
Opus 4.828 mai 2026Mode rapide ; progrès en agentique et en raisonnement
Opus 524 juil. 2026Thinking activé par défaut ; désactiver le thinking en xhigh ou max renvoie une erreur 400Les tokens de thinking facturés en sortie augmentent le volume de sortie aux mêmes tarifs ; réponses par défaut plus longuesMinimum de cache de 512 tokens ; changement d’outils en cours de conversation (bêta)
Toutes ces versions affichaient 5 $ / 25 $ par million de tokens. Les intervalles entre elles allaient de 42 à 70 jours, et le 18 septembre est le jour 56 après Opus 5. Pour le saut de génération précédent, voir Claude Opus 5 vs Claude Opus 4.8. Ces deux faits relèvent de l’historique, pas de la prévision : une future version mineure pourrait apporter l’un des trois types de changement, ou aucun.

Contrôles de compatibilité avant toute bascule

SurfaceQue vérifierPourquoi
Identifiant du modèleL’ID est documenté par Anthropic ou par le canal cloud que vous utilisez ; Bedrock et Google Cloud ont leurs propres formatsUne chaîne devinée peut échouer ou être associée par un proxy à un modèle sans rapport
Thinking et effortRejouez votre matrice d’effort ; testez le chemin de désactivation et le comportement de l’erreur 400Opus 5 a changé les deux ; les valeurs par défaut peuvent encore bouger
Décompte des tokensRemesurez les tokens d’entrée, de sortie et de cache par tâcheLes changements de tokenizer et de thinking modifient la facture à prix catalogue inchangé
Paramètres d’échantillonnageCherchez dans la configuration (grep) les paramètres que le modèle rejetteLa 4.7 a transformé les valeurs d’échantillonnage non par défaut en erreurs
Sortie structurée et outilsRejouez les parsers et la validation de schéma ; injectez des pannes d’outilsLes notes d’Anthropic sur Opus 5 indiquent que le code qui lit content[0].text doit sélectionner les blocs par type, car une réponse peut commencer par des blocs de thinking
FallbackJournalisez chaque fois qu’un fallback a servi la requête et faites-en un bras d’expérience expliciteDes résultats mêlant plusieurs modèles contaminent la comparaison

Sur l’identité : journaliser le champ model renvoyé, l’ID de requête, l’usage et la facture est nécessaire, mais ce n’est pas une preuve indépendante des poids sous-jacents, puisque chacun de ces champs est fourni par un serveur ou un proxy. Ce que vous pouvez établir, c’est la cohérence entre la correspondance d’ID documentée, les métadonnées renvoyées, des relevés amont de confiance et la facturation. Cela suffit à rendre une substitution traçable, et c’est l’objectif pratique.

L’évaluation appariée

1. Figez la référence Opus 5

Consignez les prompts, les outils, le niveau d’effort, l’état du contexte, le taux de tâches acceptées, le temps écoulé, les tokens d’entrée et de sortie, l’usage du cache, les nouvelles tentatives, le temps de relecture et les cas d’échec connus. Incluez les sessions où Opus 5 vous a demandé de « continuer » ou a sur-conçu un changement : ce sont précisément les affirmations des témoignages, et il vous faut les chiffres « avant ».

2. Constituez trois groupes de replay

  • des tâches dont la réussite est connue, pour détecter les régressions ;
  • des échecs connus d’Opus 5 (paresse, verbosité, excès de réflexion), pour mesurer la valeur de remplacement ;
  • des tâches frontière qui exigent aujourd’hui un humain ou une autre route.
Une évaluation planifiée de Claude Opus 5 face à Opus 5.2 fait passer des jeux de tâches identiques par les mêmes outils et les mêmes contrôles de temps ; le résultat équilibré illustre un test équitable, pas une parité mesurée
Une évaluation planifiée de Claude Opus 5 face à Opus 5.2 fait passer des jeux de tâches identiques par les mêmes outils et les mêmes contrôles de temps ; le résultat équilibré illustre un test équitable, pas une parité mesurée

3. N’ajoutez le candidat que lorsqu’il est une route documentée et cohérente

Un candidat entre dans le harness lorsque son ID est publié par Anthropic ou par votre canal cloud, qu’une requête authentifiée réussit, que les métadonnées renvoyées concordent avec la correspondance documentée et que l’usage se rapproche du prix publié. Utilisez ensuite les mêmes prompts, outils, timeouts, politique d’effort, règles de nouvelle tentative et relecteurs que pour la référence.

Un exemple de coût chiffré

Le chiffre qui décide d’une bascule n’est pas la dépense totale. C’est ce que vous payez pour chaque tâche qui passe l’acceptation :

Coût d’API par tâche acceptée = dépense d’API totale du groupe d’évaluation ÷ tâches ayant passé l’acceptation

Tout ce que le groupe a consommé va au numérateur : tentatives échouées, nouvelles tentatives et appels de fallback compris. Comptez les écritures et les lectures de cache telles qu’elles sont réellement facturées. Les tokens de thinking sont déjà facturés comme des tokens de sortie : ne les ajoutez pas une seconde fois. Gardez le temps de relecture humaine dans sa propre colonne plutôt que de le convertir en dollars d’API.

Les chiffres ci-dessous sont inventés pour montrer le calcul. Ce ne sont les mesures d’aucun modèle.
Groupe de référenceGroupe candidat
Tâches tentées100100
Dépense d’API totale, échecs et nouvelles tentatives compris12,00 $14,00 $
Tâches ayant passé l’acceptation8095
Coût d’API par tâche acceptée12,00 $ ÷ 80 = 0,150 $14,00 $ ÷ 95 = 0,147 $
Tâches qu’une personne doit encore corriger ou refaire205

Le groupe candidat a dépensé 2,00 $ de plus et reste pourtant légèrement moins cher par tâche acceptée, parce qu’une plus grande part de sa dépense a produit du travail utilisable. L’effet le plus important est sur la dernière ligne : quinze tâches de moins reviennent à une personne. Le cas inverse est tout aussi réel. Si le candidat avait dépensé 16,00 $ pour 85 réussites, son coût par tâche acceptée serait de 0,188 $, et le surcroît de qualité devrait justifier un coût unitaire supérieur de 25 %. Faites la division avant de lire les chiffres mis en avant.

Une fiche d’acceptation à remplir

Des critères vagues comme « nettement meilleur » ou « la latence tient » ne se vérifient pas. Écrivez le seuil avant l’exécution, à partir de l’exigence métier de la classe de tâches, puis consignez ce qui s’est passé. Recopiez ce tableau une fois par classe de tâches.

ChampVotre seuil (fixé avant l’exécution)Résultat de référenceRésultat du candidatAtteint ?
Classe de tâches et groupe de replay
Taille de l’échantillon (tâches tentées)minimum : ____
Taux de réussite (réussies ÷ tentées)au moins ____ % et pas inférieur à la référence sur le groupe des réussites connues
Latence p95au plus ____ s
Coût d’API par tâche acceptéeau plus ____ $
Nouvelles tentatives et appels de fallback pour 100 tâchesau plus ____
Temps de correction humaine par tâche acceptéeau plus ____ min
Relances par tâche longue (agents uniquement)au plus ____
Cohérence sur ____ joursaucun seuil manqué, quel que soit le jour
Une condition de montée en charge exécutable se lit ainsi : router 5 % de cette classe de tâches vers le candidat lorsque chaque ligne est atteinte sur au moins ____ tâches pendant ____ jours ; revenir à 0 % dès le premier jour où une ligne est manquée. Il n’existe pas de seuil universel. Un bot de support et un job nocturne de refactoring ne devraient pas partager le même.

Basculez tâche par tâche, et testez le chemin du retour

L’issue réaliste est une politique de routage, pas une bascule globale. Déplacez les classes de tâches qui ont validé leur fiche, dans l’ordre de la matrice ci-dessus, et laissez le reste sur Opus 5.

Un parcours planifié de canary et de rollback pour Claude Opus 5.2 : l’essentiel du trafic reste sur la route de référence ambre, avec une petite branche d’évaluation et un chemin de retour explicite ; il ne s’agit pas d’un déploiement en service
Un parcours planifié de canary et de rollback pour Claude Opus 5.2 : l’essentiel du trafic reste sur la route de référence ambre, avec une petite branche d’évaluation et un chemin de retour explicite ; il ne s’agit pas d’un déploiement en service
Le chemin du retour mérite son propre test. La page des dépréciations d’Anthropic indique claude-opus-5 comme actif, avec un retrait « au plus tôt le 24 juillet 2027 », et précise que ses dates s’appliquent aux plateformes exploitées par Anthropic (l’API Claude, Claude Platform sur AWS et Microsoft Foundry), tandis qu’Amazon Bedrock et Google Cloud fixent leurs propres calendriers. C’est une fenêtre d’évaluation. Cela ne garantit ni la capacité, ni les autorisations, ni le statut de la route précise sur laquelle vous vous replieriez. Avant tout canary, envoyez du trafic réel sur la route de fallback Opus 5 que vous comptez utiliser, confirmez les quotas et les autorisations, et répétez le changement de configuration qui y ramène le trafic.

Gardez Opus 5 là où il atteint déjà vos objectifs de taux de réussite, de latence et de coût, là où une migration n’apporte aucun gain mesuré, ou là où votre journalisation ne sait pas encore distinguer les appels primaires des appels de fallback. Attendre n’est pas passif tant que vous collectez des références ; cela ne le devient que lorsqu’une livraison est bloquée pour un modèle qui n’a pas été annoncé.

L’API unifiée d’EvoLink garde le choix du modèle dans la configuration de routage plutôt que dans le code applicatif, ce qui rend un challenger peu coûteux à ajouter comme à retirer. Rien dans ce plan n’exige qu’une route Opus 5.2 existe aujourd’hui.

Consulter la route Claude Opus 5 actuelle Recevoir l’alerte de lancement de l’API Claude Opus 5.2

FAQ

Claude Opus 5.2 a-t-il été annoncé ?

Au 18 septembre 2026, nous n’en avons trouvé aucune mention dans le catalogue de modèles, les notes de version, la page des tarifs ni la newsroom d’Anthropic. L’Opus le plus récent est Claude Opus 5.

Claude Opus 5.2 est-il meilleur que Claude Opus 5 ?

Aucune comparaison fondée sur des preuves n’est possible, puisqu’il n’existe aucun Opus 5.2 documenté et appelable. Les témoignages de la communauté décrivent des réponses plus rapides et moins paresseuses dans Claude Code, sans identifiant de modèle ni mesures.

Que corrigerait Opus 5.2, d’après les utilisateurs ?

La vitesse, l’excès de réflexion, la paresse sur les tâches longues et le code verbeux ou sur-conçu. Ce sont les bonnes catégories pour un jeu de replay, et ce sont des affirmations, pas des résultats.

Comment comparer les coûts équitablement ?

Divisez la dépense d’API totale du groupe d’évaluation, échecs et nouvelles tentatives compris, par le nombre de tâches ayant passé l’acceptation. Comparez ce chiffre, et non la dépense totale ou le prix catalogue, et rapportez à part le temps de correction humaine.

Un Opus plus récent épuisera-t-il plus vite mon quota ou mon budget ?

On l’ignore tant qu’on ne peut pas le mesurer. Certains utilisateurs signalent déjà une consommation plus élevée avec Opus 5, et sur Opus 5 les tokens de thinking sont facturés comme des tokens de sortie : un modèle qui réfléchit davantage coûte donc plus cher au même prix catalogue. Mesurez les tokens d’entrée, de sortie et de cache par tâche acceptée, à votre niveau d’effort. Les quotas des offres grand public dans les applications Claude sont une question distincte de la facturation de l’API.

Faut-il attendre Opus 5.2 avant de démarrer un projet ?

Non. Utilisez Claude Opus 5 pour les livraisons engagées, gardez le choix du modèle dans la configuration, et collectez les traces qui deviendront votre évaluation de mise à niveau.

Puis-je utiliser l’ID de modèle claude-opus-5-2 dès maintenant ?

Non. Nous n’avons trouvé cet identifiant dans aucune documentation d’Anthropic. Un ID deviné échouera ou, pire, sera associé par un proxy tiers à un modèle sans rapport.

Opus 5 restera-t-il disponible si un nouvel Opus sort ?

Anthropic indique claude-opus-5 comme actif, avec un retrait au plus tôt le 24 juillet 2027 sur les plateformes qu’il exploite ; Bedrock et Google Cloud fixent leurs propres dates. Cela ne garantit aucune route de gateway en particulier : testez la route de fallback que vous comptez utiliser.

Comment comparer les deux après une sortie ?

Utilisez les mêmes prompts, outils, timeouts, niveaux d’effort, état du contexte, règles de nouvelle tentative et relecteurs. Remplissez une fiche d’acceptation par classe de tâches, comparez le coût par tâche acceptée, et déplacez le trafic par classe de tâches avec un chemin du retour déjà répété.

Sources

Sources officielles consultées pour la dernière fois le 18 septembre 2026. Les faits concernant Anthropic proviennent de la documentation officielle ; les signalements de la communauté proviennent de posts X que nous avons lus directement, de fils de forum et d’un fil Reddit relayé de seconde main, et sont étiquetés comme tels ; l’exemple de coût utilise des chiffres inventés ; le statut de la route EvoLink est distinct et non vérifié.

Prêt à réduire vos coûts IA de 89 % ?

Commencez avec EvoLink dès aujourd'hui et découvrez la puissance du routage intelligent des API.