GPT Image 2.5 Flare & Sunburst sont disponibles sur EvoLinkEssayer GPT Image 2.5
Des workflows de cuivre et de verre bleu avec des tuiles de mémoire et une boucle de reprise pour Gemini 4 vs Claude Fable 5.1
analysis

Gemini 4 vs Claude Fable 5.1 : agents longue durée

EvoLink Team
EvoLink Team
Équipe produit
16 septembre 2026
18 min de lecture
Au 16 septembre 2026, il n’existe aucune route Gemini 4 à ajouter : restez sur Claude Fable 5.1 et enregistrez la référence qu’une future route Gemini 4 devra battre. Au 16 septembre 2026, il n’existe aucune preuve d’exécution de Gemini 4 qu’une équipe d’agents de longue durée puisse comparer à Claude Fable 5.1. Google a seulement confirmé que le pré-entraînement de Gemini 4 a commencé ; il n’y a ni entrée d’API publique, ni ID de modèle, ni prix, ni chiffre de contexte, ni règle de cache, ni benchmark. Claude Fable 5.1 dispose d’un contrat Anthropic publié et d’une route EvoLink configurée. La décision d’un Tech Lead ou d’un responsable FinOps n’est donc pas « quel modèle doit faire tourner nos agents » mais « que devons-nous enregistrer sur Fable 5.1 maintenant, pour qu’une route Gemini 4 ait quelque chose de concret à prouver plus tard ». Capturez dès aujourd’hui votre référence de tâches longues et de réutilisation du contexte, puis écrivez les portes qu’une nouvelle route devra franchir avant de mériter du trafic.
Cet article traite une seule décision : le choix, pour les agents de longue durée, entre ces deux modèles. Les questions de chronologie de sortie relèvent du suivi de sortie de Gemini 4 ; le statut actuel de l’API est sur la page Gemini 4 ; le versant OpenAI est couvert dans Gemini 4 vs GPT-6 Astra ; et les deux modèles frontière sortis sont comparés dans Claude Fable 5.1 vs GPT-6 Astra, qui contient déjà un exemple chiffré de cache que cet article ne répète pas.

Tableau de statut et de preuves

QuestionGemini 4Claude Fable 5.1Décision sûre
Statut officielPré-entraînement confirmé par Google (juillet 2026)Sorti chez Anthropic le 1er septembre 2026 ; marqué Active (latest)Traiter l’écart comme un écart de statut, pas comme un verdict de capacité
ID de modèle APINon publiéclaude-fable-5-1 (Anthropic)Ne jamais placer un ID non publié dans la configuration ou le code
Contexte et sortie maximaleNon publiés1M de contexte ; 128K de sortie maximale (Anthropic)Relever la part de la fenêtre que vos traces consomment réellement
Modalités d’entréeNon publiéesEntrée texte et image, sortie texte (Anthropic)Lister les modalités requises par chaque workload avant de tester
Contrôles de thinkingNon publiésThinking adaptatif toujours actif ; effort par défaut high ; latence comparative indiquée comme Slower (Anthropic)Journaliser le réglage d’effort par trace pour tester une future route à réglages appariés
Structure des prix du cacheNon publiéeEntrée 10 $ / sortie 50 $ par MTok ; écriture de cache 5 minutes 12,50 $ ; écriture de cache 1 heure 20 $ ; lecture de cache 0,25 $ par MTok (catalogue Anthropic)L’économie du cache ne peut pas être comparée tant que les deux côtés n’ont pas publié TTL et tarifs
Disponibilité du BatchNon publiéeAnthropic affiche le Batch en entrée et en sortie à 50 % du standardComparer Standard à Standard, Batch à Batch
Changements incompatibles documentésNon publiésTrois dans le guide de migration d’Anthropic : erreurs sur le choix d’outil forcé, incompatibilité des anciens modèles avec les thinking blocks de 5.1, invalidation des thinking blocks après modification de tours antérieursUne liste publiée de changements incompatibles est testable ; une liste absente ne l’est pas
Route EvoLinkAucune route appelable vérifiée ; alerte de lancement ouverteRoute configurée claude-fable-5-1 ; prix sur la page produitVérifier l’identité de modèle renvoyée à la première requête de toute route

La colonne Gemini 4 est une liste de ce qui peut être mesuré, pas une critique. Chaque cellule « Non publié » est un champ pour lequel votre harness devrait déjà avoir un emplacement, afin qu’un contrat publié remplisse des valeurs au lieu d’imposer une refonte.

Quelles tâches de longue durée valent la peine d’être évaluées

Le travail d’agent de longue durée n’est pas un workload unique. Cinq classes de tâches couvrent la plupart des traces que les équipes routent vers Fable 5.1, chacune avec sa propre définition de « accepté ». Relevez la référence par classe ; jugez aussi toute future route Gemini 4 par classe.

WorkloadCe que « accepté » signifieQuoi relever sur Fable 5.1 maintenantCe qu’une route Gemini 4 devra égaler plus tard
Réparation multi-fichiers d’un dépôtTests au vert, diff relu, aucun fichier sans rapport touchéFichiers lus et modifiés, appels d’outils, retries, minutes de reviewer, tokens par correctif acceptéMême jeu de tâches, suite de tests et grille de revue
Recherche multi-étapes et livrables de connaissanceLes citations se résolvent, la structure correspond au brief, aucune affirmation non étayéeSources récupérées, révisions demandées, corrections factuelles par livrableMêmes briefs et même passe de vérification des faits
Boucles d’outils de plusieurs heuresLa boucle se termine sur la condition d’arrêt avec un état final valideNombre de boucles, appels d’outils échoués, checkpoints, événements de reprise, temps horloge jusqu’à la terminaisonMêmes outils, permissions, budget de retries et règles d’arrêt
Extraction structurée sur documents longsLa sortie valide le schéma ; les champs échantillonnés correspondent à la sourceLongueur du document, échecs de schéma, réexécutions, justesse des champs sur un échantillon fixeMêmes documents, schéma et échantillon
Flux d’outils multi-étapes du service clientTicket résolu dans le cadre de la politique sans escalade humaineEscalades, appels au mauvais outil, violations de politique, temps de traitementMêmes définitions de flux et mêmes contrôles de politique

Aucune ligne ne désigne un modèle préféré, parce qu’aucune exécution appariée n’existe. Le tableau fixe seulement ce que « la même tâche » signifiera quand une seconde route deviendra disponible.

Réutilisation du contexte et conditions de cache

Les agents de longue durée renvoient à chaque tour la même carte du dépôt, les mêmes schémas d’outils et les mêmes instructions, si bien que le prix du cache domine la facture de tokens. C’est aussi la partie de la comparaison qui ne peut pas commencer aujourd’hui.

Google n’a publié pour Gemini 4 ni TTL de cache, ni tarifs d’écriture ou de lecture, ni périmètre du cache (cache de préfixe automatique contre objets de cache explicites), ni taille minimale mise en cache. Sans ces quatre valeurs il n’y a pas de dénominateur : une lecture de cache à cinq minutes est un produit différent d’une lecture à une heure, et un cache de préfixe par requête est un produit différent d’un cache nommé partagé par plusieurs agents. Des TTL, des périmètres de contexte et des modes batch différents ne peuvent pas être mélangés dans un seul chiffre.

Fable 5.1 vous donne la structure sur laquelle enregistrer. Anthropic documente une écriture de cache 5 minutes à 12,50 $ par MTok, une écriture 1 heure à 20 $ par MTok, des lectures de cache à 0,25 $ par MTok et le Batch à 50 % de l’entrée et de la sortie standard. Pour chaque trace Fable, journalisez :

  • quel TTL a été choisi et pourquoi (espacement des tours sous cinq minutes, ou pauses qui justifiaient l’écriture 1 heure) ;
  • la taille du préfixe en cache et la fréquence de ses changements en cours de tâche, puisqu’un préfixe modifié force une nouvelle écriture ;
  • les tokens lus en cache contre les tokens d’entrée frais par tour ;
  • si la trace a tourné en Standard ou en Batch, et comment la page des tarifs d’Anthropic combinait le Batch avec les modificateurs de cache au moment de l’exécution.
Conservez ces champs par trace, pas par mois. Quand Gemini 4 publiera un contrat de cache, vous saurez lesquelles de vos traces seraient même éligibles à son cache, au lieu de comparer deux prix catalogue qui décrivent des objets différents. Les tarifs EvoLink de Fable 5.1 sont sur la page produit.

Coût des retries, de la reprise et de la prise en main humaine

C’est la couche qu’un tableau de spécifications ne montre jamais, et celle où la plupart des budgets d’agents de longue durée se perdent réellement. Une trace qui se termine à la troisième tentative après qu’un humain l’a débloquée ne coûte pas la même chose qu’une trace terminée du premier coup. Journalisez six événements par trace, chacun avec un horodatage et un décompte de tokens :

  1. Détection de boucle. Le même appel d’outil avec les mêmes arguments répété au-delà d’un seuil fixé à l’avance. Notez combien de tours ont brûlé avant que la règle d’arrêt ne se déclenche.
  2. Appels d’outils échoués. Séparez les erreurs côté fournisseur, les erreurs côté outil et les appels mal formés côté modèle. Seule la troisième est un signal de qualité du modèle ; les deux autres sont un coût d’infrastructure qu’une nouvelle route paiera aussi.
  3. Intégrité des checkpoints. Vérifiez que chaque état sauvegardé peut réellement restaurer la tâche. Un checkpoint qui ne reprend pas est une sortie gaspillée plus une réexécution complète.
  4. Reprise après interruption. Comptez les tokens dépensés à reconstruire le contexte après un rate limit, un timeout ou une pause opérateur, séparément des tokens de la première exécution.
  5. Invalidation des thinking blocks. Le guide de migration d’Anthropic documente que la modification de tours antérieurs invalide les thinking blocks conservés de Fable 5.1. Tout framework qui réécrit l’historique pour la compaction ou la correction le déclenchera ; notez la fréquence et le coût du nouveau raisonnement. Que Gemini 4 ait une règle équivalente n’est pas publié.
  6. Prise en main humaine. Minutes de reviewer passées à débloquer, corriger ou terminer la tâche, journalisées comme du temps pour qu’elles ne disparaissent jamais dans un total API.

Stockez ces éléments comme des champs de l’enregistrement de trace, pas dans un journal d’incidents séparé ; le coût par tâche acceptée n’a de sens que si les retries, les reprises et les minutes de reviewer portent le même ID de tâche que les tokens.

Le tableau complet des variables de coût de tâche

Le dénominateur de chaque chiffre ci-dessous est le nombre de tâches terminées et ayant passé l’acceptation. Les tâches terminées mais refusées en revue comptent dans la dépense (elles ont été payées) mais pas dans le dénominateur. La dépense API et le temps humain restent dans des colonnes séparées ; ne convertissez les minutes en argent qu’au niveau du reporting, à un taux que votre équipe finance possède.

VariableComment l’enregistrer sur Fable 5.1 aujourd’huiStatut Gemini 4
Tokens d’entréeEntrée fraîche (non mise en cache) par tour, sommée par tâche, à partir des compteurs d’usage renvoyés par EvoLinkInconnu jusqu’à la publication du contrat
Écriture de cacheTokens écrits, ventilés par TTL 5 minutes et 1 heure, avec le nombre d’écritures par tâcheInconnu jusqu’à la publication du contrat
Lecture de cacheTokens servis depuis le cache par tâche ; journalisez aussi le taux de hit (lecture de cache / (lecture de cache + entrée fraîche))Inconnu jusqu’à la publication du contrat
Tokens de sortieRéponse finale plus arguments d’outils intermédiaires, sommés par tâcheInconnu jusqu’à la publication du contrat
Appels d’outils et coût externeNombre et tout coût mesuré (recherche, exécution de code, API tierces) par tâcheInconnu jusqu’à la publication du contrat
RetriesTentatives au-delà de la première, avec les tokens par tentative, rattachées au même ID de tâcheInconnu jusqu’à la publication du contrat
Usage de la route de fallbackSi un tour a été servi par un autre modèle, et lequel, vérifié via le champ model renvoyéInconnu jusqu’à la publication du contrat
Minutes de revue humaineTemps de reviewer et d’opérateur par tâche, enregistré en minutesMesuré sur vos propres exécutions dès qu’une route existe ; ce n’est pas une valeur publiée par le fournisseur
Temps horloge jusqu’à l’acceptationDurée du début de la tâche au résultat accepté, attentes et tours humains inclusMesuré sur vos propres exécutions dès qu’une route existe ; ce n’est pas une valeur publiée par le fournisseur
Taux de tâches acceptéesTâches acceptées / tâches tentées par classe de workload sur la fenêtreMesuré sur vos propres exécutions dès qu’une route existe ; ce n’est pas une valeur publiée par le fournisseur

Le coût par tâche acceptée est la dépense API divisée par les tâches acceptées, rapportée à côté des minutes de revue par tâche acceptée. Une route qui baisse le premier en augmentant le second n’a pas réduit le coût ; elle l’a déplacé sur les personnes.

Acceptation de la qualité d’achèvement

Une grille d’acceptation qui ne fonctionne que pour un modèle est une préférence, pas une grille. Construisez l’acceptation pour qu’elle survive à un changement de modèle :

  • Contrôles objectifs d’abord. Tests au vert, schéma validé, citations résolues, diff limité aux fichiers déclarés. Binaires et peu coûteux à exécuter sur chaque trace.
  • Grille de reviewer ensuite. Une courte checklist fixe par classe de workload (justesse, complétude, sécurité, respect du brief), notée par des reviewers qui ignorent quelle route a produit la sortie.
  • Exécutions répétées. Exécutez chaque tâche plus d’une fois et rapportez le taux de tâches acceptées comme une fourchette, pour qu’un succès en une exécution ne soit pas promu en capacité.
  • Rapport d’incertitude. Publiez la taille d’échantillon, les réglages (effort, outils, TTL) et la liste des échecs à côté de chaque résultat. Un taux sans taille d’échantillon n’est pas une preuve.

Écrivez la grille avant qu’un accès à Gemini 4 n’existe ; écrite après, elle se pliera autour de ce que la nouvelle route fait bien par hasard.

Plan de trafic en shadow et de rollback

Quand une route Gemini 4 existera un jour, elle devra entrer par les trois mêmes étapes que toute nouvelle route, Fable 5.1 restant la référence mesurée tout au long.

  1. Replay. Envoyez offline les traces Fable 5.1 enregistrées au candidat ; comparez le taux de tâches acceptées et le coût par tâche acceptée sur des entrées identiques.
  2. Shadow. Envoyez les requêtes réelles aux deux routes, servez la réponse de Fable 5.1, notez le candidat en silence. Cela révèle les boucles et les erreurs d’outils sans exposition des utilisateurs.
  3. Canary. Routez une classe de workload à une petite part ; n’élargissez que si les portes tiennent sur toute la fenêtre d’observation.

Portes de promotion, fixées avant le début du test : taux de tâches acceptées au moins égal à la référence ; p95 du temps horloge jusqu’à l’acceptation dans la borne convenue ; coût par tâche acceptée, retries et fallback inclus, au plus égal à la référence ; zéro incident pour la classe de workload sur la fenêtre.

Déclencheur de rollback : une porte qui échoue pendant le nombre convenu de jours consécutifs, ou un incident qui atteint un client. Le rollback est un changement de configuration de la gateway, pas un déploiement de code, c’est pourquoi la sélection du modèle appartient à la configuration de routage plutôt qu’au code applicatif.

La vérification de « l’identité de modèle renvoyée » consiste à lire le champ model et les compteurs d’usage dans chaque réponse et à contrôler qu’ils correspondent à la route configurée. Sur une gateway, cela confirme qu’une requête a été servie par le modèle demandé et non silencieusement par un fallback. Faites-le à la première requête de toute nouvelle route et en continu en shadow ; consignez le résultat dans le champ route de fallback du tableau de coût.

Ce qui ne compterait pas comme un progrès

  • Une fenêtre de contexte Gemini 4 supposée plus grande, sans tâches longues terminées pour le démontrer.
  • Un prix affiché plus bas compensé par des retries, des reprises, des sorties plus longues ou des minutes de revue supplémentaires.
  • Des captures d’écran de benchmarks ayant fuité ou des tableaux de spécifications tiers sans réglages, taille d’échantillon ni jeu de tâches reproductible.
  • Une route qui renvoie un modèle plus ancien ou un fallback opaque tout en portant le nouveau nom.
  • Un gain de tâches acceptées sur une journée qui disparaît sur des exécutions répétées ou sur toute la fenêtre d’observation.

Écrivez ces règles de rejet maintenant, dans le même document que la grille d’acceptation. Les équipes qui sautent cette étape tendent à redéfinir le succès autour du premier résultat excitant.

Évaluer Claude Fable 5.1 sur EvoLink Suivre la disponibilité de l’API Gemini 4

FAQ

Quelqu’un peut-il prouver aujourd’hui que Gemini 4 coûte moins cher que Claude Fable 5.1 pour les agents ?

Non. Google n’a publié pour Gemini 4 ni prix, ni règle de cache, ni fenêtre de contexte, ni entrée d’API au 16 septembre 2026, si bien que toute affirmation de coût dans un sens ou dans l’autre n’a aucun dénominateur publié. Relevez dès maintenant votre coût par tâche acceptée sur Fable 5.1 pour qu’une affirmation ultérieure ait quelque chose à quoi être confrontée.

Peut-on comparer directement les prix du cache entre fournisseurs ?

Pas comme des chiffres isolés. Une lecture de cache n’est comparable que lorsque le TTL, le périmètre du cache (préfixe contre explicite), la taille minimale mise en cache et le mode Standard ou Batch sont tous appariés. Anthropic documente les paliers d’écriture 5 minutes et 1 heure de Fable 5.1 ainsi que son tarif de lecture ; Gemini 4 n’a publié aucun de ces éléments.

Comment compter le coût d’une tâche de longue durée échouée ?

Rattachez chaque tentative, reprise et minute de reviewer au même ID de tâche. Les tâches échouées et non acceptées restent dans la dépense totale mais pas dans le dénominateur des tâches acceptées. Rapportez la dépense API par tâche acceptée et les minutes de revue par tâche acceptée comme deux chiffres, jamais fusionnés.

Comment enregistrer les caractéristiques que Gemini 4 n’a pas publiées ?

Créez le champ avec la valeur « Non publié au [date] ». Ne le remplissez pas avec une valeur de Gemini 3.x, un chiffre ayant fuité ou zéro. Quand Google publiera un contrat, remplacez la valeur provisoire et notez la date du changement pour que les comparaisons historiques restent honnêtes.

Comment conserver ma référence Claude vérifiée pendant le test d’une nouvelle route ?

Gardez la route Fable 5.1 configurée et en service pendant que le candidat passe par le replay, le shadow et le canary. Figez le jeu de tâches, la grille et les évaluateurs avant le test, et stockez les chiffres de référence avec leur date et leurs réglages ; une référence qui bouge pendant le test n’est pas une référence. Anthropic recommande de démarrer la plupart des workloads sur Claude Opus 5 et de réserver Fable 5.1 au raisonnement exigeant ou au travail à long horizon, précisez donc quelle route Claude constitue réellement votre référence.
EvoLink dispose d’une route configurée nommée claude-fable-5-1. Vérifiez l’identité de modèle renvoyée et les compteurs d’usage à votre première requête avant de router du trafic de production, et consultez les prix actuels sur la page produit Claude Fable 5.1. La disponibilité sur la gateway n’est pas un verdict de production ; celui-ci vient de vos propres résultats de replay, shadow et canary.

Sources

Preuves revues le 16 septembre 2026. Les faits Anthropic viennent de la documentation d’Anthropic ; les faits Google du blog officiel de Google et de la documentation de l’API Gemini. Gemini 4 n’a ni API publique ni route EvoLink.

Prêt à réduire vos coûts IA de 89 % ?

Commencez avec EvoLink dès aujourd'hui et découvrez la puissance du routage intelligent des API.