
Gemini 4 vs Claude Fable 5.1 : agents longue durée
Tableau de statut et de preuves
| Question | Gemini 4 | Claude Fable 5.1 | Décision sûre |
|---|---|---|---|
| Statut officiel | Pré-entraînement confirmé par Google (juillet 2026) | Sorti chez Anthropic le 1er septembre 2026 ; marqué Active (latest) | Traiter l’écart comme un écart de statut, pas comme un verdict de capacité |
| ID de modèle API | Non publié | claude-fable-5-1 (Anthropic) | Ne jamais placer un ID non publié dans la configuration ou le code |
| Contexte et sortie maximale | Non publiés | 1M de contexte ; 128K de sortie maximale (Anthropic) | Relever la part de la fenêtre que vos traces consomment réellement |
| Modalités d’entrée | Non publiées | Entrée texte et image, sortie texte (Anthropic) | Lister les modalités requises par chaque workload avant de tester |
| Contrôles de thinking | Non publiés | Thinking adaptatif toujours actif ; effort par défaut high ; latence comparative indiquée comme Slower (Anthropic) | Journaliser le réglage d’effort par trace pour tester une future route à réglages appariés |
| Structure des prix du cache | Non publiée | Entrée 10 $ / sortie 50 $ par MTok ; écriture de cache 5 minutes 12,50 $ ; écriture de cache 1 heure 20 $ ; lecture de cache 0,25 $ par MTok (catalogue Anthropic) | L’économie du cache ne peut pas être comparée tant que les deux côtés n’ont pas publié TTL et tarifs |
| Disponibilité du Batch | Non publiée | Anthropic affiche le Batch en entrée et en sortie à 50 % du standard | Comparer Standard à Standard, Batch à Batch |
| Changements incompatibles documentés | Non publiés | Trois dans le guide de migration d’Anthropic : erreurs sur le choix d’outil forcé, incompatibilité des anciens modèles avec les thinking blocks de 5.1, invalidation des thinking blocks après modification de tours antérieurs | Une liste publiée de changements incompatibles est testable ; une liste absente ne l’est pas |
| Route EvoLink | Aucune route appelable vérifiée ; alerte de lancement ouverte | Route configurée claude-fable-5-1 ; prix sur la page produit | Vérifier l’identité de modèle renvoyée à la première requête de toute route |
La colonne Gemini 4 est une liste de ce qui peut être mesuré, pas une critique. Chaque cellule « Non publié » est un champ pour lequel votre harness devrait déjà avoir un emplacement, afin qu’un contrat publié remplisse des valeurs au lieu d’imposer une refonte.
Quelles tâches de longue durée valent la peine d’être évaluées
Le travail d’agent de longue durée n’est pas un workload unique. Cinq classes de tâches couvrent la plupart des traces que les équipes routent vers Fable 5.1, chacune avec sa propre définition de « accepté ». Relevez la référence par classe ; jugez aussi toute future route Gemini 4 par classe.
| Workload | Ce que « accepté » signifie | Quoi relever sur Fable 5.1 maintenant | Ce qu’une route Gemini 4 devra égaler plus tard |
|---|---|---|---|
| Réparation multi-fichiers d’un dépôt | Tests au vert, diff relu, aucun fichier sans rapport touché | Fichiers lus et modifiés, appels d’outils, retries, minutes de reviewer, tokens par correctif accepté | Même jeu de tâches, suite de tests et grille de revue |
| Recherche multi-étapes et livrables de connaissance | Les citations se résolvent, la structure correspond au brief, aucune affirmation non étayée | Sources récupérées, révisions demandées, corrections factuelles par livrable | Mêmes briefs et même passe de vérification des faits |
| Boucles d’outils de plusieurs heures | La boucle se termine sur la condition d’arrêt avec un état final valide | Nombre de boucles, appels d’outils échoués, checkpoints, événements de reprise, temps horloge jusqu’à la terminaison | Mêmes outils, permissions, budget de retries et règles d’arrêt |
| Extraction structurée sur documents longs | La sortie valide le schéma ; les champs échantillonnés correspondent à la source | Longueur du document, échecs de schéma, réexécutions, justesse des champs sur un échantillon fixe | Mêmes documents, schéma et échantillon |
| Flux d’outils multi-étapes du service client | Ticket résolu dans le cadre de la politique sans escalade humaine | Escalades, appels au mauvais outil, violations de politique, temps de traitement | Mêmes définitions de flux et mêmes contrôles de politique |
Aucune ligne ne désigne un modèle préféré, parce qu’aucune exécution appariée n’existe. Le tableau fixe seulement ce que « la même tâche » signifiera quand une seconde route deviendra disponible.
Réutilisation du contexte et conditions de cache
Les agents de longue durée renvoient à chaque tour la même carte du dépôt, les mêmes schémas d’outils et les mêmes instructions, si bien que le prix du cache domine la facture de tokens. C’est aussi la partie de la comparaison qui ne peut pas commencer aujourd’hui.
Google n’a publié pour Gemini 4 ni TTL de cache, ni tarifs d’écriture ou de lecture, ni périmètre du cache (cache de préfixe automatique contre objets de cache explicites), ni taille minimale mise en cache. Sans ces quatre valeurs il n’y a pas de dénominateur : une lecture de cache à cinq minutes est un produit différent d’une lecture à une heure, et un cache de préfixe par requête est un produit différent d’un cache nommé partagé par plusieurs agents. Des TTL, des périmètres de contexte et des modes batch différents ne peuvent pas être mélangés dans un seul chiffre.
Fable 5.1 vous donne la structure sur laquelle enregistrer. Anthropic documente une écriture de cache 5 minutes à 12,50 $ par MTok, une écriture 1 heure à 20 $ par MTok, des lectures de cache à 0,25 $ par MTok et le Batch à 50 % de l’entrée et de la sortie standard. Pour chaque trace Fable, journalisez :
- quel TTL a été choisi et pourquoi (espacement des tours sous cinq minutes, ou pauses qui justifiaient l’écriture 1 heure) ;
- la taille du préfixe en cache et la fréquence de ses changements en cours de tâche, puisqu’un préfixe modifié force une nouvelle écriture ;
- les tokens lus en cache contre les tokens d’entrée frais par tour ;
- si la trace a tourné en Standard ou en Batch, et comment la page des tarifs d’Anthropic combinait le Batch avec les modificateurs de cache au moment de l’exécution.
Coût des retries, de la reprise et de la prise en main humaine
C’est la couche qu’un tableau de spécifications ne montre jamais, et celle où la plupart des budgets d’agents de longue durée se perdent réellement. Une trace qui se termine à la troisième tentative après qu’un humain l’a débloquée ne coûte pas la même chose qu’une trace terminée du premier coup. Journalisez six événements par trace, chacun avec un horodatage et un décompte de tokens :
- Détection de boucle. Le même appel d’outil avec les mêmes arguments répété au-delà d’un seuil fixé à l’avance. Notez combien de tours ont brûlé avant que la règle d’arrêt ne se déclenche.
- Appels d’outils échoués. Séparez les erreurs côté fournisseur, les erreurs côté outil et les appels mal formés côté modèle. Seule la troisième est un signal de qualité du modèle ; les deux autres sont un coût d’infrastructure qu’une nouvelle route paiera aussi.
- Intégrité des checkpoints. Vérifiez que chaque état sauvegardé peut réellement restaurer la tâche. Un checkpoint qui ne reprend pas est une sortie gaspillée plus une réexécution complète.
- Reprise après interruption. Comptez les tokens dépensés à reconstruire le contexte après un rate limit, un timeout ou une pause opérateur, séparément des tokens de la première exécution.
- Invalidation des thinking blocks. Le guide de migration d’Anthropic documente que la modification de tours antérieurs invalide les thinking blocks conservés de Fable 5.1. Tout framework qui réécrit l’historique pour la compaction ou la correction le déclenchera ; notez la fréquence et le coût du nouveau raisonnement. Que Gemini 4 ait une règle équivalente n’est pas publié.
- Prise en main humaine. Minutes de reviewer passées à débloquer, corriger ou terminer la tâche, journalisées comme du temps pour qu’elles ne disparaissent jamais dans un total API.
Stockez ces éléments comme des champs de l’enregistrement de trace, pas dans un journal d’incidents séparé ; le coût par tâche acceptée n’a de sens que si les retries, les reprises et les minutes de reviewer portent le même ID de tâche que les tokens.
Le tableau complet des variables de coût de tâche
Le dénominateur de chaque chiffre ci-dessous est le nombre de tâches terminées et ayant passé l’acceptation. Les tâches terminées mais refusées en revue comptent dans la dépense (elles ont été payées) mais pas dans le dénominateur. La dépense API et le temps humain restent dans des colonnes séparées ; ne convertissez les minutes en argent qu’au niveau du reporting, à un taux que votre équipe finance possède.
| Variable | Comment l’enregistrer sur Fable 5.1 aujourd’hui | Statut Gemini 4 |
|---|---|---|
| Tokens d’entrée | Entrée fraîche (non mise en cache) par tour, sommée par tâche, à partir des compteurs d’usage renvoyés par EvoLink | Inconnu jusqu’à la publication du contrat |
| Écriture de cache | Tokens écrits, ventilés par TTL 5 minutes et 1 heure, avec le nombre d’écritures par tâche | Inconnu jusqu’à la publication du contrat |
| Lecture de cache | Tokens servis depuis le cache par tâche ; journalisez aussi le taux de hit (lecture de cache / (lecture de cache + entrée fraîche)) | Inconnu jusqu’à la publication du contrat |
| Tokens de sortie | Réponse finale plus arguments d’outils intermédiaires, sommés par tâche | Inconnu jusqu’à la publication du contrat |
| Appels d’outils et coût externe | Nombre et tout coût mesuré (recherche, exécution de code, API tierces) par tâche | Inconnu jusqu’à la publication du contrat |
| Retries | Tentatives au-delà de la première, avec les tokens par tentative, rattachées au même ID de tâche | Inconnu jusqu’à la publication du contrat |
| Usage de la route de fallback | Si un tour a été servi par un autre modèle, et lequel, vérifié via le champ model renvoyé | Inconnu jusqu’à la publication du contrat |
| Minutes de revue humaine | Temps de reviewer et d’opérateur par tâche, enregistré en minutes | Mesuré sur vos propres exécutions dès qu’une route existe ; ce n’est pas une valeur publiée par le fournisseur |
| Temps horloge jusqu’à l’acceptation | Durée du début de la tâche au résultat accepté, attentes et tours humains inclus | Mesuré sur vos propres exécutions dès qu’une route existe ; ce n’est pas une valeur publiée par le fournisseur |
| Taux de tâches acceptées | Tâches acceptées / tâches tentées par classe de workload sur la fenêtre | Mesuré sur vos propres exécutions dès qu’une route existe ; ce n’est pas une valeur publiée par le fournisseur |
Le coût par tâche acceptée est la dépense API divisée par les tâches acceptées, rapportée à côté des minutes de revue par tâche acceptée. Une route qui baisse le premier en augmentant le second n’a pas réduit le coût ; elle l’a déplacé sur les personnes.
Acceptation de la qualité d’achèvement
Une grille d’acceptation qui ne fonctionne que pour un modèle est une préférence, pas une grille. Construisez l’acceptation pour qu’elle survive à un changement de modèle :
- Contrôles objectifs d’abord. Tests au vert, schéma validé, citations résolues, diff limité aux fichiers déclarés. Binaires et peu coûteux à exécuter sur chaque trace.
- Grille de reviewer ensuite. Une courte checklist fixe par classe de workload (justesse, complétude, sécurité, respect du brief), notée par des reviewers qui ignorent quelle route a produit la sortie.
- Exécutions répétées. Exécutez chaque tâche plus d’une fois et rapportez le taux de tâches acceptées comme une fourchette, pour qu’un succès en une exécution ne soit pas promu en capacité.
- Rapport d’incertitude. Publiez la taille d’échantillon, les réglages (effort, outils, TTL) et la liste des échecs à côté de chaque résultat. Un taux sans taille d’échantillon n’est pas une preuve.
Écrivez la grille avant qu’un accès à Gemini 4 n’existe ; écrite après, elle se pliera autour de ce que la nouvelle route fait bien par hasard.
Plan de trafic en shadow et de rollback
Quand une route Gemini 4 existera un jour, elle devra entrer par les trois mêmes étapes que toute nouvelle route, Fable 5.1 restant la référence mesurée tout au long.
- Replay. Envoyez offline les traces Fable 5.1 enregistrées au candidat ; comparez le taux de tâches acceptées et le coût par tâche acceptée sur des entrées identiques.
- Shadow. Envoyez les requêtes réelles aux deux routes, servez la réponse de Fable 5.1, notez le candidat en silence. Cela révèle les boucles et les erreurs d’outils sans exposition des utilisateurs.
- Canary. Routez une classe de workload à une petite part ; n’élargissez que si les portes tiennent sur toute la fenêtre d’observation.
Portes de promotion, fixées avant le début du test : taux de tâches acceptées au moins égal à la référence ; p95 du temps horloge jusqu’à l’acceptation dans la borne convenue ; coût par tâche acceptée, retries et fallback inclus, au plus égal à la référence ; zéro incident pour la classe de workload sur la fenêtre.
Déclencheur de rollback : une porte qui échoue pendant le nombre convenu de jours consécutifs, ou un incident qui atteint un client. Le rollback est un changement de configuration de la gateway, pas un déploiement de code, c’est pourquoi la sélection du modèle appartient à la configuration de routage plutôt qu’au code applicatif.
model et les compteurs d’usage dans chaque réponse et à contrôler qu’ils correspondent à la route configurée. Sur une gateway, cela confirme qu’une requête a été servie par le modèle demandé et non silencieusement par un fallback. Faites-le à la première requête de toute nouvelle route et en continu en shadow ; consignez le résultat dans le champ route de fallback du tableau de coût.Ce qui ne compterait pas comme un progrès
- Une fenêtre de contexte Gemini 4 supposée plus grande, sans tâches longues terminées pour le démontrer.
- Un prix affiché plus bas compensé par des retries, des reprises, des sorties plus longues ou des minutes de revue supplémentaires.
- Des captures d’écran de benchmarks ayant fuité ou des tableaux de spécifications tiers sans réglages, taille d’échantillon ni jeu de tâches reproductible.
- Une route qui renvoie un modèle plus ancien ou un fallback opaque tout en portant le nouveau nom.
- Un gain de tâches acceptées sur une journée qui disparaît sur des exécutions répétées ou sur toute la fenêtre d’observation.
Écrivez ces règles de rejet maintenant, dans le même document que la grille d’acceptation. Les équipes qui sautent cette étape tendent à redéfinir le succès autour du premier résultat excitant.
Évaluer Claude Fable 5.1 sur EvoLink Suivre la disponibilité de l’API Gemini 4FAQ
Quelqu’un peut-il prouver aujourd’hui que Gemini 4 coûte moins cher que Claude Fable 5.1 pour les agents ?
Non. Google n’a publié pour Gemini 4 ni prix, ni règle de cache, ni fenêtre de contexte, ni entrée d’API au 16 septembre 2026, si bien que toute affirmation de coût dans un sens ou dans l’autre n’a aucun dénominateur publié. Relevez dès maintenant votre coût par tâche acceptée sur Fable 5.1 pour qu’une affirmation ultérieure ait quelque chose à quoi être confrontée.
Peut-on comparer directement les prix du cache entre fournisseurs ?
Pas comme des chiffres isolés. Une lecture de cache n’est comparable que lorsque le TTL, le périmètre du cache (préfixe contre explicite), la taille minimale mise en cache et le mode Standard ou Batch sont tous appariés. Anthropic documente les paliers d’écriture 5 minutes et 1 heure de Fable 5.1 ainsi que son tarif de lecture ; Gemini 4 n’a publié aucun de ces éléments.
Comment compter le coût d’une tâche de longue durée échouée ?
Rattachez chaque tentative, reprise et minute de reviewer au même ID de tâche. Les tâches échouées et non acceptées restent dans la dépense totale mais pas dans le dénominateur des tâches acceptées. Rapportez la dépense API par tâche acceptée et les minutes de revue par tâche acceptée comme deux chiffres, jamais fusionnés.
Comment enregistrer les caractéristiques que Gemini 4 n’a pas publiées ?
Créez le champ avec la valeur « Non publié au [date] ». Ne le remplissez pas avec une valeur de Gemini 3.x, un chiffre ayant fuité ou zéro. Quand Google publiera un contrat, remplacez la valeur provisoire et notez la date du changement pour que les comparaisons historiques restent honnêtes.
Comment conserver ma référence Claude vérifiée pendant le test d’une nouvelle route ?
Fable 5.1 est-il disponible sur EvoLink maintenant ?
claude-fable-5-1. Vérifiez l’identité de modèle renvoyée et les compteurs d’usage à votre première requête avant de router du trafic de production, et consultez les prix actuels sur la page produit Claude Fable 5.1. La disponibilité sur la gateway n’est pas un verdict de production ; celui-ci vient de vos propres résultats de replay, shadow et canary.Sources
- Anthropic : vue d’ensemble du modèle Claude Fable 5.1
- Anthropic : guide de migration vers Claude Fable 5.1
- Anthropic : tarifs, TTL du cache et Batch
- Anthropic : annonce de Claude Fable 5.1
- Anthropic : page produit Claude Fable
- Anthropic : dépréciations de modèles
- Google : message du CEO sur les résultats du T2 2026 d’Alphabet
- Google : annonce de Gemini 3.6 Flash
- Google : catalogue de modèles de l’API Gemini
- Statut de l’API Gemini 4 sur EvoLink
- EvoLink : Claude Fable 5.1
- EvoLink : suivi de sortie de Gemini 4
- EvoLink : Claude Fable 5.1 vs GPT-6 Astra


