GPT Image 2.5 Flare & Sunburst sont disponibles sur EvoLinkEssayer GPT Image 2.5
Quatre niveaux de réflexion de Gemini 3.6 Flash représentés comme des paliers croissants
analysis

Niveaux de réflexion de Gemini 3.6 Flash : coûts mesurés

Jacey
Jacey
Founder
22 juillet 2026
29 min de lecture
Dernière vérification : 2026-07-21. Rédigé par l’équipe de recherche sur les modèles d’EvoLink. Les chiffres de cette page proviennent de 406 appels d’API effectués le jour du lancement ; la méthode est décrite en détail ci-dessous. EvoLink conçoit une infrastructure de modèles d’IA pour les équipes de production, sur laquelle s’exécutent les modèles mesurés ici.
La version courte
  • minimal a coûté 73.6% de moins que le niveau medium par défaut sur nos neuf tâches représentatives de la production, avec le même score de neuf sur neuf. Si vous n’avez jamais choisi de niveau, c’est votre principal levier de réduction des coûts.
  • Les jetons de réflexion représentaient 75 % de la facture totale sur medium, en comptant les jetons d'entrée. La longueur des réponses a à peine changé sur les quatre niveaux, donc presque chaque dollar de différence entre les niveaux est une réflexion.
  • low ne consomme pas un budget fixe. Sur les neuf exécutions d’extraction structurée, il a produit exactement zéro jeton de réflexion et a donc coûté autant que minimal, tout en continuant à raisonner pour les appels d’outils et les tâches de code.
  • Au-dessus de low, davantage de réflexion n’a pas produit davantage de bonnes réponses lors de notre deuxième tour, plus difficile. Les scores ont été de 2, 10, 10 et 8 sur 15 pour minimal, low, medium et high.
  • La valeur par défaut n'est pas fausse, elle n'est tout simplement pas ciblée. medium est un paramètre intermédiaire raisonnable pour un travail inconnu. Une fois que vous connaissez la forme de votre travail, le niveau mérite d’être réglé délibérément.
  • Chaque référence publiée pour ce modèle s'exécute sur high, tandis que la valeur par défaut de l'API est medium. Ce sont des factures différentes et des latences différentes.

La réponse courte, par niveau

Le niveau de réflexion est la principale variable de coût d’une requête Gemini 3.6 Flash, devant même le choix entre Gemini 3.6 Flash et Gemini 3.5 Flash. Les jetons de réflexion sont facturés au tarif de sortie et sont environ six fois plus nombreux que les jetons de réponse avec le réglage par défaut.

Voici le coût de chaque niveau pour un passage sur les neuf mêmes tâches, ainsi que les cas où cette dépense s’est justifiée.

NiveauCoût par passePar rapport à la valeur par défaut mediumUtilisez-le quand
minimal$0.015873.6% moins cherExtraction, classification, routage, localisation du code et chaînes d'outils qui n'ont qu'à suivre le script
low$0.023261.2% moins cherLe même travail, plus des appels d'outils en plusieurs étapes où le modèle devra peut-être se remettre d'un problème
medium (par défaut)$0.0598ligne de baseVous ne connaissez pas encore la forme de votre trafic, ou les travaux sont trop variés pour être cernés
high$0.06539.3% plus cherÀ réserver. Sur nos tâches, le budget supplémentaire est resté en grande partie inutilisé et, lors du tour difficile, son score a été inférieur à celui de medium
Ce tableau ne peut toutefois pas garantir que minimal convient à votre charge de travail. Il convenait à la nôtre, dont nous décrivons précisément la composition ci-dessous.

Le nombre que personne ne publie : jetons de réponse contre jetons de réflexion

Chaque comparaison de prix de ce modèle que nous avons pu trouver le jour du lancement traite les jetons de sortie comme un seul nombre. Cela fusionne deux quantités qui ne se comportent pas de la même manière, et une fois que vous les séparez, la plus grande partie de la confusion autour de cette version est résolue.

Voici un passage à travers nos neuf tâches, avec le côté sortie divisé en jetons que vous pouvez lire et en jetons que vous ne pouvez pas lire.

ConfigurationJetons de réponseJetons de réflexionPart de la réflexion dans la sortieCoût par passeCorrectLatence moyenne
3.6 Flash minimal1,16200%$0.01589/92.8s
3.6 Flash low1,0561,09551%$0.02329/93.3s
3.6 Flash medium (par défaut)1,0805,94485%$0.05989/95.1s
3.6 Flash high1,0926,67986%$0.06539/95.3s
3.5 Flash medium1,0785,82784%$0.06929/95.1s
3.5 Flash high1,1137,18587%$0.08189/95.7s
3.5 Flash-Lite minimal (par défaut)97700%$0.00368/91.8s
3.5 Flash-Lite high1,0978,28888%$0.02499/94.2s

Lisez d’abord la colonne des jetons de réponse. Sur huit configurations, deux modèles et quatre niveaux de réflexion, il reste entre les jetons 977 et 1,162, et le chiffre le plus élevé de la colonne appartient à la configuration la moins chère. Les modèles produisent des réponses à peu près de la même longueur, quelle que soit la réflexion initiale.

Lisez maintenant la colonne de réflexion. Elle va de zéro à 8,288. C'est toute l'histoire de votre facture.

Voici les mêmes données que l'argent, en divisant chaque passe en ce que vous avez payé pour l'entrée, pour la réponse et pour la réflexion, aux tarifs standard de Gemini 3.6 Flash de $1.50 par million de jetons d'entrée et $7.50 par million de jetons de sortie.

NiveauEntréeRéponseRéflexionTotalPart de la réflexion dans la facture totale
minimal$0.0071$0.0087$0.0000$0.01580%
low$0.0071$0.0079$0.0082$0.023235%
medium$0.0071$0.0081$0.0446$0.059875%
high$0.0071$0.0082$0.0501$0.065377%

Au niveau par défaut, les trois quarts de ce que vous payez sont des raisonnements que vous ne voyez jamais, sur des tâches pour lesquelles le niveau ne fait aucune différence quant à la bonne réponse. Ce n'est pas un défaut du modèle. C'est ce qui se produit lorsqu'une valeur par défaut à usage général répond à une charge de travail spécifique.

Cela explique également pourquoi « le nouveau modèle économise-t-il les jetons » obtient-il des réponses contradictoires en public. L'affirmation concerne les jetons de sortie, les jetons de sortie sont pour la plupart des jetons de réflexion, et le nombre de jetons de réflexion dépend du niveau de réflexion, ce que presque personne ne déclare. Une mesure sans niveau indiqué n’est pas reproductible.

Comment nous avons mesuré cela

Deux tours, exécutés sur 2026-07-21, le jour de la sortie des deux modèles.

Premier tour : combien coûtent les niveaux sur un travail de production ordinaire. Neuf tâches réparties en trois groupes de trois. Extraction structurée d'une facture, d'un fichier journal et du HTML d'une page produit. Outil multi-tours appelant trois à cinq étapes par rapport à des outils simulés. Localisation et réparation du code, où une description de bug doit devenir un correctif qui s'exécute. Les entrées s'effectuaient entre les jetons environ 1,000 et 4,000, cela couvre donc les tailles de requêtes ordinaires et ne dit rien sur le travail dans un contexte long. Chaque tâche a été exécutée trois fois sur chacune des huit configurations de modèle et de niveau de réflexion : appels 216, $1.03.
Deuxième tour : là où la qualité se casse réellement. Nous avons écrit 20 des tâches délibérément plus difficiles couvrant la résolution des contradictions, la corrélation entre enregistrements, la conversion d'unités en plusieurs étapes, les bogues inter-fonctions et les chaînes d'outils plus longues. Chacun a été exécuté une fois avec la configuration la plus faible et une fois avec la configuration la plus forte pour les trier par difficulté ; seules les tâches que les plus faibles ont échoué et que les plus forts ont réussies contiennent des informations sur les différences entre les niveaux. Trois des 20 se sont qualifiés. Ces trois éléments ont été exécutés cinq fois sur chacune des six configurations, soit des appels 90. Nous avons ensuite réexécuté toutes les tâches 20 trois fois sur minimal pour vérifier si le tri a eu lieu, ce qui est un autre appel 60. Le deuxième tour a eu lieu avec les appels 190 et $1.34.
Conditions qui s'appliquent à chaque numéro sur cette page.
  • Les appels passaient par OpenRouter avec le fournisseur épinglé sur Google AI Studio, envoyés en série plutôt que simultanément. La passerelle n'indique pas quelle région a répondu à la demande, nous ne pouvons donc pas en indiquer une.
  • Les coûts sont calculés à partir des prix catalogue standard de Google, et non à partir de la propre facturation de la passerelle. La passerelle propose des itinéraires à un niveau réduit, et mélanger les deux rendrait nos chiffres incomparables avec les tarifs publiés par Google.
  • Aucun paramètre d'échantillonnage n'a été défini. temperature, top_p et top_k sont obsolètes sur Gemini 3.x et sont acceptés puis ignorés, donc les définir n'aurait rien changé tout en impliquant que nous n'avions pas lu la documentation. Si vous les définissez toujours en production, le reste des modifications de l'interface de cette version sont traités dans notre guide de version Gemini 3.6 Flash.
  • La notation est basée sur des règles et non sur des humains. L'exactitude est ici une mesure de soutien, présente pour exclure l'explication selon laquelle un niveau bon marché semble bon marché parce qu'il fait tranquillement moins de travail.
  • Les jetons de réponse et les jetons de réflexion ont été enregistrés séparément pour chaque appel, ce qui rend les tableaux ci-dessus possibles.
Une limite honnête concernant les exécutions répétées. Au cours du premier tour, l'exactitude n'a jamais varié entre les trois répétitions d'une tâche : chaque configuration a obtenu le même score à chaque exécution. Le nombre de jetons de réflexion variait beaucoup, entre 6% et 51% pour la même tâche et le même niveau. Une tâche de code sur high a renvoyé des jetons de réflexion 331, 538 et 347 sur trois requêtes identiques. Ainsi, une moyenne sur trois exécutions est nécessaire pour les chiffres de coût et inutile pour les chiffres d'exactitude. Au deuxième tour, où les tâches se situent à la limite de ce que les modèles peuvent faire, cette stabilité disparaît complètement, ce que nous traitons comme une constatation plutôt que comme une note de bas de page.

Pourquoi les benchmarks publiés ne répondent pas à cette question

Il existe une raison documentée pour laquelle personne ne peut rechercher cela. Les chiffres de référence en circulation sont mesurés à des niveaux auxquels la plupart des flux de production ne fonctionnent pas, et les sources le disent rarement.

  • Artificial Analysis, actuellement la seule source indépendante avec une ventilation complète de ce modèle, mesurée à high thinking. La valeur par défaut de l'API est medium.
  • Le propre tableau de résultats de Google pour Gemini 3.5 Flash-Lite a été produit à l'adresse high, alors que l'API par défaut de ce modèle est minimal. L’exécution de la configuration par défaut n’est pas l’expérience décrite dans le tableau.
  • Dans le tableau de comparaison de Google, la ligne DeepSWE exécute Gemini 3.5 Flash sur medium et Gemini 3.6 Flash sur high, donc les deux chiffres Gémeaux de cette ligne ne constituent pas une comparaison de même niveau.
  • Le titre de Google « jusqu'à 65% sur DeepSWE » fait référence à une réduction de l'utilisation des jetons, et non à un score. Le score DeepSWE est 49%.
L’allégation d’efficacité la plus citée pose un problème similaire. Google déclare que le nouveau modèle utilise environ 17% moins de jetons de sortie, citant Artificial Analysis plutôt que sa propre mesure. Le nombre absolu de jetons publié sur cette même page, 59 million contre 75 million, correspond à 21.3%. Les deux chiffres n’ont pas été réconciliés publiquement, et ni l’un ni l’autre ne désigne un niveau de réflexion ou un ensemble de tâches. Nous utilisons le plus conservateur 17% partout où l'allégation apparaît dans notre travail, et nous la traitons comme une entrée arithmétique plutôt que comme une mesure.

Rien de tout cela ne fausse les chiffres publiés. Cela leur permet de répondre à une question différente de "qu'est-ce que cela va me coûter au niveau que je dirige réellement".

Premier tour : les niveaux sur le travail ordinaire

Trois résultats, dans l'ordre dans lequel ils comptent.

minimal signifie aucune réflexion, pas moins de réflexion. Les jetons de réflexion sont revenus exactement à zéro, pas sous la forme d'un petit nombre. Sur toutes nos exécutions minimal sur Gemini 3.6 Flash, 101 des appels 102 n'ont renvoyé précisément aucun jeton de réflexion. La seule exception est suffisamment étrange pour avoir sa propre section ci-dessous. Dans le même temps, l’exactitude est restée inchangée à neuf sur neuf et la latence médiane est passée de 5.1 seconds à 2.8 seconds. Sur cet ensemble de tâches, le niveau par défaut n'a rien acheté sauf une facture 3.8 fois plus importante et une réponse deux fois plus lente.
high coûte seulement 9.3% de plus que medium ici, car le budget supplémentaire n'a en grande partie pas été dépensé : la réflexion est passée de 5,944 à 6,679 tokens. C’est un fait concernant ces neuf tâches, et non concernant le modèle. Donnez-lui un travail qui nécessite réellement plus de raisonnement et l’écart se creuse. Ne tenez pas compte de ce ratio dans vos propres prévisions.
Les deux nouveaux niveaux de modèle étaient moins chers que le niveau équivalent sur Gemini 3.5 Flash, par 13.6% sur medium et 20.1% sur high. Presque toutes ces économies proviennent de la baisse du prix de sortie de $9.00 à $7.50 par million de jetons, plutôt que de l'efficacité des jetons : sur medium, nos jetons de sortie facturés ont en fait augmenté 1.7% par rapport à l'ancien modèle, et sur high, ils ont chuté 6.4%. Qu'il en soit de même pour votre trafic dépend de votre rapport entrée/sortie, puisque le prix d'entrée n'a pas changé du tout, et notre Gemini 3.5 Flash cost calculator parcourt cette arithmétique à travers des exemples concrets sur l'ancien modèle.

low est adaptatif, pas un budget fixe plus petit

C'est le résultat auquel nous ne nous attendions pas, et c'est le plus directement utile sur cette page.

Sur low, Gemini 3.6 Flash a réfléchi de manière inégale à nos trois types de tâches. Jetons de réflexion par passe :
Groupe de tâchesminimallowmediumhigh
Extraction structurée002,6732,916
Appel d'outil multi-tours05491,7971,914
Localisation et réparation du code05461,4741,849
Sur les trois tâches d’extraction et lors des trois répétitions, low a produit exactement zéro jeton de réflexion. Ce groupe a coûté $0.00490 avec low, contre $0.00489 avec minimal, soit deux dixièmes de point de pourcentage d’écart. Pour les appels d’outils et la réparation de code, le même niveau a consommé entre 100 et 440 jetons de réflexion par tâche.
Conséquence pratique : si votre trafic mêle extraction et travail en plusieurs étapes sous une seule configuration de modèle, low maintient un coût proche de minimal pour la part d’extraction tout en conservant une réserve de raisonnement pour le reste. Il n’est pas nécessaire de répartir le trafic entre deux configurations pour obtenir l’essentiel des économies. Sur notre ensemble de tâches, cette combinaison a coûté 61.2% de moins que le réglage par défaut.
Une mise en garde sur la portée : nous décrivons le comportement d’un réglage sur neuf tâches pendant une journée, et non un comportement documenté par Google. Nous rapportons une observation sans prétendre connaître le mécanisme qui la produit. Nous ne construirions donc pas un système reposant sur l’hypothèse que low n’utilise jamais de jetons de réflexion pour l’extraction sans le vérifier d’abord avec nos propres prompts.

Deuxième tour : là où la qualité se dégrade réellement

Le premier tour n'a pas pu répondre à la question de la qualité, car chaque configuration a obtenu une note de neuf sur neuf. Neuf tâches n'étaient pas assez difficiles pour séparer quatre niveaux. Nous les avons donc rendus plus difficiles, et la réponse qui est revenue n’était pas celle qu’impliquaient les niveaux.

Tout d’abord, le résultat du tri, qui est un constat en soi. Parmi les 20 tâches délibérément difficiles, minimal en a réussi 17 lors de trois tentatives sur trois : résolution de contradiction où trois chiffres sur une facture sont en désaccord et doivent être recalculés, corrélation de trois enregistrements de requêtes entrelacés en une seule chaîne d'échec, application d'une méta-règle "le document signé plus tard gagne" aux clauses contractuelles conflictuelles, conversion multi-devises et multi-périodes, un bug de clé de cache couvrant deux fonctions, et un bug de limiteur de débit qui n'apparaît qu'au troisième appel. Cela a résolu tous ces problèmes sans dépenser un seul jeton de réflexion. Les mêmes tâches coûtent entre 1,100 et 6,900 jetons de réflexion sur high.

Le niveau de réflexion n’achète donc pas l’exactitude du raisonnement, du moins pas dans l’étendue occupée par ces tâches. Ce qu'il achète est quelque chose de plus restreint.

Les trois tâches qui ont distingué les niveaux étaient toutes des appels d’outils en plusieurs tours, avec le même profil : un problème survient en cours d’exécution et le modèle doit ajouter une action absente du plan initial. Intercepter un colis avant la modification de l’adresse. Réessayer une fois après une réponse de limitation de débit. Rétablir l’étiquette d’origine lorsqu’une étiquette express ne s’imprime pas. Les tâches qui exigeaient de refuser une action ou de choisir correctement parmi les options proposées ont toutes été réussies avec minimal, y compris une chaîne de huit étapes.

Voici comment les six configurations ont marqué sur ces trois tâches, cinq tentatives chacune.

ConfigurationTâche 1Tâche 2Tâche 3TotalCoût par appel
3.6 Flash minimal1/50/51/52/15$0.00175
3.6 Flash low4/51/55/510/15$0.00553
3.6 Flash medium (par défaut)5/55/50/510/15$0.00674
3.6 Flash high5/52/51/58/15$0.00739
3.5 Flash-Lite minimal (par défaut)4/55/50/59/15$0.00068
3.5 Flash-Lite high2/55/53/510/15$0.00262

Le coût par appel exclut une requête anormale décrite dans la section suivante ; les totaux qui l’incluent y sont indiqués.

Il y a exactement un véritable pas en avant, et c'est de minimal à low. Deux sur 15 deviennent dix sur 15. Au-delà de ce point, la ligne est plate puis s'incurve : dix, dix, huit.
Par tâche, le tableau est plus compliqué que ce que suggèrent les totaux. La tâche 1 s'améliore nettement à mesure que le niveau augmente. La tâche 2 a besoin de medium pour être fiable, puis revient à deux sur cinq sur high. La tâche 3 s'exécute entièrement dans l'autre sens, avec un score de cinq sur cinq à low, zéro sur cinq à medium et un sur cinq à high. Plus de réflexion a rendu cette tâche pire, de manière constante, au cours de cinq tentatives chacune.
Nous n’allons pas expliquer pourquoi, car nous ne le savons pas. Ce que le modèle soutient est une affirmation plus étroite et plus défendable : sur des tâches à la limite des capacités d'un modèle, le niveau n'est pas un cadran de qualité que vous pouvez régler. Au-delà de low, les différences que nous avons mesurées sont inférieures à la variation entre des analyses identiques.
Cette instabilité est elle-même le constat le plus généralisable. Au premier tour, sur 216 appels, l’exactitude n’a jamais varié entre les répétitions d’une même tâche. Au second tour, la plupart des cellules du tableau affichent des valeurs comme un sur cinq ou quatre sur cinq. La même requête, envoyée cinq fois au même niveau, produit des réponses différentes. Toute évaluation qui n’exécute chaque configuration qu’une seule fois mesure donc aussi du bruit. Cela inclut notre propre passe de classement par difficulté, volontairement exécutée une fois par configuration. Lorsque nous avons réexécuté trois fois les tâches classées avec minimal, 17 sur 20 ont été clairement confirmées ; une tâche marquée comme échec lors de la passe unique n’a toutefois réussi qu’une fois sur trois. C’est exactement la variation que nous décrivons.

La conséquence technique est plus utile qu’une recommandation de niveau. Si votre agent doit récupérer après des états inattendus, intégrez la nouvelle tentative et la vérification dans votre application, et traitez le niveau de réflexion comme un paramètre de coût plutôt que comme un élément qui rend la récupération fiable.

Gemini 3.6 Flash low contre Gemini 3.5 Flash-Lite

Cette comparaison ne contient aucune donnée publiée que nous pourrions trouver, et c'est celle à laquelle une équipe soucieuse des coûts est réellement confrontée : pour à peu près le même prix, utilisez-vous le modèle le plus puissant avec un peu de réflexion, ou le modèle le moins cher en réfléchissant sérieusement ?

Au premier tour, ils coûtent presque le même prix. Gemini 3.6 Flash sur low était $0.0232 par passe ; Gemini 3.5 Flash-Lite sur high était $0.0249. Les deux ont obtenu neuf sur neuf. Gemini 3.6 Flash sur low était plus rapide, à 3.3 secondes contre 4.2 secondes de latence moyenne, et il a atteint ce score sur les jetons de réflexion 1,095 là où Flash-Lite avait besoin de 8,288.
Au deuxième tour, les tâches d'appel d'outils les plus difficiles, ils étaient à nouveau à égalité à dix sur 15, mais les prix se séparaient : Flash-Lite à high coûtait $0.00262 par appel contre $0.00553. Sur cet ensemble de tâches, le modèle le moins cher qui réfléchissait était moins de la moitié du prix pour le même score.

Laquelle de ces deux images s'applique à vous dépend de la répartition de vos tâches, et c'est la réponse honnête plutôt qu'une haie. Les deux configurations sont dans la même bande de performances sur nos deux tours. La relation de prix entre eux n’est pas stable d’un ensemble de tâches à l’autre.

Deux autres observations à partir des mêmes données, toutes deux intéressantes à connaître avant de choisir par défaut Flash-Lite.

Le niveau minimal par défaut sur Flash-Lite a échoué à une tâche de manière spécifique et reproductible. Sur une chaîne de notification en trois étapes, il a appelé les deux premiers outils puis s'est arrêté sans envoyer la notification, trois fois sur trois, avec à chaque fois une signature identique. C'était la seule différence de qualité dans tous les appels 216 du premier tour. Il reproduit également une limitation documentée par Google lui-même : la valeur par défaut minimal est décrite comme inadaptée à l'utilisation de sous-agents autonomes car elle met fin prématurément aux appels d'outils. Si vous exécutez Flash-Lite en tant qu'agent, augmentez le niveau ou attendez-vous à cet échec.
Les niveaux les plus bas des deux modèles échouent différemment, et aucun n'est uniformément plus fort. Lors des tâches d'appel d'outils du deuxième tour, Flash-Lite sur minimal a obtenu neuf sur 15 contre deux sur 15 pour Gemini 3.6 Flash. Lors de la chaîne de notification du premier tour, cette relation s'est inversée : Gemini 3.6 Flash sur minimal a réussi trois fois sur trois alors que Flash-Lite a échoué trois fois sur trois. Il n'y a pas d'ordre ici, seulement deux formes de défaillance différentes, et un niveau qui est sûr pour le trafic d'un modèle ne l'est pas automatiquement pour celui de l'autre.

Une anomalie que nous ne pouvons pas expliquer

Au deuxième tour, un appel à minimal a renvoyé des jetons de réflexion 62,916.
Tous les autres appels minimal dans nos données ont renvoyé exactement zéro. Celui-ci a utilisé cinq tours d'outil, a produit une sortie proche du plafond de sortie 65,536-token du modèle, a pris 209 secondes et a coûté $0.48. C'est à peu près 270 fois ce que l'autre appelle à ce niveau, et presque tout le $0.50 que cette configuration a dépensé tout au long de son cycle 15-call. C'était aussi la seule fois où minimal réussissait cette tâche particulière.
Nous signalons cela parce que cela s'est produit et parce que cela est important pour quiconque établit un budget sur minimal. Nous n’allons pas proposer de mécanisme, car nous n’en avons pas. La fiche modèle de Google répertorie les réponses lentes occasionnelles parmi les limitations connues du modèle, mais nous ne pouvons pas relier cette note à cette observation avec certitude.
Le point opérationnel à retenir est sans explication : si vous exécutez minimal sur un travail d'appel d'outil, définissez une limite maximale de jeton de sortie et un délai d'attente. Un niveau qui ne dépense normalement aucun jeton de réflexion n’est pas la même chose qu’un niveau qui ne peut pas en dépenser.

Quel niveau pour quelle tâche

Voici le tableau à retenir. Chaque ligne s’appuie sur les deux tours décrits ci-dessus ; les limites de ces résultats sont précisées ensuite.

Type de travailNiveauPourquoi
Extraction, classification, réponse aux questions, localisation et réparation du code en un seul tourminimal17 de 20 tâches volontairement difficiles réussies trois fois sur trois, à 26 % du coût par défaut
Appels d'outils en plusieurs étapes qui n'ont qu'à suivre le plan, ou à refuser une actionminimal suffitUne chaîne en huit étapes, trouver l'exception dans un lot, refuser une demande non conforme aux règles et choisir la source de données faisant autorité, a été réussie trois fois sur trois.
Appels d’outils en plusieurs étapes où le modèle peut avoir besoin d’une action absente du plan : nouvelle tentative, retour en arrière ou interception préventivelow au minimumminimal a obtenu 2/15 précisément sur ces tâches ; low a obtenu 10/15
Le même cas, mais avec une exigence de fiabilitéAucun niveau ne résout ce problèmelow, medium et high ont obtenu 10, 10 et 8 sur 15. Les écarts sont inférieurs à la variation d’une exécution à l’autre. Gérez ce risque par des nouvelles tentatives et une vérification dans l’application
Trafic mixte sous une seule configurationlowIl a consommé zéro jeton de réflexion sur nos tâches d’extraction tout en conservant une réserve pour le reste, à un coût inférieur de 61.2% au réglage par défaut
Vous ne connaissez pas encore votre mixmedium, puis mesurezLa valeur par défaut est un point de départ judicieux. Cela ne coûte cher que lorsque vous savez que ce n'est pas nécessaire
Les limites de ce conseil. Il repose sur 29 tâches conçues par nos soins – neuf ordinaires et 20 difficiles – avec des entrées inférieures à environ 4,000 tokens. Il ne couvre ni les contextes longs, ni les entrées multimodales, ni l’écriture créative, ni la recherche ouverte. Un autre ensemble de tâches peut produire des résultats différents, et nous en avons une preuve directe : pour savoir si Gemini 3.6 Flash utilise plus ou moins de jetons de réflexion que Gemini 3.5 Flash avec medium, le test indépendant d’aibenchy a mesuré 66.2% de plus, contre 2.0% de plus dans notre test. Leurs 22 courtes questions de benchmark et nos tâches d’extraction, d’appel d’outils et de code ont donné des réponses opposées à la même question. Il ne s’agit pas d’un différend à trancher, mais du constat central : l’économie de jetons dépend de la charge de travail, pas seulement du modèle.

Mesurer cela sur votre propre trafic

Quatre étapes, dans l'ordre qui vous permet d'obtenir une réponse le plus rapidement possible.

  1. ** Enregistrez les jetons de réflexion séparément aujourd'hui, avant de modifier quoi que ce soit. ** L'API de Google renvoie le nombre dans total_thought_tokens, à côté du niveau que vous avez défini. Si vous ne suivez que le total des jetons de production, vous ne pouvez pas constater une régression rapide à partir d'un niveau qui a décidé de réfléchir plus sérieusement cette semaine.
    from google import genai
    from google.genai import types
    
    client = genai.Client()  # reads the API key from the environment
    
    response = client.models.generate_content(
        model="gemini-3.6-flash",
        contents=prompt,
        config=types.GenerateContentConfig(
            thinking_config=types.ThinkingConfig(thinking_level="minimal"),
        ),
    )
    
    log.info(
        "level=minimal thinking_tokens=%s",
        response.usage_metadata.total_thought_tokens,
    )
Stockez le nombre de réflexions dans son propre champ à côté de votre métrique de jeton de sortie existante et stockez le niveau que vous avez envoyé à côté. L'addition des deux comptes de jetons jette le seul signal qui vous indique lequel a bougé. 2. Définissez le niveau explicitement, même si vous le définissez sur medium. Une valeur par défaut héritée est une décision coûteuse que personne n'a prise. Cela signifie également que votre facture peut évoluer en cas de défaut. 3. Rejouez une journée de trafic réel sur minimal et sur low, et comparez les résultats à vos résultats actuels plutôt qu'à un benchmark. Sur nos tâches, cette comparaison valait entre 61% et 74% de la facture, ce qui représente un effet plus important que n'importe quel échange de modèle disponible dans ce niveau. 4. Notez les chemins d'appel d'outils séparément de tout le reste. C'est le seul endroit où nous avons trouvé l'exactitude du changement de niveau, et la moyenne avec le trafic d'extraction le masquera.

Effectuer cette comparaison sur plusieurs modèles signifie généralement une intégration distincte par fournisseur, et ce coût d'intégration est la raison la plus courante pour laquelle les équipes ignorent complètement la mesure. La normalisation sur un point de terminaison compatible OpenAI le supprime, de sorte que la chaîne de modèle devient la seule chose qui change entre les exécutions.

import os
from openai import OpenAI

client = OpenAI(
    base_url="https://api.evolink.ai/v1",
    api_key=os.environ["EVOLINK_API_KEY"],
)

for model in ("gemini-3.6-flash", "gemini-3.5-flash-lite"):
    response = client.chat.completions.create(model=model, messages=messages)
    record(model, response.usage)
EvoLink est une infrastructure de modèle d'IA pour les équipes de production, et ce type de mesure fait partie de son objectif : l'utilisation est rapportée par requête, vous pouvez donc séparer les colonnes de réponse et de réflexion de la première exécution. L’endroit où vous exécutez la comparaison est bien moins important que son exécution.

FAQ

Quel est le niveau de réflexion par défaut pour Gemini 3.6 Flash ? medium. Les valeurs sélectionnables sont minimal, low, medium et high. Gemini 3.5 Flash-Lite est par défaut minimal, de sorte que les deux modèles se comportent très différemment dès la sortie de la boîte.
Puis-je désactiver complètement la réflexion ? minimal est le paramètre le plus bas disponible, et la documentation de Google décrit la réflexion comme activée par défaut pour ce modèle plutôt que comme quelque chose que vous désactivez. En pratique, minimal n'a renvoyé exactement aucun jeton de réflexion sur 101 de nos appels 102, il se comporte donc comme étant désactivé à des fins de facturation pour la plupart des requêtes. La seule exception est documentée ci-dessus, c’est pourquoi nous ne la décrirons pas comme une garantie.
Les jetons de réflexion sont-ils facturés ? Oui, au tarif de sortie. La documentation de Google indique que le prix d’une réponse correspond à la somme des jetons de sortie et des jetons de réflexion. Avec un tarif de $7.50 par million de jetons de sortie pour Gemini 3.6 Flash et des jetons de réflexion équivalant à 85 % des jetons de sortie au niveau par défaut, la réflexion représente la majeure partie de la facture.
À quel point minimal est-il moins cher que la valeur par défaut ? Sur notre ensemble de neuf tâches, minimal a coûté 73.6 % de moins par passage, avec la même exactitude de neuf sur neuf et environ deux fois moins de latence. Votre ratio dépendra du nombre de jetons de réflexion que votre charge de travail provoque avec medium : considérez ce chiffre comme une raison de mesurer, pas comme une prévision.
Un niveau de réflexion plus élevé rend-il le modèle plus précis ? Pas de manière fiable, d’après nos mesures. Sur les appels d’outils en plusieurs étapes, le passage de minimal à low a produit une nette progression, de deux à dix réussites sur 15. Au-dessus de low, les scores ont été de dix, dix et huit sur 15, et une tâche a même obtenu de moins bons résultats aux niveaux supérieurs sur cinq tentatives chacun. Pour les tâches de raisonnement en un seul tour, minimal a résolu 17 problèmes difficiles sur 20 sans aucun jeton de réflexion.
Quel niveau de réflexion les benchmarks publiés utilisent-ils ? Artificial Analysis est publié sur high, et le tableau de résultats Flash-Lite de Google a également été produit sur high alors que l'API par défaut de ce modèle est minimal. Si vous exécutez les valeurs par défaut, vous n'exécutez pas la configuration décrite par ces numéros.
Comment puis-je voir combien de jetons de réflexion une requête a utilisés ? Lisez total_thought_tokens à partir de la réponse. Enregistrez-le comme son propre champ à côté des jetons de sortie plutôt que de les additionner, sinon vous ne pourrez pas attribuer de changement de coût plus tard.
Le niveau de réflexion change-t-il la longueur de la réponse ? À peine. Dans huit configurations couvrant deux modèles et quatre niveaux, les jetons de réponse sont restés entre 977 et 1,162 par passe sur notre ensemble de tâches. Le niveau modifie ce que fait le modèle avant de répondre, pas ce qu'il écrit.

Sources

Prêt à réduire vos coûts IA de 89 % ?

Commencez avec EvoLink dès aujourd'hui et découvrez la puissance du routage intelligent des API.