
Niveaux de réflexion de Gemini 3.6 Flash : coûts mesurés
minimala coûté 73.6% de moins que le niveaumediumpar défaut sur nos neuf tâches représentatives de la production, avec le même score de neuf sur neuf. Si vous n’avez jamais choisi de niveau, c’est votre principal levier de réduction des coûts.- Les jetons de réflexion représentaient 75 % de la facture totale sur
medium, en comptant les jetons d'entrée. La longueur des réponses a à peine changé sur les quatre niveaux, donc presque chaque dollar de différence entre les niveaux est une réflexion. lowne consomme pas un budget fixe. Sur les neuf exécutions d’extraction structurée, il a produit exactement zéro jeton de réflexion et a donc coûté autant queminimal, tout en continuant à raisonner pour les appels d’outils et les tâches de code.- Au-dessus de
low, davantage de réflexion n’a pas produit davantage de bonnes réponses lors de notre deuxième tour, plus difficile. Les scores ont été de 2, 10, 10 et 8 sur 15 pourminimal,low,mediumethigh. - La valeur par défaut n'est pas fausse, elle n'est tout simplement pas ciblée.
mediumest un paramètre intermédiaire raisonnable pour un travail inconnu. Une fois que vous connaissez la forme de votre travail, le niveau mérite d’être réglé délibérément. - Chaque référence publiée pour ce modèle s'exécute sur
high, tandis que la valeur par défaut de l'API estmedium. Ce sont des factures différentes et des latences différentes.
La réponse courte, par niveau
Voici le coût de chaque niveau pour un passage sur les neuf mêmes tâches, ainsi que les cas où cette dépense s’est justifiée.
| Niveau | Coût par passe | Par rapport à la valeur par défaut medium | Utilisez-le quand |
|---|---|---|---|
minimal | $0.0158 | 73.6% moins cher | Extraction, classification, routage, localisation du code et chaînes d'outils qui n'ont qu'à suivre le script |
low | $0.0232 | 61.2% moins cher | Le même travail, plus des appels d'outils en plusieurs étapes où le modèle devra peut-être se remettre d'un problème |
medium (par défaut) | $0.0598 | ligne de base | Vous ne connaissez pas encore la forme de votre trafic, ou les travaux sont trop variés pour être cernés |
high | $0.0653 | 9.3% plus cher | À réserver. Sur nos tâches, le budget supplémentaire est resté en grande partie inutilisé et, lors du tour difficile, son score a été inférieur à celui de medium |
minimal convient à votre charge de travail. Il convenait à la nôtre, dont nous décrivons précisément la composition ci-dessous.Le nombre que personne ne publie : jetons de réponse contre jetons de réflexion
Chaque comparaison de prix de ce modèle que nous avons pu trouver le jour du lancement traite les jetons de sortie comme un seul nombre. Cela fusionne deux quantités qui ne se comportent pas de la même manière, et une fois que vous les séparez, la plus grande partie de la confusion autour de cette version est résolue.
Voici un passage à travers nos neuf tâches, avec le côté sortie divisé en jetons que vous pouvez lire et en jetons que vous ne pouvez pas lire.
| Configuration | Jetons de réponse | Jetons de réflexion | Part de la réflexion dans la sortie | Coût par passe | Correct | Latence moyenne |
|---|---|---|---|---|---|---|
3.6 Flash minimal | 1,162 | 0 | 0% | $0.0158 | 9/9 | 2.8s |
3.6 Flash low | 1,056 | 1,095 | 51% | $0.0232 | 9/9 | 3.3s |
3.6 Flash medium (par défaut) | 1,080 | 5,944 | 85% | $0.0598 | 9/9 | 5.1s |
3.6 Flash high | 1,092 | 6,679 | 86% | $0.0653 | 9/9 | 5.3s |
3.5 Flash medium | 1,078 | 5,827 | 84% | $0.0692 | 9/9 | 5.1s |
3.5 Flash high | 1,113 | 7,185 | 87% | $0.0818 | 9/9 | 5.7s |
3.5 Flash-Lite minimal (par défaut) | 977 | 0 | 0% | $0.0036 | 8/9 | 1.8s |
3.5 Flash-Lite high | 1,097 | 8,288 | 88% | $0.0249 | 9/9 | 4.2s |
Lisez d’abord la colonne des jetons de réponse. Sur huit configurations, deux modèles et quatre niveaux de réflexion, il reste entre les jetons 977 et 1,162, et le chiffre le plus élevé de la colonne appartient à la configuration la moins chère. Les modèles produisent des réponses à peu près de la même longueur, quelle que soit la réflexion initiale.
Lisez maintenant la colonne de réflexion. Elle va de zéro à 8,288. C'est toute l'histoire de votre facture.
Voici les mêmes données que l'argent, en divisant chaque passe en ce que vous avez payé pour l'entrée, pour la réponse et pour la réflexion, aux tarifs standard de Gemini 3.6 Flash de $1.50 par million de jetons d'entrée et $7.50 par million de jetons de sortie.
| Niveau | Entrée | Réponse | Réflexion | Total | Part de la réflexion dans la facture totale |
|---|---|---|---|---|---|
minimal | $0.0071 | $0.0087 | $0.0000 | $0.0158 | 0% |
low | $0.0071 | $0.0079 | $0.0082 | $0.0232 | 35% |
medium | $0.0071 | $0.0081 | $0.0446 | $0.0598 | 75% |
high | $0.0071 | $0.0082 | $0.0501 | $0.0653 | 77% |
Au niveau par défaut, les trois quarts de ce que vous payez sont des raisonnements que vous ne voyez jamais, sur des tâches pour lesquelles le niveau ne fait aucune différence quant à la bonne réponse. Ce n'est pas un défaut du modèle. C'est ce qui se produit lorsqu'une valeur par défaut à usage général répond à une charge de travail spécifique.
Cela explique également pourquoi « le nouveau modèle économise-t-il les jetons » obtient-il des réponses contradictoires en public. L'affirmation concerne les jetons de sortie, les jetons de sortie sont pour la plupart des jetons de réflexion, et le nombre de jetons de réflexion dépend du niveau de réflexion, ce que presque personne ne déclare. Une mesure sans niveau indiqué n’est pas reproductible.
Comment nous avons mesuré cela
Deux tours, exécutés sur 2026-07-21, le jour de la sortie des deux modèles.
minimal pour vérifier si le tri a eu lieu, ce qui est un autre appel 60. Le deuxième tour a eu lieu avec les appels 190 et $1.34.- Les appels passaient par OpenRouter avec le fournisseur épinglé sur Google AI Studio, envoyés en série plutôt que simultanément. La passerelle n'indique pas quelle région a répondu à la demande, nous ne pouvons donc pas en indiquer une.
- Les coûts sont calculés à partir des prix catalogue standard de Google, et non à partir de la propre facturation de la passerelle. La passerelle propose des itinéraires à un niveau réduit, et mélanger les deux rendrait nos chiffres incomparables avec les tarifs publiés par Google.
- Aucun paramètre d'échantillonnage n'a été défini.
temperature,top_pettop_ksont obsolètes sur Gemini 3.x et sont acceptés puis ignorés, donc les définir n'aurait rien changé tout en impliquant que nous n'avions pas lu la documentation. Si vous les définissez toujours en production, le reste des modifications de l'interface de cette version sont traités dans notre guide de version Gemini 3.6 Flash. - La notation est basée sur des règles et non sur des humains. L'exactitude est ici une mesure de soutien, présente pour exclure l'explication selon laquelle un niveau bon marché semble bon marché parce qu'il fait tranquillement moins de travail.
- Les jetons de réponse et les jetons de réflexion ont été enregistrés séparément pour chaque appel, ce qui rend les tableaux ci-dessus possibles.
high a renvoyé des jetons de réflexion 331, 538 et 347 sur trois requêtes identiques. Ainsi, une moyenne sur trois exécutions est nécessaire pour les chiffres de coût et inutile pour les chiffres d'exactitude. Au deuxième tour, où les tâches se situent à la limite de ce que les modèles peuvent faire, cette stabilité disparaît complètement, ce que nous traitons comme une constatation plutôt que comme une note de bas de page.Pourquoi les benchmarks publiés ne répondent pas à cette question
Il existe une raison documentée pour laquelle personne ne peut rechercher cela. Les chiffres de référence en circulation sont mesurés à des niveaux auxquels la plupart des flux de production ne fonctionnent pas, et les sources le disent rarement.
- Artificial Analysis, actuellement la seule source indépendante avec une ventilation complète de ce modèle, mesurée à
highthinking. La valeur par défaut de l'API estmedium. - Le propre tableau de résultats de Google pour Gemini 3.5 Flash-Lite a été produit à l'adresse
high, alors que l'API par défaut de ce modèle estminimal. L’exécution de la configuration par défaut n’est pas l’expérience décrite dans le tableau. - Dans le tableau de comparaison de Google, la ligne DeepSWE exécute Gemini 3.5 Flash sur
mediumet Gemini 3.6 Flash surhigh, donc les deux chiffres Gémeaux de cette ligne ne constituent pas une comparaison de même niveau. - Le titre de Google « jusqu'à 65% sur DeepSWE » fait référence à une réduction de l'utilisation des jetons, et non à un score. Le score DeepSWE est 49%.
Rien de tout cela ne fausse les chiffres publiés. Cela leur permet de répondre à une question différente de "qu'est-ce que cela va me coûter au niveau que je dirige réellement".
Premier tour : les niveaux sur le travail ordinaire
Trois résultats, dans l'ordre dans lequel ils comptent.
minimal signifie aucune réflexion, pas moins de réflexion. Les jetons de réflexion sont revenus exactement à zéro, pas sous la forme d'un petit nombre. Sur toutes nos exécutions minimal sur Gemini 3.6 Flash, 101 des appels 102 n'ont renvoyé précisément aucun jeton de réflexion. La seule exception est suffisamment étrange pour avoir sa propre section ci-dessous. Dans le même temps, l’exactitude est restée inchangée à neuf sur neuf et la latence médiane est passée de 5.1 seconds à 2.8 seconds. Sur cet ensemble de tâches, le niveau par défaut n'a rien acheté sauf une facture 3.8 fois plus importante et une réponse deux fois plus lente.high coûte seulement 9.3% de plus que medium ici, car le budget supplémentaire n'a en grande partie pas été dépensé : la réflexion est passée de 5,944 à 6,679 tokens. C’est un fait concernant ces neuf tâches, et non concernant le modèle. Donnez-lui un travail qui nécessite réellement plus de raisonnement et l’écart se creuse. Ne tenez pas compte de ce ratio dans vos propres prévisions.medium et 20.1% sur high. Presque toutes ces économies proviennent de la baisse du prix de sortie de $9.00 à $7.50 par million de jetons, plutôt que de l'efficacité des jetons : sur medium, nos jetons de sortie facturés ont en fait augmenté 1.7% par rapport à l'ancien modèle, et sur high, ils ont chuté 6.4%. Qu'il en soit de même pour votre trafic dépend de votre rapport entrée/sortie, puisque le prix d'entrée n'a pas changé du tout, et notre Gemini 3.5 Flash cost calculator parcourt cette arithmétique à travers des exemples concrets sur l'ancien modèle.low est adaptatif, pas un budget fixe plus petit
C'est le résultat auquel nous ne nous attendions pas, et c'est le plus directement utile sur cette page.
low, Gemini 3.6 Flash a réfléchi de manière inégale à nos trois types de tâches. Jetons de réflexion par passe :| Groupe de tâches | minimal | low | medium | high |
|---|---|---|---|---|
| Extraction structurée | 0 | 0 | 2,673 | 2,916 |
| Appel d'outil multi-tours | 0 | 549 | 1,797 | 1,914 |
| Localisation et réparation du code | 0 | 546 | 1,474 | 1,849 |
low a produit exactement zéro jeton de réflexion. Ce groupe a coûté $0.00490 avec low, contre $0.00489 avec minimal, soit deux dixièmes de point de pourcentage d’écart. Pour les appels d’outils et la réparation de code, le même niveau a consommé entre 100 et 440 jetons de réflexion par tâche.low maintient un coût proche de minimal pour la part d’extraction tout en conservant une réserve de raisonnement pour le reste. Il n’est pas nécessaire de répartir le trafic entre deux configurations pour obtenir l’essentiel des économies. Sur notre ensemble de tâches, cette combinaison a coûté 61.2% de moins que le réglage par défaut.low n’utilise jamais de jetons de réflexion pour l’extraction sans le vérifier d’abord avec nos propres prompts.Deuxième tour : là où la qualité se dégrade réellement
Le premier tour n'a pas pu répondre à la question de la qualité, car chaque configuration a obtenu une note de neuf sur neuf. Neuf tâches n'étaient pas assez difficiles pour séparer quatre niveaux. Nous les avons donc rendus plus difficiles, et la réponse qui est revenue n’était pas celle qu’impliquaient les niveaux.
minimal en a réussi 17 lors de trois tentatives sur trois : résolution de contradiction où trois chiffres sur une facture sont en désaccord et doivent être recalculés, corrélation de trois enregistrements de requêtes entrelacés en une seule chaîne d'échec, application d'une méta-règle "le document signé plus tard gagne" aux clauses contractuelles conflictuelles, conversion multi-devises et multi-périodes, un bug de clé de cache couvrant deux fonctions, et un bug de limiteur de débit qui n'apparaît qu'au troisième appel. Cela a résolu tous ces problèmes sans dépenser un seul jeton de réflexion. Les mêmes tâches coûtent entre 1,100 et 6,900 jetons de réflexion sur high.Le niveau de réflexion n’achète donc pas l’exactitude du raisonnement, du moins pas dans l’étendue occupée par ces tâches. Ce qu'il achète est quelque chose de plus restreint.
minimal, y compris une chaîne de huit étapes.Voici comment les six configurations ont marqué sur ces trois tâches, cinq tentatives chacune.
| Configuration | Tâche 1 | Tâche 2 | Tâche 3 | Total | Coût par appel |
|---|---|---|---|---|---|
3.6 Flash minimal | 1/5 | 0/5 | 1/5 | 2/15 | $0.00175 |
3.6 Flash low | 4/5 | 1/5 | 5/5 | 10/15 | $0.00553 |
3.6 Flash medium (par défaut) | 5/5 | 5/5 | 0/5 | 10/15 | $0.00674 |
3.6 Flash high | 5/5 | 2/5 | 1/5 | 8/15 | $0.00739 |
3.5 Flash-Lite minimal (par défaut) | 4/5 | 5/5 | 0/5 | 9/15 | $0.00068 |
3.5 Flash-Lite high | 2/5 | 5/5 | 3/5 | 10/15 | $0.00262 |
Le coût par appel exclut une requête anormale décrite dans la section suivante ; les totaux qui l’incluent y sont indiqués.
minimal à low. Deux sur 15 deviennent dix sur 15. Au-delà de ce point, la ligne est plate puis s'incurve : dix, dix, huit.medium pour être fiable, puis revient à deux sur cinq sur high. La tâche 3 s'exécute entièrement dans l'autre sens, avec un score de cinq sur cinq à low, zéro sur cinq à medium et un sur cinq à high. Plus de réflexion a rendu cette tâche pire, de manière constante, au cours de cinq tentatives chacune.low, les différences que nous avons mesurées sont inférieures à la variation entre des analyses identiques.minimal, 17 sur 20 ont été clairement confirmées ; une tâche marquée comme échec lors de la passe unique n’a toutefois réussi qu’une fois sur trois. C’est exactement la variation que nous décrivons.La conséquence technique est plus utile qu’une recommandation de niveau. Si votre agent doit récupérer après des états inattendus, intégrez la nouvelle tentative et la vérification dans votre application, et traitez le niveau de réflexion comme un paramètre de coût plutôt que comme un élément qui rend la récupération fiable.
Gemini 3.6 Flash low contre Gemini 3.5 Flash-Lite
Cette comparaison ne contient aucune donnée publiée que nous pourrions trouver, et c'est celle à laquelle une équipe soucieuse des coûts est réellement confrontée : pour à peu près le même prix, utilisez-vous le modèle le plus puissant avec un peu de réflexion, ou le modèle le moins cher en réfléchissant sérieusement ?
low était $0.0232 par passe ; Gemini 3.5 Flash-Lite sur high était $0.0249. Les deux ont obtenu neuf sur neuf. Gemini 3.6 Flash sur low était plus rapide, à 3.3 secondes contre 4.2 secondes de latence moyenne, et il a atteint ce score sur les jetons de réflexion 1,095 là où Flash-Lite avait besoin de 8,288.high coûtait $0.00262 par appel contre $0.00553. Sur cet ensemble de tâches, le modèle le moins cher qui réfléchissait était moins de la moitié du prix pour le même score.Laquelle de ces deux images s'applique à vous dépend de la répartition de vos tâches, et c'est la réponse honnête plutôt qu'une haie. Les deux configurations sont dans la même bande de performances sur nos deux tours. La relation de prix entre eux n’est pas stable d’un ensemble de tâches à l’autre.
Deux autres observations à partir des mêmes données, toutes deux intéressantes à connaître avant de choisir par défaut Flash-Lite.
minimal par défaut sur Flash-Lite a échoué à une tâche de manière spécifique et reproductible. Sur une chaîne de notification en trois étapes, il a appelé les deux premiers outils puis s'est arrêté sans envoyer la notification, trois fois sur trois, avec à chaque fois une signature identique. C'était la seule différence de qualité dans tous les appels 216 du premier tour. Il reproduit également une limitation documentée par Google lui-même : la valeur par défaut minimal est décrite comme inadaptée à l'utilisation de sous-agents autonomes car elle met fin prématurément aux appels d'outils. Si vous exécutez Flash-Lite en tant qu'agent, augmentez le niveau ou attendez-vous à cet échec.minimal a obtenu neuf sur 15 contre deux sur 15 pour Gemini 3.6 Flash. Lors de la chaîne de notification du premier tour, cette relation s'est inversée : Gemini 3.6 Flash sur minimal a réussi trois fois sur trois alors que Flash-Lite a échoué trois fois sur trois. Il n'y a pas d'ordre ici, seulement deux formes de défaillance différentes, et un niveau qui est sûr pour le trafic d'un modèle ne l'est pas automatiquement pour celui de l'autre.Une anomalie que nous ne pouvons pas expliquer
minimal a renvoyé des jetons de réflexion 62,916.minimal dans nos données ont renvoyé exactement zéro. Celui-ci a utilisé cinq tours d'outil, a produit une sortie proche du plafond de sortie 65,536-token du modèle, a pris 209 secondes et a coûté $0.48. C'est à peu près 270 fois ce que l'autre appelle à ce niveau, et presque tout le $0.50 que cette configuration a dépensé tout au long de son cycle 15-call. C'était aussi la seule fois où minimal réussissait cette tâche particulière.minimal. Nous n’allons pas proposer de mécanisme, car nous n’en avons pas. La fiche modèle de Google répertorie les réponses lentes occasionnelles parmi les limitations connues du modèle, mais nous ne pouvons pas relier cette note à cette observation avec certitude.minimal sur un travail d'appel d'outil, définissez une limite maximale de jeton de sortie et un délai d'attente. Un niveau qui ne dépense normalement aucun jeton de réflexion n’est pas la même chose qu’un niveau qui ne peut pas en dépenser.Quel niveau pour quelle tâche
Voici le tableau à retenir. Chaque ligne s’appuie sur les deux tours décrits ci-dessus ; les limites de ces résultats sont précisées ensuite.
| Type de travail | Niveau | Pourquoi |
|---|---|---|
| Extraction, classification, réponse aux questions, localisation et réparation du code en un seul tour | minimal | 17 de 20 tâches volontairement difficiles réussies trois fois sur trois, à 26 % du coût par défaut |
| Appels d'outils en plusieurs étapes qui n'ont qu'à suivre le plan, ou à refuser une action | minimal suffit | Une chaîne en huit étapes, trouver l'exception dans un lot, refuser une demande non conforme aux règles et choisir la source de données faisant autorité, a été réussie trois fois sur trois. |
| Appels d’outils en plusieurs étapes où le modèle peut avoir besoin d’une action absente du plan : nouvelle tentative, retour en arrière ou interception préventive | low au minimum | minimal a obtenu 2/15 précisément sur ces tâches ; low a obtenu 10/15 |
| Le même cas, mais avec une exigence de fiabilité | Aucun niveau ne résout ce problème | low, medium et high ont obtenu 10, 10 et 8 sur 15. Les écarts sont inférieurs à la variation d’une exécution à l’autre. Gérez ce risque par des nouvelles tentatives et une vérification dans l’application |
| Trafic mixte sous une seule configuration | low | Il a consommé zéro jeton de réflexion sur nos tâches d’extraction tout en conservant une réserve pour le reste, à un coût inférieur de 61.2% au réglage par défaut |
| Vous ne connaissez pas encore votre mix | medium, puis mesurez | La valeur par défaut est un point de départ judicieux. Cela ne coûte cher que lorsque vous savez que ce n'est pas nécessaire |
medium, le test indépendant d’aibenchy a mesuré 66.2% de plus, contre 2.0% de plus dans notre test. Leurs 22 courtes questions de benchmark et nos tâches d’extraction, d’appel d’outils et de code ont donné des réponses opposées à la même question. Il ne s’agit pas d’un différend à trancher, mais du constat central : l’économie de jetons dépend de la charge de travail, pas seulement du modèle.Mesurer cela sur votre propre trafic
Quatre étapes, dans l'ordre qui vous permet d'obtenir une réponse le plus rapidement possible.
-
** Enregistrez les jetons de réflexion séparément aujourd'hui, avant de modifier quoi que ce soit. ** L'API de Google renvoie le nombre dans
total_thought_tokens, à côté du niveau que vous avez défini. Si vous ne suivez que le total des jetons de production, vous ne pouvez pas constater une régression rapide à partir d'un niveau qui a décidé de réfléchir plus sérieusement cette semaine.from google import genai from google.genai import types client = genai.Client() # reads the API key from the environment response = client.models.generate_content( model="gemini-3.6-flash", contents=prompt, config=types.GenerateContentConfig( thinking_config=types.ThinkingConfig(thinking_level="minimal"), ), ) log.info( "level=minimal thinking_tokens=%s", response.usage_metadata.total_thought_tokens, )
medium. Une valeur par défaut héritée est une décision coûteuse que personne n'a prise. Cela signifie également que votre facture peut évoluer en cas de défaut.
3. Rejouez une journée de trafic réel sur minimal et sur low, et comparez les résultats à vos résultats actuels plutôt qu'à un benchmark. Sur nos tâches, cette comparaison valait entre 61% et 74% de la facture, ce qui représente un effet plus important que n'importe quel échange de modèle disponible dans ce niveau.
4. Notez les chemins d'appel d'outils séparément de tout le reste. C'est le seul endroit où nous avons trouvé l'exactitude du changement de niveau, et la moyenne avec le trafic d'extraction le masquera.Effectuer cette comparaison sur plusieurs modèles signifie généralement une intégration distincte par fournisseur, et ce coût d'intégration est la raison la plus courante pour laquelle les équipes ignorent complètement la mesure. La normalisation sur un point de terminaison compatible OpenAI le supprime, de sorte que la chaîne de modèle devient la seule chose qui change entre les exécutions.
import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.evolink.ai/v1",
api_key=os.environ["EVOLINK_API_KEY"],
)
for model in ("gemini-3.6-flash", "gemini-3.5-flash-lite"):
response = client.chat.completions.create(model=model, messages=messages)
record(model, response.usage)FAQ
medium. Les valeurs sélectionnables sont minimal, low, medium et high. Gemini 3.5 Flash-Lite est par défaut minimal, de sorte que les deux modèles se comportent très différemment dès la sortie de la boîte.minimal est le paramètre le plus bas disponible, et la documentation de Google décrit la réflexion comme activée par défaut pour ce modèle plutôt que comme quelque chose que vous désactivez. En pratique, minimal n'a renvoyé exactement aucun jeton de réflexion sur 101 de nos appels 102, il se comporte donc comme étant désactivé à des fins de facturation pour la plupart des requêtes. La seule exception est documentée ci-dessus, c’est pourquoi nous ne la décrirons pas comme une garantie.minimal est-il moins cher que la valeur par défaut ?
Sur notre ensemble de neuf tâches, minimal a coûté 73.6 % de moins par passage, avec la même exactitude de neuf sur neuf et environ deux fois moins de latence. Votre ratio dépendra du nombre de jetons de réflexion que votre charge de travail provoque avec medium : considérez ce chiffre comme une raison de mesurer, pas comme une prévision.minimal à low a produit une nette progression, de deux à dix réussites sur 15. Au-dessus de low, les scores ont été de dix, dix et huit sur 15, et une tâche a même obtenu de moins bons résultats aux niveaux supérieurs sur cinq tentatives chacun. Pour les tâches de raisonnement en un seul tour, minimal a résolu 17 problèmes difficiles sur 20 sans aucun jeton de réflexion.high, et le tableau de résultats Flash-Lite de Google a également été produit sur high alors que l'API par défaut de ce modèle est minimal. Si vous exécutez les valeurs par défaut, vous n'exécutez pas la configuration décrite par ces numéros.total_thought_tokens à partir de la réponse. Enregistrez-le comme son propre champ à côté des jetons de sortie plutôt que de les additionner, sinon vous ne pourrez pas attribuer de changement de coût plus tard.Sources
- Documentation de réflexion Gemini, Google, pour les valeurs
thinking_level, les valeurs par défaut par modèle, la déclaration selon laquelle le prix de réponse additionne les jetons de sortie et de réflexion, et le champtotal_thought_tokens - Documentation des modèles d'API Gemini, Google
- Tarifs de l'API Gemini, Google
- Présentation de Gemini 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber, Google, 2026-07-21
- Gemini 3.6 Flash, Google DeepMind, pour les limitations documentées du modèle
- Gemini 3.6 Flash et Gemini 3.5 Flash-Lite : réduction de moitié du temps par tâche, Artificial Analysis, 2026-07-21
- aibenchy, test indépendant 22-question, 2026-07-21
- EvoLink mesure de première partie, 2026-07-21 : 406 appels sur deux tours, avec enregistrements par appel conservés


