
Grok 4.6 vs Grok 4.5 : le post-entraînement justifie-t-il une migration ?
Grok 4.6 n’est pas encore une amélioration démontrée de Grok 4.5. Les informations publiques mettent surtout en avant un apprentissage supervisé et un apprentissage par renforcement plus poussés. Cela pourrait améliorer la fiabilité du raisonnement sans exiger un modèle plus grand, mais ne justifie une migration qu’après la sortie de Grok 4.6 et des tests de production comparables.
Pour les utilisateurs d’EvoLink, la bonne approche consiste à conserver Grok 4.5 comme référence mesurable, à préparer une évaluation directe et à ne migrer que les charges de travail où Grok 4.6 améliore les résultats acceptés sans dégrader la latence, la fiabilité des outils ni le coût.
Résumé de la décision
| Votre situation | Meilleure décision maintenant | Pourquoi |
|---|---|---|
| Grok 4.5 est stable et atteint les objectifs d'acceptation | Gardez-le comme référence | Grok 4.6 n'a pas de comportement d'API vérifié ni de résultats correspondants |
| Les tâches de codage ou d'agent échouent en raison d'une mauvaise planification ou d'une dérive des instructions | Testez Grok 4.6 d'abord après sa sortie | Un meilleur post-entraînement devrait apparaître le plus clairement dans ces traces |
| Vous avez besoin d’un modèle de production avant que Grok 4.6 soit accessible | Utiliser une route actuelle vérifiée | Une date estimée ne doit pas bloquer un lancement engagé |
| Votre charge de travail est très sensible aux coûts | Attendez les prix et l'utilisation mesurée des jetons | Les conditions commerciales de Grok 4.6 sont inconnues |
| Vous manquez de données de replay, d’observabilité ou de solution de secours | Ne migrez pas encore | Vous ne pouvez pas distinguer un gain réel du bruit du déploiement |
| Grok 4.6 respecte les critères de qualité, fiabilité, latence et coût | Étendre par charge de travail | Une route sélective est plus sûre qu’un remplacement global immédiat |
Grok 4.6 vs Grok 4.5 : que sait-on réellement ?
La comparaison est asymétrique. Grok 4.5 dispose d’une page officielle, d’un identifiant API, d’une tarification, d’une fenêtre de contexte et de résultats publiés par xAI. Pour Grok 4.6, nous n’avons actuellement qu’une estimation de sortie donnée par la direction et des informations contradictoires dans la presse.
| Critère | Grok 4.5 | Grok 4.6 |
|---|---|---|
| Statut public | Publié et documenté | Attendu, pas encore documenté comme publié |
| ID du modèle d'API xAI | grok-4.5 | Non publié |
| Fenêtre contextuelle | 500 000 jetons | Non publié |
| Prix d'entrée | 2 $ par million de jetons | Non publié |
| Prix de sortie | 6 $ par million de jetons | Non publié |
| Contrôle du raisonnement | Configurable | Non publié |
| Positionnement officiel | Codage, tâches agents et travail de connaissances | Non publié |
| Benchmarks officiels | Résultats xAI disponibles | Aucun publié |
| Changement signalé | Référence actuelle | SFT et RL plus forts |
| Nombre de paramètres | Non précisé dans le catalogue officiel actuel | Informations de presse contradictoires |
| Route EvoLink | Aucune route dédiée n’est vérifiée dans cet article | Non vérifié |
La bonne conclusion n’est pas que Grok 4.6 a déjà gagné. L’amélioration annoncée cible un problème réel en production, mais les preuves nécessaires pour valider cette amélioration n’existent pas encore.
Le principal point de comparaison : le post-entraînement, pas le nombre de paramètres
Les premiers articles sur Grok 4.6 se concentraient surtout sur la taille du modèle. C’est une base fragile pour cette comparaison, car les informations publiques se contredisent et xAI n’a publié aucune fiche modèle.
Le point de comparaison le plus utile est l’investissement annoncé dans le réglage fin supervisé et l’apprentissage par renforcement :
- Le réglage fin supervisé (SFT) entraîne un modèle à partir d’exemples sélectionnés du comportement attendu.
- L’apprentissage par renforcement (RL) optimise le comportement à partir de récompenses, d’évaluations ou d’autres signaux de retour.
Pour un utilisateur final, ces termes d’entraînement n’ont d’importance que s’ils modifient les résultats observables. Une amélioration du post-entraînement devrait réduire les erreurs aux points de décision où un agent planifie, respecte les contraintes, choisit ses outils, se remet d’un échec ou décide de s’arrêter.
Cela crée une hypothèse plus claire de mise à niveau de Grok 4.6 :
Grok 4.6 mérite d’être adopté si un meilleur post-entraînement augmente la fiabilité des tâches acceptées ou réduit suffisamment les nouvelles tentatives pour améliorer le résultat en production.
Il s’agit d’une règle de décision plus forte que la comparaison du nombre de paramètres, car elle relie le changement revendiqué à quelque chose qu’une équipe peut mesurer.
Ce que Grok 4.5 offre déjà
Grok 4.5 n'est pas une base de référence vide. xAI le positionne comme son modèle phare pour le codage, les tâches agentiques et le travail de connaissances.
- ID de modèle
grok-4.5; - une fenêtre contextuelle de 500 000 jetons ;
- 2 $ par million de jetons d'entrée et 6 $ par million de jetons de sortie ;
- raisonnement configurable ;
- une date limite de connaissance le 1er février 2026.
xAI rapporte également que Grok 4.5 fonctionne à 80 jetons par seconde et publie les résultats de tests d'ingénierie, notamment DeepSWE, SWE Marathon, Terminal Bench 2.1 et SWE Bench Pro. Ce sont des résultats rapportés par le fournisseur. Ils établissent des affirmations testables et une référence actuelle, et non un classement universel entre les charges de travail de production.
| Évaluation rapportée par xAI | Résultat Grok 4.5 | Ce que l’évaluation peut signaler | Ce qu'il ne peut établir |
|---|---|---|---|
| DeepSWE 1.0 | 62,0% | Performance sur les tâches d’agents d’ingénierie logicielle dans ce protocole d’évaluation | Réussite sur un dépôt privé avec d’autres outils et instructions |
| DeepSWE 1.1 | 53,0% | Sensibilité à une version plus récente du jeu de tâches d’ingénierie | La capacité éventuelle d’un benchmark unique à remplacer un rejeu de production |
| SWE Marathon pass@1 | 29,0% | Performances dès la première tentative sur des tâches logicielles plus longues | Coût des nouvelles tentatives, examen humain ou sécurité des effets secondaires dans le système de l'équipe |
| Terminal Bench 2.1 | 83,3% | Capacité à fonctionner dans des environnements de tâches orientés terminal | Fiabilité avec les autorisations, le bac à sable et les contrats d'outils de l'équipe |
| SWE Bench Pro | 64,7% | Résolution des problèmes au niveau du référentiel dans le cadre de la configuration de référence | Latence, capacité régionale ou acceptation sur code propriétaire |
xAI rapporte en outre 80 jetons de sortie par seconde et une moyenne de 15 954 jetons de sortie sur SWE Bench Pro pour Grok 4.5. Ces chiffres constituent des affirmations de base utiles, mais ils ne doivent pas être mélangés à un classement universel de vitesse ou de coût : le débit des jetons, la durée de la tâche et le coût du résultat accepté mesurent différentes choses.
L’écart entre les benchmarks est lui-même instructif. Un résultat de 62,0 % sur une version de DeepSWE et de 53 % sur une autre montre pourquoi « mieux coder » est un critère de migration trop vague. Comparez les versions 4.5 et 4.6 avec le même protocole, la même répartition des tâches, les mêmes autorisations d’outils et le même système de notation.
L'avantage pratique de Grok 4.5 est la maturité des preuves. Les équipes peuvent appeler un modèle nommé, observer l'utilisation, tarifer une demande et créer une référence de régression dès aujourd'hui.
Ce que Grok 4.6 doit améliorer pour justifier une mise à niveau
La mise à niveau doit être jugée sur les résultats de la production, et non sur la question de savoir si quelques réponses semblent plus impressionnantes.
| Critère de mise à niveau | Mesure | Résultat attendu de Grok 4.6 |
|---|---|---|
| Qualité des résultats acceptés | Taux de réussite selon les contrôles d’acceptation réels | Davantage de tâches acceptées sans régression cachée |
| Respect des instructions | Violations de contraintes et invites de réparation | Moins d'exigences manquées sur les tâches longues |
| Fiabilité des outils | Appels invalides, mauvais outils, appels répétés, récupération | Meilleure réalisation avec moins de pannes d'outils |
| Efficacité du raisonnement | Tours, jetons de sortie, boucles, tentatives | Moins de travail par résultat accepté |
| Latence | p50, p95 et délai jusqu’à l’obtention d’un résultat accepté | Un profil de latence compatible avec le produit |
| Coût | Modèle, outils, tentatives, solution de secours et révision | Coût inférieur ou justifié par tâche acceptée |
| Stabilité de la route | Erreurs, limitations, identité et capacité | Comportement prévisible sous un trafic représentatif |
| Compatibilité | Champs de requête, sortie structurée et outils | Pas de régression d'intégration bloquante |
cost per accepted task =
model usage + tool usage + retries + fallback + review cost
divided by accepted tasksUn modèle peut coûter plus cher par jeton et rester moins cher s'il se termine en moins de tentatives. Cela peut également paraître moins cher tout en augmentant le travail de révision et de nouvelle tentative.
Les interfaces et comportements à retester
Même si Grok 4.6 produit de meilleures réponses, il ne s'agit pas d'une mise à niveau immédiate jusqu'à ce que les contrats de demande et de réponse soient passés. La documentation actuelle de Grok 4.5 crée une base de référence concrète :
| Base de référence Grok 4.5 | Risque migratoire | Test 4.6 apparié |
|---|---|---|
reasoning_effort accepte les valeurs faibles, moyennes et élevées ; high est la valeur par défaut documentée | Une valeur par défaut modifiée peut déplacer la latence et l'utilisation des jetons | Épinglez chaque niveau d'effort et comparez les résultats acceptés, l'utilisation et p95 |
| Le raisonnement ne peut pas être désactivé | Un chemin à faible latence peut se comporter différemment d'un modèle sans raisonnement | Vérifiez l'effort minimum, le délai d'obtention du premier jeton et le temps d'exécution total |
presencePenalty, frequencyPenalty et stop ne sont pas pris en charge avec les modèles de raisonnement | Un générateur de requêtes partagées peut échouer avant la génération | Envoyer la forme exacte de la demande de production et enregistrer les erreurs de validation |
L'utilisation inclut reasoning_tokens | Les champs manquants peuvent interrompre l'attribution des coûts | Réconcilier l'utilisation de l'API avec la mesure interne |
| Le contenu de raisonnement crypté peut être utilisé lors de conversations ultérieures. | Le comportement multi-tours peut régresser si l'état est omis ou remodelé | Rejouez une conversation à plusieurs tours avec le flux d'inclusion et de retour documenté |
| Des outils de recherche/code intégrés et des appels de fonctions personnalisés sont disponibles | La qualité du texte ne prédit pas la sélection des outils ou la qualité des arguments | Testez chaque outil de production, y compris la récupération des délais d'attente et des erreurs. |
| Les sorties structurées peuvent suivre le schéma JSON, tandis que certains mots-clés nécessitent un meilleur effort | Une réponse syntaxiquement valide peut toujours violer les contraintes métier | Validez les schémas en dehors du modèle et comparez les échecs au niveau du champ |
Les préfixes répétés peuvent utiliser la mise en cache des invites ; xAI recommande x-grok-conv-id | Le comportement du cache peut fausser les comparaisons de latence froide/chaud et de coûts | Exécuter des cohortes distinctes de cache froid et de cache chaud |
Une comparaison valide doit conserver tout le contexte d’exécution : modèle demandé, modèle renvoyé, champs de requête, niveau de raisonnement, état du cache, données d’usage, trace des outils et résultat de validation. Sans ces dimensions, un gain de qualité peut masquer une régression d’intégration.
Quelles charges de travail devraient tester Grok 4.6 en premier ?
Commencez par un travail où Grok 4.5 expose déjà un problème mesurable. Cela rend le test sensible au changement signalé.
Testez Grok 4.6 en premier
- des agents de codage en plusieurs étapes qui perdent leurs contraintes au milieu d'une tâche ;
- les modifications du référentiel qui nécessitent une planification sur plusieurs fichiers ;
- workflows d'outils avec appels invalides répétés ou récupération faible ;
- analyse technique où Grok 4.5 nécessite plusieurs invites de réparation ;
- tâches longues avec une utilisation élevée de jetons causées par des boucles de raisonnement improductives.
Conservez d’abord Grok 4.5
- tâches stables et à volume élevé avec des taux d'acceptation élevés ;
- des chemins sensibles à la latence qui répondent déjà aux exigences de qualité ;
- charges de travail adaptées au comportement connu de Grok 4.5 ;
- flux réglementés ou à haut risque sans examen complet ;
- tout système dépourvu d’une solution de secours testée.
L'objectif n'est pas d'acheminer chaque requête vers le modèle le plus récent. Il s’agit d’identifier les charges de travail pour lesquelles le nouveau modèle mérite réellement du trafic.
Un plan sûr pour évaluer la migration de Grok 4.5 vers Grok 4.6

1. Vérifiez l'identité du modèle et les conditions commerciales
Avant de tester la qualité, confirmez l'enregistrement officiel du modèle, l'ID du modèle de demande, le modèle renvoyé, le prix, la région, le contexte et le comportement de demande pris en charge. Un identifiant deviné n’est pas une cible d’évaluation.
2. Créez un jeu de rejeu comparatif
Utilisez 20 à 50 tâches de production représentatives pour la première décision. Incluez :
- tâches Grok 4.5 réussies ;
- des succès coûteux ou lents ;
- tâches nécessitant de nombreuses nouvelles tentatives ;
- échecs connus;
- les cas critiques pour la sécurité ou irréversibles qui doivent rester hors ligne.
Exécutez les deux modèles avec les mêmes entrées de tâches, outils, autorisations, délais d'attente et contrôles d'acceptation.
Commencez avec 40 traces représentatives, pas une poignée d'invites de présentation. Une composition pratique est la suivante :
| Groupe de traces | Nombre | Pourquoi l’inclure |
|---|---|---|
| Succès connus de Grok 4.5 | 10 | Détecter les régressions sur des travaux déjà fiables |
| Échecs connus de Grok 4.5 | 10 | Vérifier si le changement de post-entraînement annoncé corrige de réelles faiblesses |
| Séquences d'outils en plusieurs étapes | 8 | Mesurez le choix des outils, les arguments, la récupération et les actions en double |
| Tâches à sortie structurée | 6 | Régressions du schéma de capture et de l'analyseur en aval |
| Tâches à contexte long ou sensibles au cache | 4 | Séparer la gestion du contexte des effets de latence froid/chaud |
| Cas de sécurité ou d’effets secondaires externes | 2 | Maintenir les comportements irréversibles hors ligne jusqu'à ce qu'ils soient explicitement approuvés |
Cette distribution est un modèle de départ et non une référence universelle. Pondérer l'ensemble final en fonction du volume de production et de l'impact commercial ; sinon, de rares échecs critiques disparaissent derrière des tâches courantes et faciles.
3. Évaluer les critères bloquants avant les préférences
L’exactitude, la sécurité des outils, la validité des schémas et les régressions critiques doivent être des critères obligatoires. Les préférences de style et les faibles écarts de latence viennent ensuite.
Ne laissez pas un score moyen plus élevé cacher une augmentation des échecs graves.
Une grille de décision peut par exemple prendre la forme suivante :
| Critère bloquant | Exemple de règle de décision | Pourquoi le vérifier d’abord |
|---|---|---|
| Erreur irréversible ou sensible à la sécurité | Zéro nouvelle panne critique | Une action sévère peut l’emporter sur de nombreuses réponses plus jolies |
| Schéma requis | Atteindre ou dépasser le taux de réussite de Grok 4.5 et le SLO de l'application | Une sortie invalide peut interrompre le système suivant même lorsque le contenu est correct |
| Exécution de l'outil | Aucune augmentation du taux d'outils erronés, d'arguments invalides ou d'effets secondaires en double | La fiabilité de l'agent est une propriété d'exécution, pas un score de prose |
| Résultat accepté | Amélioration sur la cohorte d’échecs ciblée, sans régression significative sur les succès connus | Prouve que la mise à niveau corrige la raison pour laquelle elle a été testée |
| Latence | Rester à l'intérieur du SLO p95 existant du produit | Un seuil de pourcentage générique ignore l'expérience utilisateur réelle |
| Coût | Rester dans la limite de coût acceptée par l’équipe pour chaque résultat réussi | Le prix du jeton seul ne tient pas compte des nouvelles tentatives, des outils ni de la révision |
Les seuils exacts doivent provenir du SLO et du modèle de risque du produit. L’essentiel est de décider les critères critiques avant de calculer un score de préférence global.
4. Lancer un test canary limité
Après les tests de rejeu hors ligne, envoyez une petite part de charge de travail réversible à Grok 4.6. Commencez par la catégorie de tâches pour laquelle le modèle a montré l’avantage mesuré le plus net.
Journal :
- modèle demandé et retourné ;
- jetons et appels d'outils ;
- événements de nouvelle tentative et de repli ;
- latence ;
- échecs de validation ;
- acceptation humaine ou automatisée.
5. Étendez progressivement par charge de travail
Ne faites de Grok 4.6 la route par défaut que pour les catégories de tâches où il respecte les critères convenus. Conservez Grok 4.5 comme solution de secours jusqu’à ce que la nouvelle route reste stable en conditions normales et de pointe.
Pour les agents susceptibles de créer des effets secondaires externes, utilisez des points de contrôle idempotents. Ne basculez pas après une action partielle à moins que le système puisse prouver que la répétition de l'étape est sûre.
Une stratégie de routage plus sûre qu’un remplacement global de Grok 4.5
Une mise à niveau de version ne doit pas nécessairement prendre la forme d’un basculement global. Une politique progressive peut conserver la route connue tout en collectant de meilleures preuves :
- Grok 4.5 reste la version stable par défaut pour les charges de travail respectant déjà leur SLO.
- Grok 4.6 s'exécute en mode shadow ou en replay hors ligne où l'exécution en double n'a aucun effet secondaire externe.
- Grok 4.6 reçoit en premier la cohorte d'échec, les classes de tâches dans lesquelles 4.5 présente des problèmes mesurables d'instruction, d'outil ou de raisonnement.
- Grok 4.5 reste la solution de repli explicite en cas de pannes spécifiques à la capacité ou au modèle, mais seulement avant le début d'une action irréversible de l'outil.
- Modifications du routage par défaut par charge de travail une fois que le nouveau modèle a dépassé la fenêtre d'observation convenue.
Comment accéder à Grok 4.6 via EvoLink
Grok 4.6 n’est actuellement pas une route EvoLink vérifiée. EvoLink ne devrait ajouter un accès public qu’après que xAI a exposé un modèle utilisable via l’API et qu’EvoLink a vérifié :
- identité exacte du modèle ;
- compatibilité de la route et des requêtes ;
- prix approuvé ;
- raisonnement pris en charge et comportement de l'outil ;
- requêtes de bout en bout réussies ;
- solution de repli en production et observabilité.
Une fois ces contrôles réussis, l'avantage d'une passerelle unifiée est que les équipes peuvent évaluer Grok 4.6 sans coupler la logique de l'application à une route spécifique au fournisseur. La sélection du modèle peut rester configurable tandis que l'utilisation, les erreurs et les décisions de secours restent observables.
En attendant, cette section décrit un plan d’accès et non une disponibilité effective.
Et si vous ne pouvez pas attendre Grok 4.6 ?
Si une équipe doit déployer immédiatement, elle doit choisir un modèle déjà accessible et vérifiable plutôt que de bloquer son lancement sur une date estimée de Grok 4.6.
Tarification et accès API : pourquoi la comparaison est incomplète
Grok 4.5 a documenté les prix et le comportement de l'API. Grok 4.6 ne le fait pas.
Une conclusion fiable sur les coûts est impossible aujourd’hui. Les équipes peuvent préparer la formule d’évaluation et les champs de journalisation, mais pas affirmer sérieusement que Grok 4.6 est moins cher, plus cher, plus rapide ou plus efficace.
Prenons par exemple un lot hypothétique de rejeu avec Grok 4.5 utilisant 1 million de jetons d’entrée et 300 000 jetons de sortie. Aux tarifs documentés de xAI :
model usage = (1.0 × $2) + (0.3 × $6) = $3.80Si ce lot contient 20 tâches et que 16 passent les critères d’acceptation, le coût direct du modèle est d’environ 0,24 $ par tâche acceptée :
$3.80 ÷ 16 accepted tasks = $0.2375Il ne s'agit pas d'un devis EvoLink ni d'une prévision Grok 4.6. L'exemple exclut les frais d'outil, les tentatives, le repli, les effets de cache et le travail de révision ; son but est de montrer le dénominateur. Si Grok 4.6 coûte plus cher par jeton généré mais augmente le nombre de tâches acceptées de 16 à 19 avec moins de tentatives, il s'agit peut-être toujours de la voie la plus efficace ; si l’acceptation reste stable, la prime est plus difficile à justifier.
Lorsque Grok 4.6 devient utilisable via l’API, comparez :
- prix du fournisseur et de la passerelle pour la route exacte ;
- effets au niveau du raisonnement sur les jetons de sortie ;
- comportement de cache d'invite s'il est pris en charge ;
- frais d'outils ;
- tentatives et repli ;
- temps d'examen humain ;
- tâches acceptées par dollar.
Conservez les prix exacts et à jour sur les pages de modèle ou de tarification dès qu’une route vérifiée existe. La page de comparaison doit expliquer la décision, pas dupliquer un module tarifaire susceptible de devenir obsolète.
Verdict : devriez-vous effectuer une mise à niveau ?
Préparez-vous à tester Grok 4.6, mais ne prévoyez pas de migration aveugle.Grok 4.5 reste le seul côté mesurable de la comparaison. Grok 4.6 devient la meilleure voie lorsqu'il offre une amélioration significative des propres traces défaillantes ou coûteuses de l'équipe et franchit les mêmes critères d'exactitude, d'outil, de latence, de fiabilité et de coût.
L’opportunité sera probablement sélective plutôt qu’universelle. Si les améliorations de post-entraînement annoncées sont réelles, Grok 4.6 devrait d’abord recevoir le trafic des tâches de programmation et d’agents exigeantes en raisonnement. Les charges stables de Grok 4.5 peuvent rester en place jusqu’à ce que les données justifient leur remplacement.
C’est le bon standard pour une mise à niveau en production : une nouvelle version gagne du trafic grâce à des résultats mesurés, et non grâce à son numéro de version.
FAQ
Grok 4.6 est-il meilleur que Grok 4.5 ?
Ce n’est pas encore prouvé. Les rapports publics indiquent un réglage fin supervisé et un apprentissage par renforcement plus forts, mais xAI n'a pas publié de résultats correspondants pour Grok 4.5 et Grok 4.6.
Quelle est la plus grande amélioration attendue de Grok 4.6 ?
Le changement le plus important annoncé est l’amélioration du post-entraînement. Si elle se confirme, le bénéfice devrait apparaître dans le respect des instructions, la fiabilité des outils, la reprise après échec et l’efficacité du raisonnement.
Grok 4.6 et Grok 4.5 sont-ils tous deux des modèles 1,5T ?
Cela n'est pas officiellement confirmé. Les rapports secondaires sont en conflit sur le nombre de paramètres de Grok 4.6, et le catalogue de modèles xAI actuel ne publie pas le nombre de paramètres pour cette comparaison.
Grok 4.6 est-il disponible via une API ?
Pas selon le catalogue de modèles public et les notes de version de xAI en date du 30 juillet 2026. L'ID de modèle, le prix et la portée d'accès n'ont pas été publiés.
Grok 4.6 coûtera-t-il le même prix que Grok 4.5 ?
Inconnu. Grok 4.5 est au prix de 2 $ par million de jetons d'entrée et de 6 $ par million de jetons de sortie via xAI. Ces taux ne devraient pas être attribués à Grok 4.6.
Grok 4.6 sera-t-il disponible via EvoLink ?
EvoLink peut préparer sa prise en charge après que xAI a exposé une route utilisable via l’API. La disponibilité ne doit être annoncée qu’après vérification par EvoLink de l’identité du modèle, du prix, du comportement des requêtes et d’un appel de bout en bout réussi.
Les charges de travail Grok 4.5 existantes doivent-elles être mises à niveau immédiatement ?
Non. Rejouez des traces représentatives, appliquez des contrôles stricts de qualité et de fiabilité, lancez un test canary limité, puis n’élargissez que les charges de travail pour lesquelles Grok 4.6 apporte un avantage mesurable.
Que devraient utiliser les équipes si elles ne peuvent pas attendre ?
Sources
- Elon Musk : estimation de la version Grok 4.6
- Catalogue de modèles xAI
- Notes de version de l'API xAI
- xAI : Présentation de Grok 4.5
- Documentation des modèles de raisonnement xAI
- Présentation des outils xAI
- Documentation des sorties structurées xAI
- Documentation de mise en cache des invites xAI
- NewsBytes : rapports Grok 4.6 et Grok 4.7
- IT之家 : rapport chronologique Grok 4.6 du 24 juillet


