Cursus
La plupart des lecteurs connaissent encore le labo derrière Grok sous le nom xAI. SpaceXAI a publié Grok 4.6 le 12 août 2026, un peu plus d'un mois après Grok 4.5, avec un accent sur le code, le web visuel et des tâches d'agent plus longues.
Les données de lancement ne soutiennent pas un classement simple. Grok mène sur certains tests sélectionnés par SpaceXAI, tandis que GPT-5.6 Sol et Claude Fable 5 dominent d'autres. Artificial Analysis place Grok au niveau de Sol avec un prix moyen plus bas, mais la mise à niveau commence aussi à répondre plus tard et coûte plus par tâche mesurée que Grok 4.5.
Cet article suit ces arbitrages à travers les spécifications du modèle, les tarifs, l'accès et des comparaisons directes avec Sol et Claude. Notre dossier sur Grok 4.5 mettait l'accent sur une faible consommation de jetons. Ici, la question est de savoir si un score plus élevé change vraiment la facture une fois l'entrée mise en cache, les jetons de raisonnements et la sortie supplémentaire pris en compte.
En bref : Grok 4.6
En court, le gain de cinq points compte moins, isolément, que ne le laisse entendre la page de lancement. Le comportement tarifaire et le type de tâche décident si cela change le choix du modèle.
-
Au niveau d'effort
high, Grok 4.6 obtient 61 à l'Artificial Analysis Intelligence Index, égal à Sol enmaxet à deux points d'Opus 5 enmax. -
Les tarifs de base entrée/sortie restent à 2 $ et 6 $ par million de jetons, mais l'entrée mise en cache, le délai avant le premier jeton de réponse et le coût par tâche mesuré augmentent par rapport à Grok 4.5.
-
Sur AA-Briefcase, Grok a utilisé moins d'échanges et de jetons d'entrée qu'Opus 5 ; Sol mène les tests terminal, tandis que Sonnet 5 offre deux fois plus de contexte sans surtaxe pour longues invites.
Les comparaisons ci-dessous séparent les affirmations des fournisseurs des résultats d'Artificial Analysis. C'est important car un modèle peut changer de position si le niveau d'effort ou le protocole de test change.
Vous souhaitez vous lancer dans l'IA générative ?
Apprenez à travailler avec des LLM en Python directement dans votre navigateur

Qu'est-ce que Grok 4.6 ?
Grok 4.6 est le modèle de raisonnement propriétaire de SpaceXAI. L'API et Cursor n'exposent pas la même limite de contexte, et le tarif à long contexte plus élevé s'applique bien avant la limite API. Le tableau met ces contraintes en regard des types d'entrée, outils et de la date de coupure des connaissances.
|
Spécification |
Grok 4.6 |
|
500 000 jetons (API) ; 256 000 jetons dans Cursor |
|
|
Entrée / sortie |
Texte et images en entrée ; texte en sortie |
|
Effort de raisonnement |
Low, medium, high (par défaut), xhigh |
|
Date de coupure des connaissances |
1er février 2026 |
|
Outils |
Function calling, recherche web, recherche X, exécution de code, recherche dans des collections (RAG), MCP distant |
|
Tarification standard |
2 $ / million de jetons d'entrée, 0,50 $ en cache, 6 $ / million en sortie |
|
Tarification long contexte |
4 $ / 1 $ / 12 $ dès qu'une invite atteint 200 000 jetons, appliqués à toute la requête |
SpaceXAI ne publie toujours pas de nombre de paramètres pour ces modèles. Le chiffre de 1,5 billion présent dans certains rapports ne vient pas de SpaceXAI et n'est donc pas une spécification confirmée.
Quoi de neuf dans Grok 4.6 ?
SpaceXAI indique qu'il ne s'agit pas d'un nouveau modèle entraîné à partir de zéro. Il s'agit plutôt d'un entrainement supplémentaire de Grok 4.5, avec un focus sur les tâches d'agents IA. Les changements annoncés concernent des exécutions d'agents plus longues, des créations visuelles et le post-entrainement.
Des tâches d'agent plus longues
SpaceXAI affirme que Grok 4.6 reste sur la bonne voie lors de longues tâches à plusieurs étapes, comme la recherche, le travail sur une base de code et la création d'une application. Le modèle vérifierait plus souvent son travail au lieu de tout faire en un seul passage.
Cela correspond à une évolution plus large des tests de modèles. Une bonne première réponse compte moins si le modèle oublie des décisions antérieures après plusieurs appels d'outils. Les tests internes de GitHub ont également constaté que Grok 4.6 maintenait son raisonnement et l'usage d'outils sur des tâches plus longues.
L'API propose des fonctions liées à cette promesse. Grok 4.6 peut diffuser des résumés de raisonnement, ce que Grok 4.5 n'expose pas, et xAI recommande la compaction de contexte avec une prompt_cache_key persistante pour de longues boucles d'agent. La compaction résume l'historique en un élément, mais consomme tout de même des jetons, et la requête doit tenir dans la fenêtre de contexte avant que la compaction ne s'applique.
Développement web visuel et interactif
SpaceXAI et Cursor rapportent de meilleures premières ébauches sur des projets visuels. Dans un test externe, Grok 4.6 a reconstruit une ancienne page produit d'iPod Mini en site 3D avec roue chromatique et animation au défilement. La démo fonctionnait, mais un test ne suffit pas à prouver l'affirmation générale.
Comment Grok 4.6 a été post-entraîné
Si vous ne cherchez que des benchmarks et des tarifs, passez cette sous-section. Elle explique la version de SpaceXAI sur l'origine du gain.
SpaceXAI a effectué plus d'entraînement que pour Grok 4.5. Ils ont utilisé des exemples de raisonnement et d'ingénierie générés par IA, ont retiré les mauvais exemples via des contrôles par modèle, puis ont utilisé l'apprentissage par renforcement pour le codinge, les tâches bureautiques, le développement web, l'optimisation de noyau et la conception d'ordinateurs. SpaceXAI indique aussi que Grok 4.5 a créé de nouveaux exemples d'entraînement sur différents réglages de raisonnement et sujets. L'entreprise attribue le gain à plus d'entraînement et à une sélection de données plus stricte, pas à une nouvelle architecture.
Des équipes externes ne peuvent pas vérifier ces détails, et SpaceXAI n'a pas partagé assez d'informations pour reproduire l'entraînement. Il s'agit du récit de l'entreprise, et non d'un résultat vérifié par un tiers.
Benchmarks de Grok 4.6 : officiels et indépendants
Le tableau de lancement de SpaceXAI montre où les scores montent, mais les scores concurrents sont « les meilleurs des résultats auto-déclarés ou publics ». Une seule équipe n'a pas exécuté tous les modèles dans la même configuration. Le niveau d'effort de raisonnement est indiqué ci-dessous car il influe sur le score.
|
Benchmark |
Grok 4.6 (high) |
Grok 4.5 (high) |
GPT-5.6 Sol (max) |
Claude Fable 5 (max) |
|---|---|---|---|---|
|
AA Intelligence Index |
61 |
56 |
61 |
62 |
|
GDPVal-AA v2 (Elo) |
1 753 |
1 526 |
1 728 |
1 741 |
|
DeepSWE 1.1 |
65,9 % |
54,0 % |
73,0 % |
70,0 % |
|
Terminal-Bench 3.0 |
26,0 % |
15,7 % |
34,6 % |
34,1 % |
|
APEX-Agents |
57,5 % |
47,1 % |
56,7 % |
59,2 % |
|
CursorBench v3.2 |
69,9 % |
66,7 % |
67,2 % |
70,5 % |
Grok 4.6 progresse partout par rapport à Grok 4.5. Les écarts les plus marqués de Sol apparaissent sur DeepSWE et Terminal-Bench, tandis que Fable mène sur 3 lignes. Même le tableau de SpaceXAI ne désigne pas un vainqueur unique.
Résultats de benchmarks indépendants
Artificial Analysis a exécuté son propre Intelligence Index sur six modèles dans cette comparaison. Ses résultats sont proches de ceux de SpaceXAI, mais pas identiques.

Grok 4.6 face à cinq rivaux de pointe. Image par l'auteur.
Le graphique place Grok au niveau de Sol en intelligence, mais bien plus bas en prix moyen. Artificial Analysis calcule ce prix avec un mix 7:2:1 d'entrée en cache, d'entrée non mise en cache et de sortie. Le coût par tâche réussie montre le même écart : 0,84 $ pour Grok, 1,23 $ pour Sol et 2,34 $ pour Opus 5.
Le temps jusqu'au premier jeton de réponse est passé de 14,62 secondes sur Grok 4.5 à 40,44 secondes, tandis que le coût par tâche a augmenté de 0,36 $ à 0,84 $. Grok 4.6 a utilisé environ 20 % de jetons de sortie en plus sur les mêmes tests, donc un prix catalogue inchangé ne signifie pas un coût par tâche inchangé. Le coût par tâche terminée donne une meilleure vue que les cartes de tarifs API seules car il inclut une partie du raisonnement supplémentaire nécessaire pour aboutir.
Comparé à GPT-5.6 Sol et Claude Sonnet 5, Grok 4.6 envoie son premier jeton de réponse plus tôt. Sol en mode effort max prend 213,52 secondes, et Sonnet 5 prend 184,48 secondes, contre 40,44 pour Grok. Grok ne paraît lent qu'en face de modèles à faible latence comme Gemini 3.7 Flash.
Quelle fiabilité accorder à ces comparaisons ?
Elles sont utiles pour cerner des points forts relatifs, mais pas pour établir un classement inter-modèles fiable. Le niveau d'effort modifie score et temps de réponse : GPT-5.6 Sol a obtenu 57 en high et 61 en max. Les noms de benchmarks peuvent aussi renvoyer à des versions différentes, donc le Terminal-Bench 3.0 de xAI et le Terminal-Bench 2.1 d'Artificial Analysis ne sont pas comparables.
Qu'est-ce qui change par rapport à Grok 4.5 ?
Pour les utilisateurs de Grok 4.5, la question n'est pas de savoir si 4.6 est « meilleur » en soi, mais si le score plus élevé compense une latence et un profil d'usage des jetons différents. Le tableau met ces évolutions sur une même base.
|
Métrique |
Grok 4.5 (high) |
Grok 4.6 (high) |
|
AA Intelligence Index |
56 |
61 |
|
Coût par tâche d'index |
0,36 $ |
0,84 $ |
|
Délai avant premier jeton de réponse |
14,62 s |
40,44 s |
|
Prix de l'entrée en cache |
0,30 $ / M |
0,50 $ / M |
|
Jetons de sortie utilisés pour l'index |
60 M |
72 M |
|
Prix de base entrée / sortie |
2 $ / 6 $ |
2 $ / 6 $ (inchangé) |
Cependant, « même prix » ne décrit que le tarif de base catalogue. Un autre changement compte pour les utilisateurs existants : l'entrée en cache a augmenté de 67 %, de 0,30 $ à 0,50 $ par million de jetons. Ce taux de cache plus élevé accentue l'écart entre le tarif affiché et le coût d'une tâche aboutie.
Grok 4.6 face à la concurrence
Après la comparaison avec son prédécesseur, voyons comment Grok 4.6 se mesure aux autres modèles de pointe d'OpenAI et Anthropic.
Grok 4.6 vs GPT-5.6 Sol
L'égalité à l'index cache une vraie séparation. Sol devance Grok de 7,1 points sur DeepSWE et de 8,6 sur Terminal-Bench, faisant du codage très orienté terminal son meilleur cas d'usage. Grok obtient de meilleurs scores sur les trois autres lignes de tâches.
Les propres tests d'OpenAI étendent ce résultat au navigateur et à l'usage d'ordinateur. Ce sont toujours des éléments sélectionnés par le fournisseur plutôt qu'une comparaison contrôlée, mais ils vont dans le même sens : le point fort de Sol est le travail qui dépend du terminal, du navigateur ou d'appels d'outils répétés.
OpenAI a aussi présenté un mode Ultrafast pour Sol, annoncé jusqu'à 14 fois plus rapide. Aucun prix publié à ce stade, donc hors comparaison de coûts.
Grok 4.6 commence à 2 $ en entrée et 6 $ en sortie par million de jetons. Le tarif standard de Sol est de 5 $ en entrée et 30 $ en sortie, soit cinq fois le prix de sortie de Grok. Au-dessus de 272 000 jetons, Sol double le prix d'entrée et porte la sortie à 45 $.
Cela ne rend pas chaque tâche Grok cinq fois moins chère. L'usage de jetons de raisonnement, le taux de hits du cache et le nombre d'échanges modifient la facture finale. L'avantage prix de Grok est le plus net quand l'usage de jetons est prévisible. Pour du travail très orienté terminal, les meilleurs scores de Sol peuvent peser plus que l'écart de prix catalogue.
Grok 4.6 vs Claude Sonnet 5
Sonnet 5 et Grok 4.6 commencent tous deux à 2 $ par million de jetons d'entrée, ce qui facilite la comparaison. Sonnet 5 offre par défaut une fenêtre de contexte d'1 million de jetons, soit deux fois les 500 000 de Grok, sans tarif supérieur pour les longues invites. La sortie coûte 10 $ par million contre 6 $ pour Grok.
Deux jours avant la sortie de Grok 4.6, Anthropic a rendu permanent le tarif 2 $/10 $ et annulé une hausse prévue à 3 $/15 $. Point important si vous comparez à une grille plus ancienne, y compris chez nous.
Sur l'index d'Artificial Analysis, Sonnet 5 obtient 55 en effort max, soit six points de moins que Grok 4.6. Il a utilisé 300 millions de jetons de sortie pour les tests, contre 72 millions pour Grok, plaçant son coût par tâche à 1,72 $. Son tokenizer génère environ 30 % de jetons de plus que Sonnet 4.6 pour un même texte, ce qui complique la comparaison entre ces deux versions. Sonnet 5 n'est pas non plus le modèle le plus avancé d'Anthropic.
Grok 4.6 vs Claude Opus 5 et Fable 5
Opus 5, facturé 5 $ en entrée et 25 $ en sortie, mène l'index avec 63. Fable 5, à 10 $ en entrée et 50 $ en sortie, obtient 62. Le score d'index de Fable appelle aussi une note : Artificial Analysis a relevé des bascules de sécurité sur certaines invites difficiles, donc le score reflète le modèle tel qu'il est utilisable, pas une version non restreinte qu'Anthropic ne propose pas.
Sur le benchmark AA-Briefcase d'Artificial Analysis pour de longues tâches d'agent, Grok 4.6 a terminé en environ 53 échanges et utilisé 0,5 milliard de jetons d'entrée. Opus 5 a nécessité environ 103 échanges et 2 milliards de jetons. Cela ne prouve pas que Grok soit supérieur dans l'absolu. Cela montre qu'il a utilisé moins d'étapes et moins de jetons d'entrée sur cet ensemble de tests, tandis que Claude mène sur d'autres évaluations ci-dessus.
Tarification de Grok 4.6
Le seuil d'invite à 200 000 jetons est, à mon sens, le point à surveiller : il bascule tous les jetons de la requête sur le palier supérieur. Le tableau inclut également les options prioritaires et les frais d'outils.
|
Élément |
Tarif |
|
Jetons d'entrée, invite < 200 K |
2,00 $ / million |
|
Entrée en cache, invite < 200 K |
0,50 $ / million |
|
Jetons de sortie, invite < 200 K |
6,00 $ / million |
|
Entrée / cache / sortie (invite > 200 K) |
4,00 $ / 1,00 $ / 12,00 $ |
|
Traitement rapide ou prioritaire |
2× le tarif standard |
|
Recherche web, recherche X, exécution de code |
5 $ pour 1 000 appels |
Les frais d'outils sont distincts des frais de jetons. Une requête qui effectue une recherche web puis exécute du code peut encourir les deux frais avant la facturation du texte final. Il n'existe pas de modèle séparé grok-4.6-fast. L'API directe propose une option priorité facturée 2× lorsque la réponse confirme l'usage prioritaire. Cursor affiche un choix distinct « Grok 4.6 (Fast) » au même tarif 2×.

Grok 4.6 Fast sélectionné dans Cursor. Image par l'auteur.
Comment accéder à Grok 4.6 ?
Grok 4.6 est accessible en première partie via :
- l'API SpaceXAI
- Cursor
- Grok Build
- Passe-relais tiers (OpenRouter, Vercel, Cloudflare, Google Cloud Vertex AI)
- Autres outils de développement (GitHub Copilot, VS Code, JetBrains, Xcode et Eclipse)
Le déploiement couvre les offres Pro, Pro+, Max, Business et Enterprise. Les administrateurs Business et Enterprise doivent activer le modèle : il est désactivé par défaut. Grok 4.6 n'est pas pris en charge par l'API Batch de SpaceXAI, donc pas d'option lot à tarif réduit.
Un détail Enterprise se situe hors disponibilité du modèle. Les réponses sont étatées par défaut et SpaceXAI indique que l'historique est conservé 30 jours. En Zero Data Retention, les équipes ne peuvent pas utiliser des chaînes de réponses stockées ni des complétions différées ; xAI oriente vers l'enregistrement chiffré du raisonnement et WebSocket Responses. Chaque réponse inclut un en-tête indiquant si ZDR était actif.
La semaine de lancement de Grok 4.6 : modèles, Copilot et Cursor
Ce qui m'a frappé cette semaine-là, c'est la densité des lancements de modèles et des accords de distribution autour de Grok 4.6.

La semaine de lancement de Grok 4.6, au-delà des benchmarks. Image par l'auteur.
Grok Bot a donné le ton avant le lancement du modèle. Cet agent cloud en bêta précoce était inclus avec SuperGrok Heavy à 300 $ par mois ou Cursor Ultra à 200 $ par mois, et non vendus séparément, liant l'accès aux offres premium. Grok 4.6 a ensuite prolongé ce focus agent dans l'API, Cursor et Grok Build.
Le lancement de Gemini 3.7 Flash par Google et l'aperçu Ultrafast de GPT-5.6 Sol par OpenAI ont chargé la semaine. En parallèle, le déploiement de Copilot et l'arrivée de Cursor chez SpaceX ont élargi la distribution de Grok. Cursor a relié ce mouvement à son partenariat SpaceXAI plus tôt dans l'année et l'a cadré autour de l'accès aux GPU de SpaceX plutôt que des scores de modèles. Selon son billet, cet accès l'aidera à construire des modèles à moindre coût.
Ma lecture de cette semaine : SpaceXAI veut Grok dans les outils que les gens utilisent déjà. Grok 4.5 était co-entraîné avec Cursor, et Grok 4.6 est arrivé très vite dans Copilot. La distribution via partenaires fait partie du lancement, pas un ajout tardif.
Quand utiliser Grok 4.6 ?
Grok 4.6 convient quand le prix API et de longues tâches d'agent comptent plus que la latence du premier jeton. Il est moins adapté quand les meilleurs scores terminal de Sol ou la fenêtre de contexte plus vaste de Sonnet 5 collent mieux à la tâche.
Grok 4.6 est pertinent quand :
- Le prix API est une contrainte majeure : il sous-tarife Sol, Opus 5 et Fable 5 en prix catalogue et en coût par tâche
- Le travail se fait en longues chaînes d'agent multi-étapes, où son efficacité (moins d'échanges et de jetons d'entrée qu'Opus 5 sur AA-Briefcase) paie
- La tâche est du travail de connaissance ou du raisonnement juridique, domaines où il mène le tableau
- La latence du premier jeton importe peu : un démarrage lent pèse peu sur une longue exécution, mais pèse sur l'expérience en chat interactif
Il peut exister de meilleures alternatives quand :
- Le travail est du codage très orienté terminal → GPT-5.6 Sol (meilleurs scores DeepSWE et Terminal-Bench)
- La tâche requiert une très grande fenêtre de contexte → Claude Sonnet 5 (contexte 1 M, pas de surtaxe longues invites)
- Vous cherchez la plus faible latence en usage interactif → Gemini 3.7 Flash
- Vous achetez uniquement sur l'intelligence de pointe → Opus 5 (63) ou Fable 5 (62) mènent l'index
Conclusion sur Grok 4.6
Grok 4.6 atterrit dans un entre-deux délicat : +5 points à l'index et des prix listés sous Sol et Opus 5, mais un démarrage plus lent et un coût par tâche mesuré plus élevé que Grok 4.5. « Même prix, meilleur modèle » ne raconte que la moitié de l'histoire.
Ce que j'attends encore, c'est une exécution de plusieurs heures où la base de code, les outils et les instructions évoluent en continu. Cursor et GitHub Copilot fournissent désormais ce terrain. Si les taux de correction et d'échec restent bas, la promesse d'entraînement « agent » aura un appui au-delà d'un test figé ; sinon, le gain de cinq points restera… un gain de cinq points.
Pour celles et ceux qui développent contre l'API xAI, notre tutoriel Grok 4 API couvre le client Python et le flux de requêtes.
Grok 4.6 : FAQ
Grok 4.6 remplace-t-il Grok 4.5 ?
Officiellement, non. SpaceXAI n'a pas annoncé de date de retrait pour Grok 4.5, et il figure toujours dans l'API et dans Cursor. Aucun basculement forcé vers 4.6 pour l'instant.
Puis-je auto-héberger Grok 4.6 ?
Non. Comme indiqué plus haut, il n'y a ni poids ouverts ni nombre de paramètres publié ; rien à télécharger et exécuter sur votre propre infrastructure. Tous les accès, API directe incluse, passent par l'infrastructure de SpaceXAI ou un partenaire revendeur.
Comment GitHub Copilot facture-t-il Grok 4.6 ?
Copilot convertit l'usage de Grok 4.6 en GitHub AI Credits au prix catalogue du fournisseur, un centime valant un crédit. Les complétions de code normales et les suggestions pour la prochaine édition ne sont pas facturées en AI Credits. L'usage du modèle en chat ou en tâches d'agent suit les règles d'usage de Copilot.
Grok 4.6 est-il disponible dans l'UE ?
Oui, mais traité aux États-Unis. Les utilisateurs de l'UE peuvent accéder à Grok 4.6 (la base partagée Grok 4.5 a passé l'AI Act de l'UE et ouvert en juillet, et 4.6 est disponible dans Cursor à travers l'UE), mais il n'y a pas de résidence des données en UE. La page modèle de xAI ne liste que us-east-1 et us-west-2, donc les requêtes s'exécutent aux États-Unis. Vérifiez par surface (console API, Cursor, passerelles) avant d'y compter.
Grok 4.6 fonctionne-t-il avec la résidence des données US de Cursor ?
Grok 4.6 est désormais disponible dans Cursor (il a sa propre page modèle), mais la résidence des données US uniquement est une fonctionnalité Enterprise qui ne couvre que des modèles pris en charge, avec certaines exclusions. Vérifiez donc que 4.6 figure sur la liste des modèles actuellement pris en charge de Cursor avant d'y compter.
Je suis ingénieur de données et créateur de communautés. Je travaille sur les pipelines de données, le cloud et les outils d'IA, tout en rédigeant des tutoriels pratiques et percutants pour DataCamp et les développeurs émergents.


