Grok 4.6 arrive à $2/$6 — 61 à l'indice AA, à égalité avec GPT-5.6 Sol
- Ce qui s’est passé
- SpaceXAI launched Grok 4.6 on Aug 12 at $2/$6, scoring 61 on the AA Intelligence Index — tying GPT-5.6 Sol for third, behind Claude Opus 5 and Claude Fable 5.
- Pourquoi c’est important
- It's frontier-competitive and the cheapest in its class — the model to watch for long-running agents and visual/interactive work.
- Que faire
- Cursor and Grok Build users should try it now (2x included usage this week); everyone else, hold for broader benchmarks before betting production on it.
Grok 4.6 est sorti le 12 août au même prix de $2 / $6 par 1M de jetons que Grok 4.5 — et la première lecture indépendante est solide : 61 à l'Artificial Analysis Intelligence Index, un composite de neuf benchmarks à égalité avec GPT-5.6 Sol, derrière Claude Opus 5 (63) et Claude Fable 5 (62). Nous faisons passer le verdict du répertoire de en attente → conditionnel — non pas parce que les benchmarks sont faibles, mais parce qu'un modèle sorti hier n'a pas encore mérité recommandé.
Ce qui s'est passé
SpaceXAI a lancé Grok 4.6 avec des tarifs inchangés par rapport à Grok 4.5, plus une "variante Fast" au double du prix pour un débit supérieur. Les chiffres clés (Artificial Analysis, 2026) :
| Métrique | Grok 4.6 | GPT-5.6 Sol | Fable 5 Max | Grok 4.5 |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 61 | 62 | 56 |
| GDPVal-AA v2 | 1 753 | 1 728 | 1 741 | 1 526 |
| CursorBench v3.2 | 69,9 % | 67,2 % | 70,5 % | 66,7 % |
Le tableau ci-dessus compare un sous-ensemble de quatre modèles — Claude Opus 5 (63) se place au-dessus de Grok 4.6 sur le composite de l'AA Intelligence Index.
Trois points ressortent :
- GDPVal-AA 1 753 — derrière seulement Claude Opus 5, devant Fable 5 Max et GPT-5.6 Sol.
- Un bond de 5 points sur le composite par rapport à Grok 4.5 (56 → 61) au même prix.
- Le double d'utilisation incluse dans Grok Build et Cursor la première semaine — SpaceXAI paie pour la fenêtre d'évaluation.
Il sort aujourd'hui sur Cursor, Grok Build, l'API, OpenRouter, Vercel et Cloudflare. Le billet de lancement le positionne pour les agents de longue durée et un travail interactif/visuel plus ambitieux : rester sur sa tâche à travers de nombreuses étapes, et une structure d'application et un langage visuel plus solides dès la première passe (xAI, 2026).
Pourquoi c'est important
Grok 4.6 est compétitif face à la frontière, au prix le plus bas de sa catégorie. Faire jeu égal avec GPT-5.6 Sol sur le composite — à $2/$6, inchangé par rapport à Grok 4.5 — rebat l'équation coût-par-capacité pour les charges de travail des agents. Si son avance sur GDPVal-AA se maintient, il devient le choix par défaut pour les équipes qui brûlent des jetons sur des agents de codage.
Mais la vérification indépendante ne repose que sur un seul évaluateur. Artificial Analysis est la seule lecture tierce à ce jour. Un modèle sorti hier n'a aucun historique de fiabilité à long terme — pas de tests de stress d'agents multi-étapes, pas de données d'achèvement de tâches sur plusieurs jours. C'est l'écart entre conditionnel et recommandé, et un score composite du premier jour ne le comble pas.
Le positionnement met les agents au premier plan. Le lancement met en avant la persistance à travers de nombreuses étapes ainsi que la structure et les visuels dès la première passe, visant les utilisateurs de Cursor et Grok Build — pas un positionnement d'assistant généraliste.
Ce qui change pour vous
Sur Cursor ou Grok Build : essayez-le cette semaine. Le double d'utilisation incluse en fait une évaluation quasi gratuite, et les utilisateurs de Grok 4.5 obtiennent une mise à niveau significative au même prix.
Pour la production : attendez. Laissez l'ensemble plus large de benchmarks arriver avant d'y diriger des charges critiques. Un score composite, aussi solide soit-il, n'est pas un historique de fiabilité.
Besoin de débit : surveillez la variante Fast. Elle tourne au double du prix ; elle ne vaut le coup que si votre charge est limitée par la latence, pas par les jetons.
FAQ
Qu'est-ce qui a changé entre Grok 4.6 et Grok 4.5 ?
Les tarifs restent inchangés à $2/$6, mais Grok 4.6 ajoute un bond de 5 points sur le composite (56 → 61), un résultat GDPVal-AA derrière seulement Claude Opus 5 et — selon le billet de lancement — une meilleure persistance sur les tâches d'agents de longue durée ainsi qu'une structure d'application et un langage visuel plus solides dès la première passe (xAI, 2026).
Grok 4.6 est-il meilleur que GPT-5.6 Sol ?
Ils sont à égalité à 61 sur l'AA Intelligence Index. Grok 4.6 devance GPT-5.6 Sol sur GDPVal-AA (1 753 contre 1 728) et CursorBench (69,9 % contre 67,2 %), tandis que Claude Opus 5 (63) et Claude Fable 5 (62) restent en tête sur le composite. À $2/$6, Grok 4.6 est la voie la moins chère vers ce niveau de capacité — avec un historique bien plus mince.
Dois-je déplacer mes charges de production vers Grok 4.6 dès maintenant ?
Pas encore. Il n'a qu'un seul évaluateur et un seul jour d'existence. Évaluez-le cette semaine — en particulier sur Cursor et Grok Build avec le double d'utilisation incluse — et laissez les benchmarks indépendants agentiques et de long terme arriver avant qu'il ne touche à la production.
Launch completes the pending entity: 61 AA Intelligence Index (ties GPT-5.6 Sol, behind Claude Opus 5 and Claude Fable 5) at $2/$6, with GDPVal-AA behind only Claude Opus 5.
Que faire
- 1 If you're on Cursor or Grok Build, try Grok 4.6 this week — the 2x included usage makes it a low-cost evaluation.
- 2 Hold production bets until the broader benchmark set lands; one evaluator (Artificial Analysis) is the only independent read so far.
- 3 Watch the 'Fast variant' at 2x price only if your workload is latency-bound, not token-bound.
Outils et modèles concernés
Ne ratez plus jamais une mise à jour
Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.