Correction : nous ne trouvons aucune source aux chiffres de l'Intelligence Index de notre verdict sur Astra, nous les retirons donc
- Ce qui s’est passé
- We cannot source the three Artificial Analysis Intelligence Index figures our Astra verdict quoted (61.2 for Astra, 65.7 for Fable 5.1, 63.1 for Opus 5), so we are removing them and the third-place ranking built on them.
- Pourquoi c’est important
- That ranking was the lead condition on a buying recommendation, and an unsourceable benchmark inside a published verdict is a fabrication risk.
- Que faire
- Re-run any Astra decision that rested on the third-place ranking. The verdict stays conditional on two constraints: EU data residency blocks Fast mode, and OpenAI disclosed decreased monitorability versus GPT-5.6 Sol.
Astra reste conditionnel. L'évaluation ne bouge pas. Ce qui bouge, c'est la preuve qui la soutient : trois chiffres de benchmark que nous avions publiés sont retirés, parce que nous ne pouvons pas les sourcer.
Ce qui s'est passé
Le 4 septembre, nous avons publié notre couverture du lancement de GPT-6 Astra et fait passer Astra d'en attente à conditionnel. La condition en tête de liste était « troisième sur l'intelligence générale », et elle reposait sur trois chiffres que nous attribuions au tableau comparatif de lancement d'OpenAI : un Artificial Analysis Intelligence Index de 61,2 pour Astra, 65,7 pour Claude Fable 5.1 et 63,1 pour Claude Opus 5.
Nous sommes allés chercher ce tableau le 9 septembre et avons récupéré à nouveau chacune des pages concernées. Il n'est pas là où nous disions qu'il était.
- Artificial Analysis publie des chiffres différents, sous une forme différente. Son propre article sur Fable 5.1 attribue à Fable 5.1 un 66 à effort maximal, qu'il présente comme le score le plus élevé qu'il ait mesuré, et à Opus 5 un 63 à effort maximal. GPT-5.6 Sol est à 61. Des nombres entiers, à effort maximal. Astra n'apparaît nulle part dans cet article.
- La page du modèle GPT-6 Astra chez OpenAI présente les spécifications et la grille tarifaire, et aucune comparaison de benchmark, quelle qu'elle soit. Aucun chiffre d'index, aucune colonne concurrente.
- Le changelog de l'API d'OpenAI qualifie Astra de « notre modèle le plus performant, conçu pour les travaux de bout en bout les plus difficiles » et ne publie aucun tableau de benchmark.
- Le billet de blog de lancement d'OpenAI renvoie un HTTP 403 à notre robot de récupération. Un tableau comparatif s'y trouve peut-être. Nous ne pouvons pas le lire, donc nous ne le citerons pas. Notre liste de sources ci-dessous décrit encore cette page comme portant des tableaux de benchmarks, description héritée de notre première publication ; nous ne pouvons pas davantage la garantir aujourd'hui.
Les deux du milieu sont les sources primaires que cite notre propre fiche Astra. Aucune des deux ne contient le tableau auquel nous avions attribué ces chiffres.
Les trois chiffres sont donc retirés, et le classement « troisième sur l'intelligence générale » qui reposait sur eux est retiré avec eux. Nous ne leur substituons pas les chiffres d'Artificial Analysis cités plus haut : ce sont des scores à effort maximal pour deux modèles concurrents, et il n'existe aucun score Astra publié à leur opposer.
Pourquoi c'est important
Un classement de benchmark impossible à sourcer, à l'intérieur d'un verdict publié, c'est exactement la défaillance que nous sommes là pour éviter, et celle-ci était porteuse. « Troisième sur l'intelligence générale » était la première condition posée à une recommandation d'achat. C'est la phrase qui disait aux lecteurs d'orienter le raisonnement général ailleurs que vers Astra.
Un verdict avec une raison de moins vaut plus qu'un verdict avec une raison inventée. Ces chiffres figurent aussi dans notre article du 4 septembre et dans son résumé. Le présent avis les y retire également.
Ce qui change pour vous
Astra reste conditionnel. Deux conditions l'y maintiennent, et nous disons explicitement à quel point chacune tient aujourd'hui.
| Condition | État de la preuve |
|---|---|
| Le mode Fast est indisponible dans le cadre de la résidence des données dans l'UE | Revérifié aujourd'hui. La documentation tarifaire d'OpenAI l'énonce en ces termes et redirige les requêtes en résidence UE vers le traitement Standard |
| La monitorabilité a baissé par rapport à GPT-5.6 Sol | Repris tel quel, non revérifié. Cela provient de l'aperçu de sécurité d'Astra publié par OpenAI, que nous avons lu le 4 septembre ; cette page renvoie un 403 à notre robot de récupération aujourd'hui |
Revérifiés aujourd'hui dans la documentation d'OpenAI et inchangés : 10 $ en entrée et 50 $ en sortie par million de tokens en contexte court, 20 $/75 $ en contexte long, mode Fast à 20 $/100 $ et 40 $/150 $. Fenêtre de contexte de 1 050 000 tokens, sortie maximale de 128 000.
Si vous avez écarté Astra parce que nous l'avions classé troisième, cette raison n'existe plus. Reprenez la décision sur ce qui subsiste : un spécialiste du pilotage d'ordinateur, du terminal et du contexte long, à un tarif de pointe, sans le moindre score d'intelligence générale indépendant publié à son sujet.
FAQ
Le verdict a-t-il changé ? Non. Astra était conditionnel avant cette correction et l'est toujours après. Ce qui change, c'est la preuve : le résumé de verdict en vigueur perd les chiffres de l'index et le classement en troisième position, et conserve les deux conditions ci-dessus.
Pourquoi ne pas simplement publier les chiffres d'Artificial Analysis à la place ? Parce qu'ils ne répondent pas à la question que nous posions. Artificial Analysis n'a publié aucun score pour Astra : ses 66 et 63 classent donc Fable 5.1 et Opus 5 l'un par rapport à l'autre, pas par rapport à Astra. Remplacer un jeu de chiffres par un autre reviendrait à répéter l'erreur initiale avec un sourçage plus propre.
D'où venaient alors 61,2, 65,7 et 63,1 ? Nous l'ignorons, et c'est bien là le problème. Notre propre couverture les attribuait au tableau comparatif de lancement d'OpenAI. Cette page nous est illisible, et aucune des pages OpenAI ou Artificial Analysis que nous pouvons lire ne les contient. Tant que personne ne pourra désigner une source consultable, nous considérons ces trois chiffres comme non étayés.
Dois-je toujours éviter Astra pour le raisonnement général ? C'est désormais une affaire de jugement, et non quelque chose que nos données tranchent. Claude Opus 5 et Claude Fable 5.1 détiennent les deux scores Artificial Analysis les plus élevés que nous puissions vérifier. Astra n'en a aucun. L'absence de score ne prouve pas qu'il soit bas.
The Artificial Analysis Intelligence Index figures (61.2 / 65.7 / 63.1) and the third-place general-intelligence ranking could not be sourced against Artificial Analysis or either OpenAI primary cited on the entity, and are removed from the standing verdict. The rating holds at conditional on two constraints: Fast mode is unavailable under EU data residency (re-verified 2026-09-09), and OpenAI disclosed decreased monitorability versus GPT-5.6 Sol (read 2026-09-04, page unreadable today).
Que faire
- 1 If you ruled Astra out on the strength of a third-place intelligence ranking, re-run that decision. The ranking is withdrawn and we have no replacement figure to offer.
- 2 If you quoted our 61.2 / 65.7 / 63.1 figures in an internal model-selection doc, strike them.
- 3 If you operate under EU data residency, treat Fast mode as unavailable on Astra and budget the Standard tier at $10/$50 per 1M tokens short context.
- 4 Budget long-context Astra work at $20/$75 per 1M tokens, double the short-context rate.
Outils et modèles concernés
Ne ratez plus jamais une mise à jour
Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.