Korrektur: Wir können die Intelligence-Index-Werte in unserem Astra-Urteil nicht belegen und nehmen sie deshalb heraus

OpenAI logoOpenAIUrteil geändert9. September 2026Modelle
Was ist passiert
We cannot source the three Artificial Analysis Intelligence Index figures our Astra verdict quoted (61.2 for Astra, 65.7 for Fable 5.1, 63.1 for Opus 5), so we are removing them and the third-place ranking built on them.
Warum es wichtig ist
That ranking was the lead condition on a buying recommendation, and an unsourceable benchmark inside a published verdict is a fabrication risk.
Was zu tun ist
Re-run any Astra decision that rested on the third-place ranking. The verdict stays conditional on two constraints: EU data residency blocks Fast mode, and OpenAI disclosed decreased monitorability versus GPT-5.6 Sol.

Astra bleibt bedingt empfohlen. An der Bewertung ändert sich nichts. Was sich ändert, ist die Beweislage darunter: Drei Benchmark-Werte, die wir veröffentlicht haben, entfallen, weil wir sie nicht belegen können.

Was passiert ist

Am 4. September haben wir unsere Berichterstattung zum Start von GPT-6 Astra veröffentlicht und Astra von ausstehend auf bedingt empfohlen gesetzt. Die erste Bedingung lautete „Rang drei bei allgemeiner Intelligenz“, und sie stützte sich auf drei Zahlen, die wir OpenAIs eigener Vergleichstabelle zum Start zugeschrieben haben: ein Artificial Analysis Intelligence Index von 61,2 für Astra, 65,7 für Claude Fable 5.1 und 63,1 für Claude Opus 5.

Am 9. September haben wir diese Tabelle gesucht und jede beteiligte Seite neu abgerufen. Sie steht nicht dort, wo wir sie verortet haben.

  • Artificial Analysis veröffentlicht andere Zahlen in anderer Form. In der eigenen Auswertung zu Fable 5.1 erhält Fable 5.1 eine 66 bei maximalem Effort, laut Artificial Analysis der höchste Wert, den es je gemessen hat, und Opus 5 eine 63 bei maximalem Effort. GPT-5.6 Sol liegt bei 61. Ganze Zahlen, maximaler Effort. Astra kommt in diesem Artikel überhaupt nicht vor.
  • OpenAIs Modellseite zu GPT-6 Astra führt die Spezifikationen und die Preisliste, aber keinerlei Benchmark-Vergleich. Kein Indexwert, keine Spalte für Konkurrenzmodelle.
  • OpenAIs API-Changelog nennt Astra „unser leistungsfähigstes Modell, gebaut für die schwierigsten End-to-End-Aufgaben“ und veröffentlicht keine Benchmark-Tabelle.
  • OpenAIs Blogbeitrag zum Start liefert unserem Fetcher ein HTTP 403. Gut möglich, dass auf dieser Seite eine Vergleichstabelle steht. Lesen können wir sie nicht, also zitieren wir sie auch nicht. Unsere Quellenliste weiter unten beschreibt diese Seite noch als Träger von Benchmark-Tabellen, so wie wir sie beim ersten Erfassen eingetragen haben; auch für diese Beschreibung können wir nicht mehr geradestehen.

Die beiden mittleren sind die Primärquellen, die unser eigener Astra-Eintrag zitiert. Keine von beiden enthält die Tabelle, der wir die Zahlen zugeschrieben haben.

Also entfallen die drei Werte, und mit ihnen entfällt die darauf gebaute Platzierung „Rang drei bei allgemeiner Intelligenz“. Als Ersatz schieben wir die oben genannten Artificial-Analysis-Zahlen nicht nach: Das sind Werte bei maximalem Effort für zwei Konkurrenzmodelle, und es gibt keinen veröffentlichten Astra-Wert, den man dagegen einordnen könnte.

Warum das wichtig ist

Eine nicht belegbare Benchmark-Platzierung in einem veröffentlichten Urteil ist genau das Versagen, zu dessen Vermeidung es uns gibt, und diese hier war tragend. „Rang drei bei allgemeiner Intelligenz“ war die erste Bedingung einer Kaufempfehlung. Es ist der Satz, der unseren Lesern gesagt hat, allgemeines Reasoning an Astra vorbeizuleiten.

Ein Urteil mit einem Grund weniger ist mehr wert als ein Urteil mit einem erfundenen Grund. Die Werte stehen auch in unserem Artikel vom 4. September und in dessen Zusammenfassung. Diese Meldung zieht sie auch dort zurück.

Was sich für Sie ändert

Astra bleibt bedingt empfohlen. Zwei Bedingungen halten es dort, und wir sagen offen, wie belastbar jede davon heute ist.

BedingungStand der Belege
Der Fast-Modus ist unter EU-Datenresidenz nicht verfügbarHeute erneut verifiziert. OpenAIs Preisdokumentation formuliert es genau so und leitet Anfragen mit EU-Datenresidenz an die Standard-Verarbeitung
Die Überwachbarkeit hat gegenüber GPT-5.6 Sol abgenommenÜbernommen, nicht erneut verifiziert. Die Angabe stammt aus OpenAIs Sicherheitsüberblick zu Astra, den wir am 4. September gelesen haben; diese Seite liefert unserem Fetcher heute ein 403

Heute gegen OpenAIs eigene Dokumentation erneut verifiziert und unverändert: 10 USD Input und 50 USD Output je 1 Mio. Tokens bei kurzem Kontext, 20 USD/75 USD bei langem Kontext, Fast-Modus bei 20 USD/100 USD und 40 USD/150 USD. Kontextfenster 1.050.000 Tokens, maximaler Output 128.000.

Wenn Sie Astra ausgeschlossen haben, weil wir es auf Rang drei gesetzt haben, ist dieser Grund weg. Treffen Sie die Entscheidung neu, auf Basis dessen, was übrig bleibt: ein Spezialist für Computer-Use, Terminal und lange Kontexte zu einem Frontier-Preis. Für dieses Modell ist überhaupt kein herstellerneutraler Wert für allgemeine Intelligenz veröffentlicht.

FAQ

Hat sich das Urteil geändert? Nein. Astra war vor dieser Korrektur bedingt empfohlen und ist es danach immer noch. Was sich ändert, ist die Beweislage: Die gültige Urteilszusammenfassung verliert die Indexwerte und die Platzierung auf Rang drei und behält die beiden Bedingungen von oben.

Warum veröffentlichen Sie nicht einfach stattdessen die Zahlen von Artificial Analysis? Weil sie die Frage nicht beantworten, die wir gestellt haben. Artificial Analysis hat keinen Wert für Astra veröffentlicht, also ordnen die 66 und die 63 Fable 5.1 und Opus 5 gegeneinander ein, nicht gegen Astra. Einen Zahlensatz durch einen anderen zu ersetzen, hieße den ursprünglichen Fehler zu wiederholen, nur mit ordentlicherer Quellenangabe.

Woher stammen 61,2, 65,7 und 63,1 dann? Wir wissen es nicht, und genau das ist das Problem. Unsere eigene Berichterstattung hat sie OpenAIs Vergleichstabelle zum Start zugeschrieben. Diese Seite ist für uns nicht lesbar, und keine der OpenAI- oder Artificial-Analysis-Seiten, die wir lesen können, enthält sie. Solange niemand auf eine abrufbare Quelle zeigen kann, behandeln wir alle drei als unbelegt.

Soll ich Astra für allgemeines Reasoning weiterhin meiden? Das ist jetzt eine Ermessensentscheidung und nichts, was unsere Daten klären. Claude Opus 5 und Claude Fable 5.1 halten die beiden höchsten Artificial-Analysis-Werte, die wir verifizieren können. Astra hat gar keinen. Dass ein Wert fehlt, ist kein Beleg dafür, dass er niedrig wäre.

conditionalvorherige Wahl
conditionalneue Wahl

The Artificial Analysis Intelligence Index figures (61.2 / 65.7 / 63.1) and the third-place general-intelligence ranking could not be sourced against Artificial Analysis or either OpenAI primary cited on the entity, and are removed from the standing verdict. The rating holds at conditional on two constraints: Fast mode is unavailable under EU data residency (re-verified 2026-09-09), and OpenAI disclosed decreased monitorability versus GPT-5.6 Sol (read 2026-09-04, page unreadable today).

Was zu tun ist

  1. 1 If you ruled Astra out on the strength of a third-place intelligence ranking, re-run that decision. The ranking is withdrawn and we have no replacement figure to offer.
  2. 2 If you quoted our 61.2 / 65.7 / 63.1 figures in an internal model-selection doc, strike them.
  3. 3 If you operate under EU data residency, treat Fast mode as unavailable on Astra and budget the Standard tier at $10/$50 per 1M tokens short context.
  4. 4 Budget long-context Astra work at $20/$75 per 1M tokens, double the short-context rate.

Betroffene Tools & Modelle

Nie wieder etwas verpassen

Das wöchentliche Delta — nur Urteilsänderungen und dringende Punkte. Kein Füllmaterial.

Mit dem Abonnieren stimmst du unserer Datenschutzerklärung zu. Jederzeit abbestellbar.