Corrección: no podemos documentar las cifras del Intelligence Index de nuestro veredicto sobre Astra, así que las retiramos
- Qué pasó
- We cannot source the three Artificial Analysis Intelligence Index figures our Astra verdict quoted (61.2 for Astra, 65.7 for Fable 5.1, 63.1 for Opus 5), so we are removing them and the third-place ranking built on them.
- Por qué importa
- That ranking was the lead condition on a buying recommendation, and an unsourceable benchmark inside a published verdict is a fabrication risk.
- Qué hacer
- Re-run any Astra decision that rested on the third-place ranking. The verdict stays conditional on two constraints: EU data residency blocks Fast mode, and OpenAI disclosed decreased monitorability versus GPT-5.6 Sol.
Astra mantiene el veredicto conditional. La calificación no se mueve. Lo que sí se mueve es la evidencia que la sostiene: retiramos tres cifras de benchmark que publicamos, porque no encontramos ninguna fuente que las respalde.
Qué pasó
El 4 de septiembre publicamos nuestra cobertura del lanzamiento de GPT-6 Astra y pasamos Astra de pending a conditional. La condición principal era «tercero en inteligencia general», y se apoyaba en tres números que atribuimos a la propia tabla comparativa de lanzamiento de OpenAI: un Artificial Analysis Intelligence Index de 61,2 para Astra, 65,7 para Claude Fable 5.1 y 63,1 para Claude Opus 5.
El 9 de septiembre fuimos a buscar esa tabla y volvimos a descargar todas las páginas implicadas. No está donde dijimos que estaba.
- Artificial Analysis publica números distintos y con otra forma. Su propio artículo sobre Fable 5.1 le da a Fable 5.1 un 66 con esfuerzo máximo, que califica como la puntuación más alta que ha medido, y a Opus 5 un 63 con esfuerzo máximo. GPT-5.6 Sol queda en 61. Números enteros, esfuerzo máximo. Astra no aparece en ese artículo en absoluto.
- La página del modelo GPT-6 Astra de OpenAI recoge las especificaciones y la tarifa, y ninguna comparativa de benchmarks de ningún tipo. Ni cifra del índice, ni columna de rivales.
- El changelog de la API de OpenAI describe Astra como «nuestro modelo más capaz, creado para el trabajo de extremo a extremo más difícil» y no publica ninguna tabla de benchmarks.
- La entrada de blog del lanzamiento de OpenAI devuelve un HTTP 403 a nuestro fetcher. Es muy posible que haya una tabla comparativa en esa página. No podemos leerla, así que no la vamos a citar. Nuestra lista de fuentes de más abajo sigue describiendo esa página como si contuviera tablas de benchmarks, desde que la registramos por primera vez; tampoco podemos seguir respaldando esa etiqueta.
Las dos del medio son las fuentes primarias que cita nuestra propia entrada de Astra. Ninguna contiene la tabla a la que atribuimos los números.
Así que las tres cifras se retiran, y con ellas se retira la clasificación de «tercero en inteligencia general» construida sobre ellas. Y no ponemos en su lugar los números de Artificial Analysis citados arriba: son puntuaciones con esfuerzo máximo de dos modelos rivales, y no hay ninguna puntuación publicada de Astra que ordenar frente a ellas.
Por qué importa
Una clasificación de benchmarks sin fuente localizable dentro de un veredicto publicado es exactamente el fallo que estamos aquí para evitar, y esta era estructural. «Tercero en inteligencia general» era la primera condición de una recomendación de compra. Es la frase que decía al lector que sacara el razonamiento general de Astra.
Un veredicto con una razón menos vale más que un veredicto con una razón inventada. Las cifras aparecen también en nuestro artículo del 4 de septiembre y en su resumen. Este aviso las retira también de ahí.
Qué cambia para ti
Astra mantiene el veredicto conditional. Son dos condiciones las que lo sostienen ahí, y decimos con claridad cómo de sólida es hoy cada una.
| Condición | Estado de la evidencia |
|---|---|
| El modo Fast no está disponible bajo residencia de datos en la UE | Reverificado hoy. La documentación de precios de OpenAI lo dice con esas mismas palabras y encamina las peticiones con residencia en la UE al procesamiento Standard |
| La monitorizabilidad ha disminuido frente a GPT-5.6 Sol | Arrastrado, no reverificado. Procede del informe de seguridad de Astra de OpenAI, que leímos el 4 de septiembre; hoy esa página devuelve un 403 a nuestro fetcher |
Reverificado hoy frente a la propia documentación de OpenAI y sin cambios: $10 de entrada y $50 de salida por 1M de tokens en contexto corto, $20/$75 en contexto largo, modo Fast a $20/$100 y $40/$150. Ventana de contexto de 1.050.000 tokens, salida máxima de 128.000.
Si descartaste Astra porque lo situamos en tercer lugar, esa razón ya no existe. Vuelve a tomar la decisión con lo que queda en pie: un especialista en manejo del ordenador, terminal y contexto largo, a precio de frontera, sin que se haya publicado para él ninguna puntuación de inteligencia general independiente del proveedor.
FAQ
¿Ha cambiado el veredicto? No. Astra era conditional antes de esta corrección y sigue siendo conditional después. Lo que cambia es la evidencia: el resumen del veredicto vigente pierde las cifras del índice y el tercer puesto, y conserva las dos condiciones de arriba.
¿Por qué no publicar simplemente los números de Artificial Analysis en su lugar? Porque no responden a la pregunta que hicimos. Artificial Analysis no ha publicado ninguna puntuación de Astra, así que su 66 y su 63 ordenan a Fable 5.1 y a Opus 5 entre sí, no frente a Astra. Sustituir un conjunto de números por otro repetiría el error original con un aparato de fuentes más pulcro.
Entonces, ¿de dónde salieron 61,2, 65,7 y 63,1? No lo sabemos, y ese es el problema. Nuestra propia cobertura los atribuyó a la tabla comparativa de lanzamiento de OpenAI. Esa página nos resulta ilegible, y ninguna de las páginas de OpenAI o de Artificial Analysis que sí podemos leer las contiene. Hasta que alguien pueda señalar una fuente accesible, tratamos las tres como no respaldadas.
¿Debería seguir evitando Astra para razonamiento general? Eso es ahora una cuestión de criterio, no algo que zanjen nuestros datos. Claude Opus 5 y Claude Fable 5.1 tienen las dos puntuaciones de Artificial Analysis más altas que podemos verificar. Astra no tiene ninguna. La ausencia de puntuación no es prueba de una puntuación baja.
The Artificial Analysis Intelligence Index figures (61.2 / 65.7 / 63.1) and the third-place general-intelligence ranking could not be sourced against Artificial Analysis or either OpenAI primary cited on the entity, and are removed from the standing verdict. The rating holds at conditional on two constraints: Fast mode is unavailable under EU data residency (re-verified 2026-09-09), and OpenAI disclosed decreased monitorability versus GPT-5.6 Sol (read 2026-09-04, page unreadable today).
Qué hacer
- 1 If you ruled Astra out on the strength of a third-place intelligence ranking, re-run that decision. The ranking is withdrawn and we have no replacement figure to offer.
- 2 If you quoted our 61.2 / 65.7 / 63.1 figures in an internal model-selection doc, strike them.
- 3 If you operate under EU data residency, treat Fast mode as unavailable on Astra and budget the Standard tier at $10/$50 per 1M tokens short context.
- 4 Budget long-context Astra work at $20/$75 per 1M tokens, double the short-context rate.
Herramientas y modelos afectados
No vuelvas a tener que ponerte al día
El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.