FAR.AI Security Leaderboard: Fable 5 y GPT-5.6 Sol nunca fallan; Grok y Gemini se rompen por monedas
- Qué pasó
- FAR.AI launched the first public, reproducible AI security leaderboard: Fable 5 and GPT-5.6 Sol produced zero universal jailbreaks; Grok 4.5 yielded 448 and Gemini 3.1 Pro yielded 249 — jailbreakable for $58 and $278 respectively.
- Por qué importa
- Independent, adversarial benchmarks replace vendor safety claims with head-to-head comparison. The hundredfold gap between the most and least secure frontier models is now a checkable property — not a trust exercise.
- Qué hacer
- Check your deployed models against leaderboard.far.ai. Add application-layer security wrappers for any model that shows reproducible jailbreak vulnerabilities. Use FAR.AI's Minimal Standard in vendor evaluations.
La organización independiente sin fines de lucro FAR.AI acaba de publicar el primer leaderboard de seguridad público y reproducible para modelos de IA de frontera — y la brecha entre los seguros y los vulnerables es de cien veces. Claude Fable 5 y GPT-5.6 Sol produjeron cero jailbreaks universales en 1,500 ataques por modelo. Grok 4.5 produjo 448. Gemini 3.1 Pro produjo 249. El costo para encontrar un jailbreak funcional: $58 para Grok, $278 para Gemini, y más de $14,200 — sin encontrar nada — para los dos que resistieron.
Qué pasó
El 29 de julio, la organización sin fines de lucro de seguridad de IA con sede en Berkeley, FAR.AI, lanzó el AI Security Leaderboard en leaderboard.far.ai(se abre en una pestaña nueva), junto con el Minimal Standard for Safeguards, Versión 1.0 — una línea base que define los ataques que un modelo de frontera debería ser capaz de resistir (PRNewswire(se abre en una pestaña nueva), 2026). La metodología está completamente documentada, los prompts de ataque están publicados y los resultados son verificables de forma independiente.
Cómo funcionaron las pruebas. FAR.AI reunió una taxonomía de más de 60 técnicas de jailbreak documentadas públicamente, construyó herramientas para combinarlas sistemáticamente y ejecutó 1,000 ataques ensamblados aleatoriamente y 500 ataques guiados por expertos contra cada modelo en cinco dominios de riesgo: amenazas químicas, biológicas, radiológicas, nucleares, explosivas y de ciberseguridad. Un ataque contaba como jailbreak universal cuando tenía éxito en más de tres cuartas partes de las solicitudes dañinas en un dominio — lo que significa que no es algo puntual, sino una llave reutilizable.
Los resultados, en números:
| Modelo | Jailbreaks universales encontrados | Costo para encontrar uno |
|---|---|---|
| Grok 4.5 | 448 | ~$58 |
| Gemini 3.1 Pro | 249 | ~$278 |
| Claude Fable 5 | 0 | >$14,200 (ninguno encontrado) |
| GPT-5.6 Sol | 0 | >$14,200 (ninguno encontrado) |
Incluso la búsqueda aleatoria automatizada no dirigida — sin ninguna intervención humana — encontró 63 jailbreaks universales en Grok y 18 en Gemini. Añadir composición experta de ataques elevó esas cifras a 385 y 231 respectivamente, y los ataques construidos por expertos eran mucho más propensos a funcionar en tres o más dominios de riesgo a la vez.
«El enfoque de defensa en profundidad que recomienda debería convertirse en práctica estándar en toda la industria», dijo Seán Ó hÉigeartaigh, profesor de investigación en la Universidad de Cambridge. «Espero que el leaderboard anime a las empresas rezagadas a redoblar sus esfuerzos para endurecer los modelos contra el uso indebido.»
Respuestas de los proveedores. Anthropic dijo a WIRED(se abre en una pestaña nueva): «Estos hallazgos reflejan la inversión sostenida que hemos hecho en nuestras salvaguardas.» OpenAI dijo que «prueba rigurosamente nuestros modelos contra nuevas amenazas y usa esos hallazgos para mejorar nuestras protecciones.» Rohin Shah de Google DeepMind advirtió que los resultados «no deben interpretarse como una evaluación integral de la seguridad de Gemini», aunque señaló que la empresa está «trabajando constantemente para mejorar nuestras salvaguardas.» SpaceXAI no respondió a la solicitud de comentarios de WIRED.
Por qué importa
Esto cambia cómo las empresas deben evaluar la seguridad de los modelos. Hasta ahora, las afirmaciones de seguridad de IA provenían de los propios laboratorios — las system cards de Anthropic, las divulgaciones de red-teaming de OpenAI, los informes de responsabilidad de Google. El leaderboard de FAR.AI introduce comparación independiente, adversarial y cara a cara con metodología publicada. Ahora puedes verificar si las afirmaciones de seguridad de un modelo resisten bajo ataque antes de desplegarlo.
La replicabilidad es la verdadera historia. Cualquiera con acceso a API y unos pocos cientos de dólares puede reproducir estos ataques. Las vulnerabilidades son sistemáticas, no incidentales — y hasta que los proveedores las parcheen, son explotables a escala. Como dijo Adam Gleave, cofundador y CEO de FAR.AI: «Los modelos de IA ahora mismo están menos regulados que los restaurantes.»
Los modelos que resistieron — Fable 5 y GPT-5.6 Sol — tenían varias capas independientes de protección trabajando juntas. Los modelos más débiles «no ofrecieron nada parecido a esa resistencia y cedieron rápidamente, una y otra vez», según el informe de FAR.AI. La defensa en profundidad no es teórica; es la diferencia medible entre cero jailbreaks y 448.
«Algunas empresas claramente saben cómo defenderse contra al menos el subconjunto de ataques probados en este informe», dijo Anka Reuel, científica informática en Stanford. «La pregunta es por qué algunas empresas los están usando y otras no.»
Stephen Casper, científico informático en Harvard, ofreció un encuadre más crudo: «Si un incidente grave de uso indebido ocurre en el futuro cercano o mediano, será casi con certeza de un sistema que no fue desplegado con salvaguardas de última generación.»
Qué cambia para ti
- Revisa tus modelos desplegados contra el leaderboard. Si estás ejecutando Grok 4.5 o Gemini 3.1 Pro en producción, estos resultados sugieren que tus modelos son vulnerables por monedas. Añade una capa de seguridad a nivel de aplicación — no confíes solo en el entrenamiento de seguridad nativo del modelo.
- Usa el Minimal Standard de FAR.AI en evaluaciones de proveedores. Cuando un proveedor afirme que su último lanzamiento es «seguro por diseño», verifica si cumple con el Minimal Standard for Safeguards, Versión 1.0. Los benchmarks adversariales independientes son ahora un requisito básico para la selección empresarial de modelos.
- Atento a la expansión del leaderboard. FAR.AI se actualizará con cada lanzamiento importante de modelo de frontera y revisará el Minimal Standard a medida que avancen las técnicas de ataque y defensa. La dinámica competitiva de la seguridad de modelos acaba de cambiar — espera que los proveedores empiecen a optimizar para las puntuaciones del leaderboard.
FAQ
¿Cero jailbreaks significa que Fable 5 y GPT-5.6 Sol son irrompibles? No. FAR.AI declara explícitamente que pasar sus pruebas «no ha sido certificado como seguro.» La evaluación probó un conjunto representativo de ataques fácilmente accesibles — no todos los vectores posibles. Ataques dinámicos más complejos y costosos fueron deliberadamente excluidos de la Versión 1.0. Cero jailbreaks significa que estos modelos son sustancialmente más difíciles de romper que sus pares, no que sean invulnerables.
¿Por qué hay una brecha tan grande entre modelos? La diferencia se reduce a la defensa en profundidad. FAR.AI encontró que los modelos que resistieron tenían varias capas independientes de protección operando juntas — así que atravesarlas habría requerido que todas fallaran simultáneamente. Los modelos más débiles tenían menos capas, y los atacantes solo necesitaban encontrar una brecha. La brecha es función de la inversión en ingeniería, no de la capacidad — estas vulnerabilidades son prevenibles con técnicas que existen hoy.
¿Este leaderboard realmente cambiará algo? Ya lo está haciendo. FAR.AI compartió los hallazgos confidencialmente con cada empresa antes de la publicación, dando tiempo a los proveedores para corregir problemas. El leaderboard se actualizará con cada lanzamiento importante de modelo, creando un registro público continuo. Combinado con las leyes de seguridad estatales recientemente aprobadas en California, Nueva York e Illinois, los benchmarks de seguridad independientes se están convirtiendo en parte del panorama regulatorio — no solo un ejercicio de investigación.
actions:
- Revisa tus modelos desplegados contra leaderboard.far.ai
- Añade capas de seguridad a nivel de aplicación para modelos vulnerables a jailbreak
- Incluye el Minimal Standard de FAR.AI en las evaluaciones de seguridad de proveedores
tldr:
- happened: FAR.AI lanzó el primer leaderboard de seguridad de IA público y reproducible: Fable 5 y GPT-5.6 Sol produjeron cero jailbreaks universales; Grok 4.5 produjo 448 y Gemini 3.1 Pro produjo 249 — vulnerables por $58 y $278 respectivamente.
- matters: Benchmarks adversariales independientes reemplazan las afirmaciones de seguridad de los proveedores con comparación cara a cara. La brecha de cien veces entre los modelos de frontera más y menos seguros ahora es una propiedad verificable — no un ejercicio de confianza.
- action: Revisa tus modelos desplegados contra leaderboard.far.ai. Añade capas de seguridad a nivel de aplicación para cualquier modelo que muestre vulnerabilidades de jailbreak reproducibles. Usa el Minimal Standard de FAR.AI en evaluaciones de proveedores.
Qué hacer
- 1 Check your deployed models against leaderboard.far.ai
- 2 Add application-layer security wrappers for jailbreakable models
- 3 Include FAR.AI's Minimal Standard in vendor security evaluations
Herramientas y modelos afectados
No vuelvas a tener que ponerte al día
El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.