FAR.AI-Sicherheits-Leaderboard: Fable 5 und GPT-5.6 Sol versagen nie; Grok und Gemini brechen für Kleingeld
- Was ist passiert
- FAR.AI launched the first public, reproducible AI security leaderboard: Fable 5 and GPT-5.6 Sol produced zero universal jailbreaks; Grok 4.5 yielded 448 and Gemini 3.1 Pro yielded 249 — jailbreakable for $58 and $278 respectively.
- Warum es wichtig ist
- Independent, adversarial benchmarks replace vendor safety claims with head-to-head comparison. The hundredfold gap between the most and least secure frontier models is now a checkable property — not a trust exercise.
- Was zu tun ist
- Check your deployed models against leaderboard.far.ai. Add application-layer security wrappers for any model that shows reproducible jailbreak vulnerabilities. Use FAR.AI's Minimal Standard in vendor evaluations.
Die unabhängige gemeinnützige Organisation FAR.AI hat gerade das erste öffentliche, reproduzierbare Sicherheits-Leaderboard für Frontier-KI-Modelle veröffentlicht – und die Kluft zwischen den Sicheren und den Verwundbaren beträgt das Hundertfache. Claude Fable 5 und GPT-5.6 Sol produzierten null universelle Jailbreaks bei 1.500 Angriffen pro Modell. Grok 4.5 lieferte 448. Gemini 3.1 Pro lieferte 249. Die Kosten, um einen funktionierenden Jailbreak zu finden: 58 USD für Grok, 278 USD für Gemini und mehr als 14.200 USD – ohne jeden Fund – für die beiden, die standhielten.
Was passiert ist
Am 29. Juli startete die in Berkeley ansässige KI-Sicherheits-NGO FAR.AI das AI Security Leaderboard auf leaderboard.far.ai(wird in einem neuen Tab geöffnet) sowie den Minimal Standard for Safeguards, Version 1.0 – eine Basislinie, die die Angriffe definiert, denen ein Frontier-Modell standhalten sollte (PRNewswire(wird in einem neuen Tab geöffnet), 2026). Die Methodik ist vollständig dokumentiert, die Angriffsprompts sind veröffentlicht und die Ergebnisse sind unabhängig verifizierbar.
Wie die Tests funktionierten. FAR.AI stellte eine Taxonomie von mehr als 60 öffentlich dokumentierten Jailbreak-Techniken zusammen, entwickelte Werkzeuge, um sie systematisch zu kombinieren, und führte 1.000 zufällig zusammengestellte Angriffe sowie 500 expertengesteuerte Angriffe gegen jedes Modell in fünf Risikodomänen durch: chemische, biologische, radiologische, nukleare und explosive Bedrohungen sowie Cybersicherheitsbedrohungen. Ein Angriff galt als universeller Jailbreak, wenn er bei mehr als drei Vierteln der schädlichen Anfragen in einer Domäne erfolgreich war – das heißt, es handelt sich nicht um einen Einzelfall, sondern um einen wiederverwendbaren Schlüssel.
Die Ergebnisse, in Zahlen:
| Modell | Universelle Jailbreaks gefunden | Kosten, um einen zu finden |
|---|---|---|
| Grok 4.5 | 448 | ~58 USD |
| Gemini 3.1 Pro | 249 | ~278 USD |
| Claude Fable 5 | 0 | >14.200 USD (keine gefunden) |
| GPT-5.6 Sol | 0 | >14.200 USD (keine gefunden) |
Selbst eine ungerichtete, automatisierte Zufallssuche – ohne jegliches menschliches Eingreifen – fand 63 universelle Jailbreaks bei Grok und 18 bei Gemini. Die Hinzufügung von Expertenkomposition bei den Angriffen steigerte diese Zahlen auf 385 bzw. 231, wobei die von Experten erstellten Angriffe weitaus häufiger in drei oder mehr Risikodomänen gleichzeitig wirkten.
'Der darin empfohlene Defense-in-Depth-Ansatz sollte branchenweit zum Best Practice werden', sagte Seán Ó hÉigeartaigh, Forschungsprofessor an der University of Cambridge. 'Ich hoffe, das Leaderboard wird zurückliegende Unternehmen dazu ermutigen, ihre Anstrengungen zur Härtung von Modellen gegen Missbrauch zu verdoppeln.'
Reaktionen der Anbieter. Anthropic sagte gegenüber WIRED(wird in einem neuen Tab geöffnet): 'Diese Ergebnisse spiegeln die nachhaltigen Investitionen wider, die wir in unsere Schutzmaßnahmen getätigt haben.' OpenAI erklärte, es 'teste unsere Modelle rigoros gegen neue Bedrohungen und nutze diese Erkenntnisse zur Verbesserung unserer Schutzmaßnahmen.' Google DeepMinds Rohin Shah warnte, die Ergebnisse 'sollten nicht als umfassende Bewertung der Gemini-Sicherheit interpretiert werden', merkte aber an, das Unternehmen arbeite 'kontinuierlich an der Verbesserung unserer Schutzmaßnahmen'. SpaceXAI reagierte nicht auf die Anfrage von WIRED.
Warum es zählt
Dies verändert, wie Unternehmen Modellsicherheit bewerten sollten. Bislang kamen KI-Sicherheitsbehauptungen von den Laboren selbst – Anthropics System Cards, OpenAIs Red-Teaming-Offenlegungen, Googles Verantwortungsberichte. Das Leaderboard von FAR.AI führt unabhängige, gegnerische Kopf-an-Kopf-Vergleiche mit veröffentlichter Methodik ein. Sie können nun prüfen, ob die Sicherheitsbehauptungen eines Modells unter Beschuss standhalten, bevor Sie es einsetzen.
Die Reproduzierbarkeit ist die eigentliche Geschichte. Jeder mit API-Zugang und ein paar hundert Dollar kann diese Angriffe reproduzieren. Die Schwachstellen sind systematisch, nicht zufällig – und solange die Anbieter sie nicht patchen, sind sie im großen Maßstab ausnutzbar. Wie Adam Gleave, Mitgründer und CEO von FAR.AI, es formulierte: 'KI-Modelle sind derzeit weniger reguliert als Restaurants.'
Die Modelle, die standhielten – Fable 5 und GPT-5.6 Sol – verfügten über mehrere unabhängige, zusammenwirkende Schutzebenen. Die schwächeren Modelle 'boten nichts dergleichen an Widerstandsfähigkeit und gaben schnell und wiederholt nach', so der FAR.AI-Bericht. Defense in Depth ist keine Theorie; es ist der messbare Unterschied zwischen null Jailbreaks und 448.
'Manche Unternehmen wissen offensichtlich, wie sie sich gegen zumindest die in diesem Bericht getesteten Angriffe verteidigen können', sagte Anka Reuel, Informatikerin in Stanford. 'Die Frage ist, warum manche Unternehmen diese Maßnahmen nutzen und andere nicht.'
Stephen Casper, Informatiker in Harvard, formulierte es noch drastischer: 'Sollte es in naher oder mittlerer Zukunft zu einem schwerwiegenden Missbrauchsvorfall kommen, wird es mit ziemlicher Sicherheit ein System sein, das nicht mit modernsten Schutzmaßnahmen eingesetzt wurde.'
Was sich für Sie ändert
- Ihre eingesetzten Modelle gegen das Leaderboard prüfen. Falls Sie Grok 4.5 oder Gemini 3.1 Pro in Produktion betreiben, legen diese Ergebnisse nahe, dass Ihre Modelle für Kleingeld jailbreakbar sind. Fügen Sie einen Sicherheits-Wrapper auf Anwendungsebene hinzu – verlassen Sie sich nicht allein auf das native Sicherheitstraining des Modells.
- Den Minimal Standard von FAR.AI in Anbieterbewertungen nutzen. Wenn ein Anbieter behauptet, sein neuestes Release sei 'by design sicher', prüfen Sie, ob es den Minimal Standard for Safeguards, Version 1.0 erfüllt. Unabhängige gegnerische Benchmarks sind jetzt Mindestvoraussetzung für die Enterprise-Modellauswahl.
- Die Ausweitung des Leaderboards beobachten. FAR.AI wird es mit jedem größeren Frontier-Modell-Release aktualisieren und den Minimal Standard überarbeiten, wenn Angriffs- und Verteidigungstechniken voranschreiten. Die Wettbewerbsdynamik der Modellsicherheit hat sich gerade verändert – rechnen Sie damit, dass Anbieter beginnen, auf Leaderboard-Scores zu optimieren.
FAQ
Bedeutet null Jailbreaks, dass Fable 5 und GPT-5.6 Sol unknackbar sind? Nein. FAR.AI stellt ausdrücklich fest, dass das Bestehen seiner Tests 'nicht als sicher zertifiziert gilt'. Die Evaluierung testete eine repräsentative Auswahl leicht zugänglicher Angriffe – nicht jeden möglichen Vektor. Komplexere, teurere dynamische Angriffe wurden in Version 1.0 bewusst ausgeschlossen. Null Jailbreaks bedeutet, dass diese Modelle erheblich schwerer zu knacken sind als ihre Konkurrenten, nicht dass sie unverwundbar sind.
Warum gibt es eine so große Kluft zwischen den Modellen? Der Unterschied liegt in Defense in Depth. FAR.AI stellte fest, dass die Modelle, die standhielten, über mehrere unabhängige, zusammenwirkende Schutzebenen verfügten – ein Durchbruch hätte erfordert, dass alle gleichzeitig versagen. Die schwächeren Modelle hatten weniger Ebenen, und Angreifer mussten nur eine Lücke finden. Die Kluft ist eine Folge von Entwicklungsinvestition, nicht von Fähigkeit – diese Schwachstellen sind mit heute existierenden Techniken vermeidbar.
Wird dieses Leaderboard tatsächlich etwas verändern? Das tut es bereits. FAR.AI teilte die Ergebnisse vertraulich mit jedem Unternehmen vor der Veröffentlichung und gab den Anbietern Zeit, Probleme zu beheben. Das Leaderboard wird mit jedem größeren Modell-Release aktualisiert und schafft eine fortlaufende öffentliche Aufzeichnung. In Kombination mit kürzlich verabschiedeten staatlichen Sicherheitsgesetzen in Kalifornien, New York und Illinois werden unabhängige Sicherheits-Benchmarks Teil der regulatorischen Landschaft – nicht nur eine Forschungsübung.
Was zu tun ist
- 1 Check your deployed models against leaderboard.far.ai
- 2 Add application-layer security wrappers for jailbreakable models
- 3 Include FAR.AI's Minimal Standard in vendor security evaluations
Betroffene Tools & Modelle
Nie wieder etwas verpassen
Das wöchentliche Delta — nur Urteilsänderungen und dringende Punkte. Kein Füllmaterial.