Classement de sécurité FAR.AI : Fable 5 et GPT-5.6 Sol ne cèdent jamais ; Grok et Gemini craquent pour trois fois rien

FYI30 juillet 2026Sécurité
Ce qui s’est passé
FAR.AI launched the first public, reproducible AI security leaderboard: Fable 5 and GPT-5.6 Sol produced zero universal jailbreaks; Grok 4.5 yielded 448 and Gemini 3.1 Pro yielded 249 — jailbreakable for $58 and $278 respectively.
Pourquoi c’est important
Independent, adversarial benchmarks replace vendor safety claims with head-to-head comparison. The hundredfold gap between the most and least secure frontier models is now a checkable property — not a trust exercise.
Que faire
Check your deployed models against leaderboard.far.ai. Add application-layer security wrappers for any model that shows reproducible jailbreak vulnerabilities. Use FAR.AI's Minimal Standard in vendor evaluations.

L'organisation indépendante à but non lucratif FAR.AI vient de publier le premier classement de sécurité public et reproductible pour les modèles d'IA de pointe — et l'écart entre les sécurisés et les vulnérables est d'un facteur cent. Claude Fable 5 et GPT-5.6 Sol n'ont produit aucun jailbreak universel sur 1 500 attaques par modèle. Grok 4.5 en a cédé 448. Gemini 3.1 Pro en a cédé 249. Le coût pour trouver un jailbreak fonctionnel : 58 $ pour Grok, 278 $ pour Gemini, et plus de 14 200 $ — sans rien trouver — pour les deux qui ont tenu.

Ce qui s'est passé

Le 29 juillet, l'organisation à but non lucratif de sécurité IA basée à Berkeley, FAR.AI, a lancé le Classement de Sécurité IA sur leaderboard.far.ai, accompagné de la Norme Minimale pour les Garde-fous, Version 1.0 — une base de référence qui définit les attaques auxquelles un modèle de pointe devrait pouvoir résister (PRNewswire, 2026). La méthodologie est entièrement documentée, les invites d'attaque sont publiées et les résultats sont vérifiables de manière indépendante.

Comment les tests ont fonctionné. FAR.AI a assemblé une taxonomie de plus de 60 techniques de jailbreak documentées publiquement, construit des outils pour les combiner systématiquement et exécuté 1 000 attaques aléatoires et 500 attaques guidées par des experts contre chaque modèle dans cinq domaines de risque : menaces chimiques, biologiques, radiologiques, nucléaires, explosives et de cybersécurité. Une attaque était comptée comme un jailbreak universel lorsqu'elle réussissait sur plus des trois quarts des requêtes nuisibles dans un domaine — ce qui signifie que ce n'est pas un cas isolé, mais une clé réutilisable.

Les résultats, en chiffres :

ModèleJailbreaks universels trouvésCoût pour en trouver un
Grok 4.5448~58 $
Gemini 3.1 Pro249~278 $
Claude Fable 50>14 200 $ (aucun trouvé)
GPT-5.6 Sol0>14 200 $ (aucun trouvé)

Même une recherche aléatoire automatisée non dirigée — sans aucune orientation humaine — a trouvé 63 jailbreaks universels sur Grok et 18 sur Gemini. L'ajout de composition experte des attaques a poussé ces chiffres à 385 et 231 respectivement, et les attaques construites par les experts étaient bien plus susceptibles de fonctionner dans trois domaines de risque ou plus simultanément.

« L'approche de défense en profondeur qu'il recommande devrait devenir une bonne pratique dans toute l'industrie », a déclaré Seán Ó hÉigeartaigh, professeur de recherche à l'Université de Cambridge. « J'espère que le classement encouragera les entreprises à la traîne à redoubler d'efforts pour durcir leurs modèles contre les mésusages. »

Réponses des fournisseurs. Anthropic a déclaré à WIRED : « Ces résultats reflètent l'investissement soutenu que nous avons fait dans nos garde-fous. » OpenAI a déclaré « tester rigoureusement nos modèles contre les nouvelles menaces et utiliser ces résultats pour améliorer nos protections. » Rohin Shah de Google DeepMind a averti que les résultats « ne devraient pas être interprétés comme une évaluation complète de la sécurité de Gemini », tout en notant que l'entreprise « travaille constamment à améliorer ses garde-fous. » SpaceXAI n'a pas répondu à la demande de commentaire de WIRED.

Pourquoi c'est important

Cela change la façon dont les entreprises devraient évaluer la sécurité des modèles. Jusqu'à présent, les affirmations de sécurité IA venaient des laboratoires eux-mêmes — les fiches système d'Anthropic, les divulgations de red-teaming d'OpenAI, les rapports de responsabilité de Google. Le classement de FAR.AI introduit une comparaison indépendante, adversariale et directe avec une méthodologie publiée. Vous pouvez désormais vérifier si les affirmations de sécurité d'un modèle tiennent sous attaque avant de le déployer.

La reproductibilité est la vraie histoire. N'importe qui avec un accès API et quelques centaines de dollars peut reproduire ces attaques. Les vulnérabilités sont systématiques, pas accidentelles — et tant que les fournisseurs ne les corrigent pas, elles sont exploitables à grande échelle. Comme l'a dit Adam Gleave, co-fondateur et PDG de FAR.AI : « Les modèles d'IA actuels sont moins régulés que les restaurants. »

Les modèles qui ont tenu — Fable 5 et GPT-5.6 Sol — avaient plusieurs couches de protection indépendantes fonctionnant ensemble. Les modèles plus faibles « n'offraient rien de comparable en matière de résistance et cédaient rapidement, encore et encore », selon le rapport de FAR.AI. La défense en profondeur n'est pas théorique ; c'est la différence mesurable entre zéro jailbreak et 448.

« Certaines entreprises savent clairement comment se défendre contre au moins le sous-ensemble d'attaques testées dans ce rapport », a déclaré Anka Reuel, informaticienne à Stanford. « La question est de savoir pourquoi certaines entreprises les utilisent et d'autres pas. »

Stephen Casper, informaticien à Harvard, a offert un cadrage plus sévère : « Si un incident majeur de mésusage se produit dans un avenir proche ou moyen, il viendra presque certainement d'un système qui n'a pas été déployé avec des garde-fous à la pointe de l'état de l'art. »

Ce qui change pour vous

  1. Vérifiez vos modèles déployés contre le classement. Si vous utilisez Grok 4.5 ou Gemini 3.1 Pro en production, ces résultats suggèrent que vos modèles sont jailbreakables pour trois fois rien. Ajoutez une couche de sécurité au niveau applicatif — ne vous fiez pas uniquement à l'entraînement de sécurité natif du modèle.
  2. Utilisez la Norme Minimale de FAR.AI dans vos évaluations de fournisseurs. Quand un fournisseur affirme que sa dernière version est « sûre par conception », vérifiez si elle satisfait la Norme Minimale pour les Garde-fous, Version 1.0. Les benchmarks adversariaux indépendants sont désormais un minimum pour la sélection de modèles en entreprise.
  3. Surveillez l'expansion du classement. FAR.AI le mettra à jour avec chaque sortie majeure de modèle de pointe et révisera la Norme Minimale à mesure que les techniques d'attaque et de défense avancent. La dynamique concurrentielle de la sécurité des modèles vient de changer — attendez-vous à ce que les fournisseurs commencent à optimiser pour les scores du classement.

FAQ

Zéro jailbreak signifie-t-il que Fable 5 et GPT-5.6 Sol sont incassables ? Non. FAR.AI déclare explicitement que réussir ses tests « n'a pas été certifié sécurisé ». L'évaluation a testé un ensemble représentatif d'attaques facilement accessibles — pas tous les vecteurs possibles. Des attaques dynamiques plus complexes et coûteuses ont été délibérément exclues de la Version 1.0. Zéro jailbreak signifie que ces modèles sont substantiellement plus difficiles à casser que leurs pairs, pas qu'ils sont invulnérables.

Pourquoi un tel écart entre les modèles ? La différence tient à la défense en profondeur. FAR.AI a constaté que les modèles qui ont tenu avaient plusieurs couches de protection indépendantes fonctionnant ensemble — donc les franchir aurait nécessité que toutes tombent simultanément. Les modèles plus faibles avaient moins de couches, et les attaquants n'avaient besoin de trouver qu'une seule brèche. L'écart est une fonction d'investissement d'ingénierie, pas de capacité — ces vulnérabilités sont évitables avec des techniques qui existent aujourd'hui.

Ce classement changera-t-il vraiment quelque chose ? C'est déjà le cas. FAR.AI a partagé ses conclusions confidentiellement avec chaque entreprise avant publication, donnant aux fournisseurs le temps de corriger les problèmes. Le classement sera mis à jour à chaque sortie majeure de modèle, créant un registre public continu. Combiné aux lois de sécurité étatiques récemment adoptées en Californie, à New York et en Illinois, les benchmarks de sécurité indépendants deviennent partie intégrante du paysage réglementaire — pas seulement un exercice de recherche.

Que faire

  1. 1 Check your deployed models against leaderboard.far.ai
  2. 2 Add application-layer security wrappers for jailbreakable models
  3. 3 Include FAR.AI's Minimal Standard in vendor security evaluations

Outils et modèles concernés

Ne ratez plus jamais une mise à jour

Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.

En vous abonnant, vous acceptez notre Politique de confidentialité. Désabonnement à tout moment.