Leaderboard de Segurança FAR.AI: Fable 5 e GPT-5.6 Sol Não Falham; Grok e Gemini Quebram por Troco

FYI30 de julho de 2026Segurança
O que aconteceu
FAR.AI launched the first public, reproducible AI security leaderboard: Fable 5 and GPT-5.6 Sol produced zero universal jailbreaks; Grok 4.5 yielded 448 and Gemini 3.1 Pro yielded 249 — jailbreakable for $58 and $278 respectively.
Porque é importante
Independent, adversarial benchmarks replace vendor safety claims with head-to-head comparison. The hundredfold gap between the most and least secure frontier models is now a checkable property — not a trust exercise.
O que fazer
Check your deployed models against leaderboard.far.ai. Add application-layer security wrappers for any model that shows reproducible jailbreak vulnerabilities. Use FAR.AI's Minimal Standard in vendor evaluations.

A organização independente sem fins lucrativos FAR.AI acaba de publicar o primeiro leaderboard público e reproduzível de segurança para modelos de IA de fronteira — e a diferença entre o seguro e o vulnerável é de cem vezes. Claude Fable 5 e GPT-5.6 Sol produziram zero jailbreaks universais em 1.500 ataques por modelo. Grok 4.5 produziu 448. Gemini 3.1 Pro produziu 249. O custo para encontrar um jailbreak funcional: $58 para Grok, $278 para Gemini, e mais de $14.200 — sem nada encontrado — para os dois que resistiram.

O que aconteceu

Em 29 de julho, a organização sem fins lucrativos de segurança de IA FAR.AI, sediada em Berkeley, lançou o AI Security Leaderboard em leaderboard.far.ai(abre num novo separador), junto com o Minimal Standard for Safeguards, Versão 1.0 — uma linha de base que define os ataques que um modelo de fronteira deveria ser capaz de suportar (PRNewswire(abre num novo separador), 2026). A metodologia está totalmente documentada, os prompts de ataque são publicados e os resultados são independentemente verificáveis.

Como os testes funcionaram. A FAR.AI montou uma taxonomia de mais de 60 técnicas de jailbreak publicamente documentadas, construiu ferramentas para combiná-las sistematicamente e executou 1.000 ataques montados aleatoriamente e 500 ataques guiados por especialistas contra cada modelo em cinco domínios de risco: ameaças químicas, biológicas, radiológicas, nucleares, explosivas e de cibersegurança. Um ataque contou como jailbreak universal quando teve sucesso em mais de três quartos das solicitações nocivas em um domínio — significando que não é um caso isolado, mas uma chave reutilizável.

Os resultados, em números:

ModeloJailbreaks universais encontradosCusto para encontrar um
Grok 4.5448~$58
Gemini 3.1 Pro249~$278
Claude Fable 50>$14.200 (nenhum encontrado)
GPT-5.6 Sol0>$14.200 (nenhum encontrado)

Mesmo a busca aleatória automatizada, sem direcionamento — sem nenhuma orientação humana — encontrou 63 jailbreaks universais no Grok e 18 no Gemini. Adicionar composição especializada de ataques elevou esses números para 385 e 231 respectivamente, e os ataques construídos por especialistas foram muito mais propensos a funcionar em três ou mais domínios de risco simultaneamente.

"A abordagem de defesa em profundidade que ele recomenda deveria se tornar prática recomendada em toda a indústria," disse Seán Ó hÉigeartaigh, Professor de Pesquisa da Universidade de Cambridge. "Espero que o leaderboard incentive empresas atrasadas a redobrarem seus esforços para fortalecer modelos contra uso indevido."

Respostas dos fornecedores. A Anthropic disse à WIRED(abre num novo separador): "Estes achados refletem o investimento sustentado que fizemos em nossas salvaguardas." A OpenAI disse que "testa rigorosamente nossos modelos contra novas ameaças e usa esses achados para melhorar nossas proteções." Rohin Shah, do Google DeepMind, alertou que os resultados "não devem ser interpretados como uma avaliação abrangente da segurança do Gemini," observando que a empresa está "constantemente trabalhando para melhorar nossas salvaguardas." A SpaceXAI não respondeu ao pedido de comentário da WIRED.

Por que isso importa

Isso muda como as empresas devem avaliar a segurança de modelos. Até agora, alegações de segurança de IA vinham dos próprios laboratórios — system cards da Anthropic, divulgações de red-teaming da OpenAI, relatórios de responsabilidade do Google. O leaderboard da FAR.AI introduz comparação independente, adversarial e direta com metodologia publicada. Agora você pode verificar se as alegações de segurança de um modelo resistem sob ataque antes de implantá-lo.

A replicabilidade é a verdadeira história. Qualquer pessoa com acesso à API e algumas centenas de dólares pode reproduzir esses ataques. As vulnerabilidades são sistemáticas, não incidentais — e até que os fornecedores as corrijam, são exploráveis em escala. Como disse Adam Gleave, cofundador e CEO da FAR.AI: "Modelos de IA hoje são menos regulados que restaurantes."

Os modelos que resistiram — Fable 5 e GPT-5.6 Sol — tinham várias camadas independentes de proteção trabalhando juntas. Os modelos mais fracos "não ofereceram nada parecido com essa resistência e cederam rapidamente, repetidas vezes," segundo o relatório da FAR.AI. Defesa em profundidade não é teórica; é a diferença mensurável entre zero jailbreaks e 448.

"Algumas empresas claramente sabem como se defender contra pelo menos o subconjunto de ataques testados neste relatório," disse Anka Reuel, cientista da computação em Stanford. "A pergunta é por que algumas empresas estão usando essas defesas e outras não."

Stephen Casper, cientista da computação em Harvard, ofereceu um enquadramento mais duro: "Se um grande incidente de uso indevido acontecer no futuro próximo ou de médio prazo, será quase certamente de um sistema que não foi implantado com salvaguardas de última geração."

O que muda para você

  1. Verifique seus modelos implantados contra o leaderboard. Se você está rodando Grok 4.5 ou Gemini 3.1 Pro em produção, esses resultados sugerem que seus modelos podem sofrer jailbreak por troco. Adicione uma camada de segurança no nível da aplicação — não dependa apenas do treinamento de segurança nativo do modelo.
  2. Use o Minimal Standard da FAR.AI em avaliações de fornecedores. Quando um fornecedor alega que seu lançamento mais recente é "seguro por design," verifique se atende ao Minimal Standard for Safeguards, Versão 1.0. Benchmarks adversariais independentes agora são requisitos básicos para seleção empresarial de modelos.
  3. Observe o leaderboard se expandir. A FAR.AI atualizará com cada grande lançamento de modelo de fronteira e revisará o Minimal Standard conforme as técnicas de ataque e defesa avançam. A dinâmica competitiva da segurança de modelos acaba de mudar — espere que fornecedores comecem a otimizar para pontuações no leaderboard.

FAQ

Zero jailbreaks significa que Fable 5 e GPT-5.6 Sol são inquebráveis? Não. A FAR.AI declara explicitamente que passar em seus testes "não certifica o modelo como seguro." A avaliação testou um conjunto representativo de ataques prontamente acessíveis — não todos os vetores possíveis. Ataques dinâmicos mais complexos e caros foram deliberadamente excluídos da Versão 1.0. Zero jailbreaks significa que esses modelos são substancialmente mais difíceis de quebrar do que seus pares, não que sejam invulneráveis.

Por que existe uma diferença tão grande entre modelos? A diferença se resume à defesa em profundidade. A FAR.AI descobriu que os modelos que resistiram tinham várias camadas independentes de proteção operando juntas — de modo que atravessá-las exigiria que todas falhassem simultaneamente. Os modelos mais fracos tinham menos camadas, e os atacantes só precisavam encontrar uma brecha. A diferença é função de investimento em engenharia, não de capacidade — essas vulnerabilidades são preveníveis com técnicas que existem hoje.

Esse leaderboard realmente mudará alguma coisa? Já está mudando. A FAR.AI compartilhou os achados confidencialmente com cada empresa antes da publicação, dando tempo para corrigir problemas. O leaderboard será atualizado a cada grande lançamento de modelo, criando um registro público contínuo. Combinado com leis estaduais de segurança recentemente aprovadas na Califórnia, Nova York e Illinois, benchmarks de segurança independentes estão se tornando parte do cenário regulatório — não apenas um exercício de pesquisa.

O que fazer

  1. 1 Check your deployed models against leaderboard.far.ai
  2. 2 Add application-layer security wrappers for jailbreakable models
  3. 3 Include FAR.AI's Minimal Standard in vendor security evaluations

Ferramentas e modelos afetados

Nunca mais precisas de te pôr a par

O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.

Ao subscreveres, aceitas a nossa Política de Privacidade. Cancela a subscrição quando quiseres.