GPT-5.6 Sol logo

GPT-5.6 Sol

OpenAI · Lançado 06/2026

Recomendado

O GPT-5.6 Sol é o modelo de fronteira mais custo-efetivo, liderando em benchmarks de codificação e competitivo em raciocínio complexo a uma fração do custo dos concorrentes. O veredicto é reforçado pela divulgação do endurecimento de segurança GPT-Red — o modelo foi treinado adversarialmente contra um modelo dedicado de red-teaming por RL de auto-jogo em escala de fronteira, tornando-o 6x mais robusto a injeções de prompt.

É adequada para ti?

Bom para

  • TerminalBench 2.1 estado da arte: 88,8% base, 91,9% no modo Ultra com subagente — supera Mythos 5 (88,0%) e Fable 5 (84,3%). Sol Ultra está >3 pontos à frente de qualquer concorrente.
  • Codificação de longo horizonte e tarefas agênticas: primeiro modelo a ultrapassar a metade no Agent's Last Exam (50,9%), com raciocínio máximo e modo ultra baseado em subagentes para decompor problemas difíceis.
  • Cibersegurança e investigação de vulnerabilidades: iguala o Mythos Preview da Anthropic no ExploitBench com cerca de 1/3 dos tokens de saída. Pontuação CTF de 96,7% em testes internos. Forte descoberta de primitivas de exploit em Chromium e Firefox sem cruzar para exploração autónoma de cadeia completa.
  • Biologia e raciocínio científico: aumento de ~9 pontos sobre o GPT-5.5 nas avaliações SecureBio (Human Pathogen 68,4%, Molecular Biology 60,0%). Mais forte no GeneBench v1 usando menos tokens. Útil para investigação biomédica legítima sob programas de acesso confiável.
  • Lançamento controlado com stack de segurança pesada: classificadores de ativação, triagem de uso indevido em tempo real, 700K horas de GPU A100e em red teaming automatizado e recusas em camadas ao nível do modelo. Fortemente endurecido contra ataques adversariais com postura cibernética defensiva.
  • Revisão do cache de prompts: breakpoints de cache explícitos, vida mínima de cache de 30 minutos, escritas de cache a 1,25x da taxa de entrada, leituras de cache com 90% de desconto. Torna as sessões agênticas de longa duração muito mais previsíveis em custo.

Não recomendado para

  • Pré-visualização limitada com restrição governamental sem acesso público: apenas ~20 organizações recebem acesso, e a disponibilidade geral é prometida 'nas próximas semanas' mas não garantida. Não pode testar este modelo nas suas próprias cargas de trabalho hoje.
  • Não testado em bases de código reais desorganizadas: todos os benchmarks publicados são executados pelo fornecedor sob harness do fornecedor. A diferença de 0,8 pontos sobre o Mythos 5 no TerminalBench está dentro do ruído de medição — são um empate estatístico.
  • A $5/$30 por 1M tokens, o Sol iguala o preço do GPT-5.5 para um grande aumento de capacidade — mas o GPT-5.6 Terra oferece desempenho de classe GPT-5.5 a metade do custo ($2,50/$15). O Sol deve ser reservado apenas para as tarefas mais difíceis.

Desempenho por tarefa

Codificação agêntica

Excellent

Estado da arte no TerminalBench 2.1 com 88,8% (91,9% Ultra). A diferença sobre o campo é real. A decomposição por subagentes do modo Ultra é um avanço arquitetónico genuíno para tarefas de codificação de longo horizonte.

Cibersegurança

Excellent

Iguala o Mythos Preview no ExploitBench com 1/3 dos tokens. 96,7% CTF. Pode encontrar vulnerabilidades e primitivas de exploit mas não produziu autonomamente exploits de cadeia completa. Postura defensiva por design.

Raciocínio científico (biologia)

Very Good

Aumento de ~9 pontos sobre o GPT-5.5 nas avaliações de biologia SecureBio. Forte no GeneBench v1. Human Pathogen Capabilities a 68,4%. Classificação de alto risco significa acesso restrito para fluxos de biologia sensíveis.

Raciocínio de longo horizonte

Excellent

Primeiro modelo a ultrapassar 50% no Agent's Last Exam (50,9% modo código). Modo de raciocínio máximo e modo ultra com subagente empurram a profundidade de raciocínio mais longe que qualquer modelo anterior.

Uso geral diário

Good

Exagerado para tarefas de rotina. Terra é a melhor escolha para trabalho diário a metade do custo com capacidade de classe GPT-5.5. Sol deve ser reservado para problemas onde os erros de um modelo mais fraco são caros.

Preços

Entrada

$5 / 1M tokens

Saída

$30 / 1M tokens

Contexto

Same rate card as GPT-5.5. Ultra mode costs more.

Ver preços completos

Testes de desempenho

TestePontuaçãoFonte
TerminalBench 2.1 (base)88.8% Fonte
TerminalBench 2.1 (Ultra)91.9% Fonte
Agent's Last Exam (code mode)50.9% Fonte
SecureBio: Human Pathogen Capabilities68.4% Fonte
SecureBio: World-Class Biology68.3% Fonte
SecureBio: Molecular Biology60.0% Fonte
SecureBio: Virology Capabilities Test53.5% Fonte
Internal CTF (capture-the-flag)96.7% Fonte

Histórico de veredictos

16/07/2026
recommended → recommended (reinforced) — GPT-Red disclosure demonstrates frontier-scale safety investment alongside capability — the model was trained against an automated red-teamer achieving 84% attack success (6.5x human baseline) and emerged 6x more robust. This reinforces the existing Recommended stance rather than changing it.
12/07/2026
pending -> recommended — GPT-5.6 Sol leads the DeepSWE coding-agent benchmark at 72-73% vs Fable 5's 70% at one-third the cost, and tops the AI Analysis Coding Agent Index at 80 points. These are the independent benchmarks the directory was waiting for.
12/07/2026
pending -> recommended — UK AISI confirms GPT-5.6 Sol carries equivalent cyber vulnerabilities to Fable 5 — every frontier model shares this risk, which does not diminish Sol's coding and cost advantages. Vulnerability equivalence is now table stakes for frontier models.

Registo de verificação

  • Preços— Sem alterações

    Agente automatizado

  • Preços— Sem alterações

    Agente automatizado

  • Estado— Atualizado

    Agente automatizado

    Summary re-dated to Jul 7 2026 and made explicit about what is awaited: stays pending pending GA + independent benchmarks; still government-gated (~20 orgs); Sol Ultra confirmed for Codex Jul 6 by Sottiaux, prediction markets pricing Jul 9 GA (unconfirmed). Verdict unchanged (pending).

  • Preços— Sem alterações

    Agente automatizado

  • Preços— Sem alterações

    Agente automatizado

    Pricing unchanged: $5/$30 per 1M tokens. Government-gated limited preview (~20 orgs). Confirmed by OpenAI blog and aipricing.guru.

  • Perfil— Sem alterações

    Importado no lançamento

  • Preços— Sem alterações

    Importado no lançamento

Como avaliamos