GPT-5.6 Sol
OpenAI · Lançado 06/2026
O GPT-5.6 Sol é o modelo de fronteira mais custo-efetivo, liderando em benchmarks de codificação e competitivo em raciocínio complexo a uma fração do custo dos concorrentes. O veredicto é reforçado pela divulgação do endurecimento de segurança GPT-Red — o modelo foi treinado adversarialmente contra um modelo dedicado de red-teaming por RL de auto-jogo em escala de fronteira, tornando-o 6x mais robusto a injeções de prompt.
É adequada para ti?
Bom para
- TerminalBench 2.1 estado da arte: 88,8% base, 91,9% no modo Ultra com subagente — supera Mythos 5 (88,0%) e Fable 5 (84,3%). Sol Ultra está >3 pontos à frente de qualquer concorrente.
- Codificação de longo horizonte e tarefas agênticas: primeiro modelo a ultrapassar a metade no Agent's Last Exam (50,9%), com raciocínio máximo e modo ultra baseado em subagentes para decompor problemas difíceis.
- Cibersegurança e investigação de vulnerabilidades: iguala o Mythos Preview da Anthropic no ExploitBench com cerca de 1/3 dos tokens de saída. Pontuação CTF de 96,7% em testes internos. Forte descoberta de primitivas de exploit em Chromium e Firefox sem cruzar para exploração autónoma de cadeia completa.
- Biologia e raciocínio científico: aumento de ~9 pontos sobre o GPT-5.5 nas avaliações SecureBio (Human Pathogen 68,4%, Molecular Biology 60,0%). Mais forte no GeneBench v1 usando menos tokens. Útil para investigação biomédica legítima sob programas de acesso confiável.
- Lançamento controlado com stack de segurança pesada: classificadores de ativação, triagem de uso indevido em tempo real, 700K horas de GPU A100e em red teaming automatizado e recusas em camadas ao nível do modelo. Fortemente endurecido contra ataques adversariais com postura cibernética defensiva.
- Revisão do cache de prompts: breakpoints de cache explícitos, vida mínima de cache de 30 minutos, escritas de cache a 1,25x da taxa de entrada, leituras de cache com 90% de desconto. Torna as sessões agênticas de longa duração muito mais previsíveis em custo.
Não recomendado para
- Pré-visualização limitada com restrição governamental sem acesso público: apenas ~20 organizações recebem acesso, e a disponibilidade geral é prometida 'nas próximas semanas' mas não garantida. Não pode testar este modelo nas suas próprias cargas de trabalho hoje.
- Não testado em bases de código reais desorganizadas: todos os benchmarks publicados são executados pelo fornecedor sob harness do fornecedor. A diferença de 0,8 pontos sobre o Mythos 5 no TerminalBench está dentro do ruído de medição — são um empate estatístico.
- A $5/$30 por 1M tokens, o Sol iguala o preço do GPT-5.5 para um grande aumento de capacidade — mas o GPT-5.6 Terra oferece desempenho de classe GPT-5.5 a metade do custo ($2,50/$15). O Sol deve ser reservado apenas para as tarefas mais difíceis.
Desempenho por tarefa
Codificação agêntica
Estado da arte no TerminalBench 2.1 com 88,8% (91,9% Ultra). A diferença sobre o campo é real. A decomposição por subagentes do modo Ultra é um avanço arquitetónico genuíno para tarefas de codificação de longo horizonte.
Cibersegurança
Iguala o Mythos Preview no ExploitBench com 1/3 dos tokens. 96,7% CTF. Pode encontrar vulnerabilidades e primitivas de exploit mas não produziu autonomamente exploits de cadeia completa. Postura defensiva por design.
Raciocínio científico (biologia)
Aumento de ~9 pontos sobre o GPT-5.5 nas avaliações de biologia SecureBio. Forte no GeneBench v1. Human Pathogen Capabilities a 68,4%. Classificação de alto risco significa acesso restrito para fluxos de biologia sensíveis.
Raciocínio de longo horizonte
Primeiro modelo a ultrapassar 50% no Agent's Last Exam (50,9% modo código). Modo de raciocínio máximo e modo ultra com subagente empurram a profundidade de raciocínio mais longe que qualquer modelo anterior.
Uso geral diário
Exagerado para tarefas de rotina. Terra é a melhor escolha para trabalho diário a metade do custo com capacidade de classe GPT-5.5. Sol deve ser reservado para problemas onde os erros de um modelo mais fraco são caros.
Preços
Entrada
$5 / 1M tokens
Saída
$30 / 1M tokens
Contexto
Same rate card as GPT-5.5. Ultra mode costs more.
Testes de desempenho
| Teste | Pontuação | Fonte |
|---|---|---|
| TerminalBench 2.1 (base) | 88.8% | Fonte |
| TerminalBench 2.1 (Ultra) | 91.9% | Fonte |
| Agent's Last Exam (code mode) | 50.9% | Fonte |
| SecureBio: Human Pathogen Capabilities | 68.4% | Fonte |
| SecureBio: World-Class Biology | 68.3% | Fonte |
| SecureBio: Molecular Biology | 60.0% | Fonte |
| SecureBio: Virology Capabilities Test | 53.5% | Fonte |
| Internal CTF (capture-the-flag) | 96.7% | Fonte |
Histórico de veredictos
Fontes
Registo de verificação
- Preços— Sem alterações
Agente automatizado
- Preços— Sem alterações
Agente automatizado
- Estado— Atualizado
Agente automatizado
Summary re-dated to Jul 7 2026 and made explicit about what is awaited: stays pending pending GA + independent benchmarks; still government-gated (~20 orgs); Sol Ultra confirmed for Codex Jul 6 by Sottiaux, prediction markets pricing Jul 9 GA (unconfirmed). Verdict unchanged (pending).
- Preços— Sem alterações
Agente automatizado
- Preços— Sem alterações
Agente automatizado
Pricing unchanged: $5/$30 per 1M tokens. Government-gated limited preview (~20 orgs). Confirmed by OpenAI blog and aipricing.guru.
- Perfil— Sem alterações
Importado no lançamento
- Preços— Sem alterações
Importado no lançamento