GPT-5.6 Sol
OpenAI · Sorti juin 2026
GPT-5.6 Sol est le modèle frontière le plus rentable, en tête des benchmarks de codage et compétitif sur les raisonnements difficiles pour une fraction du coût de ses pairs. Verdict renforcé par la divulgation du durcissement de sécurité GPT-Red — le modèle a été entraîné de manière adversariale contre un modèle de red teaming dédié en self-play RL à l'échelle frontière, le rendant 6x plus robuste aux injections de prompt.
Est-ce fait pour vous ?
Recommandé pour
- État de l'art sur TerminalBench 2.1 : 88,8% en base, 91,9% en mode Ultra avec sous-agents — dépasse Mythos 5 (88,0%) et Fable 5 (84,3%). Sol Ultra a plus de 3 points d'avance sur tout concurrent.
- Codage à horizon long et tâches agentiques : premier modèle à dépasser la moitié sur Agent's Last Exam (50,9%), avec raisonnement max et mode ultra à base de sous-agents pour décomposer les problèmes difficiles.
- Cybersécurité et recherche de vulnérabilités : égale Mythos Preview d'Anthropic sur ExploitBench avec environ 1/3 des tokens de sortie. Score CTF de 96,7% en test interne. Forte découverte de primitives d'exploit dans Chromium et Firefox.
- Biologie et raisonnement scientifique : gain d'environ 9 points sur GPT-5.5 aux évaluations SecureBio (Human Pathogen 68,4%, Molecular Biology 60,0%). Plus performant sur GeneBench v1 en utilisant moins de tokens.
- Déploiement contrôlé avec pile de sécurité renforcée : classificateurs d'activation, filtrage en temps réel, 700K heures GPU A100e de red teaming automatisé et refus multicouches au niveau du modèle.
- Refonte du cache de prompts : points d'arrêt explicites, durée de vie minimale de 30 minutes, écriture cache à 1,25x le taux d'entrée, lecture cache avec 90% de réduction. Rend les sessions agentiques longues bien plus prévisibles en coût.
Déconseillé pour
- Preview limitée restreinte par le gouvernement sans accès public : seules ~20 organisations reçoivent un accès, et la disponibilité générale est promise mais non garantie. Vous ne pouvez pas tester ce modèle aujourd'hui.
- Non testé sur des codebases réelles : tous les benchmarks publiés sont internes au fournisseur. L'écart de 0,8 point sur Mythos 5 sur TerminalBench est dans la marge de bruit de mesure.
- À $5/$30 par 1M tokens, Sol égale le prix de GPT-5.5 pour un bond de capacité majeur — mais GPT-5.6 Terra offre des performances de classe GPT-5.5 à moitié coût ($2,50/$15). Sol devrait être réservé aux tâches les plus difficiles.
Performances par tâche
Codage agentique
État de l'art sur TerminalBench 2.1 à 88,8% (91,9% Ultra). L'avance sur le peloton est réelle. La décomposition en sous-agents du mode Ultra est une avancée architecturale réelle.
Cybersécurité
Égale Mythos Preview sur ExploitBench avec 1/3 des tokens. 96,7% CTF. Peut trouver des vulnérabilités et des primitives d'exploit. Posture défensive par conception.
Raisonnement scientifique (biologie)
Gain d'environ 9 points sur GPT-5.5 aux évaluations SecureBio. Fort sur GeneBench v1. Human Pathogen Capabilities à 68,4%. Accès restreint pour les workflows sensibles.
Raisonnement à horizon long
Premier modèle au-delà de 50% sur Agent's Last Exam (50,9% mode code). Le mode max reasoning et le mode ultra sous-agents poussent la profondeur de raisonnement plus loin que tout modèle antérieur.
Usage général quotidien
Surdimensionné pour les tâches routinières. Terra est le meilleur choix pour le travail quotidien à moitié prix avec des capacités de classe GPT-5.5. Sol devrait être réservé aux problèmes où les erreurs d'un modèle plus faible coûtent cher.
Tarifs
Entrée
$5 / 1M tokens
Sortie
$30 / 1M tokens
Contexte
Same rate card as GPT-5.5. Ultra mode costs more.
Tests de performance
| Test | Score | Source |
|---|---|---|
| TerminalBench 2.1 (base) | 88.8% | Source |
| TerminalBench 2.1 (Ultra) | 91.9% | Source |
| Agent's Last Exam (code mode) | 50.9% | Source |
| SecureBio: Human Pathogen Capabilities | 68.4% | Source |
| SecureBio: World-Class Biology | 68.3% | Source |
| SecureBio: Molecular Biology | 60.0% | Source |
| SecureBio: Virology Capabilities Test | 53.5% | Source |
| Internal CTF (capture-the-flag) | 96.7% | Source |
Historique des verdicts
Sources
Journal de vérification
- Tarifs— Aucun changement
Agent automatisé
- Tarifs— Aucun changement
Agent automatisé
- Statut— Mis à jour
Agent automatisé
Summary re-dated to Jul 7 2026 and made explicit about what is awaited: stays pending pending GA + independent benchmarks; still government-gated (~20 orgs); Sol Ultra confirmed for Codex Jul 6 by Sottiaux, prediction markets pricing Jul 9 GA (unconfirmed). Verdict unchanged (pending).
- Tarifs— Aucun changement
Agent automatisé
- Tarifs— Aucun changement
Agent automatisé
Pricing unchanged: $5/$30 per 1M tokens. Government-gated limited preview (~20 orgs). Confirmed by OpenAI blog and aipricing.guru.
- Profil— Aucun changement
Importé au lancement
- Tarifs— Aucun changement
Importé au lancement