GPT-5.6 Sol
OpenAI · Veröffentlicht Juni 2026
GPT-5.6 Sol ist das kosteneffizienteste Frontier-Modell — führend bei Coding-Benchmarks und konkurrenzfähig bei hartem Reasoning zu einem Bruchteil der Kosten vergleichbarer Modelle. Das Urteil wird durch die GPT-Red-Offenlegung zur Sicherheitshärtung gestärkt: Das Modell wurde adversarial gegen ein dediziertes Self-Play-RL-Red-Teaming-Modell im Frontier-Maßstab trainiert und ist dadurch 6x robuster gegen Prompt-Injections.
Ist es das Richtige für dich?
Gut für
- TerminalBench 2.1 State-of-the-Art: 88,8 % Basis, 91,9 % im Ultra-Subagent-Modus — schlägt Mythos 5 (88,0 %) und Fable 5 (84,3 %). Sol Ultra liegt >3 Punkte vor jedem Konkurrenten.
- Langfristige Coding- und agentenbasierte Aufgaben: erstes Modell über der 50-%-Marke bei Agent's Last Exam (50,9 %), mit Max-Reasoning und subagentenbasiertem Ultra-Modus zur Zerlegung harter Probleme.
- Cybersicherheit und Schwachstellenforschung: erreicht Anthropic Mythos Preview auf ExploitBench mit etwa einem Drittel der Ausgabe-Tokens. CTF-Ergebnis von 96,7 % in internen Tests. Starke Exploit-Primitive-Erkennung in Chromium und Firefox ohne Übergang zu autonomer Full-Chain-Exploitation.
- Biologie und wissenschaftliches Reasoning: ~9 Punkte Verbesserung gegenüber GPT-5.5 bei SecureBio-Evaluierungen (Human Pathogen 68,4 %, Molecular Biology 60,0 %). Stärker bei GeneBench v1 mit weniger Tokens. Nützlich für legitime biomedizinische Forschung unter Trusted-Access-Programmen.
- Kontrollierte Veröffentlichung mit schwerem Sicherheits-Stack: Activation Classifier, Echtzeit-Missbrauchserkennung, 700K A100e GPU-Stunden automatisiertes Red Teaming und mehrschichtige modellbasierte Ablehnungen. Stark gehärtet gegen adversariale Angriffe mit defensiver Cyber-Haltung.
- Prompt-Caching-Überarbeitung: explizite Cache-Breakpoints, mindestens 30 Minuten Cache-Lebensdauer, Cache-Schreibvorgänge zum 1,25-fachen Eingabepreis, Cache-Lesevorgänge mit 90 % Rabatt. Macht langlaufende agentenbasierte Sessions weitaus kostenvorhersagbarer.
Nicht geeignet für
- Regierungsbeschränkte Vorschau ohne öffentlichen Zugang: nur ~20 Organisationen erhalten Zugang, allgemeine Verfügbarkeit ist 'in den kommenden Wochen' versprochen, aber nicht garantiert. Du kannst dieses Modell heute nicht mit deinen eigenen Workloads testen.
- Ungetestet an realen, unordentlichen Codebasen: alle veröffentlichten Benchmarks sind anbietergeführt unter Anbieter-Harness. Der 0,8-Punkte-Vorsprung vor Mythos 5 auf TerminalBench liegt innerhalb des Messrauschens — ein statistisches Unentschieden.
- Mit 5/30 $ pro 1M Tokens entspricht Sol den GPT-5.5-Preisen bei einem deutlichen Leistungssprung — aber GPT-5.6 Terra liefert GPT-5.5-Niveau zum halben Preis (2,50/15 $). Sol sollte nur für die härtesten Aufgaben reserviert sein.
Leistung nach Aufgabe
Agentenbasiertes Programmieren
State-of-the-Art bei TerminalBench 2.1 mit 88,8 % (91,9 % Ultra). Der Vorsprung vor dem Feld ist real. Die Subagent-Zerlegung des Ultra-Modus ist ein echter architektonischer Fortschritt für langfristige Coding-Aufgaben.
Cybersicherheit
Erreicht Mythos Preview auf ExploitBench mit einem Drittel der Tokens. 96,7 % CTF. Kann Schwachstellen und Exploit-Primitive finden, produzierte aber keine autonomen Full-Chain-Exploits. Defensive Haltung by Design.
Wissenschaftliches Reasoning (Biologie)
~9 Punkte Verbesserung gegenüber GPT-5.5 bei SecureBio-Biologie-Evaluierungen. Stark bei GeneBench v1. Human Pathogen Capabilities bei 68,4 %. Hohe Risikoeinstufung bedeutet Zugangsbeschränkung für sensible Biologie-Workflows.
Langfristiges Reasoning
Erstes Modell über 50 % bei Agent's Last Exam (50,9 % Code-Modus). Max-Reasoning-Modus und Ultra-Subagent-Modus treiben die Reasoning-Tiefe weiter als jedes vorherige Modell.
Alltägliche Nutzung
Overkill für Routineaufgaben. Terra ist die bessere Wahl für die tägliche Arbeit zum halben Preis mit GPT-5.5-Niveau. Sol sollte für Probleme reserviert sein, bei denen Fehler eines schwächeren Modells teuer sind.
Preise
Eingabe
$5 / 1M tokens
Ausgabe
$30 / 1M tokens
Kontext
Same rate card as GPT-5.5. Ultra mode costs more.
Benchmarks
| Benchmark | Wert | Quelle |
|---|---|---|
| TerminalBench 2.1 (base) | 88.8% | Quelle |
| TerminalBench 2.1 (Ultra) | 91.9% | Quelle |
| Agent's Last Exam (code mode) | 50.9% | Quelle |
| SecureBio: Human Pathogen Capabilities | 68.4% | Quelle |
| SecureBio: World-Class Biology | 68.3% | Quelle |
| SecureBio: Molecular Biology | 60.0% | Quelle |
| SecureBio: Virology Capabilities Test | 53.5% | Quelle |
| Internal CTF (capture-the-flag) | 96.7% | Quelle |
Urteilsverlauf
Quellen
Prüfprotokoll
- Preise— Keine Änderungen
Automatisierter Agent
- Preise— Keine Änderungen
Automatisierter Agent
- Status— Aktualisiert
Automatisierter Agent
Summary re-dated to Jul 7 2026 and made explicit about what is awaited: stays pending pending GA + independent benchmarks; still government-gated (~20 orgs); Sol Ultra confirmed for Codex Jul 6 by Sottiaux, prediction markets pricing Jul 9 GA (unconfirmed). Verdict unchanged (pending).
- Preise— Keine Änderungen
Automatisierter Agent
- Preise— Keine Änderungen
Automatisierter Agent
Pricing unchanged: $5/$30 per 1M tokens. Government-gated limited preview (~20 orgs). Confirmed by OpenAI blog and aipricing.guru.
- Profil— Keine Änderungen
Beim Start importiert
- Preise— Keine Änderungen
Beim Start importiert