GPT-5.6 Sol logo

GPT-5.6 Sol

OpenAI · Veröffentlicht Juni 2026

Empfohlen

GPT-5.6 Sol ist das kosteneffizienteste Frontier-Modell — führend bei Coding-Benchmarks und konkurrenzfähig bei hartem Reasoning zu einem Bruchteil der Kosten vergleichbarer Modelle. Das Urteil wird durch die GPT-Red-Offenlegung zur Sicherheitshärtung gestärkt: Das Modell wurde adversarial gegen ein dediziertes Self-Play-RL-Red-Teaming-Modell im Frontier-Maßstab trainiert und ist dadurch 6x robuster gegen Prompt-Injections.

Ist es das Richtige für dich?

Gut für

  • TerminalBench 2.1 State-of-the-Art: 88,8 % Basis, 91,9 % im Ultra-Subagent-Modus — schlägt Mythos 5 (88,0 %) und Fable 5 (84,3 %). Sol Ultra liegt >3 Punkte vor jedem Konkurrenten.
  • Langfristige Coding- und agentenbasierte Aufgaben: erstes Modell über der 50-%-Marke bei Agent's Last Exam (50,9 %), mit Max-Reasoning und subagentenbasiertem Ultra-Modus zur Zerlegung harter Probleme.
  • Cybersicherheit und Schwachstellenforschung: erreicht Anthropic Mythos Preview auf ExploitBench mit etwa einem Drittel der Ausgabe-Tokens. CTF-Ergebnis von 96,7 % in internen Tests. Starke Exploit-Primitive-Erkennung in Chromium und Firefox ohne Übergang zu autonomer Full-Chain-Exploitation.
  • Biologie und wissenschaftliches Reasoning: ~9 Punkte Verbesserung gegenüber GPT-5.5 bei SecureBio-Evaluierungen (Human Pathogen 68,4 %, Molecular Biology 60,0 %). Stärker bei GeneBench v1 mit weniger Tokens. Nützlich für legitime biomedizinische Forschung unter Trusted-Access-Programmen.
  • Kontrollierte Veröffentlichung mit schwerem Sicherheits-Stack: Activation Classifier, Echtzeit-Missbrauchserkennung, 700K A100e GPU-Stunden automatisiertes Red Teaming und mehrschichtige modellbasierte Ablehnungen. Stark gehärtet gegen adversariale Angriffe mit defensiver Cyber-Haltung.
  • Prompt-Caching-Überarbeitung: explizite Cache-Breakpoints, mindestens 30 Minuten Cache-Lebensdauer, Cache-Schreibvorgänge zum 1,25-fachen Eingabepreis, Cache-Lesevorgänge mit 90 % Rabatt. Macht langlaufende agentenbasierte Sessions weitaus kostenvorhersagbarer.

Nicht geeignet für

  • Regierungsbeschränkte Vorschau ohne öffentlichen Zugang: nur ~20 Organisationen erhalten Zugang, allgemeine Verfügbarkeit ist 'in den kommenden Wochen' versprochen, aber nicht garantiert. Du kannst dieses Modell heute nicht mit deinen eigenen Workloads testen.
  • Ungetestet an realen, unordentlichen Codebasen: alle veröffentlichten Benchmarks sind anbietergeführt unter Anbieter-Harness. Der 0,8-Punkte-Vorsprung vor Mythos 5 auf TerminalBench liegt innerhalb des Messrauschens — ein statistisches Unentschieden.
  • Mit 5/30 $ pro 1M Tokens entspricht Sol den GPT-5.5-Preisen bei einem deutlichen Leistungssprung — aber GPT-5.6 Terra liefert GPT-5.5-Niveau zum halben Preis (2,50/15 $). Sol sollte nur für die härtesten Aufgaben reserviert sein.

Leistung nach Aufgabe

Agentenbasiertes Programmieren

Excellent

State-of-the-Art bei TerminalBench 2.1 mit 88,8 % (91,9 % Ultra). Der Vorsprung vor dem Feld ist real. Die Subagent-Zerlegung des Ultra-Modus ist ein echter architektonischer Fortschritt für langfristige Coding-Aufgaben.

Cybersicherheit

Excellent

Erreicht Mythos Preview auf ExploitBench mit einem Drittel der Tokens. 96,7 % CTF. Kann Schwachstellen und Exploit-Primitive finden, produzierte aber keine autonomen Full-Chain-Exploits. Defensive Haltung by Design.

Wissenschaftliches Reasoning (Biologie)

Very Good

~9 Punkte Verbesserung gegenüber GPT-5.5 bei SecureBio-Biologie-Evaluierungen. Stark bei GeneBench v1. Human Pathogen Capabilities bei 68,4 %. Hohe Risikoeinstufung bedeutet Zugangsbeschränkung für sensible Biologie-Workflows.

Langfristiges Reasoning

Excellent

Erstes Modell über 50 % bei Agent's Last Exam (50,9 % Code-Modus). Max-Reasoning-Modus und Ultra-Subagent-Modus treiben die Reasoning-Tiefe weiter als jedes vorherige Modell.

Alltägliche Nutzung

Good

Overkill für Routineaufgaben. Terra ist die bessere Wahl für die tägliche Arbeit zum halben Preis mit GPT-5.5-Niveau. Sol sollte für Probleme reserviert sein, bei denen Fehler eines schwächeren Modells teuer sind.

Preise

Eingabe

$5 / 1M tokens

Ausgabe

$30 / 1M tokens

Kontext

Same rate card as GPT-5.5. Ultra mode costs more.

Alle Preise ansehen

Benchmarks

BenchmarkWertQuelle
TerminalBench 2.1 (base)88.8% Quelle
TerminalBench 2.1 (Ultra)91.9% Quelle
Agent's Last Exam (code mode)50.9% Quelle
SecureBio: Human Pathogen Capabilities68.4% Quelle
SecureBio: World-Class Biology68.3% Quelle
SecureBio: Molecular Biology60.0% Quelle
SecureBio: Virology Capabilities Test53.5% Quelle
Internal CTF (capture-the-flag)96.7% Quelle

Urteilsverlauf

16. Juli 2026
recommended → recommended (reinforced) — GPT-Red disclosure demonstrates frontier-scale safety investment alongside capability — the model was trained against an automated red-teamer achieving 84% attack success (6.5x human baseline) and emerged 6x more robust. This reinforces the existing Recommended stance rather than changing it.
12. Juli 2026
pending -> recommended — GPT-5.6 Sol leads the DeepSWE coding-agent benchmark at 72-73% vs Fable 5's 70% at one-third the cost, and tops the AI Analysis Coding Agent Index at 80 points. These are the independent benchmarks the directory was waiting for.
12. Juli 2026
pending -> recommended — UK AISI confirms GPT-5.6 Sol carries equivalent cyber vulnerabilities to Fable 5 — every frontier model shares this risk, which does not diminish Sol's coding and cost advantages. Vulnerability equivalence is now table stakes for frontier models.

Prüfprotokoll

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Status— Aktualisiert

    Automatisierter Agent

    Summary re-dated to Jul 7 2026 and made explicit about what is awaited: stays pending pending GA + independent benchmarks; still government-gated (~20 orgs); Sol Ultra confirmed for Codex Jul 6 by Sottiaux, prediction markets pricing Jul 9 GA (unconfirmed). Verdict unchanged (pending).

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Preise— Keine Änderungen

    Automatisierter Agent

    Pricing unchanged: $5/$30 per 1M tokens. Government-gated limited preview (~20 orgs). Confirmed by OpenAI blog and aipricing.guru.

  • Profil— Keine Änderungen

    Beim Start importiert

  • Preise— Keine Änderungen

    Beim Start importiert

Wie wir bewerten