GPT-5.6 Sol schlägt Fable 5 auf DeepSWE bei einem Drittel der Kosten

OpenAI logoOpenAIUrteil geändert12. Juli 2026Modelle
Was ist passiert
GPT-5.6 Sol scored ~72–73% on the DeepSWE coding-agent benchmark to Fable 5's ~70%, at roughly one-third the cost per task ($8.40 vs $13–22).
Warum es wichtig ist
This is the first credible third-party benchmark since both models reached GA, and it reverses the expected outcome: the cheaper model wins on both performance and cost. Fable 5's $10/$50 credit-only pricing (starting tonight) is now empirically harder to justify.
Was zu tun ist
If you're choosing between GPT-5.6 Sol and Fable 5 for coding-agent workloads, the benchmark and pricing data both favor Sol. Run your own representative tasks — but the directional signal is clear.

GPT-5.6 Sol schlägt Fable 5 auf DeepSWE bei einem Drittel der Kosten

GPT-5.6 Sol hat Claude Fable 5 auf DeepSWE geschlagen — dem anspruchsvollsten verfügbaren Coding-Agent-Benchmark — und kostet dabei etwa ein Drittel pro Task. Die Zahlen kommen genau dann, wenn Fable 5s Abo-Zugangsfenster heute Nacht schließt.

DeepSWE ist kein Code-Generierungswettbewerb. Es setzt einen Agenten in ein echtes Open-Source-Repository mit einer gewünschten Änderung und prüft, ob der finale Patch tatsächlich funktioniert — 113 Aufgaben über 91 Repositories und 5 Sprachen hinweg, die Repo-Navigation, Bug-Diagnose, Code-Bearbeitung, Tool-Nutzung und mehrstufige Reparatur testen. Der Score bedeutet "wie viel Prozent realer Software-Engineering-Aufgaben wurden gelöst." GPT-5.6 Sol löste mehr davon, für weniger Geld.

Was passiert ist: GPT-5.6 Sol führt DeepSWE-Benchmark zu einem Drittel der Kosten an

Der unabhängige Evaluator Rohan Paul veröffentlichte den ersten glaubwürdigen Drittanbieter-DeepSWE-Benchmark-Vergleich seit beide Modelle allgemein verfügbar sind. GPT-5.6 Sol (max) erreichte etwa 72–73 % zu rund $8,40 pro Task, während Claude Fable 5 (max) etwa 70 % zu $13–22 pro Task erzielte (Rohan Paul(wird in einem neuen Tab geöffnet), 2026).

ModellDeepSWE-ScoreKosten pro TaskInput / Output Preise
GPT-5.6 Sol (max)~72–73 %~$8,40$5 / $30 pro 1M Tokens
Claude Fable 5 (max)~70 %$13–22$10 / $50 pro 1M Tokens

Der Artificial Analysis Coding Agent Index — der DeepSWE, Terminal-Bench v2 und SWE-Atlas-QnA über modellspezifische Harnesse hinweg kombiniert — bestätigt den Befund: GPT-5.6 Sol (max) in Codex führt mit 80 Punkten, vor Claude Fable 5 (max) in Claude Code mit 77 (Artificial Analysis(wird in einem neuen Tab geöffnet), 2026).

Im breiteren Intelligence Index erreicht Sol 59 zu Fable 5s 60 — ein Punkt zurück bei einem Drittel der Kosten pro Task ($1,04 vs. $2,75). Die Kostenlücke über Anthropics gesamte Produktlinie hinweg ist noch deutlicher:

  • GPT-5.6 Sol: 3x günstiger als Fable 5
  • GPT-5.6 Sol: 5–7x günstiger als Opus 4.8
  • GPT-5.6 Sol: 10x günstiger als Sonnet 5

Diese Multiplikatoren stammen aus der Analyse des International Cyber Digest(wird in einem neuen Tab geöffnet) (2026), die auch Terra mit 2x und Luna mit 2x günstiger als Fable 5 verfolgt.

Warum das wichtig ist

GPT-5.6 Sol stand seit seiner regierungsgegate-ten Vorschau am 26. Juni mit einem Pending-Urteil im Verzeichnis. Die unabhängigen Benchmark-Daten, auf die das Verzeichnis gewartet hat, sind nun eingetroffen — und Sol hat geliefert.

Fable 5s Abo-Zugang läuft heute Nacht um 23:59 Uhr PT aus. Danach gibt es nur noch Credits zu $10/$50 — Anthropics teuerstes öffentlich verfügbares Modell-Pricing. Eine Rückkehr zu Abos ist nicht angekündigt.

GPT-5.6 Sol startet zu $5/$30, im Abo enthalten, und trägt nun eine bestätigte Coding-Agent-Benchmark-Führung.

Das Regierungs-Gating-Drama, das Sols erste Vorschau umgab, verdeckte eine einfachere Wettbewerbsrealität: Wenn beide Modelle verfügbar sind, kostet eines dramatisch weniger und löst mehr echte Coding-Aufgaben. Die politische Frage war immer eine Nebenschau. Der Benchmark ist das Hauptevent.

Für Teams, die Coding-Agenten bauen, summiert sich die Kosten-pro-Task-Rechnung schnell. Ein 50-Task-Nachtlauf zu $22/Task (Fable 5) kostet $1.100. Dieselbe Arbeitslast auf Sol kostet etwa $420. Über einen Monat täglicher Läufe beträgt diese Lücke $20.000.

Was sich für Sie ändert

Wenn Sie zwischen GPT-5.6 Sol und Claude Fable 5 für Coding-Agent-Workloads wählen, ist das Richtungssignal eindeutig. Sol liefert messbar mehr gelöste Tasks zu einem Drittel der Kosten. Führen Sie Ihre eigenen repräsentativen Repos zur Bestätigung durch, aber warten Sie nicht auf einen Tie-Breaker, der bereits eingetroffen ist.

Wenn Fable 5 in Ihrer Pipeline ist, auditieren Sie heute. Nach 23:59 Uhr PT verbrennt jeder Agent-Loop Credits zu $10/$50 ohne messbaren Abo-Fallback. Budgetieren Sie entsprechend — es gibt keine automatische Ausgabenobergrenze.

Für Teams, die nicht bei jeder Aufgabe maximale Reasoning-Leistung benötigen: GPT-5.6 Terra (77 im Coding Agent Index zu ~$0,55/Task) und Luna (75 zu ~$0,21/Task) bieten noch besseren Wert für Routine-Coding-Arbeiten.

FAQ

Ist DeepSWE ein verlässlicher Benchmark? DeepSWE testet Agenten in echten Open-Source-Repositories mit programmbasierten Verifizierern — nicht mit Multiple-Choice-Fragen oder Funktionsvervollständigungs-Aufgaben. Es misst, ob ein Patch in der Praxis tatsächlich funktioniert. Der Benchmark umfasst 113 Aufgaben, 91 Repositories und 5 Sprachen, was ihn repräsentativer für reale Softwareentwicklung macht als SWE-bench Verified, das auf Unit-Test-Bestehen/Nichtbestehen basiert.

Bedeutet das, dass Sol das bessere Modell für alles ist? Nein. Bei AA-Briefcase (Wissensarbeits-Aufgaben) führt Fable 5 immer noch mit einem Rubric Score von 56 % gegenüber Sols 42 %. Beim Intelligence Index liegen die beiden einen Punkt auseinander. Die Daten sagen: Sol ist der bessere Coding-Agent fürs Geld — nicht dass Sol universell überlegen ist. Für analytisches Reasoning oder präsentationsreife Ergebnisse bleibt Fable 5 wettbewerbsfähig.

Was ist mit GPT-5.6 Terra und Luna? Beide erzielen respektable Werte im Coding Agent Index — Terra mit 77 und Luna mit 75 — bei noch niedrigeren Pro-Task-Kosten. Wenn Ihre Coding-Aufgaben keine maximale Reasoning-Anstrengung erfordern, bieten die günstigeren Varianten möglicherweise noch besseren Wert. Die gesamte GPT-5.6-Familie definiert nun eine neue Pareto-Frontier in den Intelligence-vs-Cost-Charts.

pendingvorherige Wahl
recommendedneue Wahl

GPT-5.6 Sol leads the DeepSWE coding-agent benchmark at 72-73% vs Fable 5's 70% at one-third the cost, and tops the Artificial Analysis Coding Agent Index at 80 points. These are the independent benchmarks the directory was waiting for — the verdict moves from Pending to Recommended.

Was zu tun ist

  1. 1 If your coding-agent workload is budget-sensitive, benchmark GPT-5.6 Sol against Fable 5 on your own repos — the public data favors Sol on both performance and cost
  2. 2 Don't let Fable 5's credit-only pricing surprise you — tonight is the last night of subscription-included access

Betroffene Tools & Modelle

Nie wieder etwas verpassen

Das wöchentliche Delta — nur Urteilsänderungen und dringende Punkte. Kein Füllmaterial.

Mit dem Abonnieren stimmst du unserer Datenschutzerklärung zu. Jederzeit abbestellbar.