Claude Sonnet 5
Anthropic · Veröffentlicht Juni 2026
Anthropics agentischstes Sonnet liefert nahezu Opus-4.8-Leistung zu rund dem halben Preis, mit +13,4 Punkten auf Terminal-Bench 2.1 gegenüber Sonnet 4.6. Der neue Tokenizer bläht die Token-Zahlen um ~30 % auf; das Einführungsangebot ($2/$10 per MTok bis 31. August) hält die Migration kostenneutral, doch Teams sollten ihre Budgets vor dem Wechsel neu durchrechnen. Es löst Sonnet 4.6 als Standard in allen Claude-Plänen ab und ist ideal für agentisches Coding, Brownfield-Debugging und Produktions-Pipelines — nicht für die härtesten Frontier-Reasoning- oder Cybersecurity-Aufgaben.
Ist es das Richtige für dich?
Gut für
- Mehrschrittiges agentisches Coding und autonome Aufgabenausführung — beendet komplexe Workflows, an denen frühere Sonnet-Modelle steckenblieben
- Brownfield-Debugging: verfolgt Fehler bis zur Ursache, schreibt reproduzierende Tests und liefert robuste Fixes unaufgefordert
- Produktive KI-Agenten zu attraktiven Kosten — nahezu Opus-4.8-Qualität bei agentischen Benchmarks zu rund dem halben Preis
- Wissensarbeit, bei der es Opus 4.8 übertrifft (GDPval-AA v2: 1.618 vs. 1.615) — Dokumentenerstellung, Recherche, professionelle Analyse
- Selbstverifikation: prüft eigene Ergebnisse ohne explizite Aufforderung, reduziert Folgefehler in automatisierten Pipelines
Nicht geeignet für
- Maximale Frontier-Aufgaben, die Opus 4.8 oder Fable 5 erfordern — Sonnet 5 kommt nahe heran, erreicht aber nicht die Spitzenklasse
- Cybersicherheits-Arbeit mit reduzierten Schutzmechanismen — Cyber-Safeguards sind standardmäßig aktiv; Anthropic empfiehlt Opus 4.8 für diesen Einsatzzweck
- Workloads, bei denen die ~30% Token-Inflation des neuen Tokenizers ins Gewicht fällt — Budgets vor dem Wechsel neu durchrechnen; gleicher Text kostet mehr Tokens als bei Sonnet 4.6
Leistung nach Aufgabe
Agentisches Coding
Terminal-Bench 2.1: 80,4% (+13,4 Pkt. vs. Sonnet 4.6) — das klarste Signal für mehrschrittige agentische Zuverlässigkeit. Cursor-Produktions-Benchmark: 61,2% (vs. 49,0% für 4.6).
Code-Generierung
SWE-bench Verified: 85,2% — 4,1 Pkt. vor Sonnet 4.6 (81,1%), schließt die Lücke zu Opus 4.8 (88,6%). Stark beim Standard-Coding, Opus führt bei Pro jedoch mit 6 Pkt.
Debugging
Frühe Tester heben unaufgeforderte Reproduktionstests, Stashing zur Bestätigung von Regressionen und Ursachenverfolgung in Brownfield-Code besonders hervor.
Tool-Nutzung und Computer-Use
OSWorld-Verified: 81,2%, auf Augenhöhe mit Opus 4.8 (83,4%) und deutlich vor Sonnet 4.6 (78,5%). Bedient Browser, Terminals und API-Tools durchgängig.
Wissensarbeit
GDPval-AA v2: 1.618 — übertrifft knapp Opus 4.8 (1.615). Ein echtes Novum für ein Sonnet-Mittelklassemodell gegenüber seinem Flaggschiff-Geschwister.
Reasoning
Humanity's Last Exam: 43,2% (ohne Tools) / 57,4% (mit Tools). Mit Tools nahezu auf Opus-4.8-Niveau (57,9%); ohne Tools bleibt es hinter der Flaggschiff-Stufe zurück.
Cybersicherheit
Designbedingt — entwickelte nie einen voll funktionsfähigen Exploit bei Firefox-147-Schwachstellentests (0,0%). Cyber-Safeguards standardmäßig aktiv. Anthropic empfiehlt Opus 4.8 für Cyber-Arbeit.
Preise
Eingabe
$3 / 1M
Ausgabe
$15 / 1M
Kontext
1M tokens
Benchmarks
| Benchmark | Wert | Quelle |
|---|---|---|
| SWE-bench Verified | 85.2% | Quelle |
| Terminal-Bench 2.1 | 80.4% | Quelle |
| SWE-bench Pro | 63.2% | Quelle |
| Humanity's Last Exam (no tools) | 43.2% | Quelle |
| Humanity's Last Exam (with tools) | 57.4% | Quelle |
| OSWorld-Verified | 81.2% | Quelle |
| Knowledge Work (GDPval-AA v2) | 1,618 | Quelle |
| Cursor Production Benchmark (Max effort) | 61.2% | Quelle |
| BrowseComp 25 (agentic search) | 84.7% | Quelle |
Urteilsverlauf
Quellen
- Anthropic — Introducing Claude Sonnet 5Juli 2026
- Anthropic Platform Docs — What's new in Sonnet 5Juli 2026
- Claude Platform Docs — Models OverviewJuli 2026
- TechCrunch — Anthropic launches Claude Sonnet 5Juli 2026
- Codersera — Claude Sonnet 5: Benchmarks, Pricing & How It ComparesJuli 2026
- CosmicJS — Claude Sonnet 5: Benchmarks, Pricing, and What Developers Need to KnowJuli 2026
- MarkTechPost — Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8: Benchmarks and Cost-Performance ComparedJuli 2026
- Kingy AI — Claude Sonnet 5: Benchmarks, Specs, Pricing & Everything NewJuli 2026
Prüfprotokoll
- Preise— Keine Änderungen
Automatisierter Agent
- Preise— Keine Änderungen
Automatisierter Agent
Live $2/$10 intro through Aug 31; stored $3/$15 standard rate. No change to standard rate.
- Preise— Keine Änderungen
Automatisierter Agent
- Profil— Keine Änderungen
Beim Start importiert
- Preise— Keine Änderungen
Beim Start importiert