Claude Sonnet 5 logo

Claude Sonnet 5

Anthropic · Veröffentlicht Juni 2026

Empfohlen

Anthropics agentischstes Sonnet liefert nahezu Opus-4.8-Leistung zu rund dem halben Preis, mit +13,4 Punkten auf Terminal-Bench 2.1 gegenüber Sonnet 4.6. Der neue Tokenizer bläht die Token-Zahlen um ~30 % auf; das Einführungsangebot ($2/$10 per MTok bis 31. August) hält die Migration kostenneutral, doch Teams sollten ihre Budgets vor dem Wechsel neu durchrechnen. Es löst Sonnet 4.6 als Standard in allen Claude-Plänen ab und ist ideal für agentisches Coding, Brownfield-Debugging und Produktions-Pipelines — nicht für die härtesten Frontier-Reasoning- oder Cybersecurity-Aufgaben.

Ist es das Richtige für dich?

Gut für

  • Mehrschrittiges agentisches Coding und autonome Aufgabenausführung — beendet komplexe Workflows, an denen frühere Sonnet-Modelle steckenblieben
  • Brownfield-Debugging: verfolgt Fehler bis zur Ursache, schreibt reproduzierende Tests und liefert robuste Fixes unaufgefordert
  • Produktive KI-Agenten zu attraktiven Kosten — nahezu Opus-4.8-Qualität bei agentischen Benchmarks zu rund dem halben Preis
  • Wissensarbeit, bei der es Opus 4.8 übertrifft (GDPval-AA v2: 1.618 vs. 1.615) — Dokumentenerstellung, Recherche, professionelle Analyse
  • Selbstverifikation: prüft eigene Ergebnisse ohne explizite Aufforderung, reduziert Folgefehler in automatisierten Pipelines

Nicht geeignet für

  • Maximale Frontier-Aufgaben, die Opus 4.8 oder Fable 5 erfordern — Sonnet 5 kommt nahe heran, erreicht aber nicht die Spitzenklasse
  • Cybersicherheits-Arbeit mit reduzierten Schutzmechanismen — Cyber-Safeguards sind standardmäßig aktiv; Anthropic empfiehlt Opus 4.8 für diesen Einsatzzweck
  • Workloads, bei denen die ~30% Token-Inflation des neuen Tokenizers ins Gewicht fällt — Budgets vor dem Wechsel neu durchrechnen; gleicher Text kostet mehr Tokens als bei Sonnet 4.6

Leistung nach Aufgabe

Agentisches Coding

Excellent

Terminal-Bench 2.1: 80,4% (+13,4 Pkt. vs. Sonnet 4.6) — das klarste Signal für mehrschrittige agentische Zuverlässigkeit. Cursor-Produktions-Benchmark: 61,2% (vs. 49,0% für 4.6).

Code-Generierung

Very Good

SWE-bench Verified: 85,2% — 4,1 Pkt. vor Sonnet 4.6 (81,1%), schließt die Lücke zu Opus 4.8 (88,6%). Stark beim Standard-Coding, Opus führt bei Pro jedoch mit 6 Pkt.

Debugging

Excellent

Frühe Tester heben unaufgeforderte Reproduktionstests, Stashing zur Bestätigung von Regressionen und Ursachenverfolgung in Brownfield-Code besonders hervor.

Tool-Nutzung und Computer-Use

Excellent

OSWorld-Verified: 81,2%, auf Augenhöhe mit Opus 4.8 (83,4%) und deutlich vor Sonnet 4.6 (78,5%). Bedient Browser, Terminals und API-Tools durchgängig.

Wissensarbeit

Excellent

GDPval-AA v2: 1.618 — übertrifft knapp Opus 4.8 (1.615). Ein echtes Novum für ein Sonnet-Mittelklassemodell gegenüber seinem Flaggschiff-Geschwister.

Reasoning

Very Good

Humanity's Last Exam: 43,2% (ohne Tools) / 57,4% (mit Tools). Mit Tools nahezu auf Opus-4.8-Niveau (57,9%); ohne Tools bleibt es hinter der Flaggschiff-Stufe zurück.

Cybersicherheit

Fair

Designbedingt — entwickelte nie einen voll funktionsfähigen Exploit bei Firefox-147-Schwachstellentests (0,0%). Cyber-Safeguards standardmäßig aktiv. Anthropic empfiehlt Opus 4.8 für Cyber-Arbeit.

Preise

Eingabe

$3 / 1M

Ausgabe

$15 / 1M

Kontext

1M tokens

Alle Preise ansehen

Benchmarks

BenchmarkWertQuelle
SWE-bench Verified85.2% Quelle
Terminal-Bench 2.180.4% Quelle
SWE-bench Pro63.2% Quelle
Humanity's Last Exam (no tools)43.2% Quelle
Humanity's Last Exam (with tools)57.4% Quelle
OSWorld-Verified81.2% Quelle
Knowledge Work (GDPval-AA v2)1,618 Quelle
Cursor Production Benchmark (Max effort)61.2% Quelle
BrowseComp 25 (agentic search)84.7% Quelle

Urteilsverlauf

15. Juli 2026
copy edit to brevity standard, detail preserved in children — EN verdict_summary was ~116 words / 5 sentences — over the 2–4 sentence / ≤90 word target. Shortened to 3 sentences / ~70 words while preserving all claims. Children (strengths, task_strengths, etc.) retain the full detail.

Prüfprotokoll

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Preise— Keine Änderungen

    Automatisierter Agent

    Live $2/$10 intro through Aug 31; stored $3/$15 standard rate. No change to standard rate.

  • Preise— Keine Änderungen

    Automatisierter Agent

  • Profil— Keine Änderungen

    Beim Start importiert

  • Preise— Keine Änderungen

    Beim Start importiert

Wie wir bewerten