Claude Sonnet 5
Anthropic · Sorti juin 2026
Le Sonnet le plus agentique d'Anthropic offre des performances proches d'Opus 4.8 pour environ la moitié du prix, avec +13,4 points sur Terminal-Bench 2.1 par rapport à Sonnet 4.6. Le nouveau tokenizer gonfle les décomptes d'environ 30%, si bien que la tarification de lancement ($2/$10 par MTok jusqu'au 31 août) rend la migration neutre en coût, mais les équipes devraient recalculer leurs budgets avant de basculer. Il remplace Sonnet 4.6 comme modèle par défaut sur tous les plans Claude, idéal pour le codage agentique, le débogage de code existant et les pipelines de production — pas pour les raisonnements frontière les plus difficiles ni les tâches de cybersécurité.
Est-ce fait pour vous ?
Recommandé pour
- Codage agentique multi-étapes et complétion autonome de tâches — termine des workflows complexes sur lesquels les précédents modèles Sonnet bloquaient
- Débogage de code existant : trace les défaillances jusqu'aux causes racines, écrit des tests de reproduction et livre des correctifs durables sans y être invité
- Agents IA de production à un coût attractif — qualité proche d'Opus 4.8 sur les benchmarks agentiques pour environ la moitié du prix
- Travail de connaissance où il devance Opus 4.8 (GDPval-AA v2 : 1 618 vs 1 615) — rédaction de documents, recherche, analyse professionnelle
- Auto-vérification : vérifie sa propre sortie sans y être explicitement invité, réduisant les erreurs cumulatives dans les pipelines automatisés
Déconseillé pour
- Tâches frontière à capacité maximale où Opus 4.8 ou Fable 5 sont nécessaires — Sonnet 5 s'en approche mais n'atteint pas le niveau supérieur
- Travail de cybersécurité nécessitant des garde-fous réduits — les garde-fous cyber sont activés par défaut et Anthropic recommande Opus 4.8 pour ce cas d'usage
- Charges où l'inflation d'environ 30% du nouveau tokenizer importe — recalculez vos budgets avant de basculer ; le même texte coûte plus de tokens que sur Sonnet 4.6
Performances par tâche
Codage agentique
Terminal-Bench 2.1 80,4% (+13,4 pts vs Sonnet 4.6) — le signal le plus clair de fiabilité agentique multi-étapes. Benchmark production Cursor : 61,2% (vs 49,0% pour 4.6).
Génération de code
SWE-bench Verified 85,2% — 4,1 pts d'avance sur Sonnet 4.6 (81,1%), réduisant l'écart avec Opus 4.8 (88,6%). Solide en codage standard mais Opus garde l'avance sur Pro de 6 pts.
Débogage
Les premiers testeurs soulignent régulièrement les tests de reproduction spontanés, le stash pour confirmer les régressions et le traçage des causes racines sur du code existant.
Utilisation d'outils et d'ordinateur
OSWorld-Verified 81,2%, équivalent à Opus 4.8 (83,4%) et nettement devant Sonnet 4.6 (78,5%). Gère les navigateurs, terminaux et outils API de bout en bout.
Travail de connaissance
GDPval-AA v2 : 1 618 — devance légèrement Opus 4.8 (1 615). Une véritable première pour un modèle Sonnet de milieu de gamme face à son grand frère flagship.
Raisonnement
Humanity's Last Exam : 43,2% (sans outils) / 57,4% (avec outils). Avec outils, se rapproche d'Opus 4.8 (57,9%) ; sans outils, reste derrière le niveau flagship.
Cybersécurité
Par conception — n'a jamais développé d'exploit fonctionnel complet sur les tests de vulnérabilité Firefox 147 (0,0%). Garde-fous cyber activés par défaut. Anthropic recommande Opus 4.8 pour le travail cyber.
Tarifs
Entrée
$3 / 1M
Sortie
$15 / 1M
Contexte
1M tokens
Tests de performance
| Test | Score | Source |
|---|---|---|
| SWE-bench Verified | 85.2% | Source |
| Terminal-Bench 2.1 | 80.4% | Source |
| SWE-bench Pro | 63.2% | Source |
| Humanity's Last Exam (no tools) | 43.2% | Source |
| Humanity's Last Exam (with tools) | 57.4% | Source |
| OSWorld-Verified | 81.2% | Source |
| Knowledge Work (GDPval-AA v2) | 1,618 | Source |
| Cursor Production Benchmark (Max effort) | 61.2% | Source |
| BrowseComp 25 (agentic search) | 84.7% | Source |
Historique des verdicts
Sources
- Anthropic — Introducing Claude Sonnet 5juil. 2026
- Anthropic Platform Docs — What's new in Sonnet 5juil. 2026
- Claude Platform Docs — Models Overviewjuil. 2026
- TechCrunch — Anthropic launches Claude Sonnet 5juil. 2026
- Codersera — Claude Sonnet 5: Benchmarks, Pricing & How It Comparesjuil. 2026
- CosmicJS — Claude Sonnet 5: Benchmarks, Pricing, and What Developers Need to Knowjuil. 2026
- MarkTechPost — Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8: Benchmarks and Cost-Performance Comparedjuil. 2026
- Kingy AI — Claude Sonnet 5: Benchmarks, Specs, Pricing & Everything Newjuil. 2026
Journal de vérification
- Tarifs— Aucun changement
Agent automatisé
- Tarifs— Aucun changement
Agent automatisé
Live $2/$10 intro through Aug 31; stored $3/$15 standard rate. No change to standard rate.
- Tarifs— Aucun changement
Agent automatisé
- Profil— Aucun changement
Importé au lancement
- Tarifs— Aucun changement
Importé au lancement