Claude Sonnet 5 logo

Claude Sonnet 5

Anthropic · Sorti juin 2026

Recommandé

Le Sonnet le plus agentique d'Anthropic offre des performances proches d'Opus 4.8 pour environ la moitié du prix, avec +13,4 points sur Terminal-Bench 2.1 par rapport à Sonnet 4.6. Le nouveau tokenizer gonfle les décomptes d'environ 30%, si bien que la tarification de lancement ($2/$10 par MTok jusqu'au 31 août) rend la migration neutre en coût, mais les équipes devraient recalculer leurs budgets avant de basculer. Il remplace Sonnet 4.6 comme modèle par défaut sur tous les plans Claude, idéal pour le codage agentique, le débogage de code existant et les pipelines de production — pas pour les raisonnements frontière les plus difficiles ni les tâches de cybersécurité.

Est-ce fait pour vous ?

Recommandé pour

  • Codage agentique multi-étapes et complétion autonome de tâches — termine des workflows complexes sur lesquels les précédents modèles Sonnet bloquaient
  • Débogage de code existant : trace les défaillances jusqu'aux causes racines, écrit des tests de reproduction et livre des correctifs durables sans y être invité
  • Agents IA de production à un coût attractif — qualité proche d'Opus 4.8 sur les benchmarks agentiques pour environ la moitié du prix
  • Travail de connaissance où il devance Opus 4.8 (GDPval-AA v2 : 1 618 vs 1 615) — rédaction de documents, recherche, analyse professionnelle
  • Auto-vérification : vérifie sa propre sortie sans y être explicitement invité, réduisant les erreurs cumulatives dans les pipelines automatisés

Déconseillé pour

  • Tâches frontière à capacité maximale où Opus 4.8 ou Fable 5 sont nécessaires — Sonnet 5 s'en approche mais n'atteint pas le niveau supérieur
  • Travail de cybersécurité nécessitant des garde-fous réduits — les garde-fous cyber sont activés par défaut et Anthropic recommande Opus 4.8 pour ce cas d'usage
  • Charges où l'inflation d'environ 30% du nouveau tokenizer importe — recalculez vos budgets avant de basculer ; le même texte coûte plus de tokens que sur Sonnet 4.6

Performances par tâche

Codage agentique

Excellent

Terminal-Bench 2.1 80,4% (+13,4 pts vs Sonnet 4.6) — le signal le plus clair de fiabilité agentique multi-étapes. Benchmark production Cursor : 61,2% (vs 49,0% pour 4.6).

Génération de code

Very Good

SWE-bench Verified 85,2% — 4,1 pts d'avance sur Sonnet 4.6 (81,1%), réduisant l'écart avec Opus 4.8 (88,6%). Solide en codage standard mais Opus garde l'avance sur Pro de 6 pts.

Débogage

Excellent

Les premiers testeurs soulignent régulièrement les tests de reproduction spontanés, le stash pour confirmer les régressions et le traçage des causes racines sur du code existant.

Utilisation d'outils et d'ordinateur

Excellent

OSWorld-Verified 81,2%, équivalent à Opus 4.8 (83,4%) et nettement devant Sonnet 4.6 (78,5%). Gère les navigateurs, terminaux et outils API de bout en bout.

Travail de connaissance

Excellent

GDPval-AA v2 : 1 618 — devance légèrement Opus 4.8 (1 615). Une véritable première pour un modèle Sonnet de milieu de gamme face à son grand frère flagship.

Raisonnement

Very Good

Humanity's Last Exam : 43,2% (sans outils) / 57,4% (avec outils). Avec outils, se rapproche d'Opus 4.8 (57,9%) ; sans outils, reste derrière le niveau flagship.

Cybersécurité

Fair

Par conception — n'a jamais développé d'exploit fonctionnel complet sur les tests de vulnérabilité Firefox 147 (0,0%). Garde-fous cyber activés par défaut. Anthropic recommande Opus 4.8 pour le travail cyber.

Tarifs

Entrée

$3 / 1M

Sortie

$15 / 1M

Contexte

1M tokens

Voir tous les tarifs

Tests de performance

TestScoreSource
SWE-bench Verified85.2% Source
Terminal-Bench 2.180.4% Source
SWE-bench Pro63.2% Source
Humanity's Last Exam (no tools)43.2% Source
Humanity's Last Exam (with tools)57.4% Source
OSWorld-Verified81.2% Source
Knowledge Work (GDPval-AA v2)1,618 Source
Cursor Production Benchmark (Max effort)61.2% Source
BrowseComp 25 (agentic search)84.7% Source

Historique des verdicts

15 juil. 2026
copy edit to brevity standard, detail preserved in children — EN verdict_summary was ~116 words / 5 sentences — over the 2–4 sentence / ≤90 word target. Shortened to 3 sentences / ~70 words while preserving all claims. Children (strengths, task_strengths, etc.) retain the full detail.

Journal de vérification

  • Tarifs— Aucun changement

    Agent automatisé

  • Tarifs— Aucun changement

    Agent automatisé

    Live $2/$10 intro through Aug 31; stored $3/$15 standard rate. No change to standard rate.

  • Tarifs— Aucun changement

    Agent automatisé

  • Profil— Aucun changement

    Importé au lancement

  • Tarifs— Aucun changement

    Importé au lancement

Comment nous évaluons