Claude Sonnet 5
Anthropic · Lançado 06/2026
O Sonnet mais agêntico da Anthropic entrega desempenho próximo ao do Opus 4.8 por cerca de metade do preço, com +13,4 pontos no Terminal-Bench 2.1 sobre o Sonnet 4.6. O novo tokenizador infla as contagens em ~30%, então o preço introdutório ($2/$10 por MTok até 31 de agosto) mantém a migração neutra em custo, mas as equipes devem recalcular os orçamentos antes de trocar. Ele substitui o Sonnet 4.6 como padrão em todos os planos Claude, ideal para codificação agêntica, depuração brownfield e pipelines de produção — não para as tarefas mais difíceis de raciocínio de fronteira ou cibersegurança.
É adequada para ti?
Bom para
- Codificação agêntica multi-etapa e conclusão autónoma de tarefas — termina fluxos de trabalho complexos nos quais os modelos Sonnet anteriores paravam
- Depuração brownfield: rastreia falhas até às causas-raiz, escreve testes de reprodução e envia correções duradouras sem ser solicitado
- Agentes de IA em produção com custo atrativo — qualidade próxima do Opus 4.8 em benchmarks agênticos por cerca de metade do preço
- Trabalho de conhecimento onde supera ligeiramente o Opus 4.8 (GDPval-AA v2: 1618 vs 1615) — redação de documentos, investigação, análise profissional
- Autoverificação: verifica a sua própria saída sem ser explicitamente instruído, reduzindo erros de acumulação em pipelines automatizados
Não recomendado para
- Tarefas de fronteira de capacidade máxima onde o Opus 4.8 ou o Fable 5 são necessários — o Sonnet 5 aproxima-se mas não atinge o nível superior
- Trabalho de cibersegurança que exige menos salvaguardas — as salvaguardas cibernéticas estão ativas por padrão e a Anthropic recomenda o Opus 4.8 para esse caso de uso
- Cargas de trabalho onde a inflação de tokens de ~30% do novo tokenizador importa — recalcule os orçamentos antes de mudar; o mesmo texto custa mais tokens do que no Sonnet 4.6
Desempenho por tarefa
Codificação agêntica
Terminal-Bench 2.1 80,4% (+13,4 pontos sobre o Sonnet 4.6) — o sinal mais claro de fiabilidade agêntica multi-etapa. Benchmark de produção Cursor: 61,2% (vs 49,0% do 4.6).
Geração de código
SWE-bench Verified 85,2% — 4,1 pontos à frente do Sonnet 4.6 (81,1%), a encurtar a distância para o Opus 4.8 (88,6%). Forte em código padrão, mas o Opus ainda lidera no Pro por 6 pontos.
Depuração
Os primeiros testadores destacam repetidamente testes de reprodução não solicitados, stash para confirmar regressões e rastreamento de causas-raiz em código brownfield.
Uso de ferramentas e computador
OSWorld-Verified 81,2%, igualando o Opus 4.8 (83,4%) e significativamente à frente do Sonnet 4.6 (78,5%). Lida com navegadores, terminais e ferramentas de API de ponta a ponta.
Trabalho de conhecimento
GDPval-AA v2: 1618 — supera ligeiramente o Opus 4.8 (1615). Um feito inédito para um modelo Sonnet de nível intermédio contra o seu irmão carro-chefe.
Raciocínio
Humanity's Last Exam: 43,2% (sem ferramentas) / 57,4% (com ferramentas). Com ferramentas, quase iguala o Opus 4.8 (57,9%); sem ferramentas, ainda fica atrás do nível carro-chefe.
Cibersegurança
Por design — nunca desenvolveu um exploit funcional completo em testes de vulnerabilidade do Firefox 147 (0,0%). Salvaguardas cibernéticas ativas por padrão. A Anthropic recomenda o Opus 4.8 para trabalho cibernético.
Preços
Entrada
$3 / 1M
Saída
$15 / 1M
Contexto
1M tokens
Testes de desempenho
| Teste | Pontuação | Fonte |
|---|---|---|
| SWE-bench Verified | 85.2% | Fonte |
| Terminal-Bench 2.1 | 80.4% | Fonte |
| SWE-bench Pro | 63.2% | Fonte |
| Humanity's Last Exam (no tools) | 43.2% | Fonte |
| Humanity's Last Exam (with tools) | 57.4% | Fonte |
| OSWorld-Verified | 81.2% | Fonte |
| Knowledge Work (GDPval-AA v2) | 1,618 | Fonte |
| Cursor Production Benchmark (Max effort) | 61.2% | Fonte |
| BrowseComp 25 (agentic search) | 84.7% | Fonte |
Histórico de veredictos
Fontes
- Anthropic — Introducing Claude Sonnet 507/2026
- Anthropic Platform Docs — What's new in Sonnet 507/2026
- Claude Platform Docs — Models Overview07/2026
- TechCrunch — Anthropic launches Claude Sonnet 507/2026
- Codersera — Claude Sonnet 5: Benchmarks, Pricing & How It Compares07/2026
- CosmicJS — Claude Sonnet 5: Benchmarks, Pricing, and What Developers Need to Know07/2026
- MarkTechPost — Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8: Benchmarks and Cost-Performance Compared07/2026
- Kingy AI — Claude Sonnet 5: Benchmarks, Specs, Pricing & Everything New07/2026
Registo de verificação
- Preços— Sem alterações
Agente automatizado
- Preços— Sem alterações
Agente automatizado
Live $2/$10 intro through Aug 31; stored $3/$15 standard rate. No change to standard rate.
- Preços— Sem alterações
Agente automatizado
- Perfil— Sem alterações
Importado no lançamento
- Preços— Sem alterações
Importado no lançamento