Claude Sonnet 5 logo

Claude Sonnet 5

Anthropic · Lançado 06/2026

Recomendado

O Sonnet mais agêntico da Anthropic entrega desempenho próximo ao do Opus 4.8 por cerca de metade do preço, com +13,4 pontos no Terminal-Bench 2.1 sobre o Sonnet 4.6. O novo tokenizador infla as contagens em ~30%, então o preço introdutório ($2/$10 por MTok até 31 de agosto) mantém a migração neutra em custo, mas as equipes devem recalcular os orçamentos antes de trocar. Ele substitui o Sonnet 4.6 como padrão em todos os planos Claude, ideal para codificação agêntica, depuração brownfield e pipelines de produção — não para as tarefas mais difíceis de raciocínio de fronteira ou cibersegurança.

É adequada para ti?

Bom para

  • Codificação agêntica multi-etapa e conclusão autónoma de tarefas — termina fluxos de trabalho complexos nos quais os modelos Sonnet anteriores paravam
  • Depuração brownfield: rastreia falhas até às causas-raiz, escreve testes de reprodução e envia correções duradouras sem ser solicitado
  • Agentes de IA em produção com custo atrativo — qualidade próxima do Opus 4.8 em benchmarks agênticos por cerca de metade do preço
  • Trabalho de conhecimento onde supera ligeiramente o Opus 4.8 (GDPval-AA v2: 1618 vs 1615) — redação de documentos, investigação, análise profissional
  • Autoverificação: verifica a sua própria saída sem ser explicitamente instruído, reduzindo erros de acumulação em pipelines automatizados

Não recomendado para

  • Tarefas de fronteira de capacidade máxima onde o Opus 4.8 ou o Fable 5 são necessários — o Sonnet 5 aproxima-se mas não atinge o nível superior
  • Trabalho de cibersegurança que exige menos salvaguardas — as salvaguardas cibernéticas estão ativas por padrão e a Anthropic recomenda o Opus 4.8 para esse caso de uso
  • Cargas de trabalho onde a inflação de tokens de ~30% do novo tokenizador importa — recalcule os orçamentos antes de mudar; o mesmo texto custa mais tokens do que no Sonnet 4.6

Desempenho por tarefa

Codificação agêntica

Excellent

Terminal-Bench 2.1 80,4% (+13,4 pontos sobre o Sonnet 4.6) — o sinal mais claro de fiabilidade agêntica multi-etapa. Benchmark de produção Cursor: 61,2% (vs 49,0% do 4.6).

Geração de código

Very Good

SWE-bench Verified 85,2% — 4,1 pontos à frente do Sonnet 4.6 (81,1%), a encurtar a distância para o Opus 4.8 (88,6%). Forte em código padrão, mas o Opus ainda lidera no Pro por 6 pontos.

Depuração

Excellent

Os primeiros testadores destacam repetidamente testes de reprodução não solicitados, stash para confirmar regressões e rastreamento de causas-raiz em código brownfield.

Uso de ferramentas e computador

Excellent

OSWorld-Verified 81,2%, igualando o Opus 4.8 (83,4%) e significativamente à frente do Sonnet 4.6 (78,5%). Lida com navegadores, terminais e ferramentas de API de ponta a ponta.

Trabalho de conhecimento

Excellent

GDPval-AA v2: 1618 — supera ligeiramente o Opus 4.8 (1615). Um feito inédito para um modelo Sonnet de nível intermédio contra o seu irmão carro-chefe.

Raciocínio

Very Good

Humanity's Last Exam: 43,2% (sem ferramentas) / 57,4% (com ferramentas). Com ferramentas, quase iguala o Opus 4.8 (57,9%); sem ferramentas, ainda fica atrás do nível carro-chefe.

Cibersegurança

Fair

Por design — nunca desenvolveu um exploit funcional completo em testes de vulnerabilidade do Firefox 147 (0,0%). Salvaguardas cibernéticas ativas por padrão. A Anthropic recomenda o Opus 4.8 para trabalho cibernético.

Preços

Entrada

$3 / 1M

Saída

$15 / 1M

Contexto

1M tokens

Ver preços completos

Testes de desempenho

TestePontuaçãoFonte
SWE-bench Verified85.2% Fonte
Terminal-Bench 2.180.4% Fonte
SWE-bench Pro63.2% Fonte
Humanity's Last Exam (no tools)43.2% Fonte
Humanity's Last Exam (with tools)57.4% Fonte
OSWorld-Verified81.2% Fonte
Knowledge Work (GDPval-AA v2)1,618 Fonte
Cursor Production Benchmark (Max effort)61.2% Fonte
BrowseComp 25 (agentic search)84.7% Fonte

Histórico de veredictos

15/07/2026
copy edit to brevity standard, detail preserved in children — EN verdict_summary was ~116 words / 5 sentences — over the 2–4 sentence / ≤90 word target. Shortened to 3 sentences / ~70 words while preserving all claims. Children (strengths, task_strengths, etc.) retain the full detail.

Registo de verificação

  • Preços— Sem alterações

    Agente automatizado

  • Preços— Sem alterações

    Agente automatizado

    Live $2/$10 intro through Aug 31; stored $3/$15 standard rate. No change to standard rate.

  • Preços— Sem alterações

    Agente automatizado

  • Perfil— Sem alterações

    Importado no lançamento

  • Preços— Sem alterações

    Importado no lançamento

Como avaliamos