Claude Sonnet 5 logo

Claude Sonnet 5

Anthropic · Lanzado jun 2026

Recomendado

El Sonnet más agéntico de Anthropic ofrece un rendimiento cercano a Opus 4.8 a aproximadamente la mitad del precio, con +13.4 puntos en Terminal-Bench 2.1 sobre Sonnet 4.6. El nuevo tokenizador infla los conteos ~30%, por lo que el precio de lanzamiento ($2/$10 por MTok hasta el 31 de agosto) mantiene la migración neutral en costos, aunque los equipos deberían recalcular presupuestos antes de cambiar. Sustituye a Sonnet 4.6 como el modelo por defecto en todos los planes de Claude, ideal para programación agéntica, depuración de código heredado y pipelines de producción — no para el razonamiento frontera más exigente ni para tareas de ciberseguridad.

¿Es adecuada para ti?

Bueno para

  • Programación agentiva de múltiples pasos y finalización autónoma de tareas: completa flujos de trabajo complejos en los que modelos Sonnet anteriores se atascaban
  • Depuración de código heredado: rastrea fallos hasta sus causas raíz, escribe tests de reproducción y entrega correcciones duraderas sin necesidad de indicaciones
  • Agentes de IA en producción a un coste atractivo: calidad cercana a Opus 4.8 en benchmarks agentivos a aproximadamente la mitad de precio
  • Trabajo de conocimiento donde supera a Opus 4.8 (GDPval-AA v2: 1,618 frente a 1,615): redacción de documentos, investigación, análisis profesional
  • Autoverificación: comprueba su propia salida sin necesidad de indicaciones explícitas, lo que reduce errores compuestos en pipelines automatizados

No recomendado para

  • Tareas frontera de máxima capacidad donde Opus 4.8 o Fable 5 son necesarios: Sonnet 5 se acerca pero no alcanza el nivel superior
  • Trabajo de ciberseguridad que requiere menos restricciones: las salvaguardas cibernéticas están activadas por defecto y Anthropic recomienda Opus 4.8 para ese caso de uso
  • Cargas de trabajo donde la inflación de tokens del ~30% del nuevo tokenizador importa: recalcula presupuestos antes de cambiar; el mismo texto cuesta más tokens que en Sonnet 4.6

Rendimiento por tarea

Programación agentiva

Excellent

Terminal-Bench 2.1: 80.4% (+13.4 pts sobre Sonnet 4.6), la señal más clara de fiabilidad agentiva en múltiples pasos. Benchmark de producción Cursor: 61.2% (frente a 49.0% de 4.6).

Generación de código

Very Good

SWE-bench Verified: 85.2%, 4.1 pts por delante de Sonnet 4.6 (81.1%), cerrando la brecha con Opus 4.8 (88.6%). Sólido en programación estándar, pero Opus sigue liderando Pro por 6 pts.

Depuración

Excellent

Los primeros evaluadores destacan repetidamente los tests de reproducción autónomos, el guardado para confirmar regresiones y el rastreo de causa raíz en código heredado.

Uso de herramientas y ordenadores

Excellent

OSWorld-Verified: 81.2%, igualando a Opus 4.8 (83.4%) y muy por delante de Sonnet 4.6 (78.5%). Maneja navegadores, terminales y herramientas API de extremo a extremo.

Trabajo de conocimiento

Excellent

GDPval-AA v2: 1,618, supera ligeramente a Opus 4.8 (1,615). Una primicia genuina para un modelo Sonnet de nivel medio frente a su hermano insignia.

Razonamiento

Very Good

Humanity's Last Exam: 43.2% (sin herramientas) / 57.4% (con herramientas). Con herramientas casi iguala a Opus 4.8 (57.9%); sin herramientas sigue por detrás del nivel insignia.

Ciberseguridad

Fair

Por diseño: nunca desarrolló un exploit completo funcional en pruebas de vulnerabilidad de Firefox 147 (0.0%). Salvaguardas cibernéticas activadas por defecto. Anthropic recomienda Opus 4.8 para trabajo de ciberseguridad.

Precios

Entrada

$3 / 1M

Salida

$15 / 1M

Contexto

1M tokens

Ver precios completos

Pruebas de rendimiento

PruebaPuntuaciónFuente
SWE-bench Verified85.2% Fuente
Terminal-Bench 2.180.4% Fuente
SWE-bench Pro63.2% Fuente
Humanity's Last Exam (no tools)43.2% Fuente
Humanity's Last Exam (with tools)57.4% Fuente
OSWorld-Verified81.2% Fuente
Knowledge Work (GDPval-AA v2)1,618 Fuente
Cursor Production Benchmark (Max effort)61.2% Fuente
BrowseComp 25 (agentic search)84.7% Fuente

Historial de veredictos

15 jul 2026
copy edit to brevity standard, detail preserved in children — EN verdict_summary was ~116 words / 5 sentences — over the 2–4 sentence / ≤90 word target. Shortened to 3 sentences / ~70 words while preserving all claims. Children (strengths, task_strengths, etc.) retain the full detail.

Registro de verificación

  • Precios— Sin cambios

    Agente automatizado

  • Precios— Sin cambios

    Agente automatizado

    Live $2/$10 intro through Aug 31; stored $3/$15 standard rate. No change to standard rate.

  • Precios— Sin cambios

    Agente automatizado

  • Perfil— Sin cambios

    Importado en el lanzamiento

  • Precios— Sin cambios

    Importado en el lanzamiento

Cómo evaluamos