Claude Sonnet 5
Anthropic · Lanzado jun 2026
El Sonnet más agéntico de Anthropic ofrece un rendimiento cercano a Opus 4.8 a aproximadamente la mitad del precio, con +13.4 puntos en Terminal-Bench 2.1 sobre Sonnet 4.6. El nuevo tokenizador infla los conteos ~30%, por lo que el precio de lanzamiento ($2/$10 por MTok hasta el 31 de agosto) mantiene la migración neutral en costos, aunque los equipos deberían recalcular presupuestos antes de cambiar. Sustituye a Sonnet 4.6 como el modelo por defecto en todos los planes de Claude, ideal para programación agéntica, depuración de código heredado y pipelines de producción — no para el razonamiento frontera más exigente ni para tareas de ciberseguridad.
¿Es adecuada para ti?
Bueno para
- Programación agentiva de múltiples pasos y finalización autónoma de tareas: completa flujos de trabajo complejos en los que modelos Sonnet anteriores se atascaban
- Depuración de código heredado: rastrea fallos hasta sus causas raíz, escribe tests de reproducción y entrega correcciones duraderas sin necesidad de indicaciones
- Agentes de IA en producción a un coste atractivo: calidad cercana a Opus 4.8 en benchmarks agentivos a aproximadamente la mitad de precio
- Trabajo de conocimiento donde supera a Opus 4.8 (GDPval-AA v2: 1,618 frente a 1,615): redacción de documentos, investigación, análisis profesional
- Autoverificación: comprueba su propia salida sin necesidad de indicaciones explícitas, lo que reduce errores compuestos en pipelines automatizados
No recomendado para
- Tareas frontera de máxima capacidad donde Opus 4.8 o Fable 5 son necesarios: Sonnet 5 se acerca pero no alcanza el nivel superior
- Trabajo de ciberseguridad que requiere menos restricciones: las salvaguardas cibernéticas están activadas por defecto y Anthropic recomienda Opus 4.8 para ese caso de uso
- Cargas de trabajo donde la inflación de tokens del ~30% del nuevo tokenizador importa: recalcula presupuestos antes de cambiar; el mismo texto cuesta más tokens que en Sonnet 4.6
Rendimiento por tarea
Programación agentiva
Terminal-Bench 2.1: 80.4% (+13.4 pts sobre Sonnet 4.6), la señal más clara de fiabilidad agentiva en múltiples pasos. Benchmark de producción Cursor: 61.2% (frente a 49.0% de 4.6).
Generación de código
SWE-bench Verified: 85.2%, 4.1 pts por delante de Sonnet 4.6 (81.1%), cerrando la brecha con Opus 4.8 (88.6%). Sólido en programación estándar, pero Opus sigue liderando Pro por 6 pts.
Depuración
Los primeros evaluadores destacan repetidamente los tests de reproducción autónomos, el guardado para confirmar regresiones y el rastreo de causa raíz en código heredado.
Uso de herramientas y ordenadores
OSWorld-Verified: 81.2%, igualando a Opus 4.8 (83.4%) y muy por delante de Sonnet 4.6 (78.5%). Maneja navegadores, terminales y herramientas API de extremo a extremo.
Trabajo de conocimiento
GDPval-AA v2: 1,618, supera ligeramente a Opus 4.8 (1,615). Una primicia genuina para un modelo Sonnet de nivel medio frente a su hermano insignia.
Razonamiento
Humanity's Last Exam: 43.2% (sin herramientas) / 57.4% (con herramientas). Con herramientas casi iguala a Opus 4.8 (57.9%); sin herramientas sigue por detrás del nivel insignia.
Ciberseguridad
Por diseño: nunca desarrolló un exploit completo funcional en pruebas de vulnerabilidad de Firefox 147 (0.0%). Salvaguardas cibernéticas activadas por defecto. Anthropic recomienda Opus 4.8 para trabajo de ciberseguridad.
Precios
Entrada
$3 / 1M
Salida
$15 / 1M
Contexto
1M tokens
Pruebas de rendimiento
| Prueba | Puntuación | Fuente |
|---|---|---|
| SWE-bench Verified | 85.2% | Fuente |
| Terminal-Bench 2.1 | 80.4% | Fuente |
| SWE-bench Pro | 63.2% | Fuente |
| Humanity's Last Exam (no tools) | 43.2% | Fuente |
| Humanity's Last Exam (with tools) | 57.4% | Fuente |
| OSWorld-Verified | 81.2% | Fuente |
| Knowledge Work (GDPval-AA v2) | 1,618 | Fuente |
| Cursor Production Benchmark (Max effort) | 61.2% | Fuente |
| BrowseComp 25 (agentic search) | 84.7% | Fuente |
Historial de veredictos
Fuentes
- Anthropic — Introducing Claude Sonnet 5jul 2026
- TechCrunch — Anthropic launches Claude Sonnet 5jul 2026
- Anthropic Platform Docs — What's new in Sonnet 5jul 2026
- Claude Platform Docs — Models Overviewjul 2026
- Codersera — Claude Sonnet 5: Benchmarks, Pricing & How It Comparesjul 2026
- CosmicJS — Claude Sonnet 5: Benchmarks, Pricing, and What Developers Need to Knowjul 2026
- MarkTechPost — Claude Sonnet 5 vs Sonnet 4.6 vs Opus 4.8: Benchmarks and Cost-Performance Comparedjul 2026
- Kingy AI — Claude Sonnet 5: Benchmarks, Specs, Pricing & Everything Newjul 2026
Registro de verificación
- Precios— Sin cambios
Agente automatizado
- Precios— Sin cambios
Agente automatizado
Live $2/$10 intro through Aug 31; stored $3/$15 standard rate. No change to standard rate.
- Precios— Sin cambios
Agente automatizado
- Perfil— Sin cambios
Importado en el lanzamiento
- Precios— Sin cambios
Importado en el lanzamiento