GPT-5.6 Sol
OpenAI · Lanzado jun 2026
GPT-5.6 Sol es el modelo frontera más rentable, líder en benchmarks de código y competitivo en razonamiento difícil a una fracción del costo de sus pares. El veredicto se refuerza con la divulgación del endurecimiento de seguridad GPT-Red — el modelo fue entrenado adversarialmente contra un modelo dedicado de red-teaming por RL de auto-juego a escala frontera, lo que lo hace 6x más robusto frente a inyecciones de prompt.
¿Es adecuada para ti?
Bueno para
- Estado del arte en TerminalBench 2.1: 88,8% base, 91,9% en modo Ultra con subagentes — supera a Mythos 5 (88,0%) y Fable 5 (84,3%). Sol Ultra está >3 puntos por delante de cualquier competidor.
- Programación de largo alcance y tareas con agentes: primer modelo que supera la mitad en Agent's Last Exam (50,9%), con razonamiento máximo y modo ultra basado en subagentes para descomponer problemas difíciles.
- Ciberseguridad e investigación de vulnerabilidades: iguala a Anthropic Mythos Preview en ExploitBench con aproximadamente 1/3 de los tokens de salida. Puntuación CTF del 96,7% en pruebas internas. Fuerte descubrimiento de primitivas de exploit en Chromium y Firefox sin llegar a la explotación autónoma de cadena completa.
- Biología y razonamiento científico: mejora de ~9 puntos sobre GPT-5.5 en evaluaciones de SecureBio (Human Pathogen 68,4%, Molecular Biology 60,0%). Más fuerte en GeneBench v1 usando menos tokens. Útil para investigación biomédica legítima bajo programas de acceso de confianza.
- Lanzamiento controlado con stack de seguridad intensivo: clasificadores de activación, cribado de uso indebido en tiempo real, 700K horas de GPU A100 de red teaming automatizado y rechazos por capas a nivel de modelo. Altamente reforzado contra ataques adversariales con postura defensiva de ciberseguridad.
- Revisión del almacenamiento en caché de prompts: puntos de ruptura de caché explícitos, vida mínima de caché de 30 minutos, escrituras de caché a 1,25× la tasa de entrada, lecturas de caché con 90% de descuento. Hace que las sesiones largas con agentes sean mucho más predecibles en coste.
No recomendado para
- Vista previa limitada restringida por el gobierno sin acceso público: solo ~20 organizaciones reciben acceso, y la disponibilidad general está prometida 'en las próximas semanas' pero no garantizada. No puedes probar este modelo con tus propias cargas de trabajo hoy.
- No probado en codebases reales desordenadas: todos los benchmarks publicados son ejecutados por el proveedor con harnesses del proveedor. La brecha de 0,8 puntos sobre Mythos 5 en TerminalBench está dentro del ruido de medición — es un empate estadístico.
- A $5/$30 por 1M de tokens, Sol iguala el precio de GPT-5.5 con un salto importante de capacidad — pero GPT-5.6 Terra ofrece rendimiento de clase GPT-5.5 a mitad de coste ($2,50/$15). Sol debe reservarse solo para las tareas más difíciles.
Rendimiento por tarea
Programación con agentes
Estado del arte en TerminalBench 2.1 con 88,8% (91,9% Ultra). La ventaja sobre el resto es real. La descomposición por subagentes del modo Ultra es un avance arquitectónico genuino para tareas de programación de largo alcance.
Ciberseguridad
Iguala a Mythos Preview en ExploitBench con 1/3 de tokens. 96,7% CTF. Puede encontrar vulnerabilidades y primitivas de exploit pero no produjo exploits de cadena completa de forma autónoma. Postura defensiva por diseño.
Razonamiento científico (biología)
Mejora de ~9 puntos sobre GPT-5.5 en evaluaciones de biología de SecureBio. Fuerte en GeneBench v1. Human Pathogen Capabilities al 68,4%. La clasificación de alto riesgo implica acceso restringido para flujos de trabajo sensibles de biología.
Razonamiento de largo alcance
Primer modelo que supera el 50% en Agent's Last Exam (50,9% modo código). El modo de razonamiento máximo y el modo ultra de subagentes llevan la profundidad de razonamiento más lejos que cualquier modelo anterior.
Uso general cotidiano
Excesivo para tareas rutinarias. Terra es la mejor opción para el trabajo diario a mitad de coste con capacidad de clase GPT-5.5. Sol debe reservarse para problemas donde los errores de un modelo más débil resultan caros.
Precios
Entrada
$5 / 1M tokens
Salida
$30 / 1M tokens
Contexto
Same rate card as GPT-5.5. Ultra mode costs more.
Pruebas de rendimiento
| Prueba | Puntuación | Fuente |
|---|---|---|
| TerminalBench 2.1 (base) | 88.8% | Fuente |
| TerminalBench 2.1 (Ultra) | 91.9% | Fuente |
| Agent's Last Exam (code mode) | 50.9% | Fuente |
| SecureBio: Human Pathogen Capabilities | 68.4% | Fuente |
| SecureBio: World-Class Biology | 68.3% | Fuente |
| SecureBio: Molecular Biology | 60.0% | Fuente |
| SecureBio: Virology Capabilities Test | 53.5% | Fuente |
| Internal CTF (capture-the-flag) | 96.7% | Fuente |
Historial de veredictos
Fuentes
Registro de verificación
- Precios— Sin cambios
Agente automatizado
- Precios— Sin cambios
Agente automatizado
- Estado— Actualizado
Agente automatizado
Summary re-dated to Jul 7 2026 and made explicit about what is awaited: stays pending pending GA + independent benchmarks; still government-gated (~20 orgs); Sol Ultra confirmed for Codex Jul 6 by Sottiaux, prediction markets pricing Jul 9 GA (unconfirmed). Verdict unchanged (pending).
- Precios— Sin cambios
Agente automatizado
- Precios— Sin cambios
Agente automatizado
Pricing unchanged: $5/$30 per 1M tokens. Government-gated limited preview (~20 orgs). Confirmed by OpenAI blog and aipricing.guru.
- Perfil— Sin cambios
Importado en el lanzamiento
- Precios— Sin cambios
Importado en el lanzamiento