GPT-5.6 Sol logo

GPT-5.6 Sol

OpenAI · Lanzado jun 2026

Recomendado

GPT-5.6 Sol es el modelo frontera más rentable, líder en benchmarks de código y competitivo en razonamiento difícil a una fracción del costo de sus pares. El veredicto se refuerza con la divulgación del endurecimiento de seguridad GPT-Red — el modelo fue entrenado adversarialmente contra un modelo dedicado de red-teaming por RL de auto-juego a escala frontera, lo que lo hace 6x más robusto frente a inyecciones de prompt.

¿Es adecuada para ti?

Bueno para

  • Estado del arte en TerminalBench 2.1: 88,8% base, 91,9% en modo Ultra con subagentes — supera a Mythos 5 (88,0%) y Fable 5 (84,3%). Sol Ultra está >3 puntos por delante de cualquier competidor.
  • Programación de largo alcance y tareas con agentes: primer modelo que supera la mitad en Agent's Last Exam (50,9%), con razonamiento máximo y modo ultra basado en subagentes para descomponer problemas difíciles.
  • Ciberseguridad e investigación de vulnerabilidades: iguala a Anthropic Mythos Preview en ExploitBench con aproximadamente 1/3 de los tokens de salida. Puntuación CTF del 96,7% en pruebas internas. Fuerte descubrimiento de primitivas de exploit en Chromium y Firefox sin llegar a la explotación autónoma de cadena completa.
  • Biología y razonamiento científico: mejora de ~9 puntos sobre GPT-5.5 en evaluaciones de SecureBio (Human Pathogen 68,4%, Molecular Biology 60,0%). Más fuerte en GeneBench v1 usando menos tokens. Útil para investigación biomédica legítima bajo programas de acceso de confianza.
  • Lanzamiento controlado con stack de seguridad intensivo: clasificadores de activación, cribado de uso indebido en tiempo real, 700K horas de GPU A100 de red teaming automatizado y rechazos por capas a nivel de modelo. Altamente reforzado contra ataques adversariales con postura defensiva de ciberseguridad.
  • Revisión del almacenamiento en caché de prompts: puntos de ruptura de caché explícitos, vida mínima de caché de 30 minutos, escrituras de caché a 1,25× la tasa de entrada, lecturas de caché con 90% de descuento. Hace que las sesiones largas con agentes sean mucho más predecibles en coste.

No recomendado para

  • Vista previa limitada restringida por el gobierno sin acceso público: solo ~20 organizaciones reciben acceso, y la disponibilidad general está prometida 'en las próximas semanas' pero no garantizada. No puedes probar este modelo con tus propias cargas de trabajo hoy.
  • No probado en codebases reales desordenadas: todos los benchmarks publicados son ejecutados por el proveedor con harnesses del proveedor. La brecha de 0,8 puntos sobre Mythos 5 en TerminalBench está dentro del ruido de medición — es un empate estadístico.
  • A $5/$30 por 1M de tokens, Sol iguala el precio de GPT-5.5 con un salto importante de capacidad — pero GPT-5.6 Terra ofrece rendimiento de clase GPT-5.5 a mitad de coste ($2,50/$15). Sol debe reservarse solo para las tareas más difíciles.

Rendimiento por tarea

Programación con agentes

Excellent

Estado del arte en TerminalBench 2.1 con 88,8% (91,9% Ultra). La ventaja sobre el resto es real. La descomposición por subagentes del modo Ultra es un avance arquitectónico genuino para tareas de programación de largo alcance.

Ciberseguridad

Excellent

Iguala a Mythos Preview en ExploitBench con 1/3 de tokens. 96,7% CTF. Puede encontrar vulnerabilidades y primitivas de exploit pero no produjo exploits de cadena completa de forma autónoma. Postura defensiva por diseño.

Razonamiento científico (biología)

Very Good

Mejora de ~9 puntos sobre GPT-5.5 en evaluaciones de biología de SecureBio. Fuerte en GeneBench v1. Human Pathogen Capabilities al 68,4%. La clasificación de alto riesgo implica acceso restringido para flujos de trabajo sensibles de biología.

Razonamiento de largo alcance

Excellent

Primer modelo que supera el 50% en Agent's Last Exam (50,9% modo código). El modo de razonamiento máximo y el modo ultra de subagentes llevan la profundidad de razonamiento más lejos que cualquier modelo anterior.

Uso general cotidiano

Good

Excesivo para tareas rutinarias. Terra es la mejor opción para el trabajo diario a mitad de coste con capacidad de clase GPT-5.5. Sol debe reservarse para problemas donde los errores de un modelo más débil resultan caros.

Precios

Entrada

$5 / 1M tokens

Salida

$30 / 1M tokens

Contexto

Same rate card as GPT-5.5. Ultra mode costs more.

Ver precios completos

Pruebas de rendimiento

PruebaPuntuaciónFuente
TerminalBench 2.1 (base)88.8% Fuente
TerminalBench 2.1 (Ultra)91.9% Fuente
Agent's Last Exam (code mode)50.9% Fuente
SecureBio: Human Pathogen Capabilities68.4% Fuente
SecureBio: World-Class Biology68.3% Fuente
SecureBio: Molecular Biology60.0% Fuente
SecureBio: Virology Capabilities Test53.5% Fuente
Internal CTF (capture-the-flag)96.7% Fuente

Historial de veredictos

16 jul 2026
recommended → recommended (reinforced) — GPT-Red disclosure demonstrates frontier-scale safety investment alongside capability — the model was trained against an automated red-teamer achieving 84% attack success (6.5x human baseline) and emerged 6x more robust. This reinforces the existing Recommended stance rather than changing it.
12 jul 2026
pending -> recommended — GPT-5.6 Sol leads the DeepSWE coding-agent benchmark at 72-73% vs Fable 5's 70% at one-third the cost, and tops the AI Analysis Coding Agent Index at 80 points. These are the independent benchmarks the directory was waiting for.
12 jul 2026
pending -> recommended — UK AISI confirms GPT-5.6 Sol carries equivalent cyber vulnerabilities to Fable 5 — every frontier model shares this risk, which does not diminish Sol's coding and cost advantages. Vulnerability equivalence is now table stakes for frontier models.

Registro de verificación

  • Precios— Sin cambios

    Agente automatizado

  • Precios— Sin cambios

    Agente automatizado

  • Estado— Actualizado

    Agente automatizado

    Summary re-dated to Jul 7 2026 and made explicit about what is awaited: stays pending pending GA + independent benchmarks; still government-gated (~20 orgs); Sol Ultra confirmed for Codex Jul 6 by Sottiaux, prediction markets pricing Jul 9 GA (unconfirmed). Verdict unchanged (pending).

  • Precios— Sin cambios

    Agente automatizado

  • Precios— Sin cambios

    Agente automatizado

    Pricing unchanged: $5/$30 per 1M tokens. Government-gated limited preview (~20 orgs). Confirmed by OpenAI blog and aipricing.guru.

  • Perfil— Sin cambios

    Importado en el lanzamiento

  • Precios— Sin cambios

    Importado en el lanzamiento

Cómo evaluamos