GPT-5.6 Sol supera a Fable 5 en el benchmark DeepSWE — a un tercio del costo

OpenAI logoOpenAIVeredicto cambiado12 de julio de 2026Modelos
Qué pasó
GPT-5.6 Sol scored ~72–73% on the DeepSWE coding-agent benchmark to Fable 5's ~70%, at roughly one-third the cost per task ($8.40 vs $13–22).
Por qué importa
This is the first credible third-party benchmark since both models reached GA, and it reverses the expected outcome: the cheaper model wins on both performance and cost. Fable 5's $10/$50 credit-only pricing (starting tonight) is now empirically harder to justify.
Qué hacer
If you're choosing between GPT-5.6 Sol and Fable 5 for coding-agent workloads, the benchmark and pricing data both favor Sol. Run your own representative tasks — but the directional signal is clear.

GPT-5.6 Sol ha vencido a Claude Fable 5 en DeepSWE — el benchmark de agentes de programación más riguroso disponible — costando aproximadamente un tercio por tarea. Las cifras llegan justo cuando la ventana de acceso incluido en la suscripción de Fable 5 se cierra esta noche.

DeepSWE no es una competencia de generación de código. Introduce a un agente en un repositorio open-source real con un cambio solicitado y verifica si el parche final realmente funciona — 113 tareas en 91 repositorios y 5 lenguajes, evaluando navegación de repositorios, diagnóstico de bugs, edición de código, uso de herramientas y reparación multi-paso. La puntuación significa "qué porcentaje de tareas reales de ingeniería de software fueron resueltas". GPT-5.6 Sol resolvió más, por menos dinero.

Lo que ocurrió: GPT-5.6 Sol lidera el benchmark DeepSWE a un tercio del costo

El evaluador independiente Rohan Paul publicó la primera comparación creíble de terceros del benchmark DeepSWE desde que ambos modelos alcanzaron disponibilidad general. GPT-5.6 Sol (max) obtuvo aproximadamente 72–73% a unos $8.40 por tarea, mientras que Claude Fable 5 (max) obtuvo aproximadamente 70% a $13–22 por tarea (Rohan Paul(se abre en una pestaña nueva), 2026).

ModeloPuntuación DeepSWECosto por tareaPrecios entrada/salida
GPT-5.6 Sol (max)~72–73%~$8.40$5 / $30 por 1M tokens
Claude Fable 5 (max)~70%$13–22$10 / $50 por 1M tokens

El Índice de Agentes de Programación de Artificial Analysis —que combina DeepSWE, Terminal-Bench v2 y SWE-Atlas-QnA con harnesses específicos por modelo— corrobora el hallazgo: GPT-5.6 Sol (max) en Codex lidera con 80 puntos, por delante de Claude Fable 5 (max) en Claude Code con 77 (Artificial Analysis(se abre en una pestaña nueva), 2026).

En el Índice de Inteligencia más amplio, Sol obtiene 59 frente a 60 de Fable 5 — un punto por detrás a un tercio del costo por tarea ($1.04 vs $2.75). La brecha de costo en toda la línea de Anthropic es aún más marcada:

  • GPT-5.6 Sol: 3x más barato que Fable 5
  • GPT-5.6 Sol: 5–7x más barato que Opus 4.8
  • GPT-5.6 Sol: 10x más barato que Sonnet 5

Estos multiplicadores provienen del análisis de International Cyber Digest(se abre en una pestaña nueva) (2026), que también registra a Terra como 2x y a Luna como 2x más baratos que Fable 5.

Por qué importa

GPT-5.6 Sol ha estado en el directorio con un veredicto Pendiente desde su preview con restricción gubernamental del 26 de junio. Los datos independientes de benchmark que el directorio estaba esperando ya han llegado — y Sol ha cumplido.

El acceso incluido en la suscripción de Fable 5 expira esta noche a las 11:59 PM PT. Después, será solo por créditos a $10/$50 — los precios de modelo público más caros de Anthropic. No hay un retorno anunciado a las suscripciones.

GPT-5.6 Sol se lanza a $5/$30, incluido en la suscripción, y ahora cuenta con un liderazgo confirmado en benchmarks de agentes de programación.

El drama del control gubernamental que rodeó la preview inicial de Sol ocultó una realidad competitiva más simple: cuando ambos modelos están disponibles, uno cuesta drásticamente menos y resuelve más tareas reales de programación. La cuestión política siempre fue un espectáculo secundario. El benchmark es el evento principal.

Para los equipos que construyen agentes de programación, el costo por tarea se acumula rápidamente. Una ejecución nocturna de 50 tareas a $22/tarea (Fable 5) cuesta $1,100. La misma carga de trabajo en Sol cuesta aproximadamente $420. En un mes de ejecuciones diarias, esa brecha es de $20,000.

Lo que cambia para ti

Si estás eligiendo entre GPT-5.6 Sol y Claude Fable 5 para cargas de trabajo de agentes de programación, la señal direccional es inequívoca. Sol ofrece mediblemente más tareas resueltas a un tercio del costo. Ejecuta tus propios repositorios representativos para confirmar, pero no esperes un desempate que ya llegó.

Si Fable 5 está en tu pipeline, audítalo hoy. Después de las 11:59 PM PT, cada bucle del agente consume créditos a $10/$50 sin alternativa de suscripción medida. Presupuesta en consecuencia — no hay un límite automático de gasto.

Para equipos que no necesitan razonamiento máximo en cada tarea: GPT-5.6 Terra (77 en el Índice de Agentes de Programación a ~$0.55/tarea) y Luna (75 a ~$0.21/tarea) ofrecen un valor aún mejor para trabajo de programación rutinario.

FAQ

¿Es DeepSWE un benchmark confiable? DeepSWE prueba agentes dentro de repositorios open-source reales con verificadores basados en programas — no preguntas de opción múltiple ni tareas de completado de funciones. Mide si un parche realmente funciona en la práctica. El benchmark abarca 113 tareas, 91 repositorios y 5 lenguajes, lo que lo hace más representativo de la ingeniería del mundo real que SWE-bench Verified, que depende de pruebas unitarias de pasa/falla.

¿Significa esto que Sol es el mejor modelo para todo? No. En AA-Briefcase (tareas de trabajo de conocimiento), Fable 5 aún lidera con una puntuación de rúbrica del 56% frente al 42% de Sol. En el Índice de Inteligencia, ambos están a un punto de distancia. Los datos dicen que Sol es el mejor agente de programación por el dinero — no que Sol sea universalmente superior. Para razonamiento analítico o resultados con calidad de presentación, Fable 5 sigue siendo competitivo.

¿Qué hay de GPT-5.6 Terra y Luna? Ambos obtienen puntuaciones respetables en el Índice de Agentes de Programación — Terra con 77 y Luna con 75 — a un costo por tarea aún menor. Si tus tareas de programación no requieren el máximo esfuerzo de razonamiento, las variantes más baratas pueden ofrecer un valor aún mejor. Toda la familia GPT-5.6 define ahora una nueva frontera de Pareto en los gráficos de inteligencia vs. costo.

pendingelección anterior
recommendednueva elección

GPT-5.6 Sol leads the DeepSWE coding-agent benchmark at 72-73% vs Fable 5's 70% at one-third the cost, and tops the Artificial Analysis Coding Agent Index at 80 points. These are the independent benchmarks the directory was waiting for — the verdict moves from Pending to Recommended.

Qué hacer

  1. 1 If your coding-agent workload is budget-sensitive, benchmark GPT-5.6 Sol against Fable 5 on your own repos — the public data favors Sol on both performance and cost
  2. 2 Don't let Fable 5's credit-only pricing surprise you — tonight is the last night of subscription-included access

Herramientas y modelos afectados

No vuelvas a tener que ponerte al día

El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.

Al suscribirte aceptas nuestra Política de privacidad. Cancela cuando quieras.