GPT-5.6 Sol Supera Fable 5 no Benchmark DeepSWE — por Um Terço do Custo
- O que aconteceu
- GPT-5.6 Sol scored ~72–73% on the DeepSWE coding-agent benchmark to Fable 5's ~70%, at roughly one-third the cost per task ($8.40 vs $13–22).
- Porque é importante
- This is the first credible third-party benchmark since both models reached GA, and it reverses the expected outcome: the cheaper model wins on both performance and cost. Fable 5's $10/$50 credit-only pricing (starting tonight) is now empirically harder to justify.
- O que fazer
- If you're choosing between GPT-5.6 Sol and Fable 5 for coding-agent workloads, the benchmark and pricing data both favor Sol. Run your own representative tasks — but the directional signal is clear.
GPT-5.6 Sol superou o Claude Fable 5 no DeepSWE — o benchmark de agente de codificação mais rigoroso disponível — custando aproximadamente um terço por tarefa. Os números chegam exatamente quando a janela de acesso incluso na assinatura do Fable 5 se encerra hoje à noite.
O DeepSWE não é uma competição de geração de código. Ele coloca um agente dentro de um repositório open-source real com uma alteração solicitada e verifica se o patch final realmente funciona — 113 tarefas em 91 repositórios e 5 linguagens, testando navegação em repositórios, diagnóstico de bugs, edição de código, uso de ferramentas e reparo em múltiplas etapas. A pontuação significa "qual porcentagem de tarefas reais de engenharia de software foram resolvidas". O GPT-5.6 Sol resolveu mais delas, por menos dinheiro.
O que aconteceu: GPT-5.6 Sol lidera o benchmark DeepSWE por um terço do custo
O avaliador independente Rohan Paul publicou a primeira comparação confiável de terceiros no benchmark DeepSWE desde que ambos os modelos alcançaram disponibilidade geral. O GPT-5.6 Sol (max) marcou aproximadamente 72–73% a cerca de $8,40 por tarefa, enquanto o Claude Fable 5 (max) marcou aproximadamente 70% a $13–22 por tarefa (Rohan Paul(abre num novo separador), 2026).
| Modelo | Pontuação DeepSWE | Custo por tarefa | Preço Input / Output |
|---|---|---|---|
| GPT-5.6 Sol (max) | ~72–73% | ~$8,40 | $5 / $30 por 1M tokens |
| Claude Fable 5 (max) | ~70% | $13–22 | $10 / $50 por 1M tokens |
O Coding Agent Index da Artificial Analysis — que combina DeepSWE, Terminal-Bench v2 e SWE-Atlas-QnA em harnesses específicos por modelo — corrobora a descoberta: o GPT-5.6 Sol (max) no Codex lidera com 80 pontos, à frente do Claude Fable 5 (max) no Claude Code com 77 (Artificial Analysis(abre num novo separador), 2026).
No Intelligence Index mais amplo, o Sol marca 59 contra 60 do Fable 5 — um ponto atrás por um terço do custo por tarefa ($1,04 vs $2,75). A diferença de custo em toda a linha da Anthropic é ainda mais gritante:
- GPT-5.6 Sol: 3x mais barato que o Fable 5
- GPT-5.6 Sol: 5–7x mais barato que o Opus 4.8
- GPT-5.6 Sol: 10x mais barato que o Sonnet 5
Esses multiplicadores vêm da análise do International Cyber Digest(abre num novo separador) (2026), que também registra o Terra em 2x e o Luna em 2x mais baratos que o Fable 5.
Por que isso importa
O GPT-5.6 Sol está no diretório com veredito Pendente desde sua prévia com restrição governamental de 26 de junho. Os dados independentes de benchmark que o diretório estava aguardando agora chegaram — e o Sol entregou.
O acesso incluso na assinatura do Fable 5 expira hoje à noite às 23h59 PT. Depois disso, será apenas créditos a $10/$50 — o preço de modelo publicamente disponível mais caro da Anthropic. Não há retorno anunciado às assinaturas.
O GPT-5.6 Sol é lançado a $5/$30, incluso na assinatura, e agora tem uma liderança confirmada em benchmark de agente de codificação.
O drama da restrição governamental que cercou a prévia inicial do Sol obscureceu uma realidade competitiva mais simples: quando ambos os modelos estão disponíveis, um custa dramaticamente menos e resolve mais tarefas reais de codificação. A questão política sempre foi um espetáculo paralelo. O benchmark é o evento principal.
Para equipes que constroem agentes de codificação, a matemática do custo por tarefa se acumula rapidamente. Uma execução noturna de 50 tarefas a $22/tarefa (Fable 5) custa $1.100. A mesma carga de trabalho no Sol custa cerca de $420. Ao longo de um mês de execuções diárias, essa diferença é de $20.000.
O que muda para você
Se você está escolhendo entre o GPT-5.6 Sol e o Claude Fable 5 para cargas de trabalho de agente de codificação, o sinal direcional é inequívoco. O Sol entrega mensuravelmente mais tarefas resolvidas por um terço do custo. Execute seus próprios repositórios representativos para confirmar, mas não espere por um desempate que já chegou.
Se o Fable 5 está no seu pipeline, faça a auditoria hoje. Após 23h59 PT, cada loop de agente queima créditos a $10/$50 sem alternativa de assinatura medida. Faça o orçamento adequado — não há limite automático de gastos.
Para equipes que não precisam de raciocínio máximo em todas as tarefas: o GPT-5.6 Terra (77 no Coding Agent Index a ~$0,55/tarefa) e o Luna (75 a ~$0,21/tarefa) oferecem valor ainda melhor para trabalho rotineiro de codificação.
FAQ
O DeepSWE é um benchmark confiável? O DeepSWE testa agentes dentro de repositórios open-source reais com verificadores baseados em programa — não perguntas de múltipla escolha ou tarefas de completação de função. Ele mede se um patch realmente funciona na prática. O benchmark abrange 113 tarefas, 91 repositórios e 5 linguagens, tornando-o mais representativo da engenharia do mundo real do que o SWE-bench Verified, que depende de aprovação/reprovação em testes unitários.
Isso significa que o Sol é o melhor modelo para tudo? Não. No AA-Briefcase (tarefas de trabalho de conhecimento), o Fable 5 ainda lidera com um Rubric Score de 56% contra 42% do Sol. No Intelligence Index, os dois estão separados por um ponto. Os dados dizem que o Sol é o melhor agente de codificação pelo custo — não que o Sol é universalmente superior. Para raciocínio analítico ou resultados com qualidade de apresentação, o Fable 5 permanece competitivo.
E quanto ao GPT-5.6 Terra e Luna? Ambos pontuam respeitavelmente no Coding Agent Index — Terra com 77 e Luna com 75 — com custo por tarefa ainda menor. Se suas tarefas de codificação não exigem esforço máximo de raciocínio, as variantes mais baratas podem oferecer valor ainda melhor. Toda a família GPT-5.6 agora define uma nova fronteira de Pareto nos gráficos de inteligência versus custo.
GPT-5.6 Sol leads the DeepSWE coding-agent benchmark at 72-73% vs Fable 5's 70% at one-third the cost, and tops the Artificial Analysis Coding Agent Index at 80 points. These are the independent benchmarks the directory was waiting for — the verdict moves from Pending to Recommended.
O que fazer
- 1 If your coding-agent workload is budget-sensitive, benchmark GPT-5.6 Sol against Fable 5 on your own repos — the public data favors Sol on both performance and cost
- 2 Don't let Fable 5's credit-only pricing surprise you — tonight is the last night of subscription-included access
Ferramentas e modelos afetados
Nunca mais precisas de te pôr a par
O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.