GPT-5.6 Sol surpasse Fable 5 sur DeepSWE pour un tiers du coût

OpenAI logoOpenAIVerdict modifié12 juillet 2026Modèles
Ce qui s’est passé
GPT-5.6 Sol scored ~72–73% on the DeepSWE coding-agent benchmark to Fable 5's ~70%, at roughly one-third the cost per task ($8.40 vs $13–22).
Pourquoi c’est important
This is the first credible third-party benchmark since both models reached GA, and it reverses the expected outcome: the cheaper model wins on both performance and cost. Fable 5's $10/$50 credit-only pricing (starting tonight) is now empirically harder to justify.
Que faire
If you're choosing between GPT-5.6 Sol and Fable 5 for coding-agent workloads, the benchmark and pricing data both favor Sol. Run your own representative tasks — but the directional signal is clear.

GPT-5.6 Sol surpasse Fable 5 sur DeepSWE pour un tiers du coût

GPT-5.6 Sol a battu Claude Fable 5 sur DeepSWE — le benchmark d'agents de codage le plus rigoureux disponible — tout en coûtant environ trois fois moins cher par tâche. Ces chiffres arrivent alors que la fenêtre d'accès inclus dans l'abonnement de Fable 5 se referme ce soir.

DeepSWE n'est pas un concours de génération de code. Il plonge un agent dans un vrai dépôt open source avec une modification demandée et vérifie si le correctif final fonctionne réellement — 113 tâches sur 91 dépôts et 5 langages, testant la navigation dans le dépôt, le diagnostic de bugs, l'édition de code, l'utilisation d'outils et la réparation en plusieurs étapes. Le score signifie « quel pourcentage de vraies tâches d'ingénierie logicielle ont été résolues ». GPT-5.6 Sol en a résolu davantage, pour moins d'argent.

Ce qui s'est passé : GPT-5.6 Sol domine le benchmark DeepSWE pour un tiers du coût

L'évaluateur indépendant Rohan Paul a publié la première comparaison crédible du benchmark DeepSWE par un tiers depuis que les deux modèles sont disponibles au grand public. GPT-5.6 Sol (max) a obtenu environ 72–73 % à environ 8,40 $ par tâche, tandis que Claude Fable 5 (max) a obtenu environ 70 % à 13–22 $ par tâche (Rohan Paul(s’ouvre dans un nouvel onglet), 2026).

ModèleScore DeepSWECoût par tâcheTarifs entrée / sortie
GPT-5.6 Sol (max)~72–73%~8,40 $5 $ / 30 $ par 1M tokens
Claude Fable 5 (max)~70%13–22 $10 $ / 50 $ par 1M tokens

L'Artificial Analysis Coding Agent Index — qui combine DeepSWE, Terminal-Bench v2 et SWE-Atlas-QnA sur des harnais spécifiques à chaque modèle — corrobore ce résultat : GPT-5.6 Sol (max) dans Codex est en tête avec 80 points, devant Claude Fable 5 (max) dans Claude Code à 77 (Artificial Analysis(s’ouvre dans un nouvel onglet), 2026).

Sur l'Intelligence Index plus large, Sol obtient 59 contre 60 pour Fable 5 — un point de retard pour un tiers du coût par tâche (1,04 $ contre 2,75 $). L'écart de coût sur l'ensemble de la gamme Anthropic est encore plus marqué :

  • GPT-5.6 Sol : 3x moins cher que Fable 5
  • GPT-5.6 Sol : 5–7x moins cher qu'Opus 4.8
  • GPT-5.6 Sol : 10x moins cher que Sonnet 5

Ces multiplicateurs proviennent de l'analyse de l'International Cyber Digest(s’ouvre dans un nouvel onglet) (2026), qui suit également Terra à 2x et Luna à 2x moins cher que Fable 5.

Pourquoi c'est important

GPT-5.6 Sol figure dans le répertoire avec un verdict Pending depuis son aperçu sous contrôle gouvernemental du 26 juin. Les données de benchmark indépendantes que le répertoire attendait sont maintenant arrivées — et Sol a tenu ses promesses.

L'accès inclus dans l'abonnement de Fable 5 expire ce soir à 23h59 PT. Ensuite, ce sera crédits uniquement à 10 $/50 $ — la tarification la plus chère parmi les modèles disponibles publiquement d'Anthropic. Aucun retour aux abonnements n'a été annoncé.

GPT-5.6 Sol est lancé à 5 $/30 $, inclus dans l'abonnement, et affiche désormais une avance confirmée sur le benchmark d'agents de codage.

Le feuilleton du contrôle gouvernemental qui a entouré l'aperçu initial de Sol a occulté une réalité concurrentielle plus simple : quand les deux modèles sont disponibles, l'un coûte nettement moins cher et résout plus de vraies tâches de codage. La question politique n'a toujours été qu'un spectacle. Le benchmark est l'événement principal.

Pour les équipes qui construisent des agents de codage, le calcul du coût par tâche s'amplifie rapidement. Une exécution nocturne de 50 tâches à 22 $/tâche (Fable 5) coûte 1 100 $. La même charge de travail sur Sol coûte environ 420 $. Sur un mois d'exécutions quotidiennes, cet écart représente 20 000 $.

Ce qui change pour vous

Si vous devez choisir entre GPT-5.6 Sol et Claude Fable 5 pour des charges de travail d'agents de codage, le signal directionnel est sans ambiguïté. Sol résout sensiblement plus de tâches pour un tiers du coût. Exécutez vos propres dépôts représentatifs pour confirmer, mais n'attendez pas un départage qui est déjà arrivé.

Si Fable 5 fait partie de votre pipeline, auditez-le aujourd'hui. Après 23h59 PT, chaque boucle d'agent brûle des crédits à 10 $/50 $ sans filet de sécurité d'abonnement. Budgétez en conséquence — il n'y a pas de plafond automatique sur les dépenses.

Pour les équipes qui n'ont pas besoin du raisonnement maximal sur chaque tâche : GPT-5.6 Terra (77 au Coding Agent Index à ~0,55 $/tâche) et Luna (75 à ~0,21 $/tâche) offrent un rapport qualité-prix encore meilleur pour le travail de codage routinier.

FAQ

DeepSWE est-il un benchmark fiable ? DeepSWE teste des agents à l'intérieur de vrais dépôts open source avec des vérificateurs basés sur des programmes — pas des QCM ou des tâches de complétion de fonction. Il mesure si un correctif fonctionne réellement en pratique. Le benchmark couvre 113 tâches, 91 dépôts et 5 langages, ce qui le rend plus représentatif de l'ingénierie réelle que SWE-bench Verified, qui repose sur des tests unitaires succès/échec.

Est-ce que cela signifie que Sol est le meilleur modèle pour tout ? Non. Sur AA-Briefcase (tâches de travail intellectuel), Fable 5 reste en tête avec un Rubric Score de 56 % contre 42 % pour Sol. Sur l'Intelligence Index, les deux sont à un point d'écart. Les données indiquent que Sol est le meilleur agent de codage pour l'argent investi — pas que Sol est universellement supérieur. Pour le raisonnement analytique ou les livrables de qualité présentation, Fable 5 reste compétitif.

Qu'en est-il de GPT-5.6 Terra et Luna ? Les deux obtiennent des scores honorables au Coding Agent Index — Terra à 77 et Luna à 75 — avec un coût par tâche encore plus bas. Si vos tâches de codage ne nécessitent pas un effort de raisonnement maximal, les variantes moins chères peuvent offrir un rapport qualité-prix encore meilleur. Toute la famille GPT-5.6 définit désormais une nouvelle frontière de Pareto sur les graphiques intelligence/coût.

pendingchoix précédent
recommendednouveau choix

GPT-5.6 Sol leads the DeepSWE coding-agent benchmark at 72-73% vs Fable 5's 70% at one-third the cost, and tops the Artificial Analysis Coding Agent Index at 80 points. These are the independent benchmarks the directory was waiting for — the verdict moves from Pending to Recommended.

Que faire

  1. 1 If your coding-agent workload is budget-sensitive, benchmark GPT-5.6 Sol against Fable 5 on your own repos — the public data favors Sol on both performance and cost
  2. 2 Don't let Fable 5's credit-only pricing surprise you — tonight is the last night of subscription-included access

Outils et modèles concernés

Ne ratez plus jamais une mise à jour

Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.

En vous abonnant, vous acceptez notre Politique de confidentialité. Désabonnement à tout moment.