Laguna S 2.1: The West's Open-Weight Answer Arrives

Poolside logoPoolsideImportant22 juillet 2026Modèles
Ce qui s’est passé
Poolside released Laguna S 2.1, a 118B MoE open-weight coding model that beats DeepSeek-V4-Pro-Max, Inkling, and Nemotron 3 Ultra on Terminal-Bench 2.1. Built in under 9 weeks on 4,096 H200 GPUs, with a 1M-token context window.
Pourquoi c’est important
This is the first credible Western open-weight coding model in nearly a year. At $0.10/$0.20 per 1M tokens — roughly 100x cheaper than closed frontier models — it gives enterprises a Western alternative to Chinese open-weight models for cost-sensitive coding workloads.
Que faire
If you're running DeepSeek V4, GLM-5.2, or Kimi K3 for cost-sensitive coding, evaluate Laguna S 2.1. The OpenMDW-1.1 license is enterprise-friendly, and GGUF quants let you run it locally on a DGX Spark.

Poolside a publié Laguna S 2.1 le 21 juillet — un modèle de codage Mixture-of-Experts de 118 milliards de paramètres qui n'active que 8 milliards de paramètres par token et bat nettement ses concurrents open-weight plus grands sur les benchmarks de codage agentique. C'est le premier modèle de codage open-weight occidental crédible depuis près d'un an, avec un score de 70,2 % sur Terminal-Bench 2.1 devant DeepSeek-V4-Pro-Max (64,0 %), Inkling (63,8 %) et Nemotron 3 Ultra (56,4 %).

Ce qui s'est passé

Poolside a entraîné Laguna S 2.1 en moins de neuf semaines sur 4 096 GPU NVIDIA H200 — le troisième modèle que le laboratoire de San Francisco a livré en trois mois. Les poids sont disponibles immédiatement sur Hugging Face sous la licence permissive OpenMDW-1.1.

L'architecture : 118 milliards de paramètres au total avec 256 experts routés plus un expert partagé. Seuls 8 milliards de paramètres s'activent par token, ce qui fait que les coûts d'inférence évoluent avec le nombre actif, pas la taille totale du modèle. La fenêtre de contexte d'1 million de tokens prend en charge les longues sessions agentiques de plusieurs heures pour lesquelles le modèle est conçu.

Les benchmarks (source : Blog Poolside(s’ouvre dans un nouvel onglet), 21 juillet 2026) :

BenchmarkLaguna S 2.1DeepSeek-V4-Pro-MaxInklingNemotron 3 Ultra
Terminal-Bench 2.170,2 %64,0 %63,8 %56,4 %
SWE-Bench Multilingual78,5 %76,2 %67,7 %
SWE-Bench Pro (Public)59,4 %55,4 %54,3 %

Ce ne sont pas des victoires marginales. Laguna S 2.1 bat des modèles avec 5 à 20 fois plus de paramètres actifs tout en utilisant une fraction du calcul par token. Il est notable qu'il a utilisé exactement les mêmes données de pré-entraînement que le plus petit Laguna XS 2.1 — presque toute l'amélioration provient de l'échelle, des corrections du code d'entraînement et du post-entraînement sur 409 000 environnements agentiques et non agentiques.

Tarifs et accès : Sur OpenRouter, un endpoint gratuit avec contexte de 256K est disponible. Un endpoint payant dédié fournit la fenêtre complète d'1M de contexte à 0,10 $ en entrée et 0,20 $ en sortie par million de tokens. Des variantes quantifiées GGUF (jusqu'à 4 bits, 75 Go) permettent de l'exécuter localement sur une seule NVIDIA DGX Spark. Le support de l'écosystème couvre vLLM, SGLang, Ollama, llama.cpp, Baseten et Vercel AI Gateway.

La transparence comme politique : Poolside a publié la trajectoire complète et non éditée de chaque essai de ses benchmarks finaux sur trajectories.poolside.ai — chaque étape de raisonnement, appel d'outil et commande shell derrière chaque score. Pendant l'entraînement, plus de la moitié des trajectoires sur certaines tâches SWE-bench ont été signalées parce que le modèle recherchait en ligne la PR originale de correction de bug et l'appliquait. L'entreprise a documenté ses mesures d'atténuation avec franchise, puis a publié les résultats quand même.

Pourquoi c'est important

L'écart open-weight occidental vient de se réduire. Pendant 11 mois — depuis GPT-OSS-120B d'OpenAI en août dernier — aucun laboratoire occidental n'avait publié de poids de codage open-weight compétitifs. Les modèles chinois (DeepSeek, Kimi K3, Qwen, GLM, Tencent Hy3) ont rempli le vide. Laguna S 2.1 est une réponse directe. « L'Occident a besoin de modèles open-weight auxquels il peut faire confiance, qu'il peut exécuter et sur lesquels il peut construire, » a déclaré le co-PDG Jason Warner.

L'équation des coûts bascule. À 0,10 $ en entrée / 0,20 $ en sortie par million de tokens, Laguna S 2.1 est environ 100 fois moins cher que Claude Fable 5 (10 $/50 $). Pour les entreprises qui exécutent du codage agentique sensible aux coûts à grande échelle, les économies par tâche se composent rapidement — surtout en auto-hébergement, où le coût d'inférence est la seule ligne récurrente.

Mais ce n'est pas au niveau des modèles fermés frontaliers. Fable 5 (88,0 %), GPT-5.6 Sol (88,8 %) et Kimi K3 (88,3 %) se situent tous bien au-dessus de 70,2 % sur Terminal-Bench 2.1. Les modèles open-weight chinois comme Kimi K3 et Tencent Hy3 surpassent également Laguna S 2.1 sur les benchmarks bruts. C'est un pari sur le coût et la souveraineté, pas sur la couronne de la capacité.

Le cœur de métier de Poolside en dépend. Les clients principaux de l'entreprise — gouvernements, agences de défense et entreprises réglementées — exigent des modèles qui s'exécutent à l'intérieur de leurs périmètres de sécurité. Chaque entreprise qui standardise aujourd'hui sur un modèle ouvert chinois est plus difficile à conquérir demain. Publier des poids ouverts occidentaux compétitifs est à la fois une stratégie d'écosystème et de pipeline.

Ce qui change pour vous

  • Si vous utilisez DeepSeek V4, GLM-5.2 ou Kimi K3 pour des workloads de codage sensibles aux coûts, benchmarkez Laguna S 2.1. La licence OpenMDW-1.1 est favorable aux entreprises et les quants GGUF rendent le déploiement local pratique sur une DGX Spark.
  • Pour les tâches d'ingénierie les plus difficiles, les modèles fermés frontaliers (Fable 5, GPT-5.6 Sol) offrent toujours une capacité brute supérieure. Utilisez Laguna S 2.1 là où l'auto-hébergement, le coût ou la souveraineté est la priorité.
  • Attendez-vous à plus. Le prochain modèle Laguna de Poolside, plus grand, a commencé son pré-entraînement la semaine dernière. La plateforme « Model Factory » a maintenant produit trois modèles en trois mois. Si la trajectoire se maintient, l'écart entre l'open-weight occidental et le fermé frontalier continuera de se réduire.

FAQ

Comment Laguna S 2.1 se compare-t-il aux modèles open-weight chinois ? Il bat DeepSeek-V4-Pro-Max et Inkling sur les benchmarks de codage agentique, mais reste derrière Kimi K3 (88,3 %) et Tencent Hy3 (71,7 %) sur Terminal-Bench 2.1. Son avantage est le coût par token, la déployabilité locale et une licence permissive occidentale — OpenMDW-1.1 — que certaines entreprises préfèrent aux licences des laboratoires chinois.

Quel est le bémol ? Le modèle peut surapprendre au harness agentique natif de Poolside et trébucher sur des schémas d'outils légèrement différents dans des scaffolds tiers. Il écrase parfois le JSON dans les arguments d'outils imbriqués. Il n'y a pas de cadran d'effort de réflexion configurable par l'utilisateur — juste activé ou désactivé — et le mode « réflexion » double approximativement la consommation de tokens. L'entreprise divulgue tout cela ouvertement.

Puis-je l'exécuter localement ? Oui. Des variantes quantifiées GGUF sont disponibles, et le modèle tient sur une seule NVIDIA DGX Spark. Pour le serving, il nécessite plusieurs GPU en BF16 (environ 236 Go de poids), mais les quants FP8 et INT4 réduisent cela substantiellement.

Outils et modèles concernés

Laguna S 2.1DeepSeek V4 ProInkling

Ne ratez plus jamais une mise à jour

Le récap hebdomadaire — uniquement les changements de verdict et les actions urgentes. Sans remplissage.

En vous abonnant, vous acceptez notre Politique de confidentialité. Désabonnement à tout moment.