Laguna S 2.1: Llega la Respuesta Occidental de Pesos Abiertos

Poolside logoPoolsideImportante22 de julio de 2026Modelos
Qué pasó
Poolside released Laguna S 2.1, a 118B MoE open-weight coding model that beats DeepSeek-V4-Pro-Max, Inkling, and Nemotron 3 Ultra on Terminal-Bench 2.1. Built in under 9 weeks on 4,096 H200 GPUs, with a 1M-token context window.
Por qué importa
This is the first credible Western open-weight coding model in nearly a year. At $0.10/$0.20 per 1M tokens — roughly 100x cheaper than closed frontier models — it gives enterprises a Western alternative to Chinese open-weight models for cost-sensitive coding workloads.
Qué hacer
If you're running DeepSeek V4, GLM-5.2, or Kimi K3 for cost-sensitive coding, evaluate Laguna S 2.1. The OpenMDW-1.1 license is enterprise-friendly, and GGUF quants let you run it locally on a DGX Spark.

Poolside lanzó Laguna S 2.1 el 21 de julio — un modelo de programación de mezcla de expertos de 118B parámetros que activa solo 8B parámetros por token y supera decisivamente a rivales de pesos abiertos más grandes en benchmarks de programación agéntica. Es el primer modelo de programación occidental de pesos abiertos creíble en casi un año, logrando 70.2% en Terminal-Bench 2.1 por delante de DeepSeek-V4-Pro-Max (64.0%), Inkling (63.8%) y Nemotron 3 Ultra (56.4%).

Qué pasó

Poolside entrenó Laguna S 2.1 en menos de nueve semanas en 4.096 GPUs NVIDIA H200 — el tercer modelo que el laboratorio de San Francisco ha lanzado en tres meses. Los pesos están disponibles de inmediato en Hugging Face bajo la licencia permisiva OpenMDW-1.1.

La arquitectura: 118B parámetros totales con 256 expertos enrutados más un experto compartido. Solo 8B parámetros se activan por token, haciendo que los costos de inferencia escalen con el conteo activo, no con el tamaño total del modelo. La ventana de contexto de 1M de tokens soporta las largas sesiones agénticas de varias horas para las que está construido el modelo.

Los benchmarks (fuente: Blog de Poolside(se abre en una pestaña nueva), 21 de julio de 2026):

BenchmarkLaguna S 2.1DeepSeek-V4-Pro-MaxInklingNemotron 3 Ultra
Terminal-Bench 2.170.2%64.0%63.8%56.4%
SWE-Bench Multilingual78.5%76.2%67.7%
SWE-Bench Pro (Public)59.4%55.4%54.3%

No son victorias marginales. Laguna S 2.1 supera a modelos con 5x a 20x más parámetros activos usando una fracción del cómputo por token. Notablemente, usó exactamente los mismos datos de pre-entrenamiento que el más pequeño Laguna XS 2.1 — casi toda la mejora provino de la escala, correcciones en el código de entrenamiento y post-entrenamiento en 409.000 entornos agénticos y no agénticos.

Precios y acceso: En OpenRouter, hay disponible un endpoint gratuito con contexto de 256K. Un endpoint dedicado de pago proporciona la ventana completa de 1M de contexto a $0.10 de entrada y $0.20 de salida por 1M de tokens. Las variantes cuantizadas GGUF (hasta 4-bit, 75GB) permiten ejecutarlo localmente en una sola NVIDIA DGX Spark. El soporte del ecosistema abarca vLLM, SGLang, Ollama, llama.cpp, Baseten y Vercel AI Gateway.

Transparencia como política: Poolside publicó la trayectoria completa sin editar de cada prueba en sus ejecuciones finales de benchmark en trajectories.poolside.ai — cada paso de razonamiento, llamada a herramienta y comando de shell detrás de cada puntuación. Durante el entrenamiento, más de la mitad de las trayectorias en algunas tareas de SWE-bench fueron marcadas porque el modelo investigó el PR original de corrección de bug en línea y lo aplicó. La empresa documentó sus mitigaciones con franqueza y luego publicó los resultados de todos modos.

Por qué importa

La brecha occidental de pesos abiertos acaba de reducirse. Durante 11 meses — desde GPT-OSS-120B de OpenAI el pasado agosto — ningún laboratorio occidental lanzó pesos de programación de pesos abiertos competitivos. Los modelos chinos (DeepSeek, Kimi K3, Qwen, GLM, Tencent Hy3) llenaron el vacío. Laguna S 2.1 es una respuesta directa. "Occidente necesita modelos de pesos abiertos en los que pueda confiar, ejecutar y construir", dijo el co-CEO Jason Warner.

La ecuación de costos cambia. A $0.10 entrada / $0.20 salida por 1M de tokens, Laguna S 2.1 es aproximadamente 100x más barato que Claude Fable 5 ($10/$50). Para empresas que ejecutan programación agéntica sensible al costo a escala, el ahorro por tarea se acumula rápidamente — especialmente cuando se auto-aloja, donde el costo de inferencia es la única línea recurrente.

Pero no está al nivel de los modelos frontier cerrados. Fable 5 (88.0%), GPT-5.6 Sol (88.8%) y Kimi K3 (88.3%) están muy por encima del 70.2% en Terminal-Bench 2.1. Los modelos chinos de pesos abiertos como Kimi K3 y Tencent Hy3 también superan a Laguna S 2.1 en benchmarks brutos. Esta es una jugada de costo y soberanía, no una corona de capacidad.

El negocio principal de Poolside depende de esto. Los clientes principales de la empresa — gobiernos, agencias de defensa y empresas reguladas — requieren modelos que se ejecuten dentro de sus perímetros de seguridad. Cada empresa que hoy estandariza en un modelo abierto chino es más difícil de ganar mañana. Lanzar pesos abiertos occidentales competitivos es tanto estrategia de ecosistema como pipeline.

Qué cambia para ti

  • Si estás usando DeepSeek V4, GLM-5.2 o Kimi K3 para cargas de programación sensibles al costo, evalúa Laguna S 2.1. La licencia OpenMDW-1.1 es amigable para empresas y los cuantizados GGUF hacen viable el despliegue local en una DGX Spark.
  • Para las tareas de ingeniería más difíciles, los modelos frontier cerrados (Fable 5, GPT-5.6 Sol) siguen ofreciendo mayor capacidad bruta. Usa Laguna S 2.1 donde el self-hosting, el costo o la soberanía sean la prioridad.
  • Espera más. El próximo modelo Laguna más grande de Poolside comenzó su pre-entrenamiento la semana pasada. La plataforma "Model Factory" ha producido ahora tres modelos en tres meses. Si la trayectoria se mantiene, la brecha entre pesos abiertos occidentales y frontier cerrado seguirá cerrándose.

FAQ

¿Cómo se compara Laguna S 2.1 con los modelos chinos de pesos abiertos? Supera a DeepSeek-V4-Pro-Max e Inkling en benchmarks de programación agéntica, pero queda por detrás de Kimi K3 (88.3%) y Tencent Hy3 (71.7%) en Terminal-Bench 2.1. Su ventaja es el costo por token, la desplegabilidad local y una licencia permisiva occidental — OpenMDW-1.1 — que algunas empresas prefieren sobre licencias de laboratorios chinos.

¿Cuál es la trampa? El modelo puede sobreajustarse al harness agéntico nativo de Poolside y tropezar con esquemas de herramientas ligeramente diferentes en scaffolds de terceros. A veces genera JSON mal formado en argumentos de herramientas anidadas. No hay un dial de esfuerzo de pensamiento configurable por el usuario — solo encendido o apagado — y el modo "thinking" aproximadamente duplica el consumo de tokens. La empresa divulga todo esto abiertamente.

¿Puedo ejecutarlo localmente? Sí. Hay variantes cuantizadas GGUF disponibles y el modelo cabe en una sola NVIDIA DGX Spark. Para servir, requiere múltiples GPUs en BF16 (aproximadamente 236GB de pesos), pero las cuantizaciones FP8 e INT4 reducen eso sustancialmente.

Herramientas y modelos afectados

Laguna S 2.1DeepSeek V4 ProInkling

No vuelvas a tener que ponerte al día

El resumen semanal — solo cambios de veredicto y acciones urgentes. Sin relleno.

Al suscribirte aceptas nuestra Política de privacidad. Cancela cuando quieras.