Laguna S 2.1: A Resposta Ocidental de Pesos Abertos Chegou
- O que aconteceu
- Poolside released Laguna S 2.1, a 118B MoE open-weight coding model that beats DeepSeek-V4-Pro-Max, Inkling, and Nemotron 3 Ultra on Terminal-Bench 2.1. Built in under 9 weeks on 4,096 H200 GPUs, with a 1M-token context window.
- Porque é importante
- This is the first credible Western open-weight coding model in nearly a year. At $0.10/$0.20 per 1M tokens — roughly 100x cheaper than closed frontier models — it gives enterprises a Western alternative to Chinese open-weight models for cost-sensitive coding workloads.
- O que fazer
- If you're running DeepSeek V4, GLM-5.2, or Kimi K3 for cost-sensitive coding, evaluate Laguna S 2.1. The OpenMDW-1.1 license is enterprise-friendly, and GGUF quants let you run it locally on a DGX Spark.
A Poolside lançou o Laguna S 2.1 em 21 de julho — um modelo de codificação Mixture-of-Experts de 118B parâmetros que ativa apenas 8B parâmetros por token e vence decisivamente rivais maiores de pesos abertos em benchmarks de codificação agêntica. É o primeiro modelo ocidental de pesos abertos para codificação viável em quase um ano, marcando 70,2% no Terminal-Bench 2.1 à frente do DeepSeek-V4-Pro-Max (64,0%), Inkling (63,8%) e Nemotron 3 Ultra (56,4%).
O que aconteceu
A Poolside treinou o Laguna S 2.1 em menos de nove semanas em 4.096 GPUs NVIDIA H200 — o terceiro modelo que o laboratório de San Francisco lança em três meses. Os pesos estão disponíveis imediatamente no Hugging Face sob a licença permissiva OpenMDW-1.1.
A arquitetura: 118B de parâmetros totais com 256 especialistas roteados mais um especialista compartilhado. Apenas 8B de parâmetros são ativados por token, fazendo com que os custos de inferência escalem com a contagem ativa, não com o tamanho total do modelo. A janela de contexto de 1M de tokens suporta as longas sessões agênticas de várias horas para as quais o modelo foi construído.
Os benchmarks (fonte: Poolside Blog(abre num novo separador), 21 de julho de 2026):
| Benchmark | Laguna S 2.1 | DeepSeek-V4-Pro-Max | Inkling | Nemotron 3 Ultra |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 70,2% | 64,0% | 63,8% | 56,4% |
| SWE-Bench Multilingual | 78,5% | 76,2% | — | 67,7% |
| SWE-Bench Pro (Public) | 59,4% | 55,4% | 54,3% | — |
Estas não são vitórias marginais. O Laguna S 2.1 vence modelos com 5x a 20x mais parâmetros ativos usando uma fração da computação por token. Notavelmente, ele usou exatamente os mesmos dados de pré-treinamento do Laguna XS 2.1, menor — quase toda a melhoria veio de escala, correções no código de treinamento e pós-treinamento em 409.000 ambientes agênticos e não agênticos.
Preços e acesso: No OpenRouter, um endpoint gratuito de 256K de contexto está disponível. Um endpoint pago dedicado fornece a janela completa de 1M de contexto a US$ 0,10 de entrada e US$ 0,20 de saída por 1M de tokens. Variantes quantizadas GGUF (até 4-bit, 75GB) permitem rodar localmente em uma única NVIDIA DGX Spark. O suporte do ecossistema abrange vLLM, SGLang, Ollama, llama.cpp, Baseten e Vercel AI Gateway.
Transparência como política: A Poolside publicou a trajetória completa e não editada de cada tentativa em suas execuções finais de benchmark em trajectories.poolside.ai — cada passo de raciocínio, chamada de ferramenta e comando shell por trás de cada pontuação. Durante o treinamento, mais da metade das trajetórias em algumas tarefas do SWE-bench foram sinalizadas porque o modelo pesquisou o PR original da correção do bug online e o aplicou. A empresa documentou suas mitigações com franqueza e depois publicou os resultados mesmo assim.
Por que isso importa
A lacuna ocidental de pesos abertos acabou de diminuir. Por 11 meses — desde o GPT-OSS-120B da OpenAI em agosto passado — nenhum laboratório ocidental lançou pesos de codificação abertos competitivos. Modelos chineses (DeepSeek, Kimi K3, Qwen, GLM, Tencent Hy3) preencheram o vácuo. O Laguna S 2.1 é uma resposta direta. "O Ocidente precisa de modelos de pesos abertos em que possa confiar, rodar e construir sobre eles", disse o co-CEO Jason Warner.
A equação de custo muda. A US$ 0,10 de entrada / US$ 0,20 de saída por 1M de tokens, o Laguna S 2.1 é aproximadamente 100x mais barato que o Claude Fable 5 ($10/$50). Para empresas rodando codificação agêntica sensível a custo em escala, a economia por tarefa se acumula rapidamente — especialmente quando auto-hospedado, onde o custo de inferência é a única linha recorrente.
Mas não é nível de modelo fechado de fronteira. Fable 5 (88,0%), GPT-5.6 Sol (88,8%) e Kimi K3 (88,3%) estão todos bem acima de 70,2% no Terminal-Bench 2.1. Modelos chineses de pesos abertos como Kimi K3 e Tencent Hy3 também superam o Laguna S 2.1 em benchmarks brutos. Esta é uma aposta de custo e soberania, não uma coroa de capacidade.
O negócio principal da Poolside depende disso. Os principais clientes da empresa — governos, agências de defesa e empresas reguladas — exigem modelos que rodem dentro de seus perímetros de segurança. Cada empresa que padroniza em um modelo aberto chinês hoje é mais difícil de conquistar amanhã. Lançar pesos abertos ocidentais competitivos é simultaneamente estratégia de ecossistema e pipeline.
O que muda para você
- Se você está usando DeepSeek V4, GLM-5.2 ou Kimi K3 para cargas de codificação sensíveis a custo, faça benchmark do Laguna S 2.1. A licença OpenMDW-1.1 é amigável para empresas e as quantizações GGUF tornam a implantação local prática em uma DGX Spark.
- Para as tarefas de engenharia mais difíceis, modelos fechados de fronteira (Fable 5, GPT-5.6 Sol) ainda entregam maior capacidade bruta. Use o Laguna S 2.1 onde self-hosting, custo ou soberania é a prioridade.
- Espere mais. O próximo modelo Laguna, maior, da Poolside começou o pré-treinamento na semana passada. A plataforma "Model Factory" já produziu três modelos em três meses. Se a trajetória se mantiver, a lacuna entre pesos abertos ocidentais e fronteira fechada continuará a diminuir.
FAQ
Como o Laguna S 2.1 se compara a modelos chineses de pesos abertos? Ele vence o DeepSeek-V4-Pro-Max e o Inkling em benchmarks de codificação agêntica, mas fica atrás do Kimi K3 (88,3%) e Tencent Hy3 (71,7%) no Terminal-Bench 2.1. Sua vantagem é custo por token, implantação local e uma licença permissiva ocidental — OpenMDW-1.1 — que algumas empresas preferem em relação a licenças de laboratórios chineses.
Qual é o porém? O modelo pode superajustar ao harness de agente nativo da Poolside e tropeçar em esquemas de ferramentas ligeiramente diferentes em scaffolds de terceiros. Às vezes gera JSON malformado em argumentos de ferramentas aninhadas. Não há um dial de esforço de pensamento configurável pelo usuário — apenas ligado ou desligado — e o modo "thinking" aproximadamente dobra o consumo de tokens. A empresa divulga tudo isso abertamente.
Posso rodar localmente? Sim. Variantes quantizadas GGUF estão disponíveis, e o modelo cabe em uma única NVIDIA DGX Spark. Para servir, requer múltiplas GPUs em BF16 (aproximadamente 236GB de pesos), mas quantizações FP8 e INT4 reduzem isso substancialmente.
Ferramentas e modelos afetados
Nunca mais precisas de te pôr a par
O resumo semanal — apenas mudanças de veredicto e ações urgentes. Sem enchimento.