
Poolside lança Laguna S 2.1, modelo MoE para coding agentic de longa duração
resumo de ~3 min
Laguna S 2.1: modelo MoE da Poolside para coding agentic
A Poolside lançou o Laguna S 2.1, um modelo Mixture-of-Experts com 118B de parâmetros totais e ~8B ativados por token, projetado para coding agentic e tarefas de longa duração. Ele se posiciona entre o Laguna XS 2.1 (33B-A3B) e o Laguna M.1 (225B-A23B) na série Laguna.
Arquitetura
- 48 camadas com proporção 1:3 entre atenção global e sliding-window (12 camadas globais, 36 com janela de 512 tokens)
- 256 experts roteados (top-10) mais 1 expert compartilhado
- Atenção grouped-query com 8 KV heads e gating softplus por head
- Janela de contexto de 1.048.576 tokens (1M)
- Vocabulário de 100.352 tokens
Destaques
- Raciocínio nativo: thinking intercalado entre chamadas de ferramentas, com controle por requisição via
enable_thinking - Decodificação especulativa: modelo draft DFlash treinado para servir com menor latência
- Variantes quantizadas: FP8, NVFP4, INT4 e GGUF disponíveis
- Licença OpenMDW-1.1: uso e modificação livres para fins comerciais e não comerciais
Benchmarks (21 de julho de 2026)
| Benchmark | Laguna S 2.1 |
|---|---|
| Terminal-Bench 2.1 | 70,2% |
| SWE-bench Multilingual | 78,5% |
| SWE-Bench Pro | 59,4% |
| DeepSWE | 40,4% |
| SWE Atlas | 46,2% |
| Toolathlon Verified | 49,7% |
Em comparação, o Claude Fable 5 atinge 88% no Terminal-Bench e 80,3% no SWE-Bench Pro; o Kimi K3 marca 88,3% no Terminal-Bench; e o Qwen 3.7 Max alcança 78,3% no SWE-bench Multilingual.
Infraestrutura
O checkpoint BF16 requer múltiplas GPUs (~236GB de pesos). É compatível com vLLM, SGLang, TRT-LLM e llama.cpp (via fork da Poolside com suporte a DFlash). A Poolside recomenda manter o reasoning_content no histórico de mensagens para melhor desempenho em cenários agentic.