stamatios
← Voltar ao feed
Poolside lança Laguna S 2.1, modelo MoE para coding agentic de longa duração
IA & Modelos · Open Source

Poolside lança Laguna S 2.1, modelo MoE para coding agentic de longa duração

resumo de ~3 min

Laguna S 2.1: modelo MoE da Poolside para coding agentic

A Poolside lançou o Laguna S 2.1, um modelo Mixture-of-Experts com 118B de parâmetros totais e ~8B ativados por token, projetado para coding agentic e tarefas de longa duração. Ele se posiciona entre o Laguna XS 2.1 (33B-A3B) e o Laguna M.1 (225B-A23B) na série Laguna.

Arquitetura

  • 48 camadas com proporção 1:3 entre atenção global e sliding-window (12 camadas globais, 36 com janela de 512 tokens)
  • 256 experts roteados (top-10) mais 1 expert compartilhado
  • Atenção grouped-query com 8 KV heads e gating softplus por head
  • Janela de contexto de 1.048.576 tokens (1M)
  • Vocabulário de 100.352 tokens

Destaques

  • Raciocínio nativo: thinking intercalado entre chamadas de ferramentas, com controle por requisição via enable_thinking
  • Decodificação especulativa: modelo draft DFlash treinado para servir com menor latência
  • Variantes quantizadas: FP8, NVFP4, INT4 e GGUF disponíveis
  • Licença OpenMDW-1.1: uso e modificação livres para fins comerciais e não comerciais

Benchmarks (21 de julho de 2026)

Benchmark Laguna S 2.1
Terminal-Bench 2.1 70,2%
SWE-bench Multilingual 78,5%
SWE-Bench Pro 59,4%
DeepSWE 40,4%
SWE Atlas 46,2%
Toolathlon Verified 49,7%

Em comparação, o Claude Fable 5 atinge 88% no Terminal-Bench e 80,3% no SWE-Bench Pro; o Kimi K3 marca 88,3% no Terminal-Bench; e o Qwen 3.7 Max alcança 78,3% no SWE-bench Multilingual.

Infraestrutura

O checkpoint BF16 requer múltiplas GPUs (~236GB de pesos). É compatível com vLLM, SGLang, TRT-LLM e llama.cpp (via fork da Poolside com suporte a DFlash). A Poolside recomenda manter o reasoning_content no histórico de mensagens para melhor desempenho em cenários agentic.