
Poolside detalha construção de 'fábrica' de modelos frontier
Origem: de $12M perdidos à vindicação com o ChatGPT
Eiso Kant, co-CEO da Poolside AI, começou a construir modelos de linguagem para código em 2015, inspirado pelo artigo de Andrej Karpathy sobre RNNs. Fundou a Sourced, gastou cerca de $12 milhões e quatro a cinco anos desenvolvendo modelos de código antes de o mercado se importar - e fracassou. Quando o ChatGPT surgiu, sentiu como uma vindicação pessoal. A Poolside foi fundada com duas apostas: a capacidade dos modelos continuaria crescendo exponencialmente, e o reinforcement learning seria o principal motor de avanço - ambas contrariavam o consenso da época.
Decisão pelo open source
No início de 2026, Kant e seu co-fundador Jason retomaram a conversa sobre open source. A motivação: Kant prefere viver em um mundo com 100 empresas de modelos fundacionais do que com cinco, mesmo que a Poolside fosse uma das cinco. Ele reconhece que a decisão foi mais fácil porque a empresa ainda não estava na fronteira - quanto mais perto dela, mais difícil seria mudar de direção. A Poolside também se diferencia por publicar pesquisa aberta (não apenas pesos), algo raro entre labs ocidentais.
A Model Factory: 90% engenharia
O conceito central da Poolside é que construir modelos é 90% engenharia. A "Model Factory" é um sistema end-to-end que vai da ingestão de dados brutos da web até o lançamento do modelo, com milhares de componentes. Menos de 70 pesquisadores e 35 engenheiros rodam entre 10.000 e 20.000 experimentos por mês.
Princípios-chave:
- Streaming de dados direto para o treino: em vez de materializar e empacotar datasets inteiros antes de treinar, os dados fluem em tempo real, eliminando gargalos de preparação.
- Dados imutáveis e código versionado: cada experimento é reproduzível até o nível do token individual, permitindo rigor científico real.
- Agentes dentro do pipeline: agentes já escrevem código, lançam jobs, avaliam resultados e modificam pipelines - os primeiros sinais do que Kant chama de RSI (Recursive Self-Improvement).
O resultado prático: o modelo Laguna XS 2 foi do início do treino ao lançamento em cinco semanas. O Laguna S, em oito semanas. Zero eventos de on-call durante todo o ano.
Laguna S: 118B parâmetros, 8B ativos
O Laguna S 2.1 é um modelo Mixture-of-Experts com 118 bilhões de parâmetros totais e 8 bilhões ativos por token, contexto de até 1M tokens, e modos com e sem "thinking". Ele supera o modelo recente da Thinking Machines, que tem quase 10x mais parâmetros. Kant argumenta que persistência, verificação e backtracking podem ser mais importantes do que inteligência bruta.
Visões sobre o futuro
- MCP e tool calls tradicionais são "estúpidos": Kant defende que agentes futuros escreverão scripts em vez de escolher entre ferramentas pré-definidas.
- RL vai migrar para mais cedo no pré-treino: o reinforcement learning não ficará restrito ao post-training.
- Next-token prediction ainda extrai pouco da web: há muito conhecimento não aproveitado no paradigma atual.
- Modelos menores podem fazer mais: há capacidade latente em modelos pequenos que ainda não foi explorada.
- Regulação pode criar oligopólio: regras mal desenhadas podem acidentalmente consolidar o mercado em duas ou três empresas.
- A Poolside levantou $500 milhões enquanto investidores ainda questionavam se AGI era real.