
Modelos locais superam nuvem por raciocínio, não memorização
Tese central
Modelos locais menores podem alcançar a mesma qualidade de modelos de nuvem muito maiores, mas por um caminho diferente: raciocínio mais longo em vez de memorização. Tomasz Tunguz argumenta que a métrica relevante para comparar modelos locais e de nuvem deve ser o tempo até a resposta, não a velocidade de geração de tokens.
Evidência de ranking
O Qwen3.8-27B ocupa a primeira posição entre 135 modelos no Intelligence Index da Artificial Analysis, com pontuação 52, um ponto acima do GLM-5.2, modelo de 753 bilhões de parâmetros da Z.ai. Um modelo de laptop supera um modelo de nuvem de classe frontier aproximadamente 28 vezes maior em tamanho. Ao mesmo tempo, o Qwen3.8-27B fica em 23º de 135 em tokens de saída por tarefa, com 160 milhões de tokens ponderados contra uma mediana de 43 milhões - inteligência e verbosidade se movem de forma independente.
Experimento prático
Tunguz comparou três modelos em 25 tarefas de venture capital (pesquisa de startups, resumo de artigos, transcrição de podcasts), avaliados por um modelo juiz (deepseek-v4-pro) de forma cega, em três critérios: completude, precisão e concisão. Os resultados:
- DeepSeek V4 Flash (nuvem): qualidade 8,0/9, 137,3 tokens/s, média de 159 tokens por resposta, latência de 1,1 segundo.
- Qwen3.8-27B (local, denso): qualidade 8,0/9, 51,9 tokens/s, média de 369 tokens, latência de 7,2 segundos.
- Qwen3.6-35B-A3B (local, mixture-of-experts com 3 bilhões de parâmetros ativos): qualidade 7,9/9, 113,4 tokens/s, média de 1.143 tokens, latência de 10,0 segundos.
Os três modelos produzem respostas de qualidade equivalente, mas o modelo local mais rápido em tokens por segundo é o mais lento em tempo total porque raciocina 7,2 vezes mais tokens que o modelo de nuvem.
Mecanismo explicado
Modelos maiores armazenam mais conhecimento e podem pular direto para a resposta, como um especialista em múltiplas áreas. Modelos menores têm menos conhecimento memorizado e precisam raciocinar quase desde os primeiros princípios para compensar. O Qwen3.6-35B-A3B usa arquitetura mixture-of-experts com 256 especialistas totais, dos quais 8 são roteados e 1 compartilhado por token. Em um exemplo extremo, esse modelo gastou 993 tokens de raciocínio para produzir uma resposta de seis palavras.
Ressalvas
O autor observa que modelos menores produzem cadeia de raciocínio fluente, mas com maior probabilidade de deriva logicamente inconsistente, porque dispõem de um mapa mais esparso de exemplos corretos próximos. A comparação foi feita com os modelos locais servidos via Ollama no mesmo runtime MLX, eliminando variáveis de infraestrutura. O piso de ruído do modelo juiz, medido pela reavaliação de saídas idênticas, foi de 0,16 em média absoluta.