
Qwen 3.8 27B é elogiado, mas peca por overthinking
Um modelo capaz, com um padrão inconveniente
Lançado em 16 de agosto de 2026, o Qwen 3.8 27B é um modelo de linguagem com visão, 27 bilhões de parâmetros e licença Apache 2, desenvolvido pelo laboratório de pesquisa Qwen, da Alibaba. Seu tamanho o torna adequado para execução em máquinas pessoais relativamente potentes: a versão quantizada Q4_K_M testada ocupa 17 GB. Benchmarks divulgados pela própria Qwen indicam ganhos sobre o Qwen 3.6 27B e sobre o Qwen 3.7-Plus, embora ainda faltassem avaliações independentes.
O principal problema observado está na configuração padrão de raciocínio. O modelo usa xhigh, nível destinado a tarefas complexas, que pode ser reduzido para medium, low ou desativado. Em testes locais, essa configuração fez o Qwen consumir o limite padrão de 8.192 tokens do LM Studio mesmo em solicitações simples. Ao gerar um SVG de um pelicano andando de bicicleta, gastou 22.276 tokens de raciocínio para produzir 3.223 tokens de saída e levou 21 minutos. O resultado foi considerado o melhor já obtido pelo autor em um modelo local, mas o tempo não compensou: com o raciocínio desligado, a mesma tarefa levou 137 segundos.
O comportamento também apareceu em um pedido para desenhar apenas um círculo. Em vez de entregar uma forma simples, o modelo criou uma animação elaborada, com anéis concêntricos, gradientes e movimento. O excesso de elaboração não é apenas um defeito: em uma ferramenta para desenhar caixas delimitadoras sobre imagens, o raciocínio ajudou a produzir uma interface funcional em uma única tentativa. Sem raciocínio, a versão quase funcionou, mas posicionou as caixas incorretamente. A ferramenta gerada, porém, também incluiu recursos não solicitados, como uma cena de demonstração com pelicanos.
Visão, código e ferramentas
Nos testes com uma fotografia de pelicanos, o modelo retornou caixas delimitadoras em escala de 0 a 1.000 que corresponderam muito bem aos animais. Ele também conseguiu operar em um fluxo de agente de programação usando Pi, LM Studio e um NVIDIA DGX Spark. Ao investigar como a autenticação funcionava em um projeto, acessou vários arquivos e produziu uma resposta considerada sólida. Depois, escreveu e testou um programa em Python para converter o registro JSONL da sessão em Markdown.
O limite é a velocidade
A execução no LM Studio ficou entre 15 e 30 tokens por segundo, considerada lenta diante de modelos hospedados, cujas velocidades citadas chegavam a 74 e 184 tokens por segundo. Uma otimização baseada em Multi-Token Prediction, testada com llama.cpp, elevou o desempenho em cerca de 72% em comparação com a versão padrão do LM Studio no Spark. Ainda assim, outras melhorias de execução poderiam surgir nas semanas seguintes.
A avaliação final é que o Qwen 3.8 27B demonstra o avanço dos modelos locais: um arquivo de 17 GB reúne contexto de até 262.144 tokens, uso eficaz de ferramentas, visão e geração de código competente. O desempenho, contudo, continua sendo o obstáculo para o uso diário, especialmente porque modelos densos exigem muita largura de banda de memória. O modelo mostra que já é possível executar uma opção geral de pesos abertos em um laptop capaz, sem hardware de datacenter, mas não elimina a vantagem de velocidade das APIs hospedadas.