
Qwen3.8-2.4T-A95B chega com foco em código e tarefas de longa duração
Lançamento do Qwen3.8-2.4T-A95B
A equipe Qwen publicou no Hugging Face o modelo aberto Qwen3.8-2.4T-A95B, apresentado como o primeiro modelo de nível "Qwen-Max" liberado em formato aberto. Trata-se de um modelo de linguagem causal com 2,4 trilhões de parâmetros totais e 95 bilhões ativados, em arquitetura Mixture of Experts, com 512 especialistas, sendo 10 roteados mais 1 compartilhado por token.
Segundo o anúncio, a série Qwen3.8 traz ganhos em código, trabalho profissional, pesquisa e tarefas agentíticas de longa duração. O foco não é apenas responder perguntas mais difíceis, mas conduzir tarefas complexas e multi-etapas até a conclusão com maior confiabilidade.
Arquitetura e contexto
O modelo possui dimensão oculta de 8.192, 92 camadas, vocabulário de 248.320 tokens e saída com previsão de múltiplos tokens (Multi-Token Prediction). A estrutura combina blocos de Gated DeltaNet com atenção linear e blocos de Gated Attention com atenção tradicional, ambos seguidos por camadas MoE.
O contexto nativo é de 262.144 tokens, com possibilidade de extensão até cerca de 1.010.000 tokens. O repositório contém pesos e configurações em formato Transformers, compatíveis com frameworks como vLLM, SGLang e TokenSpeed.
Benchmarks
O modelo é comparado com nomes como Claude Opus 4.8, Fable 5, GPT 5.6 Sol e Qwen3.7-Max em diversas avaliações de agentes e programação.
Entre os resultados destacados:
| Benchmark | Qwen3.8-Max |
|---|---|
| Terminal Bench 2.1 | 86,6 |
| SWE-bench Pro | 67,7 |
| DeepSWE 1.1 | 56,6 |
| FrontierSWE | 73,5 |
| PaperBench | 93,0 |
| AndroidBench | 75,1 |
| GPQA Diamond | 92,6 |
| HealthBench | 60,2 |
| PLawBench | 73,2 |
| MRCR v2 256K | 92,9 |
No PaperBench, o Qwen3.8-Max aparece com 93,0, acima de Opus 4.8 (80,3), Fable 5 (88,8) e GPT 5.6 Sol (90,5). Em SWE-bench Pro, fica atrás de Fable 5 (80,0), mas supera GPT 5.6 Sol (64,6) e Qwen3.7-Max (60,6).
Relação com o Qwen3.8-Max
O Qwen3.8-2.4T-A95B é a base aberta do serviço Qwen3.8-Max, oferecido via API na Qwen Cloud. A versão Max adiciona recursos como entrada de visão, suporte a não-pensamento, contexto de 1 milhão de tokens por padrão e ferramentas nativas. Já o modelo aberto é somente texto e opera com modo de raciocínio obrigatório.
Uso recomendado
A recomendação oficial é usar APIs para integração mais simples ou motores dedicados como SGLang, vLLM e TokenSpeed para produção e alto throughput.
Parâmetros sugeridos de amostragem:
temperature=1.0top_p=0.95top_k=20min_p=0.0presence_penalty=0.0repetition_penalty=1.0
O modelo suporta controle de profundidade de raciocínio com reasoning_effort, nos níveis:
xhigh(padrão): análise profunda para tarefas complexas;medium: equilíbrio entre precisão e velocidade;low: foco em velocidade e custo.
Também há preserve_thinking ativado por padrão, mantendo contexto de raciocínio de mensagens anteriores.
Para tarefas agentíticas, o texto recomenda reservar bastante espaço de saída: até 262.144 tokens para raciocínio interno e 131.072 tokens para resposta final, dentro do contexto de 1 milhão de tokens.