stamatios
← Voltar ao feed
Caixa de ferramentas aberta com engrenagens e circuitos brilhantes, representando o modelo aberto Qwen3.8
IA & Modelos · Open Source

Qwen3.8-2.4T-A95B chega com foco em código e tarefas de longa duração

resumo de ~3 min

Lançamento do Qwen3.8-2.4T-A95B

A equipe Qwen publicou no Hugging Face o modelo aberto Qwen3.8-2.4T-A95B, apresentado como o primeiro modelo de nível "Qwen-Max" liberado em formato aberto. Trata-se de um modelo de linguagem causal com 2,4 trilhões de parâmetros totais e 95 bilhões ativados, em arquitetura Mixture of Experts, com 512 especialistas, sendo 10 roteados mais 1 compartilhado por token.

Segundo o anúncio, a série Qwen3.8 traz ganhos em código, trabalho profissional, pesquisa e tarefas agentíticas de longa duração. O foco não é apenas responder perguntas mais difíceis, mas conduzir tarefas complexas e multi-etapas até a conclusão com maior confiabilidade.

Arquitetura e contexto

O modelo possui dimensão oculta de 8.192, 92 camadas, vocabulário de 248.320 tokens e saída com previsão de múltiplos tokens (Multi-Token Prediction). A estrutura combina blocos de Gated DeltaNet com atenção linear e blocos de Gated Attention com atenção tradicional, ambos seguidos por camadas MoE.

O contexto nativo é de 262.144 tokens, com possibilidade de extensão até cerca de 1.010.000 tokens. O repositório contém pesos e configurações em formato Transformers, compatíveis com frameworks como vLLM, SGLang e TokenSpeed.

Benchmarks

O modelo é comparado com nomes como Claude Opus 4.8, Fable 5, GPT 5.6 Sol e Qwen3.7-Max em diversas avaliações de agentes e programação.

Entre os resultados destacados:

Benchmark Qwen3.8-Max
Terminal Bench 2.1 86,6
SWE-bench Pro 67,7
DeepSWE 1.1 56,6
FrontierSWE 73,5
PaperBench 93,0
AndroidBench 75,1
GPQA Diamond 92,6
HealthBench 60,2
PLawBench 73,2
MRCR v2 256K 92,9

No PaperBench, o Qwen3.8-Max aparece com 93,0, acima de Opus 4.8 (80,3), Fable 5 (88,8) e GPT 5.6 Sol (90,5). Em SWE-bench Pro, fica atrás de Fable 5 (80,0), mas supera GPT 5.6 Sol (64,6) e Qwen3.7-Max (60,6).

Relação com o Qwen3.8-Max

O Qwen3.8-2.4T-A95B é a base aberta do serviço Qwen3.8-Max, oferecido via API na Qwen Cloud. A versão Max adiciona recursos como entrada de visão, suporte a não-pensamento, contexto de 1 milhão de tokens por padrão e ferramentas nativas. Já o modelo aberto é somente texto e opera com modo de raciocínio obrigatório.

Uso recomendado

A recomendação oficial é usar APIs para integração mais simples ou motores dedicados como SGLang, vLLM e TokenSpeed para produção e alto throughput.

Parâmetros sugeridos de amostragem:

  • temperature=1.0
  • top_p=0.95
  • top_k=20
  • min_p=0.0
  • presence_penalty=0.0
  • repetition_penalty=1.0

O modelo suporta controle de profundidade de raciocínio com reasoning_effort, nos níveis:

  • xhigh (padrão): análise profunda para tarefas complexas;
  • medium: equilíbrio entre precisão e velocidade;
  • low: foco em velocidade e custo.

Também há preserve_thinking ativado por padrão, mantendo contexto de raciocínio de mensagens anteriores.

Para tarefas agentíticas, o texto recomenda reservar bastante espaço de saída: até 262.144 tokens para raciocínio interno e 131.072 tokens para resposta final, dentro do contexto de 1 milhão de tokens.