stamatios
← Voltar ao feed
Qwen 3.8-Max estabelece novo padrão em código e trabalho
IA & Modelos

Qwen 3.8-Max estabelece novo padrão em código e trabalho

resumo de ~3 min

O Qwen Studio anunciou o lançamento do Qwen 3.8-Max, o modelo mais avançado da família até agora, com 2,4 trilhões de parâmetros totais e 95 bilhões ativos, disponível via QwenCloud. É a primeira vez que os pesos de um modelo da classe Qwen-Max serão abertos - a liberação está prevista para a próxima semana.

Coding autônomo

O modelo foi testado em três desafios de longo prazo sem intervenção humana:

  1. Harness auto-evolutivo - Em ~16 dias de operação autônoma, o Qwen 3.8-Max construiu do zero o projeto oh-my-cli, acumulando 265 commits, 127 PRs e 151 issues. O sistema coleta requisitos, executa agentes, roda testes e itera continuamente.

  2. Reprodução e melhoria de paper - Recebeu apenas o PDF do artigo "Unified Data Selection for LLM Reasoning" e, em ~5 dias (~125 horas), escreveu ~7.600 linhas de código, executou 33 rodadas de treinamento em GPU, reproduziu os seis resultados principais do paper e, depois, rodou um loop de autoaperfeiçoamento com 18 hipóteses em 4 rodadas, superando o método original em +2,7 pontos no AIME24.

  3. Competição real - Inscrito na WWW2025 Multimodal Dialogue Intent Recognition Challenge (526 equipes humanas, prazo de 24h), o modelo construiu sozinho uma solução de ensemble multimodal e, ao longo de 45 submissões iterativas, subiu de 0,60 para 0,853 de acurácia, superando 458 das 526 equipes (87%).

Trabalho real

O modelo foi testado em centenas de profissões de alto valor econômico:

  • Advogado de compliance: analisou 1.284 cláusulas em centenas de documentos em menos de uma hora (trabalho que levaria ~1 semana para uma equipe de paralegais).
  • Designer UI/UX: gerou protótipo de 8 telas com design system consistente em uma única tentativa, sem revisões humanas.
  • Engenheiro estrutural: reconstruiu modelo sísmico de torre de 30 andares no navegador, com inspeção em tempo real de período natural, cortante de base e drift entre pavimentos.
  • Analista de dados esportivos: processou ~8.400 posses ofensivas/defensivas por jogador e gerou perfil tático completo em dezenas de minutos.

Também construiu uma estratégia quant de rotação de ETFs end-to-end em uma única sessão, orquestrando ~330 sub-agentes e ~6.000 backtests, com Sharpe excedente de 0,64–1,48.

Tarefas de longo prazo

  • Design de chip autônomo: otimizou um acelerador criptográfico GCD/RSA de 8.298 para 678 gates em ~500 turnos, com redução de 81% na área física do die e timing closure em 500 MHz.
  • Simulação de e-commerce (365 dias): com ¥100.000 de capital inicial, gerenciou 12 tipos de lojas, negociou com ~600 fornecedores (incluindo 152 fraudulentos ocultos), e terminou com ¥416.252 (retorno de 4,16x), superando o segundo colocado em 38%.

Agentes multimodais

O modelo processa documentos de 200+ páginas, vídeos de 100+ horas e transforma entradas visuais em estruturas interativas (3D, animações, jogos). Introduz o conceito de "Hybrid Agent" - combinação de código e operação de GUI - e o RecreationBench, benchmark de recriação de aplicações em 5 plataformas. Também lançou o Qwen-MM-Plugins, biblioteca de extensão para agentes multimodais.

Benchmarks

Nos benchmarks de coding agent, o Qwen 3.8-Max atinge 86,6 no Terminal Bench 2.1, 93,0 no PaperBench e 73,5 no FrontierSWE. Em tarefas gerais de agente, lidera em CoWorkBench (74,8), JobBench (53,4) e Automation-Bench (27,3). Em multimodal, destaca-se em OSWorld-Verified (86,1), BabyVision (82,0/91,3) e MLVU (90,8).