
Estado dos modelos abertos: Qwen lidera comunidade e agentes dominam tráfego
Fronteira chinesa e estratégia de portfólio
O relatório da Hugging Face sobre modelos abertos entre janeiro e agosto de 2026 observa que o hub passou de 2,43 milhões para 2,96 milhões de repositórios de modelos, datasets de 711 mil para 1 milhão e Spaces de 1,00 para 1,44 milhão. A concentração segue extrema: cerca de 85,6% dos modelos têm menos de 200 downloads acumulados e 1,5% dos repositórios concentram 99,2% dos downloads. Nesse período, laboratórios chineses lançaram quase sempre os maiores modelos abertos do mês, com teto entre 754 bilhões e 2,78 trilhões de parâmetros, enquanto modelos americanos ficaram abaixo de 130 bilhões em cinco de sete meses. As exceções citadas foram o Nemotron 3 Ultra, da NVIDIA, com 561 bilhões, e o Inkling, da Thinking Machines Lab. Moonshot, MiniMax, Xiaomi e Z.ai publicam quase nada abaixo de 70 bilhões, enquanto Tencent e Alibaba Qwen cobrem toda a faixa, de menos de 1 bilhão para cima. O texto afirma que construir modelos grandes deixou de ser diferencial e que a camada de quantização da comunidade pode tornar modelos grandes executáveis em dias. AMD e NVIDIA foram as organizações que mais publicaram novos modelos abertos no período, cada uma com mais de 200 repositórios, à frente da LiquidAI, com cerca de 100.
Atenção diferente de adoção
Comparando os 25 repositórios com mais downloads no ano e os 25 com mais curtidas, apenas um aparece nas duas listas. Nenhum modelo publicado em 2026 entra no top 25 de downloads, enquanto 13 dos 25 vêm de 2022. O all-MiniLM-L6-v2 teve 1,55 bilhão de downloads em sete meses contra 5.156 curtidas. Para os autores, curtidas medem empolgação com lançamentos de fronteira, enquanto downloads medem dependência de modelos pequenos e estáveis integrados a pipelines. Laboratórios chineses de fronteira concentram downloads em modelos acima de 70 bilhões: quase todos os da MiniMax, 88% dos da Moonshot, 55% dos da DeepSeek e 39% dos da Z.ai. Google, Microsoft e IBM Granite praticamente não têm downloads acima desse porte; NVIDIA e Meta têm 14% e 9%. A Moonshot registrou 37 milhões de downloads no ano, enquanto a Qwen alcançou cerca de 2,045 bilhões, aproximadamente 55 vezes mais.
Licenças e valor
Entre 178 lançamentos chineses acima de 20 bilhões de parâmetros no ano, 59% usam Apache 2.0 e 22% MIT, quase sem restrições não comerciais, embora Kimi K3 e Qwen 3.8 2.4T tenham começado a incluir restrições não comerciais e exigências de participação de receita. Na mesma faixa de tamanho nos EUA, 29% usam Apache ou MIT, 41% termos personalizados e 30% não declaram licença. O relatório avalia que o retorno não vem de licenciamento, mas possivelmente de API, nuvem, hardware, posicionamento de plataforma ou ecossistema.
Qwen como base da comunidade
Qwen soma 151.448 modelos derivados no hub, 2,6 vezes o total da Meta e 4,7 vezes os repositórios Llama. Google tem 82.506 derivados; o terceiro lugar é a conta comunitária Unsloth. Foram criados entre 180 e 210 novos derivados de Qwen por dia nos primeiros sete meses de 2026. Dos 28.531 conversões GGUF de modelos Qwen, apenas 54 foram publicadas pela própria Qwen. Os fatores apontados são cadência regular, cobertura de tamanhos e licença Apache 2.0.
Modelos pequenos e inferência local
Modelos com menos de 1 bilhão de parâmetros concentram 83% dos downloads históricos; acima de 100 bilhões, 1%. Em 2026, só 3% do volume foi para modelos acima de 70 bilhões. O projeto llama.cpp, cuja equipe ggml entrou para a Hugging Face em fevereiro, permitiu GGUF do DeepSeek-V4-Flash com cerca de 284 bilhões e do Kimi-K3 com cerca de 2,8 trilhões. Qwen tem 39,6 milhões de downloads mensais de GGUF, quase o dobro dos 20,8 milhões do Gemma e mais de cinco vezes os 7,5 milhões do Llama.
Agentes como novo usuário
O dataset agent-usage, publicado em julho, registra tráfego de agentes de codificação no hub. Claude Code liderou julho com 44,4%, mas tinha 67,8% em abril e 64% em maio; Codex subiu de 10,4% para 20,8%. Quase um quarto do tráfego de agentes em julho veio de clientes ainda não nomeados; em maio eram 59,8%. O relatório também cita o primeiro caso documentado de um agente autônomo conduzindo intrusão sustentada por iniciativa própria contra a Hugging Face; a análise foi feita com um modelo aberto quantizado GLM-5.2 após modelos fechados recusarem a tarefa por guardrails.