stamatios
← Voltar ao feed
Cubo denso de modelo de linguagem sendo fatiado em camadas quantizadas finas cabendo dentro de dispositivo em forma de maçã, ilustrando o Qwen3.8-27B-Uncensored-MLX
Open Source · Hardware & Chips

Qwen3.8-27B-Uncensored-MLX: modelo quantizado para Apple Silicon

resumo de ~3 min

O que foi lançado

O repositório apresenta o Qwen3.8-27B-Uncensored-MLX, uma adaptação do Qwen3.8-27B para o formato MLX e voltada principalmente a computadores com Apple Silicon. O modelo tem 27 bilhões de parâmetros, arquitetura híbrida com Gated DeltaNet e atenção completa, capacidade nativa de visão, controle de raciocínio, chamada de ferramentas e contexto de 262.144 tokens. A adaptação removeu substancialmente o alinhamento de segurança por meio de “abliteration”, que elimina a direção associada às recusas no fluxo residual, e depois aplicou quantização aos pesos lineares do modelo de linguagem.

São oferecidas quatro versões, com 2, 4, 6 e 8 bits por peso. A de 8 bits ocupa cerca de 27,5 GB e é descrita como quase sem perda; a de 6 bits ocupa aproximadamente 22 GB; a de 4 bits, cerca de 15 GB; e a de 2 bits, aproximadamente 8,7 GB. A torre de visão, as normalizações e as camadas convolucionais permanecem em BF16, enquanto os pesos lineares, incluindo embed_tokens e lm_head, são quantizados. O modelo pode ser usado localmente com mlx-vlm, inclusive para entradas de texto e imagem, ou disponibilizado por um servidor compatível com a API da OpenAI.

Verificações e limitações da quantização

Segundo o model card, todas as versões foram derivadas da mesma fonte BF16 e verificadas por comparação numérica dos pesos desquantizados, além de testes de geração em GPU. As versões de 8, 6 e 4 bits alcançaram similaridade cosseno de 0,9997, 0,9996 e 0,996, respectivamente, e foram aprovadas nos testes de texto, chinês, código e visão. A versão de 2 bits atingiu 0,92, apresentou degradação acentuada e pode produzir repetições, texto corrompido ou sem sentido; por isso, é indicada apenas como arquivo de compressão extrema, não para uso real.

Nos testes descritos, as versões de 4, 6 e 8 bits mantiveram a capacidade multimodal e responderam a sondagens de red team com conteúdo substantivo e zero recusas. A velocidade registrada foi de aproximadamente 32 a 37 tokens por segundo em uma H200 usando o backend CUDA do MLX; o alvo nativo do formato continua sendo o Metal em Apple Silicon. O documento também registra um problema de desempacotamento na função offline mx.dequantize para a versão de 6 bits, mas afirma que a inferência não é afetada e que a correção foi verificada por geração limpa.

Uso previsto e riscos

O modelo é apresentado estritamente para pesquisa em segurança e interpretabilidade, estudo de mecanismos de recusa, red teaming, avaliação de robustez e experimentos controlados. Como as salvaguardas foram removidas, ele pode atender a pedidos nocivos, ilegais ou ofensivos, inclusive relacionados a malware, exploração, armas e fraude. Também pode produzir falsidades, conteúdo tendencioso ou ofensivo com tom de autoridade. A combinação de visão, chamada de ferramentas e contexto extenso amplia esses riscos para usos multimodais e agentes autônomos.

O documento desaconselha qualquer implantação para usuários finais, menores ou ambientes de produção sem camadas próprias de moderação, segurança e prevenção de abuso. O uso deve respeitar a licença Apache 2.0 herdada do modelo-base e as leis aplicáveis; os responsáveis pelo repositório não assumem responsabilidade por danos ou uso indevido.