stamatios
← Voltar ao feed
Escha-W2: build quantizado de 2 bits do Qwen3.6 roda em GPU de 16GB
Open Source · IA & Modelos

Escha-W2: build quantizado de 2 bits do Qwen3.6 roda em GPU de 16GB

resumo de ~3 min

Escha-W2: Qwen3.6-35B-A3B quantizado em 2 bits

A Escha Labs publicou uma build quantizada em 2 bits do Qwen3.6-35B-A3B, um modelo Mixture-of-Experts com 256 experts. O resultado ocupa 12,3 GB em disco e roda em uma única GPU de 24 GB - ou em placas de 16 GB (como a RTX 5060 Ti), onde o usuário escolhe entre menos concorrência ou menos contexto.

Qualidade vs. FP8

A comparação com a baseline FP8 (que exige ~35 GB) mostra retenção média de 100,2% em seis eixos. Os destaques:

  • MMLU-Pro: 80,9 vs 82,3 (−1,4 pp, retenção de 98,3%)
  • MATH-500: 93,8 vs 91,2 (+2,6 pp)
  • GPQA-Diamond: 77,8 vs 74,7 (+3,1 pp, mas dentro da variância de ±5 pp)
  • LiveCodeBench v6: 62,6 vs 67,0 (−4,4 pp, retenção de 93,4%) - o único gap claro, em geração de código de longo horizonte
  • BFCL-AST (tool use): 88,9 vs 88,2 (empate)
  • RULER (contexto longo): 89,9 vs 89,4 (empate)

Performance de serving

Medido com o engine SGLang em cinco GPUs:

GPU Decode single-user Throughput de pico
RTX 5090 (32 GB) 283 tok/s ~2.670 tok/s @ bs32
RTX 4090 (24 GB) 225 tok/s 1.321 tok/s @ bs32
RTX 5080 (16 GB) 212 tok/s 914 tok/s @ bs16
RTX 3090 (24 GB) 154 tok/s 390 tok/s @ bs16
RTX 5060 Ti (16 GB) 128 tok/s 387 tok/s @ bs16

O decode single-stream é limitado por bandwidth e praticamente não varia com o tamanho do prompt. A 4090 mantém 90% da taxa mesmo com prompts de 20k tokens.

Latência SLA (RTX 4090, chegadas Poisson)

Com 1.000 tokens de input e 400 de output, a saturação ocorre em ~1,9 req/s. Abaixo disso, TTFT p99 fica em 433 ms e TPOT p99 em 16,3 ms - dentro dos thresholds "Interactive" do MLPerf. O gargalo é sempre prefill/TTFT, nunca decode.

Engines disponíveis

  • SGLang (recomendado): suporta concorrência, tool calling, structured output e reasoning parser.
  • ZML: binário único, sem Python, com decode single-user 15–26% mais rápido em respostas longas (RTX 5090/3090), mas perde em respostas curtas e não suporta concorrência. Só funciona com temperature=0 para atingir os números divulgados.

Configurações críticas

Três ajustes que mais impactam: CUDA graphs (obrigatório, 4,4× mais rápido que eager), RADIX=0 (ganho de ~20% em single-stream, mas desabilita prefix caching) e MEM=0.92 em placas de 16 GB (acima disso, risco de OOM que derruba o servidor inteiro).