
Escha-W2: build quantizado de 2 bits do Qwen3.6 roda em GPU de 16GB
Escha-W2: Qwen3.6-35B-A3B quantizado em 2 bits
A Escha Labs publicou uma build quantizada em 2 bits do Qwen3.6-35B-A3B, um modelo Mixture-of-Experts com 256 experts. O resultado ocupa 12,3 GB em disco e roda em uma única GPU de 24 GB - ou em placas de 16 GB (como a RTX 5060 Ti), onde o usuário escolhe entre menos concorrência ou menos contexto.
Qualidade vs. FP8
A comparação com a baseline FP8 (que exige ~35 GB) mostra retenção média de 100,2% em seis eixos. Os destaques:
- MMLU-Pro: 80,9 vs 82,3 (−1,4 pp, retenção de 98,3%)
- MATH-500: 93,8 vs 91,2 (+2,6 pp)
- GPQA-Diamond: 77,8 vs 74,7 (+3,1 pp, mas dentro da variância de ±5 pp)
- LiveCodeBench v6: 62,6 vs 67,0 (−4,4 pp, retenção de 93,4%) - o único gap claro, em geração de código de longo horizonte
- BFCL-AST (tool use): 88,9 vs 88,2 (empate)
- RULER (contexto longo): 89,9 vs 89,4 (empate)
Performance de serving
Medido com o engine SGLang em cinco GPUs:
| GPU | Decode single-user | Throughput de pico |
|---|---|---|
| RTX 5090 (32 GB) | 283 tok/s | ~2.670 tok/s @ bs32 |
| RTX 4090 (24 GB) | 225 tok/s | 1.321 tok/s @ bs32 |
| RTX 5080 (16 GB) | 212 tok/s | 914 tok/s @ bs16 |
| RTX 3090 (24 GB) | 154 tok/s | 390 tok/s @ bs16 |
| RTX 5060 Ti (16 GB) | 128 tok/s | 387 tok/s @ bs16 |
O decode single-stream é limitado por bandwidth e praticamente não varia com o tamanho do prompt. A 4090 mantém 90% da taxa mesmo com prompts de 20k tokens.
Latência SLA (RTX 4090, chegadas Poisson)
Com 1.000 tokens de input e 400 de output, a saturação ocorre em ~1,9 req/s. Abaixo disso, TTFT p99 fica em 433 ms e TPOT p99 em 16,3 ms - dentro dos thresholds "Interactive" do MLPerf. O gargalo é sempre prefill/TTFT, nunca decode.
Engines disponíveis
- SGLang (recomendado): suporta concorrência, tool calling, structured output e reasoning parser.
- ZML: binário único, sem Python, com decode single-user 15–26% mais rápido em respostas longas (RTX 5090/3090), mas perde em respostas curtas e não suporta concorrência. Só funciona com temperature=0 para atingir os números divulgados.
Configurações críticas
Três ajustes que mais impactam: CUDA graphs (obrigatório, 4,4× mais rápido que eager), RADIX=0 (ganho de ~20% em single-stream, mas desabilita prefix caching) e MEM=0.92 em placas de 16 GB (acima disso, risco de OOM que derruba o servidor inteiro).