
LLaDA2.X: modelos de linguagem por difusão para texto e agentes
resumo de ~3 min
LLaDA2.X: modelos de linguagem por difusão escalados a 100B parâmetros
A equipe InclusionAI, do Ant Group, lançou a série LLaDA2.X de modelos de linguagem baseados em difusão discreta (dLLMs) - uma abordagem alternativa aos modelos autoregressivos (AR) tradicionais. A família inclui três gerações principais:
- LLaDA2.0 (nov/2025): primeira vez que um modelo de difusão foi escalado a 100 bilhões de parâmetros, com arquitetura Mixture-of-Experts (MoE). Duas variantes: LLaDA2.0-mini (16B) e LLaDA2.0-flash (100B).
- LLaDA2.1 (fev/2026): aceleração da difusão de texto via token editing.
- LLaDA2.2 (jul/2026): habilita capacidades agênticas por meio de edição baseada em distância de Levenshtein.
Destaques técnicos
- Aceleração de inferência de 2,1x: usando um mecanismo de decodificação paralela chamado Confidence-Aware Parallel (CAP), o LLaDA2.0-flash-CAP atinge até 535 tokens/s, superando modelos AR comparáveis.
- Código aberto: pesos dos modelos (16B e 100B) e código de treinamento disponíveis no Hugging Face sob licença Apache 2.0.
- Engine de inferência customizada: construída sobre dInfer e SGLang, com suporte a reuso de KV-Cache e decodificação paralela em nível de bloco, visando deploy em produção.
Variantes disponíveis
O repositório oferece modelos instruction-tuned prontos para uso downstream (LLaDA2.0-mini, LLaDA2.0-flash, LLaDA2.1-mini, LLaDA2.1-flash, LLaDA2.2-flash), além de versões com CAP para inferência eficiente.
O projeto posiciona a difusão discreta como uma alternativa viável aos transformers autoregressivos, especialmente em geração de código e tarefas complexas de seguimento de instruções.