
DiffusionGemma adapta Gemma 4 para difusão discreta rápida
O que é DiffusionGemma
DiffusionGemma é um modelo de linguagem experimental de pesos abertos que usa difusão discreta para gerar texto em velocidade muito superior à dos modelos autoregressivos (AR) convencionais. Em vez de decodificar um token por vez, o modelo refina iterativamente blocos de 256 tokens em paralelo, eliminando o gargalo sequencial típico de LLMs AR.
Base e arquitetura
O modelo não foi treinado do zero: ele parte do Gemma 4, um modelo mixture-of-experts com 3,8 bilhões de parâmetros ativados e 25,2 bilhões no total, e o adapta via fine-tuning. O pipeline de treinamento em duas etapas consome menos de 10% do orçamento total de tokens usado no modelo AR original.
Pipeline de treinamento
- Estágio 1 – Supervised fine-tuning: ensina o modelo a fazer denoising bidirecional, ou seja, a reconstruir blocos de tokens a partir de versões corrompidas.
- Estágio 2 – RL + destilação de sampler: combina reinforcement learning com destilação de sampler para melhorar simultaneamente a qualidade da geração e a eficiência de inferência.
Resultados
- Gera em média ~20 tokens por forward pass.
- Alcança cerca de 1.500 tokens de saída por segundo em uma única GPU NVIDIA H100.
- Supera modelos AR mesmo com speculative decoding de ponta.
- Estabelece uma nova fronteira de Pareto no trade-off entre velocidade de geração e capacidade do modelo.
Capacidades mantidas
Apesar da adaptação para difusão, o modelo retém suporte a modo de raciocínio (thinking mode), entradas multimodais e contextos longos. Ele também continua capaz de geração autoregressiva com apenas degradação leve de desempenho, o que sugere um caminho para decodificação híbrida difusão-AR.