stamatios
← Voltar ao feed
DiffusionGemma adapta Gemma 4 para difusão discreta rápida
IA & Modelos

DiffusionGemma adapta Gemma 4 para difusão discreta rápida

resumo de ~3 min

O que é DiffusionGemma

DiffusionGemma é um modelo de linguagem experimental de pesos abertos que usa difusão discreta para gerar texto em velocidade muito superior à dos modelos autoregressivos (AR) convencionais. Em vez de decodificar um token por vez, o modelo refina iterativamente blocos de 256 tokens em paralelo, eliminando o gargalo sequencial típico de LLMs AR.

Base e arquitetura

O modelo não foi treinado do zero: ele parte do Gemma 4, um modelo mixture-of-experts com 3,8 bilhões de parâmetros ativados e 25,2 bilhões no total, e o adapta via fine-tuning. O pipeline de treinamento em duas etapas consome menos de 10% do orçamento total de tokens usado no modelo AR original.

Pipeline de treinamento

  1. Estágio 1 – Supervised fine-tuning: ensina o modelo a fazer denoising bidirecional, ou seja, a reconstruir blocos de tokens a partir de versões corrompidas.
  2. Estágio 2 – RL + destilação de sampler: combina reinforcement learning com destilação de sampler para melhorar simultaneamente a qualidade da geração e a eficiência de inferência.

Resultados

  • Gera em média ~20 tokens por forward pass.
  • Alcança cerca de 1.500 tokens de saída por segundo em uma única GPU NVIDIA H100.
  • Supera modelos AR mesmo com speculative decoding de ponta.
  • Estabelece uma nova fronteira de Pareto no trade-off entre velocidade de geração e capacidade do modelo.

Capacidades mantidas

Apesar da adaptação para difusão, o modelo retém suporte a modo de raciocínio (thinking mode), entradas multimodais e contextos longos. Ele também continua capaz de geração autoregressiva com apenas degradação leve de desempenho, o que sugere um caminho para decodificação híbrida difusão-AR.