
Decoding paralelo destila múltiplos passos em vídeo
O problema
A geração de vídeo com modelos de difusão ou flow matching é computacionalmente cara porque o processo de amostragem exige centenas de avaliações de rede (NFE). Os métodos atuais de aceleração, baseados em distilação variacional de score (VSD) e perdas adversariais, conseguem reduzir o número de passos, mas sofrem com otimização instável e colapso de modos - resultando em vídeos com pouca diversidade e movimento limitado.
A proposta: Parallel Decoding Distillation (PDD)
Pesquisadores da NVIDIA e do Weizmann Institute of Science propõem o PDD, um método de destilação baseado em trajetória que acelera a inferência ao prever múltiplos passos de denoising em uma única avaliação de rede. Em vez de fundir vários passos do professor em um único passo grande (como fazem métodos tradicionais), o PDD prevê vários passos do professor em paralelo dentro de uma única passagem forward.
O tempo é discretizado em N intervalos, agrupados em blocos de tamanho L. O modelo estudante aprende a prever o passo do solver ODE do professor para todos os intervalos dentro de um bloco usando uma única avaliação. Na geração, cada avaliação do estudante avança L intervalos.
Arquitetura
A arquitetura do estudante parte do modelo professor e simplesmente replica a última camada linear N vezes - uma para cada intervalo da discretização. Isso permite amostragem com NFE variável em tempo de inferência, ajustando o tamanho do bloco. Como uma soma ponderada de transformações lineares é ela mesma uma transformação linear, as camadas podem ser fundidas na geração, exigindo apenas uma camada linear fundida por bloco. Os pesos do estudante são inicializados diretamente a partir dos pesos do professor.
Treinamento
O treinamento usa um algoritmo on-policy: a partir de um estado ruidoso, o estudante faz um rollout sobre o próximo bloco de intervalos; depois, amostra-se um estado da trajetória do estudante e alinha-se a saída correspondente com o passo do solver ODE do professor naquele estado.
Resultados
O PDD atinge desempenho state-of-the-art com 4 a 8 NFE em três modelos: LTX-2.3 (texto-para-vídeo/áudio), Wan2.1 14B (texto-para-vídeo) e Qwen-Image (texto-para-imagem). O método mostra melhoria significativa na diversidade dos vídeos gerados em comparação com abordagens como DMD2 e AnyFlow, mantendo qualidade visual competitiva com o professor (que usa 50+ NFE com classifier-free guidance).