
SANA-Video 2.0 da Nvidia gera vídeos longos em GPU única
SANA-Video 2.0: geração de vídeo eficiente em GPU única
A Nvidia Research apresentou o SANA-Video 2.0, um transformer de difusão de vídeo híbrido disponível nas escalas de 5B e 14B parâmetros, projetado para gerar vídeos de até 720p em uma única GPU. O modelo atinge um score VBench de 84.30 em 13,2 segundos (480p, uma H100), mantendo qualidade comparável a modelos de atenção softmax muito maiores, mas com latência drasticamente inferior.
Arquitetura híbrida
O núcleo da abordagem é a Hybrid Linear-Softmax Attention, que combina atenção linear com gating (complexidade O(N)) com âncoras periódicas de softmax em proporção 3:1. Isso restaura as interações token de rank completo que a atenção linear pura não consegue capturar. Estudos com proxies de resolução reduzida determinaram que 25% de softmax é o ponto ótimo de trade-off entre qualidade e eficiência.
Para propagar essas representações ao longo da profundidade da rede, o modelo usa Block Attention Residuals (AttnRes), que roteiam resumos de blocos completos para camadas lineares posteriores, permitindo reuso de features das âncoras e aumentando o rank efetivo das camadas profundas em aproximadamente 12%.
Desempenho
Os números de latência em uma única H100 (720p, 5 segundos de vídeo, 40 steps de amostragem):
- SANA-Video 2.0 (5B + Sol-Engine): 13,06 segundos
- SANA-Video 2.0 (14B): 69,3 segundos
- LTX-2.3: 130 segundos
- Hunyuan: 788 segundos
- Wan 2.2 14B: 1.556 segundos
O forward pass compilado do DiT é 3,2× mais rápido que um baseline full-softmax equivalente em 720p/60s, e essa vantagem cresce com a duração do vídeo. A otimização full-stack do Sol-Engine (fusão de kernels, caching e atenção esparsa) acelera o backbone em mais 3,58×.
Treinamento
Diferente de abordagens que linearizam modelos pré-treinados, o SANA-Video 2.0 é treinado do zero com a arquitetura híbrida completa, aprendendo diretamente a combinação de atenção linear e softmax.