
SGLang acelera vídeo do MiniMax-H3 em até 6,2x em GPUs H200
Resultado principal
A equipe do SGLang Diffusion mediu a geração de vídeo do MiniMax-H3 em oito GPUs NVIDIA H200, mantendo prompts, sementes, resolução, taxa de quadros e etapas de denoising constantes em seis cargas de trabalho. Em comparação com o Diffusers, o caminho denso e sem perdas do SGLang foi de 1,85 a 1,95 vez mais rápido, sem alterar o cálculo de denoising. A comparação usou vídeos de 1.344×768 pixels, 24 FPS, 50 etapas configuradas e durações de 5 e 10 segundos; a execução ocorreu em 18 de agosto de 2026 com o SGLang v0.5.18.
As maiores acelerações combinaram três mecanismos. Os kernels fundidos reduzem tráfego de memória, tensores intermediários e lançamentos de kernels sem modificar a matemática. O Cache-DiT reutiliza resultados entre etapas de denoising quando a mudança residual fica abaixo de um limite, evitando recalcular parte da pilha compartilhada de blocos. Já a atenção esparsa SubBlock reduz o custo das etapas que continuam sendo executadas, descartando blocos de atenção cuja contribuição estimada é menor. Como os tokens de vídeo e áudio do MiniMax-H3 usam uma pilha DiT empacotada, o Cache-DiT toma uma decisão conjunta, sem caches independentes para vídeo e áudio.
Velocidade e qualidade
O perfil mais rápido testado, SubBlock 0.80 combinado com Cache-DiT stride, atingiu aceleração de 5,06× e 5,72× no T2VA, para vídeos de 5 e 10 segundos, e de 5,86× e 6,24× no FL2VA. O custo variou conforme a tarefa: o FL2VA manteve SSIM médio entre 0,85 e 0,91, enquanto o T2VA ficou entre 0,76 e 0,78 nesse perfil. O SSIM foi calculado sobre todos os quadros, em YUV420, usando o vídeo sem perdas do SGLang como referência.
Para priorizar qualidade, o texto recomenda Cache-DiT sem SubBlock. O perfil conservador chegou a 2,65–2,99× de aceleração, com SSIM entre 0,8986 e 0,9771; o modo stride alcançou 3,99–4,46×, com SSIM de 0,8037 a 0,9248 nas tabelas apresentadas. Como opção intermediária, SubBlock 0.75 mais Cache-DiT stride entregou 4,90–5,64× em 5 segundos e 5,44–5,93× em 10 segundos, com SSIM entre 0,7713 e 0,9202.
De onde vêm os ganhos
Microbenchmarks de operações isoladas registraram acelerações de 2,00× a 12,16× para kernels de AdaLN, SwiGLU, QK RMSNorm e RoPE, mas esses números não são economias aditivas de latência final. Em um rastreamento de uma solicitação T2VA de 5 segundos, com 49 avaliações efetivas do modelo, os tempos variaram de 37,78 segundos no caminho sem perdas a 14,34 segundos no perfil SubBlock 0.80 com stride. Esses valores identificam esse rastreamento específico e não substituem as medianas agregadas, calculadas com três prompts distintos.
A atenção SubBlock divide a sequência em blocos de 64 tokens e usa roteamento para manter apenas parte dos blocos de chaves. A configuração 0.75 mantém aproximadamente 25% deles; 0.80 é mais agressiva e tende a reduzir mais o SSIM. Os dez primeiros passos usam atenção densa, e chamadas curtas ou incompatíveis recorrem ao caminho denso. O estudo ressalta que quantização e resolução progressiva não foram incluídas, portanto os resultados representam apenas uma parte das possibilidades de aceleração. Os vídeos de demonstração permitem avaliar diretamente o custo visual das configurações.