stamatios
← Voltar ao feed
Rolo de filme atravessa peneira separando quadros do ruído, metáfora da filtragem de dados para vídeo generativo
IA & Modelos

Filtragem de dados vira peça-chave no pré-treino de vídeo gerativo

resumo de ~3 min

Tese central

A filtragem de dados se tornou, segundo a experiência da Linum, a principal alavanca - além de aumentar a escala - para melhorar modelos generativos de vídeo. Os autores relatam que a qualidade do conjunto de pré-treinamento importa mais do que simplesmente reunir o maior volume possível: dados comprimidos, redundantes, pouco descritíveis ou desbalanceados fazem o modelo gastar capacidade aprendendo padrões indesejados. Para o Linum v3, a empresa busca melhorar a obediência a prompts, acelerar treino e inferência e tornar a física mais consistente, atribuindo grande parte dos avanços recentes em modelos de imagem e vídeo a melhorias de dados, anotações e geração sintética.

Da heurística barata aos modelos especializados

Em 2024, a Linum processou dados brutos com ferramentas de visão computacional executadas em CPUs. PySceneDetect dividia vídeos em tomadas, mas tinha dificuldades com dissoluções, fades e cortes com tremor. O EAST Detector identificava vídeos com muito texto, embora o redimensionamento agressivo deixasse passar fontes pequenas. Vetores de movimento H.264 serviam para remover vídeos estáticos, caóticos ou com trechos sem atividade, mas tinham baixa capacidade de detectar todos os clipes com ações difíceis de descrever. Detectores Haar ajudavam a identificar e reduzir vídeos de pessoas falando diretamente para a câmera, considerados super-representados.

A empresa concluiu que essa árvore de decisões era difícil de ampliar, interpretar e editar. Em um exemplo apresentado pelos autores, o modelo demorou semanas para aprender ações básicas, como tocar violão, com o conjunto de 2024, mas aprendeu as mesmas ações em menos de 24 horas após a aplicação dos filtros de 2025. A recomendação passou a ser otimizar os melhores filtros que o orçamento permitir, substituindo heurísticas por redes neurais capazes de capturar padrões menos facilmente descritos por regras manuais.

Escala, rotulagem e reequilíbrio

A nova infraestrutura trocou PySceneDetect por AutoShot e TransNetV2, e o EAST por PaddleOCR executado com TensorRT em milhares de GPUs Nvidia A10G e L4. A Linum afirma ter processado dezenas de bilhões de amostras em cerca de 36 horas, por menos de US$ 10 mil. Vetores H.264 continuam sendo usados como filtro inicial barato para extremos de movimento, enquanto modelos de linguagem ajustados substituíram vários classificadores tradicionais.

O processo de rotulagem é tratado como parte inseparável da construção do conjunto. A equipe recomenda definir categorias claras, rotular cerca de 2 mil amostras, reservar uma validação, ajustar o modelo, revisar erros e redefinir ou combinar categorias em ciclos sucessivos. Os autores destacam que a inconsistência humana é um problema central: categorias ambíguas, critérios que se diluem durante a anotação e discordâncias entre avaliadores podem contaminar o sinal de treinamento. Um estudo da CMU citado no texto encontrou discordância de aproximadamente 24% entre especialistas ao anotar movimento de câmera, embora rodadas repetidas tenham elevado a concordância a 96%.

Estética e pipeline final

Para filtragem estética, a Linum abandonou várias etiquetas específicas, que geravam sinais esparsos e rotulagem lenta, e adotou notas de 1 a 4. O modelo Qwen-2.5-VL-3B treinado com Reinforcement Learning with Verifiable Rewards (RLVR), usando uma rubrica que penaliza a distância entre a nota prevista e a real, superou seus equivalentes ajustados por aprendizado supervisionado, segundo os autores. Tentativas de ensinar justificativas textuais não funcionaram bem para distinguir notas próximas, como 2 e 3.

Na etapa final, o pipeline reduziu cerca de 15 bilhões de imagens a aproximadamente 250 milhões e cerca de 1 bilhão de clipes a cerca de 50 milhões. Os filtros incluíram proporção e tamanho, detecção de texto, classificadores categóricos, deduplicação, pontuação estética, detecção de tomadas e fluxo óptico. Legendas também foram convertidas em tags para reduzir categorias super-representadas e ampliar outras. A conclusão é que o pré-treinamento pode ser mais permissivo para preservar cobertura, enquanto fases posteriores podem apertar a distribuição; ainda assim, economizar na filtragem tende a comprometer o aprendizado do modelo.