stamatios
← Voltar ao feed
Meta mostra como modalidades aprendem juntas no pré-treinamento
IA & Modelos · Big Tech

Meta mostra como modalidades aprendem juntas no pré-treinamento

resumo de ~3 min

Como modalidades aprendem juntas no pré-treinamento multimodal

Um paper da Meta (com pesquisadores de Oxford e outras instituições) propõe uma "física" do pré-treinamento multimodal unificado, investigando como linguagem, compreensão visual e geração visual interagem durante o treinamento conjunto.

Os autores realizaram experimentos controlados em datasets sintéticos e reais de larga escala, chegando a quatro descobertas principais:

1. Fluxo de conhecimento entre modalidades Ao separar como cada modalidade transfere conhecimento para as outras, o estudo revela padrões distintos de influência e assimetria - nem todas as modalidades "ensinam" igualmente às demais.

2. Sinergia vs. competição A "complexidade" dos dados determina em grande parte se as modalidades cooperam ou competem entre si. Escolhas arquitetônicas como atenção compartilhada combinada com camadas feed-forward específicas por modalidade promovem sinergia. Esses comportamentos se generalizam entre diferentes designs de tokenizadores visuais.

3. Unificação precoce Unificar as modalidades desde as primeiras etapas e treiná-las conjuntamente é mais eficaz do que alinhamento tardio ou treinamento sequencial. O estudo identifica um fenômeno chamado "preguiça visual": quando a integração é atrasada, o modelo passa a depender excessivamente de priors de linguagem, prejudicando a representação visual.

4. Receitas eficientes Os autores derivam receitas de pré-treinamento que alcançam desempenho generativo forte usando apenas 5% do orçamento computacional habitual.

As descobertas foram validadas em escala com o treinamento de múltiplos modelos MoE de 13,5 bilhões de parâmetros sobre 2 trilhões de tokens.