
Escalando repetição de dados para LLMs
O dilema da repetição de dados de domínio
À medida que modelos de linguagem de grande porte escalam, o orçamento de tokens de treinamento precisa crescer para manter uma proporção adequada de tokens por parâmetro (TPP). O resumo do artigo aponta que dados de domínio de alta qualidade são muito mais difíceis de escalar do que dados gerais da web, de modo que sua fração na mistura de treinamento tende a diminuir conforme o tamanho do modelo e o orçamento de tokens aumentam. Repetir os dados de alta qualidade disponíveis surge como uma forma eficaz de conter essa diluição, mas o excesso de repetição pode levar a sobreajuste.
O que o estudo examina
Os autores estudam esse equilíbrio sob condições práticas de escalonamento de LLMs, nas quais o orçamento de tokens de treinamento cresce proporcionalmente ao tamanho do modelo. Para um domínio fixo, o artigo relata um resultado considerado surpreendente: mantida a mesma TPP, a contagem ótima de repetição aumenta levemente conforme o modelo fica maior. Ou seja, modelos maiores podem tolerar ou aproveitar um pouco mais de repetição do mesmo dado de domínio, desde que a proporção entre tokens e parâmetros seja mantida.
Relação entre domínio, perda e volume de dados únicos
Ao comparar diferentes domínios, o estudo encontra uma correlação negativa forte entre a contagem ótima de repetição e a perda final de validação do domínio. Domínios com perda menor geralmente podem se beneficiar de mais repetições. Em contraste, a quantidade de dados únicos do domínio apresenta apenas relação fraca com a contagem ótima de repetição. Isso desloca o critério de decisão do volume bruto de dados disponíveis para a qualidade efetiva do domínio, medida pelo desempenho de validação.
Implicação prática
As conclusões sugerem que contagens de repetição ajustadas em modelos menores usados como proxies, desde que mantenham a mesma TPP, podem fornecer uma estimativa prática para modelos maiores. O artigo não apresenta a repetição como solução sem custo: reconhece explicitamente o risco de sobreajuste quando a repetição é excessiva. Ainda assim, indica um caminho para preservar a presença de dados especializados em misturas de pré-treinamento sem depender exclusivamente da coleta de novos dados de domínio.