stamatios
← Voltar ao feed
Robô estuda diante de pilha de livros com ampulheta ao lado, aprendizado no momento do teste como novo eixo de escala da IA
IA & Modelos

Test-time training surge como novo eixo de escala para modelos

resumo de ~3 min

A promessa de um novo eixo de escala

O autor parte de uma observação sobre o desenvolvimento de modelos: cada nova forma de escalar trouxe ganhos grandes de eficácia. Numa visão simplificada, os GPTs 1 a 3 escalaram dados, arquiteturas MoE escalaram parâmetros separadamente dos FLOPs, e tudo desde o o1 também escala compute no momento do teste, por meio de raciocínio.

Nesse contexto, o test-time training (TTT) parece atraente como um novo eixo de escala. Ele também dialoga com o tema do aprendizado contínuo: os modelos atuais são muito inteligentes, mas para evitar que repitam o mesmo erro é preciso incluir avisos como "IMPORTANT: DO NOT IGNORE" nos prompts. Se eles pudessem aprender, isso não seria necessário.

O que os artigos mostram

Ao comentar o artigo "Test-Time Training with KV Binding Is Secretly Linear Attention", o autor nota que ele mostra que uma ampla classe de arquiteturas TTT pode ser expressa como uma forma de operador de atenção linear aprendido - o que pode parecer uma reformulação de algo já existente. Ele considera o artigo interessante, com conclusões úteis para quem constrói certos tipos de modelos, mas o que mais lhe chamou atenção foi a confusão terminológica em torno de "test time training".

O artigo que define o termo, "Test Time Training under Distribution Shift", mostra o esperado: atualizar os pesos do modelo para lidar com mudanças de distribuição vistas no momento do teste. São atualizações de slow weights - pesos atualizados pelo otimizador, uma vez por minibatch, com checkpoints, ou seja, o que normalmente se entende por "pesos".

Já os fast weights são produzidos no forward pass, como a matriz de estado de uma camada de atenção linear. O treino normal não otimiza esses pesos diretamente; aprende uma regra que os cria.

KV binding como fast weights

No caso analisado, o TTT treina fast weights: uma camada de KV binding que adiciona uma matriz de tamanho fixo, que não cresce com o comprimento da sequência, e roda um passo de gradiente atualizando essa matriz a cada elemento da sequência. O autor observa que isso lembra uma camada de atenção linear ou uma RNN.

Isso resolve o aprendizado contínuo?

Não, segundo o texto: os fast weights são reiniciados a cada nova sequência, então o mecanismo não proporciona aprendizado persistente entre sequências.