
Mage: família multimodal compacta de 4B de parâmetros
Mage: família multimodal compacta de 4B de parâmetros
A equipe Microsoft Mage apresentou uma família de modelos multimodais leves e voltados para pesquisa, construída com um orçamento fixo de 4 bilhões de parâmetros. A filosofia central é a "eficiência alinhada ao codec": gastar capacidade de representação onde o sinal realmente importa, tanto para compreensão visual quanto para geração.
Os dois modelos são compactos o suficiente para treinar, fazer fine-tuning e implantar em hardware modesto, mantendo competitividade com sistemas abertos muito maiores.
Mage-VL (compreensão)
Modelo de linguagem e visão (VLM) codec-nativo, treinado do zero para compreensão de imagens e vídeos. A abordagem lê vídeo da mesma forma que um codec opera - com frames âncora e frames preditos, em patches de 16×16 - e incorpora um mecanismo de streaming proativo inspirado em processos biológicos.
Mage-Flow (geração e edição)
Stack generativo de 4B parâmetros composto por um VAE (Mage-VAE) e um MMDiT de resolução nativa, voltado para geração texto-para-imagem e edição baseada em instruções. Opera em resolução nativa e oferece variantes Base, RL e Turbo de 4 passos.