stamatios
← Voltar ao feed
Mage: família multimodal compacta de 4B de parâmetros
Open Source · IA & Modelos

Mage: família multimodal compacta de 4B de parâmetros

resumo de ~3 min

Mage: família multimodal compacta de 4B de parâmetros

A equipe Microsoft Mage apresentou uma família de modelos multimodais leves e voltados para pesquisa, construída com um orçamento fixo de 4 bilhões de parâmetros. A filosofia central é a "eficiência alinhada ao codec": gastar capacidade de representação onde o sinal realmente importa, tanto para compreensão visual quanto para geração.

Os dois modelos são compactos o suficiente para treinar, fazer fine-tuning e implantar em hardware modesto, mantendo competitividade com sistemas abertos muito maiores.

Mage-VL (compreensão)

Modelo de linguagem e visão (VLM) codec-nativo, treinado do zero para compreensão de imagens e vídeos. A abordagem lê vídeo da mesma forma que um codec opera - com frames âncora e frames preditos, em patches de 16×16 - e incorpora um mecanismo de streaming proativo inspirado em processos biológicos.

Mage-Flow (geração e edição)

Stack generativo de 4B parâmetros composto por um VAE (Mage-VAE) e um MMDiT de resolução nativa, voltado para geração texto-para-imagem e edição baseada em instruções. Opera em resolução nativa e oferece variantes Base, RL e Turbo de 4 passos.