
Mage: família leve de modelos multimodais da Microsoft para pesquisa
Mage: família de modelos multimodais de 4B parâmetros da Microsoft
A Microsoft lançou o Mage, uma família de modelos multimodais leves (4B parâmetros) voltada para pesquisa. O projeto segue a filosofia de "gastar capacidade de representação onde está o sinal", aplicada tanto ao lado de compreensão quanto ao de geração. A família inclui dois modelos:
Mage-VL - compreensão de imagem e vídeo
Modelo de linguagem e visão treinado inteiramente do zero, com capacidade de streaming proativo e compreensão de imagens e vídeos. Código, checkpoints e detalhes completos ainda estão por vir.
Mage-Flow - geração e edição de imagens
Stack generativo compacto para text-to-image e edição baseada em instruções, composto por dois componentes co-desenhados:
- Mage-VAE: tokenizador latente leve e de alta fidelidade que iguala a qualidade de reconstrução do FLUX.2-VAE usando ~12× menos MACs de encode e ~22× menos MACs de decode por pixel, eliminando o gargalo do VAE em alta resolução.
- Native-Resolution Multimodal Diffusion Transformer: treinado com rectified flow matching.
Cada tarefa (geração e edição) vem em três variantes: Base, RL-aligned e 4-step Turbo.
Destaques de desempenho
- Competitivo com modelos muito maiores: iguala ou supera sistemas como Qwen-Image (20B), Z-Image (6B), FLUX.2 (32B) e FireRed-Image-Edit (20B).
- Resolução nativa: um único checkpoint gera de 512 a 2048 px em qualquer aspect ratio, incluindo extremos como 4:1 (ex.: 512×2048).
- Velocidade: packing de resolução nativa + kernels CUDA fusionados reduziram o tempo de treino por step de ~1,93s para ~0,78s (~2,5× mais rápido). Em uma única A100 a 1024², o Turbo gera uma imagem em 0,59s e faz uma edição em 1,02s.
- Edição versátil: edição semântica de conteúdo, transformação de aparência, restauração de imagem e outputs com consciência de estrutura, tudo em um único modelo condicionado por imagem e texto.
Disponibilidade
Os checkpoints do Mage-Flow (Base, RL-aligned e Turbo, para geração e edição) já estão no Hugging Face. O Mage-VL será lançado em breve. O projeto está sob licença MIT e é destinado exclusivamente a pesquisa - não para deploy em produtos ou serviços.