
WeChat libera família de modelos de embedding multimodal WeMM
Uma família de embeddings multimodais
A equipe WeChat Vision, da Tencent, disponibilizou o WeMM-Embedding, uma família de modelos de embeddings multimodais voltada à compreensão e à recuperação de informações. O conjunto inclui as versões WeMM-Embedding-2B, 4B e 9B, com dimensões Matryoshka que variam de 64 a 2.048, 2.560 ou 4.096, conforme o modelo. Todos processam texto, imagens, vídeos, documentos visuais e entradas multimodais intercaladas; áudio ainda não é compatível.
As representações são extraídas do estado oculto da última camada na posição reservada para o token de embedding e depois normalizadas por L2. O repositório oferece instruções de instalação, inferência com Transformers e Sentence Transformers e execução com vLLM ou SGLang. Para reprodução dos resultados, a equipe recomenda Transformers 5.2.0, observando que versões mais novas podem apresentar diferenças no pré-processamento.
Dimensões reduzidas e avaliação
Os modelos permitem truncar o embedding completo para uma dimensão suportada e normalizá-lo novamente. Segundo a documentação, no MMEB-v2, o modelo de 2B usando 256 dimensões reteve 98,7% do desempenho em imagens e vídeos obtido com a dimensão completa.
No MMEB-v2, avaliação baseada em 78 conjuntos de dados registrou médias de 77,9 para o modelo de 2B, 79,2 para o de 4B e 80,6 para o de 9B. As pontuações combinam tarefas de imagem, vídeo e documentos visuais: o modelo de 9B obteve, respectivamente, 81,9, 74,3 e 83,3 nessas categorias. A métrica usada foi Hit@1 para imagem e vídeo e NDCG@5 para documentos visuais.
No MMEB-v3, que reúne 190 tarefas - incluindo as 78 do MMEB-v2, além de tarefas de texto, agentes, MCMR e áudio -, o WeMM-Embedding alcançou 56,0 com 2B, 58,2 com 4B e 59,5 com 9B na pontuação geral. O modelo de 9B registrou 48,8 em texto, 51,0 em tarefas de agentes e 49,3 em MCMR. Como o WeMM-Embedding não oferece suporte a áudio, essa categoria recebeu pontuação zero na avaliação. Os resultados foram produzidos com uma versão adaptada do pipeline oficial do VLM2Vec, incluindo inferência distribuída e amostragem de 64 quadros por vídeo.
Disponibilidade
O código criado pela Tencent no repositório é distribuído sob a licença Apache 2.0, salvo indicação diferente; componentes de terceiros mantêm suas próprias licenças. O projeto também disponibiliza o código de avaliação do MMEB-v3 e links para os modelos no Hugging Face. A documentação apresenta os números como resultados da própria equipe com base nas tabelas do relatório técnico, e observa que alguns resultados comparativos do MMEB-v2 vêm de submissões fechadas sem pesos ou endpoint público.