
Plugin multimodal nativo para modelos Qwen chega ao GitHub
Visão geral
O repositório Qwen-MM-Plugins, publicado pela QwenLM no GitHub, oferece plugins multimodais nativos para modelos Qwen com o objetivo de tornar qualquer agente de código ou CLI “multimodal-native”. A proposta é que o modelo consiga ler imagens, vídeos, documentos e arquivos 3D, além de usar APIs de visão, áudio/vídeo, busca web, edição e geração de mídia, memória para vídeos longos e integração com ferramentas 3D/CAD.
Capacidades incluídas
Cada capacidade é instalada separadamente como um “skill” - para que o modelo saiba que o conjunto de ferramentas existe - acompanhado opcionalmente por um servidor MCP, que fornece as ferramentas em si.
Entre as capacidades listadas estão:
- core: leitura local de imagens e vídeos em resolução dinâmica, visualização de arquivos como documentos e modelos 3D, além de operações básicas de imagem, como corte, anotação e extração de quadros.
- api: uso de APIs em nuvem para entendimento de mídia, incluindo chat visual, OCR, grounding, legendagem com timestamps, ASR, separação de múltiplos falantes, segmentação SAM3 e entendimento de áudio/vídeo. Atualmente suporta DashScope.
- search: busca web e busca reversa de imagem para confirmação de fatos, com suporte atual ao Serper.
- video-memory: memória hierárquica em grafo para permitir perguntas e respostas sobre vídeos longos.
- video-edit: fluxos de edição de vídeo e geração de imagem, vídeo e áudio.
- blender: controle de uma instância do Blender via Python, com 22 ferramentas para modelagem, materiais, iluminação e renderização.
- freecad: controle de uma instância do FreeCAD, com 14 ferramentas para modelagem paramétrica, edição de propriedades, importação/exportação STEP/STL e análise FEM.
- edu-agent: criação de vídeos tutoriais educacionais em chinês a partir de problemas de matemática/ciência ou imagens, funcionando apenas como skill, sem servidor MCP.
Instalação
O projeto recomenda um instalador guiado, executado por script, que lida com instalação, configuração, verificação e desinstalação em vários ambientes suportados, incluindo Claude Code, Codex, Qoder, OpenClaw, Qwen Code e Gemini CLI. O script usa os mecanismos nativos de cada harness e grava uma configuração compartilhada em ~/.qwen-mm-plugins/config, usada tanto por interfaces gráficas quanto por terminal.
Também é possível instalar manualmente por harness, adicionando o marketplace de plugins e instalando capacidades específicas, como core, api, search, video-memory, video-edit, blender ou freecad. A recomendação é instalar primeiro o core, por ser a base de leitura local para as demais capacidades.
Para Windows, o projeto indica o uso de WSL2, preferencialmente Ubuntu, com o repositório clonado dentro do diretório home do WSL. O Windows nativo ainda não foi validado.
Dependências e configuração
As dependências Python são instaladas automaticamente via uvx na primeira execução, sem necessidade de pip manual. O usuário precisa instalar apenas ferramentas de sistema quando necessário, como ffmpeg para vídeo e áudio, além de opcionais como libreoffice, blender, texlive e chromium para recursos de visualização.
As ferramentas baseadas em API exigem chaves específicas:
DASHSCOPE_API_KEYpara visão, OCR, grounding, transcrição, entendimento Omni de áudio/vídeo, geração e construção de memória de vídeo.SERPER_API_KEYpara busca web, extração de páginas e busca reversa de imagem.
As chaves podem ser exportadas no shell ou persistidas no arquivo de configuração compartilhado. A leitura nativa de imagens, vídeos e documentos locais não requer chave de API.
Uso
Depois de instalada uma capacidade, o usuário pode referenciar arquivos diretamente no harness e pedir a ação desejada. O modelo escolhe automaticamente a ferramenta adequada. A leitura usa resolução dinâmica: imagens, quadros de vídeo e páginas de documentos são redimensionados automaticamente para o grid do modelo visual, preservando detalhes tanto em capturas 4K quanto em miniaturas.
Os exemplos incluem ler números de um dashboard em alta resolução, resumir páginas de PDF, fazer OCR de recibos, detectar objetos com caixas delimitadoras, transcrever reuniões com identificação de falantes, contar eventos em vídeos esportivos, identificar locais em fotos por busca reversa, consultar vídeos longos, gerar imagens, editar vídeos, modelar objetos no Blender e criar peças paramétricas no FreeCAD.
Licença
O projeto é licenciado sob Apache-2.0. As capacidades Blender e FreeCAD incluem código de terceiros sob licença MIT, com avisos próprios nos diretórios correspondentes.