stamatios
← Voltar ao feed
Qwen-Image 3.0: geração de imagens com texto longo e renderização de interfaces
IA & Modelos · Open Source

Qwen-Image 3.0: geração de imagens com texto longo e renderização de interfaces

resumo de ~3 min

Qwen-Image 3.0: geração de imagens com foco em utilidade real

A Qwen Studio lançou em 21 de julho de 2026 o Qwen-Image-3.0, terceira geração de seu modelo de geração de imagens. Se a versão 1.0 tinha como palavra-chave "Precisão" e a 2.0 adicionava "Variedade, Completude, Beleza e Autenticidade", a 3.0 se resume a uma única palavra: "Real" (实). O objetivo declarado é transformar geração de imagens de algo "bonito" em algo "útil" - uma ferramenta de produtividade de fato.

Rich Content (Conteúdo Rico)

O modelo aceita instruções de até 4.500 tokens, permitindo gerar layouts complexos em uma única passagem. O exemplo mais impressionante: uma grade 3×3 contendo nove infográficos distintos (quadrinhos de segurança em túneis, aula de geometria espacial, análise estilística de um texto clássico chinês, física de projéteis, parasitologia, diagrama médico, teoremas de Sylow, infográfico de controle bancário e estrutura celular de DNA) - tudo com texto em chinês e inglês, fórmulas, gráficos e personagens, gerado de uma só vez. O post também demonstra profundidade visual: uma imagem com interfaces aninhadas (VSCode → Qwen Chat → WeChat → pôster de café), cada camada mantendo o estilo autêntico da respectiva UI.

Authentic Details (Detalhes Autênticos)

O modelo renderiza texto legível a partir de 10 pixels, incluindo fórmulas LaTeX com subscritos, sobrescritos e alinhamento multi-linha em tamanho de fonte pequeno. Também reproduz texturas de pele com poros e fios de cabelo em nível fotográfico. Em tarefas de edição, consegue sobrepor anotações manuscritas realistas (sublinhados, setas, comentários) simulando cadernos de estudantes, e restaurar pinturas tradicionais danificadas mantendo o estilo original de pincelada.

Deep Knowledge (Conhecimento Profundo)

O Qwen-Image-3.0 renderiza nativamente 12 idiomas (com exemplos em japonês, coreano e espanhol), simula interfaces de UI realistas (páginas web, jogos, livestreams) e possui conhecimento de mundo que permite criar infográficos profissionais a partir de fotos reais - como transformar uma foto de inseto em uma figura acadêmica com anotações taxonômicas e barra de escala. O modelo também pode se conectar à internet para buscar informações atualizadas (ex.: previsão do tempo de uma data específica) e gerar imagens com figuras de IP específicas (ex.: Qi Baishi e Van Gogh em uma sala de livestream).

Conclusão

A equipe posiciona o modelo como avanço em cenários de produtividade de alto valor: PDFs de jornais, storyboards de curtas-metragens e interfaces de UI complexas. A ambição é que, à medida que as capacidades evoluam, a geração de imagens destrave valor real em design, criação de conteúdo, educação e e-commerce.