
Qwen-Image-3.0-Pro gera layouts complexos em imagem única
Qwen-Image-3.0-Pro: geração de imagens com layouts complexos em uma única passagem
O Qwen-Image-3.0-Pro é um modelo de geração de imagens da Qwen (Alibaba) que se destaca pela capacidade de produzir layouts densos e complexos em uma única geração. Entre os casos de uso citados estão jornais, storyboards, menus e provas de exame - tudo renderizado de uma só vez, sem necessidade de composição manual.
Capacidades principais
- Conteúdo rico: aceita até 4,5 mil tokens de entrada e suporta layouts com imagens dentro de imagens (nested images).
- Detalhe autêntico: renderiza texto com até 10px de tamanho e reproduz microexpressões, poros e fios de cabelo individuais, aproximando-se da qualidade de fotografia real.
- Conhecimento profundo: renderiza nativamente 12 idiomas e diversas fontes, simula interfaces de páginas web, jogos e lives, e incorpora conhecimento externo.
Posicionamento
A proposta declarada é que o modelo não busca apenas "boa aparência", mas "utilidade" - tornando a geração de imagem uma ferramenta de produtividade realmente implantável.
Preços
| Item | Custo |
|---|---|
| Entrada de imagem (1K ou 2K) | US$ 0,003 por imagem |
| Saída de imagem 1K | US$ 0,04 por imagem |
| Saída de imagem 2K | US$ 0,075 por imagem |
O limite de requisições é de 1 RPM (requests por minuto), o que indica um modelo voltado a uso controlado ou batch.
Recursos de API disponíveis
O modelo oferece prefix completion (modo parcial), function calling, cache de contexto, saídas estruturadas (JSON), processamento em lote, busca na web e fine-tuning - os mesmos recursos típicos da plataforma Qwen/DashScope.
Exemplo de uso
A documentação mostra um prompt longo e detalhado (descrição cinematográfica de um retrato urbano com elementos tipográficos e de composição), demonstrando a capacidade do modelo de lidar com instruções complexas e multicamadas.