
Visual prompt engineering melhora raciocínio em modelos de vídeo
O que é VIPE
Assim como o prompt engineering textual melhora sistematicamente o desempenho de modelos de linguagem, o Visual Prompt Engineering (VIPE) propõe modificar automaticamente a imagem de entrada de uma tarefa para extrair melhor raciocínio visual de modelos de vídeo. A ideia é simples: transformar uma cena abstrata (esboço, diagrama) em uma versão fotorrealista ou estilizada usando um modelo de edição de imagem, antes de enviá-la ao modelo de vídeo.
Como funciona
O processo usa uma chamada a um modelo de edição de imagem para gerar variantes visuais da tarefa original. Os autores exploram duas abordagens:
- Freeform VIPE: gera variações temáticas livres (ex.: transformar um labirinto em "neon motion graphics" ou "classic 2d arcade game").
- Atomic Concept Edit (ACE) VIPE: aplica edições atômicas e controladas, como "SET material of the blue circles as glossy 3D spheres" ou "REPLACE white background with dark solid color".
Tarefas testadas
O método foi avaliado em seis tarefas de raciocínio visual:
- Physics VPCT – prever em qual recipiente uma bola cai após descer rampas com obstáculos.
- Conjunctive Search – localizar um objeto definido por conjunção de features (cor + forma).
- Connect the Dots – conectar pares de pontos da mesma cor.
- Sort 3 Numbers – ordenar três números em ordem crescente.
- Maze Solving – encontrar caminho em labirintos de tamanhos variados (5×5, 7×7, 9×9 e irregular).
- RushHour – deslizar blocos para liberar a saída do carro vermelho.
Em todos os casos, a tentativa original (com a imagem abstrata) falhava, enquanto a melhor variante VIPE produzia a solução correta.
Principais achados
- VIPE melhora o desempenho de raciocínio em vídeo de forma consistente entre tarefas.
- Para modelos de vídeo, a engenharia de prompt visual pode ser mais eficaz que o prompt engineering textual clássico ou que test-time scaling.
- O método é computacionalmente eficiente: basta uma chamada de edição de imagem antes da inferência.
- Diferentes tarefas se beneficiam de estilos diferentes - não existe uma variante universalmente ótima, o que sugere que a busca pela melhor transformação visual é parte relevante do pipeline.
Autores e contexto
O trabalho é de Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer e colaboradores (core team inclui também Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim e Priyank Jaini), publicado como preprint no arXiv em 2026.