stamatios
← Voltar ao feed
Visual prompt engineering melhora raciocínio em modelos de vídeo
IA & Modelos · Ciência & Espaço

Visual prompt engineering melhora raciocínio em modelos de vídeo

resumo de ~3 min

O que é VIPE

Assim como o prompt engineering textual melhora sistematicamente o desempenho de modelos de linguagem, o Visual Prompt Engineering (VIPE) propõe modificar automaticamente a imagem de entrada de uma tarefa para extrair melhor raciocínio visual de modelos de vídeo. A ideia é simples: transformar uma cena abstrata (esboço, diagrama) em uma versão fotorrealista ou estilizada usando um modelo de edição de imagem, antes de enviá-la ao modelo de vídeo.

Como funciona

O processo usa uma chamada a um modelo de edição de imagem para gerar variantes visuais da tarefa original. Os autores exploram duas abordagens:

  • Freeform VIPE: gera variações temáticas livres (ex.: transformar um labirinto em "neon motion graphics" ou "classic 2d arcade game").
  • Atomic Concept Edit (ACE) VIPE: aplica edições atômicas e controladas, como "SET material of the blue circles as glossy 3D spheres" ou "REPLACE white background with dark solid color".

Tarefas testadas

O método foi avaliado em seis tarefas de raciocínio visual:

  1. Physics VPCT – prever em qual recipiente uma bola cai após descer rampas com obstáculos.
  2. Conjunctive Search – localizar um objeto definido por conjunção de features (cor + forma).
  3. Connect the Dots – conectar pares de pontos da mesma cor.
  4. Sort 3 Numbers – ordenar três números em ordem crescente.
  5. Maze Solving – encontrar caminho em labirintos de tamanhos variados (5×5, 7×7, 9×9 e irregular).
  6. RushHour – deslizar blocos para liberar a saída do carro vermelho.

Em todos os casos, a tentativa original (com a imagem abstrata) falhava, enquanto a melhor variante VIPE produzia a solução correta.

Principais achados

  • VIPE melhora o desempenho de raciocínio em vídeo de forma consistente entre tarefas.
  • Para modelos de vídeo, a engenharia de prompt visual pode ser mais eficaz que o prompt engineering textual clássico ou que test-time scaling.
  • O método é computacionalmente eficiente: basta uma chamada de edição de imagem antes da inferência.
  • Diferentes tarefas se beneficiam de estilos diferentes - não existe uma variante universalmente ótima, o que sugere que a busca pela melhor transformação visual é parte relevante do pipeline.

Autores e contexto

O trabalho é de Robert Geirhos, Yuxuan Li, Thaddäus Wiedemer e colaboradores (core team inclui também Neha Kalibhat, Zi Wang, Mani Malek, Oyvind Tafjord, Kevin Swersky, Been Kim e Priyank Jaini), publicado como preprint no arXiv em 2026.