
Laboratórios estariam otimizando modelos para o teste do pelicano de bicicleta?
O experimento
Dylan Castillo (Iwana Labs) investigou se laboratórios de IA estariam otimizando seus modelos especificamente para o famoso benchmark informal de Simon Willison: "gere um SVG de um pelicano andando de bicicleta". Para isso, criou uma grade de 48 combinações (8 animais × 6 veículos), gerou 1.008 SVGs em sete modelos frontier (GPT-5.6 Terra, Claude Sonnet 5, Gemini 3.5 Flash, Grok 4.5, Qwen3.7-Max, GLM-5.2 e DeepSeek V4 Pro), e avaliou cada imagem com um juiz LLM (GPT-5.6 Luna) em três critérios: qualidade do animal, do veículo e coerência da ação.
Resultados
Pelicano não é desenhado melhor que outros animais. Na média de todos os modelos, o pelicano ficou em 6º de 8 - atrás de gato, baleia, guaxinim, garça e antílope.
Bicicleta não é desenhada melhor que outros veículos. Ficou em penúltimo lugar, quase empatada com avião (que teve problemas por ambiguidade da palavra "plane").
A combinação pelicano+bicicleta ficou em 42º de 48. Mesmo ajustando para dificuldade com regressão de efeitos fixos, nenhum laboratório mostrou um "boost" estatisticamente significativo na célula específica do benchmark. O único resultado com p < 0,05 (Gemini 3.5 Flash na coluna bicicleta) não sobrevive à correção de Bonferroni e é consistente com um falso positivo esperado por acaso.
As cenas não parecem memorizadas. Todos os 21 pelicanos em bicicleta estão voltados para a direita - a única combinação com unanimidade -, mas isso se explica pelo fato de que tanto pelicanos quanto bicicletas tendem a ser desenhados de perfil voltados para a direita (81% das imagens de bicicleta, 78% das de pelicano). Elementos recorrentes (sol, cachecol, cesta) aparecem em outras combinações com frequência similar.
Limitações
- Um único juiz LLM, sem verificação de consistência.
- O experimento não detecta "SVGmaxxing" genérico (otimizar SVGs como um todo), algo que o Google/DeepMind faz abertamente.
- Orçamento de ~US$ 80 limitou a 3 amostras por célula e 7 modelos.
Conclusão
Não há evidência de que laboratórios estejam treinando especificamente para o benchmark do pelicano na bicicleta. A explicação mais plausível para bons resultados é otimização geral de geração de SVGs, não memorização do prompt específico.