
Agentes de IA testam limites criativos em produção de vídeo
Desenho do teste
A Magic Hour construiu um harness para avaliar gosto e criatividade em agentes de IA, submetendo Fable 5 e Sol 5.6 aos mesmos quatro trabalhos: três anúncios de 15 segundos - restaurante de hambúrguer, protetor solar masculino e Codex Micro - e um mini documentário sobre o Big Ben. Cada execução recebeu orçamento de 5.000 créditos (cerca de US$ 8,7), em 8 execuções, com acesso a um servidor MCP local da Magic Hour para geração de vídeo e imagem, busca na web e ffmpeg. Cada rodada usou workspace isolado, briefing idêntico e oito skills, com pipeline de dez estágios e validação em cada etapa. Como os modelos não assistem a vídeo, extraíram frames para inspecionar imagens antes de avançar. A rubrica tinha cinco critérios, sendo criatividade e gosto o mais importante; cada modelo se autoavaluou de 1 a 5 e escreveu uma declaração do diretor.
Resultados e custos
O tempo de relógio pouco separou os modelos, porque a maior parte da execução é espera em filas de geração. Sol fez 22 buscas na web contra 9 de Fable; Fable compensou baixando páginas e 94 imagens de referência para o Codex Micro. Sol leu mais tokens de entrada, enquanto Fable escreveu 40–100% mais tokens por execução. Em custo, Fable foi sistematicamente mais caro: 11% mais créditos Magic Hour e 80% mais caro em tokens, totalizando US$ 83,26 contra US$ 45,92 de Sol.
Estratégias criativas
Fable adotou conceitos mais literais e próximos do briefing: hambúrguer como documentário de vida selvagem, protetor solar como duelo de faroeste e Codex Micro como bateria eletrônica para código. Sol assumiu riscos maiores e conceitos mais premium e afastados do pedido: DEAD AIR, SHADEWORK e uma mesa de controle de missão em luzes. Em tarefas com restrições, ambos recorreram a imagens oficiais como âncora e evitaram inserir material encontrado no filme final.
Limites e ressalvas
Os autores afirmam que nenhum dos clipes é ótimo e que a incapacidade de ver movimento limita o resultado. Em 6 de 8 execuções, os modelos recusaram a lista de vozes de celebridades exposta pelo MCP e criaram alternativas: Fable extraiu uma voz genérica do áudio nativo do veo3.1; Sol testou vozes locais de síntese de fala. O som ficou fora de sincronia com a imagem em todos os clipes, e ambos foram conservadores com créditos, parando mesmo quando havia orçamento para iterar. A conclusão é que não há vencedor claro em criatividade pura: Fable segue melhor o briefing, Sol arrisca mais. O gosto, segundo o artigo, segue longe do padrão humano; modelos podem ajudar a explorar ideias, mas não substituem julgamento humano.
Abertura do experimento
O harness inteiro é open source no repositório github.com/maniculehq/creative-duel, com briefings, skills, runner e ferramentas de resumo. Para executar, é preciso ter os CLIs dos dois agentes, uma chave da API Magic Hour, ffmpeg e um terminal rodando o servidor MCP.