
MirrorCode avalia capacidade de IA em reescrever programas do zero
O que é o MirrorCode
MirrorCode é um benchmark da Epoch AI, desenvolvido em parceria com a METR, que testa a capacidade de modelos de IA em reescrever programas inteiros do zero - sem acesso ao código-fonte original. A IA precisa reimplementar um programa completo e fazer com que sua saída coincida exatamente com a do original em testes end-to-end, incluindo testes ocultos que o modelo nunca vê durante o desenvolvimento.
O benchmark contém 25 programas-alvo de diferentes áreas: utilitários Unix, serialização e consulta de dados, bioinformática, interpretadores, análise estática, criptografia e compressão.
Diferenciais do benchmark
Orçamento de inferência realista. Diferente de benchmarks que limitam gastos a $1–10 em tarefas que levariam semanas para um humano, o MirrorCode oferece orçamento suficiente para tentativas sérias. Uma das maiores tarefas custou $2.600 por execução e envolveu a IA trabalhando por 19 dias sem intervenção humana.
Difícil, mas justo. Reimplementar programas inteiros é extremamente desafiador até para engenheiros humanos - estima-se que as tarefas mais complexas levariam meses. Porém, há informação suficiente para que as tarefas sejam factíveis.
Resistente a trapaça. Os modelos rodam em sandbox, sem acesso à internet, sem o código original e sem possibilidade de criar tabelas de consulta para simular saídas, graças aos testes ocultos.
Resultados principais
A IA já consegue resolver tarefas de longo horizonte no MirrorCode. O exemplo destacado é o Claude Opus 4.7, que reimplementou o gotree - um toolkit de bioinformática com ~16.000 linhas de Go e mais de 40 comandos. Um engenheiro humano sem IA levaria de 2 a 17 semanas; o modelo resolveu em 14 horas, ao custo de $251. A implementação passou em 2.000 de 2.001 testes, falhando apenas em um caso de borda de um comando de nicho.
Ressalva sobre contaminação
Como os programas-alvo são open-source, é provável que os modelos tenham visto o código original durante o pré-treinamento. Os autores aplicaram um filtro de memorização: a IA conseguiu reimplementar programas que passaram nesse filtro e falhou naqueles com evidência de memorização, sugerindo que os resultados não são dominados por memorização - embora não seja possível descartar completamente essa contribuição.
Leaderboard e código aberto
O leaderboard atual avalia 15 programas dos buckets Medium e Large, cada um em duas linguagens (geralmente Go e Ada), totalizando 30 tarefas, com três tentativas por tarefa, orçamento de 10 bilhões de tokens e 7 dias por tentativa. O benchmark ainda não foi completamente resolvido.
O scaffold e 22 dos 25 programas-alvo (132 instâncias de tarefa em seis linguagens) foram liberados como código aberto; três programas são mantidos como conjunto de teste privado.