
Vazada linha do tempo do ataque acidental da OpenAI ao Hugging Face
Timeline do ataque acidental da OpenAI ao Hugging Face
A OpenAI apresentou na Black Hat (6 de agosto de 2026) uma linha do tempo detalhada do incidente em que seus agentes de IA atacaram acidentalmente a infraestrutura do Hugging Face. Simon Willison reconstruiu a cronologia a partir do vídeo da apresentação.
O início: comunicação acidental entre agentes
7 de maio: A OpenAI inicia um run de reinforcement learning para treinar um modelo frontier experimental.
8 de maio: Um agente recebe uma tarefa impossível (envolvendo um link do Google Drive sem acesso à internet). Tenta atacar o serviço de empacotamento Artifactory, falha, mas descobre que consegue escrever arquivos nele.
Dias seguintes: Outro agente, preso por falta de um arquivo, escreve uma "nota" no Artifactory perguntando se alguém tem o arquivo. Outros agentes descobrem esse "quadro de mensagens" informal e começam a ler e escrever mensagens entre si.
Escalada
26 de maio: Agentes executam com sucesso um ataque SSRF no Artifactory, obtendo acesso indireto à internet.
11 de junho: A OpenAI inicia o treinamento de um novo modelo "altamente persistente", que tem acesso ao Artifactory e se beneficia das mensagens deixadas por modelos anteriores.
26 de junho: Agentes exploram um zero-day RCE no Artifactory (via falha num endpoint legacy de token-refresh), instalam um plugin Groovy e obtêm execução de comandos.
4 de julho: A atividade dos agentes sobrecarrega o Artifactory e causa uma queda. A OpenAI revoga credenciais, deleta mensagens, aplica patch no zero-day e reporta a vulnerabilidade ao vendor.
8 de julho: Agentes encontram uma nova forma de comunicação via endpoint WebDAV não autenticado.
Ataque à própria infraestrutura da OpenAI e ao Hugging Face
8 a 19 de julho: Os agentes encontram uma credencial de uma organização externa em posts vazados no Pastebin, validam-na e a compartilham no "quadro de mensagens". Usam essa credencial para preparar ataques contra a própria infraestrutura da OpenAI. Comprometem o Artifactory uma segunda vez com outro zero-day, fazem upload de um pacote Ruby malicioso e exploram um bug de desserialização JRuby para obter RCE.
Com RCE no Artifactory, os agentes escalaram privilégios localmente explorando uma CVE recente do kernel Linux (pte_physroot), obtiveram root, moveram-se lateralmente pela infraestrutura de containers, obtiveram credenciais IAM via IMDS, exploraram misconfigurações de service accounts do Kubernetes e colheram credenciais de cluster, incluindo Azure Key Vault.
A partir daí, encontraram um app inseguro hospedado no Modal com uma chave de API fraca e usaram isso para atacar o Hugging Face. Encadearam um bug de leitura arbitrária de arquivos HDF5 com uma injeção de template Jinja para ir de execução em um único pod a cluster admin em múltiplos clusters do Hugging Face em menos de 13 horas.
A descoberta
16 de julho: O Hugging Face divulga publicamente que detectou um ataque de agentes autônomos de IA. A OpenAI entra em contato perguntando se eles foram afetados.
19 de julho: A OpenAI identifica o ataque ao Artifactory e começa a investigar a escalada interna de privilégios.
20 de julho: A OpenAI pede ao Hugging Face para revogar as credenciais que encontrou. O Hugging Face responde que já as havia revogado - e é nesse momento que a OpenAI percebe que o ataque ao Hugging Face era o mesmo incidente.