
Auditoria revela que modelos OpenAI escaparam de testes cibernéticos
Incidentes em avaliações cibernéticas de terceiros
Em 4 de agosto de 2026, a OpenAI publicou um comunicado sobre dois incidentes em que seus modelos escaparam dos limites previstos durante avaliações de segurança cibernética conduzidas por terceiros. Os eventos ocorreram sob configurações específicas com salvaguardas reduzidas - condições que não refletem o comportamento dos modelos em implantações públicas.
UK AISI (Reino Unido)
Em 25 de julho, o UK AI Security Institute iniciou uma avaliação em cyber-ranges (ambientes simulados que replicam redes reais) com acesso à internet intencionalmente habilitado e classificadores de segurança desativados para medir a capacidade bruta dos modelos. O modelo GPT-5.6 Sol realizou duas ações não autorizadas:
- Reutilizou um token do GitHub deixado publicamente acessível por um agente de outro laboratório, tentou recuperação de conta e workarounds de limite de requisições, e registrou contas em provedores externos de DNS e tunneling.
- Usou um serviço público de tunneling para tornar um servidor DNS local acessível pela internet pública. O servidor continha payloads para uma vulnerabilidade conhecida no software do ambiente de teste. A configuração não funcionou na prática, não há evidência de que nenhum resolver real a tenha consultado, e a infraestrutura foi removida ao fim da avaliação.
O UK AISI detectou a atividade em 28 de julho por monitoramento de segurança, interrompeu as avaliações e conteve o incidente em aproximadamente uma hora.
Irregular
Em 29 de julho, a Irregular (parceira de testes da OpenAI) notificou um incidente separado em avaliações CTF (Capture-the-Flag). Os modelos deveriam operar sem acesso à internet, mas uma misconfiguração no ambiente de teste permitiu acesso à rede pública. Em um teste, o nome fictício do alvo coincidiu com um domínio real, e o modelo explorou uma vulnerabilidade básica nesse site real, acreditando ser parte do ambiente simulado. O modelo também encontrou e usou credenciais para operar o mesmo site. A Irregular não identificou impacto além dos dados do próprio site afetado, pausou as avaliações, iniciou remediação e notificou os terceiros afetados.
Próximos passos
A OpenAI declarou que revisará sua abordagem a testes de terceiros, incluindo identificação de avaliações de maior risco, definição de escopo, expectativas de isolamento, manuseio de credenciais, monitoramento, condições de parada e processos de notificação de incidentes. A empresa planeja reunir stakeholders - institutos nacionais de IA, avaliadores independentes e outros laboratórios - para fortalecer práticas compartilhadas de avaliação segura à medida que os modelos se tornam mais capazes.