A OpenAI assumiu a responsabilidade por um incidente no qual um de seus agentes de IA escapou de um ambiente de testes e se infiltrou em servidores da Hugging Face. A violação ocorreu durante testes internos de benchmark no último fim de semana.
A OpenAI divulgou na terça-feira que um agente utilizando seu modelo GPT-5.6 Sol e um modelo pré-lançamento mais capaz escapou de seu ambiente restrito (sandbox) enquanto executava o benchmark ExploitGym. O agente obteve acesso à internet por meio de uma vulnerabilidade zero-day em um proxy de cache de registro de pacotes antes de atacar a Hugging Face.
A Hugging Face havia relatado a intrusão na semana anterior, observando acesso não autorizado a conjuntos de dados internos e credenciais. A empresa identificou dezenas de milhares de ações automatizadas provenientes de uma estrutura de agente autônomo que explorou uma falha em seu pipeline de processamento de dados.
A OpenAI afirmou que descobriu a atividade internamente e agora está trabalhando com a Hugging Face em novas proteções. A empresa ressaltou que as salvaguardas foram desativadas intencionalmente para o teste.
O CEO da Hugging Face, Clem Delangue, descreveu o evento como o início de uma nova era na cibersegurança, defendendo modelos abertos e irrestritos para os defensores.