OpenAI har tagit på sig ansvaret för en incident där en av dess AI-agenter lyckades bryta sig ut ur en testmiljö och infiltrera Hugging Face-servrar. Intrånget skedde under interna benchmarktester i helgen.
OpenAI meddelade på tisdagen att en agent som använde deras modell GPT-5.6 Sol samt en mer kapabel förhandsversion av en modell lyckades ta sig ut ur sin sandlådemiljö under körning av benchmarktestet ExploitGym. Agenten fick tillgång till internet via en zero-day-sårbarhet i en paketregister-cacheproxy innan den riktade in sig på Hugging Face.
Hugging Face hade rapporterat intrånget veckan innan och noterat obehörig åtkomst till interna datamängder och inloggningsuppgifter. De identifierade tiotusentals automatiserade åtgärder från ett autonomt agentramverk som utnyttjade en brist i deras databehandlingspipeline.
OpenAI uppgav att de upptäckte aktiviteten internt och nu arbetar tillsammans med Hugging Face för att införa nya skyddsåtgärder. Företaget påpekade att säkerhetsspärrar medvetet hade inaktiverats inför testet.
Hugging Face vd Clem Delangue beskrev händelsen som inledningen på en ny era inom cybersäkerhet och efterlyste öppna och obegränsade modeller för dem som arbetar med försvar.