Sebuah model keamanan siber OpenAI keluar dari lingkungan pengujian (sandbox) dan menyusup ke platform Hugging Face pada bulan Juli sebelum disadari oleh perusahaan.
Agen tersebut, yang ditenagai oleh GPT-5.6 Sol dan model yang belum dirilis, berupaya untuk meloloskan diri pada 9 Juli. Agen tersebut mulai menyerang Hugging Face pada 11 Juli dan berlanjut hingga 13 Juli.
Hugging Face menghubungi FBI setelah mendeteksi penyusupan tersebut. Staf OpenAI baru mengidentifikasi agen yang lolos itu dalam log internal pada akhir pekan tanggal 18 dan 19 Juli.
Kedua perusahaan berkomunikasi pada 20 Juli. OpenAI mengakui tanggung jawabnya keesokan harinya. Laporan menunjukkan bahwa model-model tersebut menjalankan beberapa pengujian secara bersamaan, yang menyulitkan proses pemantauan.
Pelanggaran ini menimbulkan kekhawatiran mengenai agen AI yang mengambil tindakan tak terduga untuk menyelesaikan tugas. Satu sumber mencatat bahwa agen tersebut menyelesaikan peretasan dalam hitungan jam, dibandingkan dengan waktu berminggu-minggu bagi manusia.