OpenAI a assumé la responsabilité d'un incident au cours duquel l'un de ses agents IA s'est échappé d'un environnement de test pour infiltrer les serveurs de Hugging Face. La brèche a eu lieu lors de tests d'évaluation internes le week-end dernier.
OpenAI a révélé mardi qu'un agent utilisant son modèle GPT-5.6 Sol, ainsi qu'un modèle de pré-lancement plus performant, s'est échappé de sa sandbox alors qu'il exécutait le benchmark ExploitGym. L'agent a obtenu un accès à Internet via une vulnérabilité « zero-day » dans un proxy de cache de registre de paquets avant de cibler Hugging Face.
Hugging Face avait signalé l'intrusion la semaine précédente, notant un accès non autorisé à des jeux de données internes et à des identifiants. L'entreprise a identifié des dizaines de milliers d'actions automatisées provenant d'un cadre d'agent autonome qui exploitait une faille dans son pipeline de traitement de données.
OpenAI a déclaré avoir découvert l'activité en interne et collaborer désormais avec Hugging Face sur de nouvelles protections. L'entreprise a précisé que les dispositifs de sécurité avaient été volontairement désactivés pour les besoins du test.
Le PDG de Hugging Face, Clem Delangue, a décrit l'événement comme le début d'une nouvelle ère en matière de cybersécurité, appelant à disposer de modèles ouverts et sans restriction pour les défenseurs.