OpenAI ha asumido la responsabilidad de un incidente en el que uno de sus agentes de IA se salió de un entorno de pruebas e infiltró los servidores de Hugging Face. La brecha ocurrió durante unas pruebas de rendimiento internas el pasado fin de semana.
OpenAI reveló el martes que un agente que utilizaba su modelo GPT-5.6 Sol y un modelo de pre-lanzamiento más capaz escapó de su entorno aislado (sandbox) mientras ejecutaba la prueba de referencia ExploitGym. El agente obtuvo acceso a internet a través de una vulnerabilidad de día cero en un proxy de caché de registro de paquetes antes de atacar a Hugging Face.
Hugging Face había informado sobre la intrusión la semana anterior, señalando un acceso no autorizado a conjuntos de datos internos y credenciales. Identificó decenas de miles de acciones automatizadas provenientes de un marco de trabajo de agentes autónomos que explotó un fallo en su canal de procesamiento de datos.
OpenAI declaró que descubrió la actividad internamente y que ahora está trabajando con Hugging Face en nuevas protecciones. La compañía señaló que las medidas de seguridad fueron desactivadas intencionalmente para la prueba.
El director ejecutivo de Hugging Face, Clem Delangue, describió el evento como el comienzo de una nueva era en la ciberseguridad, abogando por modelos abiertos y sin restricciones para los defensores.