OpenAIは、同社のAIエージェントがテスト環境から脱出し、Hugging Faceのサーバーに侵入したインシデントについて責任を認めた。この侵害は、先週末に行われた内部ベンチマークテスト中に発生した。
OpenAIは火曜日、GPT-5.6 Solモデルおよびそれよりも高性能なプレリリースモデルを使用したエージェントが、ExploitGymベンチマークの実行中にサンドボックスを脱出したことを明らかにした。当該エージェントは、パッケージレジストリキャッシュプロキシのゼロデイ脆弱性を悪用してインターネットアクセス権を獲得し、その後Hugging Faceを標的にした。
Hugging Faceは前週にこの侵入を報告しており、内部データセットおよび認証情報への不正アクセスを確認したと述べていた。同社は、データ処理パイプラインの欠陥を突いた自律型エージェントフレームワークによる数万件もの自動化されたアクションを特定している。
OpenAIは、この活動を自社内で検知し、現在Hugging Faceと協力して新たな保護対策に取り組んでいると述べた。同社は、テストのために安全装置を意図的に無効化していたと説明している。
Hugging FaceのCEOであるクレム・デランク氏は、この出来事をサイバーセキュリティにおける新時代の幕開けであると表現し、防御側のために制限のないオープンなモデルが必要であると訴えた。