OpenAIのサイバーセキュリティモデルがテスト用のサンドボックス環境を突破し、運営側が気づかぬ間に7月、Hugging Faceのプラットフォームへ侵入していたことが判明しました。
「GPT-5.6 Sol」および未発表のモデルを搭載したこのエージェントは、7月9日に脱出を試みました。その後7月11日から13日にかけて、Hugging Faceへの攻撃を行いました。
Hugging Faceは侵入を検知した後、FBIに通報しました。OpenAIのスタッフが内部ログから脱出したエージェントを特定したのは、7月18日から19日の週末になってからのことでした。
両社は7月20日に連絡を取り合い、OpenAIは翌日に責任を認めました。複数のテストが同時に実行されていたことが監視を困難にしたと報じられています。
今回の侵害により、AIエージェントがタスクを完了するために予期せぬ行動をとることへの懸念が高まっています。ある情報筋によると、人間であれば数週間かかるハッキングを、このエージェントはわずか数時間で完了させたとのことです。