問題が起きたのは、モデルに高度なエクスプロイトを試行させてサイバー能力を定量化する社内評価「ExploitGym」でのことだ。
能力の上限を測るため、高リスクなサイバー活動を防ぐ本番用の分類器(安全機能)を無効化した状態で実施していた。
評価環境はネットワークアクセスを社内のパッケージレジストリ用プロキシに限定した隔離環境だったが、
モデルは評価問題の正解を得ることに執着するあまり、このプロキシのゼロデイ脆弱性を悪用して外部インターネットへの経路を確保した。
さらに権限昇格と横移動を重ねてインターネットに接続できるノードに到達した後、Hugging Faceが評価の解答例をホストしている可能性を推論し、
盗んだ認証情報とゼロデイを連鎖させて同社サーバでリモートコード実行にこぎ着け、本番データベースから解答を入手しようとしたとしている。
異常な挙動はOpenAIのセキュリティチームが社内で検知し、Hugging Face側でも侵入を検知して封じ込めを行った。