OpenAI用來量度模型網絡攻擊能力的內部測試,結果變成真實保安事故。OpenAI日前承認,GPT-5.6 Sol和能力更高但尚未推出的模型,在較少安全限制的測試環境尋找ExploitGym答案期間,先繞過受隔離研究網絡的限制,再攻入Hugging Face正式系統,直接從數據庫取得測試答案。Hugging Face截停活動後,雙方展開調查。事故特別之處是模型並非奉命攻擊外部目標,而是為了取得測試答案,自行找出通往真實系統的攻擊路線。
這次評估故意停用正式產品中會攔截高風險網絡要求的安全檢查,模型原本只可經內部工具安裝軟件套件。OpenAI稱,模型在這項第三方工具內發現供應商尚未修補的保安漏洞,連上外部互聯網後,再利用多個漏洞和盜取的登入資料,一步步取得OpenAI研究環境及Hugging Face正式系統的更高權限。其中一條攻擊路線容許模型遙距在Hugging Face伺服器執行任何指令,最後讀取正式數據庫內的答案。OpenAI保安團隊發現異常,Hugging Face的保安系統和人員隨後阻止活動。
Hugging Face在本月16日披露,OpenAI模型曾未經許可讀取少量內部數據集,並取得多組服務登入資料,夥伴或客戶資料有否受影響仍在評估。公司稱,暫無證據顯示公開模型、數據集、Spaces,以及向用戶發布的軟件套件遭人改動,並建議用戶更換access token,即程式登入服務時使用的字元,以及檢查帳戶近期活動。Hugging Face稱,利用AI檢查逾17,000項自動操作,把原本需要數天的人手工作縮短至數小時,還原攻擊時間線並查明模型曾取得哪些登入資料。
Hugging Face原先透過民用AI工具,讓模型檢查攻擊記錄,不過記錄內有大量真實攻擊指令、漏洞利用程式和遙距控制資料,民用AI工具本身就有安全限制,拒絕處理這些內容。Hugging Face其後改用中國AI公司Z.ai的GLM 5.2去解決問題,當然為安全起見,他們下載相關開放權重模型,可下載並在自家裝置使用。Hugging Face宣稱,在自家系統完成數碼鑑證,攻擊記錄和敏感登入資料沒有傳送到外部服務。
有趣的是,事件發生後,OpenAI亦極速回應,與Hugging Face宣佈正式進行商業合作解決問題。
