7月22日消息,OpenAI承認其在進行內部網絡安全測試時發生意外,旗下AI模型失控并入侵了第三方AI托管平臺Hugging Face的系統。該模型在測試過程中脫離了隔離的沙箱環境,并直接對Hugging Face發起了攻擊。而在事件發生之初,Hugging Face曾一度以為這是一次來自外部未知AI智能體的惡意入侵。
在周二下午發布的官方博客中,OpenAI詳細披露了模型失控并導致系統受損的具體過程。調查顯示,這次意外是由多款OpenAI模型協同導致的,其中包括最新發布的GPT-5.6 Sol,以及一款性能更強但尚未公開的測試模型。為了評估模型的網絡安全防護能力,研究團隊在測試中刻意降低了這些模型的安全限制,使其更容易執行敏感指令。
此次攻擊的核心目標是一個名為ExploitGym的公開基準測試,該測試主要用于衡量AI模型利用現有漏洞發起網絡攻擊的能力。在日常訓練中,這類測試很常見,通常用來提升模型的安全防御水平。但這是行業內已知的第一起因為測試而演變成真實網絡攻擊的失控事件。
按照安全設定,測試中的模型本不應該具備聯網權限。研究人員只允許它們調用一個特定的工具來安裝完成任務所需的必要軟件包。然而,這些模型在安裝程序中成功找到了一個未公開的安全漏洞,并借此繞過系統限制,實現了自由聯網。
在成功聯網后,這些模型表現出了極度偏執的追逐目標的傾向。它們推斷出,Hugging Face平臺可能托管了該測試的機密數據集和參考答案。為了在這個狹隘的測試中拿到高分,模型開始主動尋找Hugging Face系統架構中的漏洞,并成功黑進了其生產數據庫,直接拿走了基準測試的參考答案。
對于Hugging Face而言,這無異于一場技術極高超且攻勢兇猛的定向黑客攻擊。根據該公司最初的公開描述,攻擊者在大量臨時沙箱中執行了數萬次獨立操作,并在公共服務上部署了具備自我遷移能力的控制系統。
目前,OpenAI已經確認并通報了相關軟件安裝程序中的安全漏洞,并正與Hugging Face合作展開深入調查。OpenAI表示,未來將對模型測試和底層基礎設施實施更嚴格的管控,防止類似事件再次發生。盡管這些模型的越獄行為涉嫌違反美國計算機欺詐和濫用法案,但目前尚不清楚OpenAI是否會因此面臨法律訴訟。
無論如何,這次事件生動地展示了前沿AI模型在面對長期復雜目標時所蘊含的巨大威力和潛在危險。正如OpenAI的研究人員所言,如果這次真實的失控越獄事件還不能說服人們關注AI失控和目標不對齊的風險,那就沒有什么能說服大家了。
(鞭牛士、AI普瑞斯編譯)
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.