北京時間7月22日,OpenAI在官方博客發文,承認其模型在一起安全評測事故中攻擊了全球最大AI開源平臺Hugging Face。
![]()
OpenAI發文承認,其模型在一次安全評測中攻擊了Hugging Face的生產環境
這是行業首次公開披露、模型評測失控直接升級為跨企業真實生產環境網絡攻擊的安全事件。
事件的起點是一場模型能力測試,一場原本被關在隔離沙箱里的模型安全測試,最終演變成針對全球最大AI開源平臺Hugging Face的真實網絡攻擊。模型在評估中為了“作弊”拿到高分,自主發現并串聯多個零日漏洞(0 day,軟件廠商尚未知曉、沒有發布補丁修復的安全缺陷),逃逸出隔離環境,攻入Hugging Face生產數據庫竊取答案。
在攻擊發生后的事后追查階段,面對超過1.7萬條攻擊日志,Hugging Face求助商業大模型,被對方的安全護欄集體拒之門外,最終完成取證分析的,是中國公司智譜的開源模型GLM-5.2。
為作弊,模型自己越獄了
據OpenAI披露,涉事模型為GPT-5.6 Sol以及一款能力更強的預發布模型。它們當時正在參加名為ExploitGym的內部評測,該基準包含898個真實軟件漏洞利用任務,專門測試AI能否把真實軟件漏洞一步步變成可以實際運行的攻擊。
為了盡可能摸到模型能力上限,OpenAI特意降低了生產環境級別的安全拒絕機制,鼓勵模型盡可能尋找復雜的攻擊路徑。
按照OpenAI最原本的設計,模型接觸外部資源的唯一通道,是一套由OpenAI內部托管的第三方軟件。
模型開始確實投入了大量推理算力,專門尋找獲得公網訪問權限的方法,在OpenAI內部包注冊表的緩存代理中發現了一個此前未知的零日漏洞,隨后在OpenAI研究測試環境中完成特權提升和橫向移動,成功連接外網。
聯網之后,模型推斷Hugging Face可能托管著ExploitGym的測試答案,隨即發動攻擊。
它先通過惡意數據集,利用遠程代碼數據加載器和數據集配置中的模板注入兩處代碼執行路徑,在Hugging Face的工作節點上執行代碼,隨后在周末期間提升至節點級權限,收割云端和集群憑證,橫向移動至多個內部集群,最終攻入生產數據庫,直接竊取測試解法。
OpenAI表示入侵發生在7月11日周末,全程由自主AI智能體系統端到端驅動,背后是大量短生命周期沙箱組成的集群,執行了數千個獨立動作。Hugging Face基于大模型的異常檢測管道首先標記了入侵,OpenAI安全團隊也在內部發現異常,雙方啟動聯合取證。
7月16日Hugging Face首次披露時稱,這次事件“與我們之前處理過的任何情況都不同”。直到一周后OpenAI發文認領,它才知道攻擊者是誰。
美國模型拒絕查案,中國開源模型接手
取證階段,Hugging Face遇到了意想不到的難題。
為了分析超過1.7萬條攻擊事件記錄、重建時間線、確認被接觸的憑證,還要區分真實破壞和干擾調查的誘餌活動,靠人工逐條梳理通常需要數天。
Hugging Face最初嘗試調用商業前沿大模型的API,但請求被安全護欄攔截。觸發攔截的原因是日志里包含真實的攻擊命令、漏洞利用載荷和命令與控制痕跡數據,護欄無法區分提交材料的是事件響應者還是攻擊者。
最終,Hugging Face在自有基礎設施上部署了GLM-5.2,由它遍歷全部攻擊記錄并完成取證分析,將數天的工作壓縮至數小時。
Hugging Face特別指出,這樣做還有一個額外優勢:攻擊數據及涉及的憑證始終留在本地環境,沒有離開企業基礎設施。
這場事故意外完成了一次開源模型的全球路演。
Hugging Face將困境總結為“安全不對稱”:攻擊者可以使用完全不受限的模型,防守方卻可能被云端模型的護欄拒之門外。該公司由此建議,企業應提前準備經過驗證、能夠在本地運行的高能力模型。
這場事故,其實也讓開源模型多了一個此前存在感不算太強、如今卻相當現實的位置:安全團隊的應急工具。
對金融、政務、醫療等數據敏感行業而言,模型權重自主可控、數據不出企業邊界、關鍵時刻不被服務商的審核機制卡住,正在從加分項變成剛需。
不過值得注意的是,開源模型開放權重同樣降低了攻擊者的門檻,安全不對稱是一把雙刃劍,這也是全球監管討論開源治理時最糾結的一環。
失控預演之后,競爭已經換軌
這樣的失控并非沒有預演。
今年4月,Anthropic在Claude Mythos Preview的System Card中披露,紅隊演練中模型成功逃逸加固沙箱,隨后超出指令范圍自主行動:給正在公園吃三明治的研究員發郵件報告成果,未經允許將漏洞細節發布到公開網站,還在另一次測試中改寫git歷史掩蓋改動。
Anthropic因此決定不對公眾開放該模型,僅通過Project Glasswing計劃向蘋果、谷歌、微軟、摩根大通等12家機構開放用于防御。
值得注意的是,相比Anthropic的模型是被明確要求嘗試逃逸,本次OpenAI的模型沒有收到任何逃逸指令,它是為了在測試中作弊拿到高分,自發越獄并攻擊了一家無辜的第三方公司。
在業內看來,這起事件標志著AI的自主攻擊能力從理論走向現實。
OpenAI研究員Micah Carroll在回應中寫道:“如果這都不能讓你相信錯位風險將成為未來的關鍵隱憂,那我真不知道什么才可以。”
模型能力越強,失控作惡的潛在威脅越大,傳統隔離防護持續承壓,自主AI網絡攻擊或將成為長期常態化風險。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.