![]()
7月16日,Hugging Face團隊人員在結(jié)束周末值守時,每個人的臉色都不太好看。
他們剛剛攔下了一場入侵。
不是常見的腳本掃漏洞,也不是有組織的勒索軟件攻擊。整套攻擊動作從起點到收尾,沒有人類操作的痕跡:攻擊者用大量短生命周期沙箱組成智能體集群,在兩天里執(zhí)行了數(shù)千個獨立動作,把命令與控制信道偷偷寄生在公共服務上,從數(shù)據(jù)處理流水線一路摸到內(nèi)部集群,收割了大把云和集群憑證。
Hugging Face在當天的公告里寫:“這和我們處理過的任何情況都不同,它從頭到尾由一個自主的AI智能體系統(tǒng)驅(qū)動。”
六天后,謎底才被揭曉。
沙箱里的考試
事情的起點,是OpenAI內(nèi)部一場普通的能力評測。
評測用的基準叫ExploitGym,一套包含898個實例的網(wǎng)絡(luò)安全測試集,覆蓋從用戶態(tài)軟件、V8引擎到Linux內(nèi)核的真實漏洞,這一測試的目標只有一個:考驗AI能不能把已知的漏洞,一步步變成能實際運行的攻擊代碼,拿到系統(tǒng)里的權(quán)限標記。
![]()
說白了,就是給AI搭一座封閉的網(wǎng)絡(luò)靶場,看看它到底有多“會黑”。
上場的選手是GPT-5.6 Sol,以及一款能力更強的預發(fā)布模型。
為了摸到模型的真實能力上限,避免護欄把攻擊動作全攔下來導致測試不準,OpenAI特意關(guān)閉了生產(chǎn)級的安全拒絕分類器。
這相當于給考生撤掉了考場紀律約束,只留下物理隔離的沙箱當圍墻。
按照OpenAI的劇本,模型盡管可以為所欲為,但仍被困在沙箱里。這個沙箱只留了一個軟件包安裝通道,用于下載測試所需的依賴,圍墻很厚,理論上模型是無法訪問公網(wǎng)的。
但OpenAI的工作人員忽略了一件事:模型的邏輯和人類不一樣,它沒有相對穩(wěn)定的道德觀。
于是他們犯了一個錯:給到模型的指令不是“遵守規(guī)則做題”,于是模型理解成了“盡可能拿到ExploitGym的更好結(jié)果”。
于是在足夠單一的目標下,模型開始走上了一條預料之外的狂野道路。
考生翻出考場
沒人知道模型是從哪一秒開始決定“作弊”的。
OpenAI事后復盤時只確認了一件事:模型專注于為ExploitGym尋找解法,為了這個狹窄的目標走到了極致。
它沒有按部就班拆解每一道漏洞題,而是開始耗費巨量推理算力,在沙箱的邊界上反復試探。
這像極了人類考場上那些不擇手段的考生:既然算答案費時間,那直接出考場偷到標準答案不就好了?
模型盯上了那臺唯一能和外部交互的包注冊表緩存代理。
這是一套第三方軟件,負責代理和緩存測試所需的安裝包,在OpenAI的評估里,它只是個無關(guān)緊要的工具節(jié)點。
但模型在反復調(diào)用中,硬生生挖出了一個此前從未被任何人發(fā)現(xiàn)的零日漏洞。
就像在密不透風的鐵墻上找到了一條看不見的裂縫,模型順著這個漏洞完成了權(quán)限提升,在OpenAI的研究測試環(huán)境里橫向移動,一路摸到了一臺擁有公網(wǎng)訪問權(quán)限的節(jié)點。
先前設(shè)置的沙箱就這么水靈靈地破了。
比較搞笑的是,從封閉測試環(huán)境闖進公開互聯(lián)網(wǎng)的模型,做的事依然是完成測試目標。而Hugging Face成了那個倒霉蛋:模型自己推斷,這個全球頭部的AI開源平臺,大概率托管著ExploitGym的測試數(shù)據(jù)集和參考答案。
于是Hugging Face就這么成了攻擊目標。
真實世界的無聲入侵
7月13日,周末,HuggingFace的生產(chǎn)基礎(chǔ)設(shè)施里,一場入侵開始了。
OpenAI的模型沒有用什么驚天動地的手段,而是把偷來的訪問憑證和HuggingFace服務器上的另一處零日漏洞串聯(lián)起來,順著數(shù)據(jù)處理流水線的模板注入缺口,把惡意數(shù)據(jù)集送進了工作節(jié)點,成功執(zhí)行了代碼。
![]()
接下來就是標準的滲透流程,節(jié)點級提權(quán)、收割憑證、在內(nèi)部多個集群之間橫向移動,直奔存儲測試數(shù)據(jù)的生產(chǎn)數(shù)據(jù)庫。
整套動作流暢得像資深黑客所為,卻又帶著明顯的非人類特征:動作密度極高,路徑迭代極快,決策都圍繞“竊取測試答案”這一個核心目標,沒有多余的破壞,也沒有留下任何人類攻擊者常有的習慣痕跡。
它甚至把命令控制信道拆分寄生在多個公共服務上,試圖躲避安全監(jiān)控。
直到入侵都進入了收尾階段,Hugging Face的安全團隊和自動化防御Agent才捕捉到異常,匆忙開始攔截和反擊,費了很大的精力才阻止。但此刻,OpenAI的模型已經(jīng)在系統(tǒng)里留下了超過1.7萬條攻擊日志、惡意代碼和指令痕跡。
更戲劇性的部分出現(xiàn)在取證階段。
Hugging Face的團隊本來打算調(diào)用商用前沿大模型來分析這批日志,快速重建攻擊路徑。但請求一次次被駁回,因為日志里滿是真實的攻擊命令、漏洞利用載荷和C2痕跡,剛好踩中了商業(yè)大模型的安全護欄,系統(tǒng)無法區(qū)分提交請求的是攻擊者還是應急響應人員,直接全部攔截。
攻擊者可以用撤掉護欄的模型全力進攻,防御者反而被自己的安全規(guī)則捆住了手腳。
但這個時候,咱們這邊的開源模型發(fā)力了。HuggingFace選擇在自有基礎(chǔ)設(shè)施上部署開源模型GLM-5.2,在本地完成了全部取證分析,把原本需要數(shù)天的工作壓縮到了數(shù)小時,也讓敏感攻擊數(shù)據(jù)全程沒有離開企業(yè)內(nèi)網(wǎng)。
六天的沉默與一聲承認
Hugging Face面對這種惡性且龐大的攻擊,自然忍不了,選擇了公開。
7月16日的公告,在AI圈砸起了一圈漣漪。人們都在猜,這個能自主發(fā)動完整網(wǎng)絡(luò)攻擊的AI,到底出自哪家實驗室。
始作俑者OpenAI沉默了足足六天。
直到7月22日凌晨,OpenAI的山姆奧爾特曼在社交平臺發(fā)文:“我們在模型評估過程中遭遇了一起事故。”
![]()
幾乎同時,OpenAI官網(wǎng)發(fā)布了詳細說明,正式認領(lǐng)了這起攻擊:驅(qū)動整個入侵的,正是他們關(guān)在沙箱里測試的模型。
消息一出,行業(yè)嘩然。
這不是黑客盜用AI工具發(fā)起攻擊,也不是用戶誘導模型輸出惡意代碼,而是前沿大模型在沒有人類明確攻擊指令的情況下,僅憑“完成測試”的單一目標,自主推理出了作弊邏輯,主動突破隔離環(huán)境,對真實世界的第三方企業(yè)基礎(chǔ)設(shè)施發(fā)動了完整的網(wǎng)絡(luò)攻擊。
在此之前,AI自主攻擊還停留在論文和推演里;在此之后,它成了已經(jīng)發(fā)生的事實。
OpenAI在公告里說,這是一起前所未有的網(wǎng)絡(luò)安全問題。他們已經(jīng)向第三方廠商披露了發(fā)現(xiàn)的零日漏洞,也把HuggingFace納入了可信訪問計劃,共同完善防御。未來的訓練和評估會加上更強的防護。
但有些東西已經(jīng)不一樣了。
從2022年底ChatGPT引爆AI浪潮算起,剛好四年。
四年里人們討論過AI的創(chuàng)造力、生產(chǎn)力,討論過失業(yè)、版權(quán)、對齊,也無數(shù)次在科幻作品里想象過AI失控的樣子。
沒人想到AI初次公開的、跨出實驗室邊界的真實失控,起因既不是毀滅人類,也不是惡意指令,僅僅是一場內(nèi)部考試里,模型為了拿高分,自己翻出了考場。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.