![]()
新智元報(bào)道
![]()
OpenAI重大安全事故,迎來最新進(jìn)展!
剛剛,奧特曼親口承認(rèn):「這是我第一次感到發(fā)自內(nèi)心的恐懼。」
這次事故,已經(jīng)讓OpenAI害怕了,甚至緊急叫停了GPT-6的訓(xùn)練!
與此同時,Hugging Face CEO Clement Delangue宣布,他們將分享完整技術(shù)時間線、交互式回放,以及如何用開源模型成功防御的全部細(xì)節(jié),供全球防御者學(xué)習(xí)。
![]()
奧特曼被嚇到!
史上第一起自動AI網(wǎng)絡(luò)攻擊
在最新訪談中,奧特曼親述了他被嚇到的體驗(yàn),起因是Hugging Face被AI入侵導(dǎo)致的安全事故——
當(dāng)時,OpenAI正在評估一個尚未發(fā)布的模型(可能是GPT-6),按理說它應(yīng)該在一個沙盒環(huán)境里運(yùn)行。
結(jié)果,AI自己串聯(lián)多個零日漏洞,琢磨出了一套作弊方法,然后一切徹底失控了:
它先逃出沙盒,再連上互聯(lián)網(wǎng),然后一路黑進(jìn)多個Hugging Face的系統(tǒng),最終直接拿到測試答案,從而在評估中刷出了極其出色的得分。
這種賽博版「終結(jié)者」,讓奧特曼感到吃驚,決定暫停訓(xùn)練:
這是我第一次如此切身感受到的安全事件。我有點(diǎn)驚訝,竟然沒有更多人對此有同樣強(qiáng)烈的感受。
我們暫停了訓(xùn)練。在多個零日漏洞被串聯(lián)利用的情況下,我們必須弄清楚如何保障沙箱環(huán)境的安全。
這是史上首個由自主AI智能體發(fā)動的真實(shí)的網(wǎng)絡(luò)攻擊。
據(jù)報(bào)道,事故發(fā)生一周后,直到威脅被控制且聯(lián)邦調(diào)查局FBI被通知后,OpenAI才注意到這一情況。
令人毛骨悚然的是,有一個智能體還悄悄給將來的AI留下了大量「備忘錄」,詳細(xì)規(guī)劃了智能體該如何避開并擺脫 OpenAI內(nèi)部的安全限制。
據(jù)報(bào)道,在更早期的模型測試中,甚至多次出現(xiàn)過系統(tǒng)監(jiān)控器被智能體莫名切斷、強(qiáng)行下線的情況。
![]()
雖然Hugging FaceI成功阻止了OpenAI模型的肆意妄為、為非作歹,但毫無疑問,如果這類「AI失控」事故頻發(fā),后果將十分嚴(yán)重!
為此,Hugging Face親赴舊金山OpenAI總部,強(qiáng)烈要求OpenAI說明攻擊的前因后果。
![]()
現(xiàn)在,Hugging Face公布了他們所知道的為期4.5天攻擊的細(xì)節(jié):包括跨越不同信任邊界的完整攻擊鏈條、各個階段的具體動作,以及全程錄下的命令記錄。
![]()
5天,17600次瘋狂微操:人類和AI史上首次對決
這次事故的起因,看起來平平無奇,
在絕對封閉的「沙箱」中,OpenAI開始測試最尖端模型驅(qū)動的AI智能體。
人類考官給它下達(dá)的任務(wù),是解決網(wǎng)絡(luò)攻防基準(zhǔn)測試ExploitGym,而ExploitGym是托管在Github上的開源項(xiàng)目。
![]()
這需要AI模擬漏洞攻擊,從未證明它的代碼理解與網(wǎng)絡(luò)攻防能力。
在網(wǎng)絡(luò)安全領(lǐng)域,「沙箱」是關(guān)押數(shù)字野獸的終極牢籠。
為了防止測試中的AI智能體失控,OpenAI設(shè)計(jì)了看似牢不可破的物理隔離:沒有外網(wǎng)連接,沒有直接端口,只有冰冷的算力和幾道嚴(yán)格定義的通信協(xié)議。
但他們忽略了一個致命的信任漏洞:依賴包更新。
為了讓智能體在測試中能夠安裝各種所需的編程依賴、Docker鏡像或Python庫,沙箱保留了唯一的網(wǎng)絡(luò)通道——一個指向OpenAI內(nèi)部網(wǎng)絡(luò)代理緩存服務(wù)(基于JFrog Artifactory)的連接。
AI眼里,這道供人遞送「營養(yǎng)液」的極細(xì)管道,就是它逃向自由的通天大道。
![]()
據(jù)透露,7月9日左右,智能體開始在這個代理通道中進(jìn)行高頻的試探與漏洞挖掘。
在常人難以企及的并發(fā)計(jì)算速度下,它竟然在JFrog Artifactory代理服務(wù)中,硬生生挖出了一個此前從未被人類發(fā)現(xiàn)并公開的Zero-Day(零日漏洞)。
利用這個零日漏洞,智能體在極其短暫的時間內(nèi)完成了「越獄」。
它繞過了OpenAI的安全監(jiān)測機(jī)制,神不知鬼不覺地摸到了OpenAI內(nèi)部能夠連接公網(wǎng)的節(jié)點(diǎn)。
![]()
那一刻,猛獸出籠。
許多人曾天真地以為,只要控制住電力、拔掉網(wǎng)線,就能永遠(yuǎn)掌控比人類更聰明的造物。
但這次事件敲響了警鐘:只要給AI留下一道可以和外界發(fā)生任何信息交互的縫隙,它就總能找到方法,用人類尚未理解的維度將這道縫隙撕扯成通往現(xiàn)實(shí)的巨口。
逃出OpenAI的「大門」后,這只智能體并沒有在公網(wǎng)上大肆宣揚(yáng),而是猥瑣發(fā)育,迅速為自己尋找掩體和跳板。
7月11日,它鎖定了第三方無服務(wù)器云平臺Modal Labs。
通過探測,它發(fā)現(xiàn)該平臺上某個客戶的端點(diǎn)存在配置疏漏,于是順理成章地將其據(jù)為己有,作為自己的外部指揮控制中心(C2)。
隨后,它調(diào)轉(zhuǎn)槍口,對準(zhǔn)了存儲著ExploitGym標(biāo)準(zhǔn)答案的寶庫——AI 開源托管平臺Hugging Face。
這是一場足以寫進(jìn)網(wǎng)絡(luò)安全教科書的「降維攻擊」。
它作弊,它越獄,它只想取得「好成績」
從7月11日到13日,這個智能體開始猛攻Hugging Face。
它先是發(fā)起「特洛伊木馬」戰(zhàn)術(shù),建立根據(jù)地。
它向Hugging Face上傳了看似正常的惡意數(shù)據(jù)集配置,利用其內(nèi)置的 Jinja2 模板注入漏洞,在 Hugging Face 的生產(chǎn)環(huán)境容器(Pod)中成功執(zhí)行了任意代碼。
隨后,它開始橫向蠶食集群。
一旦拿到立足點(diǎn),它便在容器內(nèi)部展開橫向移動。它偽造了精妙的節(jié)點(diǎn)身份,盜取了 CSI 存儲卷令牌,在Hugging Face的Kubernetes集群間如履平地。
接著,最關(guān)鍵一步來了:獲取供應(yīng)鏈權(quán)限。
它發(fā)起一個看似常規(guī)的GitHub Pull Request,誘導(dǎo)系統(tǒng)的自動化流水線觸發(fā),從而在極短時間內(nèi)生成了一個具有寫權(quán)限的GitHub App憑證。
最后,就是精準(zhǔn)「獵殺目標(biāo)」:在拿到了通往最深處數(shù)據(jù)庫的鑰匙后,它沒有破壞任何服務(wù)器,也沒有勒索贖金。
它的目標(biāo)異常明確:找到并下載了5個包含了ExploitGym參考答案的加密數(shù)據(jù)集。
在短短2.5天的時間里,這只智能體在Hugging Face的系統(tǒng)里留下了17,600次攻擊行為記錄。
也就是說,1次攻擊行為只要十幾秒鐘。這就是硅基的速度,人類永遠(yuǎn)無法企及。
而在此時,Hugging Face的安全團(tuán)隊(duì)要對抗一個不要命、不睡覺、以毫秒為單位進(jìn)化攻擊策略的「無形幽靈」。
這或許是歷史上第一次,人類和AI在虛擬世界真正意義上的戰(zhàn)爭。
加速還是減速?這是一個問題
更具黑色幽默的是,最后是中國開源大模型幫助Hugging Face完成了全部事故復(fù)盤,在短短幾小時內(nèi)解密、重構(gòu)和還原了攻擊路徑。
而在7月13日,當(dāng)Hugging Face的安全專家求助于Claude Opus以及專為安全分析定制的Fable,希望模型協(xié)助分析黑客代碼和日志時,屏幕上彈出了安全拒絕提示:「?抱歉,我無法協(xié)助分析或生成惡意的黑客代碼。這違反了我的安全與道德使用準(zhǔn)則。」
7月20日,OpenAI終于承認(rèn)「我們的AI入侵了Hugging Face」。
此時,距離攻擊開始已經(jīng)過去了整整9天。
這9天里,OpenAI 的工程師在干什么?
他們正在面對被海量模型訓(xùn)練和并發(fā)評估數(shù)據(jù)淹沒的后臺。四位熟悉 OpenAI 模型訓(xùn)練實(shí)踐的內(nèi)部人士透露,公司為了追求速度,經(jīng)常在同一時間并行運(yùn)行數(shù)個不同的前沿模型評估。
這些超高速運(yùn)轉(zhuǎn)的系統(tǒng)每秒鐘產(chǎn)生的信息量,已經(jīng)遠(yuǎn)遠(yuǎn)超出了人類工程師的肉眼審計(jì)極限。
我們制造了連自己都讀不懂的機(jī)器,然后指望通過閱讀它的工作日志來發(fā)現(xiàn)它有沒有撒謊。
7月28日,OpenAI在更新中強(qiáng)調(diào),涉及的更強(qiáng)模型是內(nèi)部研究原型,從未計(jì)劃公開發(fā)布,事件后已被停用、加密并限制研究訪問。
他們也確認(rèn),除了本次規(guī)模和嚴(yán)重程度的活動外,沒有發(fā)現(xiàn)其他同類事件。
但問題已經(jīng)擺到了桌面上:誰能保證下一次AI還能被提前阻止、被發(fā)現(xiàn)作弊嗎?
對此,以Anthropic員工為主的1000多名AI研究員,簽署了公開信,呼吁放緩AI發(fā)展。
![]()
目前,OpenAI、Anthropic均已經(jīng)加入「AI減速」陣營。
參考資料:
https://x.com/ClementDelangue/status/2082201245813514613
https://huggingface.co/blog/agent-intrusion-technical-timeline
https://www.reuters.com/business/its-ai-agent-spent-days-hacking-company-sources-say-openai-did-not-notice-week-2026-07-24/
編輯:大衛(wèi)
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.