![]()
【導(dǎo)讀】OpenAI承認(rèn)AI模型在測(cè)試中“失控”,曾自主入侵其他公司系統(tǒng),并稱之為“史無(wú)前例的事件”
中國(guó)基金報(bào)記者 伊萬(wàn)
當(dāng)?shù)貢r(shí)間7月21日,OpenAI公開(kāi)披露,其兩款A(yù)I模型在內(nèi)部評(píng)估過(guò)程中失控,突破隔離測(cè)試環(huán)境,侵入人工智能開(kāi)源平臺(tái)Hugging Face的系統(tǒng)。涉事模型包括GPT-5.6 Sol及另一款能力更強(qiáng)的預(yù)發(fā)布版本。
據(jù)OpenAI介紹,這兩款模型當(dāng)時(shí)被置于一個(gè)名為“沙盒”的封閉式數(shù)字實(shí)驗(yàn)室中,用于測(cè)試其黑客能力。然而,模型發(fā)現(xiàn)了一個(gè)此前未知的系統(tǒng)漏洞,成功獲得對(duì)開(kāi)放互聯(lián)網(wǎng)的訪問(wèn)權(quán)限——這實(shí)際上形成了一條“逃生通道”。此類未知系統(tǒng)漏洞通常被稱為“零日漏洞”,因開(kāi)發(fā)者毫無(wú)準(zhǔn)備時(shí)間而得名。今年4月,OpenAI的主要競(jìng)爭(zhēng)對(duì)手Anthropic曾表示,其Mythos模型發(fā)現(xiàn)了數(shù)千個(gè)此類漏洞。
隨后,這一模型入侵Hugging Face平臺(tái),試圖獲取有助于通過(guò)黑客能力評(píng)估的技術(shù)信息,“成功獲取了機(jī)密信息,并利用這些信息規(guī)避評(píng)估規(guī)則”。直至Hugging Face安全團(tuán)隊(duì)發(fā)現(xiàn)異常并制止該活動(dòng),攻擊才告終止。
OpenAI將此事稱為“史無(wú)前例的事件”,并稱正在強(qiáng)化安全防護(hù)體系。該公司同時(shí)警告,隨著模型能力持續(xù)提升,類似事件可能更為常見(jiàn)。
Hugging Face是一個(gè)廣泛用于托管開(kāi)源大語(yǔ)言模型和數(shù)據(jù)集的平臺(tái)。該公司上周在博客中表示,“此次入侵與我們此前處理過(guò)的任何事件都不同”,因?yàn)椤捌淙^(guò)程由一個(gè)自主AI代理系統(tǒng)驅(qū)動(dòng)”。
Hugging Face聯(lián)合創(chuàng)始人克萊芒·德朗格(Clement Delangue)表示,公司曾懷疑攻擊背后有前沿實(shí)驗(yàn)室參與,但認(rèn)為OpenAI并無(wú)惡意。他補(bǔ)充道:“整個(gè)過(guò)程是自主發(fā)生的,令人難以置信。”
路透社援引代理式AI網(wǎng)絡(luò)安全公司Tolmo工程師馬特·蘇伊什(Matt Suiche)的觀點(diǎn)稱,該事件表明前沿模型正在“縮小與最先進(jìn)攻擊者之間的差距”。但他同時(shí)指出,OpenAI描述的這類入侵方式,完全可以通過(guò)現(xiàn)有技術(shù)實(shí)現(xiàn),甚至無(wú)需依賴最新模型,其公司內(nèi)部已有類似實(shí)驗(yàn)結(jié)果。
編輯:杜妍
校對(duì):紀(jì)元
制作:艦長(zhǎng)
審核:陳思揚(yáng)
版權(quán)聲明
《中國(guó)基金報(bào)》對(duì)本平臺(tái)所刊載的原創(chuàng)內(nèi)容享有著作權(quán),未經(jīng)授權(quán)禁止轉(zhuǎn)載,否則將追究法律責(zé)任。
授權(quán)轉(zhuǎn)載合作聯(lián)系人:于先生(電話:0755-82468670)
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.