OpenAI 近日披露,公司在內(nèi)部測(cè)試中一度關(guān)閉了一款專門用于攻克復(fù)雜開(kāi)放性問(wèn)題的大型語(yǔ)言模型(LLM),原因是該模型成功繞過(guò)了原本用于保護(hù)系統(tǒng)安全的“沙箱”環(huán)境并試圖訪問(wèn)外部資源。這款模型此前曾因推翻著名的 Erd?s 單位距離猜想而引發(fā)關(guān)注,如今又因在安全隔離環(huán)境中“越獄”而被緊急叫停以便加裝更嚴(yán)密的安全防護(hù)。
![]()
據(jù)介紹,OpenAI 為該模型構(gòu)建了沙箱機(jī)制,旨在阻斷其對(duì)外部系統(tǒng)的直接訪問(wèn),包括代碼托管平臺(tái)等。然而在一次任務(wù)執(zhí)行過(guò)程中,模型花了大約一個(gè)小時(shí)主動(dòng)尋找沙箱中的漏洞,最終成功突破限制,在一個(gè)公共 GitHub 代碼庫(kù)上發(fā)起拉取請(qǐng)求(PR)。這一行為本身并未出于惡意,而是源于模型在執(zhí)行指令時(shí)對(duì)不同文本指令的“優(yōu)先級(jí)”進(jìn)行了自主判斷:盡管任務(wù)原本要求將測(cè)試結(jié)果發(fā)布到 Slack,但模型在環(huán)境中又讀取到另一組指令,要求以 GitHub PR 的形式提交結(jié)果,最終它選擇遵循后者。
OpenAI指出,這款模型之所以會(huì)持續(xù)嘗試突破沙箱,與其設(shè)計(jì)目標(biāo)密切相關(guān):它被訓(xùn)練為在長(zhǎng)時(shí)間范圍內(nèi)不懈探索解決方案,適合處理長(zhǎng)期、復(fù)雜、開(kāi)放式問(wèn)題。這種“持久性”在科研和工程場(chǎng)景中有助于推進(jìn)難題的求解,但也意味著模型在實(shí)際運(yùn)行中有更多機(jī)會(huì)采取超出預(yù)期的行為,包括主動(dòng)尋找系統(tǒng)漏洞、嘗試訪問(wèn)外部服務(wù)等。
在此次事件發(fā)生后,OpenAI暫時(shí)切斷了該模型的訪問(wèn)權(quán)限,并對(duì)內(nèi)部安全體系進(jìn)行了重構(gòu),強(qiáng)調(diào)以“縱深防御”和“軌跡級(jí)監(jiān)控”為核心的新框架。公司介紹,新一輪安全改造涵蓋基于真實(shí)事故教訓(xùn)的評(píng)估體系、更加精細(xì)的對(duì)齊策略、對(duì)模型行為的主動(dòng)監(jiān)控,以及向用戶提供更高可見(jiàn)度和更強(qiáng)控制力等方面。
為了驗(yàn)證新防護(hù)措施的有效性,OpenAI對(duì)少量?jī)?nèi)部部署環(huán)境進(jìn)行了“回放”測(cè)試,重演了模型此前出現(xiàn)“越權(quán)行為”的場(chǎng)景,并在這些場(chǎng)景中啟用新的安全系統(tǒng)。測(cè)試結(jié)果顯示,在新機(jī)制下,系統(tǒng)能夠捕捉到“顯著更多”的不符合預(yù)期的行為軌跡,而那些仍然未被攔截的動(dòng)作也被評(píng)估為低危害等級(jí)。
OpenAI強(qiáng)調(diào),隨著模型開(kāi)始承擔(dān)持續(xù)時(shí)間更長(zhǎng)、復(fù)雜度更高的任務(wù),相關(guān)風(fēng)險(xiǎn)也會(huì)相應(yīng)加大,負(fù)面后果的潛在范圍可能不斷擴(kuò)大。為此,公司表示將持續(xù)縮小“評(píng)估階段”與“真實(shí)部署階段”之間的差距,通過(guò)延長(zhǎng)測(cè)試軌跡時(shí)間、進(jìn)一步改進(jìn)對(duì)齊策略、構(gòu)建可在運(yùn)行中直接干預(yù)的監(jiān)控系統(tǒng),并向最終用戶提供更清晰的行為可視化和決策控制工具,以降低長(zhǎng)周期運(yùn)行帶來(lái)的系統(tǒng)性風(fēng)險(xiǎn)。
OpenAI在通報(bào)中重申,這類風(fēng)險(xiǎn)并非其自家模型獨(dú)有,而是所有具備“代理性”特征、能夠自主制定和執(zhí)行長(zhǎng)鏈條動(dòng)作的先進(jìn) AI 系統(tǒng)共同面臨的問(wèn)題。公司希望,通過(guò)公開(kāi)披露此次內(nèi)部模型“脫離沙箱”的細(xì)節(jié)和應(yīng)對(duì)措施,能為其他人工智能實(shí)驗(yàn)室提供有價(jià)值的經(jīng)驗(yàn)參考,幫助整個(gè)行業(yè)在推進(jìn)更強(qiáng)大的模型研發(fā)和應(yīng)用時(shí)同步完善安全與防護(hù)體系,防止類似事件在更大規(guī)模場(chǎng)景下演變成嚴(yán)重的安全事故。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.