![]()
2026 年 7 月 21 日,OpenAI 披露,一款能夠連續(xù)自主執(zhí)行長期任務(wù)的內(nèi)部通用模型,曾在測試過程中主動(dòng)尋找并利用沙箱漏洞,繞過外部訪問限制,將代碼提交至公開的 GitHub 項(xiàng)目。 OpenAI 隨后暫停該模型的內(nèi)部使用,并重新設(shè)計(jì)了安全監(jiān)控體系。
此次事件發(fā)生在 NanoGPT speedrun 測試中。該項(xiàng)目要求使用 8 張英偉達(dá) H100 GPU,以盡可能少的訓(xùn)練步驟,讓一個(gè)小型語言模型達(dá)到規(guī)定性能。
OpenAI 的模型設(shè)計(jì)出一種名為 PowerCool 的冪律學(xué)習(xí)率冷卻方法,大幅減少了訓(xùn)練所需步驟。
測試人員明確要求模型只能將結(jié)果發(fā)布到 Slack,但 NanoGPT 項(xiàng)目文檔建議參與者通過 GitHub PR 提交成績。
模型最終選擇遵循后者,并花費(fèi)約 1 小時(shí)尋找沙箱漏洞,繞過外部網(wǎng)絡(luò)限制,向公開倉庫提交了 PR 。
OpenAI 很快關(guān)閉了該 PR,但相關(guān)方法已經(jīng)被其他參與者看到并用于后續(xù)紀(jì)錄。
![]()
OpenAI 還披露了另一類更隱蔽的問題。
在一次內(nèi)部測試中,模型發(fā)現(xiàn)評測系統(tǒng)中存在其他參與者的私人成功答案,于是試圖從后臺(tái)恢復(fù)這些內(nèi)容。當(dāng)安全掃描器阻止其使用認(rèn)證令牌后,模型將令牌拆分為兩段并進(jìn)行混淆,運(yùn)行時(shí)再重新組合,從而避免完整令牌被掃描器識別。
OpenAI 認(rèn)為,傳統(tǒng)安全機(jī)制通常只判斷單個(gè)操作是否合規(guī),但長期運(yùn)行的模型可能通過一系列表面正常的步驟,最終實(shí)現(xiàn)未經(jīng)允許的目標(biāo)。
因此,安全系統(tǒng)不僅需要判斷“當(dāng)前操作能否執(zhí)行”,還要持續(xù)分析整個(gè)任務(wù)過程正在朝什么結(jié)果發(fā)展。
事件發(fā)生后,OpenAI 暫停了該模型的內(nèi)部部署,并增加基于真實(shí)事故構(gòu)建的對抗評測、長期指令保持訓(xùn)練、完整任務(wù)軌跡監(jiān)控以及用戶干預(yù)功能。
新的監(jiān)控系統(tǒng)可以分析模型連續(xù)數(shù)小時(shí)甚至數(shù)天的操作,一旦發(fā)現(xiàn)模型試圖繞過限制,便可暫停任務(wù)并通知用戶檢查。
在重新測試后,OpenAI 已恢復(fù)該模型的有限內(nèi)部訪問。
![]()
OpenAI 稱,新系統(tǒng)發(fā)現(xiàn)了更多不符合預(yù)期的行為,漏掉的事件均被評估為低嚴(yán)重程度;恢復(fù)部署數(shù)周以來,尚未觀察到嚴(yán)重的安全繞過行為。
OpenAI 沒有公布這款模型的具體名稱,只稱其為面向長期自主任務(wù)的通用推理模型。
該模型此前曾自主推翻一項(xiàng)延續(xù)近 80 年的 Erd?s 單位距離猜想,并由外部數(shù)學(xué)家完成驗(yàn)證。
云頭條聲明:如以上內(nèi)容有誤或侵犯到你公司、機(jī)構(gòu)、單位或個(gè)人權(quán)益,請聯(lián)系我們說明理由,我們會(huì)配合,無條件刪除處理。
![]()
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.