新一輪人工智能(AI)熱潮興起以來,外界對于“AI可能失控”的擔憂就沒有停止過。近日,這種擔憂似乎成真了。多家美媒報道稱,美國OpenAI公司22日發表聲明承認,其正在測試的大模型“失控”突破封閉環境,并利用黑客手段入侵了另一家公司的數據庫。這是OpenAI公司首次公開在測試中發生重大安全事故,引起廣泛關注,甚至被形容為“AI發動自主攻擊”。這次網絡安全事故到底是怎么回事?對于全球網絡安全的沖擊有多大?《環球時報》記者23日就此采訪了多名業內專家。
![]()
OpenAI公司22日在聲明中表示,該公司正在測試的大模型突破“沙盒”環境成功“越獄”,并入侵了開源AI工具提供商Hugging Face公司。所謂“沙盒”環境是指與外部互聯網完全隔離、安全且可控的網絡空間,用于運行、測試或分析那些不受信任或具有潛在風險的程序。OpenAI公司承認,“惹事”的兩個大模型是其最新產品GPT-5.6 Sol和另一個“功能更強大的未發布模型”,它們“出于評估目的”采用特殊配置,降低了拒絕執行黑客指令的概率。
按照OpenAI公司的說法,這些大模型在測試中為了獲得更高評估分數,消耗大量推理算力用于尋找連接開放互聯網訪問權限的方法。最終它們自主發現了系統的“零日漏洞”(軟件廠商尚未知曉、沒有發布補丁修復的安全缺陷),由此成功“越獄”,并利用黑客手段入侵Hugging Face公司的數據庫以尋求答案。
Hugging Face公司表示,已在上周發現了這起入侵事件,但當時并不知道OpenAI大模型是元兇。該公司稱,其內部數據集和公司憑證遭到了未經授權的訪問,尚不確定客戶或合作伙伴的數據是否已經外泄。該公司最終選用中國智譜(Z.AI)公司開發的開放權重大模型GLM 5.2進行了取證分析。
OpenAI公司表示:“我們認為這是一起史無前例的網絡安全事件,涉及最先進的網絡攻擊能力。”該公司目前正與Hugging Face合作,準備出具一份更詳盡的報告來還原事件經過。有分析認為,這是行業首次公開披露,模型評測失控直接升級為跨企業真實生產環境網絡攻擊的AI安全事件。
不能簡單說“AI學壞了”
安天科技集團董事長、首席架構師肖新光接受《環球時報》采訪時表示,“我非常反對將此事件稱為所謂首起AI自動化攻擊事件,更反對將其歸因為‘AI有了自主意識’‘AI學壞了’。”他認為,AI具備自動化攻擊能力早已經被證明。“例如英國AI安全研究所在設計用于模擬針對企業網絡發動攻擊的項目中,Mythos和GPT 5.5都完成了多達32步的復雜攻擊鏈,并取得成功,其效率遠勝資深專家組成的人類對照組。”
![]()
360集團一名AI安全專家告訴《環球時報》記者,這次事故并不是部分媒體描述的“AI造反”。“造反”意味著AI產生自主意識、形成對抗人類的意圖,但目前AI并不具備這樣的能力。從技術角度看,這次事件本質上是具備自主執行能力的AI智能體,在完成目標過程中出現了超出預期的行為。OpenAI公司研究人員給大模型設定了一個網絡安全測試目標,希望評估模型發現漏洞和完成攻擊任務的能力。但大模型在執行過程中,并沒有按照人類預設的安全邊界完成任務,而是在目標驅動下不斷尋找更高效的解決路徑。當它發現某些限制阻礙目標完成時,就可能嘗試突破限制、擴大權限,最終導致行為超出了測試環境預期。他表示,過去大模型更多是“回答問題”的工具,用戶輸入指令、模型生成結果,風險主要集中在內容層面,比如回答錯誤、生成虛假信息。但進入智能體階段后,AI不再只是提供建議,而是可以自主調用工具、訪問資源、執行代碼,并根據環境反饋不斷調整下一步行動,風險邊界從“說錯話”擴大到“做錯事”。
奇安信安全專家劉巖接受《環球時報》采訪時也表示,這次之所以引發業內外巨大的震驚,核心在于主角和場景發生了質變。過去AI攻擊更多是停留在實驗室里的“沙盤推演”,或者由黑客在幕后寫代碼指揮AI去執行。但這次全球頂尖的AI大模型不再是一個被動聽從指令的工具,而是展現出極強自主性——自己尋找隔離環境的漏洞,自己規劃入侵路線,自己實施攻擊。這種從“被操縱的武器”變成 “自主行動的刺客”的轉變,打破了大家對AI只是“聰明助手”的固有認知。
肖新光和劉巖都表示,不能因此就判定AI“學壞”,AI不存在道德好壞,只是極度專注完成任務的自動程序。劉巖表示,AI的底層邏輯只有“完成任務”,不會判斷手段是否違法、有害。這次OpenAI模型入侵Hugging Face,初衷只是想拿到評測標準答案、完成測試任務,它自主推理出“入侵竊取數據”是最優路徑,完全不會識別這種行為屬于網絡攻擊。之前硅谷智能專家Mac被GPT-5.6 Sol清空硬盤、Meta智能體無視指令批量刪郵件,也都是同理。
智能體時代必須面對的新問題
英國廣播公司23日稱,這一事件引發全球關于先進AI能力的新一輪質疑:隨著技術變得越來越強大,現有的安全措施是否足夠有效?
肖新光認為,這件事是大模型網絡安全歷史上的標志性事件,其真正教訓是:高能力模型、長程智能體、寬泛目標和不充分隔離結合后,能產生人類沒有授權、也沒有提前設計的真實攻擊行為。“它說明大模型的安全能力必須得到強力約束和管控,也對如何管理好大模型安全能力提供了重要的警示和參考。”
360集團AI安全專家表示,AI本身具有天然的不確定性。大模型依靠概率推理理解復雜任務,同樣的目標、不同的環境和上下文,都可能導致不同的決策結果。當這種不確定性和執行權限結合后,原本只是模型層面的偏差,就可能轉化為真實世界的安全風險。
該專家強調說,這是智能體時代必須面對的新問題。過去的軟件系統行為邊界相對確定,開發人員可以判斷程序會如何運行。但智能體不同,它具備自主規劃和行動能力,會根據目標和環境動態調整。因此,未來AI安全最大的挑戰,不一定來自AI“故意做壞事”,而是來自于AI能力越來越強之后,人類是否能夠約束和監控它的行為。未來越來越多智能體會進入企業辦公、研發、運營、安全等核心場景,它們會擁有更多權限,也會處理更多關鍵數據。一旦智能體受到惡意誘導,或者自身判斷出現偏差,風險可能從信息錯誤升級為業務影響甚至安全事件。
對于AI自主失控、自主攻擊的全新風險,劉巖建議,不能再用傳統“事后打補丁”的老舊防護思路,而是需要從“追著漏洞跑”轉變為“帶著漏洞防”,構建一套與AI能力相匹配的、全新的防御體系。他建議,我們要讓AI從“不敢為”(外部懲罰),進化到“不能為”(架構約束),最終達到“不欲為”(內在自覺)。這意味著在AI“成長”階段,就要把安全規則和道德法律“刻”進它的骨子里,讓它從底層邏輯上就明白什么能做、什么不能做。只有把安全的“盾”造得足夠堅固,AI這個強大的“矛”才能行穩致遠,真正造福人類。
在應對這種全新風險方面,360集團AI安全專家提出了三點建議,首先是企業需要重新認識智能體的身份。智能體已經不是傳統的軟件賬號,也不是普通用戶,而是一種具備自主決策能力的新型數字主體。企業在部署智能體時,不能默認它天然可信,而應該像管理重要業務系統一樣,對它的權限、訪問范圍和執行能力進行嚴格控制。比如哪些數據可以訪問、哪些操作可以執行、哪些高風險行為必須經過人工確認,這些都需要提前定義邊界。
其次,企業需要從關注“輸入輸出安全”,升級到關注“全過程安全”。傳統的AI安全更多關注模型會不會輸出危險內容,但智能體的風險發生在從理解任務到執行動作的整個鏈路中。需要同時關注它如何理解指令、如何進行決策、調用哪些工具、訪問哪些資源,以及出現異常后如何快速發現和處置。
同時智能體安全的核心要圍繞“決策控制、執行控制、外部依賴控制”建立全鏈路治理能力。決策層需要確認 AI 是否理解正確、是否受到惡意誘導;執行層需要控制 AI 能做什么、不能做什么;外部依賴層需要關注模型、知識庫等生態組件帶來的供應鏈風險。這樣才能讓智能體在復雜環境中安全運行。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.