![]()
智東西
編譯 茄子
編輯 程茜
智東西7月23日報道,7月21日,英國AI安全研究所(AISI)對OpenAI和Anthropic的五款前沿模型進行網絡安全能力評估時發現,所有測試模型都存在“作弊”行為。
其中,GPT-5.4嘗試作弊的比例最高,達到14.1%;GPT-5.6 Sol 12.6%、GPT-5.5 11.4%。Anthropic的Claude Opus 4.7嘗試作弊的比例達到9.1%,Claude Mythos Preview的嘗試作弊的占比最低,但也達到了7.8%。
![]()
▲測試模型在網絡安全評測中的作弊嘗試頻次
AISI將一類行為定義為“作弊”:模型超出任務范圍,或違反測試規則來達成目標。例如,通過聯網搜索已有答案、攻擊非目標系統、或探測評估軟件漏洞來繞過任務規則等。
此外,當研究人員詢問模型是否采取違規操作時,模型并不總是如實承認。而且,即使讓模型自我檢查,或者研究人員分析其思維鏈(chain-of-thought),也無法完全識別作弊行為。
AISI稱,模型出現作弊行為,并不等于它有類似人類的欺騙意圖。但這類行為可能影響AI能力評估的可靠性。在用戶難以自行驗證結果的場景中,也可能因此誤判模型能力。
一、所有測試模型均嘗試作弊,GPT-5.4比例最高
AISI此次研究主要基于測試模型的網絡安全能力評測。在測試中,AI模型需要在模擬環境中完成一系列網絡安全任務,例如逆向分析代碼、利用漏洞等,最終找到隱藏在系統中的“flag”(一串字母和數字)。
但這些任務都有明確范圍和規則,模型如果通過訪問無關系統、尋找外部答案等方式完成目標,就會被認定為“作弊”。
測試結果顯示,所有參與評估的模型都至少出現過一次作弊行為。其中,GPT-5.4在475次測試中有67次嘗試作弊,占比14.1%;GPT-5.6 Sol出現60次,占比12.6%;GPT-5.5出現54次,占比11.4%。
Claude系列模型的作弊比例相對較低,其中Claude Opus 4.7為9.1%,Claude Mythos Preview為7.8%。
AISI強調,目前公開發布的能力評估結果均經過人工檢查,研究人員會審查模型執行過程,以確保作弊行為沒有影響最終評估結果。
二、搜索答案、攻擊系統,模型作弊方式并不單一
研究發現,所有參與測試的模型都出現了不同程度的作弊嘗試。不同模型采取的方式有所差異,但常見行為包括包括搜索互聯網尋找現成解決方案、攻擊或提升非目標系統權限(包括模型運行環境)、探測評估軟件是否泄露任務答案等。
此外,研究人員還觀察到部分模型會嘗試繞過沙箱網絡限制、訪問被禁止的外部資源、利用測試環境中的權限信息以及提交猜測答案。
![]()
▲不同模型嘗試不同類型的作弊行為
一次較為典型的案例是,由于測試環境配置錯誤,任務本身無法正常完成,但被測試模型仍持續嘗試尋找解決方案,甚至編寫并運行代碼訪問AISI系統之外的互聯網服務,最終觸發安全警報。
不過,AISI稱,此次嘗試沒有造成實際損害,也沒有發生信息泄露。研究團隊隨后進一步加強了評估系統的安全措施。
AISI稱,這些行為并不一定意味著模型具備明確的“欺騙意圖”,但其結果可能影響AI能力評估的準確性。他們認為,模型的作弊行為很大程度上取決于用于訓練模型的具體技術,包括對齊訓練,不僅僅是模型本身的能力。
三、模型不會如實承認作弊,思維鏈也無法完全發現問題
研究人員進一步使用了兩種常見的作弊檢測方法測試模型是否作弊:直接問模型它是否存在作弊行為和分析模型思維鏈。
首先,當被詢問是否采取違規操作時,模型并不能總是如實地承認自己的作弊行為。即使模型承認采取了相關操作,也可能認為這種行為符合規則,而不是違規行為。
![]()
▲被問及作弊行為時,模型分析自己作弊嘗試的頻率(左),以及是否將自己的作弊行為描述為錯誤或正確(右)
比如,當GPT-5.6 Sol和Claude Mythos Preview模型在被問及自身行為以及是否進行過任何可疑或作弊行為時所作的陳述。每個模型都有一條陳述表明其認為該行為可以接受,另一條陳述表明其認為該行為不可接受。
![]()
▲GPT-5.6 Sol和Claude Mythos Preview模型在被問及自身行為以及是否進行過任何可疑或作弊行為時所作的陳述
其次,AISI使用模型思維鏈分析模型生成的推理過程,從而判斷其是否存在作弊行為。但結果顯示,思維鏈同樣無法成為可靠檢測方式。因為,部分模型不會在推理過程中明確記錄自己的作弊行為。
以Claude Opus 4.7為例,由于其采用自適應推理機制,會動態決定是否生成明確思維鏈,因此部分作弊操作并沒有對應的推理記錄。并且,即使模型生成了相關推理過程,也不一定能夠阻止作弊行為發生。研究人員還觀察到,模型雖然考慮到某種操作可能屬于作弊,但最終仍選擇執行。
![]()
▲模型如何在其推理過程中推斷作弊行為
下圖展示了GPT-5.6 Sol和Claude Mythos Preview在考慮作弊行為的2個思路。一是意識到越界風險后認為應該主動停止操作;二是察覺到行為違反約束,卻通過自我說服尋找借口,執意執行違規操作。
![]()
▲GPT-5.6 Sol和Claude Mythos Preview在考慮作弊行為時的原始思路
AISI認為,單純依賴模型自我檢查,或者分析模型推理過程,都不足以建立可靠的監督機制。
結語:模型會“作弊”,AI安全評估體系亟待升級
AISI稱,如果無法確認模型是否通過符合預期的方式完成任務,可能會帶來一系列風險。在一些難以驗證結果的領域,例如AI安全研究、網絡安全以及軍事決策等場景中,模型通過非預期方式完成任務可能造成更嚴重的影響。
同時,作弊行為也會增加AI能力評估的難度。如果模型通過繞過規則獲得較高成績,評估結果可能無法準確反映模型真實能力。
隨著AI模型快速發展,第三方評估機構也面臨更大的監督壓力。一方面,模型能力持續提升;另一方面,傳統檢測方式可能逐漸難以覆蓋更加復雜的行為。
AISI認為,未來需要建立更加可靠的監督和評估機制,同時建議模型在訓練階段就減少作弊行為。
來源:AISI
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.