![]()
本文來自微信公眾號: HavenlonLabs ,作者:HavenlonLabs
現在談AI安全,很多人的第一反應都是:怎樣讓模型少犯錯?
減少幻覺、優化提示詞、防止提示詞注入、增加上下文、接入更強的模型,再用另一個Agent檢查前一個Agent。
這些工作當然有價值。
但它們容易讓人產生一種錯覺:只要模型足夠聰明、提示詞足夠完善、檢測系統足夠復雜,AI就可以安全地完成一切。
問題是,AI真的可能永遠正確嗎?
答案恐怕是否定的。
我們無法消滅所有錯誤
AI Agent面對的不是一道標準答案明確的考試題,而是不斷變化的現實環境。
它讀取的郵件可能是偽造的,訪問的網頁可能包含惡意指令,接收到的數據可能已經被污染,用戶給出的任務也可能存在歧義。
即使模型本身沒有受到攻擊,它也可能誤解目標、遺漏條件,或者基于不完整的信息作出一個看起來合理的決定。
我們可以持續提高模型的準確率,卻很難證明它在下一次任務中一定不會犯錯。
試圖讓AI永遠正確,是在追求一個無法驗證的目標;阻止危險結果發生,才是一條可以真正落地的邊界。
真正的問題不是AI會不會犯錯。
它一定會。
真正的問題是:當它犯錯以后,系統是否會毫無阻礙地把這個錯誤執行出去。
模型錯誤不一定等于現實損失
一個AI在聊天窗口里回答錯誤,造成的可能只是一次糟糕的體驗。
但當同一個AI拿到支付接口、管理員權限、數據庫寫入權限和服務器控制權以后,錯誤的性質就完全不同了。
它可能把錢轉給錯誤的地址,刪除重要數據,修改生產環境,擴大成員權限,或者關閉本應保留的審計記錄。
模型只是產生了一個錯誤判斷。
真正把錯誤變成事故的,是后面的執行能力。
模型犯錯只是答案錯了,執行失控才是真的出事。
這也是為什么,AI安全不能只盯著模型內部。
我們當然要防提示詞注入,要提高推理能力,也要檢測惡意輸入。但即使前面的所有防線都失效了,系統仍然應該保留一道最后的底線。
這道底線不負責判斷AI為什么犯錯。
它只負責確認:這件事到底能不能發生。
守住錢袋子,比猜出所有騙子更現實
假設一個AI Agent正在替企業處理付款。
我們可以訓練它識別詐騙郵件,可以要求它核對合同,可以增加一個模型復核收款信息。
但我們無法保證它永遠認得騙子。
騙子會改變話術,郵件賬號可能被入侵,真實員工也可能被冒充。即使多個模型同時參與判斷,它們仍可能基于同一份錯誤信息得出相同結論。
更現實的做法,是直接守住付款的底線:
單筆金額不能超過限制;新收款地址不能立即付款;審批后收款目標不能被替換;超出風險閾值必須經過獨立確認;任何遠程管理員都不能臨時關閉這些規則。
這樣,即使AI被欺騙,損失仍然會被限制。
你不需要保證AI永遠認得騙子,只需要保證騙子無法輕易帶走你的錢。
這就是大道至簡。
前面可以有復雜的模型、提示詞、工作流和檢測系統。
最后只需要一條明確的邊界:
不符合條件,就不執行。
最后的系統不必比AI更聰明
很多人認為,保護AI的安全系統也應該是一套更強大的AI。
但位于最后一道邊界的系統,未必需要理解自然語言,也不需要參與復雜推理。
它只需要知道幾個確定事實:
這次操作要轉多少錢,目標是誰,權限是否發生變化,數據是否可以恢復,風險條件有沒有超限。
這些事實不滿足,就拒絕。
安全不一定要比風險更聰明,它只需要守住風險最終必須經過的那道門。
越靠近最終執行,系統反而越應該簡單、獨立和保守。
因為復雜意味著更多配置、更多依賴、更多攻擊面,也意味著系統可能被前面的同一套錯誤邏輯同時影響。
真正的最后防線,不應該和Agent使用同一個提示詞、同一個上下文、同一套權限,也不應該因為SaaS中有人點擊了“強制執行”就自動失效。
它存在的意義,就是在所有人都認為可以繼續時,依然保留拒絕的能力。
底線應該由人提前決定
當然,底線并不是系統自己創造的。
企業需要提前決定,什么事情絕對不能由AI單獨完成。
可能是一筆超過限額的付款,可能是刪除核心數據庫,可能是修改管理員權限,也可能是讓現實設備進入不可逆狀態。
這些邊界一旦確定,就不應該交給Agent在執行過程中臨時解釋。
真正的安全,不是讓AI在最后一秒重新思考,而是讓人類在風險發生之前提前劃清邊界。
AI可以負責分析、規劃、推薦,甚至完成絕大部分自動化工作。
但越是不可逆、越是高價值、越可能造成現實損失的操作,越需要一道獨立于AI判斷的最終約束。
AI安全的終點,不是把模型訓練成永不犯錯的圣人,而是讓系統在模型犯錯時依然守得住自己的底線。
未來的AI一定會越來越聰明,也會獲得越來越多的工具和權限。
我們沒有必要因為它可能犯錯,就拒絕所有自動化。
但我們也不能因為它越來越強,就默認把最后的決定權一起交出去。
最后想和大家討論一個問題:
對你來說,AI最不能越過的底線是什么——錢、管理員權限、核心數據,還是現實設備的控制權?
本內容由作者授權發布,觀點僅代表作者本人,不代表虎嗅立場。如對本稿件有異議或投訴,請聯系 tougao@huxiu.com。
本文來自虎嗅,原文鏈接:https://www.huxiu.com/article/4876854.html?f=wyxwapp
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.