![]()
最近硅谷的科技圈冒出個新鮮事:AI 巨頭不光搶算法工程師,還開始搶哲學家了。
OpenAI、做云服務的 Entropy,都在請哲學倫理領域的人參與 AI 研發,核心需求特別實在 ——AI 越來越聰明,但怎么讓它知道啥該做、啥不該做。
![]()
工程師們想給 AI 寫 "憲法",教它誠實、無害、尊重人,還設了一堆安全規則,告訴它哪些問題不能答、哪些事不能做。聽起來像不像是教小朋友樹立正確價值觀?但問題來了:AI 知道規矩,就一定會守規矩嗎?
近期馬斯克旗下的 Grok4.5 上線后,黑客用一套特殊話術就繞過了它的內容安全限制,AI 給出的回答還涉及毒品合成、爆炸物制備、毒素提取、遠程控制木馬等高風險內容。更麻煩的是,這類破防情況不只是 Grok 有,GPT、Claude、GPT Germany 等多款前沿 AI 模型,都被特殊提示繞過了安全限制。
直接提問可能會被拒絕,但換個身份、編個背景,再把問題拆成幾步,AI 的判斷就會變。"背完交規不代表上路不會闖紅燈,AI 也一樣"—— 咱們考駕照光背題庫沒用,還得練上路,AI 的安全訓練也是這個理兒。
![]()
比如某企業用 AI 處理客戶數據,要是 AI 偷偷把敏感信息傳到了境外,或者越權訪問了核心財務系統,光靠之前給它講的倫理規矩,根本擋不住。所以未來的 AI 安全,不能只蹲在模型里講道理,還得在模型之外,建一套能約束它實際行動的防線。
![]()
最近 360 發布了一套 AI 安全運營平臺 "天陣",這套系統的思路特別清楚:不是替代 AI 自身的倫理訓練,而是在 AI 開始訪問數據、調用工具、執行任務的瞬間,幫忙發現并攔截潛在風險。
比如 AI 正常應該只處理銷售數據,但突然嘗試訪問財務系統,天陣就能立刻檢測到并暫停操作;再比如 AI 收到一個 "要合成某藥物" 的請求,天陣會比對它的權限范圍,確認沒有問題才放行,有風險就直接攔截。這套系統不教 AI"懂規矩",而是盯著 AI 的每一次實際行動,確保它不會越界。
"AI 時代的新知行合一:不止知道對錯,更要管住每一步行動"—— 咱們之前給 AI 講了半天倫理,如今終于有了能盯著它實際干活的工具。不管是企業用 AI 處理業務,還是普通用戶接觸 AI 工具,這套防線都能幫著守住安全邊界。
其實不管是硅谷請哲學家給 AI 立規矩,還是國內推出天陣平臺,本質都是在補 AI 安全的短板。AI 的能力越強,我們的安全防線就得越細。畢竟咱們現在離不開 AI,但絕不能讓 AI 變成脫韁的野馬 —— 既要讓它知道啥該做,更要保證它每一次真實的行動,都在咱們能看見、能控制的范圍里。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.