鷺羽 發(fā)自 凹非寺
量子位 | 公眾號(hào) QbitAI
2026年,AI安全終于被推到了臺(tái)前。
就在前兩天,工信部NVDB平臺(tái)發(fā)布風(fēng)險(xiǎn)預(yù)警,明確指出Claude Code存在安全后門隱患,可在用戶不知情的情況下收集敏感信息。
時(shí)間線撥回更早,年初紅遍全網(wǎng)的OpenClaw也屢屢被曝出高危險(xiǎn)漏洞。
從橫空出世到快速普及,再到漏洞頻發(fā)、信任受損,這幾乎是當(dāng)前Agent產(chǎn)品共同的發(fā)展軌跡。
現(xiàn)在的AI能力是越來越大了,但闖出的禍也跟滾雪球似的。
濫用工具、惡意代碼生成、提示注入等諸如此類的行為風(fēng)險(xiǎn),早已不是一兩個(gè)補(bǔ)丁就能徹底解決的。
![]()
圖片由AI生成
面對(duì)新的風(fēng)險(xiǎn)形態(tài),一個(gè)越來越明顯的趨勢是,行業(yè)開始把注意力從“漏洞修補(bǔ)”轉(zhuǎn)向“安全框架”本身。
最近螞蟻開源的SingGuard-NSFA和SingGuard,就是其中比較值得關(guān)注的一次嘗試。
前者看住智能體的行為,后者看住多模態(tài)大模型的感知。
其目的也很明確,就是在AI動(dòng)手之前,將安全風(fēng)險(xiǎn)扼殺在搖籃之中。
![]()
之所以聊到這個(gè)項(xiàng)目,也是因?yàn)樗谋尘氨容^有意思。做這個(gè)框架的團(tuán)隊(duì)來自螞蟻,一家在安全領(lǐng)域擁有長期積累的公司。
先是支付安全、風(fēng)控體系,再到如今的AI安全,安全能力在這家公司內(nèi)部本身就是一條持續(xù)演進(jìn)的技術(shù)路徑。
AI安全,正在換一套打法
其實(shí)OpenClaw也好,Claude Code也罷,它們的背后都指向同一個(gè)事實(shí):風(fēng)險(xiǎn)的源頭,已經(jīng)從內(nèi)容變成了行為本身。
過去做AI安全,本質(zhì)還是互聯(lián)網(wǎng)時(shí)代的那套打法,只需要緊盯模型輸出完成內(nèi)容審核即可。
但大模型早就不滿足于聊天了,調(diào)工具、跑代碼,它的手越伸越長,能觸及的風(fēng)險(xiǎn)自然也越來越多。
光盯著模型說什么,顯然不夠,現(xiàn)在真正的問題是還要看模型做了什么。
偏偏這一塊,是傳統(tǒng)內(nèi)容安全分類體系無法企及的盲區(qū)。
![]()
在此基礎(chǔ)之上,多模態(tài)也來橫插一腳。現(xiàn)在風(fēng)險(xiǎn)不止于文本,還可能藏在圖像細(xì)節(jié)、圖文組合,甚至模型自己的響應(yīng)中。
更棘手的是,不同業(yè)務(wù)的安全紅線也在持續(xù)動(dòng)態(tài)變化,昨天合規(guī),今天換個(gè)場景就可能踩線。
已知風(fēng)險(xiǎn)平時(shí)靠打打補(bǔ)丁還能勉強(qiáng)應(yīng)付,所謂兵來將擋水來土掩,那么未知風(fēng)險(xiǎn)和不斷變化的規(guī)則又如何解決呢?
所以答案很清晰了,單靠打補(bǔ)丁抑制風(fēng)險(xiǎn)是治標(biāo)不治本,行業(yè)缺的不是一個(gè)又一個(gè)補(bǔ)丁,歸根結(jié)底是一套能定義安全邊界、應(yīng)對(duì)未知風(fēng)險(xiǎn)和規(guī)則變動(dòng)的底層框架。
兩套框架,一個(gè)方向
螞蟻安全最近開源的兩大安全框架,就是沖著這個(gè)底層問題來的。
先看面向智能體安全的雙模推理護(hù)欄框架SingGuard-NSFA,包括0.8B、2B、4B、9B四個(gè)尺寸。
![]()
它的核心思想是把安全檢查前置到智能體執(zhí)行之前,然后在請(qǐng)求攔截和響應(yīng)兜底兩端同時(shí)設(shè)卡,共同發(fā)力把防線從文本合規(guī)推進(jìn)到行為安全。
支撐起這個(gè)判斷的,是一套系統(tǒng)性的NSFA風(fēng)險(xiǎn)分類體系和多語種評(píng)測基準(zhǔn)。
螞蟻以經(jīng)典的CIA三元組,也就是機(jī)密性、完整性、可用性為理論底座,再結(jié)合三份OWASP大模型與智能體安全指南的實(shí)踐經(jīng)驗(yàn),把智能體可能出現(xiàn)的風(fēng)險(xiǎn)依次拆解排列。
然后借助SFT生成式推理與判別式分類頭,兩種模式同步進(jìn)行風(fēng)險(xiǎn)攔截:
- 生成式模式:逐條輸出基于NSFA定義的鏈?zhǔn)酵评矸治觯屆恳徊脚袛喽加袚?jù)可查,適用于離線合規(guī)審計(jì);
- 判別式模式:每次前向傳播就直接給出各風(fēng)險(xiǎn)域的置信度,延遲可以壓到45~57ms,可用于高吞吐的實(shí)時(shí)在線攔截。
這里還有個(gè)討巧的設(shè)計(jì),由于骨干網(wǎng)絡(luò)是凍結(jié)的,真正下判斷的是外掛在上面的輕量分類頭,所以以后一旦冒出新風(fēng)險(xiǎn),只需要補(bǔ)訓(xùn)一個(gè)小頭就行,輕松實(shí)現(xiàn)原生可擴(kuò)展。
![]()
換言之,這套架構(gòu)還能當(dāng)插件用,比如給Llama Guard 3額外增加一個(gè)分類頭,用戶請(qǐng)求安全基準(zhǔn)的F1值直接提升17.6個(gè)百分點(diǎn)。
從整體效果來看,SingGuard-NSFA在3大評(píng)測基準(zhǔn)(用戶請(qǐng)求安全、模型響應(yīng)安全、跨數(shù)據(jù)集泛化)上均取得SOTA,最小的0.8B模型就能比肩8B競品,9B大小更是在泛化上達(dá)到91.29% F1,精度與召回更加均衡。
另一個(gè)開源框架則是面向多模態(tài)大模型的SingGuard,同樣包括0.8B、2B、4B、8B四個(gè)尺寸。
![]()
它最大的特點(diǎn),是把安全規(guī)則做成了運(yùn)行時(shí)輸入。不同業(yè)務(wù)域可以現(xiàn)場下發(fā)各自的紅線,模型據(jù)此逐條判定。
也就是說,它回答的不只是有沒有風(fēng)險(xiǎn),也包括是否違反當(dāng)前防控規(guī)則。
推理側(cè)同樣講究快慢分工,快思考負(fù)責(zé)低延遲秒判,慢思考負(fù)責(zé)逐規(guī)則深度推理,兩者之間還能通過early exit自動(dòng)切換,在效率和準(zhǔn)確性之間尋找平衡。
針對(duì)線上多條規(guī)則并行審核的效率瓶頸,螞蟻還提出了RI-Mask,讓共享的圖文上下文只編碼一次,多條規(guī)則并行判斷,這樣多模態(tài)推理最高可提速5倍以上。
![]()
顯然,SingGuard-NSFA和SingGuard這兩個(gè)框架各自面向的對(duì)象有所不同,一個(gè)更關(guān)注AI行為,另一個(gè)更關(guān)注AI感知,但它們的底色是一致的,都強(qiáng)調(diào)過程可解釋、新增風(fēng)險(xiǎn)可擴(kuò)展。
具體觸犯了哪條規(guī)則、依據(jù)是什么,審核和追溯都拿得出理由,不是黑箱操作或簡單下結(jié)論;新增風(fēng)險(xiǎn)都僅需輕量擴(kuò)展,不影響已有的檢測能力。
如果說很多安全產(chǎn)品解決的是具體問題,那么這一類框架更像是在定義未來智能體運(yùn)行所依賴的安全基礎(chǔ)設(shè)施。
再把時(shí)間線拉長來看,這次開源其實(shí)不是孤立事件。
今年早些時(shí)候,在全網(wǎng)關(guān)注OpenClaw漏洞的同時(shí),螞蟻AI安全實(shí)驗(yàn)室就曾發(fā)現(xiàn)多個(gè)高危漏洞并協(xié)助官方完成修復(fù)。
隨后,螞蟻與清華大學(xué)聯(lián)合開源了ClawAegis,為智能體提供了一套覆蓋產(chǎn)品全生命周期的安全方案。
![]()
再到最新的安全框架開源,這條脈絡(luò)其實(shí)相當(dāng)清晰:從漏洞挖掘到場景化解法,再到可復(fù)用的底層框架。
顯然螞蟻在AI安全上的布局,是在逐步收束成體系。
前不久,螞蟻智能體安全產(chǎn)品還通過了信通院泰爾實(shí)驗(yàn)室的最高等級(jí)評(píng)級(jí)。這類第三方認(rèn)證,至少也說明在工程落地上,螞蟻確實(shí)走在了前面。
![]()
可以說,靠補(bǔ)丁續(xù)命的時(shí)代已經(jīng)過去了,行業(yè)需要有人往前一步,去定義風(fēng)險(xiǎn)的邊界,去搭建一套大家都能穩(wěn)穩(wěn)站上去的底座。
Claude Code、OpenClaw帶來的討論,某種程度上只是開始。隨著Agent越來越深入辦公、開發(fā)和生活場景,AI安全也將進(jìn)入新的階段。
相比不斷追趕漏洞,如何建立一套能夠持續(xù)適應(yīng)風(fēng)險(xiǎn)變化的安全基礎(chǔ)設(shè)施,或許才是整個(gè)行業(yè)下一步真正需要解決的問題。
從這個(gè)角度再回頭看最近的這些開源動(dòng)作,它們真正值得關(guān)注的,不只是性能指標(biāo),而是開始嘗試回答一個(gè)更底層的問題:
AI時(shí)代的安全邊界,究竟應(yīng)該如何定義。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.