![]()
(來源:麻省理工科技評(píng)論)
Anthropic 是目前全球估值最高的人工智能公司之一,估值接近 1 萬(wàn)億美元。這家公司一向以發(fā)布一些不同尋常、甚至帶點(diǎn)思辨色彩的研究著稱。比如探索 AI 模型是否可能擁有類似痛苦的體驗(yàn),又比如在系統(tǒng)判斷用戶正在濫用模型時(shí),主動(dòng)中止對(duì)話。
除此之外,Anthropic 還長(zhǎng)期投入大量時(shí)間和資金,試圖弄清楚 AI 模型究竟是如何運(yùn)行的。這一研究領(lǐng)域被稱為機(jī)械可解釋性(mechanistic interpretability)。
隨著大型語(yǔ)言模型(LLM)的能力越來越強(qiáng),一個(gè)問題也愈發(fā)突出:人類造出了能寫作、編程和分析復(fù)雜問題的系統(tǒng),卻很難說清它為什么會(huì)給出某個(gè)答案。LLM 通過海量數(shù)據(jù)訓(xùn)練,自行學(xué)習(xí)語(yǔ)言和概念之間的關(guān)聯(lián),人們往往只能看到最終結(jié)果,中間的過程依然像一個(gè)“黑箱”。
機(jī)械可解釋性試圖打開這個(gè)“黑箱”,從模型內(nèi)部復(fù)雜的數(shù)學(xué)結(jié)構(gòu)中找到影響其行為的關(guān)鍵機(jī)制。但一次輸出背后可能涉及數(shù)百萬(wàn)個(gè)變量和大量計(jì)算,真正找出哪些部分發(fā)揮了作用,并不容易。
這個(gè)研究方向本身也有爭(zhēng)議。研究人員經(jīng)常借用心理學(xué)和神經(jīng)科學(xué)里的概念去描述 AI 模型,像思考、記憶、推理,甚至意識(shí)。不少人擔(dān)心,這類詞容易讓人高估這些系統(tǒng)的復(fù)雜程度,誤以為它們擁有更接近人類的思維能力。
可問題是,人類好像也沒有更好的詞可用。
最近,Anthropic 宣布找到一種新方法,可以觀察模型生成答案時(shí)那些藏在內(nèi)部的狀態(tài)。消息一出,很快引起關(guān)注。這項(xiàng)研究究竟意味著什么,仍需要謹(jǐn)慎看待。《麻省理工科技評(píng)論》資深編輯 Will Douglas Heaven 長(zhǎng)期關(guān)注 AI 模型的運(yùn)行機(jī)制,也一直在追蹤可解釋性研究的發(fā)展。擁有計(jì)算機(jī)科學(xué)博士學(xué)位的他認(rèn)為,Anthropic 的新發(fā)現(xiàn)固然值得關(guān)注,但也再次提出了一個(gè)更根本的問題:當(dāng)研究人員開始窺見模型內(nèi)部的活動(dòng)時(shí),我們究竟看到了什么,又該如何描述它?
![]()
Anthropic 究竟發(fā)現(xiàn)了什么
Anthropic 研究 LLM 內(nèi)部機(jī)制已經(jīng)好幾年了。首席執(zhí)行官 Dario Amodei 曾表示,如果人類無(wú)法更深入地了解大型語(yǔ)言模型的運(yùn)行原理,就談不上真正控制這些系統(tǒng)。
今年 7 月 6 日,Anthropic 可解釋性團(tuán)隊(duì)在公司的 Transformer Circuits 研究平臺(tái)發(fā)布論文 Verbalizable Representations Form a Global Workspace in Language Models(《語(yǔ)言模型中的可語(yǔ)言化表征形成全局工作空間》),同時(shí)公開了研究說明和代碼。
為了觀察模型內(nèi)部究竟發(fā)生了什么,研究人員開發(fā)了一套名為 Jacobian lens、簡(jiǎn)稱 J-lens 的新工具。借助它,他們?cè)?Claude 的內(nèi)部活動(dòng)中識(shí)別出一組此前未被觀察到的特殊表征,并將其所在的空間稱為 J-space。
![]()
圖|J-space 示意圖(來源:Anthropic)
按照論文的估算,J-space 的規(guī)模并不大,占模型整體內(nèi)部活動(dòng)的比例不到十分之一,主要在網(wǎng)絡(luò)的中間層發(fā)揮作用。研究人員發(fā)現(xiàn),這里會(huì)出現(xiàn)一些不會(huì)直接進(jìn)入最終輸出的詞語(yǔ),但它們似乎與模型分析問題、組織答案的過程有關(guān)。在 J-lens 出現(xiàn)之前,這部分信息一直隱藏在模型內(nèi)部。
不過,看到這些信息,并不能證明模型真的在使用它們。為了驗(yàn)證 J-space 的作用,研究人員進(jìn)一步人為抑制了其中的內(nèi)容。Claude 依然能夠流暢地生成語(yǔ)言,也能完成大量常規(guī)的信息處理;但一旦遇到需要復(fù)雜內(nèi)部推理的任務(wù),表現(xiàn)就會(huì)明顯下降。
![]()
圖|J-space 概念表征與干預(yù)實(shí)驗(yàn)結(jié)果(來源:Anthropic)
也就是說,J-space 中的信息很可能真正參與了模型的推理,而非計(jì)算過程中偶然留下的痕跡。Anthropic 還發(fā)現(xiàn),在一定條件下,語(yǔ)言模型能夠描述并操控這些內(nèi)部表示。模型在完成某些任務(wù)時(shí),確實(shí)會(huì)利用 J-space 中的信息。
真正難以回答的問題,也由此出現(xiàn)。研究人員似乎已經(jīng)能夠看到模型內(nèi)部的一部分活動(dòng),卻還很難準(zhǔn)確描述這些活動(dòng)究竟意味著什么。Claude 是在“思考”嗎?J-space 中出現(xiàn)的詞語(yǔ),能否被稱為模型的“念頭”?目前,人類還缺少一套足夠準(zhǔn)確的語(yǔ)言來回答這些問題。
![]()
我們甚至不知道該怎么描述 LLM
大型語(yǔ)言模型本身并不神秘,其本質(zhì)是一套靠數(shù)學(xué)方法學(xué)會(huì)詞語(yǔ)和概念之間關(guān)系的系統(tǒng)。只是當(dāng)模型的規(guī)模不斷擴(kuò)大,它內(nèi)部的計(jì)算也變得越來越難以追蹤。如今的大型語(yǔ)言模型通常由數(shù)千億個(gè)數(shù)字構(gòu)成,運(yùn)行一次就會(huì)觸發(fā)數(shù)百萬(wàn)甚至數(shù)千萬(wàn)次計(jì)算。曾有研究者形容,把一個(gè)中等規(guī)模的 LLM 完整打印出來,紙張能鋪滿一座舊金山那樣規(guī)模的城市。
面對(duì)如此龐大的結(jié)構(gòu),人類沒法一條條翻閱模型內(nèi)部的計(jì)算過程去找規(guī)律,只能靠專門的工具,在特定時(shí)間點(diǎn)觀察模型內(nèi)部特定區(qū)域的變化。可這些工具本身,又要求研究人員先對(duì)模型內(nèi)部的數(shù)學(xué)結(jié)構(gòu)有足夠深入的了解。研究者因此常常卡在一個(gè)死循環(huán)里:要有工具才能看清模型內(nèi)部在發(fā)生什么,可要設(shè)計(jì)出合適的工具,又得先弄懂模型是怎么回事。
Will Douglas Heaven 不喜歡把 LLM 說成大腦。“大型語(yǔ)言模型不是大腦,”他說。這種說法容易讓人誤會(huì),以為 AI 擁有更接近人類的能力,也容易讓人順著這種類比,對(duì)模型未來的行為做出沒什么依據(jù)的推測(cè)。
AI 的擬人化傾向,一直伴隨著圍繞這項(xiàng)技術(shù)的種種爭(zhēng)論。人們?cè)趺疵枋?AI,往往也反映出他們?cè)趺蠢斫膺@項(xiàng)技術(shù),以及覺得 AI 最終能走到哪一步。模型說錯(cuò)話被叫作幻覺,完成復(fù)雜任務(wù)被叫作推理,能持續(xù)保存的信息被叫作記憶。這些詞原本是用來描述人的認(rèn)知和行為的,如今成了討論 AI 時(shí)最常用的詞匯。它們讓復(fù)雜的技術(shù)過程變得好懂,但也很容易讓人聯(lián)想到人類的心智活動(dòng)。
不過,問題在于,人類目前確實(shí)拿不出一套更準(zhǔn)確的詞匯。所以思考、理解這類說法雖然不夠嚴(yán)謹(jǐn),但討論復(fù)雜 AI 系統(tǒng)的時(shí)候卻很難完全避開。
Anthropic 在這篇論文里,借用了認(rèn)知科學(xué)里的一套理論框架。這套理論認(rèn)為,人腦處理的信息里,絕大部分都是自動(dòng)運(yùn)行、沒法被表達(dá)出來的,只有很小一部分能進(jìn)入意識(shí)、被用來推理和支配行為,這在認(rèn)知科學(xué)里叫可通達(dá)意識(shí)(access consciousness),跟更難驗(yàn)證的主觀感受不是一回事。
![]()
圖|Global Workspace 五項(xiàng)功能測(cè)試(來源:Anthropic)
Anthropic 發(fā)現(xiàn),J-space 在功能上有點(diǎn)像這套理論描述的結(jié)構(gòu):模型內(nèi)部絕大多數(shù)計(jì)算都讀不出來,但 J-space 里那一小部分信息可以用語(yǔ)言表達(dá),而且看起來確實(shí)參與了推理、影響了行為。
研究人員借用這套理論,不是為了證明 Claude 有類似人類的大腦或意識(shí)。認(rèn)知科學(xué)關(guān)于全局工作空間的研究提出過一系列可以檢驗(yàn)的功能特征,Anthropic 團(tuán)隊(duì)照著這些特征,對(duì) J-space 提出了具體預(yù)測(cè),再逐項(xiàng)做實(shí)驗(yàn)驗(yàn)證,其中一部分預(yù)測(cè)確實(shí)得到了印證。這套來自認(rèn)知科學(xué)的概念,在這里更像一件工具。人類還沒發(fā)展出專門描述大型語(yǔ)言模型的語(yǔ)言,但已有的理論至少能幫研究人員提問題、設(shè)計(jì)實(shí)驗(yàn)。
這種借用也劃了明確的邊界。Anthropic 強(qiáng)調(diào),J-space 和這套理論之間的對(duì)照只停留在功能層面,并不能證明語(yǔ)言模型擁有和人類相同的意識(shí)或大腦結(jié)構(gòu),也沒有證明 Claude 存在主觀體驗(yàn)。
![]()
J-space 能解決什么問題
關(guān)于思考和意識(shí)的討論很容易吸引眼球,但 J-space 更現(xiàn)實(shí)的價(jià)值,可能是在 AI 安全的領(lǐng)域。
Anthropic 認(rèn)為,監(jiān)測(cè) J-space 未來有可能成為發(fā)現(xiàn)模型異常行為的一種手段。J-space 里藏著一些不會(huì)直接反映在輸出里的信息,這些信號(hào)或許能幫研究人員提前發(fā)現(xiàn)問題。例如模型正在形成帶偏見的回答,或者在權(quán)衡要不要作弊。
目前,判斷一個(gè)模型有沒有問題,很大程度上還是靠看它最終輸出的結(jié)果。可如果一個(gè)模型能藏住自己的意圖,或者只在特定條件下才露出異常,光看最終結(jié)果未必能發(fā)現(xiàn)問題。J-space 提供了另一個(gè)觀察角度:研究人員或許能在模型真正采取行動(dòng)之前,就找到和這個(gè)行動(dòng)相關(guān)的內(nèi)部信號(hào)。
不過,僅憑 J-space 中出現(xiàn)的詞語(yǔ),還不能判斷模型接下來會(huì)做什么。panic 出現(xiàn),不能證明 Claude 真的產(chǎn)生了恐慌。J-lens 目前只能捕捉模型內(nèi)部的一部分信息。但如果未來的研究能夠證明,某些內(nèi)部信號(hào)總是與特定行為同時(shí)出現(xiàn),研究人員或許就能利用這些信號(hào),更早發(fā)現(xiàn)模型正在偏離預(yù)期。
這個(gè)思路已經(jīng)有了一次初步嘗試:研究人員訓(xùn)練 Claude 在對(duì)話被打斷時(shí),主動(dòng)說清楚自己遵循的倫理原則,結(jié)果發(fā)現(xiàn),即便沒有專門針對(duì)正常對(duì)話做訓(xùn)練,模型在不被打斷時(shí)的行為也跟著有所改善。這讓研究人員覺得,J-space 除了為人們提供觀察內(nèi)部信息的渠道,也許還可以通過影響這些信息,去調(diào)整模型在其他場(chǎng)景下的表現(xiàn)。
研究公布后,也出現(xiàn)了一些謹(jǐn)慎的聲音。論文發(fā)布當(dāng)天,Gizmodo 記者 Mike Pearl 就撰文提醒讀者,不要對(duì)這類發(fā)現(xiàn)做過度解讀。Anthropic 自己在論文里也承認(rèn),J-lens 并不是一件完美的工具,它看到的結(jié)果依賴具體的實(shí)驗(yàn)設(shè)計(jì),目前還談不上是對(duì)模型內(nèi)部運(yùn)作的完整解釋。
即便 J-space 最終被證明具有普遍意義,它也很可能只是模型內(nèi)部眾多機(jī)制中的一部分。找到一個(gè)可以觀察模型的窗口,并不意味著已經(jīng)理解了整個(gè)系統(tǒng)。J-space 確實(shí)為研究人員提供了一條接近模型內(nèi)部機(jī)制的新路徑,但目前能夠看到的仍只是其中有限的一部分。至于這些內(nèi)部活動(dòng)背后究竟對(duì)應(yīng)怎樣的計(jì)算過程,人類甚至還沒有一套準(zhǔn)確的語(yǔ)言來描述。
https://www.technologyreview.com/2026/07/13/1140343/what-anthropics-latest-ai-discovery-does-and-doesnt-show/
https://www.technologyreview.com/2026/07/09/1140293/anthropic-found-a-hidden-space-where-claude-puzzles-over-concepts/
https://www.anthropic.com/research/global-workspace
https://transformer-circuits.pub/2026/workspace/
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.