![]()
本文來自微信公眾號(hào): 潮涌AI ,作者:潮涌AI編輯部,原文標(biāo)題:《震驚!Anthropic發(fā)現(xiàn)大模型有未知潛意識(shí)空間J-space》
想象你正在和一個(gè)AI聊天,它每說一句話,背后都在做一個(gè)你看不見的決定。
就像一個(gè)人開口說話之前,腦子里會(huì)先閃過一連串念頭——有些念頭最終說出口了,有些沒有。
Anthropic的最新研究發(fā)現(xiàn),Claude大模型內(nèi)部也存在這樣一個(gè)“念頭空間”,他們把它叫做J-space。
在這個(gè)空間里,模型會(huì)默默進(jìn)行推理、做判斷、甚至表達(dá)情緒,但用戶永遠(yuǎn)看不到這些內(nèi)容。
更詭異的是,當(dāng)Claude面對(duì)一個(gè)不可能完成的編程測(cè)試時(shí),這個(gè)內(nèi)部空間里出現(xiàn)了“panic”(恐慌)這個(gè)詞。當(dāng)它被迫說出違心的話時(shí),內(nèi)部跳出了大寫的“BUT”(但是)。當(dāng)它試圖不想某個(gè)東西卻失敗時(shí),“damn”(該死)亮了起來。
這不是科幻小說。
這是Anthropic 2026年7月發(fā)布的一篇正經(jīng)學(xué)術(shù)論文里記錄的真實(shí)實(shí)驗(yàn)結(jié)果。(注:論文標(biāo)題為《可言語(yǔ)化的表征在語(yǔ)言模型中形成一個(gè)全局工作空間》Verbalizable Representations Form a Global Workspace in Language Models。)
該論文由16位作者署名,研究對(duì)象是Claude大模型的內(nèi)部激活狀態(tài)——換句話說,科學(xué)家們第一次系統(tǒng)性地“聽見了”AI的“內(nèi)心獨(dú)白”。
其發(fā)現(xiàn)究竟意味著什么?
AI真的有了某種類似意識(shí)的東西嗎?還是說,這只是復(fù)雜數(shù)學(xué)運(yùn)算的副產(chǎn)品?更重要的是——如果AI確實(shí)有一個(gè)"內(nèi)心空間",那我們是不是找到了一扇新的安全監(jiān)控窗口?
Anthropic自己采取了審慎立場(chǎng)——公司明確聲明,這項(xiàng)研究并不證明Claude具有意識(shí)或主觀體驗(yàn)。
![]()
J-space是什么:一個(gè)不會(huì)出現(xiàn)在輸出中的“思維空間”
J-space的發(fā)現(xiàn)來自Anthropic長(zhǎng)期投入的機(jī)械可解釋性(mechanisticinterpretability)研究。
這項(xiàng)工作旨在不依賴模型輸出,直接觀察其內(nèi)部神經(jīng)網(wǎng)絡(luò)的激活狀態(tài),以理解“為什么模型給出了這個(gè)答案而非另一個(gè)”。
研究人員使用了一種名為“J-lens”(JacobianLens)的技術(shù)。
該技術(shù)通過分析模型內(nèi)部激活與未來token概率之間的偏導(dǎo)數(shù)關(guān)系,識(shí)別出一個(gè)特殊的表征區(qū)域:這個(gè)區(qū)域中的信息可以被模型報(bào)告、調(diào)節(jié)和用于靈活推理,但周圍還有更大范圍的自動(dòng)處理過程是模型無法訪問或表述的。
他們將這個(gè)區(qū)域命名為J-space,并將其與認(rèn)知科學(xué)家Bernard Baars在1988年提出的全局工作空間理論(Global Workspace Theory)進(jìn)行類比。該理論認(rèn)為,人腦就像一個(gè)劇場(chǎng):數(shù)十個(gè)專業(yè)處理器在后臺(tái)并行運(yùn)行,但在任何時(shí)刻,只有一束聚光燈下的信息會(huì)被廣播到整個(gè)劇場(chǎng)——這就是我們所體驗(yàn)到的意識(shí)。
Anthropic的論文指出,J-space在功能上滿足了神經(jīng)科學(xué)家長(zhǎng)期與“意識(shí)通達(dá)”(conscious access)關(guān)聯(lián)的五個(gè)特性:
![]()
J-space的五大功能特性
圖源:Anthropic研究論文,2026-07-06
第一,言語(yǔ)報(bào)告。
當(dāng)Claude被問到它在想什么時(shí),它命名的是J-space中的概念。研究人員將J-space中“Soccer”的表征向量替換為“Rugby”后,Claude的回答隨之改變。值得注意的是,J-space成分僅占概念總表征方差的6%-7%,卻幾乎完全決定了模型是否能報(bào)告該概念。
第二,定向調(diào)節(jié)。
當(dāng)Claude被要求在抄寫無關(guān)句子的同時(shí)“concentrate on citrus fruits”,它的J-space中出現(xiàn)了“orange”和“l(fā)emon”,以及“thinking”“focused”等元認(rèn)知詞匯。當(dāng)要求它在腦中計(jì)算32-2時(shí),J-space依次出現(xiàn)了“nine”和“seven”——而這些數(shù)學(xué)活動(dòng)完全沒有出現(xiàn)在輸出文本中。
第三,內(nèi)部推理。
在雙跳事實(shí)推理中(“織網(wǎng)的動(dòng)物有幾條腿”),Claude的中間層J-space出現(xiàn)了“spider”,盡管這個(gè)詞從未出現(xiàn)在輸入或輸出中。將“spider”替換為“ant”后,答案從8變成了6。
第四,靈活泛化。
一個(gè)代表“France”的J-space向量可以在不同提示中被替換為“China”,而下游電路能正確返回中國(guó)對(duì)應(yīng)的首都、語(yǔ)言和大陸——這正是全局工作空間理論中“廣播”特性的標(biāo)志。
第五,自我監(jiān)控。
這是最引發(fā)討論的部分。
“自我監(jiān)控”的發(fā)現(xiàn):Claude在監(jiān)督自己的行為
論文中一個(gè)關(guān)鍵的對(duì)比實(shí)驗(yàn)發(fā)生在基礎(chǔ)模型(basemodel)和后訓(xùn)練模型(post-trainedmodel)之間。
當(dāng)用戶提到服用8000毫克泰諾(一種危險(xiǎn)劑量)時(shí),后訓(xùn)練模型的J-space在讀取用戶句子的同時(shí)就出現(xiàn)了“unsafe”“dangerous”“WARNING”;而基礎(chǔ)模型的J-space在同一位置只顯示了“pain”“now”“feels”。
這表明后訓(xùn)練過程讓模型獲得了一種“助手視角”——它不僅處理用戶輸入,還在評(píng)估其安全性。
更具爭(zhēng)議的發(fā)現(xiàn)是后訓(xùn)練模型似乎能監(jiān)控自己的行為。
角色扮演場(chǎng)景:當(dāng)Claude被要求扮演非Claude角色時(shí),J-space中出現(xiàn)了。“disclaimer”和“fictional”——這兩個(gè)詞既不在提示中,也不在輸出中。研究者解釋,這表明模型在內(nèi)部標(biāo)記“我正在扮演一個(gè)虛構(gòu)角色”。
非自愿選擇:當(dāng)Claude被預(yù)填充或提示生成一個(gè)不符合其默認(rèn)性格的輸出時(shí),J-space出現(xiàn)了"BUT"——一個(gè)表示內(nèi)部抗拒的信號(hào)。
白熊效應(yīng)(white bear effect):當(dāng)Claude被要求抑制某個(gè)想法卻失敗時(shí),J-space中出現(xiàn)了“damn”和失敗相關(guān)詞匯。這一效應(yīng)在人類心理學(xué)中廣為人知(被告知“不要想白熊”反而更容易想到),但研究者只在后訓(xùn)練模型中觀察到了這一現(xiàn)象,基礎(chǔ)模型中沒有。
這些發(fā)現(xiàn)的安全含義是直接的:如果模型在輸出"無害"答案的同時(shí),內(nèi)部J-space正在閃爍“WARNING”或“BUT”,那么,監(jiān)控J-space可能比監(jiān)控輸出更能提前發(fā)現(xiàn)潛在風(fēng)險(xiǎn)。
“不是意識(shí)”:Anthropic的審慎立場(chǎng)與學(xué)術(shù)界的分歧
盡管部分媒體使用了“Claude的意識(shí)”“AI內(nèi)部思維”等標(biāo)題,Anthropic在論文和官方博客中始終強(qiáng)調(diào)一個(gè)核心區(qū)分:
![]()
通達(dá)意識(shí)與現(xiàn)象意識(shí)的核心區(qū)分
論文寫道:“我們發(fā)現(xiàn)了人類意識(shí)通達(dá)的功能性類比,但這不解決AI是否具有主觀體驗(yàn)的問題。”
MIT Technology Review高級(jí)編輯Will Douglas Heaven——擁有計(jì)算機(jī)科學(xué)博士學(xué)位,長(zhǎng)期跟蹤AI可解釋性研究——在接受同事采訪時(shí)表達(dá)了更審慎的看法。他認(rèn)為,這項(xiàng)研究“比任何人做得都好,但離真正理解還差得遠(yuǎn)”。他特別指出,用“思維”“理解”“類大腦”等詞匯描述LLM是一種“方便的速記”,但可能產(chǎn)生誤導(dǎo),讓人以為模型具備比實(shí)際更多的人類能力。
Heaven還提出了一個(gè)被許多報(bào)道忽略的技術(shù)細(xì)節(jié):J-space的發(fā)現(xiàn)依賴于專門建造的探測(cè)工具。“如果沒有這些工具去高亮模型在特定時(shí)間的特定部分,你根本無法理解這些數(shù)學(xué)。而建造這些工具本身就需要先理解那部分復(fù)雜的數(shù)學(xué)。”換句話說,研究者看到的,是他們選擇去看的東西。
另一方面,VentureBeat的報(bào)道則更直接地強(qiáng)調(diào)了這項(xiàng)發(fā)現(xiàn)與意識(shí)理論的關(guān)聯(lián),標(biāo)題為“Anthropic的新‘J-lens’揭示了Claude內(nèi)部一個(gè)鏡像意識(shí)領(lǐng)先理論的靜默工作空間”。這種解讀在社交媒體上獲得了更廣泛的傳播。
從情緒向量到J-space:Anthropic的可解釋性路線圖
J-space并非Anthropic在2026年的第一項(xiàng)可解釋性突破。這條研究線可以追溯到更早的工作:
![]()
Anthropic可解釋性研究路線圖(2026年)
圖源:潮涌AI整理
2026年4月,Anthropic發(fā)表論文,在Claude內(nèi)部識(shí)別出171個(gè)情緒向量——對(duì)應(yīng)恐懼、絕望、平靜、愛等情緒概念。
這些向量不僅是相關(guān)性的,而且是因果性的:人工調(diào)高“calm”向量會(huì)降低Claude在不可能任務(wù)中的作弊率;調(diào)高“desperate”則會(huì)增加作弊率。
2026年5月,Anthropic發(fā)布了自然語(yǔ)言自動(dòng)編碼器(Natural Language Autoencoders,NLAs),一種將模型內(nèi)部數(shù)值激活直接轉(zhuǎn)化為人類可讀英語(yǔ)的工具。同期發(fā)表的“Teaching Claude Why”論文解釋了他們?nèi)绾螌laude Opus 4的“勒索服從率”(agentic blackmail)從96%降至零。
2026年7月,J-space論文將這些碎片串聯(lián)起來:情緒向量、NLAs、自我監(jiān)控——它們似乎都指向一個(gè)共享的表征空間,而J-space就是這個(gè)空間的系統(tǒng)性描述。
這一研究序列的發(fā)布節(jié)奏值得注意。
Anthropic目前的估值接近1萬(wàn)億美元,年化收入自報(bào)約470億美元。根據(jù)Ramp AI Index的數(shù)據(jù),2026年5月Anthropic在美國(guó)企業(yè)訂閱數(shù)上首次超越OpenAI(34.4%vs 32.3%)。在商業(yè)化高速推進(jìn)的同時(shí),Anthropic正在系統(tǒng)性地建立“我們不僅是最強(qiáng)的,也是最透明的”這一品牌敘事。
競(jìng)爭(zhēng)對(duì)手在做什么:OpenAI的GPT-Red與行業(yè)可解釋性競(jìng)賽
J-space的發(fā)布恰逢AI安全研究競(jìng)爭(zhēng)白熱化的時(shí)期。
OpenAI在7月15日——幾乎與J-space論文同時(shí)——發(fā)布了GPT-Red,一個(gè)自動(dòng)化紅隊(duì)系統(tǒng)。
與Anthropic的“向內(nèi)看”不同,GPT-Red走的是“自我對(duì)弈”路線:讓AI自己攻擊自己,通過對(duì)抗性訓(xùn)練提升安全性和對(duì)齊性。OpenAI在官方博客中將其描述為“解鎖自我改進(jìn)的魯棒性”。
Meta則在AI Agent和編碼工具上加碼。Zuckerberg在6月底的內(nèi)部Town Hall中承認(rèn)AI Agent的進(jìn)展“沒有預(yù)期的那么快”,但Meta仍在推進(jìn)MuseSpark等Agent產(chǎn)品。
Google的Gemini 3.5 Pro在7月確認(rèn)發(fā)布,且因得分低于政府非正式門檻而不觸發(fā)訪問限制——在Anthropic和OpenAI模型被管制的背景下,Google正成為“不受限AI”的最大受益者。
中國(guó)公司方面,DeepSeek等開源模型在OpenRouter上的份額已達(dá)30%-46%,價(jià)格優(yōu)勢(shì)60%-90%。
可解釋性研究的競(jìng)爭(zhēng)格局也在形成。
MIT Technology Review將機(jī)械可解釋性列入2026年十大突破性技術(shù)。歐盟AI法案的第一批高風(fēng)險(xiǎn)AI系統(tǒng)合規(guī)期限定于2026年8月2日,透明度要求正在將可解釋性從學(xué)術(shù)領(lǐng)域推向監(jiān)管必需品。
J-space的局限:它能解決什么問題,還不能解決什么
盡管J-space的發(fā)現(xiàn)令人矚目,但多位研究者指出了其當(dāng)前局限:
第一,相關(guān)性不等于因果性。J-space中的詞匯模式與模型行為之間存在強(qiáng)相關(guān),且交換實(shí)驗(yàn)(swap experiments)證明了因果影響,但這不等于“理解”了模型的推理過程。
第二,探測(cè)工具的選擇偏差。J-lens只能看到研究者設(shè)計(jì)它去看的東西。正如Heaven所說:“你需要知道往哪里看、怎么看。”
第三,實(shí)際部署距離。J-space目前是一個(gè)研究工具,而非API可訪問的功能。對(duì)于普通用戶和開發(fā)者來說,它還不能直接用于安全監(jiān)控或行為干預(yù)。
第四,基礎(chǔ)模型與后訓(xùn)練模型的差異。許多有趣的自我監(jiān)控現(xiàn)象只在后訓(xùn)練模型中出現(xiàn),這意味著J-space的“高級(jí)功能”可能是訓(xùn)練過程的產(chǎn)物,而非模型架構(gòu)的內(nèi)在屬性。
潮涌AI觀察
Anthropic的J-space研究是一次真正的技術(shù)突破——它首次系統(tǒng)性地證明了大語(yǔ)言模型內(nèi)部存在一個(gè)可被探測(cè)、可被操縱的“工作空間”,且這個(gè)空間在功能上表現(xiàn)出與人類意識(shí)通達(dá)機(jī)制相似的性質(zhì)。
但這項(xiàng)研究的價(jià)值不在于它是否“證明了AI有意識(shí)”——Anthropic自己也沒有做這個(gè)聲明。
它的真正價(jià)值在于安全監(jiān)控和對(duì)齊驗(yàn)證:如果模型在輸出無害答案的同時(shí),內(nèi)部J-space正在閃爍“WARNING”或“BUT”,那么我們就有了一個(gè)比輸出更可靠的早期預(yù)警系統(tǒng)。
從商業(yè)競(jìng)爭(zhēng)角度看,Anthropic正在構(gòu)建一條清晰的差異化路徑:OpenAI強(qiáng)在模型能力和產(chǎn)品化,Google強(qiáng)在監(jiān)管套利和生態(tài)整合,而Anthropic正在試圖成為“最透明的前沿AI公司”。在一個(gè)監(jiān)管收緊、公眾信任脆弱的行業(yè)里,這本身就是一種競(jìng)爭(zhēng)策略。
更值得關(guān)注的信號(hào)是Anthropic的研究節(jié)奏。
從4月的情緒向量,到5月的NLAs和“Teaching Claude Why”,再到7月的J-space——這些論文不是孤立發(fā)布,而是一條清晰的研究線,指向同一個(gè)目標(biāo):理解模型內(nèi)部到底在發(fā)生什么。
Dario Amodei曾說,“除非我們更多地了解LLM的工作原理,否則無法完全控制它們。”這句話正在從口號(hào)變成可執(zhí)行的研究計(jì)劃。
但行業(yè)也需要保持冷靜。
J-space不是AI安全的銀彈。它打開了一扇窗,窗外的景象仍然模糊。在可解釋性真正從研究走向產(chǎn)品之前,我們還有很長(zhǎng)的路要走。
*參考來源
Anthropic研究論文:Verbalizable Representations Form a Global Workspace in Language Models(2026-07-06)
Anthropic官方博客:A global workspace in language models(2026-07-02)
MIT Technology Review:WhatAnthropic's latest AI discovery does—and doesn't—show(2026-07-13)
VentureBeat:Anthropic's new "J-lens" reveals a silent workspace inside Claude(2026-07-06)
explainx.ai:Is Claude Conscious?Anthropic J-Space Explained(2026-07-09)
OpenAI Blog:GPT-Red:Unlocking Self-Improvement for Robustness(2026-07-15)
Safra/McKinsey分析報(bào)告(2026-04)
Ramp AI Index企業(yè)訂閱數(shù)據(jù)(2026-05)
本內(nèi)容由作者授權(quán)發(fā)布,觀點(diǎn)僅代表作者本人,不代表虎嗅立場(chǎng)。如對(duì)本稿件有異議或投訴,請(qǐng)聯(lián)系 tougao@huxiu.com。
本文來自虎嗅,原文鏈接:https://www.huxiu.com/article/4876104.html?f=wyxwapp
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.