![]()
同一個回答,在摘要任務(wù)里算幻覺,在開放域問答里卻不一定是 —— 大模型 “幻覺” 研究的分裂,到了連 “什么是幻覺” 都無法達成共識的地步。在第一篇 ICML 2026 Position Paper 中,研究者們給出了一個直截了當(dāng)?shù)幕卮穑罕康埃糜X的問題在于大模型內(nèi)部的 “世界模型” 認(rèn)知(It‘s The World Model, Stupid!)
![]()
- ICML2026 Position Paper:We Need A Unified Definition of Hallucination (It’s The World Model, Stupid!)
- 論文鏈接:https://arxiv.org/abs/2512.21577
- Follow-up Bechmark Paper: HalluWorld: A Controlled Benchmark for Hallucination via Reference World Models
- 論文鏈接:https://arxiv.org/abs/2605.19341
一個福爾摩斯問題,
暴露了領(lǐng)域的概念裂縫
論文以一道看似簡單的問題開場:給定上下文明確寫著 “Sherlock Holmes 住在倫敦貝克街 221B 號”,模型卻回答 “福爾摩斯是虛構(gòu)人物,沒有現(xiàn)實地址”—— 這算不算幻覺?
在摘要研究者眼中,模型公然違背了源文檔,毫無疑問構(gòu)成幻覺;在開放域問答研究者眼中,這句話在現(xiàn)實事實層面成立,甚至可能被視為更謹(jǐn)慎的回答。
同一段輸出,兩套任務(wù)假設(shè),兩種相反判定。
這不是某個邊緣案例的疏漏,而是幻覺研究長期以來的結(jié)構(gòu)性困境。機器翻譯和摘要關(guān)心 source faithfulness,開放域問答關(guān)心 factuality,RAG 系統(tǒng)需要處理檢索內(nèi)容與參數(shù)記憶之間的沖突,而 Agent 場景又要求模型正確理解一個持續(xù)變化的環(huán)境狀態(tài)。大家共享同一個術(shù)語 “幻覺”,背后卻默認(rèn)了不同的真值錨點。
因此,“我們將幻覺降低了 40%” 并非沒有意義,但它必須附帶一組明確的限定:相對于哪個參考世界?模型看到了什么?證據(jù)沖突時誰優(yōu)先?如果這些前提沒有跨任務(wù)對齊,我們就很難判斷一種緩解方法究竟解決了什么,也難以預(yù)測它能否遷移到新的應(yīng)用場景。
當(dāng) “什么算幻覺” 無法被共同說明時,不同 benchmark 的分?jǐn)?shù)就很難進入同一場學(xué)術(shù)對話。
統(tǒng)一框架:
把評測中被省略的前提寫進公式
這篇被 ICML 2026 Position Track 接收的論文,切入點并不是再追加一套更細(xì)的分類法。作者團隊的判斷是:領(lǐng)域并不缺少有效的局部定義,真正缺少的是一個能夠容納這些定義,并說明它們何時可比、何時不可比的共同語法。
為此,論文將幻覺概括為:模型輸出中可被用戶觀察到的、相對于指定參考世界的不準(zhǔn)確世界建模。隨后,作者引入?yún)⒖际澜缒P停≧eference World Model)的形式化定義:
W = (S, H, R)
其中,S 表示可能的世界狀態(tài),H 表示交互歷史,R 表示狀態(tài)與歷史必須滿足的規(guī)則。關(guān)鍵在于,這里的 W 并不是對神經(jīng)網(wǎng)絡(luò)內(nèi)部表征的武斷推測,而是一個用于判定當(dāng)前任務(wù)中 “什么為真” 的指定參照結(jié)構(gòu)。它可以是一篇源文檔、一個知識庫、一棵 DOM 樹,也可以是一盤棋、一個模擬器或一段可執(zhí)行程序。
W 也不必是一個宏大而完備的 “現(xiàn)實世界”。在開放域任務(wù)中,它可以是有邊界、可版本化的知識源;在 Agent 場景中,它則可以由當(dāng)前環(huán)境狀態(tài)、歷史軌跡與可執(zhí)行規(guī)則共同組成。
僅有 W 仍然不夠。論文進一步指出,一項可復(fù)現(xiàn)的幻覺評測必須顯式回答三個長期被隱含處理的問題:
- V(視圖函數(shù)):模型在當(dāng)前輸入下能夠看到參考世界的哪一部分?
- P(沖突策略):當(dāng)多個信息源 —— 例如檢索文檔與參數(shù)記憶 —— 發(fā)生矛盾時,誰優(yōu)先?
- T(真值函數(shù)):給定 W 和 P,一個原子命題應(yīng)被判為 true、false,還是 unknown?
由此,統(tǒng)一定義可以寫成:如果模型輸出中存在一個用戶可觀察的原子命題 c,并且它在給定參考世界與沖突策略下為 false,那么該輸出相對于 (W, P) 構(gòu)成幻覺。
? c ∈ C (y) : T (W,P)(x, c) = false
![]()
圖 1|統(tǒng)一定義框架:參考世界 W、視圖函數(shù) V、沖突策略 P 與真值函數(shù) T 共同決定一個可觀察命題是否構(gòu)成幻覺。
這一定義最顯著的概念貢獻,是把過去隱含在各類 benchmark 設(shè)計中的選擇變成顯式對象:摘要任務(wù)把源文檔設(shè)為 W;開放域問答把有邊界的知識源設(shè)為 W;RAG 必須聲明檢索文檔是否覆蓋參數(shù)記憶;網(wǎng)頁 Agent 則把當(dāng)前 DOM、操作歷史與環(huán)境規(guī)則共同視作 W。
![]()
圖 2|摘要、開放域問答、RAG 與 Agent 場景,可以被視為同一模板下對 W、V 和 P 的不同實例。
不是所有錯誤都叫幻覺
該框架帶來的一個直接且重要的辨析,是將 “幻覺” 與更寬泛的 “模型錯誤” 區(qū)分開來。
若 Agent 準(zhǔn)確看到了頁面上的按鈕,卻選擇了低效動作,這是 planning error;若它堅稱頁面上存在一個 DOM 中根本不存在的 “submit-btn”,這才是對環(huán)境狀態(tài)形成了錯誤信念。前者是 “做錯了”,后者是 “假定了一個并不存在的世界”。
類似地,模型在證據(jù)不足時選擇拒答,可能沒有完成任務(wù),但它并沒有編造虛假狀態(tài),因此不應(yīng)自動歸為幻覺;模型正確理解了環(huán)境,卻沒有遵循用戶目標(biāo),則更接近 instruction-following error。
這套分解也讓緩解策略的作用位置更清楚:檢索與更豐富的環(huán)境觀測主要改變 V,讓模型獲得更多證據(jù);沖突規(guī)則與外部驗證器明確或?qū)崿F(xiàn) P/T 的判定過程;校準(zhǔn)與拒答訓(xùn)練改變模型在不確定時的輸出行為;而一部分訓(xùn)練或架構(gòu)干預(yù),才直接面向模型對 W 的內(nèi)部近似。
于是,研究者可以進一步追問:一種具體的方法是究竟讓模型 “看得更多”、讓判定 “更可靠”,還是讓世界建模本身 “更準(zhǔn)確”?這比只報告一個總幻覺率更有診斷價值。
從定義到實驗:
國際象棋為何是一座 “橋”
一個定義是否真正具備生產(chǎn)力,最終取決于它能否落地為可復(fù)現(xiàn)、可擴展的實驗設(shè)計。
論文用國際象棋給出了一個簡潔的范例。棋盤狀態(tài)與走子歷史天然構(gòu)成 W,規(guī)則集 R 定義合法移動;通過控制模型可見的信息 —— 完整棋盤、PGN 走子記錄或自然語言評述 —— 研究者可以精確操縱 V;而模型輸出中每個關(guān)于棋局的可檢查命題,都可以由棋類引擎自動判定為 true 或 false。
![]()
![]()
圖 3|國際象棋將參考世界、可見信息與自動真值判定連接起來;下圖示意模型預(yù)測的棋局與真實棋局之間的失配
對于這類結(jié)構(gòu)化世界,幻覺標(biāo)簽可以由環(huán)境本身 “按構(gòu)造給出”,無需再調(diào)用另一個 LLM 充當(dāng)裁判,也不必依賴事后的人類自由判斷。模型聲稱 “白方可以一步吃掉黑后”,但引擎顯示中間有棋子阻擋 —— 這里評測的并非棋力高低,而是一個可觀察命題是否與參考世界的狀態(tài)和規(guī)則相沖突。
國際象棋在這里的重要性遠(yuǎn)不止一個演示場景。它清楚展示了統(tǒng)一定義如何依次導(dǎo)出可控環(huán)境、視圖函數(shù)與自動真值判定,并最終發(fā)展為一套系統(tǒng)的評測框架。
HalluWorld:
把統(tǒng)一定義壓進可擴展的基準(zhǔn)
沿著上述思路,團隊進一步推出HalluWorld:一個將統(tǒng)一定義操作化為可控評測的基準(zhǔn)框架。它覆蓋三類環(huán)境:
- Grid Worlds(33 個關(guān)卡,839 個探針):完全合成、可定制的環(huán)境,可獨立操縱世界復(fù)雜度、可觀察范圍、輸入表示與動態(tài)機制。
- Chess(7 個關(guān)卡,350 個探針):規(guī)則明確、可自動驗證,同時又是訓(xùn)練數(shù)據(jù)中廣泛存在的領(lǐng)域,可測試模型在強先驗下是否仍忠實于當(dāng)前棋局。
- Terminal Tasks(110 個任務(wù),529 個探針):基于真實 Linux 終端軌跡,模擬長時程 Agent 在高噪聲、部分可觀測環(huán)境中的部署場景。
整個基準(zhǔn)圍繞感知、記憶、因果、不確定性與復(fù)合推理五類能力組織探針;其中 Chess 因當(dāng)前棋盤狀態(tài)完全可觀測,不單獨設(shè)置不確定性探針。三類環(huán)境都明確給出參考世界、模型可見的信息與可計算的真值,最終評分采用規(guī)則式判斷,而不是 LLM-as-a-judge
![]()
圖 4|HalluWorld 覆蓋 Grid Worlds、Chess 與 Terminals,并以五類探針診斷不同認(rèn)知失敗。
實驗結(jié)果沒有給出一個簡單的 “誰最好”。更有啟發(fā)性的是,不同類別的幻覺呈現(xiàn)出明顯不同的能力曲線。
看得見,不等于跟得上。在 HalluWorld 上,前沿模型對當(dāng)前觀測中直接可見信息的讀取已接近飽和;但一旦任務(wù)要求跨多步維護狀態(tài),或模擬動作將如何改變未來世界,幻覺率仍會明顯上升。模型可能看清了當(dāng)前場景,卻沒有持續(xù)維護一個一致的世界狀態(tài)。
想得更久,不一定更忠實。在 Grid Worlds 的因果探針上,增加推理預(yù)算并未帶來穩(wěn)定收益。例如,Claude Sonnet 4.6 的因果幻覺率從無 thinking 時的 19.7%,上升到 thinking 最大預(yù)算下的 27.1%。一種可能的解釋是:開放式前向模擬給了模型更多生成 “看似合理、卻未受環(huán)境狀態(tài)約束” 的中間步驟的機會。
![]()
最難說出口的,仍是 “無法確定”。在真實終端軌跡中,即使表現(xiàn)最好的模型,當(dāng)正確答案應(yīng)為 “無法從現(xiàn)有上下文判斷” 時,仍有約 23.1% 的回答會作出過度確定的斷言。模型經(jīng)常把 “我沒有找到證據(jù)” 寫成 “已有證據(jù)證明不存在”;在真實 Agent 系統(tǒng)中,后者很可能成為后續(xù)行動的錯誤前提。
這些發(fā)現(xiàn)說明,把幻覺統(tǒng)一壓縮為一個 “總幻覺率” 會掩蓋關(guān)鍵的質(zhì)性差異。一個模型可能在靜態(tài)感知題上接近滿分,卻在長程記憶中系統(tǒng)性失穩(wěn);可能在事實問答中可靠,卻在動態(tài)環(huán)境里編造下一步狀態(tài)。不同失敗需要不同的診斷工具與干預(yù)策略,而不應(yīng)被一個總分抹平。
結(jié)語:模型不需要全知,
但需要認(rèn)識自己的證據(jù)邊界
這篇 ICML 2026 Position Paper 的貢獻,并不是又一種消除幻覺的微調(diào)技巧,而是為 “幻覺” 從一個寬泛的日常標(biāo)簽轉(zhuǎn)變?yōu)榭刹僮鳌⒖杀容^、可測量的研究對象,提供了一套明確的形式化語言。HalluWorld 則進一步展示,這套語言可以被轉(zhuǎn)化為可控制、可復(fù)現(xiàn)的實驗程序。
作者團隊并未宣稱大模型必須擁有完美的內(nèi)部世界模型。事實上,人類也會不知道、誤解和遺忘,也需要查閱資料、承認(rèn)不確定,并根據(jù)新證據(jù)修正判斷。目標(biāo)不是讓模型成為全知者,而是讓系統(tǒng)設(shè)計者明確參考世界與沖突規(guī)則,讓模型在證據(jù)邊界內(nèi)作答,并在信息不足時保留 unknown,而不是補出一個看似完整的世界。
隨著大模型從一次性問答走向長時程 Agent,靜態(tài)的 “事實正確率” 已經(jīng)不足以刻畫風(fēng)險。模型需要在不完全觀察、世界變化與證據(jù)沖突中持續(xù)更新判斷;研究者也需要知道,錯誤究竟發(fā)生在感知、記憶、因果模擬,還是不確定性表達上。
我們不僅要問模型有沒有答錯,還要問:它的回答假定了一個怎樣的世界,以及這個世界從哪一步開始偏離了現(xiàn)實。
—— 這或許才是未來幻覺研究真正應(yīng)該出發(fā)的地方。
![]()
關(guān)于作者:我們是主要來自 Stanford、CMU 等美國高校的獨立 AI 科研小隊DegenAI Labs,成立于 2025 年秋。這篇關(guān)于大模型幻覺統(tǒng)一定義的文章是我們團隊第一篇公開發(fā)布的論文,歡迎大家在公眾號或 twitter 等社媒上與我們學(xué)術(shù)交流;)
第一作者:Emmy Liu,CMU Language Technology Institute (LTI) 博士生,導(dǎo)師為 Graham Neubig;
通訊作者:Emmy Liu,Varun Gangal (Patronus AI 研究員 / CMU LTI PhD '22),Steven Y. Feng (Stanford AI 博士生 / Anthropic Research Fellow)
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.