![]()
編輯|+0
《三體》中有一個(gè)著名的「農(nóng)場(chǎng)主假說(shuō)」:農(nóng)場(chǎng)主每天上午 11 點(diǎn)準(zhǔn)時(shí)給火雞喂食,一只火雞科學(xué)家連續(xù)觀察一年后總結(jié)出「11 點(diǎn)必有食物」的規(guī)律。直到感恩節(jié)那天,農(nóng)場(chǎng)主帶來(lái)的不再是食物,而是屠刀。
這個(gè)寓言的原型來(lái)自羅素關(guān)于歸納問(wèn)題的「雞/火雞」寓言,它揭示了一個(gè)有趣的問(wèn)題:從過(guò)去數(shù)據(jù)中總結(jié)出的相關(guān)性,并不等于對(duì)世界機(jī)制的理解。火雞的問(wèn)題不只是樣本不夠多,而是它沒(méi)有理解「為什么被喂養(yǎng)」,也沒(méi)有意識(shí)到自己所處系統(tǒng)中的真實(shí)因果關(guān)系。
今天的 AI,在某種意義上也面臨類(lèi)似處境。
過(guò)去幾年,大模型讓我們看到,規(guī)模化學(xué)習(xí)可以把模式識(shí)別推到前所未有的高度。模型可以從海量語(yǔ)料、圖像、視頻和機(jī)器人軌跡中學(xué)習(xí)復(fù)雜規(guī)律,并在許多任務(wù)上表現(xiàn)出驚人的泛化能力。
但當(dāng) AI 開(kāi)始進(jìn)入物理世界,環(huán)境不再是靜態(tài)數(shù)據(jù)集,行動(dòng)也不再只是生成文本或像素。一次抓取、一次轉(zhuǎn)向,都會(huì)改變世界本身。因此,真正的問(wèn)題不只是模型能否預(yù)測(cè)下一步,而是模型能否理解自己的行動(dòng)會(huì)如何改寫(xiě)世界。
Aether AI 正是從這一問(wèn)題切入。
這家公司將自己的技術(shù)路線定義為「因果世界模型」(Causal World Models):相比只預(yù)測(cè)下一個(gè)狀態(tài)的世界模型,Aether AI 更關(guān)心模型能否識(shí)別真正影響結(jié)果的變量,理解變量之間的因果結(jié)構(gòu),并在采取行動(dòng)前模擬不同干預(yù)可能帶來(lái)的后果。
![]()
第一個(gè)落地場(chǎng)景是 Physical AI——不造機(jī)器人本體,而是構(gòu)建感知與控制之間的智能推理層,讓機(jī)器人在看到環(huán)境之后,不只是判斷「下一步最可能發(fā)生什么」,而是推演「如果我這樣做,世界會(huì)如何改變」。
圍繞這一目標(biāo),Aether AI 正在研發(fā)一套從底層表征到上層智能體決策的因果 AI 架構(gòu)。它讓模型從相關(guān)性預(yù)測(cè)走向機(jī)制建模,從被動(dòng)觀察走向主動(dòng)干預(yù),從「模仿過(guò)去見(jiàn)過(guò)的軌跡」走向「模擬干預(yù)后的后果」。
預(yù)測(cè)未來(lái),是否等于理解因果?
過(guò)去三年,AI 在「預(yù)測(cè)下一步」這件事上取得了驚人的進(jìn)展。大語(yǔ)言模型預(yù)測(cè)下一個(gè) token,視頻生成模型預(yù)測(cè)下一段畫(huà)面,具身模型預(yù)測(cè)下一個(gè)動(dòng)作,本質(zhì)上都是從海量數(shù)據(jù)中學(xué)習(xí)統(tǒng)計(jì)規(guī)律,并在當(dāng)前狀態(tài)下預(yù)測(cè)最可能發(fā)生什么。
在潛空間里做預(yù)測(cè),是其中一個(gè)關(guān)鍵進(jìn)步。以 Yann LeCun 提出的 JEPA 為例,它放棄像素級(jí)重建,轉(zhuǎn)而在抽象表征空間中預(yù)測(cè)缺失、被遮擋或未來(lái)的狀態(tài)表征,讓模型更集中地學(xué)習(xí)語(yǔ)義和結(jié)構(gòu)性信息。
但預(yù)測(cè)做得再好,仍然有一個(gè)邊界:它回答的是「接下來(lái)大概率會(huì)發(fā)生什么」,而不是「為什么會(huì)發(fā)生」。
這兩者的區(qū)別,在數(shù)字世界里可能無(wú)關(guān)緊要。預(yù)測(cè)下一個(gè)詞錯(cuò)了,重新生成就行。但在物理世界里,差距是結(jié)構(gòu)性的。一輛自動(dòng)駕駛汽車(chē)遇到訓(xùn)練數(shù)據(jù)中極少出現(xiàn)的路面狀況,一個(gè)機(jī)械手面對(duì)形狀和材質(zhì)完全不同的容器,一個(gè)機(jī)器人在長(zhǎng)程任務(wù)中某一步偏離預(yù)期——在這些時(shí)刻,僅依賴歷史相關(guān)性會(huì)變得脆弱。
僅靠預(yù)測(cè)的 AI,至少會(huì)遇到四類(lèi)問(wèn)題:
- 哪些變量真正決定了結(jié)果?——統(tǒng)計(jì)模型可能知道打雷和下雨常一起出現(xiàn),但未必知道背后的共同原因是雷暴天氣系統(tǒng)。
- 如果主動(dòng)改變某個(gè)變量,結(jié)果如何變化?——普通預(yù)測(cè)模型只能在訓(xùn)練分布覆蓋的范圍內(nèi)外推;面對(duì)從未出現(xiàn)過(guò)的干預(yù),需要更強(qiáng)的結(jié)構(gòu)假設(shè)或因果模型。
- 當(dāng)任務(wù)失敗時(shí),應(yīng)該追溯哪一個(gè)環(huán)節(jié)?——缺乏因果鏈時(shí),系統(tǒng)往往只能看到狀態(tài)偏離預(yù)期,卻難以判斷失敗來(lái)自感知錯(cuò)誤、抓取接觸、支撐關(guān)系、摩擦變化,還是上游規(guī)劃錯(cuò)誤。
- 當(dāng)環(huán)境改變時(shí),哪些機(jī)制仍然成立?——表面相關(guān)關(guān)系容易隨環(huán)境變化失效;相對(duì)穩(wěn)定的因果機(jī)制,才更可能支持跨環(huán)境泛化。
Aether AI 認(rèn)為,僅在潛空間預(yù)測(cè)狀態(tài)變化仍然不夠。面向真實(shí)世界決策,模型還需要進(jìn)一步識(shí)別具有穩(wěn)定性的因果機(jī)制,并顯式處理干預(yù)、反事實(shí)和環(huán)境變化。
世界該如何表示,行動(dòng)又如何改寫(xiě)世界?
一個(gè)面向真實(shí)世界決策的 AI 系統(tǒng),應(yīng)該如何把「因果」寫(xiě)進(jìn)模型架構(gòu)里?
不妨先看一個(gè)最簡(jiǎn)單的機(jī)器人任務(wù):推杯子。
機(jī)器人看到桌上有一個(gè)杯子,目標(biāo)是把它推到指定位置。對(duì)一個(gè)傳統(tǒng)預(yù)測(cè)模型來(lái)說(shuō),它可以從大量視頻和軌跡中學(xué)到一種統(tǒng)計(jì)規(guī)律:機(jī)械臂從左往右移動(dòng),杯子大概率也會(huì)往右移動(dòng)。但真實(shí)世界里的問(wèn)題遠(yuǎn)不止于此。杯子的材質(zhì)、杯底形狀、桌面摩擦、接觸角度、推力大小、杯子是否裝水、旁邊是否有遮擋物,都會(huì)影響最終結(jié)果。
也就是說(shuō),機(jī)器人真正要學(xué)的不是「下一幀杯子大概率在哪里」,而是「哪些因素真正決定杯子會(huì)怎么動(dòng)」。
Aether AI 并非在現(xiàn)有模型外部接一個(gè)解釋性的后處理模塊,而是把因果能力拆成三類(lèi)基礎(chǔ)問(wèn)題:世界應(yīng)該被表示成哪些變量;這些變量之間如何相互影響;當(dāng)智能體采取某個(gè)動(dòng)作時(shí),這個(gè)變量系統(tǒng)會(huì)如何演化。
這三類(lèi)問(wèn)題,可以概括為 Aether AI 技術(shù)路線中的三類(lèi)核心能力:因果特征表示學(xué)習(xí)、因果結(jié)構(gòu)發(fā)現(xiàn)和因果動(dòng)力學(xué)建模。
圍繞這三類(lèi)能力,團(tuán)隊(duì)近期的多項(xiàng)研究分別落在任務(wù)中心世界模型、交互式物體操作、生成式?jīng)Q策和跨本體動(dòng)作表示等方向上。它們共同指向同一個(gè)問(wèn)題:如何讓機(jī)器人從狀態(tài)預(yù)測(cè)走向因果干預(yù)。
因果特征表示學(xué)習(xí),解決的是「世界該被怎樣表示」。
在推杯子的場(chǎng)景里,普通視覺(jué)模型可能會(huì)把畫(huà)面壓縮成一個(gè)高維 embedding。這個(gè) embedding 里既包含杯子位置、桌面邊界、機(jī)械臂姿態(tài),也包含杯子顏色、桌布紋理、光照變化等信息。但對(duì)完成任務(wù)來(lái)說(shuō),并不是所有視覺(jué)細(xì)節(jié)都同等重要。
Aether AI 更關(guān)心的是:模型能否在隱空間中分離出真正影響任務(wù)結(jié)果的變量。比如杯子當(dāng)前位置、目標(biāo)位置、接觸點(diǎn)、桌面摩擦、杯子與機(jī)械臂之間的相對(duì)位置,這些才是機(jī)器人規(guī)劃動(dòng)作時(shí)需要重點(diǎn)使用的因素。杯子的顏色、背景紋理,通常只是任務(wù)無(wú)關(guān)噪聲。
這也是團(tuán)隊(duì)近期 TC-WM 工作所強(qiáng)調(diào)的方向。TC-WM 沒(méi)有直接把視覺(jué)基礎(chǔ)模型輸出的高維 embedding 當(dāng)成最終狀態(tài)空間,而是將其壓縮成 compact、task-sufficient 的 latent dynamic space。換句話說(shuō),它不單純追求更強(qiáng)的視覺(jué)表征,而是在尋找「足夠表達(dá)任務(wù)、又不過(guò)度攜帶冗余信息」的任務(wù)中心動(dòng)態(tài)表示。
![]()
- 論文標(biāo)題:Back to Parsimonious Latents: Learning Task-Centric World Models from Visual Foundations
- 論文地址:https://arxiv.org/abs/2605.25620
因果結(jié)構(gòu)發(fā)現(xiàn),解決的是「變量之間誰(shuí)影響誰(shuí)」。
在推杯子的任務(wù)中,杯子最終移動(dòng)了,可能是因?yàn)闄C(jī)械臂真正接觸到了杯子,也可能來(lái)自桌面傾斜、旁邊物體碰撞,或者杯子本身處在一個(gè)不穩(wěn)定支撐狀態(tài)。如果模型只學(xué)習(xí)相關(guān)性,就可能把「機(jī)械臂靠近杯子」和「杯子移動(dòng)」綁定在一起,卻沒(méi)有理解真正產(chǎn)生作用的是接觸、力傳遞和摩擦。
因果結(jié)構(gòu)發(fā)現(xiàn)要解決的,就是從變量中識(shí)別真正的因果鏈條:哪些變量只是背景噪聲,哪些變量會(huì)真正改變結(jié)果;哪些相關(guān)關(guān)系只在當(dāng)前場(chǎng)景成立,哪些機(jī)制在環(huán)境變化后仍然穩(wěn)定。
這一步的理論基礎(chǔ)來(lái)自結(jié)構(gòu)因果模型。一個(gè)因果系統(tǒng)并不只是變量集合,而是變量之間的生成機(jī)制。對(duì)機(jī)器人來(lái)說(shuō),關(guān)鍵不只是記錄「動(dòng)作 A 后經(jīng)常出現(xiàn)狀態(tài) B」,而是理解動(dòng)作 A 改變了哪些潛在變量,哪些變量又進(jìn)一步改變了結(jié)果。
因果動(dòng)力學(xué)建模,則進(jìn)一步追問(wèn)「行動(dòng)之后世界如何變化」。
機(jī)器人每一次動(dòng)作,本質(zhì)上都是一次干預(yù)。推杯子并非單純觀察世界,還要主動(dòng)改變世界。模型真正需要推演的是:如果從左側(cè)輕推,杯子會(huì)怎樣移動(dòng);如果從偏心位置用力推,杯子是否會(huì)旋轉(zhuǎn);如果桌面摩擦變大,原來(lái)的動(dòng)作是否還有效。
這也是 Aether AI 所說(shuō)的因果世界模型與傳統(tǒng)世界模型的關(guān)鍵區(qū)別。傳統(tǒng)世界模型主要預(yù)測(cè)下一狀態(tài);因果世界模型還要模擬不同干預(yù)會(huì)帶來(lái)的不同后果。
團(tuán)隊(duì)近期關(guān)于交互式物體操作的研究,可以更具體地說(shuō)明這一點(diǎn)。物體操作不是一條平滑連續(xù)的軌跡預(yù)測(cè)問(wèn)題,接觸、抓取、推動(dòng)、釋放等動(dòng)作,會(huì)讓系統(tǒng)在不同動(dòng)力學(xué)模式之間切換。模型如果忽略這些切換邊界,就容易在真正需要接觸和施力的階段失效。
在這項(xiàng)研究中,Interaction-weighted Resampling 通過(guò)圍繞接觸前、接觸中、接觸后的關(guān)鍵階段重采樣,讓模型更關(guān)注動(dòng)力學(xué)模式發(fā)生變化的位置。實(shí)驗(yàn)結(jié)果顯示,在一組交互密集型仿真任務(wù)中,該方法相比既有表示學(xué)習(xí)方法取得平均 19.8% 的性能提升;在部分交互稀疏或長(zhǎng)程操作任務(wù)中,提升幅度超過(guò) 50%。在真實(shí)機(jī)器人空氣曲棍球?qū)嶒?yàn)中,使用該方法訓(xùn)練的策略將成功率從 25% 提升至 60%。
這組數(shù)據(jù)說(shuō)明,物理世界中的樣本效率和成功率提升,不一定來(lái)自更多數(shù)據(jù),而可能來(lái)自更有效地識(shí)別「哪些交互真正改變了結(jié)果」。
![]()
- 論文標(biāo)題:Learning Object Manipulation from Scratch via Contrastive Interaction
- 論文地址:https://arxiv.org/abs/2606.11525
同樣的問(wèn)題也出現(xiàn)在更復(fù)雜的決策任務(wù)中。團(tuán)隊(duì)的 Ada-Diffuser 工作關(guān)注決策過(guò)程中的隱藏因素,認(rèn)為環(huán)境轉(zhuǎn)移、獎(jiǎng)勵(lì)結(jié)構(gòu)和行為策略都可能受這些因素影響。因此,決策模型不僅要知道「什么軌跡看起來(lái)合理」,還要建模「哪些隱藏條件讓這條軌跡成立」。
![]()
- 論文標(biāo)題:Ada-Diffuser: Latent-Aware Adaptive Diffusion for Decision-Making
- 論文地址:https://arxiv.org/abs/2605.16054
SCAR 則把 action 視為獨(dú)立表征因素,學(xué)習(xí)的不是某個(gè)機(jī)器人硬件的原始控制指令,而是動(dòng)作造成的「可控變化」本身。
這樣,當(dāng)模型遷移到不同機(jī)器人平臺(tái)時(shí),遷移的就不只是具體控制命令,還有更抽象的動(dòng)作效果。這也呼應(yīng)了黃碧薇關(guān)于統(tǒng)一動(dòng)作表示層的判斷:不同機(jī)器人雖然結(jié)構(gòu)和控制方式不同,但如果能在抽象層面表示動(dòng)作造成的世界變化,就有機(jī)會(huì)實(shí)現(xiàn)跨平臺(tái)遷移和泛化。
![]()
- 論文標(biāo)題:SCAR: Self-Supervised Continuous Action Representation Learning
- 論文地址:https://arxiv.org/abs/2605.16412
從因果表征到智能體,讓 AI 學(xué)會(huì)干預(yù)世界
在這三類(lèi)能力之上,Aether AI 用四層架構(gòu)回答「這些能力如何落到系統(tǒng)中」。
如果說(shuō)傳統(tǒng)機(jī)器人學(xué)習(xí)架構(gòu)更多是在「感知—規(guī)劃—控制」的工程鏈路上優(yōu)化,那么 Aether AI 的四層架構(gòu)想要重寫(xiě)的是模型理解世界的方式:從學(xué)習(xí)相關(guān)性,轉(zhuǎn)向識(shí)別因果變量;從記憶任務(wù)軌跡,轉(zhuǎn)向拆分可復(fù)用機(jī)制;從預(yù)測(cè)下一狀態(tài),轉(zhuǎn)向模擬干預(yù)后果;從失敗后重試,轉(zhuǎn)向定位根因并恢復(fù)。
最底層是Causation Transformer。傳統(tǒng) Transformer 擅長(zhǎng)學(xué)習(xí)統(tǒng)計(jì)依賴,回答的是「在已有數(shù)據(jù)中,什么通常和什么一起發(fā)生」;Causation Transformer 要進(jìn)一步識(shí)別因果影響,判斷「如果改變這里,結(jié)果是否會(huì)隨之改變」。
第二層是模塊化神經(jīng)架構(gòu)。傳統(tǒng)模塊化架構(gòu)通常按工程流程拆分,比如感知、規(guī)劃、控制;Aether AI 的模塊化則按機(jī)制拆分,把接觸、支撐、重力、摩擦、動(dòng)作影響等因果機(jī)制變成可復(fù)用、可組合、可遷移的模塊。這樣,當(dāng)環(huán)境、物體或機(jī)器人本體變化時(shí),模型不必從零記憶一條完整軌跡,而可以復(fù)用仍然成立的機(jī)制。
第三層是因果世界模型,也是 Aether AI 架構(gòu)的核心。傳統(tǒng)世界模型通常學(xué)習(xí)狀態(tài)轉(zhuǎn)移:給定當(dāng)前狀態(tài)和動(dòng)作,預(yù)測(cè)下一狀態(tài)。因果世界模型則進(jìn)一步追問(wèn):動(dòng)作改變了哪些因果變量,這些變量如何傳導(dǎo)到結(jié)果,以及換一種干預(yù)會(huì)發(fā)生什么。對(duì)機(jī)器人來(lái)說(shuō),這意味著模型不只是預(yù)測(cè)下一幀畫(huà)面,還要在行動(dòng)前模擬世界會(huì)如何被改變。
團(tuán)隊(duì)此前關(guān)于任務(wù)充分世界模型的研究,也能說(shuō)明這一點(diǎn)。僅靠被動(dòng)觀察數(shù)據(jù),很難知道哪些因素真正與任務(wù)有關(guān);通過(guò)主動(dòng)干預(yù)和環(huán)境課程,agent 可以收集更有信息量的軌跡,逐步暴露任務(wù)相關(guān)的潛在因素。這一思路也對(duì)應(yīng) Aether AI 所強(qiáng)調(diào)的主動(dòng)數(shù)據(jù)收集、干預(yù)式模擬和任務(wù)泛化。
- 論文標(biāo)題:Learning Task-Sufficient World Models via Intervention-Curriculum Co-Design
- 論文地址:https://openreview.net/forum?id=xFmxnyNYZJ
最頂層是因果驅(qū)動(dòng)智能體系統(tǒng)。傳統(tǒng) Agent 更依賴上下文記憶和任務(wù)序列,失敗后往往只記錄「哪一步?jīng)]有完成」,然后換一種動(dòng)作重試;因果驅(qū)動(dòng)智能體則要把因果世界模型用于規(guī)劃、歸因、記憶和恢復(fù),判斷失敗來(lái)自感知誤差、動(dòng)作偏差、環(huán)境變化,還是上游規(guī)劃錯(cuò)誤。
團(tuán)隊(duì)在因果表示強(qiáng)化學(xué)習(xí)方向上的工作,也說(shuō)明了類(lèi)似問(wèn)題。它嘗試讓智能體學(xué)習(xí)潛在因果變量及其結(jié)構(gòu)關(guān)系,從而判斷環(huán)境變化到底是普通分布偏移,還是狀態(tài)、動(dòng)作或任務(wù)空間本身發(fā)生了變化。對(duì)真實(shí)部署來(lái)說(shuō),這一點(diǎn)很關(guān)鍵:機(jī)器人不只是要在訓(xùn)練分布內(nèi)表現(xiàn)良好,還要知道變化發(fā)生在哪里,并用少量新數(shù)據(jù)完成適配。
![]()
- 論文標(biāo)題:Towards Generalizable Reinforcement Learning via Causality-Guided Self-Adaptive Representations
- 論文地址:https://proceedings.iclr.cc/paper_files/paper/2025/hash/83c230118e9f6688ba8f20bfef99e6da-Abstract-Conference.html
由此,Aether AI 的目標(biāo)不是讓 AI 更會(huì)「預(yù)測(cè)」,而是讓 AI 更懂「如何干預(yù)」。
Aether AI 與 JEPA 的關(guān)系,也可以放在這個(gè)框架下理解。二者都認(rèn)為,AI 不應(yīng)停留在像素級(jí)重建,而應(yīng)在更抽象的表征空間中建模世界。區(qū)別在于,JEPA 主要解決從像素重建到表征預(yù)測(cè)的問(wèn)題;Aether AI 則想繼續(xù)往前走,把表征預(yù)測(cè)推進(jìn)到因果干預(yù)。
黃碧薇教授在訪談中也提到,Aether AI 與 JEPA 的一個(gè)關(guān)鍵區(qū)別在于:Aether AI 不會(huì)完全去掉 pixel decoder,而是保留有意義的 decoding;更重要的是,Aether AI 嘗試在隱空間中顯式分離因果變量,并學(xué)習(xí)變量之間的因果結(jié)構(gòu)。
圈子里沒(méi)人創(chuàng)業(yè),她決定親手把理論變成產(chǎn)品
創(chuàng)始人黃碧薇教授的學(xué)術(shù)路徑,是一條不斷「意外」走向更底層問(wèn)題的路。
本科時(shí),她曾在一門(mén)「人工神經(jīng)網(wǎng)絡(luò)」課上接觸早期神經(jīng)網(wǎng)絡(luò)。那還是深度學(xué)習(xí)大規(guī)模爆發(fā)之前的年代,網(wǎng)絡(luò)結(jié)構(gòu)遠(yuǎn)沒(méi)有今天復(fù)雜。她開(kāi)始思考一個(gè)問(wèn)題:能否從人腦機(jī)制中找到改進(jìn) AI 的靈感?
這個(gè)想法把她帶進(jìn)了計(jì)算神經(jīng)科學(xué)。此后,從上海中科院神經(jīng)所的實(shí)驗(yàn)室,到德國(guó)馬普所的碩士項(xiàng)目,她一路沿著「大腦如何計(jì)算」這個(gè)問(wèn)題往下走。
轉(zhuǎn)折發(fā)生在馬普所的一次暑期學(xué)校。她聽(tīng)到了 Bernhard Sch?lkopf 關(guān)于因果推理的講座。這個(gè)此前幾乎沒(méi)有接觸過(guò)的領(lǐng)域,后來(lái)成為她持續(xù)十余年的研究主線。
博士階段,她在 CMU 師從因果發(fā)現(xiàn)領(lǐng)域的重要學(xué)者 Kun Zhang 和 Clark Glymour。此后,她在因果發(fā)現(xiàn)、因果表示學(xué)習(xí)、因果推理和可泛化機(jī)器學(xué)習(xí)方向持續(xù)發(fā)表研究工作,也參與推動(dòng)了 Causal-Learn、Causal-Copilot 等代表性工具,以及 CLeaR 因果學(xué)習(xí)與推理會(huì)議等學(xué)術(shù)社區(qū)建設(shè)。
![]()
黃碧薇與她的導(dǎo)師們以及其他因果領(lǐng)域?qū)W者。
在因果 AI 的學(xué)術(shù)世界里,黃碧薇已經(jīng)是兼具深厚理論積累和工程化視野的代表性學(xué)者之一。
但學(xué)術(shù)做得越深,她越意識(shí)到一件事:理論能告訴你方向是對(duì)的,但只有實(shí)踐才能證明這個(gè)方向是走得通的。實(shí)驗(yàn)室資源和工程條件有限,而她要驗(yàn)證的東西——因果世界模型能否在物理世界中真正工作——需要遠(yuǎn)超實(shí)驗(yàn)室規(guī)模的工程投入。
過(guò)去,這件事并不容易發(fā)生。
一方面,因果 AI 長(zhǎng)期更接近基礎(chǔ)研究。因果發(fā)現(xiàn)、因果推理、潛在結(jié)果等方法論派系各自深耕,但它們要進(jìn)入復(fù)雜系統(tǒng),需要足夠強(qiáng)的表征能力、足夠大的數(shù)據(jù)規(guī)模和足夠成熟的工程基礎(chǔ)。另一方面,過(guò)去的機(jī)器人和具身智能系統(tǒng)還沒(méi)有形成足夠清晰的落地窗口,許多問(wèn)題仍停留在實(shí)驗(yàn)室任務(wù)里,產(chǎn)業(yè)側(cè)對(duì)「因果」這類(lèi)底層能力的需求并不顯性。
現(xiàn)在,窗口開(kāi)始變化。
大模型證明了 Scale 的力量,也為 AI 系統(tǒng)提供了更強(qiáng)的感知、表征和生成能力。但當(dāng)模型從數(shù)字世界走向物理世界,僅靠規(guī)模化預(yù)測(cè)的邊界也開(kāi)始暴露:模型可以學(xué)習(xí)大量軌跡,卻未必知道哪些變量真正改變結(jié)果;可以模仿成功動(dòng)作,卻未必能在環(huán)境變化后解釋失敗原因;可以生成看似合理的計(jì)劃,卻未必理解行動(dòng)會(huì)如何改寫(xiě)世界。
換句話說(shuō),大模型提供了新的底層能力,但它仍然缺少因果層。物理世界正在暴露 Scale without Structure 的危險(xiǎn):機(jī)器人模型換一個(gè)環(huán)境就失效,自動(dòng)駕駛在訓(xùn)練分布之外就可能變得脆弱,VLA 模型在長(zhǎng)程任務(wù)中仍然面臨錯(cuò)誤恢復(fù)和任務(wù)泛化難題。至少在 Aether AI 的判斷中,這些問(wèn)題背后,是缺少因果結(jié)構(gòu)帶來(lái)的系統(tǒng)性瓶頸。
與此同時(shí),Physical AI 正在從概念走向落地。機(jī)器人、自動(dòng)駕駛、工業(yè)自動(dòng)化等系統(tǒng)開(kāi)始進(jìn)入更復(fù)雜、更開(kāi)放的環(huán)境,泛化、長(zhǎng)尾、失敗歸因和跨平臺(tái)遷移,正在從實(shí)驗(yàn)室問(wèn)題變成真實(shí)部署中的工程痛點(diǎn)。
這也是黃碧薇認(rèn)為「現(xiàn)在」是把因果 AI 推向產(chǎn)業(yè)的時(shí)機(jī)的原因。因果 AI 不再只是一個(gè)學(xué)術(shù)問(wèn)題,而開(kāi)始成為物理世界 AI 系統(tǒng)能否真正泛化、恢復(fù)和可靠部署的工程問(wèn)題。
「真正核心圈子里,沒(méi)有人創(chuàng)業(yè)。」黃碧薇這樣描述因果 AI 學(xué)術(shù)界的現(xiàn)狀。因果發(fā)現(xiàn)、因果推理、潛在結(jié)果等方法論長(zhǎng)期各自深耕,但很少有人將它們?nèi)跁?huì)貫通,并進(jìn)一步帶到真實(shí)工程系統(tǒng)中接受檢驗(yàn)。
她選擇從 Physical AI 切入,因?yàn)槟鞘且蚬评碜钣埠说恼n題。在物理世界里,每一次機(jī)器人動(dòng)作都是一次干預(yù),每一步失誤都立刻暴露,正如她所說(shuō):「機(jī)器人不會(huì)原諒統(tǒng)計(jì)捷徑。
跨過(guò)預(yù)測(cè)的邊界
Physical AI 真正的難處,是讓機(jī)器人在沒(méi)見(jiàn)過(guò)的場(chǎng)景里,仍然分得清什么會(huì)改變結(jié)果、什么只是背景噪聲。
Aether AI 的判斷是,進(jìn)入物理世界后,AI 不能只學(xué)習(xí)「過(guò)去通常怎樣」,還必須理解「什么真正改變結(jié)果」。因果世界模型要補(bǔ)上的,正是從預(yù)測(cè)未來(lái)到干預(yù)未來(lái)之間的這一層。
回到那只火雞。它的失敗不是因?yàn)椴粫?huì)預(yù)測(cè),而是把重復(fù)發(fā)生的事誤認(rèn)為世界機(jī)制。AI 如果想避免成為一只更復(fù)雜的火雞,也必須跨過(guò)這一步。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.