![]()
潛在世界模型(Latent world models),能讓機器人在行動前先推演未來,再據(jù)此規(guī)劃動作。2022 年,圖靈獎得主楊立昆團(tuán)隊提出了聯(lián)合嵌入預(yù)測架構(gòu)(JEPA),通過在潛空間中預(yù)測未來狀態(tài)演化,推動表征空間預(yù)測成為世界模型研究中的重要范式。
問題在于,多數(shù)世界模型在訓(xùn)練完成后參數(shù)便不再更新,難以及時適應(yīng)真實場景中變化的視覺條件和物理屬性。一旦編碼器或預(yù)測器失準(zhǔn),誤差就會在后續(xù)規(guī)劃中逐步放大,最終導(dǎo)致任務(wù)失敗。
但我們?nèi)祟悇t不同,感覺運動自適應(yīng)機制是我們適應(yīng)環(huán)境變化的核心能力。我們會根據(jù)感官反饋校準(zhǔn)動作預(yù)測,也會根據(jù)新經(jīng)驗不斷調(diào)整對環(huán)境的理解。
受到了這一生物學(xué)原理的啟發(fā),楊立昆團(tuán)隊提出了能在部署過程中持續(xù)學(xué)習(xí)的自適應(yīng)潛在世界模型 AdaJEPA,將自適應(yīng)嵌入模型預(yù)測控制(MPC)的閉環(huán)中:每執(zhí)行一個動作,就用實際觀測的狀態(tài)轉(zhuǎn)移校正模型,再用更新后的模型重新規(guī)劃。
![]()
論文鏈接:https://arxiv.org/abs/2606.32026
結(jié)果顯示,AdaJEPA 在分布內(nèi)任務(wù)和多種分布偏移下都能穩(wěn)定提高規(guī)劃成功率,即使每次重新規(guī)劃前只做一次輕量更新,也普遍優(yōu)于訓(xùn)練后參數(shù)不再更新的世界模型。
這項工作為自適應(yīng)世界模型開啟了一個有前景的方向:世界模型應(yīng)在行動過程中持續(xù)根據(jù)真實反饋校準(zhǔn)預(yù)測、更新表征,從而更好地適應(yīng)變化的環(huán)境。
AdaJEPA:一個懂“自適應(yīng)”的世界模型
AdaJEPA 是一種自適應(yīng)潛在世界模型,能夠在機器人執(zhí)行任務(wù)過程中持續(xù)修正預(yù)測。每完成一步動作,模型都會利用新的真實觀測校正偏差,并據(jù)此重新規(guī)劃。整個過程不需要額外離線數(shù)據(jù)、獎勵標(biāo)簽或專家示范。整個流程可概括為四步:規(guī)劃、執(zhí)行、校正和重新規(guī)劃。具體如下:
![]()
圖|AdaJEPA 在閉環(huán) MPC 中執(zhí)行測試時自適應(yīng)。
- 規(guī)劃:模型在內(nèi)部推演接下來幾步的狀態(tài)變化,比較多組候選方案,選出最有可能靠近目標(biāo)的動作序列。
- 執(zhí)行:規(guī)劃完成后,模型只執(zhí)行第一個動作或一小段動作,然后觀測環(huán)境的真實反饋。執(zhí)行前的狀態(tài)變化會被記錄下來,作為后續(xù)自適應(yīng)的學(xué)習(xí)樣本。
- 自適應(yīng):動作執(zhí)行后,AdaJEPA 將這一步產(chǎn)生的狀態(tài)轉(zhuǎn)移寫入在線緩沖區(qū),并用它檢驗?zāi)P皖A(yù)測是否準(zhǔn)確。如果預(yù)測的下一狀態(tài)與真實結(jié)果存在偏差,模型就把這部分誤差作為更新信號,進(jìn)行一次輕量校正,為下一輪規(guī)劃做準(zhǔn)備。
- 重新規(guī)劃:完成自適應(yīng)后,模型會從最新觀測出發(fā),用更新后的世界模型重新預(yù)測后續(xù)軌跡,并生成新的動作序列。整個任務(wù)過程中,執(zhí)行自適應(yīng)重新規(guī)劃”的循環(huán)會不斷重復(fù),使每一輪規(guī)劃都建立在最新觀測和最新模型之上。
此外,為避免拖慢實時規(guī)劃,AdaJEPA 只做輕量更新:調(diào)整少量參數(shù),維護(hù)小型在線緩沖區(qū),并沿用預(yù)訓(xùn)練階段的目標(biāo)函數(shù)。具體如下:
- 只更新關(guān)鍵層:AdaJEPA 不更新整個世界模型,而是僅調(diào)整編碼器和預(yù)測器中的少量關(guān)鍵層,這樣做既能降低計算開銷,也能減少對已有表征的擾動。
- 維護(hù)小型在線緩沖區(qū):緩沖區(qū)默認(rèn)保存最近 5 條真實狀態(tài)轉(zhuǎn)移。研究團(tuán)隊比較了兩種保留方式:recent-N 保留最近轉(zhuǎn)移,hard-N 保留預(yù)測誤差最大的轉(zhuǎn)移。結(jié)果顯示,兩種方式差異不大,但 recent-N 更穩(wěn)定。
- 沿用預(yù)訓(xùn)練階段的目標(biāo)函數(shù):自適應(yīng)階段保持與預(yù)訓(xùn)練相同的預(yù)測目標(biāo),用真實觀測對應(yīng)的表征作為監(jiān)督信號。為減少對已有表征的擾動,目標(biāo)表征僅作為參照,不參與梯度回傳。
效果如何?
整體來看,AdaJEPA 在分布內(nèi)任務(wù)和多種分布偏移下都能穩(wěn)定提高規(guī)劃成功率。研究團(tuán)隊在推物體任務(wù) PushT / PushObj 和迷宮導(dǎo)航任務(wù) PointMaze 上評估模型,覆蓋形狀、視覺、動力學(xué)和布局等變化場景。即使每次重新規(guī)劃前只做一次輕量更新,AdaJEPA仍普遍優(yōu)于訓(xùn)練后參數(shù)不再更新的世界模型。具體結(jié)果如下:
1. 分布內(nèi)任務(wù)
結(jié)果表明,AdaJEPA 在測試時自適應(yīng)不會犧牲原有能力,還能進(jìn)一步提升任務(wù)成功率。無論是用 GD 直接優(yōu)化動作序列,還是用 CEM 通過采樣和篩選候選動作來搜索,AdaJEPA 的成功率都高于不進(jìn)行測試時自適應(yīng)的基線。提升最明顯的是推物體任務(wù),最高成功率提升超過 20%;在迷宮導(dǎo)航任務(wù)中,原模型本身已經(jīng)表現(xiàn)較強,AdaJEPA 仍能保持相近水平,沒有明顯退化。
![]()
圖|PointMaze 在動力學(xué)變化和布局變化條件下的規(guī)劃成功率。
2. 分布外任務(wù)
在環(huán)境變化更明顯的任務(wù)中,AdaJEPA 的優(yōu)勢更突出。它會在每輪規(guī)劃和執(zhí)行后,用新的真實反饋更新世界模型,讓后續(xù)規(guī)劃更貼近當(dāng)前環(huán)境,提升任務(wù)成功率。相比之下,訓(xùn)練后不再更新的模型無法利用這些新觀測,成功率往往很快到達(dá)上限。
![]()
圖|在形狀變化和視覺變化條件下的規(guī)劃成功率。
具體來看,在多形狀推物體任務(wù)中,如果測試時出現(xiàn)訓(xùn)練階段沒見過的物體形狀,AdaJEPA 的提升最明顯,成功率接近翻倍;視覺擾動中,模糊、噪聲和暗光照帶來的增益更明顯;如果只是錨點或物體顏色改變,AdaJEPA 的優(yōu)勢則相對有限。在 PointMaze 迷宮導(dǎo)航中,AdaJEPA 還能適應(yīng)動力學(xué)變化和新迷宮布局,并在新布局下規(guī)劃出更接近最短路徑的軌跡。
![]()
圖|多樣化迷宮中的規(guī)劃軌跡。
![]()
圖|PointMaze-Medium 在動力學(xué)變化條件下的規(guī)劃軌跡。
3.AdaJEPA 在多種 JEPA 實現(xiàn)上均有提升
為驗證 AdaJEPA 是否依賴某一種特定模型實現(xiàn),研究團(tuán)隊在 PushT 推物體任務(wù)上,分別更換表征形式、模型架構(gòu)、訓(xùn)練目標(biāo)和規(guī)劃器進(jìn)行測試。結(jié)果顯示,AdaJEPA 在這些設(shè)置下都能提高規(guī)劃成功率;即使基線模型已經(jīng)充分訓(xùn)練、評估仍在分布內(nèi),測試時自適應(yīng)依然帶來穩(wěn)定增益,每次重新規(guī)劃只增加約 0.01–0.03 秒延遲。
![]()
圖|不同實現(xiàn)下的 AdaJEPA 表現(xiàn)。
4.AdaJEPA 不是從頭學(xué)習(xí)新世界,而是在校正已有預(yù)測
可視化結(jié)果顯示,AdaJEPA 的自適應(yīng)更像是在校準(zhǔn),而不是重新學(xué)習(xí)。研究團(tuán)隊將自適應(yīng)后的預(yù)測軌跡解碼出來后發(fā)現(xiàn),即使遇到視覺擾動或未見形狀,解碼結(jié)果仍傾向于保留訓(xùn)練分布中的結(jié)構(gòu)特征。例如,紅色方塊會被解碼成訓(xùn)練中常見的灰色方塊,未見形狀也會被解碼成相近的已見形狀。
![]()
圖|視覺變化和形狀變化條件下的 AdaJEPA 規(guī)劃軌跡示例。
5.消融實驗與分析
消融實驗結(jié)果顯示,AdaJEPA 不需要大范圍更新,也不依賴復(fù)雜調(diào)參;少量關(guān)鍵層更新、一步梯度更新和近期狀態(tài)轉(zhuǎn)移緩沖區(qū),已經(jīng)能帶來穩(wěn)定收益。
首先,AdaJEPA 只更新編碼器或預(yù)測器的部分層,或者采用 LoRA 做輕量更新時,整體表現(xiàn)都優(yōu)于不進(jìn)行測試時自適應(yīng)的基線,說明它不需要重訓(xùn)整個模型。
其次,不同分布偏移對更新位置的需求不同。形狀變化下,各種更新方案差異不大,主要調(diào)整預(yù)測器即可;視覺和布局變化下,僅更新預(yù)測器效果有限,編碼器也需要參與。布局變化中,更新預(yù)測器第一層效果最好,可能因為它最早融合潛在狀態(tài)和動作信息,更容易校正新的局部轉(zhuǎn)移關(guān)系。
此外,默認(rèn)超參數(shù)已經(jīng)足夠穩(wěn)定。在超參數(shù)設(shè)置上,AdaJEPA 默認(rèn)沿用訓(xùn)練階段學(xué)習(xí)率,每次重規(guī)劃前只做一步梯度更新,并保留近期狀態(tài)轉(zhuǎn)移作為緩沖區(qū)。更大學(xué)習(xí)率或更多更新步數(shù)可能增強適應(yīng)效果,但也會增加不穩(wěn)定性和計算開銷。總體來看,默認(rèn)設(shè)置已經(jīng)能在效果、穩(wěn)定性和延遲之間取得較好平衡。
![]()
圖|適應(yīng)超參數(shù)和回放緩沖區(qū)對規(guī)劃成功率的影響。
6.訓(xùn)練數(shù)據(jù)規(guī)模和形狀多樣性對 AdaJEPA 的影響
實驗結(jié)果表明,AdaJEPA 的效果不僅取決于訓(xùn)練數(shù)據(jù)量,也取決于訓(xùn)練數(shù)據(jù)是否足夠多樣。對 PushObj 多形狀推物體任務(wù)來說,形狀多樣性比單純堆疊同一形狀的軌跡更關(guān)鍵;同時,測試時自適應(yīng)可以在數(shù)據(jù)不足時彌補部分泛化缺口。
具體來看,在總軌跡數(shù)相同的情況下,將數(shù)據(jù)分配到更多物體形狀上,比集中在單一形狀上更有利于泛化到未見形狀。例如總軌跡數(shù)同為 16k 時,覆蓋四種形狀的 AdaJEPA 在未見形狀上的成功率為 51.9%,高于只覆蓋單一形狀時的 45.8%。
此外,AdaJEPA 在不同數(shù)據(jù)規(guī)模下都能提升成功率,低數(shù)據(jù)場景下收益尤其明顯。即使訓(xùn)練階段只覆蓋較少形狀和軌跡,模型也能在部署過程中利用新觀測校正預(yù)測。例如在已見形狀上,只用 1 種形狀、1k 條軌跡訓(xùn)練 AdaJEPA,成功率達(dá)到 60.8%,高于使用 4 種形狀、總計 64k 條軌跡訓(xùn)練但測試時不更新的模型。
![]()
圖|訓(xùn)練數(shù)據(jù)規(guī)模對 PushObj 規(guī)劃成功率的影響:形狀多樣性 (K) 與每種形狀的軌跡數(shù)量。
不足與未來方向
盡管 AdaJEPA 在多類規(guī)劃任務(wù)中都帶來了穩(wěn)定增益,但仍存在以下不足:
由于 AdaJEPA 只在規(guī)劃期間進(jìn)行輕量級修正,其有效性仍受到預(yù)訓(xùn)練表征覆蓋范圍的限制。當(dāng)測試環(huán)境中出現(xiàn)訓(xùn)練階段未涵蓋的關(guān)鍵特征時,自適應(yīng)雖然可以在一定程度上改善規(guī)劃結(jié)果,但仍難以完全彌合這一表征差距。未來,輕量級測試時自適應(yīng)還需要與持續(xù)學(xué)習(xí)、主動學(xué)習(xí)結(jié)合,使世界模型能夠在長期部署中不斷積累新經(jīng)驗,逐步擴展對環(huán)境變化的覆蓋范圍。
更多技術(shù)細(xì)節(jié),詳見原論文。
作者:夏千斯
如需轉(zhuǎn)載或投稿,請直接在本文章評論區(qū)內(nèi)留言
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.