![]()
引言
大規(guī)模視頻擴散模型在視覺質(zhì)量上取得了令人矚目的成就,但它們在保持幾何一致性方面往往力不從心。具體表現(xiàn)為:生成的視頻常常出現(xiàn)幾何漂移、攝像機軌跡不穩(wěn)定以及場景結(jié)構(gòu)不連貫等問題。這對于具身智能、世界動作模型等要求穩(wěn)定攝像機運動和連貫 3D 幾何的下游應(yīng)用來說,是一個致命的缺陷。
以往為了解決這些問題,研究者們主要采取兩種思路:一種是修改生成器架構(gòu),加入額外的模塊或幾何感知對齊;另一種是采用基于強化學(xué)習(xí)的后訓(xùn)練對齊。然而,修改架構(gòu)可能會破壞互聯(lián)網(wǎng)規(guī)模預(yù)訓(xùn)練模型的泛化能力;而現(xiàn)有的對齊方法不僅局限于靜態(tài)場景,還依賴于 RGB 空間的獎勵,這需要反復(fù)進行 VAE 解碼,導(dǎo)致計算開銷巨大,而且無法泛化到高度動態(tài)的真實世界場景中。
最近,來自 Google、哥本哈根大學(xué)、牛津大學(xué)等機構(gòu)的研究者提出了 VGGRPO(Visual Geometry GRPO,收錄于 ECCV 2026)。這項工作聚焦于一個核心問題:如何在不犧牲預(yù)訓(xùn)練模型泛化能力的前提下,高效地提升視頻生成的幾何一致性,并使其適用于動態(tài)場景。其核心思路是,在隱空間(latent space)中利用 4D 幾何獎勵,進行幾何感知的視頻后訓(xùn)練。
![]()
圖 1 VGGRPO 生成的世界一致視頻。左側(cè)為基線模型,右側(cè)為 VGGRPO 對齊后的模型。VGGRPO 在挑戰(zhàn)性動態(tài)場景中顯著減少了幾何漂移和結(jié)構(gòu)偽影,生成了更連貫的場景結(jié)構(gòu)和更平滑的攝像機運動。
![]()
- 論文標題:VGGRPO: Towards World-Consistent Video Generation with 4D Latent Reward
- 論文主頁:https://zhaochongan.github.io/projects/VGGRPO/
- 論文鏈接:https://arxiv.org/pdf/2603.26599
VGGRPO 做了什么?
VGGRPO 是一個由隱式幾何引導(dǎo)的、基于組的強化學(xué)習(xí)(GRPO)視頻后訓(xùn)練框架。它包含兩個緊密耦合的核心組件:隱式幾何模型(Latent Geometry Model, LGM)和 VGGRPO 訓(xùn)練流程。
![]()
圖 2 VGGRPO 方法概覽。(a) 隱式幾何模型訓(xùn)練:通過輕量級連接層將 VAE 隱變量與幾何基礎(chǔ)模型對齊,直接從隱空間預(yù)測 4D 場景幾何。(b) VGGRPO 訓(xùn)練:在隱空間中利用攝像機運動平滑度獎勵和幾何重投影一致性獎勵進行 GRPO 優(yōu)化。
首先,VGGRPO 構(gòu)建了一個隱式幾何模型(Latent Geometry Model, LGM)。通過一個輕量級的連接層,LGM 將視頻擴散模型的隱變量(latents)與幾何基礎(chǔ)模型 “縫合” 在一起。這意味著,模型可以直接從隱空間解碼出場景幾何信息,而無需先將其解碼回 RGB 像素空間。更重要的是,通過采用具備 4D 重建能力的幾何模型(Any4D),LGM 讓 VGGRPO 自然地擴展到了動態(tài)場景,突破了以往方法僅限靜態(tài)場景的瓶頸。
在此基礎(chǔ)上,VGGRPO 設(shè)計了兩個關(guān)鍵的獎勵機制,在隱空間中進行組相對策略優(yōu)化(GRPO),徹底免去了昂貴的 VAE 解碼過程。
1. 攝像機運動平滑度獎勵(Camera Motion Smoothness Reward):告別抖動的鏡頭
在生成的視頻中,不穩(wěn)定的攝像機運動往往會導(dǎo)致時間上的扭曲和結(jié)構(gòu)上的偽影。為了鼓勵穩(wěn)定且符合物理規(guī)律的攝像機軌跡,VGGRPO 基于隱式幾何模型預(yù)測的攝像機位姿,計算平移和旋轉(zhuǎn)的加速度,對抖動的軌跡進行懲罰。平滑、近勻速的軌跡獎勵接近 1,而抖動的運動則會使獎勵降低。這一獎勵機制促使模型生成更加平滑的鏡頭運動。
2. 幾何重投影一致性獎勵(Geometry Reprojection Consistency Reward):跨視角的 3D 連貫性
僅僅鏡頭平滑還不夠,同一場景在不同視角下必須保持幾何上的一致。VGGRPO 利用預(yù)測的點云、深度、攝像機參數(shù)和場景光流,將預(yù)測的 3D 結(jié)構(gòu)重投影到各個視角中,并比較深度圖的差異。對于動態(tài)場景,它還能利用場景光流過濾掉動態(tài)區(qū)域,僅聚合靜態(tài)點來獲得穩(wěn)定的場景表示,強有力地保證了跨視角的幾何連貫性。
實驗結(jié)果
![]()
圖 3 靜態(tài)和動態(tài)場景的定性比較。
廣泛的實驗表明,VGGRPO 在靜態(tài)和動態(tài)場景基準測試中均取得了顯著的提升。VGGRPO 在靜態(tài)和動態(tài)場景的幾何相關(guān)指標上均領(lǐng)先基線方法。在通用視頻質(zhì)量指標上,VGGRPO 同樣超越基線,表明幾何感知后訓(xùn)練沒有犧牲預(yù)訓(xùn)練模型的生成能力。
![]()
圖 4 獎勵組件消融實驗。
此外,在圖 4 獎勵組件消融實驗中展示了單獨使用攝像機運動獎勵(r_motion)可以穩(wěn)定攝像機軌跡,但幾何偽影依然存在(綠圈標注)。加入幾何重投影一致性獎勵(r_motion + r_geo)后,場景幾何得到進一步改善,同時保持了平滑的攝像機運動,驗證了兩個獎勵的互補性。
VGGRPO 的意義是什么?
現(xiàn)在的視頻生成模型不僅要生成視覺真實的畫面,還需要 “創(chuàng)造一個符合物理規(guī)律的一致世界”。
VGGRPO 給出的答案是:不需要復(fù)雜的架構(gòu)修改,也不需要昂貴的像素級獎勵。通過將幾何先驗直接引入隱空間,并在 4D 維度上進行強化學(xué)習(xí)對齊,它讓模型在生成視頻時,既能保持鏡頭的平滑,又能構(gòu)建出跨視角連貫的物理世界,并適用于動態(tài)場景。
對于世界動作模型、具身智能等領(lǐng)域而言,穩(wěn)定而一致的世界建模能力是模型進行預(yù)測、規(guī)劃與交互的重要基礎(chǔ)。VGGRPO 為此提供了一種高效、靈活的幾何感知后訓(xùn)練范式。
作者介紹
安照崇現(xiàn)為哥本哈根大學(xué)博士生,隸屬于 Pioneer Centre for Artificial Intelligence 和 ELLIS 項目,導(dǎo)師為 Serge Belongie 教授。他于 2023 年獲得蘇黎世聯(lián)邦理工學(xué)院(ETH Zurich)計算機科學(xué)碩士學(xué)位,導(dǎo)師為 Luc Van Gool 教授。他的研究方向主要包括視頻生成,多模態(tài)以及世界模型。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.