![]()
本文刊發于《現代電影技術》2026年第6期
專家點評
金小剛
二級教授
中浙江大學-騰訊公司智能圖形與互動娛樂創新技術聯合實驗室主任
浙江省虛擬現實產業聯盟理事長
立體電影可通過雙目視差為觀眾營造深度沉浸式體驗,但傳統立體視頻制作依賴人工深度圖,周期長、成本高,且大視角易產生遮擋缺失。深度學習方法雖提升了自動化水平,卻囿于二維回歸范式,缺乏三維顯式建模。3D高斯潑濺(3DGS)將場景表達為可微分三維高斯橢球,實現了單圖重建物理真實體積空間,為立體電影制作開辟了一條新路徑。蘋果公司推出的SHARP模型以前饋神經網絡從單幀回歸百萬高斯基元,繞開多視角采集局限,使“單目輸入、立體輸出”自動化流程具備工程可行性。未來,3D高斯潑濺需向時序連貫、實時交互創作及生理舒適度評價發展演進,方能從離線渲染模式走向電影工業化常態,推動后期制作從手工修補邁入智能驅動時代。《基于三維高斯潑濺的立體電影制作技術質量評價框架與SHARP模型適應性研究》一文以電影攝影美學為參照,構建AI立體視頻制作評價框架,融合感知指標與光學、影調、空間三大變量,系統評估SHARP模型在廣角、淺景深、運動模糊、低照度、黑白影像、霧氣、復雜遮擋等場景表現。實驗表明,SHARP模型在黑白影像和低照度下表現優異,因深度預測依賴亮度梯度;但在散焦語義、細碎遮擋結構及時序一致性上存在局限。本文有助于讀者理解算法適應邊界,為立體視頻制作工程選型及優化提供了美學參照。
項目信息
中國傳媒大學校級科研項目“草圖驅動生成的高可控人工智能動畫技術流程開發”(CUCAI2516)。
作者簡介
![]()
王 雷
博士,教授,中國傳媒大學動畫與數字藝術學院院長、博士生導師,中國傳媒大學英特爾人工智能生成藝術創作實踐中心主任,主要研究方向:動畫藝術創作、三維動畫技術、AI生成藝術。
鄭媛月
中國傳媒大學動畫與數字藝術學院2024級博士研究生,主要研究方向:動畫與數字藝術創作。
![]()
摘要
本文圍繞3D高斯潑濺(3DGS)在立體電影制作中的應用,研究基于SHARP模型的單目到立體視頻生成方法及工程化實現,提出面向人工智能(AI)立體電影制作技術質量的評價框架,將傳統圖像質量指標與感知指標相結合,并引入電影攝影邏輯框架中光學、影調與空間美學變量,構建結構化測試體系。研究實驗覆蓋典型攝影條件,深入分析了SHARP模型在不同場景下的適應性邊界,為相關研究提供了實驗參照。研究表明,前饋式3DGS技術在立體電影制作中具備應用潛力,本研究提出的技術質量評價框架為三維高斯潑濺技術在立體視頻制作中的應用提供了可解釋的評價路徑。
關鍵詞
3D高斯潑濺(3DGS);SHARP模型;立體電影制作;電影質量評價;體積視頻
1
引言
2025年,電影《超人》(Superman)在制作中引入3D高斯潑濺(3D Gaussian Splatting, 3DGS)技術,用于構建主角超人的氪星父母全息影像等關鍵視覺段落。該方法通過多視角數據或體積捕獲,將動態場景表示為可微分的三維高斯集合[1],從而支持在后期任意視角下進行高質量新視圖渲染,實現具有真實攝影質感的體積視頻(Volumetric Video)生成,營造“劇場環繞式觀看般”的體驗[2]。3DGS技術的行業應用,加速了電影制作從模型驅動向數據驅動的范式躍遷,使電影制作開始擺脫對復雜幾何重建的依賴、提升復雜場景的重建效率,也在真實感表達上達到了新的高度,轉向一種更符合光學傳播規律的空間表示方式。
在單目到立體視頻生成領域,傳統流程高度依賴人工逐幀遮罩(Rotoscoping)與深度圖繪制(Depth Painting),制片周期長、成本高昂,且在時序一致性方面容易引入誤差。基于深度圖像的渲染(Depth Image?Based Rendering,DIBR)技術提高了立體視頻生成的自動化程度[3],但在大視角偏移條件下仍存在遮擋缺失與幾何拉伸問題。近年來,基于單目圖像的深度學習(Deep Learning, DL)方法在深度估計任務中取得進展[4],但其本質仍屬于從二維到深度的回歸范式,缺乏對完整三維結構的顯式建模能力,因此難以支持自由視點生成與復雜攝影機運動,在真實感與幾何一致性方面存在局限。
在此背景下,3DGS為立體電影制作和立體視頻生成提供了新的技術路徑,通過顯式三維高斯場實現直接多視角渲染[5]。為解決傳統優化驅動型3DGS依賴多視角輸入進行優化訓練、難以直接應用于單目視頻立體生成任務的問題,蘋果公司提出并開源單幀圖像高精度實時視差(Single?image High?accuracy Real?time Parallax, SHARP)模型,通過前饋神經網絡從單張圖像直接回歸約120萬組高斯基元(Gaussian Primitive)的空間位置、協方差矩陣、顏色球諧系數與不透明度參數,從而繞過多視角采集與優化過程,實現單圖像到三維高斯場的快速重建,并支持自由視角渲染[6]。其可自由放置虛擬攝影機并生成具備高度空間一致性的新視角圖像,為解決傳統3DGS“每場景一組參數”的可泛化性局限提供了新的路徑啟示。
本研究通過分析SHARP模型的底層邏輯及其開源實現框架ml?sharp在立體視頻生成中的具體管線,完成左右分屏(Side?by?Side, SBS)立體視頻生成實驗,并提出一套面向人工智能(AI)立體視頻生成的電影級評價框架,重點探討立體視頻生成方法在不同鏡頭類型與空間結構條件下的表現差異,并進一步討論3DGS技術在電影后期自動化流程中的應用潛力。
2
SHARP模型及ml?sharp實現方法
2.1 從隱式神經場到顯式高斯基元的范式演進
3DGS的出現標志著神經渲染從以神經輻射場(NeRF)為代表的以體積積分為核心的隱式表達[7],轉向了以可微分、光柵化為核心的顯式表達。這種范式轉向在電影后期制作中具有重要意義,在保證照片級質量的同時,賦予了創作者對場景資產的直接物理操縱權。
在數學定義上,3DGS將空間建模為數百萬個各向異性的三維高斯分布。每個高斯基元攜帶位置均值、由縮放和旋轉矩陣定義的協方差矩陣、用于捕獲視角相關色彩的三階球面諧波(Spherical Harmonics)系數(SH)和不透明度參數[8]。這種顯式表征使3DGS能夠捕捉金屬反射、次表面散射等細微光場變化,為單目視圖合成提供物理基礎。
傳統3DGS屬于“優化驅動型”算法,通過梯度下降不斷優化高斯參數集合,以降低渲染誤差,其依賴多視角約束,且需對每個場景獨立迭代,難以滿足立體電影制作管線的大規模自動化需求。為此,前饋式(Feed?forward)3DGS方法逐漸成為重要發展趨勢,其通過引入神經網絡預測器,將傳統逐場景優化過程轉化為一次前向推理。近年來,如pixelSplat[9]、GS?LRM[10]、LGM[11]與FreeSplat[12]等基于多視圖輸入的前饋式重建方法,利用多視圖幾何約束,通過學習跨視角特征關聯,實現對3D高斯參數的直接預測。當前絕大多數需要完成3D制作的電影素材采用單目方式拍攝,而上述方法需依賴多視角輸入條件,因此難以得到實際應用。此外,如Splatter a Video[13]、SplineGS[14]、Video?3DGS[15]及NutWorld[16]等研究從時間維度出發,通過顯式建模高斯基元的時間演化或引入跨幀約束,在緩解幀間閃爍方面取得顯著效果,但通常伴隨著更高的計算復雜度與系統開銷。
電影制作迫切需要真正實現“單張圖像輸入、3D高斯場處理、任意新視角輸出”這一完整閉環的實用方法。SHARP模型通過引入基于深度學習(DL)的前饋回歸范式,不再依賴針對特定素材的反復迭代,不再將重建視為針對特定場景的優化問題,而是通過在大規模3D資產庫上進行預訓練,學習到從2D像素特征到3D空間結構的統計先驗,將其轉化為一個基于大規模數據驅動的回歸問題,其逐幀獨立推理路徑無需維護跨幀狀態或執行序列級優化,具備天然的并行性,適用于分布式渲染與離線批處理流程。該方法使每幀的空間結構完全由當前圖像驅動,有利于避免誤差在時間維度上的累積擴散,且與傳統電影后期的鏡頭級處理工作流高度兼容,便于與現有工業管線集成。
2.2 SHARP模型:單目視圖合成的前饋回歸范式
SHARP模型突破了3DGS的冷啟動問題,其核心邏輯在于利用預訓練的深度神經網絡,學習二維像素特征與三維空間拓撲間的非線性映射關系(圖1)。
![]()
圖1 SHARP模型工作流程示意圖
模型采用了基于Transformer的視覺編碼器(如ViT?L/B)[17]提取全局語義與幾何先驗,對輸入圖像(I)編碼得到多尺度特征(F),為后續三維參數預測提供上下文信息,如式(1)所示。
F=Encoder(I) (1)
SHARP的核心架構是一個高效的解碼器,其在特征圖的每個像素位置處回歸出一組高斯參數,直接預測位置回歸、形狀與各向異性、輻射度量等高斯基元的所有屬性。其中,位置回歸(Δμ)指在預測深度圖D的基礎上,通過反投影算子確定高斯球的空間中心;形狀與各向異性(S, R)為回歸各向異性的縮放和旋轉參數,使高斯球能夠自適應地貼合場景中諸如細小的發絲或銳利的建筑輪廓等物體的邊緣;輻射度量(SH, α)預測球面諧波系數(SH)和不透明度(α)。這種全參數回歸的能力,使SHARP模型的生成結果具備更穩定的空間層次與更高的真實感。
SHARP模型在訓練過程中引入了強有力的幾何約束,實現了對場景結構的形狀感知,對前饋式3DGS研究領域做出了方法論層面的關鍵貢獻。憑借大規模預訓練與自監督微調機制,模型能夠利用自身生成的偽標簽對真實圖像進行適配,在對模型陌生的電影素材上表現出良好的泛化能力,即使面對極端攝影條件也能利用學習到的幾何先驗推斷出合理的空間結構。此外,SHARP模型通過在具有真實尺度標注的數據集(如MVImgNet[18,19])上進行訓練,使生成的三維高斯場具備近似度量化的空間尺度。這一特性使虛擬攝影機的位移可直接對應真實空間距離,為立體視頻生成中的視差幅值控制提供了無需額外標定的物理錨點;相比基于深度圖的傳統方法,有助于實現更穩定且符合人類生理視差的立體效果,降低大銀幕放映時的視覺不適風險。
需要指出的是,盡管SHARP模型在技術架構上展現了極高的工業化潛力,但其發布的研究權重遵循非商業使用許可。因此,本文側重于在實驗環境下驗證該技術路徑在立體電影制作任務中的適用性及性能邊界,為未來可商業化系統的開發提供實驗參照和評價基準。
2.3 ml?sharp框架:用于電影級立體視頻制作的新范式
蘋果公司在發布SHARP模型的同時,開源了其完整應用框架ml?sharp。該框架遵循“逐幀三維化、虛擬雙目拍攝、SBS合成”的核心思路,全程無需任何幀間運動分析或時序一致性后處理,由5個關鍵處理階段構成[20]:
(1)視頻輸入標準化與解析。輸入視頻首先被解析為逐幀RGB圖像序列,統一至模型推理所需的數值范圍。必要時執行重采樣與色彩空間轉換,以保證不同來源素材在推理階段的一致性。對于低分辨率或歷史影像,此階段額外執行分辨率的雙三次插值(Bicubic Interpolation)對齊。
(2)單幀三維高斯場推理。圖像序列的每一幀獨立輸入SHARP模型的前饋式網絡。特征編碼器提取輸入圖像的多層級密集視覺特征;深度解碼器從多層次特征中解算出致密深度圖;高斯解碼器以深度圖和特征圖的級聯表示為條件,同時回歸約120萬個高斯基元的完整參數。該過程不引入跨幀特征傳遞或隱狀態建模,使每一幀的空間結構完全由當前圖像決定。
(3)雙虛擬攝影機配置。在生成的三維高斯空間中,立體視頻生成的核心操作轉化為虛擬攝影機的視點布置。ml?sharp框架構建了一個精密受控的虛擬立體攝影機系統,通過定義左、右眼攝影機的相對變換矩陣TL→R,可精準模擬電影攝影中的平行軸和匯聚軸立體成像模式。其中平行軸模式保持左右攝影機光軸平行,主要用于后期調整無窮遠處的匯聚感,匯聚軸模式通過調節旋轉矩陣Rconv,使左右視角在特定深度交匯,實現對“入屏/出屏”效果的把控,實現美學層面的深度構圖與構圖需求。由于高斯場為顯式場景表示,新視角的渲染僅需執行一次前向潑濺與α混合操作,無需額外優化過程。
(4)實時潑濺渲染。渲染過程采用了基于塊的各向異性高斯光柵化,對左右視點分別調用1次潑濺渲染器,輸出具有水平視差的雙目圖像。為消除新視角合成中的走樣問題,ml?sharp框架引入了橢圓加權平均濾波技術[21]。其投影過程通過協方差矩陣的仿射變換實現,如式(2)所示。
Σ'=JWΣWTJT (2)
式(2)中,Σ表示三維空間中高斯基元的三維協方差矩陣,決定了高斯基元在三維空間中的各向異性特征,是重建場景體積感的核心;W表示觀察變換矩陣,負責將高斯基元從世界坐標系轉換到虛擬攝影機的觀察坐標系中,實現了三維空間位置與攝影機視點的對齊;J表示透視投影變換的雅可比矩陣(Jacobian Matrix),描述了空間點到像素坐標映射的局部線性化過程,是確保投影形狀準確的關鍵;(·)T表示矩陣的轉置運算(Transpose Operator),用于確保協方差矩陣在變換過程中的對稱性與正定性;Σ'則表示投影后的二維屏幕協方差矩陣(Projected 2D Covariance Matrix),直接決定了高斯基元在圖像平面上所覆蓋的橢圓形足跡(Footprint)的大小、形狀與朝向。這種渲染方式能較好地還原電影中的光學模糊與運動模糊,這是傳統DIBR算法通過2D像素拉伸所無法達到的物理真實性。
(5)立體合成。ml?sharp框架處理完所有幀后,通過異步并行計算,將渲染出的雙路視點序列進行時序對齊,并合并為SBS格式。為保證色彩一致性,系統在輸出前會對左右視角進行感知色彩平衡校正,確保即便在高動態范圍(HDR)場景下,左右眼畫面在亮度和對比度上也能保持絕對同步,減少視覺沖突與疲勞。
SHARP模型通過將DL的前饋推理能力與3DGS的顯式渲染效率相結合,開創了立體視頻制作的新范式。其不僅將原本需要數小時的重建工作縮短至秒級,更通過形狀感知機制突破了單目素材空間信息缺失的頑疾。其實現框架ml?sharp是構建立體影視內容制作的關鍵理論支撐,將電影2D畫面從像素陣列轉化為可編輯的輻射場資產,為自動化、高保真的立體電影制作提供了新的技術路徑。
3
面向立體視頻生成的電影級評價框架構建與實驗設計
3.1 電影攝影美學框架下的實驗變量構建
本文提出一種面向AI立體視頻生成的電影級評價框架,其核心在于將計算機視覺(CV)的圖像重建問題,映射為電影攝影語境下的視覺還原問題。為系統評估基于SHARP模型的立體視頻生成性能,本實驗引入電影攝影領域成熟的影像控制框架,將來源于ASC StEM2[22]、Netflix Open Content[23]、Pexels[24]等開源素材庫及《鐵路的白薔薇》(La Roue)等黑白電影的共32個視頻物料,按照光學與鏡頭變量、影像表現變量和空間構成變量三個維度進行結構化劃分[25],將CV的圖像恢復問題轉化為電影制作的攝影美學還原問題,強調視覺生成機制與模型響應間的內在關聯,從而構建具有解釋力的變量體系。所有原始素材均以單目RGB視頻形式輸入,不提供任何深度真值或多視角參考幀。
光學透視是立體感生成的幾何基礎。光學與鏡頭變量維度主要反映鏡頭成像機制對空間幾何恢復的影響。因此,在此維度下,實驗素材涵蓋三種子類型。
(1)焦距特征素材包含廣角鏡頭與長焦鏡頭。廣角鏡頭具有顯著的透視擴張效應,強調線性透視形變;而長焦鏡頭則呈現空間壓縮特性,深度層級趨于扁平。兩者在深度線索的可信度上形成對照,可測試模型在不同透視壓力下對高斯基元分布的預測精度,比較空間透視變形與空間壓縮感對高斯場回歸的影響。
(2)景深分布素材,涵蓋縱深鏡頭和淺景深特寫。淺景深場景中,部分信息以散焦形式存在,其本質為低頻模糊信號。此測試特別觀測SHARP模型對失焦模糊的處理能力,檢驗模型是否會將光學模糊誤識別為幾何不確定性。
(3)運動動態素材選取包含劇烈鏡頭運動或主體高速運動的視頻。動態模糊會降低圖像局部對比度與結構清晰度,是點云擬合的巨大挑戰。因此,此測試關注ml?sharp框架在幀獨立推理條件下對動態邊緣的深度歸因穩定性。
影像的影調結構直接影響深度估計的準確性,影像表現變量維度關注的是圖像信號本身的統計特性。因此本維度下的實驗素材分為以下三種子類型。
(1)對比度與影調素材包含極端局部高亮與極端低照度場景。極端局部高亮場景亮度橫跨0.001~1000 nit量級,以評估高亮區域是否因輻射度量異常而導致空間位置錯亂。極端低照度場景信噪比極低,對亮度驅動的深度推斷構成挑戰,考察模型在暗部噪聲干擾下的魯棒性。
(2)色彩感知素材包括缺失色彩通道、僅依賴亮度信息進行結構表達的黑白影像,使SHARP模型僅依靠亮度信息進行深度解算、推斷場景結構,對依賴顏色分割線索的預訓練模型發起挑戰。
(3)畫面退化素材觀測膠片顆粒或數字噪點對高斯高頻細節重建的干擾。霉斑與垂直劃痕等高頻噪聲可能被誤解釋為幾何細節,從而影響高斯分布的空間擬合。此測試判斷這些2D偽影是否被SHARP模型的深度解碼器錯誤地提升為三維幾何起伏。
空間構成變量主要考察場景幾何復雜度,下設兩個子類型。
(1)遮擋關系素材,重點選取具有復雜前后景遮擋關系的場景、由于遮擋關系而形成了非自然負形空間的視頻,以及包含高頻率重復紋理遮擋的視頻,這些場景中的復雜前后景關系是傳統立體視頻生成中“空洞填充”與“深度污染”的高發區域,此實驗用于檢驗SHARP模型對空間分層的表達能力。
(2)大氣透視素材,關注視頻中半透明霧氣結構與消散感,測試模型在非剛體表面的深度還原能力,觀察模型對對比度衰減與深度關系的耦合推斷。
在素材選擇上,本實驗以攝影變量為驅動[26],避免單一因素主導實驗結果,使后續分析能關聯到電影制作實踐中的具體應用場景。
3.2 實驗流程與評價指標
本實驗基于蘋果公司提出的ml?sharp單目圖像到立體視頻生成方法,首先對三大維度內8個子類型的電影原始素材進行處理。在此基礎上,依照ml?sharp立體視頻生成管線的五個階段,基于開源實現進行系統搭建,集成了ml?sharp的兩種社區優化方案:其一為iVideoGameBoss實現的可視化交互界面版本[27],其二為Gabriel Roldán開發的SBS格式輸出工具[28]。
實驗采用客觀評價方式,提出一套面向AI立體視頻生成的電影級評價框架,將傳統圖像質量指標與視覺感知指標相結合,并引入電影攝影影像控制框架中的光學、影調與空間三大構成變量,構建了基于電影攝影邏輯的結構化測試集,為AI立體視頻生成方法提供具有解釋力的評測基準,實現了從“圖像重建評價”向“攝影美學還原評價”的轉化。
圖像質量指標衡量立體視頻生成結果的視差圖像在像素和結構層面與原始幀的一致性[29],包括峰值信噪比(Peak Signal?to?Noise Ratio, PSNR)、結構相似性(SSIM)。其中,PSNR在像素強度層面測量左右視圖合成后與原始單目基準幀的偏差,數值越高表示像素級重構越精確[30];SSIM從亮度、對比度和結構三方面出發,衡量生成結果對原始畫面結構信息的保留程度。
視覺感知指標基于DL特征提取,模擬人類視覺系統(HVS)對邊緣偽影、空間畸變的感知靈敏度,包括學習感知圖像塊相似度(Learning Perceptual Image Patch Similarity, LPIPS)、深度圖像結構與紋理相似性(Deep Image Structure and Texture Similarity, DISTS)。其中LPIPS利用預先訓練的深度網絡特征空間中的距離來模擬人類對圖像失真的感知敏感性[31],數值越低表示生成畫面越接近人類認知的真實;DISTS則結合了傳統結構相似度與深度特征紋理表征[32],對紋理變形和結構畸變更為敏感。這兩項指標作為補充,能捕捉到PSNR和SSIM難以反映的幾何扭曲。
3.3 實驗結果數據及分析
圖2及圖3匯總了各攝影邏輯下具有顯著影像特征的實驗素材在LPIPS、DISTS、PSNR和SSIM四項指標的得分,并表明該模型在處理不同光學條件、影像屬性與空間結構的影像時,表現出較穩定的結構一致性與感知穩定性。我們將根據實際數據、依據電影影像控制框架,考察各變量維度下的指標表現,對實驗結果進行系統性的橫向對比與縱深分析。
![]()
圖2 顯著實驗素材立體視頻生成的質量評估數據
![]()
圖3 評價指標的數據密度分布圖
3.3.1 光學與鏡頭變量的影響
在焦距特征方面,長焦鏡頭的立體視頻生成結果以更高的SSIM與更低的LPIPS值優于廣角鏡頭。廣角畫面中的桶形畸變與邊緣拉伸增加了幾何復雜度[33],使模型在邊緣區域產生非線性高斯分布,進而在新視角渲染時引入幾何偏移與視差不穩定〔圖4(a)〕。相比之下,長焦鏡頭因透視壓縮與景深趨于扁平,降低了深度估計歧義,使立體效果更平穩可控〔圖4(b)〕。為防止畫面中線性透視線索運動過于劇烈時,單目前饋網絡對消失點約束的擬合偏離物理合理的相機模型,在實際應用中,需根據焦距動態調整虛擬攝影機的瞳距(IPD)參數,以維持合理的視差分布。
![]()
圖4 廣角鏡頭與長焦鏡頭的高斯空間
在淺景深特寫鏡頭中,模型在焦外成像(Bokeh)區域的深度歸屬出現錯誤,立體視角下前景和背景發生粘連。淺景深場景中的散焦區域本質上缺乏清晰的結構信息,其頻譜以低頻為主,這與3DGS依賴局部高頻信息進行空間擬合的機制存在沖突。模型在遭遇攝影虛化時,對散焦攝影的語義理解不足,傾向于將模糊梯度當作需擬合的紋理,而非深度過渡區域。這也表明在實際立體視頻生成時,淺景深鏡頭可能需額外人工干預或針對性優化。
運動動態類型的素材中包含橫向拍攝與高速物體等樣本,均表現出高于靜態場景的感知損失。運動模糊削弱了圖像梯度信息,使模型難以準確定位空間結構,將方向性模糊錯誤收斂為靜態清晰邊緣,削弱運動特征。同時,由于相鄰幀模糊程度變化,模型預測的高斯參數缺乏一致性,導致輕微的幀間閃爍現象,在快速運動場景中尤為明顯。
3.3.2 影像表現變量的影響
在實驗素材中,低照度組的立體視頻生成表現出較佳的效果,整體呈現出較高的PSNR與SSIM、較低的DISTS指標。低照度圖像整體信號幅度較低,像素誤差的絕對值相對較小,同時大面積暗區降低了紋理復雜度,使高斯基元更易擬合為平滑的密度分布。在SBS圖像生成過程中,這種特性還帶來一定的視覺降噪與深度平滑效果,從而降低了重建難度。實驗結果表明,SHARP在低信噪比環境下具有良好的魯棒性,未出現將暗部噪聲誤判為幾何結構的現象,對高ISO或弱光攝影條件具有一定適應能力。
極端局部高亮的實驗素材組整體SSIM表現尚佳,未對原始素材產生結構性破壞,但PSNR和LPIPS卻呈現出較為明顯的內部分化。對于焊接火花等高速運動、面積較小且存在過曝的高亮區域,局部梯度劇烈變化可能導致高斯基元分布不穩定,從而引發空間位置偏移(圖5);而燭焰、熒光燈等面積較大、變化相對平緩的高亮區域則為模型提供了更穩定的擬合目標,這表明極端點狀過曝仍是前饋式3DGS方法的薄弱環節。
![]()
圖5 焊接火花畫面的SBS圖像有輕微位置偏移
黑白影像素材的立體視頻生成以突出表現成為實驗中亮眼的一部分。在缺少色彩通道的情況下,此類素材的DISTS和LPIPS指標均達到了極低數值,而PSNR和SSIM則取得了全部實驗的較高數值,4項指標均表現突出,優于大多數彩色素材(圖6)。這一結果表明SHARP框架的深度預測并非過度依賴顏色分割信息,底層邏輯更傾向于捕捉物體的特征邊緣與亮度梯度。模型能在亮度梯度變化處自適應聚集高斯基元,從而有效恢復空間層次。此外,雙三次插值等針對低分辨率歷史影像的預處理,在一定程度上平滑了噪聲,降低了劃痕與顆粒被誤識別為幾何結構的風險。這提示了在立體電影制作的實際應用中,該技術足以完成早期經典黑白電影修復或低飽和度風格化影像3D制作。在歷史影像的修復與立體視頻生成中,SHARP模型可能成為一個極具潛力的工具。
![]()
圖6 黑白影像素材的SBS圖像
3.3.3 空間構成變量的影響
在實驗中,半透明霧氣類素材的指標表現優異,PSNR和SSIM指標都取得了優質數值。煙霧的密度場是連續漸變體[34],本質上更接近高斯表示的優勢場景,大量半透明橢球體的疊加本身就是對連續密度場的自然逼近。而與之形成鮮明對比的是,在幾何空間構成方面,當畫面中角色做出如手臂彎曲產生空隙的復雜動作時,SHARP模型的“形狀感知先驗”將其誤判為一個整體,因而產生立體視圖中局部區域的深度跳變、漂浮感,以及邊緣頻繁且明顯的閃動。實驗結果表明,SHARP模型在處理高復雜度幾何結構時仍存在改進空間。
在含有大量非規則遮擋的視頻素材中,模型也未能較好恢復空間層級,存在較為嚴重的深度混疊問題。對于風向標、發絲、樹枝樹葉等極細碎、鏤空的非規則遮擋畫面內容,SHARP模型的前饋預測容易產生“深度污染”。3D高斯基元在擬合這種邊界時缺少足夠的表達能力,在深度軸上發生了混疊,相鄰幀間的基元分配稍有擾動就會觸發可見的二值閃變,這也是未來模型領域適配需要重點突破的方向。
4
結論
基于SHARP模型的3DGS方法通過前饋推斷實現了從單目影像到三維體積場的高效映射,在立體電影制作中的靜態資產構建展現出顯著的工程化應用潛力。本文提出了一套面向AI立體視頻制作的電影級技術質量評價框架。該框架突破了單純的計算機視覺評估范疇及傳統圖像重建評價中對單一信號指標的依賴,將信號保真度指標與感知指標進行聯合建模,并引入電影攝影中的三類核心美學維度變量,實現了從像素一致性評價向攝影語義與美學一致性評價的方法論拓展。為AI視覺生成算法在電影垂直領域的性能驗證提供了具備行業美學參照的評估標準,以及具有解釋力與可遷移性的分析工具。
基于構建的評價體系,本文設計了覆蓋多維度典型攝影條件的結構化實驗,并對SHARP模型在立體視頻生成任務中的表現進行了系統性分析。3DGS顯式表達使模型能夠超越簡單的像素位移,在三維空間中重構出符合電影攝影透視規律的幾何特征。盡管SHARP模型在單幀重建上表現卓越,但本文也從電影攝影機制出發,對實驗結果進行了跨變量維度的歸納分析,指出當前立體視頻生成方法在處理光學模糊語義、非規則遮擋結構與時序一致性方面仍存在結構性挑戰。
總體而言,SHARP模型通過將前饋式深度學習推斷與3D高斯顯式表示相結合,為立體電影制作提供了一種具備自動化潛力的新技術路徑。本文所提出的評價框架與實驗范式,則進一步為該類方法在實際生產環境中的落地應用建立了系統性的分析評估基礎。未來,隨著時序建模機制與復雜場景表達能力的持續提升,基于高斯潑濺的立體電影制作生成方法有望推動電影后期制作流程向更高程度的自動化與物理一致性演進,結合人類立體視覺的生理反饋與電影美學先驗,促使創作者回歸到影像敘事與視覺創意本身,推動立體電影制作從手工修補時代進入智能模型驅動時代。
參考文獻
(向下滑動閱讀)
[1] Radiance Fields. Gaussian Splatting in Superman[EB/OL].(2025?09?04)[2026?03?23]. https://radiancefields.com/gaussian-splatting-in-superman/.
[2] SEYMOUR M. Superman with Framestore: Krypto, Crystals & Cutting?edge Gaussian Splats[EB/OL].(2025?08?18)[2026?03?23]. https://www.fxguide.com/fxpodcasts/fxpodcast-superman-with-framestore-krypto-crystals-cutting-edge-gaussi an-splats/.
[3] FEHN C. Depth?Image?Based Rendering (DIBR), Compression, and Transmission for a New Approach on 3D?TV[C]// Proceedings of SPIE Stereoscopic Displays and Virtual Reality Systems XI. San Jose: SPIE, 2004: 93?104. DOI:10.1117/12.524762.
[4] 胡堃, 解沛. 基于深度學習的電影智能化攝制技術研究[J]. 現代電影技術, 2024(3): 12?19. DOI:10.3969/j.issn.1673-3215.2024.03.002.
[5] 李夢甜,姚聲祥,楊洋.面向電影制作的三維數字人生成和編輯系統設計與應用研究[J].現代電影技術,2025(8):12?20.
[6] MESCHEDER L, DONG W, LI S, et al. Sharp Monocular View Synthesis in Less Than a Second[EB/OL]. (2026?02?27)[2026?03?23].https://arxiv.org/abs/2512.10685. DOI:10.48550/arXiv.2512.10685.
[7] MILDENHALL B, SRINIVASAN P P, TANCIK M, et al. NeRF: Representing Scenes as Neural Radiance Fields for View Synthesis[EB/OL].(2020?08?03)[2026?05?12]https://arxiv.org/pdf/2003.08934v2.
[8] KERBL B, KOPANAS G, LEIMKüHLER T, et al. 3D Gaussian Splatting for Real?Time Radiance Field Rendering[J]. ACM Transactions on Graphics, 2023, 42(4):1?14. DOI:10.48550/arXiv.2308.04079.
[9] CHARATAN D, LI S L, TAGLIASACCHI A, et al. pixelSplat: 3D Gaussian Splats from Image Pairs for Scalable Generalizable 3D Reconstruction[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Seattle: IEEE, 2024: 1?11. DOI:10.48550/arXiv.2312.12337 .
[10] ZHANG K, BI S, TAN H, et al. GS?LRM: Large Reconstruction Model for 3D Gaussian Splatting[C]//Computer Vision – ECCV 2024: 18th European Conference, Italy, 2024, Proceedings, Part XXII. Cham: Springer, 2024: 1?19. DOI:10.1007/978-3-031-72670-5_1.
[11] TANG J, CHEN Z, CHEN X, et al. LGM: Large Multi?view Gaussian Model for High?Resolution 3D Content Creation[C]//Computer Vision – ECCV 2024: 18th European Conference, Milan, Proceedings, Part IV. Cham: Springer, 2024: 1?18. DOI:10.1007/978-3-031-73235-5.
[12] WANG Y S, HUANG T X, CHEN H L, et al. FreeSplat: Generalizable 3D Gaussian Splatting Towards Free?View Synthesis of Indoor Scenes[C]//Proceedings of the 38th Conference on Neural Information Processing Systems (NeurIPS 2024). Vancouver: NeurIPS, 2024: 1?8. DOI:10.52202/079017-3409.
[13] SUN Y T, HUANG Y H, MA L, et al. Splatter a Video: Video Gaussian Representation for Versatile Processing[EB/OL]. (2024?06?26)[2026?03?23].https://arxiv.org/abs/2406.13870. DOI:10.48550/arXiv.2406.13870.
[14] PARK J, BUI M Q V, BELLO J L G, et al. SplineGS: Robust Motion?Adaptive Spline for Real?Time Dynamic 3D Gaussians from Monocular Video[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Nashville: IEEE, 2025: 1?10. DOI:10.48550/arXiv.2412.09982.
[15] SHIN I, YU Q H, SHEN X H, et al. Enhancing Temporal Consistency in Video Editing by Reconstructing Videos with 3D Gaussian Splatting[EB/OL].(2025?04?04)[2026?03?23].https://arxiv.org/abs/2406.02541. DOI:10.48550/arXiv.2406.02541.
[16] SHEN Q H, YI X Y, LIN M B, et al. Seeing World Dynamics in a Nutshell[EB/OL], (2025?03?17)[2026?03?23].https://arxiv.org/abs/2502.03465. DOI:10.48550/arXiv.2502.03465.
[17] DOSOVITSKIY A, BEYER L, KOLESNIKOV A, et al. An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale[C]//Proceedings of the 9th International Conference on Learning Representations (ICLR 2021). Vienna: ICLR, 2021. DOI:10.48550/arXiv.2010.11929.
[18] YU X G, XU M T, ZHANG Y D, et al. MVImgNet: A Large?scale Dataset of Multi?view Images[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Vancouver: IEEE, 2023: 1?10. DOI:10.48550/arXiv.2303.06042.
[19] HAN X G, WU Y S, SHI L Y, et al. MVImgNet2.0: A Larger?scale Dataset of Multi?view Images[J]. ACM Transactions on Graphics, 2024, 43(6): Article 1. DOI:10.1145/3687973.
[20] Apple Inc. ml?sharp: Sharp Monocular View Synthesis in Less Than a Second[EB/OL].(2025?12?19)[2026?03?23]. https://github.com/apple/ml-sharp.
[21] ZWICKER M, PFISTER H, VAN BAAR J, et al. EWA volume splatting[C]//Proceedings of the conference on Visualization '01 (VIS '01). Los Alamitos: IEEE Computer Society, 2001: 29?36. DOI:10.1109/VISUAL.2001.964490.
[22] American Society of Cinematographers. ASC StEM2 (Standard Evaluation Material II) — The Mission[EB/OL].(2022?08?08)[2026?03?23].https://theasc.com/society/stem2.
[23] Netflix Inc. Netflix Open Content[EB/OL].(2022?04?26)[2026?03?23].https://opencontent.netflix.com/.
[24] Pexels. Free Stock Photos & Videos[EB/OL].(2025?05?01)[2026?03?23].https://www.pexels.com.
[25] BORDWELL D, THOMPSON K. Film Art: An Introduction[M]. New York: McGraw?Hill, 2010.
[26] 布萊恩·布朗. 電影攝影:理論與實踐[M]. 丁亞瓊, 譯. 北京: 世界圖書出版公司, 2015.
[27] iVideoGameBoss. ml?sharp: Gaussian Splatting from Apple by iVideoGameBoss. Sharp Monocular View Synthesis in Less Than a Second[EB/OL].(2026?01?31)[2026?03?23]. https://github.com/iVideoGameBoss/ml-sharp.
[28] ROLDáN G. ml?sharp: Gaussian Splatting from Apple by iVideoGameBoss (Customized by me). Sharp Monocular View Synthesis in Less Than a Second[EB/OL].(2026?01?10)[2026?03?23]. https://github.com/luisgabrielroldan/ml-sharp.
[29] WANG Z, BOVIK A C, SHEIKH H R, et al. Image Quality Assessment: From Error Visibility to Structural Similarity[J]. IEEE Transactions on Image Processing, 2004, 13(4): 600?612. DOI:10.1109/TIP.2003.819861.
[30] HUYNH?THU Q, GHANBARI M. Scope of validity of PSNR in image/video quality assessment[J]. Electronics Letters, 2008, 44(13): 800?801. DOI:10.1049/el:20080522.
[31] ZHANG R, ISOLA P, EFROS A A, et al. The Unreasonable Effectiveness of Deep Features as a Perceptual Metric[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR). Salt Lake City: IEEE, 2018: 586?595. DOI:10.1109/CVPR.2018.00068.
[32] DING K, MA K, WANG S, et al. Image Quality Assessment: Unifying Structure and Texture Similarity[J]. IEEE Transactions on Pattern Analysis and Machine Intelligence, 2022, 44(5): 2567?2581. DOI:10.1109/TPAMI.2020.3045810.
[33] KINGSLAKE R. Optical System Design[M]. New York: Academic Press, 1983.
[34] NARASIMHAN S G, NAYAR S K. Vision and the Atmosphere[J]. International Journal of Computer Vision, 2002,48(3):233?254.DOI:10.1023/A:10163 28200723.
期刊導讀 |《現代電影技術》2026年第6期
程絮森等:人工智能驅動下元宇宙技術賦能電影科技創新提質研究
孫立軍等:人工智能(AI)影像生成技術與傳統影視制作的融合路徑及流程標準化研究
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.