![]()
本文刊發于《現代電影技術》2026年第5期
專家點評
丁友東
教授
上海大學上海電影學院黨委書記、博士生導師
真人數字分身技術正由虛擬播報工具,逐步走向支撐電影生產、國際傳播和智能交互的影像基礎設施,其價值不只是替代人工出鏡,而是把聲音、口型、表情、膚色和動態范圍納入可計算、可復用、可標準化的生產鏈條。隨著生成式人工智能、多模態感知和虛擬攝制有效融合,數字分身將在新聞、教育、文旅、廣告和影視制作中連接真人形象與虛擬場景,推動內容生產由單次拍攝轉向資產化、模板化和可持續生成模式。尤其在多語種傳播中,低資源語言的聲紋復刻與唇音同步關系到文化表達的準確性和傳播效率;在影視級應用中,HDR畫質、身份一致性和表演可信度決定其能否進入高技術規格制作體系,也為后續全身驅動和交互式數字人發展奠定基礎。同時,行業還應同步完善肖像授權、數據安全、內容標識與倫理規范,使技術創新建立在可信邊界內。《面向跨語種唇音同步與動態范圍增強的真人數字分身生成方法研究》一文抓住行業落地痛點,圍繞聲紋克隆、跨語種唇音同步和SDR/HDR視覺優化構建端到端方案,并通過指標測試和新華社場景驗證有效性。論文問題導向明確,兼顧算法整合、工程效率和廣播影視標準,對真人數字分身工業化應用具有一定參考價值。
作者簡介
![]()
百樂夫
碩士,新華通訊社通信技術局工程師,主要研究方向:計算機視覺。
張寶亢
北京郵電大學數字媒體與設計藝術學院博士研究生在讀,新華通訊社音視頻部主任編輯,主要研究方向:智能影像。
![]()
摘要
針對當前真人數字分身在影視級應用中面臨的跨語種唇音同步精度低、生成畫質動態范圍不足等難題,本文提出端到端的全流程解決方案:在語音合成與聲紋克隆模塊,融合MiniMax?Speech模型與基于檢索的語音轉換(RVC)變聲技術,實現了低資源語言的高保真聲紋克隆;在唇音同步模塊,通過多語種自適應策略拓展SyncTalk 2D模型對不同語音識別模型的適配范圍,提升特殊語種和跨語種情況下的唇形自然度與精準度;在視覺優化模塊,引入逆色調映射算法,實現了從標準動態范圍(SDR)到符合ITU?R BT.2100標準的高動態范圍(HDR)畫質轉換。實驗結果表明,該系統在單張英偉達(NVIDIA)A10顯卡環境下推理時長僅為視頻總時長的 50%,其圖像質量客觀評價結果和主觀視覺效果優于基線模型。該系統已在新華通訊社新聞播報場景中驗證了有效性,可為影視制作、虛擬演播等領域提供技術參考。
關鍵詞
數字分身;多模態算法;唇音同步;HDR影像;生成式人工智能
1
引言
在人工智能(AI)技術革新的推動下,數字分身正經歷從簡單的視聽輸出工具向具備擬人化與情感化交互能力的智能體轉變[1]。特別是通過采集真人的視頻、音頻數據,實現1∶1形象復刻的真人數字分身技術,因其在影視替身、虛擬演員、新聞播報及跨語種內容生產中的廣泛應用潛力,成為計算機視覺(CV)與電影工程領域的交叉研究熱點[1,2]。在電影工業中,該技術已體現出重要的應用價值,例如《速度與激情7》借助數字分身技術重現已故演員保羅·沃克的銀幕形象,《星球大戰》系列亦通過數字分身技術使凱麗?費雪“回歸”后期作品,展現了數字分身在影視創作中的獨特應用價值與情感表現力[3]。
盡管當前數字分身唇音同步(Lip?sync)技術取得了顯著進展,但針對低資源語言(特殊語種、方言)的高精度唇音同步,以及影視級高動態范圍(HDR)的畫質合成,現有研究仍存在瓶頸。首先,現有方法對低資源語言的語音特征提取不充分,易導致唇形偏差,產生視覺脫節感;其次,主流標準動態范圍(SDR)生成模型在色域與色彩深度上難以適配HDR標準,限制了AI素材與高質量實拍素材的融合。
針對上述問題,本文提出一套影視級真人數字分身智能影像生成系統。本研究的主要貢獻在于:第一,通過集成MiniMax?Speech[4]語音模型與基于檢索的語音轉換(Retrieval?based Voice Conversion, RVC)變聲技術,配合多語種自適應策略提升SyncTalk 2D[5]在低資源語言和跨語種場景下的唇音同步精度;第二,引入逆色調映射(Inverse Tone Mapping, ITM)算法,實現了從SDR到HDR的畫質提升;第三,完成了系統級工程實現,在學習感知圖像塊相似度(LPIPS?)、弗雷歇初始距離(FID)等圖像質量指標上優于基線模型。
2
研究背景與相關工作
2.1 數字分身唇音同步驅動概況與早期技術發展
唇音同步驅動旨在根據音頻信號,生成與之時間同步、視覺效果自然的唇部運動畫面。該技術的發展始終圍繞兩大核心目標展開:一是跨模態對齊,即音頻與唇形運動的精準同步;二是身份一致性,即生成內容與目標人物外貌、神態的高度匹配。
在技術分類上,唇音同步可從三個維度進行劃分:一是按驅動媒介劃分,包括音頻驅動視頻與音頻驅動圖像;二是按推理方式劃分,分為適配任意形象的泛化推理與針對特定人物數據的定制化推理;三是按技術架構劃分,涵蓋了從早期的規則映射、統計模型,到基于生成式對抗網絡(GAN)、擴散模型(Diffusion Model)[6]及神經輻射場(NeRF)[7]等多元化路徑。
從演進歷程來看,早期唇音同步依賴規則映射。例如,Viseme[8]模型通過將語音音素映射為固定唇形類別,實現基礎的唇音同步。這類方法計算成本低,但存在自然度差、無法反映語調變化、泛化能力弱等缺陷,適用于簡單動畫場景。
2017年,隨著卷積神經網絡(CNN)在視覺領域的快速崛起,研究者開始探索通過CNN實現音頻驅動三維面部動畫的技術路徑。Audio2face[9]通過CNN直接處理語音信號并泛化到不同說話者,為后續音頻驅動數字分身技術奠定了關鍵范式。該模型訓練目標是通過輸入音頻獲得人物頭部3D坐標點位置,從而驅動三維面部動畫。盡管該工作聚焦于“三維坐標點”而非直接生成唇形圖像,但其由音頻輸入到3D動態點輸出的端到端框架明確了唇音同步驅動的核心邏輯,即通過神經網絡學習語音與視覺運動的映射關系。這一范式對后續基于GAN、NeRF等模型的設計具有重要指導意義。
2.2 主流技術路線分析
2.2.1 GAN主導的泛化推理
隨著深度學習(DL)技術的成熟,尤其是GAN在圖像生成任務中的成功,數字分身唇音同步驅動進入“數據驅動+泛化推理”的快速發展期。該階段的核心目標是通過大量視頻數據預訓練,使模型具備適配任意人臉形象的零樣本(Zero?shot)推理能力。
Wav2Lip[10]模型是該階段的代表性工作。其采用GAN的技術路線,通過生成器與同步判別器的對抗訓練實現唇音同步。生成器通過最小化L1重建損失和專家同步損失以優化輸出。同步判別器在傳統判別器基礎上做出改進,專注判斷唇形與語音的同步性。
不足的是,Wav2Lip的輸出面部區域分辨率僅為96×96,人臉畫面分辨率的不足限制了其商業應用前景。針對此問題,衍生出兩條技術路線:其一為提升輸出畫面分辨率,如Wav2Lip 288、Wav2Lip 384,但該方法訓練收斂困難,對數據集質量要求極高,多為商用閉源模型,且高分辨率下唇音同步瑕疵更易暴露;其二為增加圖像后處理,通過超分辨率模型對模糊的人臉畫面進行處理,該方法無需重新訓練模型,但如輸入信息量不足,易導致超分結果與原人物樣貌拼接處出現明顯瑕疵。
2.2.2 基于結構先驗的單圖驅動技術
針對數據門檻高的問題,以SadTalker[11]為代表的單圖驅動技術,通過三維可變形模型(3DMM)將音頻轉為三維運動系數,進而驅動單圖人物“說話”。但該方法受限于3DMM的固定先驗結構,生成的頭部運動畫面與固定不動的身體畫面容易產生視覺割裂感,應用范圍受限。
2.2.3 基于潛在表示與擴散模型的生成技術
針對畫面細節表現上的瓶頸,騰訊提出的MuseTalk[12]系列模型實現了更好的泛化推理能力,配套的MusePose與MuseV則實現了從單張人物圖片到指定動作視頻的功能,三者結合形成從輸入圖片到輸出唇音同步、具有連貫動作的完整數字分身制作流程。當出現更優的泛化唇音同步模型,例如基于擴散模型的LatentSync[13],只需對該制作流程中的唇音同步部分進行替換即可實現更好的整體效果。這一設計為后續系統迭代提供了模塊化思路。
EchoMimicV2[14]針對現有方法僅關注頭部區域的問題,實現端到端音頻驅動框架,生成包含肩膀以下身體的半身人類動畫。該模型突破了“僅頭部動態”的限制,擴展了音頻驅動的應用場景。此外,Animate Anyone[15]和MimicMotion[16]等研究也可取得不錯的效果。
2.2.4 基于NeRF的定制形象推理
當應用場景延伸至虛擬偶像、新聞主持人、帶貨主播等高保真需求領域時,“生成內容與原人物高度一致”成為核心需求。由GAN實現的泛化模型因依賴大量不同人物的預訓練數據,生成的面部本質上是“基于統計推測的結果”,難以精準匹配特定人物的外貌特征,如獨特的唇形輪廓、面部紋理、雀斑等細節。由此催生了基于定制形象推理的技術路線,即通過針對特定人物數據訓練模型,解決身份一致性問題。
NeRF通過隱式三維建模,為解決身份一致性問題提供了新思路。GeneFace[17]模型是該路線的代表性工作之一,采用3D人臉關鍵點作為中間變量,構建了一個三階段框架,顯著提升了基于NeRF的方法在泛化能力與身份一致性上的表現。后續的GeneFace++[18]、SyncTalk[19]等模型則在此基礎上進一步優化。
SyncTalk針對NeRF模型的常見問題,如嘴唇抖動噪聲等,引入了音視頻編碼器預訓練、3D面部先驗模型、頭部運動跟蹤與光流優化等技術,平衡整體清晰度與細節表現。這些改進使模型能夠生成高清晰度、表情自然、頭部姿態穩定的唇音同步視頻。
綜上所述,現階段數字分身技術尤其在語音驅動唇音同步方面取得顯著進展;但在低資源語言的高精度同步生成存在一定缺陷,就高質量視覺呈現而言,尤其是影視級高動態范圍畫質的產出,現有的應對方案相對不足。
3
真人數字分身智能影像生成系統
本文提出一套真人數字分身智能影像生成系統,可實現面向多語種與方言場景的高質量唇音同步生成,并支持影視級 HDR 視頻輸出。基于該系統,本文進一步探索了數字分身技術在虛擬主持人、新聞播報和影視制作等場景中的應用潛力。
3.1 系統整體架構
本文所述系統分為語音合成與聲紋克隆、唇音同步、視覺優化3個核心模塊,構成了一個端到端的真人數字分身影像生成系統。如圖1所示,語音合成與聲紋克隆模塊作為流程的起點,負責將輸入文本轉換為與真人音色一致的多語種語音,為后續驅動提供高質量的音頻源。唇音同步模塊作為核心技術,以語音合成與聲紋克隆模塊的輸出為驅動信號,生成精準同步的唇形與面部視頻。視覺優化模塊作為流程的終點,對生成視頻進行畫質增強與格式轉換,確保輸出符合廣播、影視級標準,包括高清與HDR格式。該架構具有較好的模塊解耦性,便于各模塊獨立開發與迭代。
![]()
圖1 系統架構
3.2 語音合成與聲紋克隆模塊:多語種高精度語音合成與聲紋克隆
語音合成與聲紋克隆模塊是構建數字分身一致性的首要環節。為實現高質量、多語種的聲紋克隆與合成,如圖2所示,模塊采用了“高資源語言+低資源語言”雙軌模式,以應對不同語種和場景的需求。
![]()
圖2 語音合成與聲紋克隆模塊
對中文、英文等高資源語言,模塊接入MiniMax?Speech語音合成與聲紋克隆服務。MiniMax?Speech模型采用基于自回歸Transformer的文本語音轉換(Text?To?Speech, TTS)架構,其技術特點主要體現在三個方面。第一,編碼器部分能夠從一段約30秒的參考音頻中,提取說話人的音色、韻律風格等細粒度特征,并將其編碼為一個固定大小的條件向量。該向量與自回歸Transformer進行聯合訓練,專為TTS任務優化,能提供比傳統方法更豐富、更相關的說話人信息,從而生成高度個性化的語音。第二,為實現對連續語音特征復雜分布的建模,該模型引入了Flow?VAE。其通過流模型對潛在空間進行非線性且靈活的轉換,從而更精準地捕捉語音數據中的動態變化和復雜模式,提升合成語音的自然度和流暢性。第三,在Flow?VAE的訓練中,模型采用KL散度對編碼器輸出進行約束,顯著增強了編碼器的信息壓縮與表達能力,避免了信息瓶頸。在客觀指標評測中,MiniMax?Speech在詞錯誤率和說話人相似度上均優于同期主流模型。在內部的真實應用測評中,其合成的語音在自然度和音色還原度上相比CosyVoice[20]等開源模型表現更優,僅需30秒音頻即可完成聲紋克隆,并支持語速、音量、情緒等多維度精細調節。
對于四川方言、陜西方言以及烏爾都語等低資源語種,由于缺乏高質量的商用聲紋克隆服務,模塊設計了基于成熟TTS語音合成服務和RVC語音風格遷移技術的組合方案。在訓練階段,需采集真人時長不低于5分鐘的純凈語音音頻。利用這些數據訓練一個專用Encoder模型,并構建其音色特征庫。在推理階段,首先選用一個與真人形象性別相同、音色最接近的基礎發音人,利用其TTS服務(如接入的科大訊飛服務)合成目標語種的語音;之后將該合成語音輸入訓練好的模型中。模型通過HuBERT[21]提取深層語義特征,并通過RMVPE[22]提取精準的基頻信息。接著,通過檢索匹配系統,將輸入語音的特征與訓練階段建立的特征庫進行比對和融合,完成從基礎發音人音色到真人音色的風格遷移。最后,通過解碼器重構出最終的高精度語音。此方案將高質量TTS的音質優勢與RVC強大的聲紋克隆能力相結合,有效解決了低資源語言數字分身的聲紋克隆難題。
3.3 唇音同步模塊:語義驅動的精準同步技術
唇音同步是衡量數字分身真實感的重要指標。當前模塊在SyncTalk 2D的基礎上,進行工程優化與改進,核心在于構建從音頻語義到唇形運動的映射。唇音同步訓練流程是一個兩階段過程,旨在建立音頻語義與唇形畫面間的穩定聯系,確保畫面質量。
(1)SyncNet判別器預訓練
如圖3所示,模型的唇音同步效果高度依賴于前端語音識別模型所提取的語義特征質量,模塊實施了“專語種專模型”的多語種自適應策略,針對不同類型的語言,使用wav2vec[23]、HuBERT、Whisper[24]等具有獨立Encoder結構的支持該語種的語音識別預訓練模型,從音頻中提取深層的、與內容相關的語義特征。隨后,根據不同模型的向量維度修改并訓練對應的SyncNet判別器,其目標是學習將音頻的語義特征與對應的唇部視頻幀在特征空間中對齊。此階段為后續訓練提供了一個強大的音頻-視覺同步先驗。
![]()
圖3 SyncNet判別器預訓練
(2)主干網絡訓練
在此階段,訓練唇音同步生成的主干網絡。其損失函數融合了3個層面的監督,確保生成結果既同步又逼真。語義層面,其利用預訓練的SyncNet計算生成幀與驅動音頻間的同步損失,確保唇形運動在內容上精準匹配音頻;在畫面感知層面,使用預訓練的VGG?19[25]網絡提取生成幀與真實幀的高級特征,計算感知損失,保證生成面部的整體結構、光照和質感的自然度,避免局部唇形正確但整體畫面違和;而像素層面,其計算生成幀與真實幀在像素空間上的絕對誤差,作為基礎的重建損失,保證畫面的清晰度。
3.4 視覺優化模塊:廣播級HDR影像生成
為滿足廣播與影視場景的畫質要求,本文設計了視覺優化模塊,核心目標是實現從SDR到HDR的高質量逆色調映射處理,以解決數字分身在影視工業部署中的動態范圍和色域瓶頸。
根據ITU?R BT.2100?2《用于制作和國際節目交換的高動態范圍電視的圖像參數值》(Image parameter values for high dynamic range television for use in production and international programme exchange)[26]、ITU?R BT.1886《高清電視演播室制片用平板顯示器的參考光電傳遞函數》(Reference electro?optical transfer function for flat panel displays used in HDTV studio production)[27]提供的SDR視頻和HDR視頻的光電轉換函數(OETF),本文將上述標準定義的SDR、HLG、PQ三條特性曲線統一繪制于同一坐標系下進行對比(圖4)。
![]()
圖4 SDR、HLG、PQ的光電傳輸特性曲線
ITU?R BT.2408?3《HDR電視制作操作實踐指南》(Guidance for operational practices in HDR television production)[28]報告明確指出,無論使用HLG還是PQ電光轉換函數(EOTF),不同膚色人種的面部皮膚區域在信號電平分布上相對集中且穩定(HLG為25%~65%,PQ為30%~55%)。根據上圖可知,在這一關鍵的膚色區間內,SDR信號所分配的量化電平數與HDR信號沒有顯著差異。因此,可通過合理的映射進行信號重新分配,結合色彩空間轉換,完成從標準動態范圍Rec.709色域到高動態范圍Rec.2020色域的映射。
基于上述分析,模塊使用了低失真的、基于色彩科學的映射變換流程(圖5)。
![]()
圖5 SDR轉HDR映射變換流程
(1)逆光電轉換。將生成的符合Rec.709標準的SDR視頻信號,通過逆SDR OETF,逆向恢復為被攝場景的線性光信號。
(2)色域轉換。應用色彩轉換矩陣,將視頻的色彩空間從Rec.709標準轉換至更寬廣的Rec.2020色域。
(3)HDR光電轉換。對線性光信號進行必要的色調映射與范圍調整后,使用HLG的OETF進行編碼,最終生成符合廣播標準的HDR視頻。
通過上述計算完成多段視頻幀畫面的映射計算,并通過DaVinci Resolve專業調色軟件制作對應顏色查找表(LUT),以便后續快速實現SDR到HDR的逆色調映射。該方法在保證人物膚色自然、準確還原的同時,提升了畫面的動態范圍和色彩表現力,使輸出視頻達到廣播、影視級HDR制作標準。
4
系統測試與結果分析
4.1 實驗環境與真人數字分身數據制作
為構建高質量的真人數字分身數據集,我們在受控的專業演播室環境中進行了數據采集。演播室配備了均勻、穩定的環形布光系統與綠幕背景,使用一臺佳能EOS 5D Mark IV 全畫幅相機以4K分辨率、24 FPS的規格進行錄制,同步錄制了48 kHz采樣率的高保真音頻。
數據采集包含不同性別、年齡與面部特征的參與者。為盡可能全面覆蓋發音與口型變化,我們為本次實驗專門設計了一套中、英文朗讀腳本。中文腳本系統性地涵蓋了所有聲母、韻母及常見組合,英文腳本則包含國際音標中的各類元音、輔音及連讀樣例。所有語句均選自新華通訊社稿件,保證語義完整、語調自然連貫,旨在誘發參與者真實、多樣的唇部運動與微表情。每位參與者需以中文或英語朗讀該腳本,錄制內容包含中性、喜悅等情緒下的口語表達。
我們共采集了16段高質量視頻序列,平均每段長度為8271幀。所有錄制均保持了嚴格的光照一致性、固定機位與中性背景,以最大程度減少無關變量干擾。
為驗證本文方法的有效性,我們選取技術路線十分相近的,同為基于NeRF的SyncTalk 2D唇音同步方法與本文方法開展對比實驗。SyncTalk 2D和本文所述方法均進行了100輪訓練。
4.2 測試結果及分析
本次測試采用全參考質量評價方式開展客觀評測。圖像質量評估選取峰值信噪比(PSNR)、LPIPS?、多尺度結構相似度(MS?SSIM)以及FID作為評估指標。唇音同步效果則采用 LSE?C 指標進行客觀評測,并結合案例觀察進行定性分析。
表1展示了圖像質量的客觀評測結果,本文方法在上述指標中均優于基線模型。唇音同步效果方面,從圖6可觀察到本文方法在部分元音(如 /u/、/o/)的合成與表現有明顯提升。
表1 唇音同步模型評測結果
![]()
![]()
圖6 唇音同步效果對比
4.3 效率評估
基于騰訊云分布式算力平臺,本文方法采用NVIDIA A10 GPU、英特爾?至強?Gold 6346 CPU及64 GB內存的標準硬件配置,實現了從文本輸入到高清視頻輸出的端到端數字分身生成流程。該配置下生成一段時長為1分鐘的數字分身視頻僅需30秒。較傳統計算機圖形學(CG)制作流程體現出較高的生成效率,驗證了大規模、快節奏的數字內容生成的技術可行性。
基于系統生成的數字分身視頻,用戶可進一步利用PikaSwaps等人工智能生成內容(AIGC)視頻編輯工具進行背景替換、服裝調整及特效制作等后期工作。這一流程不僅擴展了數字分身在短視頻、電商、在線教育、新聞播報等不同行業的應用邊界,還支持“一次生成,多次復用”的生產模式。
5
應用場景與前景
本文提出的真人數字分身智能影像生成系統具有較強的應用拓展空間,典型應用場景主要包括新聞播報和電影制作。
5.1 虛擬主持人和新聞播報
數字分身技術在傳媒領域的應用正在重塑內容生產模式和傳播形態,為行業帶來效率提升和創意革新的雙重機遇[29]。本文提出的真人數字分身智能影像生成系統已應用于新華通訊社采編報道流程中(圖7)。采編人員可使用此系統生成新聞播報員真人數字分身,通過精準的唇音同步和面部表情生成,數字分身不僅能夠完成標準化新聞播報任務,還可根據不同的情境進行個性化表現。例如,在新聞發布或者突發事件報道中,采編編輯可根據播發內容選擇數字分身形象與情緒風格。其中,形象可設置為全身或半身,情緒可設置為嚴肅或歡快。在設定好形象與情緒后,輸入文字稿,可實時生成數字分身播報新聞的視頻,滿足熱點和突發報道的實效性需求。尤其在多語種環境下,快速生成不同語言版本的播報內容,有效提高了新聞播發效率,拓展了新聞傳播場域。
![]()
圖7 真人數字分身智能影像生成系統新聞生成流程
5.2 電影制作與虛擬角色
在電影制作中,數字分身技術已應用于虛擬角色創建、特效制作與沉浸式敘事等領域,提升了制作效率與表現力。針對已故演員的數字化“復活”或特定年齡段影像的重塑,通過對歷史影像資料進行建模與特征提取,即可構建具備精準面部微表情與聲音特征的虛擬角色,例如好萊塢電影《超能敢死隊》(Ghostbusters:Afterlife),該片“復活”了已故演員哈羅德?雷米斯,這不僅能有效降低制作成本,也為電影藝術創作賦予更多敘事可能性。
在此背景下,本文提出的唇音同步及畫質增強技術,可為電影制作提供唇形自然、畫質出色的人物視頻素材。未來可結合具有視頻編輯功能的AI工具,進一步根據創作需求高效合成高質量視頻片段,為數字分身在影視工業中的落地應用提供具有可行性的技術支持路徑。
伴隨技術不斷拓展,數字分身將在更多領域實現應用,諸如醫療領域里的虛擬醫生、虛擬導覽,法律服務中的虛擬顧問,娛樂產業的虛擬偶像,廣告領域品牌虛擬代言人等。計算能力的提高與算法的優化,將使數字分身生成的速度和精準性進一步提升,進而促進其應用場景的深化與拓展。
6
結語與展望
針對當前真人數字分身跨語種唇音同步精準度低和生成畫質動態范圍不足的行業痛點,本文設計并驗證了一套端到端的真人數字分身智能影像生成系統,該系統可適應低資源語種場景,并支持影視級 HDR 畫質輸出,有效克服了傳統模型在聲紋克隆失真與動態范圍不足上的局限。經實驗驗證,該系統不僅在LPIPS與FID等客觀圖像質量評價指標上優于基線模型,也在NVIDIA A10 GPU環境中表現出較高的推理效率,為高品質數字分身的低成本、工業化落地提供了技術支撐。
盡管本系統在唇音同步及畫質增強方面獲得顯著成效,但在交互水平上仍存在改進空間。目前系統主要以語義為驅動,未來將導入更精細的情緒控制模塊,讓數字分身可按照文本情緒自動調節細微表情,增強表情表達能力;當前研究把重點放在面部與半身生成上,未來會探索將骨骼綁定與動作捕捉技術相融合,實現文本帶動全身連貫動作的生成,進一步提升其在復雜場景中的表現能力。
綜上,本研究為高品質真人數字分身的自動化生產打造了一套可行的技術方案,于新華通訊社實際業務中證實了這一技術的有效性,對于帶動媒體融合發展和影視工業智能化升級具有參考價值。
參考文獻
(向下滑動閱讀)
[1] 李曉輝. AI數字人視聽表達策略的人機協同機制研究[J]. 現代電影技術, 2025(11): 41?47.
[2] ZHANG R, YU B, MIN J, et al. Generative AI for film creation: A survey of recent advances[J]. Foundations and Trends in Computer Graphics and Vision, 2025, 15(3): 149?353.
[3] 張凈雨. 數字后人類身體的美學建構與意義生成[J]. 當代電影,2020(7):152?158.
[4] ZHANG B, GUO C, YANG G, et al. MiniMax?Speech: intrinsic zero?shot text?to?speech with a learnable speaker encoder[EB/OL]. (2025?05?12) [2025?10?01]. https://arxiv.org/abs/2505.07916.
[5] PENG Z Q. SyncTalk_2D[EB/OL]. [2025?10?01]. https://github.com/ziqiaopeng/SyncTalk_2D.
[6] SOHL-DICKSTEIN J, WEISS E A, MAHESWARANATHAN N, et al. Deep unsupervised learning using nonequilibrium thermodynamics[C]//Proceedings of the 32nd International Conference on Machine Learning, 2015, 37: 2256?2265.
[7] MILDENHALL B, SRINIVASAN P P, TANCIK M, et al. NeRF: representing scenes as neural radiance fields for view synthesis[C]//European Conference on Computer Vision, 2020: 405?421.
[8] 蔣冬梅, 謝磊, RAVYSE I, 等. 基于Viseme的連續語音識別系統及Talking Head[J]. 電子與信息學報, 2004, 26(3): 375?381.
[9] KARRAS T, AILA T, LAINE S, et al. Audio?driven facial animation by joint end?to?end learning of pose and emotion[J]. ACM Transactions on Graphics, 2017, 36(4).
[10] PRAJWAL K R, MUKHOPADHYAY R, NAMBOODIRI V, et al. A lip sync expert is all you need for speech to lip generation in the wild[C]//Proceedings of the 28th ACM International Conference on Multimedia, 2020: 484?492.
[11] ZHANG W, CUN X, WANG X, et al. SadTalker: learning realistic 3D motion coefficients for stylized audio?driven single image talking face animation[EB/OL]. (2022?11?22) [2025?10?01]. https://arxiv.org/abs/2211.12194.
[12] ZHANG Y, LIU M, CHEN Z, et al. MuseTalk: real?time high quality lip synchronization with latent space inpainting[EB/OL]. (2024?03?26) [2025?10?01]. https://arxiv.org/abs/2410.10122.
[13] LI C, ZHANG C, XU W, et al. LatentSync: taming audio?conditioned latent diffusion models for lip sync with SyncNet supervision[EB/OL]. (2024?12?12) [2025?10?01]. https://arxiv.org/abs/2412.09262.
[14] MENG R, ZHANG X, LI Y, et al. EchoMimicV2: towards striking, simplified, and semi?body human animation[EB/OL]. (2024?11?15) [2025?10?01]. https://arxiv.org/abs/2411.10061.
[15] HU L, GAO X, ZHANG P, et al. Animate Anyone: consistent and controllable image?to?video synthesis for character animation[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2024: 779?790.
[16] ZHANG Y, GU J, WANG L W, et al. MimicMotion: high?quality human motion video generation with confidence?aware pose guidance[EB/OL]. (2024?06?28) [2025?10?01]. https://arxiv.org/abs/2406.19680.
[17] YE Z, JIANG Z, REN Y, et al. GeneFace: generalized and high?fidelity audio?driven 3D talking face synthesis[EB/OL]. (2023?01?31) [2025?10?01]. https://arxiv.org/abs/2301.13430.
[18] YE Z, HE J, JIANG Z, et al. GeneFace++: generalized and stable real?time audio?driven 3D talking face generation[EB/OL]. (2023?05?01) [2025?10?01]. https://arxiv.org/abs/2305.00787.
[19] PENG Z, HU W, SHI Y, et al. SyncTalk: the devil is in the synchronization for talking head synthesis[EB/OL]. (2023?11?29) [2025?10?01]. https://arxiv.org/abs/2311.17590.
[20] DU Z, CHEN Q, ZHANG S, et al. CosyVoice: a scalable multilingual zero?shot text?to?speech synthesizer based on supervised semantic tokens[EB/OL]. (2024?07?07) [2025?10?01]. https://arxiv.org/abs/2407.05407.
[21] HSU W N, BOLTE B, TSAI Y H H, et al. HuBERT: self?supervised speech representation learning by masked prediction of hidden units[J]. IEEE/ACM Transactions on Audio, Speech, and Language Processing, 2021, 29: 3451?3460.
[22] WEI H, CAO X, DAN T, et al. RMVPE: a robust model for vocal pitch estimation in polyphonic music[C]//INTERSPEECH 2023, 2023: 5421?5425.
[23] BAEVSKI A, ZHOU H, MOHAMED A, et al. wav2vec 2.0: a framework for self?supervised learning of speech representations[J]. Advances in Neural Information Processing Systems, 2020, 33: 12449?12460.
[24] RADFORD A, KIM J W, XU T, et al. Robust speech recognition via large?scale weak supervision[C]//Proceedings of the 40th International Conference on Machine Learning, 2023:28492?28518.
[25] SIMONYAN K, ZISSERMAN A. Very deep convolutional networks for large?scale image recognition[C]//International Conference on Learning Representations, 2015.
[26] International Telecommunication Union. Image parameter values for high dynamic range television for use in production and international programme exchange: Recommendation ITU-R BT.2100-2[S],2025.
[27] International Telecommunication Union. Reference electro?optical transfer function for flat panel displays used in HDTV studio production: Recommendation ITU-R BT.1886-0 [S], 2011.
[28] International Telecommunication Union. Guidance for operational practices in HDR television production: Report ITU-R BT.2408-3 [S],2024.
[29] TAO F, ZHANG H, QI Q, et al. Advances in digital twin technology under the “object?human?environment” interaction perspective[J]. Journal of Manufacturing Systems, 2023, 68: 1?15.
期刊導讀 |《現代電影技術》2026年第5期
馮賢杰等:超高清沉浸式視頻實時分布式云渲染平臺設計及應用
王嵐君等:面向影視創作的AIGC可控生成與溯源技術進展研究
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.