![]()
作者|亞娜
2026年WAIC現(xiàn)場(chǎng),百度展區(qū)循環(huán)播放的一段視頻,引來(lái)不少參會(huì)者駐足。
![]()
畫面中,甲子光年創(chuàng)始人張一甲與量化分析師林深對(duì)坐而談,金句頻出。比對(duì)話內(nèi)容更抓人眼球的,是兩位數(shù)字人毫秒級(jí)的微表情演繹,生動(dòng)程度足以混淆虛實(shí)。畫面流暢到讓多數(shù)觀眾渾然不覺,屏幕背后的那張臉完全是由大模型生成的。
過(guò)去一年,數(shù)字人正在加速滲透到視頻內(nèi)容創(chuàng)作領(lǐng)域。去年618期間,羅永浩團(tuán)隊(duì)試水?dāng)?shù)字人直播;今年世界杯期間,百度一鏡攜手可口可樂推出了“AI范志毅”實(shí)時(shí)互動(dòng)數(shù)字人;海外健身頂流帕梅拉借助AI生成的能量棒廣告內(nèi)容。
![]()
這些實(shí)踐表明,數(shù)字人已經(jīng)逐步從概念走向直播、品牌互動(dòng)、廣告營(yíng)銷等多元場(chǎng)景應(yīng)用中,高質(zhì)量?jī)?nèi)容的生產(chǎn)門檻被進(jìn)一步拉低。
但有一個(gè)考題卻從未解決,數(shù)字人能應(yīng)對(duì)帶貨場(chǎng)景中的對(duì)話配合,放到深度訪談里就接不住了。直播帶貨尚且可以靠語(yǔ)調(diào)和動(dòng)作支撐起來(lái),深度訪談中一來(lái)一回的互動(dòng)、下意識(shí)的微表情、眼神的落點(diǎn)、接話的節(jié)奏,這些真人之間習(xí)以為常的細(xì)節(jié),恰恰是數(shù)字人最難跨越的門檻。
百度一鏡在WAIC展示的視頻播客方案,正是對(duì)這一命題的產(chǎn)業(yè)級(jí)回應(yīng)。
![]()
百度一鏡數(shù)字人有多“逼真”?
視頻播客的熱度在近兩年持續(xù)攀升,但在實(shí)際落地中仍面臨諸多痛點(diǎn)。
真人訪談?lì)惞?jié)目的制作成本居高不下,從布景陳設(shè)、嘉賓邀約到設(shè)備租賃、后期剪輯各個(gè)環(huán)節(jié)都需要大量投入,且制作周期長(zhǎng)、產(chǎn)出效率不高。現(xiàn)有數(shù)字人視頻方案雖然能在一定程度上增效降本,但技術(shù)尚未成熟,數(shù)字人表情生硬、對(duì)談缺乏交互感,畫面合成痕跡過(guò)重,觀眾幾乎一眼便能識(shí)破,無(wú)法沉浸其中。
在2026年WAIC現(xiàn)場(chǎng),百度一鏡首發(fā)的數(shù)字人視頻播客之所以能引發(fā)關(guān)注,源于其在觀感上已經(jīng)較為貼近真人訪談,部分片段甚至足以“以假亂真”,引發(fā)了不少參會(huì)者關(guān)注。
![]()
光是微表情這一項(xiàng),就能看出差距。傳統(tǒng)數(shù)字人在情緒轉(zhuǎn)換上往往缺乏過(guò)渡,例如數(shù)字人從“振奮”到“沉思”幾乎不帶情感過(guò)渡,違和感十足。而百度一鏡的視頻播客中,林深在發(fā)表觀點(diǎn)時(shí)會(huì)下意識(shí)挑眉,甲小姐在傾聽對(duì)方觀點(diǎn)進(jìn)入思考狀態(tài)時(shí)嘴角也會(huì)輕微下壓,這類近乎人類本能反應(yīng)的細(xì)節(jié),讓數(shù)字人有了“活人感”。
![]()
再看對(duì)話互動(dòng)配合。視頻播客中雙人訪談的難點(diǎn)從來(lái)不只是考驗(yàn)臺(tái)詞的完成度,而是在于雙方之間的實(shí)時(shí)反饋。這段長(zhǎng)約3分鐘的對(duì)談中,兩人的互動(dòng)節(jié)奏較為流暢。在林深陳述觀點(diǎn)時(shí),甲小姐會(huì)適時(shí)點(diǎn)頭回應(yīng)表達(dá)認(rèn)可,視線始終穩(wěn)定落在對(duì)方面部;當(dāng)話題推進(jìn)到關(guān)鍵節(jié)點(diǎn),甲小姐會(huì)迅速反應(yīng)調(diào)整并順勢(shì)接過(guò)話頭,整體銜接沒有明顯的停頓或錯(cuò)位感。
![]()
最后是畫面質(zhì)感。市面上多數(shù)AI數(shù)字人之所以“一眼AI”,核心原因在于數(shù)字人皮膚太過(guò)光滑,濾鏡太偏重,再加上人物與背景之間缺乏統(tǒng)一的光影邏輯,很容易造成人畫分離的懸浮感。在這個(gè)視頻中,兩位數(shù)字人都保留了相對(duì)自然的皮膚紋理,眼角紋路和顴骨斑點(diǎn)未被刻意磨除,近乎1:1真人可隆,且人物與背景的光照方向也基本一致,合成感有所減弱。
簡(jiǎn)而言之,傳統(tǒng)數(shù)字人在訪談場(chǎng)景中更像一套預(yù)設(shè)動(dòng)作的執(zhí)行工具;而百度一鏡的這版方案,則更像一個(gè)有反饋的談話對(duì)象。
![]()
根據(jù)百度公布的數(shù)據(jù),使用該方案后,視頻播客制作成本降低74%,制作效率提升至原來(lái)的近8倍,同時(shí)內(nèi)容平均播放時(shí)長(zhǎng)增加了29%。不難看出,這輪技術(shù)升級(jí)后,百度一鏡至少在成本控制和用戶留存兩個(gè)維度上,為行業(yè)提供了可量化的參考。
而此次升級(jí)后的百度一鏡,已不限于雙人深度訪談,還支持單人講解、多人圓桌討論等場(chǎng)景。公開信息顯示,百度一鏡在財(cái)經(jīng)短視頻賽道已涌現(xiàn)多個(gè)爆款,多個(gè)由百度一鏡生成的數(shù)字人財(cái)經(jīng)主播視頻播放量高達(dá)200w+。
![]()
同樣是數(shù)字人,百度一鏡改了什么?
AI數(shù)字人要做到真正意義上的“逼真”,關(guān)鍵不在于渲染精度,而在于行為邏輯是否經(jīng)得起推敲。
市面上大量數(shù)字人產(chǎn)品之所以“一眼AI”,根源在于其行為邏輯是編程式表演。通過(guò)對(duì)輸入內(nèi)容做情緒標(biāo)簽分類,調(diào)取對(duì)應(yīng)表情模版,結(jié)果是數(shù)字人表情轉(zhuǎn)換缺乏過(guò)渡,情緒反應(yīng)孤立,缺少連貫的人設(shè)支撐。
百度一鏡給出的技術(shù)解法是,把數(shù)字人從執(zhí)行指令的木偶,變成理解內(nèi)容的演員。
這套邏輯背后,有三個(gè)值得關(guān)注的技術(shù)要點(diǎn)。
其一,文心大模型充當(dāng)導(dǎo)演。
傳統(tǒng)技術(shù)路線是Low-level控制,識(shí)別一句話的情緒傾向,匹配一個(gè)對(duì)應(yīng)的表情動(dòng)畫。百度一鏡升級(jí)到了High-level控制,不只看情緒,而是從六個(gè)維度綜合評(píng)估,給出細(xì)粒度的表演指令。這項(xiàng)能力的底層基礎(chǔ)是AU級(jí)(Action Unit)控制,把面部微表情拆解為上百個(gè)可獨(dú)立調(diào)度的基本單元。
![]()
以“挑眉”為例,傳統(tǒng)方案只能做"挑眉/不挑眉"的二元開關(guān);而百度一鏡可以通過(guò)“標(biāo)簽+自然語(yǔ)言描述”相結(jié)合的方式,控制挑眉的角度、速度、持續(xù)時(shí)間以及它與嘴角、眼神的配合關(guān)系。
這種控制粒度,相當(dāng)于將導(dǎo)演的意圖拆解為可執(zhí)行的表演指令。
其二,專精模型確保導(dǎo)演的指令被執(zhí)行到位。
文心大模型完成規(guī)劃后,需要執(zhí)行層將指令轉(zhuǎn)化為畫面輸出。這部分的技術(shù)難點(diǎn)在兩個(gè)維度:空間上,多個(gè)部位需要同步運(yùn)動(dòng)且互不干擾;時(shí)間上,表情變化的響應(yīng)速度要足夠快,否則就會(huì)出現(xiàn)聲畫錯(cuò)位。
百度自研的數(shù)字人專精模型,在空間維度實(shí)現(xiàn)了對(duì)數(shù)百個(gè)微表情單元的協(xié)同調(diào)度;在時(shí)間維度上,將表情控制粒度壓縮到1秒以內(nèi),以確保語(yǔ)音節(jié)奏與面部動(dòng)作精準(zhǔn)對(duì)齊。這兩項(xiàng)能力疊加,解決了此前數(shù)字人產(chǎn)品普遍存在的模態(tài)拼接失真問(wèn)題。
例如,在可口可樂的一條AI范志毅廣告TVC中,數(shù)字人先是自然注視主持人,隨后從容抬起搭在膝上的雙手,從口袋掏出手機(jī),同時(shí)回答從未間斷。整個(gè)過(guò)程中,目光、手勢(shì)、語(yǔ)音三者精準(zhǔn)同步,幾乎看不出AI的痕跡。
其三,海量影視級(jí)數(shù)據(jù)“喂”出來(lái)的真實(shí)感。
數(shù)字人演技打磨需要靠高質(zhì)量素材的喂養(yǎng)。百度一鏡通過(guò)將大量影視級(jí)素材輸入文心大模型,讓模型理解每一幀畫面內(nèi)容,再經(jīng)過(guò)多輪清洗、篩選、提煉,最終保留高質(zhì)量樣本用于訓(xùn)練。而訓(xùn)練數(shù)據(jù)的質(zhì)量,直接決定了數(shù)字人在面對(duì)不同場(chǎng)景時(shí)能否做出恰當(dāng)?shù)姆磻?yīng)。
經(jīng)過(guò)高質(zhì)量喂養(yǎng)和訓(xùn)練后,百度一鏡生成的數(shù)字人演技得到了直觀的提升。
三層技術(shù)疊加下,百度一鏡數(shù)字人的語(yǔ)音節(jié)奏、面部表情、肢體動(dòng)作不再作為三個(gè)獨(dú)立模塊運(yùn)行,而是形成了一套統(tǒng)一連貫的表達(dá)系統(tǒng)。
需要指出的是,盡管這套方案已在單人講學(xué)、雙人訪談、多人討論等場(chǎng)景中有所展示,量產(chǎn)穩(wěn)定性和泛化能力仍有待更長(zhǎng)周期的驗(yàn)證。但至少?gòu)募夹g(shù)路徑上看,它為行業(yè)提供了一個(gè)值得參照的方向。
![]()
從視頻播客到AI短劇,內(nèi)容創(chuàng)作正式邁入“超級(jí)個(gè)體”時(shí)代
過(guò)去一年,AI視頻生成行業(yè)普遍卡在同一瓶頸上:文生圖像、文生視頻熱度不減,但生成人物表情依然僵硬,口型對(duì)齊仍有偏差;數(shù)字人直播雖已不少見,但能承載深度訪談內(nèi)容的幾乎沒有。
百度一鏡這次切入的,正是“微表情”這塊最難啃的骨頭。
拉長(zhǎng)時(shí)間線來(lái)看,百度一鏡過(guò)去一年的產(chǎn)品演進(jìn)路徑頗為清晰,場(chǎng)景邊界持續(xù)外擴(kuò)。
AI羅永浩時(shí)期,重點(diǎn)在于驗(yàn)證電商直播場(chǎng)景中數(shù)字人的真實(shí)感能否被用戶接受;AI范志毅階段,數(shù)字人從帶貨主播延展為可交互的品牌資產(chǎn);WAIC現(xiàn)場(chǎng)展示的視頻播客方案,則把雙人深度訪談做成了可落地的產(chǎn)品形態(tài)。
![]()
其底層產(chǎn)品架構(gòu)也在同步升級(jí)。目前,百度一鏡已將直播、視頻、互動(dòng)三大板塊整合為統(tǒng)一平臺(tái),背后的編劇Agent、導(dǎo)演Agent、剪輯Agent配合80多個(gè)Skill模塊,共同支撐起從內(nèi)容策劃到成片輸出的完整制作流程。
百度創(chuàng)始人李彥宏曾在Create大會(huì)上提出一個(gè)判斷:“數(shù)字人就是看得見的智能體。”當(dāng)數(shù)字人具備了微表情表達(dá)能力,它的角色定位就不再是直播間的出鏡工具,而是可以深度參與內(nèi)容創(chuàng)作的基礎(chǔ)設(shè)施。
這種基礎(chǔ)設(shè)施屬性,在一個(gè)容易被忽視的細(xì)節(jié)上體現(xiàn)得尤為明顯。市面上多數(shù)視頻生成工具僅能生成數(shù)十秒的片段,而百度一鏡可以輸出幾分鐘甚至數(shù)小時(shí)的連貫內(nèi)容,同時(shí)支持實(shí)時(shí)互動(dòng),不在同一量級(jí)。
![]()
更重要的是,這套方案的使用門檻并不高。用戶只需上傳3分鐘素材,即可1:1復(fù)刻本人的形象與聲音,拍攝時(shí)間和制作成本被大幅壓縮。
量級(jí)差異帶來(lái)的是創(chuàng)作方式的根本變化。一個(gè)人加上百度一鏡,就能完成以任意人物形象為主體的視頻制作。場(chǎng)地、設(shè)備、嘉賓、剪輯,這些過(guò)去繞不過(guò)去的門檻,正在被逐一拆除。
視頻播客驗(yàn)證了數(shù)字人在深度內(nèi)容場(chǎng)景的可行性,尤其是被突破的微表情能力,讓角色在對(duì)話中的情緒流露有了“真人感”的底色——同樣的能力,正在向AI短劇遷移。一部十分鐘的AI短片,創(chuàng)作者只需提供故事和創(chuàng)意,編劇、導(dǎo)演、剪輯三個(gè)Agent各司其職,百度一鏡數(shù)字人負(fù)責(zé)把想法演繹出來(lái)。一部短劇的制作成本從數(shù)萬(wàn)元降至幾乎為零,制作周期更是從數(shù)周壓縮至數(shù)小
市場(chǎng)對(duì)這套邏輯已有初步反饋。據(jù)沙利文報(bào)告,百度一鏡以8.1%的市場(chǎng)份額位列行業(yè)第一,產(chǎn)品綜合實(shí)力排名同樣居首,當(dāng)前已經(jīng)累計(jì)服務(wù)客戶超10萬(wàn),覆蓋30多個(gè)行業(yè)。
從視頻播客到AI短劇,數(shù)字人的應(yīng)用邊界還在持續(xù)外擴(kuò)。若將視線放得更遠(yuǎn),數(shù)字人在內(nèi)容創(chuàng)作領(lǐng)域的最終形態(tài),或許是一個(gè)“7×24小時(shí)在線的創(chuàng)作協(xié)作體”。
當(dāng)創(chuàng)作不再受制于資源,表達(dá)的門檻便只剩下想象力本身。而想象力,從來(lái)不是技術(shù)能決定的。百度一鏡正在做的,是把內(nèi)容生產(chǎn)的主動(dòng)權(quán),從機(jī)構(gòu)交還給個(gè)體。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.