![]()
本文刊發(fā)于《現(xiàn)代電影技術(shù)》2026年第7期
專家點(diǎn)評(píng)
徐 濤
正高級(jí)工程師
中國電影科學(xué)技術(shù)研究所(中央宣傳部電影技術(shù)質(zhì)量檢測(cè)所)副所長
當(dāng)前,我國電影科技與產(chǎn)業(yè)發(fā)展正加速推進(jìn)全面智能化,以可控生成為代表的生成式人工智能(GAI)技術(shù)正在成為驅(qū)動(dòng)行業(yè)提質(zhì)增效、培育發(fā)展新質(zhì)生產(chǎn)力的重要力量。在電影前期視覺開發(fā)中,GAI正推動(dòng)工藝流程從單點(diǎn)式圖像生成轉(zhuǎn)向面向分鏡迭代、美術(shù)資產(chǎn)管理和創(chuàng)意決策的流程化應(yīng)用,該領(lǐng)域的關(guān)鍵問題也正從“能否生成高質(zhì)量畫面”轉(zhuǎn)向“能否按照創(chuàng)作意圖精準(zhǔn)穩(wěn)定修改畫面”。電影美術(shù)創(chuàng)作通常需要圍繞角色造型、道具樣式、場(chǎng)景氛圍和鏡頭構(gòu)圖進(jìn)行多輪調(diào)整優(yōu)化,其核心要求是在保持畫面風(fēng)格、敘事邏輯和資產(chǎn)一致性的前提下,實(shí)現(xiàn)人物、道具、環(huán)境與光影等局部元素的可控修改。未來,相關(guān)技術(shù)需要進(jìn)一步打通導(dǎo)演意圖、美術(shù)資產(chǎn)、分鏡畫面與模型生成結(jié)果之間的對(duì)應(yīng)關(guān)系,并將多模態(tài)理解、區(qū)域控制、提示詞生成和標(biāo)準(zhǔn)作業(yè)程序(SOP)融入影視創(chuàng)作生產(chǎn)流程,使人工智能(AI)從輔助出圖工具轉(zhuǎn)向支撐分鏡推演、美術(shù)方案生成和創(chuàng)意比選的流程化技術(shù)能力。這一發(fā)展方向不僅有助于降低復(fù)雜模型的使用門檻,也將推動(dòng)AI技術(shù)與電影語言、電影工業(yè)流程的深度融合。《面向電影前期視覺開發(fā)的圖像智能生成框架研究》一文正是圍繞上述需求展開研究。文章提出面向電影分鏡迭代的ReMAP圖像智能生成框架,通過區(qū)域掩碼與對(duì)應(yīng)提示詞的顯式綁定,實(shí)現(xiàn)多區(qū)域資產(chǎn)的精準(zhǔn)控制和非編輯區(qū)域穩(wěn)定保持;引入多模態(tài)SOP提示生成機(jī)制,降低復(fù)雜場(chǎng)景下的提示詞編寫成本。實(shí)驗(yàn)表明,該方法在多區(qū)域語義隔離、資產(chǎn)結(jié)構(gòu)一致性和非編輯區(qū)域穩(wěn)定性方面具有良好表現(xiàn)。本文兼具技術(shù)方法探索實(shí)踐與影視生產(chǎn)流程應(yīng)用價(jià)值,對(duì)于推動(dòng)人工智能生成內(nèi)容(AIGC)技術(shù)服務(wù)電影前期視覺開發(fā)具有較高的參考價(jià)值。
項(xiàng)目信息
上海市人才發(fā)展資助項(xiàng)目(2021016);上海市教育科學(xué)研究項(xiàng)目“生成式人工智能賦能影視創(chuàng)制人才培養(yǎng)的實(shí)踐研究”(GSC2026099);中國電影地緣文化研究基地2025年度項(xiàng)目“國產(chǎn)中小成本電影的地緣版圖研究”(25Z0105)。
作者簡介
![]()
黃東晉
博士,副教授,上海大學(xué)上海電影學(xué)院、上海電影特效工程技術(shù)研究中心博士生導(dǎo)師,主要研究方向:人工智能、影視技術(shù)、計(jì)算機(jī)圖形學(xué)等。
張?jiān)娪?/strong>
上海大學(xué)上海電影學(xué)院2023級(jí)碩士研究生,主要研究方向:圖像處理與圖像生成。
![]()
![]()
曲建濤
上海大學(xué)上海電影學(xué)院2023級(jí)博士研究生,主要研究方向:計(jì)算機(jī)視覺、圖像智能處理等。
王 倩
上海大學(xué)上海電影學(xué)院2024級(jí)碩士研究生,主要研究方向:圖像智能分割。
![]()
摘要
在電影開發(fā)中,分鏡、概念圖與美術(shù)資產(chǎn)往往需要圍繞角色造型、道具樣式、場(chǎng)景氛圍和鏡頭構(gòu)圖進(jìn)行多輪迭代,現(xiàn)有全局語義編輯與掩碼重繪方法在多區(qū)域協(xié)同編輯時(shí),仍難以兼顧結(jié)構(gòu)穩(wěn)定性與語義獨(dú)立性。為此,本文面向電影前期視覺開發(fā),構(gòu)建了一種圖像智能生成框架ReMAP。該方法將復(fù)雜分鏡解構(gòu)為獨(dú)立的語義資產(chǎn)區(qū)域,通過建立區(qū)域空間掩碼與對(duì)應(yīng)提示詞的顯式約束映射,實(shí)現(xiàn)電影美術(shù)資產(chǎn)的局部精準(zhǔn)控制與非編輯區(qū)域的穩(wěn)定保持,有效支持多區(qū)域協(xié)同重繪與多變體創(chuàng)意比選。同時(shí),為緩解復(fù)雜場(chǎng)景下的提示詞工程成本,本文構(gòu)建了一種多模態(tài)標(biāo)準(zhǔn)作業(yè)程序提示自動(dòng)生成機(jī)制,能夠從參考資產(chǎn)與原始分鏡中自適應(yīng)提取視覺語義特征,自動(dòng)生成涵蓋全局風(fēng)格與區(qū)域約束的復(fù)用型場(chǎng)景描述模板。實(shí)驗(yàn)結(jié)果表明,在統(tǒng)一Flux2?Klein底座下,相較于Prompt?to?Prompt全局語義編輯與DiffEdit局部掩碼編輯等基線,ReMAP在多區(qū)域語義隔離、資產(chǎn)結(jié)構(gòu)一致性與非編輯區(qū)域穩(wěn)定性方面表現(xiàn)更優(yōu),為電影美術(shù)設(shè)定與分鏡制作提供了低成本、高交互的智能化技術(shù)支撐。
關(guān)鍵詞
擴(kuò)散模型;人工智能生成內(nèi)容(AIGC);圖像編輯;可控圖像生成
1
引言
人工智能生成內(nèi)容(AIGC)技術(shù)在電影前期視覺開發(fā)中的應(yīng)用正逐步從單幅概念圖生成走向分鏡級(jí)別的持續(xù)迭代。擴(kuò)散模型(Diffusion Model)從去噪擴(kuò)散模型(DDPM)[1]到潛在空間擴(kuò)散(Latent Diffusion)的演進(jìn)為Stable Diffusion[2]等模型奠定了基礎(chǔ)。近期基于Transformer的擴(kuò)散模型與Rectified Flow進(jìn)一步推動(dòng)了新一代模型架構(gòu)的發(fā)展,例如以DiT[3]為代表的演進(jìn)方向及其在FLUX[4]等模型中的延伸。2025年以來,OmniGen[5]與OminiControl[6]等研究進(jìn)一步表明,統(tǒng)一圖像生成與面向DiT的多條件控制正在成為可控生成系統(tǒng)的重要發(fā)展方向。在文本條件建模方面,CLIP[7]與T5[8]為跨模態(tài)表征與提示詞對(duì)齊提供了關(guān)鍵支撐。
電影分鏡圖不僅承擔(dān)敘事結(jié)構(gòu)與鏡頭調(diào)度的表達(dá),還對(duì)角色造型、場(chǎng)景光影、道具材質(zhì)等美術(shù)要素提出一致性要求。現(xiàn)實(shí)制作中,美術(shù)團(tuán)隊(duì)常需針對(duì)同一鏡頭進(jìn)行多輪局部調(diào)整,例如替換單個(gè)資產(chǎn)、修改局部表情或調(diào)整區(qū)域光感,同時(shí)維持整體風(fēng)格和非編輯區(qū)域的穩(wěn)定性。因此,面向電影前期視覺開發(fā)的生成系統(tǒng)不僅需要生成單張視覺效果圖,還應(yīng)支持分鏡迭代中的角色、道具、場(chǎng)景和光影等元素的局部修改,并在多輪修改中保持鏡頭構(gòu)圖與美術(shù)風(fēng)格穩(wěn)定。
現(xiàn)有方法多依賴全局提示詞進(jìn)行一次性生成,容易引發(fā)語義串?dāng)_,導(dǎo)致局部元素互相污染。ControlNet[9]等結(jié)構(gòu)條件控制方法提供了更強(qiáng)的幾何與結(jié)構(gòu)約束,但對(duì)多區(qū)域語義隔離與局部獨(dú)立控制仍有限。IP?Adapter[10]等圖像條件適配器提供更直接的視覺約束能力,但在多區(qū)域協(xié)同與局部獨(dú)立控制上仍存在局限。LoRA[11]作為低秩適配方法能在較低成本下實(shí)現(xiàn)風(fēng)格與角色的個(gè)性化注入,但其側(cè)重模型能力遷移,難以直接解決多區(qū)域并行編輯與語義隔離問題。在圖像編輯領(lǐng)域,Prompt?to?Prompt[12]通過跨注意力控制實(shí)現(xiàn)文本驅(qū)動(dòng)的全局語義編輯,InstructPix2Pix[13]進(jìn)一步將自然語言編輯指令用于圖像修改任務(wù),但二者在多區(qū)域資產(chǎn)并行編輯中仍缺乏顯式區(qū)域隔離機(jī)制。DiffEdit[14]與RePaint[15]等掩碼(Mask)編輯方法可支持局部重繪,但在復(fù)雜資產(chǎn)與多區(qū)域條件下仍易出現(xiàn)結(jié)構(gòu)漂移、邊界不連續(xù)或非編輯區(qū)域細(xì)節(jié)破壞。近期BrushNet[16]與PowerPaint[17]等工作進(jìn)一步提升了擴(kuò)散模型在掩碼區(qū)域修復(fù)、文本引導(dǎo)重繪與多任務(wù)圖像修復(fù)(Inpainting)中的表現(xiàn),但其重點(diǎn)仍在通用圖像修復(fù)質(zhì)量與任務(wù)泛化,尚未面向電影分鏡中的多資產(chǎn)語義隔離與工作流閉環(huán)。MultiDiffusion[18]通過多擴(kuò)散路徑融合增強(qiáng)了區(qū)域控制能力,但對(duì)電影分鏡中資產(chǎn)級(jí)語義綁定與生產(chǎn)流程自動(dòng)化支持仍有限。
針對(duì)上述問題,本文提出一種面向電影前期視覺開發(fā)的圖像智能生成框架ReMAP。核心思路是將分鏡畫面拆分為多個(gè)語義區(qū)域,為每個(gè)區(qū)域綁定獨(dú)立提示詞與掩碼約束,并結(jié)合全局風(fēng)格提示詞實(shí)現(xiàn)局部可控與全局一致。為降低提示詞負(fù)擔(dān),本文構(gòu)建多模態(tài)標(biāo)準(zhǔn)作業(yè)程序(SOP)提示生成機(jī)制,自動(dòng)生成兼顧風(fēng)格與細(xì)節(jié)的提示詞模板。實(shí)驗(yàn)結(jié)果表明,在同一生成底座和參數(shù)設(shè)置下,該流程相較于Prompt?to?Prompt全局語義編輯與DiffEdit局部掩碼編輯,在多區(qū)域語義解耦、資產(chǎn)結(jié)構(gòu)保持和背景穩(wěn)定性方面具有更好的綜合表現(xiàn)。本文的主要貢獻(xiàn)如下:
(1)針對(duì)電影前期視覺開發(fā)場(chǎng)景,構(gòu)建了ReMAP區(qū)域多模態(tài)注意力提示框架,將區(qū)域語義約束深度嵌入生成流程,實(shí)現(xiàn)了分鏡中多區(qū)域資產(chǎn)的協(xié)同精準(zhǔn)控制。
(2)設(shè)計(jì)多模態(tài)SOP提示生成機(jī)制,形成面向電影前期視覺開發(fā)的標(biāo)準(zhǔn)化工作流程,覆蓋資產(chǎn)輸入、區(qū)域標(biāo)注、語義綁定、擴(kuò)散重繪與多方案比選等關(guān)鍵環(huán)節(jié)。
(3)構(gòu)建面向電影前期視覺開發(fā)的圖像智能生成的完整ReMAP管線,并在此基礎(chǔ)上開發(fā)ReMAP Storyboard原型系統(tǒng),集成提示生成、區(qū)域標(biāo)注、模型調(diào)度與結(jié)果評(píng)估等核心模塊,驗(yàn)證該流程在分鏡局部修改與多資產(chǎn)協(xié)同編輯中的可行性。
2
研究方法
2.1 系統(tǒng)整體框架
如圖1所示,ReMAP生成框架由六個(gè)功能模塊組成。各模塊以前一階段輸出作為后一階段輸入,逐步完成電影分鏡的局部可控生成、資產(chǎn)一致性保持與多方案輸出。
![]()
圖1 面向電影前期視覺開發(fā)的圖像智能生成框架(ReMAP)
(1)用戶輸入模塊。用戶提供原始分鏡圖像、參考資產(chǎn)與編輯意圖,明確需要修改的角色、道具、背景等目標(biāo)區(qū)域及預(yù)期視覺效果。
(2)多模態(tài)場(chǎng)景生成與提示詞輸出模塊。系統(tǒng)將原始分鏡、參考資產(chǎn)與SOP指令、編輯意圖輸入多模態(tài)視覺模型,生成全局風(fēng)格提示詞、區(qū)域提示詞以及多場(chǎng)景候選描述,為后續(xù)區(qū)域控制提供語義條件。
(3)多區(qū)域Mask標(biāo)注模塊。用戶或系統(tǒng)輔助分割工具在原始分鏡上完成多個(gè)目標(biāo)區(qū)域的Mask標(biāo)注,將畫面中的資產(chǎn)區(qū)域、場(chǎng)景區(qū)域與非編輯區(qū)域進(jìn)行空間區(qū)分。
(4)區(qū)域語義約束生成模塊。系統(tǒng)將區(qū)域Mask與對(duì)應(yīng)區(qū)域提示詞建立顯式綁定,并結(jié)合全局風(fēng)格提示詞形成區(qū)域化生成條件,使不同區(qū)域主要接收與其匹配的語義約束。
(5)擴(kuò)散模型繪制模塊。系統(tǒng)將全局提示詞、區(qū)域提示詞與區(qū)域Mask輸入Flux2?Klein生成底座,通過區(qū)域化重繪與融合策略保持非編輯區(qū)域穩(wěn)定,并完成局部可控生成。
(6)可控電影分鏡輸出模塊。系統(tǒng)輸出單資產(chǎn)多場(chǎng)景、單場(chǎng)景資產(chǎn)替換與多區(qū)域同時(shí)編輯等多類結(jié)果,支持多變體方案并行生成、對(duì)比與篩選。
2.2 多模態(tài)視覺分析模塊
圖2展示了多模態(tài)視覺分析模塊的基本流程,其輸入包括參考道具圖像、SOP指令框架與編輯意圖。系統(tǒng)首先基于多模態(tài)視覺模型,結(jié)合編輯意圖和SOP指令框架,對(duì)參考資產(chǎn)和分鏡畫面進(jìn)行語義解析,隨后輸出全局風(fēng)格提示詞、區(qū)域提示詞以及多場(chǎng)景候選描述。其中,全局風(fēng)格提示詞用于控制整體電影風(fēng)格,區(qū)域提示詞分別綁定道具區(qū)域與場(chǎng)景區(qū)域,多場(chǎng)景候選描述用于支持后續(xù)方案生成與比選。SOP指令由固定約束前綴、可變場(chǎng)景描寫規(guī)則與畫質(zhì)還原后綴構(gòu)成。
![]()
圖2 多模態(tài)視覺模型用于語義解析流程
固定約束前綴用于定義整體畫面風(fēng)格與排斥條件,保障場(chǎng)景基調(diào)一致。可變場(chǎng)景描寫規(guī)則引導(dǎo)多模態(tài)模型從主色調(diào)、情緒基調(diào)、角色氣質(zhì)、造型語言、材質(zhì)觀感與空間光感等維度生成衍生元素。畫質(zhì)還原后綴用于對(duì)齊生成場(chǎng)景的畫面質(zhì)感與參考資產(chǎn)。
![]()
其中Φ為多模態(tài)提示詞生成映射。系統(tǒng)據(jù)此輸出全局風(fēng)格提示詞約束整體畫面風(fēng)格,并為每個(gè)編輯區(qū)域生成獨(dú)立區(qū)域提示詞,以提升局部可控性。該機(jī)制減少了人工編寫復(fù)雜場(chǎng)景描述的工作量,能夠快速產(chǎn)生與參考資產(chǎn)匹配的多場(chǎng)景候選描述,直接用于后續(xù)局部重繪。
2.3 區(qū)域語義約束與圖像生成
本文采用訓(xùn)練免調(diào)的區(qū)域提示思想,在不額外訓(xùn)練模型的前提下,通過區(qū)域注意力掩碼將不同文本提示約束到對(duì)應(yīng)圖像區(qū)域。Prompt?to?Prompt 證明了跨注意力圖能夠作為文本驅(qū)動(dòng)圖像編輯的有效控制入口,MultiDiffusion則通過多擴(kuò)散路徑融合展示了區(qū)域級(jí)生成控制的可行性。近期,Chen等[19]面向FLUX.1等DiT架構(gòu)表明基于注意力操控的區(qū)域提示詞-掩碼綁定能夠改善復(fù)雜提示下的空間組合控制。RAGD[20]則從區(qū)域硬綁定與軟細(xì)化角度提升了多區(qū)域文本到圖像生成的一致性。因此,本文并不將區(qū)域提示機(jī)制本身作為全新算法提出,而是將其與電影分鏡資產(chǎn)編輯、SOP提示生成和多方案比選流程結(jié)合,形成面向影視前期制作的區(qū)域化編輯管線。在FLUX的DiT架構(gòu)中,圖像被劃分為Patch token,區(qū)域語義約束通過對(duì)token空間的顯式定位與注意力隔離實(shí)現(xiàn),從而削弱全局提示詞帶來的語義串?dāng)_并提升局部可控性。
2.3.1 空間位置映射與區(qū)域控制
圖像token保留空間位置信息,系統(tǒng)采用旋轉(zhuǎn)位置編碼(Rotary Position Embedding, RoPE)[21]表示token間的相對(duì)位置關(guān)系,并將二維坐標(biāo)映射到token表征中。給定第i個(gè)編輯區(qū)域的二值掩碼Mi,其中Mi(x)∈{0,1}表示空間位置x是否屬于該區(qū)域,將其映射到token索引集合Ωi,如式(2)所示。
![]()
其中,t表示序列化后的圖像Patch token(或?qū)?yīng)的索引),pos(t)表示該token在原圖中的空間位置。該映射為后續(xù)注意力隔離提供顯式位置索引,使模型在自注意力與交叉注意力中保持區(qū)域可分性。
2.3.2 注意力隔離與區(qū)域提示詞注入
如圖3所示,為避免不同區(qū)域提示詞相互干擾,本文在交叉注意力中加入?yún)^(qū)域注意力掩碼。設(shè)區(qū)域提示詞Pi 經(jīng)文本編碼器得到的鍵和值特征分別為Ki與Vi,圖像token的查詢矩陣為Q。區(qū)域注意力掩碼Ai 作為注意力得分矩陣上的偏置項(xiàng)使用,其元素定義如式(3)所示。
![]()
圖3 區(qū)域語義約束作用于注意力圖示
![]()
區(qū)域注意力計(jì)算如式(4)所示。
![]()
其中d為注意力通道維度。實(shí)際計(jì)算中,Ai 會(huì)擴(kuò)展為與注意力得分矩陣同維度的掩碼偏置,使提示詞Pi 僅作用于Ωi 對(duì)應(yīng)區(qū)域,非目標(biāo)區(qū)域?qū)υ撎崾驹~的注意力被抑制,從而實(shí)現(xiàn)跨區(qū)域語義隔離。
2.3.3 語義注入與局部修正
在區(qū)域化生成過程中,系統(tǒng)將全局風(fēng)格提示詞Pg與區(qū)域提示詞Pi 共同注入。區(qū)域條件特征如式(5)所示。
![]()
其中,g(?)為提示詞編碼函數(shù),C(x)表示空間位置x的綜合條件特征。g(Pg)用于約束整體風(fēng)格與畫面基調(diào),Mi(x)?g(Pi ) 表示第i個(gè)區(qū)域提示詞僅在對(duì)應(yīng)掩碼區(qū)域內(nèi)生效。通過區(qū)域掩碼約束,局部語義在目標(biāo)區(qū)域內(nèi)得到強(qiáng)化,非編輯區(qū)域保持原始結(jié)構(gòu)與材質(zhì)穩(wěn)定。該機(jī)制與FLUX區(qū)域提示(Regional Prompt)一致,將區(qū)域控制從全局語義約束的粗粒度約束轉(zhuǎn)化為區(qū)域級(jí)語義注入,提升多區(qū)域同時(shí)編輯的穩(wěn)定性與可控性。
3
實(shí)驗(yàn)結(jié)果與分析
3.1 實(shí)驗(yàn)設(shè)置
3.1.1 實(shí)驗(yàn)配置
實(shí)驗(yàn)平臺(tái)采用英偉達(dá)(NVIDIA) RTX A5000雙卡作為主要計(jì)算設(shè)備,擴(kuò)散生成模型統(tǒng)一使用Flux2?Klein。系統(tǒng)運(yùn)行于Python深度學(xué)習(xí)環(huán)境,核心推理模塊基于PyTorch框架并通過CUDA進(jìn)行GPU加速。所有實(shí)驗(yàn)輸出圖像分辨率統(tǒng)一設(shè)定為1600×1200。為保證對(duì)比公平性,不同方法在相同原始分鏡、參考資產(chǎn)、區(qū)域掩碼、輸入分辨率與采樣設(shè)置下進(jìn)行測(cè)試,僅替換提示詞組織方式、區(qū)域約束機(jī)制及局部編輯策略。測(cè)試任務(wù)覆蓋單資產(chǎn)多場(chǎng)景、單場(chǎng)景多資產(chǎn)替換與多區(qū)域同時(shí)編輯三類典型需求。評(píng)價(jià)以定性對(duì)比為主、定量指標(biāo)為輔,定量部分用于輔助衡量資產(chǎn)一致性、區(qū)域語義匹配度與非編輯區(qū)域結(jié)構(gòu)穩(wěn)定性。
3.1.2 基線模型與對(duì)比方法
為驗(yàn)證本文方法在多區(qū)域語義隔離、局部獨(dú)立編輯與非編輯區(qū)域保持方面的有效性,實(shí)驗(yàn)設(shè)置三組對(duì)比對(duì)象:Prompt?to?Prompt全局語義編輯、DiffEdit局部掩碼編輯以及本文采用的ReMAP區(qū)域語義約束流程。三組方法均采用相同的Flux2?Klein生成底座、原始分鏡、參考資產(chǎn)、區(qū)域掩碼、采樣參數(shù)與輸入分辨率,僅在提示詞組織方式、區(qū)域約束機(jī)制和局部編輯策略上保持差異。
(1)Prompt?to?Prompt全局語義編輯。該方法通過跨注意力控制實(shí)現(xiàn)文本驅(qū)動(dòng)圖像編輯。本文將其作為全局提示詞編輯基線,即把全局風(fēng)格、局部資產(chǎn)與場(chǎng)景變化統(tǒng)一寫入同一提示詞中,再輸入擴(kuò)散模型生成結(jié)果。
(2)DiffEdit局部掩碼編輯。該方法依據(jù)語義差異或給定目標(biāo)區(qū)域掩碼進(jìn)行局部修改。本文將其作為局部重繪基線,即在相同原始分鏡與區(qū)域掩碼條件下,僅對(duì)目標(biāo)區(qū)域進(jìn)行重繪。
(3)ReMAP區(qū)域語義約束方法。本文方法將區(qū)域提示詞與對(duì)應(yīng)區(qū)域掩碼進(jìn)行顯式綁定,并通過區(qū)域語義約束控制不同編輯區(qū)域的生成過程。
3.1.3 評(píng)價(jià)指標(biāo)
本文評(píng)價(jià)以人工定性觀察為主,重點(diǎn)考察資產(chǎn)結(jié)構(gòu)是否穩(wěn)定、非編輯區(qū)域是否保持一致以及整體畫面是否符合電影分鏡視覺需求。定量評(píng)價(jià)作為輔助驗(yàn)證,在單資產(chǎn)多場(chǎng)景編輯實(shí)驗(yàn)中,采用CLIP語義相似度(CLIP Similarity)、DINOv2結(jié)構(gòu)相似度(DINOv2 Similarity)與圖文匹配得分(CLIPScore),分別衡量資產(chǎn)語義一致性、局部結(jié)構(gòu)穩(wěn)定性與整體圖文匹配程度;在多資產(chǎn)多場(chǎng)景同時(shí)編輯實(shí)驗(yàn)中,采用局部文本匹配度(Local CLIP?T)、背景感知差異(Background LPIPS)與整體圖像偏好評(píng)分(ImageReward),分別衡量區(qū)域文本匹配度、背景保持程度與整體圖像質(zhì)量。
3.2 單資產(chǎn)多場(chǎng)景編輯
本實(shí)驗(yàn)考察單一資產(chǎn)在多場(chǎng)景條件下的跨域一致性與環(huán)境適配能力,設(shè)置Prompt?to?Prompt全局語義編輯、DiffEdit局部掩碼編輯與本文方法(ReMAP)三種策略進(jìn)行對(duì)比。
3.2.1 定性結(jié)果
圖4展示了同一資產(chǎn)在多場(chǎng)景條件下的生成結(jié)果對(duì)比。Prompt?to?Prompt全局語義編輯容易產(chǎn)生風(fēng)格漂移或語義串?dāng)_,導(dǎo)致資產(chǎn)外觀與材質(zhì)在場(chǎng)景切換中不穩(wěn)定;DiffEdit局部掩碼編輯在局部替換時(shí)可維持部分結(jié)構(gòu),但在復(fù)雜背景與光影條件下易出現(xiàn)邊界突兀或細(xì)節(jié)破壞。本文方法通過區(qū)域語義約束與獨(dú)立提示詞綁定,使資產(chǎn)主體結(jié)構(gòu)在多場(chǎng)景切換中保持穩(wěn)定,同時(shí)能夠隨場(chǎng)景光照與材質(zhì)環(huán)境進(jìn)行合理適配。
![]()
圖4 單資產(chǎn)多場(chǎng)景下的定性實(shí)驗(yàn)對(duì)比
3.2.2 定量結(jié)果
為進(jìn)一步客觀驗(yàn)證各生成方法的資產(chǎn)保真能力并消除主觀視覺偏差,本文在定性對(duì)比的基礎(chǔ)上,引入多維度視覺特征相似度開展定量測(cè)評(píng)。通過對(duì)生成圖像中提取的資產(chǎn)區(qū)域特征與原始參考資產(chǎn)進(jìn)行深度距離計(jì)算,可嚴(yán)謹(jǐn)衡量模型在跨域遷移任務(wù)中的結(jié)構(gòu)維持底線。
表1 單資產(chǎn)多場(chǎng)景定量結(jié)果
![]()
表1匯總了各類方法在單資產(chǎn)多場(chǎng)景編輯實(shí)驗(yàn)中的客觀量化指標(biāo)對(duì)比。全局約束方法的CLIP Similarity、DINOv2 Similarity與CLIPScore分別為0.8389、0.7503和0.2815,說明僅依賴統(tǒng)一提示詞時(shí),資產(chǎn)語義與局部結(jié)構(gòu)在跨場(chǎng)景變化中容易發(fā)生漂移。局部重繪方法在 CLIP Similarity 和 DINOv2 Similarity 上提升至 0.8819 和 0.8260,表明掩碼約束有助于保持資產(chǎn)主體,但其CLIPScore降至0.2335,說明局部替換后的整體語義協(xié)調(diào)性仍存在不足。相比之下,ReMAP在三項(xiàng)指標(biāo)上分別達(dá)到0.8969、0.8472和0.3564,均為最高值,說明本文方法在資產(chǎn)語義一致性、結(jié)構(gòu)穩(wěn)定性與整體畫面匹配度方面具有更好的綜合表現(xiàn)。
3.3 多資產(chǎn)多場(chǎng)景同時(shí)編輯
本實(shí)驗(yàn)旨在驗(yàn)證本文系統(tǒng)在多目標(biāo)并發(fā)編輯場(chǎng)景下的特征隔離能力與局部可控性。同樣設(shè)置Prompt?to?Prompt全局語義編輯、DiffEdit局部掩碼編輯與本文方法ReMAP三種策略進(jìn)行對(duì)比。
3.3.1 定性實(shí)驗(yàn)
如圖5所示,實(shí)驗(yàn)以原始電影分鏡為輸入,分別對(duì)人物、車輛與場(chǎng)景風(fēng)格設(shè)置不同的語義約束,要求系統(tǒng)在同一畫面中同時(shí)完成人物造型變化、車輛外觀變化以及整體場(chǎng)景風(fēng)格轉(zhuǎn)換。在復(fù)雜的電影分鏡創(chuàng)作中,美術(shù)團(tuán)隊(duì)常需在保持鏡頭構(gòu)圖和空間關(guān)系穩(wěn)定的前提下,同步修改多個(gè)獨(dú)立元素,如人物服飾、背景道具、車輛類型或場(chǎng)景氛圍等。因此,該實(shí)驗(yàn)重點(diǎn)考察不同方法在多區(qū)域協(xié)同編輯時(shí)的語義隔離能力、局部融合效果與非目標(biāo)區(qū)域穩(wěn)定性。
![]()
圖 5 多資產(chǎn)多場(chǎng)景同時(shí)編輯流程圖
從圖6的對(duì)比結(jié)果可以看出,Prompt?to?Prompt將人物、車輛和場(chǎng)景變化統(tǒng)一寫入全局提示詞,能夠在一定程度上改變整體畫面風(fēng)格,但由于缺乏顯式區(qū)域約束,不同語義之間容易發(fā)生競爭與稀釋。例如,在人物變化約束下,畫面中的人物外觀并未被徹底改寫,仍保留較多原始服飾和輪廓特征;同時(shí),車輛和街景變化也會(huì)受全局提示詞共同影響,導(dǎo)致局部資產(chǎn)的修改邊界不夠清晰。DiffEdit依賴掩碼進(jìn)行局部重繪,能夠更直接地作用于指定區(qū)域,但其生成區(qū)域與原始背景間的融合較弱,容易在人物、車輛邊緣處產(chǎn)生突兀的貼圖感或光影不連續(xù)現(xiàn)象,使局部修改結(jié)果顯得不夠自然。相比之下,ReMAP通過區(qū)域掩碼與局部提示詞的顯式綁定,將人物、車輛與場(chǎng)景語義分別約束到對(duì)應(yīng)區(qū)域,使不同編輯目標(biāo)能夠在同一畫面中相對(duì)獨(dú)立地生效。從結(jié)果上看,人物造型、車輛外觀和賽博朋克場(chǎng)景氛圍均得到較穩(wěn)定的響應(yīng),同時(shí)整體透視關(guān)系、街道結(jié)構(gòu)和畫面光照保持較好的連貫性。
![]()
圖 6 多資產(chǎn)多場(chǎng)景同時(shí)編輯效果示例
3.3.2 定量結(jié)果
為從統(tǒng)計(jì)量化層面對(duì)多資產(chǎn)同步編輯的實(shí)際有效性進(jìn)行驗(yàn)證,本節(jié)選取了Local CLIP?T(衡量獨(dú)立區(qū)域內(nèi)文本與圖像語義的匹配度)、Background LPIPS(評(píng)估非目標(biāo)編輯區(qū)域的像素級(jí)內(nèi)容破壞程度,數(shù)值越低代表背景保護(hù)越好)以及ImageReward(反映生成整體畫面的工業(yè)美學(xué)與人類偏好綜合評(píng)分)作為定量考量基準(zhǔn)。
表2詳細(xì)列出了多場(chǎng)景混排實(shí)驗(yàn)中的客觀對(duì)比面板。如表2所示,本文方法在Local CLIP?T指標(biāo)上相較代表性基線取得了一定提升,表明其在多參數(shù)疊加的復(fù)雜場(chǎng)景下具備較好的局部語義還原能力。同時(shí),相比其他基線,ReMAP取得了較低的Background LPIPS(0.0462),說明該算法在執(zhí)行復(fù)雜前景并排編輯時(shí),對(duì)原始場(chǎng)景的非編輯區(qū)域具有較好的保護(hù)效果。最后,較高的ImageReward綜合評(píng)分也從整體視覺質(zhì)量與人類偏好角度說明,即便施加多維交叉空間掩碼,核心擴(kuò)散系統(tǒng)的最終成圖仍能維持較穩(wěn)定的電影視覺美學(xué)表現(xiàn)。
表 2 多資產(chǎn)多場(chǎng)景下的定量結(jié)果
![]()
3.4 與通用圖像編輯大模型對(duì)比
為進(jìn)一步分析本文方法的實(shí)際使用價(jià)值,本文對(duì)比其與通用圖像編輯大模型在局部精準(zhǔn)編輯任務(wù)中的差異。如圖7所示,本文選取“池塘中指定錦鯉替換為未來風(fēng)格機(jī)械魚”作為補(bǔ)充實(shí)驗(yàn)。該任務(wù)的難點(diǎn)在于,畫面中存在多條外觀相近、語義類別一致的魚類目標(biāo),僅依靠自然語言描述較難準(zhǔn)確指定需要修改的具體對(duì)象。實(shí)驗(yàn)中,各方法均輸入了包含目標(biāo)區(qū)域標(biāo)記的參考圖像,以盡可能向模型說明待編輯對(duì)象的位置。然而,Gemini 2.5 Flash Image、元寶與豆包等通用圖像編輯模型雖然能夠理解“機(jī)械魚”這一編輯意圖,并生成具有一定風(fēng)格化特征的結(jié)果,但其對(duì)圖像中掩碼或標(biāo)記區(qū)域的理解更接近軟提示,難以穩(wěn)定地將編輯操作嚴(yán)格限制在指定區(qū)域內(nèi),因此仍可能出現(xiàn)生成對(duì)象偏離原始目標(biāo)位置、影響多條魚的外觀,或?qū)Τ靥帘尘昂退娼Y(jié)構(gòu)產(chǎn)生額外改動(dòng)等現(xiàn)象。相比之下,本文方法通過顯式區(qū)域Mask將編輯意圖綁定到指定錦鯉所在區(qū)域,并在生成過程中將區(qū)域提示詞主要約束于目標(biāo)對(duì)象,從而在保持其他魚類、水面環(huán)境和整體構(gòu)圖穩(wěn)定方面表現(xiàn)更為可控。需要說明的是,通用大模型在開放式語義理解和自然語言交互方面具有明顯優(yōu)勢(shì),而本文方法的優(yōu)勢(shì)主要體現(xiàn)在目標(biāo)區(qū)域難以用語言精準(zhǔn)描述且需要嚴(yán)格局部修改的場(chǎng)景中,可通過區(qū)域約束掩碼降低定位歧義,提升局部編輯的可控性與結(jié)果穩(wěn)定性。
![]()
圖 7 與通用大模型在指定區(qū)域修改定性對(duì)比實(shí)驗(yàn)
4
系統(tǒng)功能設(shè)計(jì)與實(shí)現(xiàn)
為驗(yàn)證本文方法在電影分鏡工業(yè)生產(chǎn)中的實(shí)際可行性,本文基于前述流程框架開發(fā)了一套原型系統(tǒng)ReMAP Storyboard。系統(tǒng)采用前后端分離架構(gòu),前端基于React與TypeScript構(gòu)建交互界面,通過組件化方式實(shí)現(xiàn)資產(chǎn)上傳、區(qū)域標(biāo)注、參數(shù)配置與結(jié)果比選等功能;后端采用FastAPI搭建推理服務(wù)接口,負(fù)責(zé)請(qǐng)求調(diào)度、任務(wù)管理、文件存儲(chǔ)與模型調(diào)用。核心生成模塊基于PyTorch深度學(xué)習(xí)框架實(shí)現(xiàn)。其各個(gè)職能模塊均對(duì)應(yīng)本文第2、3章論述的方法流程,系統(tǒng)界面呈現(xiàn)四個(gè)核心板塊。
4.1 多模態(tài)SOP提示模塊
系統(tǒng)中的“多模態(tài)視覺分析模塊”對(duì)應(yīng)了本文圖1中“多模態(tài)場(chǎng)景生成與提示詞輸出”階段。 在該控制面內(nèi),用戶可導(dǎo)入原始分鏡模板(Layout)以及待嵌入的特寫資產(chǎn)圖片(如機(jī)械盾牌、特定場(chǎng)景載具)。系統(tǒng)提供結(jié)構(gòu)化參數(shù)錄入框,將前文設(shè)計(jì)的SOP提示框架具象化為“固定約束前綴(Prefix)”“可變場(chǎng)景描寫規(guī)則(Variable Rules)”與“畫質(zhì)還原后綴(Suffix)”三大控制區(qū)。
結(jié)合后端的視覺-大語言理解模型,該系統(tǒng)能生成多組劇情級(jí)候選方案(Candidate Prompts),降低分鏡畫師人工編寫冗長自然語言的負(fù)擔(dān),也為后續(xù)區(qū)域注入提供較充分的高層語義信息。
4.2 語義提取與區(qū)域標(biāo)注中心
系統(tǒng)中的“語義區(qū)域描述模塊”對(duì)應(yīng)本文圖1中的“多區(qū)域Mask標(biāo)注”和“區(qū)域語義約束生成”階段,是實(shí)現(xiàn)局部區(qū)域控制的關(guān)鍵交互環(huán)節(jié)。為減少煩瑣的人工掩碼繪制操作,系統(tǒng)集成了SAM(Segment Anything Model)零樣本圖像分割方法,用戶可通過點(diǎn)選交互將分鏡畫面中的道具區(qū)域、場(chǎng)景區(qū)域等目標(biāo)區(qū)域分離出來,形成相互獨(dú)立的區(qū)域Mask。在完成區(qū)域Mask標(biāo)注后,系統(tǒng)將不同區(qū)域Mask與對(duì)應(yīng)區(qū)域提示詞進(jìn)行綁定,例如將道具M(jìn)ask綁定至道具提示詞,將場(chǎng)景Mask綁定至場(chǎng)景提示詞,并形成區(qū)域語義約束條件。 通過這種空間區(qū)域與文本語義的顯式對(duì)應(yīng)關(guān)系,系統(tǒng)能夠在后續(xù)擴(kuò)散繪制階段降低不同區(qū)域之間的語義交叉干擾,使局部編輯主要作用于指定區(qū)域,同時(shí)保持非編輯區(qū)域內(nèi)容穩(wěn)定。
4.3 擴(kuò)散重繪核心調(diào)度臺(tái)
系統(tǒng)中的“模型參數(shù)調(diào)整模塊”作為生成渲染的運(yùn)算執(zhí)行控制臺(tái),集成了全部底層的節(jié)點(diǎn)調(diào)度鏈路。此處不僅賦予用戶隨時(shí)調(diào)度包含F(xiàn)lux?Klein在內(nèi)的高參數(shù)量基礎(chǔ)基座的能力,還配備了融合Canny(邊緣抓取)與Depth(深度信息感知)控制單元的ControlNet條件開關(guān),用以維系并鎖定原電影分鏡骨架。該控制界面的靈魂功能是為其設(shè)有的“啟用ReMAP注意力注入(Regional Semantic Constraint Core)”核心算法調(diào)度撥鈕;配置完成采樣步數(shù)(Sampling Steps)與重繪抗噪強(qiáng)度(Denoising Strength)后,一旦用戶下發(fā)生成指令,后端便會(huì)將含有精準(zhǔn)空間坐標(biāo)掩碼的跨模態(tài)協(xié)同條件送入云計(jì)算資源層推流,以此發(fā)起無損害環(huán)境結(jié)構(gòu)的高保真影像重繪。
4.4 產(chǎn)出方案分析評(píng)估矩陣
為達(dá)成驗(yàn)證所生資產(chǎn)圖組跨模態(tài)語義保真并反饋定性一致性結(jié)論的工程閉環(huán),系統(tǒng)中“產(chǎn)出分析模塊”提供強(qiáng)有力的評(píng)估展示與結(jié)果下發(fā)支撐。該模塊依據(jù)前文設(shè)定的評(píng)價(jià)指標(biāo),對(duì)不同候選方案進(jìn)行并列展示,并在結(jié)果界面中呈現(xiàn)由系統(tǒng)自動(dòng)計(jì)算的 等視覺指標(biāo)。系統(tǒng)進(jìn)一步根據(jù)多項(xiàng)指標(biāo)加權(quán)形成綜合評(píng)分,用于輔助用戶比較不同生成結(jié)果的資產(chǎn)一致性、局部結(jié)構(gòu)穩(wěn)定性與整體視覺質(zhì)量。用戶可根據(jù)評(píng)估結(jié)果篩選較優(yōu)方案,并通過導(dǎo)出功能將結(jié)果流轉(zhuǎn)至后續(xù)特效制作與美術(shù)開發(fā)環(huán)節(jié)。
4.5 系統(tǒng)性能與用戶使用
為進(jìn)一步驗(yàn)證ReMAP Storyboard在實(shí)際分鏡迭代流程中的可用性,本文對(duì)系統(tǒng)主要環(huán)節(jié)的運(yùn)行時(shí)間進(jìn)行統(tǒng)計(jì)。系統(tǒng)整體流程可劃分為SOP提示生成、區(qū)域Mask標(biāo)注、擴(kuò)散圖像生成與結(jié)果評(píng)估四個(gè)階段。不同階段的耗時(shí)來源有所差異:SOP階段主要受多模態(tài)大模型文本生成速度影響;Mask階段與用戶標(biāo)注區(qū)域數(shù)量及分割交互次數(shù)相關(guān);擴(kuò)散生成階段主要由Flux?Klein底座推理耗時(shí)決定;結(jié)果評(píng)估階段則基于CLIP Similarity、DINOv2 Similarity、Background LPIPS等指標(biāo)進(jìn)行特征提取與自動(dòng)評(píng)分。
在測(cè)試環(huán)境中,SOP模塊一次生成5組候選場(chǎng)景提示詞的平均耗時(shí)約為8~15秒,能夠滿足前期創(chuàng)意發(fā)散階段的交互需求。區(qū)域Mask標(biāo)注階段的耗時(shí)與目標(biāo)數(shù)量相關(guān),單個(gè)目標(biāo)區(qū)域通常可在5~10秒內(nèi)完成點(diǎn)選與修正;當(dāng)編輯對(duì)象增加至2~3個(gè)時(shí),整體標(biāo)注時(shí)間約為15~30秒。擴(kuò)散生成階段是系統(tǒng)耗時(shí)最高的部分,單張圖像生成時(shí)間通常穩(wěn)定在30秒左右;若進(jìn)行多方案候選生成,則總耗時(shí)隨候選圖數(shù)量近似線性增長。結(jié)果評(píng)估階段由于僅需進(jìn)行特征提取與相似度計(jì)算,整體耗時(shí)較短,單張圖像通常可在2~5秒內(nèi)完成。
5
結(jié)語
本文面向電影前期視覺開發(fā),針對(duì)電影分鏡迭代中多區(qū)域協(xié)同編輯所面臨的結(jié)構(gòu)穩(wěn)定性與語義獨(dú)立性難題,構(gòu)建了一種圖像智能生成框架ReMAP。通過將分鏡畫面解構(gòu)為多個(gè)獨(dú)立的語義區(qū)域,并建立區(qū)域空間掩碼與對(duì)應(yīng)提示詞的顯式約束映射,實(shí)現(xiàn)了生成過程中的局部控制與非編輯區(qū)域保護(hù)。相比Prompt?to?Prompt等全局語義編輯方法易導(dǎo)致跨區(qū)域特征污染,以及DiffEdit等局部掩碼編輯方法在多區(qū)域交接處產(chǎn)生的邊界割裂,本文方法通過在擴(kuò)散模型交叉注意力層中引入空間掩碼,使區(qū)域提示詞主要作用于對(duì)應(yīng)區(qū)域,從而增強(qiáng)多區(qū)域編輯中的特征解耦與語義隔離。同時(shí),本文構(gòu)建的多模態(tài)SOP提示自動(dòng)生成機(jī)制,將參考資產(chǎn)、原始分鏡與編輯意圖轉(zhuǎn)化為可復(fù)用的全局風(fēng)格提示詞和區(qū)域級(jí)細(xì)節(jié)描述,降低了復(fù)雜場(chǎng)景下的提示詞編寫成本。后續(xù)可進(jìn)一步結(jié)合自動(dòng)分割、區(qū)域跟蹤與時(shí)序一致性約束,將該流程擴(kuò)展至連續(xù)鏡頭中的角色、道具和場(chǎng)景協(xié)同控制,從而更好地服務(wù)于電影概念設(shè)計(jì)、分鏡迭代與前期視覺開發(fā)。
參考文獻(xiàn)
(向下滑動(dòng)閱讀)
[1] Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models[C]//Advances in Neural Information Processing Systems, 2020:6840?6851.
[2] Rombach R, Blattmann A, Lorenz D, et al. High?resolution image synthesis with latent diffusion models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2022:10684?10695.
[3] Peebles W, Xie S. Scalable diffusion models with transformers[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision, 2023:4195?4205.
[4] Liu X, Gong C, Liu Q. Flow straight and fast: Learning to generate and transfer data with rectified flow[C]//International Conference on Learning Representations, 2023.
[5] Xiao S, Wang Y, Zhou J, et al. OmniGen: Unified image generation[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition,2025:13294?13305.
[6] Tan Z, Liu S, Yang X, et al. OminiControl: Minimal and universal control for diffusion transformer[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025:14940?14950.
[7] Radford A, Kim J W, Hallacy C, et al. Learning transferable visual models from natural language supervision[C]//International Conference on Machine Learning,2021:8748?8763.
[8] Raffel C, Shazeer N, Roberts A, et al. Exploring the limits of transfer learning with a unified text?to?text transformer[J]. Journal of Machine Learning Research, 2020, 21(140):1?67.
[9] Zhang L, Rao A, Agrawala M. Adding conditional control to text?to?image diffusion models[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision, 2023:3836?3847.
[10] Ye H, Zhang J, Liu S, et al. IP?Adapter: Text compatible image prompt adapter for text?to?image diffusion models[PP/OL]. arXiv(2023?08?13)[2026?05?11]. https://arxiv.org/abs/2308.06721.
[11] Hu E J, Shen Y, Wallis P, et al. LoRA: Low?rank adaptation of large language models[C]//International Conference on Learning Representations, 2022.
[12] Hertz A, Mokady R, Tenenbaum J, et al. Prompt?to?Prompt image editing with cross attention control[C]//International Conference on Learning Representations, 2023.
[13] Brooks T, Holynski A, Efros A A. InstructPix2Pix: Learning to follow image editing instructions[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2023:18392?18402.
[14] Couairon G, Verbeek J, Schwenk H, et al. DiffEdit: Diffusion?based semantic image editing with mask guidance[C]//International Conference on Learning Representations, 2023.
[15] Lugmayr A, Danelljan M, Romero A, et al. RePaint: Inpainting using denoising diffusion probabilistic models[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 2022:11461?11471.
[16] Ju X, Liu X, Wang X, et al. BrushNet: A plug?and?play image inpainting model with decomposed dual?branch diffusion[C]//Computer Vision - ECCV 2024. Cham:Springer, 2025:150?168.
[17] Zhuang J, Zeng Y, Liu W, et al. A task is worth one word: Learning with task prompts for high?quality versatile image inpainting[C]//European Conference on Computer Vision, 2024.
[18] Bar?tal O, Yariv L, Lipman Y, et al. MultiDiffusion: Fusing diffusion paths for controlled image generation[C]//International Conference on Machine Learning, 2023:1737?1752.
[19] Chen A, Xu J, Zheng W, et al. Training?free regional prompting for diffusion transformers[PP/OL]. arXiv(2024?11?04)[2026?05?11]. https://arxiv.org/abs/2411.02395.
[20] Chen Z, Li Y, Wang H, et al. RAGD: Regional?aware diffusion model for text?to?image generation[C]//Proceedings of the IEEE/CVF International Conference on Computer Vision, 2025:19331?19341.
[21] Su J, Lu Y, Pan S, et al. RoFormer: Enhanced transformer with rotary position embedding[J]. Neurocomputing, 2024, 568:127063.
期刊導(dǎo)讀 |《現(xiàn)代電影技術(shù)》2026年第7期
程絮森等:人工智能驅(qū)動(dòng)下元宇宙技術(shù)賦能電影科技創(chuàng)新提質(zhì)研究
孫立軍等:人工智能(AI)影像生成技術(shù)與傳統(tǒng)影視制作的融合路徑及流程標(biāo)準(zhǔn)化研究
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.