![]()
新智元報道
![]()
【新智元導讀】交互式視頻世界模型正在從「一次性生成短片」走向「像游戲一樣邊操作邊生成」。但長軌跡交互會迅速放大上下文、顯存和多步去噪開銷。Light Interaction不改模型參數、不重新訓練,只在推理階段把相機軌跡變成調度信號,動態選擇歷史上下文、在回訪狀態復用去噪輸出,并用面向自回歸生成的3D稀疏注意力降低計算。
視頻世界模型想真正進入交互時代,不能只停留在一次性生成幾秒視頻。它需要像游戲引擎一樣,根據用戶前進、后退、轉向、回看等操作,持續生成后續畫面,并讓場景在長時間探索中保持一致。
問題在于,生成鏈路越長,成本越難壓。
以HY-WorldPlay為例,單張A100 GPU上生成約10秒視頻,模型主干推理耗時超過200秒。為了保持長時一致性,模型需要維護較重的歷史信息;當前片段需要參考更長上下文;每生成一個視頻片段,又要經過多步去噪。
浙江大學聯合NVIDIA提出Light Interaction的思路不是重新訓練一個更小模型,而是讓現有模型在推理時「看交互狀態辦事」:探索新區域時,少依賴不可靠歷史;回訪舊區域時,充分利用歷史約束;局部動態劇烈時,減少冗余上下文;狀態穩定時,則復用更多計算。
![]()
論文鏈接:https://arxiv.org/abs/2605.31158
項目主頁:https://2843721358l-del.github.io/Light-Interaction-Project/
GitHub:https://github.com/2843721358l-del/Light-Interaction-Project
原始推理與接入Light Interaction后的長時交互生成示例。(視頻中的速度數字對應本演示視頻的交互動作、視頻時長和統計口徑;論文表格中的2.59×來自統一benchmark測試)
瓶頸在哪
傳統視頻生成通常給定文本或圖像后,一次性生成固定長度片段;自回歸視頻生成則把歷史片段緩存起來,按時間順序逐塊延展。交互式視頻世界模型又往前走了一步:用戶的相機控制會不斷改變接下來要生成的視角,模型必須在流式生成中持續調用歷史記憶。
一旦交互軌跡變長,系統面對的不只是「多生成幾幀」,推理鏈路中的幾類基礎開銷都會被放大:
歷史信息更重:為保持長時一致性,模型需保留足夠的上下文,KV cache的顯存壓力難以忽略;
注意力計算更重:當前生成視頻片段需要參考更長歷史,上下文越長,生成主干中的注意力開銷越高;
去噪成本更重:每生成一個視頻片段,模型都需要多次運行Transformer完成逐步去噪。
![]()
圖1:交互式視頻世界模型的推理瓶頸。長軌跡下,模型不僅要逐段生成視頻,還要持續維護歷史上下文、KV緩存和多步去噪計算。
Light Interaction
這篇工作的核心觀察是:交互狀態決定了哪些歷史信息真正有用,也決定了哪些計算可以被安全省掉。探索新區域時,檢索到的空間記憶未必可靠;回訪已見區域時,歷史視角反而可以提供強約束。局部動態越強,固定保留長時間上下文的收益越有限;而在回訪階段,去噪過程相鄰步驟更穩定,也更適合緩存復用。
基于這些觀察,Light Interaction拆成三件事:自適應上下文管理、輕量級去噪緩存,以及軟硬件協同的3D稀疏注意力。
![]()
圖2:Light Interaction總體框架。方法在推理階段動態選擇上下文,按狀態啟用去噪緩存,并用軟硬件協同的3D稀疏注意力加速剩余計算。
第一步:只保留真正有用的歷史
交互式視頻世界模型的上下文主要包括兩類:近期時間上下文,用來維持短期運動連續;檢索得到的空間記憶,用來在相機回訪舊區域時保持幾何和外觀一致。
Light Interaction使用相機位姿相似度判斷當前視角是否存在可靠歷史參考。當最大位姿相似度低于閾值時,系統將當前狀態視為探索階段,丟棄可能誤導生成的空間記憶;當相似度達到閾值時,相關歷史視角才會被保留下來,作為條件參與后續生成。
時間上下文也不再使用固定窗口。方法會根據近期穩定latent的變化程度自適應調整:局部動態較大時縮短時間窗口,減少冗余歷史;變化較平穩時保留更多上下文,增強連續性。
第二步:在回訪狀態復用去噪
去噪緩存能不能用,關鍵看模型輸出是否穩定。論文統計顯示,回訪階段相鄰去噪步之間的相對L1距離整體低于探索階段,說明模型在有可靠歷史參考時輸出更穩定,也更適合復用早期去噪結果。
![]()
圖3:論文統計的相鄰去噪步輸出差異。回訪階段相對L1距離整體低于探索階段,為只在回訪狀態下啟用去噪復用提供依據。
因此,Light Interaction只在存在可靠歷史參考的回訪狀態下啟用去噪緩存:第一步正常計算,中間去噪步復用第一步模型輸出,最后一步仍正常計算,用于校正累計誤差。探索階段則保持完整去噪流程,避免把不穩定輸出反復放大。
第三步:讓3D稀疏注意力真正跑起來
稀疏attention的難點在于,少算理論FLOPs不等于真實延遲一定下降。在自回歸視頻生成中,當前chunk、歷史KV、文本token和因果布局交織在一起,Q/KV長度高度不對稱。直接套用通用稀疏注意力,收益很容易被數據重排、gather/scatter、layout conversion和padding等周邊開銷抵消。
Light Interaction的做法更貼近自回歸視頻生成的實際結構:文本條件KV緩存和當前chunk始終保留稠密計算,只對歷史視覺KV做3D block稀疏選擇;同時通過Triton融合Q preparation、KV preparation和untile scatter等操作,減少中間張量和重復內存搬運。
![]()
圖4:自回歸場景下的稀疏注意力實現。Light Interaction保留文本條件和當前chunk的稠密計算,只稀疏歷史視覺KV,并通過算子融合減少數據搬運。
實驗結果
團隊在HY-WorldPlay和Matrix-Game-3.0兩個開源交互式視頻世界模型上進行評估,并與Sparse VideoGen、LongCat-Video Block Sparse Attention、TeaCache等無需訓練的加速基線對比。實驗硬件為NVIDIA A100 80GB GPU。需要注意的是,論文中的latency指生成主干延遲,不包含近似固定的VAE解碼開銷。
數字最直觀:在HY-WorldPlay上,生成約10秒視頻,Light Interaction將生成主干延遲從228.60秒降至88.24秒,達到2.59×加速,同時峰值顯存從76.57GB降至54.66GB;在Matrix-Game-3.0上生成約20秒視頻,延遲從59.70秒降至37.07秒,達到1.61×加速。
質量指標上,論文報告了PSNR、SSIM、LPIPS、VBench等多維結果。整體看,Light Interaction并不是簡單「拿畫質換速度」:在HY-WorldPlay上,它保持了較好的視覺質量并顯著降低顯存;在Matrix-Game-3.0上,也在競爭性質量下取得最低延遲。
![]()
表1:HY-WorldPlay與Matrix-Game-3.0上的質量和效率對比。Light Interaction在兩個模型上均取得最快延遲,并在HY-WorldPlay上顯著降低峰值顯存。
世界模型的推理系統正在變得「狀態感知」
Light Interaction的價值不只在于某個模型上的提速,而在于它提出了一種更適合交互式生成的推理范式:交互軌跡不只是生成條件,也可以成為系統調度信號。
相機軌跡告訴系統當前是探索還是回訪;局部動態告訴系統時間上下文該長還是短;歷史可靠性決定空間記憶能否參與生成;去噪穩定性決定哪些計算可以復用。這讓視頻世界模型的推理過程從固定流程,變成了隨交互狀態變化的動態系統。
從工程角度看,這項工作也強調了算法稀疏與實際系統加速之間的差距。對自回歸視頻生成來說,稀疏策略本身不足以保證速度提升,KV布局、算子融合、訪存路徑和數據搬運都會直接影響實際延遲。
對于游戲模擬、虛擬場景探索、機器人和具身智能訓練等應用場景,推理延遲和顯存成本是能否走向實際使用的關鍵門檻。Light Interaction提供了一條現實路線:不重新訓練模型,而是在推理階段把交互狀態用起來。
結語
如果說早期視頻生成關注「生成得像不像」,交互式視頻世界模型還要回答另一個問題:能不能持續、可控、低延遲地生成。
Light Interaction的答案是,讓模型根據用戶交互狀態自適應分配計算。隨著視頻世界模型走向更長時序、更復雜控制和更高分辨率,這類狀態感知的推理優化方法可能會成為重要方向。
作者介紹
該工作來自浙江大學與NVIDIA的合作研究。論文第一作者為浙江大學逯嘉程,通訊作者為浙江大學李渝研究員,并與NVIDIA謝恩澤研究員團隊合作完成。作者團隊關注視頻生成模型推理優化、視頻世界模型、軟硬件協同加速等方向,涉及KV緩存管理、稀疏注意力、GPU算子優化等系統問題。
參考資料:
編輯:
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.