7月20日,WAIC 2026期間,生數科技與萬興科技聯合舉辦“世界模型驅動下的AI影視生產力新范式”專題論壇。論壇上,生數科技創始人、清華大學人工智能研究院副院長朱軍發表題為《通用世界模型:連接數字世界與物理世界的新基礎設施》的主題演講,系統分享了通用世界模型的技術演進、核心能力及產業應用路徑。
朱軍表示,人工智能正在從理解和生成數字內容,進一步走向對世界規律的建模、推理、預測與行動。通用世界模型將成為連接數字世界與物理世界的重要基礎設施,推動AI從“生成世界”邁向“理解世界、預測世界、行動于世界”。
![]()
以下為演講全文:
尊敬的各位嘉賓,大家上午好!
首先,非常感謝大家百忙之中參加我們的論壇。我們非常榮幸能夠與萬興科技一起,在世界人工智能大會舉辦這場面向未來的論壇。
大家都知道,大模型正從語言模型走向多模態模型,再進一步走向世界模型,技術能力不斷突破。同時,AI也在從單一工具逐步發展為支撐產業生產力的基礎設施,這正是我們發起今天這場論壇的重要初衷。接下來,我會用一點時間,跟大家簡要分享一下我們所看到的基礎模型發展趨勢。
![]()
首先,從原理上來看,什么是世界模型?
我們先來看人的世界模型。這里有一個簡單的定義。大家都有過騎自行車或者開車的經歷,在做出動作之前,我們會在大腦中形成一個小模型,幫助我們理解環境、想象不同動作可能產生的結果、規劃行動,最終指導動作輸出。這就是人的世界模型,它能夠幫助我們適應復雜環境,并作出安全、可靠的行動。
今天,全世界都在關注如何構建機器的世界模型。機器世界模型相關的研究很多,前沿進展也非常快。但從本質上來看,機器的世界模型主要需要具備三項能力。
第一,對環境進行精準理解;第二,能夠基于當前狀態和即將采取的動作進行預測和想象;第三,能夠在預測過程中學習并采取行動。總體而言,我們認為機器世界模型至少要實現理解、想象和行動的一體化。
從這里可以看出,世界模型與普通模型的區別在于,它不僅要回答“是什么”,實現對世界的理解, 還要回答“為什么”,以及“這樣做會產生什么后果”。這個領域目前最大的變革,是從專用模型走向通用模型,并形成Scaling Law。包括視頻模型和世界模型在內,大家都希望遵循Scaling Law,推動通用能力取得重大進展。
要做通用模型,首先需要回答一個問題:我們應該使用什么樣的數據?根據理解和建模世界的目標,我們梳理了相關數據,形成了六層數據金字塔。從底層向上,分別包括通用互聯網視頻、第一視角的人類動作視頻,以及機器人相關的操作數據等。
![]()
在機器人軌跡采集過程中,大量數據也是以視頻形式承載的。機器人通常配備多個相機,用于拍攝環境和機器人的動作。總體來看,視頻是這套數據體系中最主要的格式,因為它是最便捷、最容易記錄世界變化的數據載體。
數據金字塔的底層具有海量的數據規模,而在機器人專用操作數據方面,如何收集足夠多的數據,一直是行業面臨的巨大難題。
我們的目標是打造通用基模,因此在數據使用上有幾個原則:第一,數據規模要足夠大;第二,數據類型要盡可能全面;第三,要盡可能使用真實數據。這也是我們從大模型訓練中總結出的規律。過去,這些數據為什么沒有被充分利用起來?一個重要原因是,普通視頻與機器人動作軌跡之間缺少直接對應關系。
今天,我們想和大家分享的是,如何通過生成式方法和底層技術原理,讓海量視頻數據轉化為高質量、有價值的訓練數據。因此,我們看到,世界模型首先會在數字世界中成長,但最終目的不只是生成數字內容,還要進一步走向物理世界,在更加廣泛的場景中發揮價值。
有了前面的數據,接下來要考慮的是,如何真正發揮這些數據的價值。
我們的目標是打造通用模型,而通用模型需要通用架構。簡單地將不同模塊串聯或并聯起來,并不是最理想的方式。我們希望在統一架構中,實現理解、想象和行動的一體化。我們較早開始探索這一方向,并提出了全球首個MoT統一架構,將理解專家、生成專家和行動專家統一在同一個模型中,通過統一目標進行訓練。
![]()
因為它是一個一體化模型,所以在使用過程中可以自由切換不同的輸出形態。對于機器人,它可以直接輸出動作;對于創作者,它可以直接輸出高質量的像素級視頻;也可以根據任務需要進行聯合輸出,在一個模型中統一完成不同任務。生數科技正在做的就是這樣一件事情 「通用世界模型」。
![]()
上面展示的是兩類模型:世界生成模型與世界動作模型。一類與今天的論壇直接相關,面向數字內容生產和高質量影視生產;另一類則是為具身智能行業提供機器人的“大腦”。
在數字內容方向,對應的是Vidu Q3等模型。目前,我們已經取得了很多成果,也推動了內容生產力的提升。
對于一家做基模的公司來說,我們最大的體會是,通過海量視頻數據的大規模訓練和Scaling Law,模型可以實現更加精準的理解,以及高動態、高一致性的生成創新,而且這些創新往往是組合式的。這些能力在過去的傳統方案中很難實現。如今,在視頻大模型中,我們已經率先實現了理解和想象,也就是前面所說世界模型三項能力中的前兩項。
![]()
近期,我們還發布了實時生成模型。視頻模型不再只是簡單地生成素材,也可以成為實時交互模型。以數字人場景為例,傳統方式通常需要預設有限的動作模板,驅動面部表情和口型。現在,我們采用的是完全流式的生成方式,角色的表現可以更加自然、靈活,也更加擬人化。
![]()
它不僅可以實時交互,還能夠支持無限時長的連續對話。這也打開了很多想象空間。在需要流式、實時交互的場景中,可以直接使用視頻大模型提供相關解決方案。
當前,流式視頻生成主要面臨幾方面的局限。
第一,缺少實時的用戶干預;第二,缺少語音顯示控制。語言對人來說是一種非常自然的交互形式,特別是在實時交互場景中,語言是非常重要的輸入形態;第三,長時間生成的穩定性通常不足;第四,推理和部署能力不足。對于流式生成而言,無論是推理時延還是推理成本,都有非常高的要求。
針對這些問題,我們進行了一系列技術突破。模型可以端到端地理解語音指令,實現實時交互和指令跟隨,完全通過對話方式,還原人類最自然的交流形態。用戶也可以定義自己的角色,通過設定人物形象、音色和相關描述,打造具有特定人設的實時交互角色。目前,模型可以實現540P的視頻輸出,最高幀率達到42FPS。
![]()
但我們的最終目標,并不只是停留在數字內容生成上。無論是前面提到的Vidu視頻生成,還是Vidu S1的流式生成,都是在為進一步走向實時的物理交互做準備。這些核心技術也可以支撐模型在物理世界中的行動。
這也是我們今年4月份發布的最新模型。它可以基于同一個模型底座,同時驅動多種異構機器人本體,完成復雜的長程任務。
![]()
我們取得的一個重要進展是,基于較強的通用基模,可以用更加高效的方式,讓不同機器人本體快速學習復雜技能。這里展示了一些例子。用戶可能只需要給出一條文字指令,比如讓機器人完成插花、澆水等任務。模型可以理解語言描述,將任務分解為一系列步驟,并精準生成完成任務所需的動作指令,最終控制機器人完成整個任務。
畫面中展示的是機器人的“大腦”,也就是我們的基座模型正在預測未來狀態。可以看到,模型預測的狀態與真實發生的狀態非常接近。這說明機器人不只是能夠執行任務,還能夠對未來進行預測和想象,并基于這種想象,更好地規劃和輸出動作。
這也是新一代基座模型與傳統VLA方法最本質的區別之一。傳統VLA更多是在擬合軌跡:給模型演示一定數量的軌跡,讓機器人進行模仿,并在一定范圍內實現泛化。通過生成式預訓練機制,機器人可以基于對未來的想象來規劃動作,輸出的動作也更加可靠、穩定、安全和高效。同時,通用基模可以支持跨場景、跨任務的泛化。
圖中展示的是傳統VLA范式的對比結果。藍色曲線代表我們去年12月開源的版本,綠色曲線代表最新采用更強視頻模型的版本。圖中的結果越靠近左上角,意味著模型可以使用更少的數據,學習到質量更高的任務能力。可以看到,最新版本的提升非常顯著。
這意味著,通過通用基座模型,可以大幅提升機器人學習任務的效率和成功率。相關模型在多個榜單中也處于領先位置,特別是在跨場景、跨任務的泛化方面,能夠達到非常高的成功率,取得了行業領先的模型效果。
我們今天討論的通用世界模型,不再只是視頻模型的升級,也不是語言模型的簡單延伸,而是推動AI從生成內容,邁向理解世界、推演世界,并與世界實時交互的新范式。
![]()
最后,我想簡單介紹一下生數科技在這一過程中的發展歷程。
生數科技從成立之初就定位于基礎模型,并以視頻建模作為出發點。在這個過程中,我們深刻認識到,視頻模型基于對世界的深層理解,可以達到非常高的能力上限,而且這個上限仍在不斷拓展。這也是我們一直堅持探索的方向。我們希望通過高質量的基模,更加高效地服務高質量內容生產和具身機器人的產業落地。
過去短短兩年時間,大家可以看到,視頻基模已經從最初展示技術可能性,發展到今天真正進入產業、支撐生產力場景。這是一個非常快速的變化過程。
最后,對于未來的展望...
![]()
今天和大家分享的是基礎模型的故事。生數科技定位于基礎大模型,希望以更高的效率和更高的質量,為合作伙伴和整個行業提供模型能力。
我們的第一個體會是,視頻數據是語言之外一種非常豐富、規模龐大且十分寶貴的信息載體,能夠記錄和描述這個世界。
第二,基于視頻的大規模預訓練,模型可以實現精準理解、高質量和高一致性的想象與預測,并進一步形成可泛化、跨任務、跨本體的行動能力。這也是我們一直致力于探索的方向。
我們已經看到,在持續提升預訓練能力的基礎上,再配合高效的后訓練,可以推動整個行業實現快速迭代和落地。
這也是我們一直致力于打造的技術范式。希望能夠與在座的各位,以及更多行業同仁開展合作,共同探索通用世界模型的智能上限與產業落地的更多可能。
我的分享就到這里,謝謝大家!
歡迎關注【華商韜略】,識風云人物,讀韜略傳奇。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.