在世界人工智能大會(WAIC)的展館里,機器人通常是最搶鏡的一類展品。
機械臂抓取物體、人形機器人聽從指令完成家務,“世界模型”也常常伴隨這些演示出現,用來解釋機器人如何理解環境、預測變化并完成行動。久而久之,世界模型似乎逐漸成為機器人和自動駕駛領域的專屬概念。
但在生數科技創始人、清華大學人工智能研究院副院長朱軍看來,通用世界模型并不只服務于某個單一場景,其核心是通過統一的基座與架構,實現對世界的理解、預測與行動。
7 月 20 日,在生數科技與萬興科技聯合承辦的“世界模型驅動下的 AI 影視生產力新范式”專題論壇上,朱軍提出世界模型不是視頻模型的升級,也不是語言模型的延伸,而是 AI 從“生成內容”邁向“理解世界、推演世界、實時交互世界”的新范式。
![]()
基于同一底層基座,模型既可以在像素空間生成視頻內容,也可以在動作空間輸出機器人可執行的動作。AI 視頻與具身智能因此并非兩條割裂的技術路線,而是世界建模能力在數字世界和物理世界中的不同延伸。
這也是理解生數科技通用世界模型戰略的關鍵。
公眾最早通過視頻大模型 Vidu 認識這家公司。如今,其產品體系已經從數字內容生成拓展至實時交互和物理行動:世界生成模型 Vidu 理解并生成動態數字內容;實時交互模型 Vidu S1 將用戶指令納入生成過程;世界動作模型 Motubrain 則將對環境的理解和預測轉化為機器人動作。
看似分屬 AI 視頻與具身智能兩條賽道,實際上,三款產品沿著同一條路徑展開:生成世界、在世界中交互,并最終行動于世界。
01
世界模型的核心,不只是“預測下一幀”
世界模型究竟需要具備什么能力?
朱軍將其概括為三個部分:理解、想象和行動。
首先,模型要感知并理解當前環境;其次,要預測不同輸入或動作可能帶來的變化;最后,還要把理解和預測轉化為可執行的決策。
這與人類學習騎車、開車等技能的過程相似。人在采取動作前,會預判不同操作的結果,再選擇更安全、穩定的方案。
因此,世界模型不只是生成一個看起來真實的未來,也不只是預測下一幀畫面,而是要形成從理解當前狀態、推演未來變化到指導行動的閉環。機器人是這套能力最直觀、要求也最高的應用之一,但不是唯一應用。
數字內容同樣需要世界建模。
圖片記錄的是一個瞬間,視頻則包含時間、空間和狀態的連續變化。人物運動時,身體、衣服和背景要保持合理變化;鏡頭切換后,角色外貌、服裝和空間位置不能無故改變;隨著內容延長,模型還要處理物體關系、事件順序和環境狀態。
視頻模型不僅要知道物體“長什么樣”,還要學習它如何運動、如何與環境發生關系,以及一個狀態如何演變為下一個狀態。
當然,生成連貫視頻并不等同于擁有完整的通用世界模型能力,但視頻生成所要求的時空建模、動態預測和狀態一致性,為進一步走向實時交互和物理行動提供了基礎。
02
視頻數據,是構建通用世界模型的重要底座
從第一性原理出發,構建通用世界模型需要解決兩個問題:數據和架構。
過去,大模型通過通用架構、規模化數據和算力形成 Scaling Law。要讓世界模型從特定場景的小模型走向通用基座,同樣需要大規模、多樣化的數據。
生數科技將相關數據歸納為一個從互聯網視頻到機器人實采軌跡的“數據金字塔”,其中包括通用視頻、第一視角人類動作視頻、合成數據和機器人軌跡數據。
這些數據的差異,主要體現在規模和精度上。
互聯網視頻規模龐大,記錄了人物、物體、環境、動作及其時空關系。影視劇、紀錄片、監控視頻和第一視角影像,都保存了真實世界運行的一部分信息。
機器人軌跡數據則能夠提供關節角度、控制信號、力反饋和動作結果,但采集成本高,規模遠小于互聯網視頻。
過去,由于缺少動作標注和機器人控制信號,通用視頻很難直接用于從狀態到動作的學習。但隨著視頻生成模型發展,模型可以通過預測和重建視頻,學習空間、時間、動作和結果之間的關系,視頻數據也由此成為世界模型大規模預訓練的重要基礎。
不過,視頻數據不能替代機器人數據。
視頻可以告訴模型動作在視覺上如何發生、環境如何變化,卻無法完整提供機器人執行所需的關節角度、力反饋、本體狀態和控制信號。
更合理的路徑,是先通過海量視頻學習通用的世界規律,再通過機器人數據補充精確的動作知識和物理反饋:前者拓展世界模型的認知廣度,后者提升行動精度。
03
從 Vidu 到 Motubrain,是同一套能力的逐步延伸
如果只看產品形態,生數科技從視頻生成走向具身智能,像是一次橫跨兩條賽道的業務擴張。但從其模型發展路徑來看,這更像是視頻建模能力向實時交互和物理行動的自然延伸。
生數科技從成立之初便定位于基礎模型,并將視頻建模作為技術起點。在模型訓練過程中,團隊逐漸發現,視頻模型的能力上限并不只體現在畫質、時長和生成效果上。隨著數據和模型規模擴大,模型對人物、物體、空間關系與動態變化的理解也在持續增強。
這意味著,視頻模型學習的不只是如何生成畫面,還包括世界如何隨時間變化。模型對時空結構、運動規律和狀態演化理解得越深入,就越有可能從內容生成進一步走向實時交互,乃至物理行動。
過去兩年,視頻基模也經歷了從展示技術可能性,到進入真實生產環節的快速演進。
早期的視頻生成更多用于展示模型能夠“生成什么”,如今,模型開始被用于廣告、短劇、影視等實際生產場景,并逐步承擔提高內容可用率、縮短制作周期和降低生產成本的任務。
以 Vidu Q1 為例,其推出的參考生視頻能力,允許用戶通過主體參考圖生成角色和視覺元素相對一致的視頻。此后,參考生視頻逐漸成為行業中的重要產品范式,也讓視頻模型從隨機生成工具,進一步走向可控制、可復用的生產工具。
![]()
對于生數科技而言,這一過程也強化了一個判斷:高質量視頻基模不僅能夠服務內容生產,其在大規模訓練中形成的時空理解、動態預測和狀態一致性能力,也可以繼續遷移至更廣泛的智能任務。
解決數據之后,還需要一套能夠統一組織這些能力的模型架構。目前,一些具身智能方案仍然采用分離式結構:感知模型負責識別環境,世界模型負責預測未來,策略模型負責輸出動作。不同模塊分別優化,容易帶來信息割裂和誤差累積。
生數科技的思路,是通過 Mixture-of-Transformer(MoT)架構,將環境理解、世界狀態預測和動作軌跡生成整合至統一框架。模型既可以在像素空間生成視頻,也可以在動作空間輸出機器人動作,還可以根據任務需要進行聯合預測。
基于這一架構,生數科技的三項產品分別承擔不同層級的任務。
世界生成模型 Vidu 支持文生視頻、圖生視頻、參考生視頻等創作方式,持續提升主體與場景一致性、運動表現、物理合理性、鏡頭控制及內容交互性,幫助創作者更加高效地完成高保真內容創作。
實時交互模型 Vidu S1 進一步將外部輸入納入生成循環。用戶可以在互動過程中持續發出語音指令,讓角色實時改變表情、動作和行為。每一次輸入都可能影響下一時刻的畫面,模型不僅要生成內容,還要根據反饋持續更新狀態。
Vidu S1 支持無限時長連續生成,可實現 540P、25FPS 輸出,最高支持 42FPS,并允許用戶基于真人、動漫或萌寵形象及個性化音色創建交互角色。
![]()
到了世界動作模型 Motubrain,模型的輸出則從數字內容變為機器人可以執行的動作。Motubrain 定位于具身智能機器人的通用大腦,將環境理解、世界狀態預測與動作軌跡生成統一建模。面對插花、澆水等任務,模型需要理解當前環境和任務目標,預測不同行動可能帶來的結果,并生成機器人可以執行的動作軌跡。
![]()
三款產品分別回答了三個遞進的問題:能否生成一個持續變化的數字世界?能否讓這個世界根據外部輸入實時更新?能否將對世界的理解和預測轉化為物理行動?
它們不是三款產品的簡單并列,也不是生數科技從視頻生成突然轉向機器人,而是同一套世界建模能力從生成、交互到行動的逐步延伸。
從 Vidu Q1 建立參考生視頻的生產范式,到 Vidu Q3 提升復雜音視頻內容生成能力,再到 Vidu S1 和 Motubrain 分別走向實時交互與物理行動,生數科技試圖建立的是一套能夠同時服務高質量內容生產和具身智能落地的通用基礎模型。
04
機器人之外,世界模型還有更大邊界
行業習慣將世界模型與機器人綁定,一個重要原因是機器人能夠把預測轉化為可見的物理結果。
杯子是被成功拿起,還是被機械臂碰倒,結果一目了然。真實環境也會嚴格檢驗模型是否理解空間關系、接觸關系和動作后果。
但類似問題同樣存在于數字內容中。
角色上一鏡拿起的杯子,下一鏡是否還在;人物轉身后,服裝和背景是否合理變化;導演修改動作后,角色身份、空間關系和鏡頭節奏能否保持穩定。這里雖然沒有機械臂,模型仍然需要維護一個持續變化的環境。
兩類任務的差異主要在于輸出形式和風險等級。數字內容出錯可以重新生成,機器人行動失誤則可能造成現實損失。因此,物理世界對實時感知、控制精度、穩定性和安全性提出了更高要求。
但世界模型所學習的內容,不應只由最終連接的是屏幕還是電機來定義。只要模型需要表示當前狀態、預測未來變化,并根據外部輸入更新環境或作出行動,世界建模能力就已經參與其中。
機器人不是世界模型的唯一歸宿,而是其中對感知、預測、決策和執行閉環要求更高的一種應用。
05
數字世界與物理世界如何形成互補
生數科技同時布局數字世界和物理世界,不只是因為二者可以共享底層技術,還因為兩條路線有可能在數據、反饋和能力驗證上形成互補。
數字世界的優勢在于數據規模大、使用頻率高、試錯成本低。
海量視頻可以幫助模型學習物體運動、人物行為和環境變化;廣告、短劇、影視和互動內容的生產,又能持續產生真實反饋,例如哪些結果被采用、哪些鏡頭頻繁返工、角色一致性和動作表現在哪些場景下容易出錯。
物理世界則提供更精確的動作數據和更嚴格的因果檢驗。
機器人必須遵守真實空間中的尺寸、接觸、受力和運動約束。任務是否完成、物體是否被碰倒、動作是否安全穩定,無法依靠視覺效果掩蓋。這些反饋可以檢驗模型學到的規律能否轉化為可靠行動。
反過來,機器人在真實任務中學習到的動作知識、物體交互規律和空間約束,也可能幫助視頻模型提升運動表現和物理合理性。
概括來說,數字世界幫助模型擴大對世界的認知范圍,并提供更快的產品反饋;物理世界則檢驗這些認知能否轉化為準確、穩定的行動。
生數科技這條路線真正值得觀察的,是二者能否形成正向循環:視頻預訓練為機器人提供通用世界知識,機器人行動為視頻模型補充物理約束,數字內容的規模化使用和商業回報,則為長期的基座模型訓練提供支撐。
這也是通用世界模型戰略最具想象力、同時最需要驗證的部分。
06
最終仍要接受生產力的檢驗
過去一輪大模型發展,AI 主要從語言和靜態知識中學習規律。世界模型則進一步將學習對象擴展至空間、時間、狀態變化和行動后果。
這讓視頻生成、實時數字角色和機器人控制進入同一個技術命題。
生成視頻,需要維持人物、場景和動作的連續性;驅動實時數字角色,需要根據用戶輸入持續更新狀態;控制機器人,則要進一步預測行動后果,并生成可執行的動作軌跡。
對生數科技而言,Vidu 不是通用世界模型戰略之前的舊業務,Motubrain 也不是與視頻割裂的新方向。前者生成數字世界,Vidu S1 讓數字世界接受實時反饋,后者則嘗試將理解和預測轉化為物理行動。
在數字世界,要看模型能否提高內容可用率、減少返工并降低生產成本;在物理世界,則要看機器人能否走出仿真和演示,在不同本體、任務和動態環境中長期穩定運行。
當內容生成、實時交互與物理行動逐步建立在同一套世界建模能力之上,AI 也將從理解和生成信息,進一步走向理解世界、預測世界,并行動于世界。對生數科技而言,這既是從 Vidu 走向 Motubrain 的技術路徑,也是其押注通用世界模型的長期邏輯。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.