今年WAIC(世界人工智能大會)期間,許多人都在談?wù)撌澜缒P停f的未必是同一件事。
7月19日,在上海西岸國際會展中心,同一場論壇上,兩種不同的聲音先后登臺。中國科學(xué)院院士、南京大學(xué)副校長周志華講述了決策層世界模型依然面臨的現(xiàn)實(shí):推演誤差和交互試錯(cuò)的高昂成本。他的團(tuán)隊(duì)最近有些許進(jìn)展,但這仍是他口中“正在探索的方向”之一,而非已經(jīng)解決的問題。
昆侖萬維董事長兼CEO(首席執(zhí)行官)方漢則給出一種判斷。“2026年是‘世界模型元年’。AI不再只停留在生成內(nèi)容,而是開始理解世界怎么運(yùn)行,預(yù)判行動會帶來什么結(jié)果。”
一個(gè)“探索中”,一個(gè)“元年”。產(chǎn)業(yè)已經(jīng)在搶跑,但世界模型的地基還沒打完。
同一個(gè)世界模型,公司各自“解題”
每家公司對世界模型的界定,幾乎都精準(zhǔn)卡在自己正在做的事情上。
騰訊不做硬件本體,只承擔(dān)具身大腦平臺的角色。騰訊首席科學(xué)家、Robotics X實(shí)驗(yàn)室主任、福田實(shí)驗(yàn)室主任張正友認(rèn)為,機(jī)器人行業(yè)就像iOS與安卓、Mac與Windows,也會分化出“全棧自研”和“平臺+生態(tài)”兩條路,騰訊選的是后者。
在模型上,他認(rèn)為VLA(視覺語言動作模型)短板明確,沒有預(yù)測能力,而世界模型可以基于行動后果做預(yù)測。世界模型下一個(gè)有價(jià)值的方向,在于模型同時(shí)傳遞語言和圖像信息,能推理,也具備想象力。
智象未來創(chuàng)始人兼CEO梅濤認(rèn)為,一個(gè)真正的世界模型有三個(gè)要素:表達(dá)、推演、構(gòu)造世界。實(shí)現(xiàn)這些的關(guān)鍵在于,讓模型真正建立起對物理世界統(tǒng)一的認(rèn)知。這也就是智象未來堅(jiān)持原生全模態(tài)大模型的初衷:不是做一個(gè)更大的拼接模型,而是在最底層把“世界的運(yùn)行規(guī)律”刻進(jìn)模型的DNA里,以統(tǒng)一的方式理解視覺、語言、動作和空間關(guān)系。
梅濤認(rèn)為,如果我們僅僅是把世界進(jìn)行復(fù)現(xiàn),本質(zhì)上只是在做現(xiàn)有知識的壓縮、擬合與復(fù)刻。在這樣的范式下,人類五千年文明積累的信息量上限,就是AI的能力上限。
但他也坦言,現(xiàn)在包括視頻、多模態(tài)、具身、3D在內(nèi)的各種世界模型,離真正的世界模型還比較遙遠(yuǎn)。
生數(shù)科技同樣基于視頻數(shù)據(jù)訓(xùn)練世界模型,強(qiáng)調(diào)對物理世界的理解。生數(shù)科技CEO駱怡航認(rèn)為,世界模型必須同時(shí)具備感知理解、預(yù)測想象、行動三個(gè)維度:“世界模型一定要刻畫整個(gè)人與世界的交互規(guī)律,同時(shí)能驅(qū)動人與數(shù)字、物理世界打交道,這個(gè)定義應(yīng)該具備很強(qiáng)的Foundation(基礎(chǔ))屬性。”
作為PhysX物理引擎奠基人之一的張立華,同時(shí)也是復(fù)旦大學(xué)長聘特聘教授、飛捷科思創(chuàng)始人、中國人工智能學(xué)會人機(jī)融合智能專委會主任,他的判斷標(biāo)準(zhǔn)落在是否符合物理規(guī)律上。
他認(rèn)為,現(xiàn)有的主流世界模型基本還是數(shù)據(jù)驅(qū)動的視覺模型,難以把物理規(guī)律準(zhǔn)確地嵌入模型里。“雖然你看了很多圖像、視頻等數(shù)據(jù),形成了一定的物理直覺的能力,但這個(gè)能力也存在限制,就像人的物理直覺一樣,雖然能夠在某些條件下給出相對準(zhǔn)確的趨勢判斷,但并不能保證所有情況下判斷的準(zhǔn)確性和真實(shí)性。雖然你看了很多,但不等于你抓住了這些表象背后的物理機(jī)制。”
世界模型定義還存在爭議,但不影響各大公司卡位。
昆侖萬維不再局限于視頻(SkyReels)、音樂( Mureka )等AI生成內(nèi)容的業(yè)務(wù)線,開始向世界模型、機(jī)器人模型等物理AI敘事框架轉(zhuǎn)變。生數(shù)科技并不瞄準(zhǔn)單一場景,而是希望做好通用能力,用同一個(gè)模型驅(qū)動不同本體去做不同的任務(wù),半天到一天內(nèi)就能適配部署。飛捷科思則發(fā)起“物理智能創(chuàng)新聯(lián)合體”,聯(lián)合32家單位,定位成國產(chǎn)世界模型的操作系統(tǒng)底座。
誰能先抓住“世界模型”這頂帽子,誰就先占住了故事的入口。一位投資人曾透露,他年初見過一家具身智能公司,能講出非常好的應(yīng)用場景,時(shí)隔三個(gè)月后便開始講世界模型的故事,“這是很現(xiàn)實(shí)的問題”。
模型存短板,不能完全信任
世界模型對物理世界的理解,還存在欠缺。
破殼機(jī)器人創(chuàng)始人許華哲提到,即便現(xiàn)在的模型已經(jīng)能做到不錯(cuò)的像素級預(yù)測,也不能完全信任它。“只要是模型生成出來的東西,就一定帶著模型自己的特性,如果在這樣的仿真器里學(xué)策略,很容易擬合到模型的特性,而不是真實(shí)世界的特性。”
要補(bǔ)上這個(gè)缺口,模型需要兩個(gè)方向:一是讓模型本身更懂物理規(guī)律,二是讓模型學(xué)習(xí)的環(huán)境足夠真實(shí)。
前一個(gè)方向,是視頻生成廠商正在做的事,押注的是底層算法架構(gòu)和高質(zhì)量數(shù)據(jù)實(shí)現(xiàn)躍升后,模型自己能把物理規(guī)律“悟”出來。
智象未來選擇視頻、全模態(tài)到世界模型這條路徑,因?yàn)椤盎ヂ?lián)網(wǎng)視頻數(shù)據(jù)非常多,這些數(shù)據(jù)已經(jīng)包含許多物理規(guī)律、因果關(guān)系在內(nèi)”。并自研了UiT(Unified Transformer)架構(gòu),在數(shù)據(jù)端則涵蓋了20萬小時(shí)版權(quán)數(shù)據(jù),覆蓋超70%華語電影資源的行業(yè)多模態(tài)語料庫。
生數(shù)科技則用MoT架構(gòu)(可以理解為是一種稀疏、多模態(tài)Transformer架構(gòu))把理解、生成和行動整合在一起,而非“先理解、再規(guī)劃、再動作”的分步路線。
模型“悟”出規(guī)律,還得放到仿真環(huán)境里訓(xùn)練和驗(yàn)證。如果仿真環(huán)境本身的物理規(guī)律不夠真,模型學(xué)到的東西再像,也經(jīng)不起真機(jī)上的檢驗(yàn)。這就是飛捷科思在做的事,給模型提供可信的訓(xùn)練地基。
一切源于張立華團(tuán)隊(duì)的踩坑經(jīng)歷。他的復(fù)旦實(shí)驗(yàn)室團(tuán)隊(duì),早年也用過其他商用具身仿真平臺做仿真訓(xùn)練,“仿真的時(shí)候機(jī)器人表現(xiàn)得非常完美,但我們把實(shí)機(jī)都造出來后,再一驗(yàn)證就發(fā)現(xiàn)不行”。后來團(tuán)隊(duì)排查發(fā)現(xiàn),其底層的物理引擎動量并不守恒,仿真訓(xùn)練了很久,但因?yàn)槟M的物理規(guī)律并不符合現(xiàn)實(shí)世界的物理規(guī)律,導(dǎo)致訓(xùn)練好的算法不能在真機(jī)上復(fù)現(xiàn)。
經(jīng)歷這一教訓(xùn)后,團(tuán)隊(duì)沒有急于繼續(xù)擴(kuò)大模型訓(xùn)練,而是轉(zhuǎn)向自研底層物理引擎和仿真訓(xùn)練平臺,目的就是要提升物理引擎和仿真訓(xùn)練平臺的精度和能力。進(jìn)一步,他們做出了全新一代物理世界模型Fysiverse,其架構(gòu)是創(chuàng)新的“顯式物理模擬器+生成式渲染器”雙驅(qū)動,讓生成模型繼續(xù)發(fā)揮視覺表達(dá)優(yōu)勢,用物理引擎補(bǔ)因果建模的短板。
張立華認(rèn)為,現(xiàn)在絕大部分模型還是以端到端為主,很少體現(xiàn)推理能力,但一個(gè)真正通用、有泛化性的模型,未來一定要具備推理能力。“遇到物體位置突然變化這類情況,機(jī)器人應(yīng)該可以像人一樣及時(shí)做出判斷并調(diào)整策略,而不是只靠預(yù)訓(xùn)練學(xué)到的反應(yīng)去執(zhí)行。”而這種推理能力的訓(xùn)練,同樣需要物理真實(shí)的仿真環(huán)境來支撐。
第一人稱視角數(shù)據(jù)缺失,補(bǔ)法卻不一樣
模型要學(xué)好,除了要有對的架構(gòu)和環(huán)境,還需要足夠多的數(shù)據(jù)。具身智能下一步,需要大量第一人稱視角的操作數(shù)據(jù),也就是以人的視角拍到的、真實(shí)操作物體時(shí)的視頻。
視頻生成廠商正在把自己的生成能力延伸向用于模型訓(xùn)練的數(shù)據(jù)供給。這背后是世界模型對高質(zhì)量數(shù)據(jù)的渴求。梅濤提到,目前容易獲取的數(shù)據(jù)基本已經(jīng)被拿得差不多了,但真正高質(zhì)量、有私域價(jià)值的數(shù)據(jù)反而越來越難拿到。
梅濤談到智象未來與一家機(jī)器人公司的合作:對方提供人類帶著夾爪操作的仿真數(shù)據(jù),每個(gè)關(guān)節(jié)點(diǎn)精度大概在毫米級;智象未來反過來生成一份不帶夾爪的真人第一人稱實(shí)操視頻,和原始數(shù)據(jù)一一對齊。“用這樣的視頻可以做增廣,一份高精度、帶夾爪的視頻,能生成出上百到上千份不同背景、膚色、形態(tài)的版本,同樣保持高精度。”
C端的數(shù)據(jù)采集,目前還停留在比較原始的階段。許華哲提到,現(xiàn)在主要是靠58同城、獵聘這類公司,派人帶著采集設(shè)備上門去拍;下一步可能是把采集設(shè)備直接寄到普通人家里,讓人邊帶娃或邊做自媒體,邊采數(shù)據(jù)賺點(diǎn)錢。
究竟需要多少量級的數(shù)據(jù),行業(yè)還在探索。啟明創(chuàng)投給出一個(gè)參照:頭部機(jī)器人公司的有效數(shù)據(jù),會從2025年的“萬小時(shí)級”,躍升到2027年的“百萬小時(shí)級”,其中人類第一視角數(shù)據(jù)將占絕對主導(dǎo)。
而數(shù)據(jù)恰恰是行業(yè)難以共享的東西。許華哲提到,數(shù)據(jù)是具身智能里最核心的資產(chǎn),幾乎沒人會真正把它開源出來,網(wǎng)上很多號稱開源一萬小時(shí)的數(shù)據(jù)集,點(diǎn)開可能只有五十小時(shí)。
當(dāng)行業(yè)有人喊出“元年”時(shí),學(xué)界在解理論“死結(jié)”,廠商在用同一個(gè)詞爭不同的定義。模型在往前跑,地基在往下打,中間還缺數(shù)據(jù)。世界模型在還沒被講清楚前,就已經(jīng)被相信了。
新京報(bào)貝殼財(cái)經(jīng)記者 韋英姿
編輯 王進(jìn)雨
校對 穆祥桐
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.