21世紀經濟報道記者雷晨
近期,在世界人工智能大會期間的一場媒體溝通會上,昆侖萬維董事長兼CEO方漢對記者談及世界模型的數據成本、行業競爭格局、內容行業門檻變化,以及一些他自己也承認“太技術細節”的話題。
![]()
(圖為昆侖萬維董事長兼CEO方漢)
① 世界模型的核心瓶頸是數據量級,而非算法。
方漢判斷,具身智能世界模型能否迎來“ChatGPT時刻”,關鍵在于能否投喂足夠多的訓練數據,門檻大約是“1000萬小時”,再往上則是“1億小時”。這個數字對應著一筆具體的成本賬:他說手套這類采集硬件“原來的成本都是十幾萬,今年才降到一萬多”,而單位小時的UMI數據和真機數據采集成本“原來最低約500元人民幣,貴的能達到一兩千元”。按此換算,1000萬小時真機數據至少需50億元,1億小時需500億元。他的結論是:“這個誰都扛不住,我覺得沒有一家公司能負擔得起這筆費用。”
② 異構數據將取代真機數據,成為預訓練的主要來源。
正因真機數據太貴,方漢認為用手機、胸掛攝像頭拍攝的人手操作數據會成為主流。他給出的現狀是采購成本“不到50元,銷售價約在50元左右”,并預測“今年到明年”能降到“10元一小時”,這樣“1000萬小時可能只要1億元”。他還提到,昆侖萬維自有的Riemann-1.0模型在加入大量異構數據后,即使是疊衣服這類原本認為只靠真機數據就夠的任務,其完成效果也出現了明顯提升,“這使得我們的Riemann-1.0在RoboCasa 365這個特別復雜的任務上,能夠比之前的方法高出8個百分點”。
③ 誰會贏,取決于融資能力和中國的硬件供應鏈。
被問及哪家公司更有可能率先達到1000萬小時時,方漢的回答很直接:“這個大家都有可能吧,說實話,就看大家的融資能力。”但他隨即補充,數據采集設備的生產將集中在中國,理由是“中國是數據采集硬件的產地”,同時擁有“全世界最全的工業門類”以及人口規模帶來的家政和快遞服務業數據優勢。他據此預測,到今年底“應該沒有廠商能達到千萬小時,但應該有廠商能達到百萬小時”,明年底“可能有廠商能達到千萬”,而億小時級別則需“3到5年之后”。
④ 只做應用層是危險的,創業者應反過來找模型。
對于今年首發產品中應用層比重上升是否意味著重心從模型層轉移這一觀點,方漢并不認同,理由是應用層的能力隨時可能被大模型內化。他舉了Scale AI的例子,稱各行業專家寫的Skills“把自己行業最有價值的流程全部送給了大模型廠商去訓練,大模型廠商一分錢不花就能獲得這些能力”。他給創業者的建議是:“還是要拿著釘子找錘子,而不是拿著錘子找釘子”——即先厘清行業最真實的需求,再倒推需要什么樣的模型能力。
⑤ 大廠不必然贏,團隊和算法迭代速度更重要。
在被問及大廠是否會憑資金優勢壟斷大模型訓練時,方漢判斷:“我們也看到現在中國最好的模型似乎也不是大廠出的,而是創業公司。”他認為關鍵變量在于團隊人才厚度和算法迭代速度,而非資金規模,“大廠再有錢,模型訓不出來就是訓不出來,這是很實際的問題。”
⑥ 免費模式會贏,但要等Token成本降下來。
關于訂閱制和免費模式,方漢認為二者的分野取決于發達程度而非地域,“訂閱制肯定是在發達國家更普遍,這嚴格與人均GDP相關。”至于免費模式能否最終勝出,他把關鍵歸結為推理成本:“當Token成本下降到更低時,免費一定會實現,到那時才能成為普惠服務。”
⑦ 視頻創作門檻下降將帶來創作者規模躍升,但游戲世界模型商業化尚早。
方漢認為,在特定產品中,AI視頻已能做到接近真人效果,并將AI視頻普及的趨勢類比于網絡文學作者規模的擴張——中國現有“接近600萬網絡小說作者,日更6000字”,判斷視頻門檻降低后也會出現類似的創作者規模擴張。但他對游戲世界模型的商業化落地更為謹慎,認為“可能還要3~5年”,理由是端到端游戲世界模型的推理速度和成本效率目前均遠不及3D引擎渲染。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.