文 | 定焦One,作者 | 王璐,編輯 | 魏佳
具身智能賽道持續吸引資本目光的同時,各類相關榜單也越來越多。當“第一”幾乎成為各家標配時,榜單還有可信度嗎?
一個多月前,千尋智能就經歷了尷尬時刻。6月初,其具身基座模型Spirit v1.6在RoboArena榜單上以1918分的成績超過了英偉達Cosmos3的1880分,一度位居“世界第一”;緊接著,千尋宣布完成15億元A+輪融資,三個月內累計完成四輪密集融資,總額接近50億元,創下具身智能賽道的融資頻率新高。
不過,業內對評測數據的質疑幾乎從次日就開始升溫。有觀察者指出,在310次評測記錄中,有72%的分數來自兩個賬號。更值得關注的是,RoboArena官方隨后發布聲明,經回溯調查后移除了部分存疑的評測數據,并更新了榜單排名。Spirit v1.6也隨之從榜單上除名。
但這一事件并未澆滅玩家們的熱情,翻開近半年的行業新聞,星動紀元、原力靈機、極佳視界、智元、跨維、鹿明……幾乎每一家頭部公司手里都攥著一個“第一”,且這些“第一”維度各不相同。
這一景象或許不難理解,具身智能目前技術路線還沒統一、真機成功率大多卡在五六成,外界想判斷一家公司到底行不行,很大程度上只能依賴榜單。可當發榜的既有高校、機構也有媒體,各家標準各不相同、有的還牽扯商單和利益關系時,榜單本身還能不能當尺子用,就成了一個問題。
一位關注具身賽道的投資人坦言,榜單更偏市場行為,最多算投資決策的一個參考,他對于千尋這件事并不吃驚。在他看來,真正在意名次的,往往不是以財務或技術為出發點的機構,而是一些地方引導基金或偏國資的資金,一個“第一”,可能正是他們“寫在報告里一個比較好的入口”。但也有投資人持不同看法,他們認為在技術門檻高、信息不對稱的早期賽道,榜單至少提供了一個橫向比較的起點。
當“第一”的數量比認真做機器人的公司還多時,這些榜單到底是在測技術,還是在測講故事的能力?哪些榜單還值得看?
01.技術路線還沒統一,先人手一個“第一”
我們先來盤一盤目前市面上的榜單,建立一個大致印象。據不完全統計,目前具身智能的活躍榜單高達20余個。按評測內容,這些榜單大致可以分成三類。
![]()
VLA操作綜合榜,考察機器人能不能真干活,跑的是任務成功率,代表榜單是RoboChallenge Table30、MolmoSpaces;
世界模型榜,考的是腦內推演對不對,考察模型對物理世界的推演,不考機器人手腳利不利索,代表是World Arena和WorldModelBench;
專項基準榜,考察“極端情況下會不會露餡”,針對單點極端能力,比如雙臂協同、仿真到真機遷移,代表是RoboTwin 2.0、SimplerEnv、LIBERO 和 CALVIN。它的價值在于,在綜合榜照不到的極端場景里,把模型的短板逼出來。
需要說明的是,這三類榜單各有側重、互不替代。真機榜測執行、世界模型榜測推演、專項榜測邊界,沒有任何一個能覆蓋具身智能的全部能力。
有了這層坐標,近半年具身基座模型的戰報就能對號入座。如果把近兩個月具身基座模型的戰報匯總,可以得到一份相當壯觀的名單。
今年5月,星動紀元Era0宣稱拿下RoboChallenge Table30第一;智元GE-Sim 2.0是World Arena Track1第一;跨維DSCFuncWorld是World Arena Track2第一。進入6月,千尋Spirit v1.6拿下RoboArena第一(后被除名),鹿明Prime R0登頂MolmoSpaces。幾乎每一家都是第一,而且都有具體榜單排名作背書。
而亂象,也是從各種榜單開始的。
最明顯的是,榜首像流水席,“第一名”更換頻繁。
RoboChallenge Table30的榜首,過去半年里至少換了四次:先是千尋Spirit v1.5以50.33%的成功率刷新紀錄,很快又被極佳視界GigaBrain-0.1、美國波士頓動力Atlas、星動紀元Era0先后超越。
這個速度,比大語言模型的主流榜單更新快得多。2023年到2025年,GPT-4、Claude 3、Gemini 1.5在MMLU、GSM8K等榜單上的榜首位置,通常能守數月甚至一年,即便是2020年到2022年的高速迭代期,GPT-3、PaLM也是以月為換榜周期。“當下的具身智能,單個模型能霸榜一周就算不容易。”一家頭部具身智能公司的從業者米范表示。
其將主要原因歸結為兩點。一是物理世界的隨機性,同一個模型在真機上跑兩次,成功率差三到五個百分點很正常,光照、物體位置、機械臂公差都會影響結果,而MMLU這類大語言模型榜單是固定題目、確定性判分,同一模型跑一百次分數幾乎不變。二是測試任務的公開程度,像RoboChallenge的Table30,30項任務分布是公開的,各家可以照著任務專門采數據、微調模型再提交,榜首的“保質期”于是被壓到了以周計。
更讓人迷惑的,是同一個榜里會同時冒出好幾個“第一”。
World Arena就是典型,智元GE-Sim 2.0、跨維DSCFuncWorld對外都稱自己“登頂World Arena”,但事實是,這個榜單含有多條賽道,智元GE-Sim 2.0在Track1(感知與動作響應)以68.26分排第一,跨維DSCFuncWorld在Track2(數據引擎)排第一。“第一”分屬不同個子榜,對外卻被統一寫成了同一句話。
對不熟悉賽道劃分的讀者來說,兩家并列的“World Arena第一”的說法幾乎無法分辨,甚至會懷疑是不是有人在撒謊,但其實誰都沒說錯,只是不夠精確。
還有一層更模糊的地帶是,榜單性質混雜,“第一”的含金量卻被默認成同一檔,容易產生誤導。
一些公司的對外口徑里,經常會同時列出“某模型在RoboChallenge排名第一”,和“在某具身智能媒體的測評中也位居第一”。前者是7×24小時真機跑出來的成功率,后者可能只是編輯部閉門討論、甚至商務合作敲定的名單,兩者被并排放進一句話,含金量卻被默認成了同一檔。
其中最模糊的是“產業榜”,有些榜單頂著“產業”二字,但既不是真機鎖死的硬榜,也不是學術機構背書的benchmark,而是咨詢公司或媒體合辦的打分榜。類似情況也在大語言模型圈出現過,但隨著學術榜、商業測評、媒體榜逐漸分層,“雙料第一”才慢慢被拆掉,而具身智能,眼下正處在那個尚未分層的階段。
三種現象疊加,結果就是榜單“第一”嚴重通貨膨脹。而且這種通脹不只停留在營銷層面,一個“第一”的頭銜往往能換來關注度、資源和實打實的估值溢價。
02.一個“第一”是怎么造出來的?
既然榜單能撬動真金白銀,如何把第一造出來,也形成了“潛規則”。業內人士介紹,雖然千尋Spirit v1.6屬于極端個例,但行業里造“第一”的現象并不少,手法大致有三種。
成本最低、也最普遍的一種方式是話術包裝,“單科第一”成了“總分第一”,核心是省掉關鍵限定詞。
比如實際拿的是“RoboTwin 2.0雙臂協同VLA類Clean檔第一”,對外就變成“登頂RoboTwin 2.0”;實際是“LIBERO-Plus場景泛化專項第一”,對外就成了“LIBERO-Plus榜首”。數據沒造假、成績也是真的,但“第一”所指代的范圍被人為放大了。
第二種方式是利用“刷題”等方式直接干預結果。
一條是“照著考題練”。榜單公開的任務分布、評分標準、環境參數,都可以拿來做定向后訓練,在一些任務相對固定的榜上尤其明顯,各家可以通過反復“刷題”、過擬合到特定場景換來高分。
米范表示,具身領域的部分榜單的測試任務是公開的,各家可以針對這些任務專門采集數據、微調模型后再提交,這在具身圈被視為正常迭代,不算作弊,和LLM領域的“數據泄露、數據污染”有本質區別。
另一條是鉆評測機制的漏洞。有些榜權威性很高,機制卻有空子可鉆。比如RoboArena采用開放注冊、分布式評測,本意是讓更多人參與,卻留下了三個空子。
![]()
圖源 / RoboArena官網
一是評測者身份無門檻。任何人都能注冊當裁判,短期內大量新賬號集中評測同一個模型,就能把它的Elo分數快速推高;
二是匹配不強制全覆蓋, 隨機分配對手不等于必須跟同期在榜者都打一輪,評測者領任務時,A 是固定的,B 是從分數相近的模型里隨機抽,樣本不夠大時兩個模型完全可能一次都排不上。比如Spiritv1.6早期與DreamZero交手,23場后停戰,與5月30日入榜的英偉達Cosmos3-Nano-Policy為零對戰;
三是集中刷評,用多個賬號密集評測自家模型,把負面記錄降低。比如Spirit v1.6的310次評測記錄中,72%的分數來自于ECUST和Robotics Lab兩個賬號,它們用224場評測刷出97%勝率,把Spirit v1.6推上第一,但英偉達用同樣條件自測21次,勝率0%,兩組數據擺在一起,直接讓從業者產生懷疑。
事后,RoboArena補了規則:評測者必須是無利益關聯的第三方,堵住自刷賬號的入口,評測完成率低于20%的賬號標為可疑,堵住選擇性匹配。而處理后,千尋跌出榜單。
還有一種方式最隱蔽也最泛濫,是資源置換,把榜單直接做成生意。
不少媒體榜評選標準并不透明,有的干脆與被評對象存在商務合作,雙方聯合發一份“權威報告”,把媒體榜和學術benchmark并排包裝。它不涉及技術,也不涉及數據,只涉及預算和關系。不止一位從業者表示,刷榜、買榜等現象并不少見。
這三種手法往往疊加,先靠針對性訓練或鉆空子把分數刷上去,再用賽道偷換掩蓋來源,最后用話術對外傳播,必要時再買個媒體榜背書。層層包裝之下,“第一”就成了。
這些手法在行業內部并不是秘密。真正的問題在于,看穿它們需要一定的技術功底,技術越復雜,外行越難分辨,故事就越容易講。
03.去掉水分,還該信什么?
不止一位具身智能從業者坦言,他們當下已經不太關注榜單排名了,因為榜單能刷、能買,即便一切合規,物理環境的復雜性也讓數據很難做到百分百準確。
更深一層的問題是,這個行業目前還沒有一把“通用的尺子”。
具身智能從業者gashero用“炒雞蛋”和“拌涼菜”打了一個比方:機器人A擅長炒雞蛋、成功率90%,機器人B擅長拌涼菜、成功率85%,但不能就此說A比B強。炒雞蛋考驗抓取和翻鍋,拌涼菜考驗精準倒料和攪拌,兩件事技能不同、難度不同、評價標準也不同。當下的具身智能賽道還沒有一個統一標準,能把“炒雞蛋的能力”和“拌涼菜的能力”折算進同一個打分體系里。
不過,這不代表榜單一無是處。從業者普遍認為,榜單仍有其參考價值,關鍵在于知道什么值得看,以及看完之后還該看什么。
![]()
圖源 / RoboChallenge官網
綜合業內共識,真正可信的榜單,大體同時具備三個特征。
一是分項透明,不是只甩一個“第一”。
不論綜合榜還是專項榜,可信的做法都是把細項一一拆開。以RoboChallenge Table30為例,它測的是30項日常任務的綜合成功率,可信之處在于,不僅告訴讀者64.33%這個綜合數字,還讓讀者看到30項里哪幾項做得好、哪幾項掉鏈子。只報總分、不報細項的榜,價值要大打折扣。
二是評測由第三方掌控,且有反刷題設計。
MolmoSpaces不允許微調,模型直接“裸考”;LIBERO-Plus則加了光照突變、背景雜亂、相機角度變化等極端擾動,專門防止靠死記硬背拿分。它們的共同特點,是讓刷題變難,讓泛化成為真正的門檻。
三是看評測機制,而不是看更新頻率。
更新慢的榜單不一定可靠,更新快的榜單也不一定可刷。有些榜更新慢,可能因為真機評測成本極高,比如RoboChallenge一次完整評測周期可能要數周,30項任務每項跑10次,一共300次真機嘗試,7×24小時連續運行,這是物理世界的成本約束。而有些榜更新快,則是機制設計。比如RoboArena采用了Elo評分系統進行動態排名,每天都有新對戰數據進來,排名自然每天更新。這種快本身不是問題,它的可信度取決于機制是否嚴密、漏洞是否被補上。
但是,既然圈內都知道榜單有水分,為什么大家還在拼命刷?
答案在于行業當下的階段。
眼下這場“第一”的爭奪戰,本質上是資本焦慮的產物。今年是具身基座模型密集迭代的一年,早期賽道出貨量、營收、訂單量都不穩定,只能拿榜單頂上。融資導向的階段沒變,刷榜這件事就不會停。
當行業進入下一階段,評判的標尺會自然切換,例如每年交付多少臺、有哪些固定客戶、是否能盈利。到那時候,“第一”的通貨膨脹會自然消散,榜單也會退回它本該在的位置。
或許,那些不忙著刷榜、只顧著把機器人送進產線的公司,才是行業真正的答案。
*應受訪者要求,文中米范為化名。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.