![]()
通用機器人,真的快來了嗎?
過去一年,VLA、機器人基礎模型、世界模型接連成為具身智能領域的關鍵詞。各類 demo 中,機器人已經可以疊碗、插管、倒水、整理桌面,看起來正在從「聽懂人話」走向「動手干活」。
但一個更關鍵的問題仍然懸而未決:這些模型到底強在哪里?是在仿真環境中表現較好,還是在真實世界中也同樣穩定?它們能完成單個動作,還是能把一整套任務穩定做完?
曾推出 RoboTwin 系列基準的團隊發布了RoboDojo,一套統一覆蓋仿真與真實機器人操作的具身智能評測體系。它包含42 個仿真任務、18 個真實機器人任務,并將30 個代表性機器人策略放到同一套標準下比較。
評測結果顯示:在仿真環境中,當前表現最好的通用機器人策略平均成功率為8.80%;在真實世界中,頭部模型的平均成功率為12.8%。作為對照,人類專家在仿真中的成功率為76.03%,真實世界任務則達到100%
這說明,當前的機器人基礎模型已經取得一定進展,但距離可靠、可復現的通用操作能力,仍有較大提升空間。
![]()
- 論文標題:RoboDojo: A Unified Sim-and-Real Benchmark for Comprehensive Evaluation of Generalist Robot Manipulation Policies
- 項目主頁:https://robodojo-benchmark.com/
- 論文地址:https://arxiv.org/abs/2607.04434
- Leaderboard:https://robodojo-benchmark.com/LeaderBoard
- Benchmark 代碼:https://github.com/RoboDojo-Benchmark/RoboDojo
- XPolicyLab 代碼:https://github.com/XPolicyLab/XPolicyLab
![]()
視頻鏈接:https://mp.weixin.qq.com/s/J4LWa0m6tMgChf0awSu6hg
RoboDojo 項目介紹視頻。
RoboDojo:
給具身智能出一套「綜合卷」
RoboDojo 的核心并非簡單堆任務數量,而是把機器人操作拆成五類更接近真實場景的能力維度:
- 泛化能力:模型能否適應新背景、新光照、新物體和雜亂場景。
- 記憶能力:模型能否記住之前看到的信息,并在后續動作中用上。
- 精細操作:模型能否完成插入、對齊、接觸等高精度動作。
- 長程執行:模型能否連續完成多個互相依賴的步驟。
- 開放語義理解:模型能否理解未見過的語言指令,并轉化為動作。
![]()
這些任務遠非傳統 pick-and-place 的簡單變體。泛化任務中,桌面雜物數量、物體外觀、背景與光照都會變化;記憶任務里,機器人需要記住傳送帶上曾出現又消失的目標;長程任務中,拿起、移動、對齊、放置任何一步出錯,都會導致最終失敗。
![]()
RoboDojo 仿真任務總覽
這也是具身智能與純視覺、純語言任務的一個主要差異:在物理世界中,小的誤差也可能導致任務失敗。
從仿真到真機,也是評測的重要一環
RoboDojo 沒有停留在仿真環境。團隊設計了18 個真實世界任務,覆蓋ARX X5PiperPiper X三種雙臂機器人平臺,每個平臺各 6 個任務,包括制作食物、插管、插充電器、疊碗、掛杯子、清掃積木、給物體分類、把物品裝進背包等。
![]()
RoboDojo Real-World Benchmark:18 個任務覆蓋 3 種機器人平臺
![]()
真實機器人操作任務示例
這些任務聽起來日常,但對機器人來說仍具挑戰性。真實世界會引入相機噪聲、標定誤差、機械臂延遲、夾爪打滑、接觸不穩定、物體初始位置偏差等因素,一個在仿真中表現穩定的策略,遷移到真機上后可能出現性能下降。
為提高真機評測的可比性和可復現性,RoboDojo-RealEval 統一了硬件配置、工作空間布局、光照條件、場景復位流程、評測協議和部署接口。每個 trial 由評審雙盲打分,既看最終結果,也看中間步驟完成情況。
![]()
RoboDojo-RealEval 標準化評測平臺
這使得它更接近一套標準化評測流程,而不僅是個案展示。
榜單結果:頭部模型與人類專家仍有差距
在仿真榜單中,團隊評測了 30 個代表性機器人操作策略,包括Hy-Embodied-0.5-VLASpatial Forcingπ0.5X-VLAGR00T-N1.7π0OpenVLA-OFT等。
![]()
排名第一的是Hy-Embodied-0.5-VLA,平均分,平均成功率8.80%。雖然領先其他模型,但與人類專家76.03%的仿真成功率相比,仍有較大差距。
![]()
仿真榜單:Hy-Embodied-0。5-VLA 暫列第一,平均成功率 8。80%
真實世界榜單中,π0.5排名靠前,總體成功率為12.8%,平均分為22.9。InternVLA-A1、GalaxeaVLA、Xiaomi-Robotics-0、X-VLA 等模型也進入頭部區間,但整體成功率仍處于相對較低的水平。
![]()
真實世界榜單:π0。5 暫列第一,總體成功率 12。8%
在開放語義任務上,結果同樣值得關注:當前表現最好的模型,在 Open 任務上的成功率約為1.67%
這表明,當前機器人模型已經具備一定操作能力,但在穩定性和任務完整度上仍有提升空間。它們往往能夠完成部分步驟,但在對齊、插入、放置、恢復等關鍵環節仍容易出現失誤。
![]()
RoboDojo 將排行榜可視化為一座「具身珠峰」
為什么單個 demo 不足以反映通用能力?
RoboDojo 的結果表明,機器人基礎模型的能力增長并不均衡。有的模型視覺識別更強,有的動作執行更順,有的長程任務能推進更多步驟。
而通用機器人通常需要在多個維度上同時表現穩定 —— 既要理解環境,也要記住關鍵信息;既要規劃合理,也要執行準確;既要處理熟悉任務,也要理解開放指令;既要在仿真中跑通,也要在真實機械臂上穩定運行。
因此,單個任務、固定環境或經過篩選的成功片段,往往不足以全面反映模型是否可靠、是否具備泛化能力、是否適合實際部署。
RoboDojo 的價值在于,它把這些差異放到同一張榜單中比較,使不同模型在記憶、泛化、動作精度、長程執行和真機遷移等維度上的表現更加可見。
不只是評測,也是基礎設施
除 benchmark 本身,RoboDojo 還提供兩項關鍵基礎設施。
異構并行仿真。傳統仿真并行往往復制同一場景、只改變初始狀態;RoboDojo 支持不同任務、不同物體、不同布局同時運行,顯著提升評測效率。
XPolicyLab。統一接入層,處理不同機器人策略之間的數據格式、預處理流程、訓練腳本、動作表示和部署環境差異。不同模型只要接入統一的 observation-action 接口,即可在 RoboDojo 仿真環境和 RoboDojo-RealEval 真機平臺上運行。
這讓 RoboDojo 不只是一次性論文基準,而更像一個可持續更新的具身智能競技場:模型可以持續上榜,任務可以繼續擴展,真實機器人評測也可以遠程接入。
![]()
RoboDojo 后續計劃擴展至靈巧操作、人形全身操作、觸覺操作和移動操作
具身智能需要更統一的評測標準
過去,機器人領域的發展常常由 demo 推動。一個模型完成幾個任務,容易讓人產生通用機器人即將成熟的印象。
RoboDojo 的評測結果則提供了一個更完整的參照:當前模型確實在持續進步,但距離可靠、泛化、可部署的通用機器人操作,整體仍有差距。
從研究角度看,這樣的基準有助于把問題描述得更清楚。通用機器人并不只是會抓取物體,或只會執行一句指令,而是需要在復雜、變化、帶噪聲的真實環境中,把感知、記憶、規劃、控制和糾錯串聯起來,形成穩定閉環。
RoboDojo 提供了一套可重復使用的評測框架,為后續模型迭代和能力對比提供了共同參照。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.