![]()
具身智能還沒到 ChatGPT 時刻,原力靈機想先把它變得能用。
作者|Li Yuan
編輯|鄭玄
具身智能的未來,會是一個超級本體、一個超級模型籠罩一切,還是很多本體、很多模型、很多開發者、很多場景一起長出來?
現實似乎在逐漸靠近后者——無數本體和模型正在世界各處尋找不同的落地場景,而每個場景,都需要不少自己的場景數據和知識。
可真往這個方向走,眼下具身智能行業顯然還不沒有準備好:今天的模型往往和本體綁在一起訓練,換一具身體,遷移就異常吃力;后訓練需要真機數據支持,成本高居不下;開發者想像調用大模型 API 那樣輕裝取用具身能力,還差得遠。越是要「多本體、多模型、多場景」,這些卡點就越擋路。
說到底,具身智能還沒有大語言模型那樣一套標準的 API 規則,把模型和千差萬別的機器人接到一起——它缺的,是一套機器人的「安卓」。
不過,這個問題正在被回答。第一屆 Action 開發者大會上,原力靈機一口氣搬出了一串東西:DM0.5 主打模型創新,強在 Zero-shot 和多本體支持;DexDev 沖著開發者去,把后訓練工具、一裝就能對接模型的 DexOS、按量收費的 MaaS 收攏到一起;同時還發布了新本體 Apex 與 Ferrata,繼續扛起自己的商業交付。
![]()
和很多大會不一樣,原力靈機的這場大會從頭到尾把重心壓在「開發者」三個字上——不是把開發者請來看原力靈機有多強,而是把東西交到他們手里,讓他們用得上、用得起、用得動。
也正因如此,這次一口氣發布的一串模型和工具,看著雜,其實一條線:一手把模型往深里做,把能力遞到更多人手上,一手,是親自鉆進物流倉庫這樣的真實場景,用成本和使用量說話,看這套東西到底跑不跑得起來。
這背后其實是一個更根本的判斷。今天沒有誰的具身基模真正成熟,原力靈機自己也不例外。但比起再等一等、把模型悶頭做到更強,它更想先回答另一個問題:在基模還不完美的當下,怎么讓具身智能先被更多人用起來、先在真實場景里跑起來。
01
先把模型做深:
開箱即用的前提,是 Zero-shot
原力靈機首先發布的,是一個新模型:具身基座模型 DM0.5——保持了半年一次模型架構迭代的承諾。
新的 DM0.5 比上一代 DM0 更大——參數量翻了一倍到 4B,訓練數據翻了好幾倍,堆到 15 萬小時的規模。
![]()
其中 5 萬小時是不同種類的真機數據,10 萬小時是第一視角的人類操作數據,采取了毫米級的 3D 手部關鍵點標注;剩下是上百萬條高精度導航數據。
在媒體溝通會上,周而進表示:「今天行業里都在比誰的數據量大,從去年的一萬小時干到今年的上百萬小時,但真正決定模型好壞的是數據質量,忽視質量單談數量沒有意義。手部關鍵點如果標不準,喂進去再多也是「垃圾進、垃圾出」,學出來的動作看著像、一樣都做不成。」
在數據量之外,原力靈機還強調了此次模型采用了幾個創新架構:
第一是原生記憶。沒有記憶的模型做不了稍微復雜一點的任務——走一步忘一步,記不住上一步干了什么,也記不住最初的指令。原力靈機做了一個上下文抽象層,從預訓練階段就原生支持最長 60 秒的記憶,而不是事后外掛一個模塊。有了記憶,「打掃完再把東西放回原處」這類需要前后依賴的活才做得成。
第二是推理。分兩層:一層是任務規劃——定位目標物、判斷當前該做哪個子任務、下一個是什么、這個動作做完沒有;另一層才是動作生成——機械臂怎么動、夾爪怎么開合。其中最關鍵的是特意構造的反事實任務,用「如果指令換一個說法、結果該不該不一樣」這類題,逼模型真的看懂指令,而不是背下訓練集里的固定套路。
第三是對齊。同一個動作采上五十遍、一百遍,哪怕同一個人操作,也總有快有慢,軌跡對不齊,網絡學起來就一片混亂。原力靈機讓動作的監督從傳統的「對點」變成「對齊」:用帶約束的動態規劃去算出各條軌跡之間的最優匹配,訓練時先把它們對齊一遍,讓模型學到的是真實的運動節奏,而不是死記硬背一個個坐標點。
改動帶來了更強的泛化性。—機器人碰上沒有專門訓練過的任務,能靠對語言、視覺和動作的理解直接上手,而不必退回「采一批數據、再訓一個專項模型」的老路。
據公司披露,在 Franka 單臂與 Dexmal-Mint 雙臂的實際評測中,DM 0.5 相比于前一代模型和裝載了 PI0.5 的模型上,指令遵循成功率都均取得了跨越式的提升。
![]()
三處創新摞在一起,指向同一件事:行業都在往落地和場景使勁的時候,原力靈機沒把基礎模型這塊撂下,而是實打實在往深里做。最直接的證據是錢——唐文斌提到,公司在算力上的投入是「小幾個億」的量級,還補了一句,算力上沒花過上億的錢,大概率就別再訓模型了。往大做、堆高質量數據、在架構上一處處啃硬骨頭,沒有一樣省錢。
而模型做得夠不夠好,恰恰是開頭那個問題的地基。開發者敢不敢放心地不再自己折騰基模、把精力挪到上層的場景和應用,前提就是底下這個模型真的扛得住、拿來能用。基座越結實,上面能長出來的東西才越多。
更難得的是,往大做的同時,原力靈機沒有放掉效率。這一代延續了 DM0「效率優先」的底色:最快 50 毫秒延時,能在一張 4090 消費級顯卡上做二次后訓練,很多下游任務最快不到一天就能重訓一遍。這些都不是炫參數,而是實實在在給開發者留出的余地——用得起、調得動,他們才接得住。
那模型到底好到什么程度?唐文斌給了一個他們自己最認的判斷標準。他說,同行也好、自家過去的模型也好,嘴上都講自己 benchmark 更漂亮,可真正的檢驗是有沒有開發者放棄開源、轉過來用你——「到目前為止是沒有的」。而這一次,他「敢講」,DM0.5 比開源的派更好用。
02
讓能力被用起來:
MaaS 是第二條曲線
如果說 DM0.5 解決的是「模型本身夠不夠強」,那么這場大會的另一個重頭,是模型之外那一層——怎么讓這份能力,被更多不是原力靈機的人用起來。
原力靈機把這一層打包成了一個面向開發者的平臺,叫 DexDev。它裝著三樣東西:讓模型持續變強的 DFOL2.0,讓模型接得上不同機器人的 DexOS,以及讓能力被直接調用的 MaaS。三樣各解一道題。
第一道題:模型怎么在落地之后繼續變強,還不燒錢。
具身模型的后訓練,長期卡在一個又慢又貴的環節:讓真機在現實里反復試錯、采數據。DFOL2.0 的思路,是把這個試錯搬進虛擬世界。
基座模型 DM0.5 先生成一批初始動作,推給世界模型 DW0.5;DW0.5 當仿真器,在虛擬環境里把這些動作會導向的未來「跑」出來,批量生成成功和失敗的軌跡;再由一個強化學習的「教練」CFG-RL,給每條軌跡的任務進度打分——成功的價值一路走高,失敗的價值斷崖下跌;打分和獎勵實時回傳,更新模型權重,喂出一個更強的 DM0.5。
關鍵在于,這個循環里大部分數據是世界模型在線生成的,不必再靠真機一遍遍試。據公司披露,DFOL2.0 能讓實際的真機訓練數據占比下降六成,端到端的訓練成本下降四成。
對開發者來說,這意味著把模型搬進自己的場景做適配時,不必再被真機采數據的成本拖住。
![]()
第二道題:模型和五花八門的機器人,怎么接得上、跑得穩。
具身行業有個繞不開的麻煩:模型和本體之間沒有統一的抽象。換一臺機器人、換一套傳感器和執行器,往往就得重寫一大堆對接的代碼。用唐文斌的話說,這是個「N 乘 M」的匹配——M 個模型對 N 種本體,兩兩都要單獨適配,行業就很難規模化。
原力靈機給的答案是一套操作系統 DexOS,加一個開源的接口協議 ECP。它想做的,正是導語里那個「機器人的安卓」——讓模型這一側只對接一個標準接口,本體那一側也只對接同一個標準接口,中間的差異由 OS 抹平。
這樣模型只管發出它想要的軌跡,硬件盡力去實現。N 乘 M 的兩兩適配,變為一臺機器人只要裝上 DexOS,模型只要對齊這套接口,就能接上。
第三道題:這份能力,怎么讓開發者直接調用。
這是 MaaS——具身行業里第一個把模型做成「按調用付費」的服務。它對標的是大模型云服務那套:開放推理接口,任何人拿到就能用,按 Token 計費。
MaaS 給了兩種模型。一種是通用模型,零樣本,拿來即用,不必自己訓;另一種是定制模型,開發者上傳自己機器人的數據,用原力靈機的基座和這套后訓練適配之后,托管在云端供自己調用,按 GPU 占用時長另算錢。前者是「開箱即用」,后者是「用不順手就再訓一訓」——恰好復刻了大模型從通用到微調的兩條路。
![]()
范浩強提到,敢把模型做成 MaaS 開放出去,是因為對這一代模型的開放集能力有了底氣:接口一旦公開,任何人可以用任何方式來測,結果不可撤銷、即時返回、永遠留痕。這既是自信,也是一種自我倒逼——MaaS 一放出去,各種人、各種測試、各種沒見過的場景和失誤都會涌進來,而這恰恰會牽引公司把研發方向對準「通用化、場景泛化」這件最該做的事。
不過現階段,MaaS 最先盯住的還不是廣義的開發者,而是本體廠商。
邏輯很直接:相比于模型,目前完成一個相對成熟的機器人本體更簡單一點。一臺只會動的硬件,裝上 DexOS、接上云端的模型,就變成一臺能干活的機器人。范浩強表示,第一批面向的正是這些「有了硬件」的廠商,讓他們和模型一結合,硬件就成了能做任務的機器人。
03
從 Apex 到 Ferrata:
愿景很大,但原力靈機愿意自己先下場
把模型做深、把能力交出去,這是原力靈機遞給外部的兩條線。
但它沒有停在"我有一個好模型、也有一套好工具"上——同一場大會,它還發布了自己的本體 Apex,搭配此前已經發布的物流解決方案 Ferrata,把具身的落地應用往前推。
![]()
原力靈機做本體是"后發"的——用張紹政的話說,是先對模型和算法有了足夠認識,才回過頭來做硬件,所以它想做的是一臺"更懂模型"的本體。
最典型的設計是模塊化:手臂、夾爪、底盤都拆成獨立模塊,像搭積木一樣拼出不同配置,換末端不必重啟、支持熱插拔。這背后是一個務實的判斷——張紹政說,他們不認為一臺統一的本體能滿足所有場景,成本和可靠性都還沒到那個成熟度,與其硬做一臺全能機器人,不如讓一臺機器人按場景換裝。
對落地的考慮,也體現在穩定性上。過去不少具身產品跑幾個小時就發熱、宕機,Apex 反過來把穩定性當第一指標:據公司介紹,首款硬件已測出超過 1000 小時的持續運行數據,支持帶電作業、30 秒快速換電,換電時大腦不斷電、任務不用重啟。這些細節不性感,卻正是一臺機器人能不能真在倉庫里連軸轉的前提。
今年 6 月,原力靈機與物流機器人公司 Atomix 合并,很快又發布了具身 harness Ferrata,再加上自己的本體,原力靈機自己的落地這條線就補齊了。按公司的規劃,下半年在真實場景做 POC,明年開始規模化部署,年底的目標是 1000 臺機器人在物流場景里持續跑到 1000 小時。
把這次所有的發布連起來看,原力靈機這場大會的野心其實不小:它要的不是一個更強的模型,而是從各個鏈路上,把具身落地缺的那些環節一處處補齊。
![]()
但難得的是,講這么大一套東西的同時,原力靈機仍然對眼下的位置異常清醒。
唐文斌在媒體溝通會上反復強調一件事:今天還沒到「具身智能的 ChatGPT 時刻」,頂多是「ChatGPT2.0 的水平」,包括原力靈機自己在內,沒有誰的模型能說自己已經贏了。
今天所做的事更像是它的戰略選擇:它沒有選擇再等一等、把模型悶頭做到更強,而是先把能用起來的這條路鋪開——讓模型跨得了本體、讓開發者調得動、讓機器人在真實倉庫里先轉起來。
在一個還沒有定論的早期,比起證明「我的模型最強」,原力靈機更想先回答另一個問題:怎么讓具身智能這件事,從少數團隊手里的定制工程,變成更多人能直接用上的基礎能力。
*頭圖來源:原力靈機
本文為極客公園原創文章,轉載請聯系極客君微信 geekparkGO
極客一問
你如何看待原力靈機?
![]()
![]()
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.