2026年行至年中,具身智能賽道熱度仍居高不下。融資、模型、峰會(huì)、Demo 接連涌現(xiàn),行業(yè)從“具身智能元年”講到“商業(yè)化落地關(guān)鍵年”,敘事一輪輪翻新。
但在這片喧囂之下,一個(gè)更底層的難題開始浮現(xiàn):支撐具身模型持續(xù)迭代的高質(zhì)量訓(xùn)練數(shù)據(jù),正在變得越來(lái)越稀缺。行業(yè)通用的真機(jī)遙操作采集,在成本、場(chǎng)景和機(jī)型限制下,已經(jīng)逼近數(shù)據(jù)多樣性的天花板。
如果標(biāo)準(zhǔn)示教教不會(huì)機(jī)器人應(yīng)對(duì)真實(shí)世界的變量,具身模型的下一批訓(xùn)練養(yǎng)分該從哪里來(lái)?
有鑒于此,大曉機(jī)器人發(fā)布并開源了全新“一腦多型”具身操作VLA模型ACE-Ego。它將大規(guī)模第一視角人類視頻與多機(jī)型機(jī)器人數(shù)據(jù)聯(lián)合預(yù)訓(xùn)練,把人類與物理世界的交互經(jīng)驗(yàn),轉(zhuǎn)化為機(jī)器人可學(xué)習(xí)、可遷移的監(jiān)督信號(hào)。
在國(guó)際人形機(jī)器人操作基準(zhǔn)RoboCasa GR1 TableTop上,ACE-Ego以72.8%的平均成功率刷新當(dāng)前最高紀(jì)錄;在高難度雙臂操作基準(zhǔn)RoboTwin 2.0強(qiáng)域隨機(jī)化測(cè)試中,ACE-Ego取得90.62%成功率,展現(xiàn)出突出的環(huán)境魯棒性。
![]()
更關(guān)鍵的是,引入第一視角人類視頻進(jìn)行聯(lián)合預(yù)訓(xùn)練后,ACE-Ego在RoboCasa上的成功率從68.3%提升至72.8%。這意味著,“借人之眼”并非簡(jiǎn)單擴(kuò)充數(shù)據(jù),而是在為具身模型打開一條更低成本、更高泛化的規(guī)模化訓(xùn)練路徑。
目前,ACE-Ego已能穩(wěn)定完成塑料袋打包、鞋子裝入鞋盒等長(zhǎng)周期、強(qiáng)接觸的復(fù)雜零售操作,覆蓋商品整理、打包履約等典型線下零售環(huán)節(jié),突破了過去模型多停留在簡(jiǎn)單桌面抓取的能力邊界。
![]()
(大曉機(jī)器人世界模型科學(xué)家李鴻升)
近日,我們專訪了大曉機(jī)器人李鴻升。在他的講述中,ACE-Ego不只是一次SOTA刷新,更是“以人為中心”ACE 研發(fā)范式在具身模型預(yù)訓(xùn)練中的關(guān)鍵落地:從遙控機(jī)器人采集數(shù)據(jù),轉(zhuǎn)向借助人類第一視角理解真實(shí)世界;從單一本體訓(xùn)練,走向多機(jī)型協(xié)同預(yù)訓(xùn)練;從實(shí)驗(yàn)室任務(wù),走向可規(guī)模化落地的產(chǎn)業(yè)場(chǎng)景。
![]()
在相當(dāng)長(zhǎng)的時(shí)間里,遙控操作采集被視為行業(yè)黃金標(biāo)準(zhǔn)。建設(shè)專門的素材廠,配置專業(yè)的遙控人員,讓機(jī)器人在真實(shí)本體上一絲不茍地完成動(dòng)作,每一幀軌跡都被精確記錄下來(lái),成為模型學(xué)習(xí)的訓(xùn)練數(shù)據(jù)。這套方法論嚴(yán)謹(jǐn)、可控、精準(zhǔn),被大多數(shù)機(jī)器人團(tuán)隊(duì)奉為圭臬。但近兩年,越來(lái)越多人意識(shí)到,這套標(biāo)準(zhǔn)化操作正在成為制約機(jī)器人發(fā)展的天花板。
最直觀的成本壓力。從場(chǎng)地租賃、硬件集成到專業(yè)遙控人員的配置,前期投入動(dòng)輒數(shù)百萬(wàn)元。作為勞動(dòng)密集型工作,一名熟練的遙控人員一天能采集的有效數(shù)據(jù)時(shí)長(zhǎng)非常有限。
成本問題尚且可以通過融資來(lái)解決,但技術(shù)層面的限制更加根本。一個(gè)素材廠一旦搭建完成,場(chǎng)景、光照、物體位置、工作臺(tái)的高度和材質(zhì)就基本固定了。機(jī)器人學(xué)到的所有動(dòng)作,都綁定在這套固定的物理配置之上。
![]()
李鴻升對(duì)此的感受很直接:“數(shù)據(jù)多樣性的上限很低,除非你把整個(gè)素材廠搬家換布景,不然模型就困在那里了。”
這也是行業(yè)所說(shuō)的泛化能力不足,真實(shí)世界的變量遠(yuǎn)超素材廠能夠模擬的范圍,機(jī)器人無(wú)法舉一反三。在素材廠里接受訓(xùn)練的模型就像從小到大只做過標(biāo)準(zhǔn)試卷的學(xué)生,一旦考題稍微換了個(gè)問法就手足無(wú)措。仿真數(shù)據(jù)試圖以更低的成本解決這個(gè)問題,但sim-to-real的鴻溝至今沒有完美的跨越方案。
轉(zhuǎn)向人類第一視角視頻獲取現(xiàn)實(shí)世界的真實(shí)數(shù)據(jù)正是對(duì)這個(gè)困局的回應(yīng)。借眼入局繞開的不僅是高昂的采集成本和技術(shù)瓶頸,更是那條越走越窄的標(biāo)準(zhǔn)化答案之路。
但“借來(lái)”的眼睛看到的東西,離機(jī)器能理解的語(yǔ)言卻還有很長(zhǎng)一段距離。
![]()
眼睛看到了,不等于機(jī)器真的理解了。對(duì)人類如此,對(duì)機(jī)器更是如此。
人類日常操作視頻最大的價(jià)值是真實(shí)、多樣。不同的人、不同的場(chǎng)景、不同的操作習(xí)慣恰恰是實(shí)驗(yàn)室數(shù)據(jù)最稀缺的真實(shí)世界養(yǎng)分。但非結(jié)構(gòu)化、無(wú)統(tǒng)一標(biāo)準(zhǔn)、差異極大的真實(shí)世界數(shù)據(jù)就像一本用不同方言寫就的無(wú)字天書。未經(jīng)處理的數(shù)據(jù)直接塞進(jìn)模型里不僅成不了養(yǎng)料,反而會(huì)打亂已有的認(rèn)知體系。
李鴻升認(rèn)為,第一視角人類視頻要轉(zhuǎn)化為機(jī)器能夠理解的信息有四道門檻需要跨越。
第一是空間坐標(biāo)系不對(duì)齊。1.8米和1.5米的人胸前相機(jī)拍到的桌面角度完全不同,這些差異會(huì)讓它將本質(zhì)相同的操作判定為完全不同的任務(wù)。
第二是本體構(gòu)型不匹配。人類的指尖捏取動(dòng)作對(duì)應(yīng)到雙爪機(jī)器人上是夾爪閉合,二者的物理形態(tài)完全不同,如果做不到構(gòu)型層面的對(duì)齊,機(jī)器就讀不懂人類動(dòng)作的本質(zhì)。
![]()
第三是時(shí)間幀率不一致。真人視頻多按固定幀率采集,而機(jī)器人的動(dòng)作控制有獨(dú)立的響應(yīng)頻率,兩套時(shí)鐘的基準(zhǔn)完全不同。多源數(shù)據(jù)混合時(shí),同樣一個(gè)伸手抓取的動(dòng)作在真人視頻里是10幀,在真機(jī)數(shù)據(jù)里是30幀,按固定幀數(shù)切分就會(huì)打亂動(dòng)作的因果順序與節(jié)奏,讓模型對(duì)動(dòng)作的時(shí)間邏輯產(chǎn)生混亂。
第四是標(biāo)簽質(zhì)量有誤差。從視頻反推的動(dòng)作信息充滿誤差,手指末端和被遮擋部分的“偽標(biāo)簽”遠(yuǎn)達(dá)不到遙控?cái)?shù)據(jù)的精度。
這四道門檻共同筑成了人機(jī)之間的認(rèn)知鴻溝,也解釋了為什么很多團(tuán)隊(duì)明知人類數(shù)據(jù)成本低、多樣性高,卻不敢大規(guī)模使用。
![]()
(ACE-Ego概覽圖)
“如果你只是簡(jiǎn)單地把人類視頻和機(jī)器人數(shù)據(jù)混在一起訓(xùn)練,模型性能不升反降。”
人之眼看到的東西足夠豐富,但唯有當(dāng)它被準(zhǔn)確轉(zhuǎn)譯為機(jī)器能讀懂的語(yǔ)言時(shí),這種豐富才真正有價(jià)值。為解決這些問題,大曉機(jī)器人團(tuán)隊(duì)針對(duì)每一個(gè)“不對(duì)齊”設(shè)計(jì)了對(duì)應(yīng)的翻譯機(jī)制。
空間上,統(tǒng)一第一視角坐標(biāo)系。放棄以機(jī)器人本體為基準(zhǔn)的傳統(tǒng)思路,將所有真人視頻、真機(jī)數(shù)據(jù)全部對(duì)齊到統(tǒng)一的第一人稱視覺空間,通過幾何校正抹平身高、機(jī)位、俯仰角帶來(lái)的視覺差異。只有讓站在同一個(gè)視角看世界,動(dòng)作的相對(duì)位置、空間邏輯才能被模型統(tǒng)一識(shí)別。
本體上,用URDF編碼構(gòu)建身份體系。依托機(jī)器人行業(yè)通用的URDF構(gòu)型文件,團(tuán)隊(duì)設(shè)計(jì)了一套可學(xué)習(xí)的編碼器,給每一款機(jī)器人的軀體構(gòu)型都生成專屬的表征編碼,同時(shí)給人類肢體分配一套共享編碼。
![]()
時(shí)間上,按物理時(shí)長(zhǎng)替代固定幀數(shù)切分。不再用固定幀數(shù)劃分?jǐn)?shù)據(jù)片段,轉(zhuǎn)而以真實(shí)物理時(shí)間為基準(zhǔn)對(duì)齊所有數(shù)據(jù)源。無(wú)論視頻幀率多少、機(jī)器人控制頻率多高,都按統(tǒng)一的時(shí)間窗口切割,保證伸手、抓取、抬起的動(dòng)作因果序列與節(jié)奏不會(huì)被打亂,讓多源數(shù)據(jù)在時(shí)間維度上實(shí)現(xiàn)同頻。
標(biāo)簽上,用動(dòng)態(tài)置信度過濾噪聲。針對(duì)偽標(biāo)簽的誤差問題,團(tuán)隊(duì)為不同關(guān)節(jié)、不同遮擋情況設(shè)置了分層權(quán)重:手腕根部等重建精度高的部位賦予高權(quán)重,指尖末端等誤差大的部位降低權(quán)重;短時(shí)間遮擋輕微降權(quán),長(zhǎng)時(shí)間遮擋大幅降權(quán),從損失函數(shù)層面弱化噪聲數(shù)據(jù)的干擾,讓模型優(yōu)先學(xué)習(xí)高可信的動(dòng)作信號(hào)。
這套轉(zhuǎn)譯體系的效果最終直接體現(xiàn)在了榜單成績(jī)上。在RoboCasa GR1 TableTop排行榜上,ACE-Ego以72.8%的成功率刷新當(dāng)前最高紀(jì)錄奪得榜首;在RoboTwin 2.0 強(qiáng)域隨機(jī)化測(cè)試中,ACE-Ego以90.62%的成功率展現(xiàn)出遠(yuǎn)超行業(yè)平均水平的環(huán)境魯棒性。
![]()
這意味著,翻譯得越準(zhǔn)確,借人之眼才越有可能鑄就機(jī)器之魂。當(dāng)模型見過足夠多樣的人類行為和環(huán)境變化,它對(duì)單一場(chǎng)景的過擬合就被稀釋了。
而當(dāng)機(jī)器的靈魂初步成形之后,它面對(duì)的下一個(gè)問題更加棘手:市面上具身智能有各種各樣的型號(hào),這顆通用的機(jī)器之魂如何棲居進(jìn)形態(tài)各異的機(jī)械軀體?
![]()
一套翻譯方案跑通,意味著模型終于能看懂人類在做什么了。但看懂是一回事,用自己的身體做出來(lái)是另一回事。
人類用手捏起一個(gè)杯子,手腕旋轉(zhuǎn)30度,手指自然調(diào)節(jié)力度……這一串動(dòng)作對(duì)于人來(lái)說(shuō)是本能。但對(duì)于一個(gè)雙爪機(jī)器人來(lái)說(shuō),雙爪機(jī)械手要計(jì)算開合的最大幅度、夾持的力矩閾值;吸盤式末端要規(guī)劃吸附的中心點(diǎn)、抬起的垂直角度;即便是同一款靈巧手,臂長(zhǎng)的差異也會(huì)讓到達(dá)同一位置的關(guān)節(jié)軌跡天差地別。
同一個(gè)抓取打包的認(rèn)知目標(biāo)落到不同的物理軀體上,執(zhí)行路徑、發(fā)力方式、動(dòng)作時(shí)序可能截然不同。這便是魂與軀的核心矛盾:認(rèn)知內(nèi)核可以是統(tǒng)一的,但每一副軀體都有自己的物理邊界與運(yùn)動(dòng)規(guī)則。
![]()
行業(yè)內(nèi)的主流解法始終沒能跳出“一機(jī)一魂”的閉環(huán)邏輯。英偉達(dá)等玩家布局VLA模型時(shí),大多綁定自有硬件生態(tài),深度適配自家機(jī)器人的構(gòu)型參數(shù)與運(yùn)動(dòng)學(xué)模型。這些模型往往只為單一機(jī)型量身打造,換一款臂長(zhǎng)不同的同品牌機(jī)型都要重新調(diào)參,更不用說(shuō)跨品牌、跨構(gòu)型的遷移。
這種模式帶來(lái)了幾個(gè)后果。
一方面,研發(fā)成本重復(fù)投入,每一款新硬件上市,都要配套走一遍數(shù)據(jù)采集、模型訓(xùn)練、調(diào)試驗(yàn)證的完整流程,大量資源消耗在高度同質(zhì)化的工作里;另一方面,模型能力被硬件出貨量綁定,單款機(jī)型的數(shù)據(jù)體量天花板,直接鎖死了對(duì)應(yīng)模型的能力上限。高昂的適配成本讓大量中小企業(yè)望而卻步,只能站在具身智能的浪潮之外觀望。
![]()
(ACE-Ego技術(shù)架構(gòu)圖)
大曉機(jī)器人從一開始就跳出了“為特定硬件定制模型”的路徑依賴,提出一腦多型的設(shè)想。
在李鴻升看來(lái),真正有生命力的機(jī)器模型不該被單一硬件的軀殼束縛。
團(tuán)隊(duì)找到的破局密鑰藏在前文提到過的URDF構(gòu)型文件里。他們?cè)O(shè)計(jì)了一套可學(xué)習(xí)的URDF編碼器:每一款機(jī)器人的連桿長(zhǎng)度、關(guān)節(jié)限位、力矩范圍、自由度數(shù)量等所有物理參數(shù),都能通過編碼器映射到統(tǒng)一的語(yǔ)義表征空間。與此同時(shí),人類肢體結(jié)構(gòu)也被賦予了一套共享編碼,與機(jī)器人表征處在同一個(gè)特征體系下。
打個(gè)比方,這相當(dāng)于給機(jī)器之魂配了一本通用的軀體說(shuō)明書翻譯器。無(wú)論是什么品牌、什么構(gòu)型的機(jī)械臂,只要傳入它的URDF文件,這顆魂就能快速讀懂這具身體的能力邊界,把統(tǒng)一的認(rèn)知目標(biāo)拆解成適配當(dāng)前軀體的動(dòng)作序列。
![]()
預(yù)訓(xùn)練階段,團(tuán)隊(duì)就融合了星海圖、智源、銀河通用三款不同構(gòu)型的真機(jī)數(shù)據(jù),讓機(jī)器之魂在訓(xùn)練階段就接觸過不同的軀體形態(tài),早早學(xué)會(huì)了根據(jù)身體條件調(diào)整動(dòng)作邏輯。到了下游適配環(huán)節(jié),面對(duì)從未見過的方周雙臂平臺(tái),模型也能依靠URDF編碼機(jī)制快速完成遷移驗(yàn)證。
李鴻升透露,方案落地后,簡(jiǎn)單任務(wù)僅需50—100條人類演示數(shù)據(jù),1—2小時(shí)就能完成新機(jī)型適配,極簡(jiǎn)場(chǎng)景半小時(shí)即可上線。對(duì)比傳統(tǒng)數(shù)周級(jí)的適配周期,效率提升了一個(gè)量級(jí)。
大曉機(jī)器人從模型訓(xùn)練起家,早期并無(wú)自有機(jī)器人本體,這份“無(wú)硬件包袱”的出身,反而讓團(tuán)隊(duì)天然站在了開放兼容的視角上。李鴻升始終認(rèn)為,機(jī)器之魂的強(qiáng)大,從來(lái)不靠綁定某一款硬件,恰恰相反,接入的軀體越多、吸收的數(shù)據(jù)越多元,智能內(nèi)核的泛化能力才會(huì)越強(qiáng),最終形成數(shù)據(jù)越多、魂越強(qiáng)、適配越快的正向循環(huán)。
這份開放的思路,也直接落地成了ACE-Ego的完整開源計(jì)劃。
“我們不僅開放Checkpoint,還要同步開源真機(jī)任務(wù)數(shù)據(jù)集和完整訓(xùn)練腳本,讓中小企業(yè)、學(xué)術(shù)團(tuán)隊(duì)拿到就能用,能快速做下游遷移。”
在他看來(lái),具身智能還處在行業(yè)早期,沒有哪家企業(yè)能獨(dú)自跑完整個(gè)賽道,開源是降低行業(yè)門檻、加速整體落地的必經(jīng)之路,也是讓機(jī)器之魂ACE-Ego惠及更多場(chǎng)景的方式,降低具身操作模型的訓(xùn)練與遷移門檻。
![]()
技術(shù)的價(jià)值,最終要落在真實(shí)場(chǎng)景里。技術(shù)路徑跑通了,模型能力也驗(yàn)證了,哪一個(gè)場(chǎng)景能快速解鎖ACE-Ego的價(jià)值呢?
過去一年里,不少項(xiàng)目在融資階段講出了漂亮的故事,但到了交付環(huán)節(jié)卻拿不出可規(guī)模化部署的產(chǎn)品。從demo到product,中間隔著的是場(chǎng)景定義的清晰度,越早想清楚“給誰(shuí)用、解決什么問題”,就越有機(jī)會(huì)活過這場(chǎng)長(zhǎng)跑。
對(duì)于ACE-Ego的落地節(jié)奏,大曉機(jī)器人始終保持著十足的冷靜,沒有喊出全場(chǎng)景通用的口號(hào),而是選擇零售場(chǎng)景作為第一塊試驗(yàn)田。
在李鴻升看來(lái),這是商業(yè)與技術(shù)雙重理性的選擇。
“如果追求一個(gè)像人類智能那樣的通用模型,時(shí)間跨度會(huì)很大。但如果聚焦在特定任務(wù)上,一兩年內(nèi),我們能落地很多標(biāo)桿應(yīng)用。”
![]()
從市場(chǎng)維度看,零售與前置倉(cāng)賽道有著天然的落地優(yōu)勢(shì)。一方面,賽道整體體量足夠大,分揀、打包、分裝這類重復(fù)性崗位,普遍面臨用工成本高、人員流動(dòng)率大的痛點(diǎn),品牌方與運(yùn)營(yíng)商有強(qiáng)烈的自動(dòng)化替代意愿,采購(gòu)需求集中且明確;另一方面,對(duì)比家居機(jī)器人零散的C端采購(gòu),零售客戶以集中式采購(gòu)為主,單家企業(yè)就能支撐數(shù)十臺(tái)上百臺(tái)的部署規(guī)模,商業(yè)化閉環(huán)的速度快得多,能讓機(jī)器之魂的價(jià)值快速得到驗(yàn)證,也能反哺模型持續(xù)迭代。
從技術(shù)維度看,零售場(chǎng)景的任務(wù)邊界清晰,恰好適配當(dāng)前階段的模型能力。揀貨、打包、分裝這類標(biāo)準(zhǔn)化操作,核心都圍繞抓取、放置、操作的動(dòng)作邏輯展開,任務(wù)范圍可控,便于快速采集足量的人類演示數(shù)據(jù),完成場(chǎng)景適配與能力驗(yàn)證。更重要的是,真實(shí)零售場(chǎng)景天然存在商品差異、包裝變化、光線波動(dòng)等變量,這些真實(shí)世界的“不標(biāo)準(zhǔn)”既能持續(xù)檢驗(yàn)機(jī)器之魂的泛化能力,又不會(huì)像家居場(chǎng)景那樣任務(wù)過于分散、環(huán)境過于復(fù)雜,是性價(jià)比極高的練兵場(chǎng)。
目前,ACE-Ego已穩(wěn)定完成塑料袋打包、鞋盒封裝、咖啡分裝等典型零售作業(yè)。
談及未來(lái)的柔性制造、工業(yè)場(chǎng)景,他坦言還需要補(bǔ)兩塊短板:一是靠自研的輕重兩套可穿戴采集設(shè)備,大規(guī)模擴(kuò)充工業(yè)場(chǎng)景的人類操作數(shù)據(jù),讓機(jī)器的眼睛看到更多專業(yè)場(chǎng)景。二是把VLA模型與自研的世界動(dòng)作模型WAM打通,補(bǔ)足精細(xì)化操作的能力,讓機(jī)器的心智更強(qiáng)大。
而面對(duì)當(dāng)下行業(yè)里快速落地與泡沫論的兩極爭(zhēng)議,李鴻升的態(tài)度始終平和務(wù)實(shí)。在他看來(lái),兩種觀點(diǎn)本質(zhì)上指向的是不同的目標(biāo):如果期待的是像人一樣無(wú)所不能的通用具身智能,那這條路注定漫長(zhǎng),短期內(nèi)過度炒作確實(shí)容易催生泡沫;但如果把目光投向具體的產(chǎn)業(yè)場(chǎng)景,聚焦一個(gè)個(gè)邊界清晰的真實(shí)任務(wù),具身智能的落地速度遠(yuǎn)比大眾想象中更快。
“具身智能有一萬(wàn)條賽道,每一條賽道做深了,受益面都很廣。”
過去幾年,具身智能的主流敘事始終圍繞通用人形機(jī)器人展開。行業(yè)更習(xí)慣于先打磨出類人的物理軀體,再逐步為其賦予智能。大曉機(jī)器人則反其道而行之,選擇先淬煉出一顆獨(dú)立于硬件的通用機(jī)器之魂,再讓這顆智能內(nèi)核主動(dòng)去適配形態(tài)各異的產(chǎn)業(yè)軀體。
這種先塑魂、再附體的思路正在打開一種新的行業(yè)可能性:具身智能的發(fā)展未必非要沿著先造人、再賦智的路徑單線程推進(jìn);智能的迭代不用再被硬件進(jìn)度綁定,算法層面可以持續(xù)吸收人類真實(shí)操作經(jīng)驗(yàn)完成進(jìn)化;大量中小硬件廠商不必從零搭建模型團(tuán)隊(duì),接入這顆通用機(jī)器之魂就能快速賦予產(chǎn)品操作智能。
在數(shù)據(jù)荒漠里,這是一條需要更多耐心、更多工程細(xì)節(jié)、更多跨模態(tài)翻譯的路徑。但這條路一旦走通,就能繞開標(biāo)準(zhǔn)答案的囚籠,讓機(jī)器真正進(jìn)入人世間。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.