自變量機(jī)器人今日發(fā)布HOST 框架(Human-to-robot One-Shot Skill AcquisiTion,人類到機(jī)器人單樣本技能獲取)并開源,能讓機(jī)器人僅觀察一段數(shù)十秒的人類視頻就學(xué)會新技能,同時保留已掌握的技能。
HOST 采用了一種開創(chuàng)性的方法:不去將人類動作翻譯為機(jī)器人動作并試圖模仿,而是讓機(jī)器人先想象執(zhí)行動作后的結(jié)果,再從結(jié)果拆分出需要執(zhí)行的動作。
這種全新方法的效果令人欣喜:機(jī)器人從一段 29 秒人類視頻中學(xué)習(xí)技能的成功率高達(dá) 62%,超越零樣本基線 45%。相比 Pi-0.5 + 微調(diào)方案,HOST 所需數(shù)據(jù)量減少 50 倍,學(xué)習(xí)技能速度提升 500 倍。
模仿人類“觀察學(xué)習(xí)”過程,自動對齊視頻任務(wù)進(jìn)度
HOST 的思路來自認(rèn)知科學(xué)中的“觀察學(xué)習(xí)”理論:人類面對不熟悉的任務(wù)時,不需要通過長期練習(xí)或者窮舉來學(xué)習(xí),而是以先驗?zāi)芰υ诖竽X中模擬動作的預(yù)期效果,然后執(zhí)行相應(yīng)動作。
自變量研究人員受此啟發(fā),將 HOST 的學(xué)習(xí)方案從“訓(xùn)練時微調(diào)循環(huán)”變?yōu)椤巴评頃r技能獲取”,讓機(jī)器人通過觀察人類執(zhí)行任務(wù)來學(xué)習(xí)新技能。
機(jī)器人首先要解決的問題是:如何對齊自己執(zhí)行任務(wù)的進(jìn)度和視頻中的進(jìn)度?
舉例來說:同樣工作 10 秒,視頻中的人可能已經(jīng)切完菜、開始炒菜了,機(jī)器人還在切菜。如果只僅按時間對齊,機(jī)器人就會丟失任務(wù)進(jìn)度。
對此,HOST的做法是“按任務(wù)進(jìn)度對齊”。HOST 會將視頻每一幀和機(jī)器人操作每一步都轉(zhuǎn)化為同一向量空間里的向量;然后利用“動態(tài)時間規(guī)整”算法,自動對齊“人類視頻的第 X 幀和機(jī)器人操作的第 Y 步”。如此一來,機(jī)器人執(zhí)行到每一步時,看到的永遠(yuǎn)都是和任務(wù)進(jìn)度對齊的那一幀。
憑借這種方法,HOST 將對齊任務(wù)進(jìn)度的時間誤差降低了一個數(shù)量級,能夠做到機(jī)器人執(zhí)行與視頻示范的精準(zhǔn)同步。
機(jī)器人不再模仿人類動作,而是從動作結(jié)果反推過程
機(jī)器人學(xué)習(xí)人類經(jīng)驗的第二個難點(diǎn)在于:機(jī)器人身體結(jié)構(gòu)與人完全不同,無法簡單跟隨視頻“照著做”,需要找到一種動作的翻譯方式。
機(jī)器人的構(gòu)型千奇百怪,如何找到一套通用解法?HOST 規(guī)避了“對照身體結(jié)構(gòu)”的問題,分為三步解決:
首先,機(jī)器人需要判斷自己進(jìn)行到任務(wù)的哪個部分。其次,機(jī)器人需要將人類執(zhí)行完動作的畫面翻譯成機(jī)器人自身視角和身體結(jié)構(gòu)的畫面。舉例來說,機(jī)器人看到人類拿起一杯水,就要想象出機(jī)器人拿起水杯的畫面。最后,機(jī)器人從畫面推斷出需要執(zhí)行的動作,并執(zhí)行這些動作。
這個解法的優(yōu)勢在于,它利用“看到人類動作結(jié)果-想象出機(jī)器人動作結(jié)果-拆解結(jié)果對應(yīng)的機(jī)器人動作”的思路,讓機(jī)器人利用視覺推理看到結(jié)果畫面,再反推動作過程,而不是機(jī)械地模仿人類動作,從而繞開了“動作映射”的問題。
![]()
模型訓(xùn)練兩步走:先預(yù)測機(jī)器人動作,再遷移到人類教學(xué)
HOST 的核心部分是一個帶有視覺預(yù)測功能的級聯(lián)策略模型。它采用雙專家 MoT 架構(gòu),如同兩個分工明確的大腦:“視覺大腦”(視頻專家)專門處理視頻畫面、定位任務(wù)進(jìn)度、預(yù)測未來圖景;“動作大腦”(動作專家)負(fù)責(zé)將預(yù)測圖景轉(zhuǎn)化為需要執(zhí)行的動作,并控制執(zhí)行。
在訓(xùn)練模型時,自變量團(tuán)隊將訓(xùn)練過程拆分為“同體預(yù)訓(xùn)練”和“人機(jī)視頻訓(xùn)練”兩個階段。在同體預(yù)訓(xùn)練階段,機(jī)器人通過學(xué)習(xí)機(jī)器人自身執(zhí)行任務(wù)的視頻,學(xué)會預(yù)測完成任務(wù)后的狀態(tài),并生成對應(yīng)動作。在人機(jī)視頻訓(xùn)練階段,機(jī)器人進(jìn)一步學(xué)習(xí)人類演示視頻,將人類執(zhí)行任務(wù)的過程轉(zhuǎn)化為機(jī)器人視角下的任務(wù)結(jié)果,再根據(jù)目標(biāo)結(jié)果推理完成任務(wù)所需的動作,實現(xiàn)從人類示范到機(jī)器人技能的遷移。
如此分兩步訓(xùn)練的優(yōu)勢在于:人與機(jī)器人執(zhí)行同一任務(wù)的匹配數(shù)據(jù)相對稀缺,機(jī)器人執(zhí)行任務(wù)的視頻與軌跡則容易采集得多。先觀看機(jī)器人視頻打好“基本功”,再遷移到人類視頻學(xué)習(xí),能大幅提升數(shù)據(jù)訓(xùn)練模型的效率。
學(xué)習(xí)新技能成功率高達(dá) 62%,較主流方法提速 500 倍
HOST 模型的權(quán)重在訓(xùn)練好后即凍結(jié),僅在推理過程中觀看視頻和復(fù)現(xiàn)技能。盡管全部學(xué)習(xí)素材只有一段視頻,它的學(xué)習(xí)效果仍令人感到欣喜:
僅觀看一段平均 29 秒的人類視頻,HOST 復(fù)現(xiàn)技能的成功率高達(dá) 62%。相比之下,Vid2Robot/AWDA 同樣從一段視頻中學(xué)習(xí)技能,成功率僅有 19%。如果采用微調(diào)模型的方法,給 Pi-0.5 示范 50 個機(jī)器人任務(wù)并花 4 小時微調(diào)訓(xùn)練,成功率也僅有 38%。
相比 Pi-0.5 + 微調(diào)方案,HOST 僅需 1/50 的數(shù)據(jù)樣本量和 1/500 的學(xué)習(xí)時間,就能讓成功率大幅提升 24%,成為當(dāng)前表現(xiàn)最好的機(jī)器人技能學(xué)習(xí)方案。
![]()
不僅如此,HOST 還能最大限度地保留已經(jīng)學(xué)習(xí)的技能,因為它僅根據(jù)視頻來復(fù)現(xiàn)技能:視頻更像是“菜譜”,可以放入書架隨時調(diào)取。如此便實現(xiàn)了技能的持久化記憶和聯(lián)想機(jī)制。相比之下,Pi-0.5 + 微調(diào)方案學(xué)習(xí)新技能后,過去技能的保留率僅有 17%。
在泛化性方面,HOST 測試了 50 個包含不同物體、工具和基本動作的任務(wù),均學(xué)習(xí)到新技能。在魯棒性方面,HOST 面對改變光照、替換物體、替換場景和移動物體等干擾,成功率仍全部保持在 50% 以上。即使中途把物品挪走,HOST 也能調(diào)整回來繼續(xù)任務(wù)。這說明 HOST 不是在“死記硬背”動作序列,而是真正理解任務(wù)、動態(tài)規(guī)劃下一步動作。
普通人也能教授新技能,機(jī)器人邁向靈活學(xué)習(xí)新階段
簡單來說,HOST 將機(jī)器人學(xué)習(xí)技能的范式從“訓(xùn)練時微調(diào)循環(huán)”改變?yōu)椤巴评頃r技能獲取”。它僅從一段數(shù)十秒的人類視頻去學(xué)習(xí)技能,成功率則遠(yuǎn)超主流模型經(jīng)過后訓(xùn)練微調(diào)的效果。不僅如此,HOST 還能隨時調(diào)取技能,解決了“災(zāi)難性遺忘”的問題。
對此,自變量機(jī)器人團(tuán)隊表示:“在具身智能走出實驗室、走進(jìn)千家萬戶的進(jìn)程中,不應(yīng)該只靠專業(yè)人員采集數(shù)據(jù)、反復(fù)訓(xùn)練來獲得新技能。人與人之間通過示范傳遞技能,是更加自然高效的學(xué)習(xí)方式。HOST 將技能獲取從少數(shù)人的專業(yè)流程,轉(zhuǎn)變?yōu)槿魏稳硕寄苡靡欢我曨l完成教學(xué)。
目前,HOST 的研究論文和代碼已經(jīng)全部開源。未來機(jī)器人在家庭勞動時,有望擺脫專業(yè)化的數(shù)據(jù)采集和訓(xùn)練過程,通過直觀的人類演示就學(xué)會新技能。這將讓智能機(jī)器人成為真正貼心可用的“家庭伙伴”,讓智能機(jī)器人服務(wù)人類的每一天。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.