henry 發(fā)自 凹非寺
量子位 | 公眾號(hào) QbitAI
機(jī)器人,也開始擁有“觸覺想象力”了。
過去一年,隨著具身基礎(chǔ)模型的快速發(fā)展,機(jī)器人已經(jīng)能完成不少輪廓清晰、位置明確的操作任務(wù)。
可一旦涉及柔性物體、易損物體或密集接觸,機(jī)器人往往就開始力不從“腦”。
![]()
無論是捏起一顆葡萄而不將它捏破,還是抓住一只紙杯而不讓它變形,視覺只能幫助機(jī)器人找到目標(biāo),想要完成任務(wù),機(jī)器人還需要人類與物體交互時(shí)不可或缺的觸覺感知。
也正因?yàn)槿绱耍F(xiàn)在也有越來越多團(tuán)隊(duì)開始將觸覺作為建構(gòu)機(jī)器人大腦的重要模態(tài)。比如,UniTouch、AnyTouch嘗試統(tǒng)一不同傳感器的觸覺表征,F(xiàn)uSe、Tactile-VLA把觸覺送進(jìn)通用策略與VLA,近期的TacImag則開始探索讓機(jī)器人僅憑視覺和本體感覺“想象”觸覺;NVIDIA也推出TacSL等視覺觸覺仿真工具,加速觸覺策略從仿真走向真機(jī)。
但這些路線仍各有邊界:傳感器異構(gòu)讓數(shù)據(jù)難以互通,觸覺理解、生成與動(dòng)作應(yīng)用也往往分散在不同模型中。
最近,UniX AI(優(yōu)理奇機(jī)器人)聯(lián)合浙江大學(xué)、麻省理工、牛津、耶魯以及上海交通大學(xué),發(fā)布最新科研成果UniTac,提出一套統(tǒng)一的跨傳感器觸覺理解與生成架構(gòu),并進(jìn)一步接入VLA,為機(jī)器人補(bǔ)上了“觸覺想象力”。
![]()
(該工作已被ECCV 2026接收)
簡單來說,UniTac讓機(jī)器人獲得了一種未觸先感的能力,可以讓機(jī)器人像人一樣,在真正碰到物體之前,先“想象”出它摸起來是什么感覺,再?zèng)Q定怎么下手。
比如,面對(duì)一個(gè)軟杯,機(jī)器人會(huì)先預(yù)測它受力后的形變,再?zèng)Q定從哪里接觸、該用多大力。
![]()
對(duì)比來看,在未融合UniTac的情況下,VLA就會(huì)將紙杯捏扁。
![]()
這意味著,對(duì)于機(jī)器人來說,觸覺第一次從碰到以后才知道”,變成了碰到之前就能預(yù)測。
而這背后,也對(duì)應(yīng)著具身智能正在補(bǔ)上的一塊重要能力:觸覺。
機(jī)器人為什么需要學(xué)會(huì)“未觸先感”?
如果把過去幾年機(jī)器人基礎(chǔ)模型的發(fā)展,看作一個(gè)不斷把AI錨定到真實(shí)世界(grounding)的過程,那么我們大致可以將其分為三層。
![]()
VLM(視覺-語言模型)完成的是第一層grounding:把抽象的語言概念對(duì)應(yīng)到現(xiàn)實(shí)世界,讓機(jī)器人知道眼前看到的是什么;
VLA(視覺-語言-動(dòng)作模型)再往前一步,把視覺語義和語言指令錨定到動(dòng)作(軌跡),讓機(jī)器人知道在任務(wù)場景時(shí)應(yīng)該規(guī)劃怎樣的軌跡。
可當(dāng)動(dòng)作真正落地到物理世界時(shí),往往還差著第三層grounding——
機(jī)器人必須知道,應(yīng)該怎樣完成這次接觸。
因?yàn)閷?duì)于機(jī)器人來說,“抓取”只是一個(gè)動(dòng)作標(biāo)簽,但現(xiàn)實(shí)里的每一次接觸,卻完全不同。
抓起一塊毛巾,需要判斷哪里更容易捏住,毛巾的材質(zhì)、大小、形狀、表面粗糙程度都會(huì)導(dǎo)致機(jī)器人抓錯(cuò)或抓取失敗;
例如,在未接入U(xiǎn)niTac時(shí),VLA就無法抓起下圖所示的橙色毛巾。
也就是說,真正決定機(jī)器人操作成功與否的,不只是軌跡,而是接觸過程本身。而這,正是當(dāng)前VLA模型面對(duì)柔性物體、易損物體和接觸密集型任務(wù)時(shí)的短板:
動(dòng)作生成缺少對(duì)接觸過程的預(yù)判與理解
完全依賴視覺,機(jī)器人很容易對(duì)外觀相似的物體采用同一套操作策略。而且如果等到接觸發(fā)生后再根據(jù)觸覺反饋修正,紙杯可能已經(jīng)癟了,薯片也可能已經(jīng)碎了。
所以,如果機(jī)器人能夠在真正碰到之前,就已經(jīng)知道未來的觸覺狀態(tài),那么第一次接觸,就會(huì)變得安全得多。
為了實(shí)現(xiàn)這一點(diǎn),UniTac先從大規(guī)模、多傳感器數(shù)據(jù)中學(xué)習(xí)統(tǒng)一的觸覺表征,再根據(jù)視覺信息預(yù)測潛在觸覺狀態(tài),把觸覺從“接觸后的反饋”前移成“接觸前的先驗(yàn)”,并送入VLA。
值得一提的是,這并沒有取代接觸后的實(shí)時(shí)反饋,而是在第一次下手之前,讓機(jī)器人先預(yù)判這次接觸可能帶來的物理后果。
比如,在同樣面對(duì)兩塊看起來差不多的毛巾時(shí),基于UniTac的基礎(chǔ)模型,就能提前預(yù)判毛巾的質(zhì)感、顏色,從而規(guī)劃、完成毛巾的單層抓取動(dòng)作。
接下來,我們具體來看UniTac是怎么做到的。
跨傳感器的理解與生成
為了讓觸覺進(jìn)入基礎(chǔ)模型,UniTac先處理了最難統(tǒng)一的數(shù)據(jù)問題。
觸覺圖像雖然看起來很像RGB圖像,但產(chǎn)生方式卻完全不同。
以GelSight、DIGIT、Duragel等視覺式觸覺傳感器為例,它們本質(zhì)上是通過相機(jī)記錄凝膠受壓后的形變。
![]()
所以,一張觸覺圖像里通常混著兩類信息:一類來自物體,包括硬度、粗糙度、紋理和接觸形變;另一類來自傳感器,包括光照、凝膠狀態(tài)、Marker布局和相機(jī)參數(shù)。
這意味著,同一個(gè)物體,換一種觸覺傳感器,得到的數(shù)據(jù)可能完全不同。模型如果分不清哪些變化來自物體、哪些來自傳感器,就很難實(shí)現(xiàn)跨設(shè)備泛化。
與此同時(shí),過去的觸覺模型大多建立在單一傳感器或小規(guī)模數(shù)據(jù)集上。
比如PHYSICLEAR只有482段觸覺視頻,而整個(gè)社區(qū)其實(shí)已經(jīng)公開了超過40萬段觸覺視頻、160萬幀數(shù)據(jù)。
這就是說,真正的問題并不是沒有數(shù)據(jù),而是這些數(shù)據(jù)長期分散在不同傳感器、不同數(shù)據(jù)集和不同任務(wù)中,無法被統(tǒng)一利用。
為解決這些問題,UniTac把觸覺理解和觸覺生成放進(jìn)同一個(gè)多模態(tài)框架,統(tǒng)一吸收來自不同傳感器的數(shù)據(jù)。
具體來說,UniTac將觸覺拆分成兩個(gè)部分:物理屬性和傳感器配置。
前者描述物體在接觸中呈現(xiàn)出的硬度、粗糙度和紋理等屬性;后者刻畫傳感器的光照、凝膠狀態(tài)、Marker布局和相機(jī)參數(shù)等配置。
而UniTac的整體架構(gòu),就圍繞這兩方面展開。
![]()
理解端,模型同時(shí)學(xué)習(xí)物體屬性描述和傳感器識(shí)別。前一個(gè)任務(wù)讓模型理解表面屬性,后一個(gè)任務(wù)讓模型辨認(rèn)信號(hào)來自哪種設(shè)備。
這里之所以增加傳感器識(shí)別,并非單純多做一道題,它迫使模型區(qū)分,哪些變化來自物體,哪些變化來自傳感器。
從下圖我們可以看到,面對(duì)不同傳感器采集的觸覺視頻,UniTac已經(jīng)能夠圍繞硬度、粗糙度和紋理,生成與接觸材料相符的描述,并能完成屬性比較、物體匹配和極值選擇等推理任務(wù)。
![]()
生成端,UniTac則分兩步訓(xùn)練。
模型先訓(xùn)練觸覺解碼器,學(xué)習(xí)重建真實(shí)觸覺信號(hào);再用Sensor-Aware DiT Projector,將MLLM的語義輸出對(duì)齊到觸覺latent空間,并加入對(duì)應(yīng)的傳感器token。
生成觸覺時(shí),UniTac還改掉了普通生成模型常用的“無條件分支”。
原因很簡單,研究發(fā)現(xiàn)觸覺其實(shí)不存在真正的無條件狀態(tài)。任何一段觸覺信號(hào),都由某個(gè)具體傳感器產(chǎn)生。
因此,UniTac先給定目標(biāo)傳感器未接觸物體時(shí)的狀態(tài),再生成接觸發(fā)生后,由物體屬性帶來的變化。
最后,實(shí)驗(yàn)結(jié)果進(jìn)一步表明,UniTac并非只在某項(xiàng)指標(biāo)上實(shí)現(xiàn)單點(diǎn)領(lǐng)先,而是在觸覺理解與觸覺生成兩端都展現(xiàn)出優(yōu)勢。
在觸覺理解方面,UniTac-7B在PHYSICLEAR-Test上以66.51分領(lǐng)先Octopi等觸覺理解模型,以及BLIP3o等統(tǒng)一模型。
具體的,在屬性—物體匹配任務(wù)中,UniTac-7B取得64.61分,這說明它不僅能識(shí)別軟硬、粗糙度等物理屬性,還能進(jìn)一步判斷觸覺來自哪類物體。
![]()
在觸覺生成方面,UniTac同樣表現(xiàn)優(yōu)異。
面對(duì)Digit、GelSight、GelSight Mini和Duragel四類傳感器,UniTac的平均SSIM和PSNR分別達(dá)到,均取得最佳結(jié)果。
![]()
正是這種穩(wěn)定的跨傳感器生成能力,讓它可以進(jìn)一步為VLA提供觸覺先驗(yàn),幫助機(jī)器人判斷該怎樣更安全地接觸目標(biāo)。
深耕觸覺路線
最后,讓我們再把視角拉回到UniTac背后的團(tuán)隊(duì),優(yōu)理奇機(jī)器人(UniX AI)。
這家全棧式具身智能公司由00后耶魯博士楊豐瑜,于2024年4月創(chuàng)立于蘇州。
![]()
在UniTac論文中,楊豐瑜擔(dān)任共同一作,延續(xù)其在視觸覺方向的技術(shù)路線。
另一位共同一作Jiahang Tu來自浙江大學(xué),研究集中在計(jì)算機(jī)視覺與生成模型;
通訊作者Hanbin Zhao現(xiàn)任浙江大學(xué)助理教授,長期從事機(jī)器學(xué)習(xí)、計(jì)算機(jī)視覺和生成模型研究;來自UniX AI的Zhi Tao,則側(cè)重真機(jī)算法與系統(tǒng)落地。
此外,論文作者還包括牛津大學(xué)的Chenyang Ma、MIT的Xihang Yu、耶魯大學(xué)的Ziyao ZengAlex Wong,上海交通大學(xué)的Shaokai Wu等多位研究者,研究背景覆蓋觸覺表征、生成模型、VLA和真機(jī)操作。
把時(shí)間線往前拉,優(yōu)理奇圍繞觸覺展開的路線已經(jīng)相當(dāng)清晰。
從Touch and Go采集真實(shí)世界的視觸覺數(shù)據(jù),到UniTouch統(tǒng)一多傳感器表征,再到TaRF把視覺與觸覺對(duì)齊到三維空間,團(tuán)隊(duì)始終在推進(jìn)同一件事:讓機(jī)器人從看見物體,走向理解物體該如何被接觸。
最新的UniTac則把這條路線繼續(xù)推向基礎(chǔ)模型,將觸覺理解、生成和跨傳感器遷移納入統(tǒng)一架構(gòu),并把預(yù)測到的觸覺狀態(tài)接入到像VLA這樣的機(jī)器人基礎(chǔ)模型上。
這一步也延續(xù)了優(yōu)理奇一貫的場景驅(qū)動(dòng)思路。
從其產(chǎn)品與技術(shù)演進(jìn)來看,團(tuán)隊(duì)關(guān)心的不只是機(jī)器人“能不能干活”,還包括能否把活干好、干得更穩(wěn)定高效。與其針對(duì)每個(gè)場景微調(diào),不如從真實(shí)任務(wù)的痛點(diǎn)出發(fā),持續(xù)補(bǔ)齊感知、控制與系統(tǒng)能力。
因此,當(dāng)行業(yè)集中攻關(guān)VLA和世界模型時(shí),優(yōu)理奇選擇補(bǔ)上的是機(jī)器人進(jìn)入物理世界時(shí)繞不開的接觸層。
UniTac的意義,正是把不同場景中的接觸問題,沉淀為一種可以跨傳感器復(fù)用、也能參與動(dòng)作決策的基礎(chǔ)能力。
在未來,隨著視覺、觸覺、力覺與動(dòng)作模型進(jìn)一步融合,機(jī)器人有望在家庭護(hù)理、精細(xì)裝配、服務(wù)操作和康養(yǎng)陪護(hù)等場景中,完成更安全、更柔順的接觸操作。
參考鏈接[1]https://arxiv.org/abs/2606.31451
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.