IT時(shí)代網(wǎng)7月15日消息,小米正式發(fā)布并開源Xiaomi-Robotics-U0,一個(gè)擁有380億參數(shù)的多模態(tài)自回歸具身生成基礎(chǔ)模型,打通了機(jī)器人圖片和視頻數(shù)據(jù)的生成與編輯全鏈路,讓具身訓(xùn)練數(shù)據(jù)進(jìn)入大規(guī)模生成時(shí)代。
Xiaomi-Robotics-U0是具身領(lǐng)域首個(gè)統(tǒng)一覆蓋四類核心任務(wù)的生成模型:具身場(chǎng)景生成、具身遷移、機(jī)器人交互視頻生成以及通用文生圖和圖像編輯。過去具身生成往往"一個(gè)任務(wù)一個(gè)模型",各模型相互割裂難以規(guī)模化應(yīng)用。U0采用統(tǒng)一的多模態(tài)自回歸框架,可根據(jù)文本描述為指定機(jī)器人本體生成多視角初始場(chǎng)景,將已有軌跡遷移到新環(huán)境,還能基于初始觀測(cè)和操作指令生成后續(xù)視頻。
為保證生成質(zhì)量,小米設(shè)計(jì)了五維解耦結(jié)構(gòu)化控制范式,從工作區(qū)、前景操作物體、前景無關(guān)雜物、光照、背景五個(gè)維度實(shí)現(xiàn)精準(zhǔn)可控生成,確保多視角幾何一致性、機(jī)械臂位姿不因背景替換而錯(cuò)位。當(dāng)前支持方舟無限、智元G1、智元G2、松靈PiPER四種機(jī)器人本體。
在效率方面,通過FlashAR+推理加速方案,生成效率較原始自回歸范式提升近83倍。在WorldArena評(píng)測(cè)基準(zhǔn)上,Xiaomi-Robotics-U0在全球126個(gè)參評(píng)模型中位列第一。真機(jī)評(píng)測(cè)中,在未知光照、陌生背景等分布外場(chǎng)景下,使用U0擴(kuò)增數(shù)據(jù)訓(xùn)練的策略任務(wù)完成進(jìn)度顯著提升。
相關(guān)代碼與模型權(quán)重已全量開源,開發(fā)者可通過小米機(jī)器人官網(wǎng)獲取。該模型使規(guī)模化生成具身訓(xùn)練數(shù)據(jù)有了可控且高效的解決方案,覆蓋危險(xiǎn)、極端、長(zhǎng)尾等真機(jī)難以觸達(dá)的環(huán)境。
![]()
圖:小米開源Xiaomi-Robotics-U0宣傳海報(bào)
注:本文中包含AI輔助創(chuàng)作的內(nèi)容。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.