面對任務鏈長、環境不確定、誤差易累積且需精細接觸與自主糾錯的復雜操作,現有方案難以兼顧"理解"與"預判"。Gravity 給出一套面向長程、復雜、可泛化機器人任務的統一具身智能框架:以 MoT(Mixture-of-Transformers)為骨架,融合 VLM 的指令與場景理解、任務推理,以及世界模型對未來狀態的預測與子目標評估;同時引入觸覺/力覺、先驗知識(Priors)、多模態子任務過程監督、任務階段與完成度(Stage/Progress)輸出及短長期記憶模塊,并由強化學習驅動真機部署后的持續自進化。一句話概括:會理解,更會預判與生成;訓練時把世界學透,推理時以極簡鏈路實時行動;部署之后,越用越強。
![]()
▲Gravity 框架總體架構示意
六大技術特點
1.雙腦融合:理解與生成一體化的基座模型
業內主流路線存在割裂:VLA 具備場景理解、指令遵循與動作生成能力,但對環境動態與動作長期后果建模不足;WAM 能模擬未來變化,卻缺乏高層語義理解與任務規劃。Gravity 構建 AR Transformer 與 Diffusion Transformer 協同的"雙腦融合"架構:AR Transformer 作為認知決策中樞,理解指令、識別語義、解析目標,并將復雜任務分解為可執行的階段與子任務;Diffusion Transformer 負責動態推演與動作生成,通過預測未來狀態分布模擬動作影響、評估結果,提前識別碰撞、滑落、遮擋、抓取失敗等風險。兩者在任務語義、環境狀態與動作表征層面深度耦合,使機器人在執行前對多種候選策略進行內部模擬與風險評估,形成"感知—理解—規劃—推演—執行"閉環。由此機器人從"看到什么就做什么"升級為"先想清楚再行動",顯著提升長流程、多約束、高風險作業的成功率,適用于精密裝配、復雜分揀、柔性制造、設備操作等場景。
2.深認知,快行動:多維表征學習,精簡動作推理
訓練階段,模型借助 3D 空間結構、Flow、可供性、語義、動力學、物理屬性、場景圖等多維中間表征,從幾何、運動、功能、關系與物理規律多層面理解環境,提高監督密度、減少捷徑學習,提升復雜任務的能力上限、泛化性與魯棒性。推理階段,這些表征不再顯式生成,而作為隱式知識服務于動作決策:關閉非必要解碼分支,省去中間結果后處理與傳輸,只輸出動作與任務進度,從而縮短推理路徑、降低算力顯存成本、提升控制頻率與實時性。其本質是能力與效率的解耦——能力在訓練中做加法,延遲在推理中做減法。這一"訓練重、推理輕"設計已率先由 Gravity 4D(基于 Diffusion Transformer 的 4D WAM)落地并獲實驗驗證。
3.觸覺與力覺:從時空幾何建模走向物理交互建模
僅靠視覺的 4D 模型能描述幾何、運動與形變,卻難以感知質量、剛度、摩擦與接觸穩定性。Gravity 把觸覺與力覺視為一等模態,使模型從"觀察世界"走向"通過交互理解世界",升級為視覺—觸覺/力覺協同的物理交互智能。
4.任務意識 + 分層記憶:為長程任務而生
長程任務的關鍵在于持續理解"當前處于哪個階段、已完成什么、下一步做什么、異常后如何恢復"。傳統端到端模型缺乏顯式任務狀態,易出現步驟遺漏、重復操作、階段切換錯誤或異常后無法繼續。為此,Gravity 引入顯式 Stage/Progress 狀態機制,持續輸出任務階段與完成進度,實時判斷子任務是否完成、是否滿足切換條件、是否偏離目標、是否需暫停重試或回退,使任務進度成為可觀測、可解釋、可干預的結構化信息。
在此基礎上構建與任務時間結構匹配的分層記憶:**短時記憶(秒級)**由 Diffusion Transformer 生成,描述近期觀測、動作軌跡、物體運動趨勢與接觸狀態,幫助理解連續動作的因果關系,將割裂的靜態圖像轉化為具速度、方向、慣性的連續動態過程;**長期記憶(數秒至數分鐘)**由 AR Transformer 生成,記錄任務目標、執行階段、關鍵事件、歷史決策與異常原因等語義信息,跨越多個動作片段維持任務上下文。短時記憶解決"最近發生了什么、當前動作是否有效",長期記憶解決"為什么執行、完成到哪、下一階段是什么",兩者與 Stage/Progress 協同,支持局部重試、步驟回退、策略切換或請求人工介入,實現長流程作業的穩定、可控、可解釋與可恢復,并天然適配制造執行、倉儲調度與人機協作等系統。
5.機器人 Skill:注入專家知識,少數據冷啟動,安全可控
Gravity 顯式引入 Robot Skill 與先驗知識注入,支持將操作手冊、工藝規范、專家示范、標準作業程序、技能庫、約束條件與安全規則納入訓練與推理,使模型以行業經驗為基礎在明確規則下學習與執行。Robot Skill 將復雜操作封裝為標準化、可復用、可組合的能力單元,上層按任務與現場狀態選擇組合,形成模塊化、可解釋的執行體系;專家知識用于定義技能適用條件、成功標準與異常處理,避免只顧完成而忽視工藝與安全。進入新場景時可用少量示范結合既有技能與先驗快速適配,降低數據與訓練成本,并在不同本體、工位間遷移復用。Gravity 由此實現"少數據、快泛化"與"有邊界、可審計、能管控"。
6.部署即進化:越用越強
傳統模型采用"離線訓練、一次部署"的靜態模式,上線后難以自動沉淀經驗,高價值數據無法轉化為能力。Gravity 通過 Evaluation Model 與強化學習,建立"部署—反饋—評估—數據沉淀—再訓練—再部署"的持續進化閉環。真實環境中每次成功、失敗、人工接管與專家糾正都被結構化記錄,由 Evaluation Model 從完成度、動作穩定性、工藝質量、執行效率與安全合規等維度自動評估。成功樣本提煉高質量軌跡與有效技能組合,強化最佳實踐;失敗樣本定位失敗階段并分析其與感知誤差、規劃偏差、動作執行、環境變化或安全約束的關聯;專家糾正動作信息密度高,可快速修正長尾場景的行為偏差。通過離線強化學習、偏好學習、失敗樣本重加權與針對性再訓練,將運行經驗持續轉化為更優策略,使部署現場從能力使用端變為數據生產端與迭代驅動端。隨著規模擴大,跨工位、設備、場景的經驗在安全隔離與質量篩選下匯聚,形成跨場景經驗復用與能力遷移。使用越久、覆蓋越廣,應對長尾與復雜工況的能力越強,最終形成由真實數據、行業知識、技能資產與反饋閉環構成的持續復利優勢與技術壁壘。
結語:一個統一框架下的具身智能
理解、預判、行動、記憶、先驗、進化——六者在 Gravity 中被統一進同一套 MoT 雙腦架構,其目標始終一致:讓機器人在真實世界中真正干活,真正產生客戶價值。目前 Gravity VLA 與 Gravity 4D WAM 作為部分模塊已率先落地,我們將持續推進完整 Gravity 系統的構建,并在后續發布更多進展。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.