在近日的具身智能頂會 RSS(Robotics: Science and Systems)2026 上,最高獎項 Outstanding Paper Award 提名名單里,出現了一個不太 “機器人” 的名字 —— 影眸科技,一家頭部 3D 生成大模型公司。
這家公司為外界熟知,大多是因為它在 3D 生成領域的硬核實力:基于團隊發布的原生 3D 大模型框架 CLAY(提名 SIGGRAPH2024 最佳論文),影眸在 2024 年推出了全球首個原生 3D 大模型產品 Hyper3D,如今該產品已出現在今年英偉達 CES Keynote 、OpenAI 首屆黑客松冠軍項目等多個全球技術標桿場景的 3D 資產生成工作流里,其企業客戶規模位居行業第一。
但影眸科技的研究和布局,并不止于生成。在具身智能方向,Hyper3D 的 Sim-Ready 功能可以一鍵為 3D 資產賦予重力、摩擦力等真實物理屬性,無縫導出到 Isaac Sim 等仿真環境,已經成為具身團隊訓練「空間智能」的核心資產來源之一。今年 7 月,影眸科技在具身應用領域再進一步,聯合地瓜機器人、謀先飛發布了 “具身智能可訓練仿真閉環聯合解決方案”,其世界生成模型 Hyper3D WorldGen 基于自研原生 3D 大模型 Hyper3D Rodin 與 CAST 框架(SIGGRAPH2025 最佳論文)實現了僅憑單張照片還原可交互三維場景,場景內的 3D 物品均為原生 Sim-Ready 資產,具備物理屬性,可直接用于仿真訓練,打通從真實影像到具身可訓練場景的端到端鏈路。
資產 Sim-Ready 之后,一個更尖銳的問題隨之而來:如果仿真里訓練出的策略,一到真實世界成功率就大幅下降、不具備部署價值,那仿真資產的價值又在哪里?
影眸團隊用這篇研究成果給出了自己的答案。
![]()
影眸Hyper3D合伙人、物理 AI 事業部負責人 Joel Wang 作為共同一作、影眸科技作為署名單位參與完成的論文《cuNRTO: GPU-Accelerated Nonlinear Robust Trajectory Optimization》入圍了 RSS 2026 的最高獎項 Outstanding Paper Award 提名。
- 論文鏈接:https://www.roboticsproceedings.org/rss22/p102.pdf
- 項目主頁:cunrto.deemos.dev
![]()
此前十余年,RSS 的最高論文獎項長期由全球頂尖高校和實驗室占據,中國大陸機構與企業團隊進入候選名單的案例屈指可數。今年共有 8 篇論文獲得提名,其中僅兩篇成果包含由國人團隊創立的商業公司的核心參與,分別是影眸科技和銀河通用。
這篇論文回答的,正是上面那道「從仿真到現實」的必答題:在充滿誤差與擾動的真實物理世界里,如何讓具身更快地算出安全的動作。它把非線性魯棒軌跡優化的核心計算搬上 GPU,在獨輪車、四旋翼和 Franka 機械臂任務中實現最高139.6 倍加速,同時保持100%的安全約束。
從生成 Sim-Ready 的 3D 資產,到讓仿真中訓練出的智能走向 Real-World Ready,這是影眸研究版圖上關鍵而必然的一步。
仿真不必完美,策略要對不完美有所準備
![]()
具身在仿真里學會的每一個動作,都建立在一個隱含假設上:世界會按模型訓練時的環境那樣運轉,但真實世界絕不是如此。真實機器人面對的不是一個和仿真完全一致的物理世界,摩擦、控制誤差和外部擾動始終存在。
行業的傳統直覺是不斷提高仿真精度,讓模擬器盡量接近現實。但這條路有一條殘酷的漸近線,現實中的摩擦、接觸、材料屬性、執行誤差不可能被完整復刻,Sim-to-Real Gap 是仿真訓練真正落地繞不開的問題。
cuNRTO 選擇了另一條路,解決 Sim-to-Real,不一定要等待一個完美的 Simulator,也可以讓策略對 Simulator 的不完美具備魯棒性。
「仿真的上限,不只取決于它能多真實,也取決于策略能否承受它不真實的部分。」Joel Wang 說。
這在技術上對應控制領域一個經典方向 — 魯棒軌跡優化(Robust Trajectory Optimization)。思路可以用一句話概括:既然擾動無法被精確預測,那就把能夠被界定的模型誤差與外部擾動,顯式表示為一個有界的結構化不確定性集合(uncertainty set),然后在規劃階段提出硬性要求。對集合內的每一種可能擾動,軌跡都必須滿足全部安全約束:避障、關節限位、力矩上限,一個都不能違反。
換句話說,這是一種最壞情況保證(worst-case guarantee)。相比只能給出概率性保證的隨機方法,它對機械臂操作、飛行器避障這類安全攸關場景更為根本。而且求解的產物不只是一條名義軌跡,還有一組隨時間變化的反饋增益 — 機器人在執行中一旦被擾動帶偏,可以依據實時估計的擾動即時糾偏。
聽起來很美好,但有一大難題:這類問題,此前根本算不動。
從 8 個小時到 218 秒:算不動的魯棒優化,是怎么被搬上 GPU 的
為什么算不動?直覺層面,「對所有擾動都成立」意味著無窮多條約束 — 不確定性是連續取值的,無法逐一枚舉,問題在原始形式下不可解。
此前的 NRTO(Nonlinear Robust Trajectory Optimization)框架給出了一條可行路徑:外層對非線性動力學和約束做逐次線性化(successive linearization),內層通過魯棒約束重構,把無窮多條約束轉化為有限個二階錐規劃(SOCP)約束,再用交替方向乘子法(ADMM)求解。這套框架在理論上足夠優雅,非線性動力學、非線性約束都能處理。
但工程上,它撞在了一堵墻上,SOCP 子問題依賴內點法(Interior Point Method)求解。內點法精度高,卻是一種以大規模矩陣分解為核心的串行算法,每次迭代都要重新分解一個隨問題規模膨脹的 KKT 系統。系統維度一高、約束一多,計算量爆炸式增長。
論文給出的基線數據非常直觀,一個帶五個障礙物的獨輪車(unicycle)任務,原始 NRTO 要算30423 秒— 超過 8 個小時;四旋翼任務也要 13374 秒。這樣的速度,魯棒優化只能停留在論文里,談不上任何部署價值。
與此同時,從剛體動力學梯度并行化,到實時非線性 MPC,把優化搬上 GPU 已是明確趨勢。麻煩在于,NRTO 的原始結構,嵌套雙層循環加串行內點法,天然不適合并行。
cuNRTO 的貢獻,就是通過兩次算法層面的架構重構,把這套串行算法改寫成 GPU 友好的形態。
第一步:NRTO-DR,用算子分裂替換內點法。
![]()
NRTO-DR 架構圖
直覺上,這一步做的事情是把一個龐大而串行的求解器,拆成大量小而獨立的基本計算操作。
具體而言,團隊用經典的 Douglas-Rachford 分裂方法重寫了內層最昂貴的 SOCP 子問題,將其分解為兩類操作。其一是稀疏線性求解,由于內層迭代中 KKT 系統的系數矩陣保持不變,只需做一次 Cholesky 分解,之后每次迭代復用三角求解,直接推翻了內點法「每步重新分解」的成本結構。其二是二階錐投影,把一個點投影到二階錐上只有三種幾何情形,且每條約束的投影彼此完全獨立,是典型的可大規模并行問題。
GPU 實現上,稀疏分解與三角求解交給 cuDSS,錐投影由定制 CUDA kernel 完成。每條約束映射到一個 warp,向量運算通過 cuBLAS 全程留在設備端。
效果立竿見影:無障礙獨輪車任務從 30423 秒降到 1934 秒。
但團隊在 profiling 時發現了新的瓶頸,43.5% 的運行時間花在 CPU 與 GPU 之間的同步上,真正的錐投影計算只占 11%,GPU 平均利用率僅 34.9%。算法快了,數據卻在 GPU 與主機之間來回搬運,把省下的時間又還了回去。
第二步:NRTO-FullADMM,整個內循環搬進 GPU。
![]()
NRTO-FullADMM 架構圖
這是論文真正的核心創新。它不再滿足于替換子求解器,而是重構了內層 ADMM 本身的分塊結構,通過引入新的松弛變量,把二階錐投影直接「壓」進 ADMM 的第一個更新塊 — 原本需要嵌套一層 DR 求解器才能完成的事,變成了 ADMM 迭代中的一步原生投影,嵌套結構被抹平了。
由此帶來關鍵的工程紅利是,整個內循環可以完整跑在 GPU 上。每個外層線性化迭代只需向 GPU 上傳一次約束數據與常量算子,之后的仿射求值、并行錐投影、QP 更新、反饋增益、對偶更新與殘差檢查,全部在設備端完成,直到收斂才把結果傳回。
GPU 到主機通信瓶頸被徹底消除,GPU 平均利用率從 34.9% 提升至86.5%
速度提了兩個數量級,安全一分沒讓
![]()
使用 cuNRTO 規劃 Franka 機械臂軌跡
論文在獨輪車、四旋翼和 7 自由度 Franka 機械臂三類系統上做了系統評測,對時間步長、不確定性水平、障礙物數量三個維度分別做了實驗。幾組關鍵數字:
- 獨輪車五障礙任務:30423 秒 →218 秒,加速139.6 倍
- 四旋翼五障礙任務:13374 秒 → 200 秒,加速 66.9 倍;
- Franka 機械臂(14 維狀態、7 維力矩輸入,包含關節限位、速度限制、力矩邊界與避碰約束):3949 秒 → 152 秒,加速 25.9 倍。
更重要的是,所有加速都沒有以安全為代價。通過 1000 次隨機擾動采樣,加上 1000 次專門探測不確定性集合邊界的極端用例,合計 2000 次 Monte Carlo rollout 驗證:在考慮線性化誤差的設定下,所有任務、所有擾動實現均保持100% 約束滿足。三種求解器的最優目標值差異不到 0.5%,但速度提升兩個數量級,解的質量沒有退化。
這項工作的核心,是同時處理速度和魯棒性,而不是用安全換速度。
![]()
![]()
值得一提的是,論文還在 Robotarium 平臺上完成了真機驗證,擾動集合直接從開環執行的殘差中估計,NRTO 輸出的反饋策略在線估計擾動、實時糾偏,最終穩定駛入目標區域。而只執行名義控制序列的對照組,出現了肉眼可見的漂移。
擾動不必被精確建模,只需被界定;世界不必完美,策略只需對不完美有所準備。這套方法論在真實硬件上跑通了完整閉環。
據了解,團隊正在與英偉達進一步推進 GPU 側優化,目標是把相關計算繼續壓縮至毫秒級。一旦達成,魯棒優化將不再只是離線規劃工具,而是具備在線控制能力的實時組件。
一家 3D 生成公司,憑什么入圍具身頂會最佳論文?
![]()
![]()
回到開頭的問題:一家 3D 生成公司,為什么要下場做機器人控制?
把影眸Hyper3D近幾年的研究工作擺在一起,答案會自己浮現:
- CLAY(SIGGRAPH2024 最佳論文提名):原生 3D 生成基礎模型,解決三維物體如何生成;
- DressCode(SIGGRAPH2024 最佳論文提名):自回歸 3D 生成架構探索;
- BANG (SIGGRAPH2025 Top 10 技術論文速覽):通過生成式方法理解物體內部結構、實現 3D 資產遞歸分件,解決物體結構如何理解和拆解;
- CAST(SIGGRAPH 2025 最佳論文):從單圖重建包含物體關系與物理約束的完整 3D 場景,解決完整場景及物理關系如何重建;
- cuNRTO(RSS 2026 最佳論文提名):解決智能體如何在存在不確定性的環境中安全行動。
生成物體 → 理解結構 → 構建場景 → 在物理場景中行動。這不是四篇孤立的論文,而是同一張研究版圖上環環相扣的四塊拼圖,也對應著影眸正在打通的業務閉環,Hyper3D 的 Sim-Ready 功能為具身智能持續生產可仿真的 3D 資產,cuNRTO 則在探索讓基于這些資產訓練出的智能真正走向 Real-World Ready。影眸的定位也變得清晰:它正在成為連接生成世界、仿真世界與真實世界的 3D 智能基礎設施。
支撐這張版圖的,是一個在創業公司里相當罕見的全球頂級科研團隊。影眸Hyper3D是業內唯一連續多年獲得 SIGGRAPH 最佳論文及提名的商業公司,算法團隊每 2 人中就有 1 人獲得或被提名過頂會最佳論文,約 70% 的科研成果實現了產品轉化。
這種研究密度今年還在加碼,SIGGRAPH 2026 上,影眸共有 6 篇論文被接收 — 對一家 60 人的創業公司而言,這是足以對標全球頂級實驗室的產出。
![]()
團隊在大會現場設了展位,演示 Hyper3D 的實時生成,人流幾乎沒斷過,其中相當一部分是 Hyper3D 的老用戶,圍上來當面提需求、給反饋。
![]()
同一個會場里,論文在講臺上被宣讀,產品在展臺前被用戶圍住,這無疑是「研究即產品」這條路線最具象的畫面。
![]()
在影眸Hyper3D,研究者擁有真正的問題定義權,可以探索不直接服務于短期產品版本的長期問題。研究與產品不是兩套割裂的體系,CLAY、BANG、CAST 最終都進入了產品與產業場景,多位核心研究者本身就是公司合伙人和核心決策者。身兼創業者與一線研究者的 Joel Wang,正是其中之一。
「這次提名當然是對論文的認可,但對我們更重要的是,它再次證明影眸有能力支持非常前沿、甚至不直接服務于短期產品版本的研究。我們希望影眸最終成為一支真正理解三維世界、也能夠持續定義前沿問題的 Research Lab。」Joel Wang 說。
從 SIGGRAPH 到 RSS,從圖形學到機器人學,一個判斷正在變得清晰:影眸正在從一家 3D 生成模型公司,成長為一個覆蓋 3D 表示、生成、理解、場景構建與智能體控制的研究團隊,這些工作共同指向未來三維物理世界的建模、理解與交互。
當具身智能的敘事聚焦于本體與大模型時,不容忽視的是,具身能否走進充滿干擾、摩擦與誤差的現實世界。而在具身走向現實世界的關鍵一步上,像影眸這樣連接生成、仿真與現實世界的 3D 智能基礎設施將會是不可或缺的。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.