![]()
今年的 CVPR 在丹佛落幕,在已揭曉的獎項中,華人研究者拿下了 Best Paper 的第一作者席位,兩篇 Honorable Mention 的核心作者群同樣以華人為主體。 15 篇候選中,12 篇有華人研究者深度參與,華人作者總數超過 80 人。年度趨勢有三個關鍵詞:
3D 更易摘獎。從生成(TRELLIS.2)、重建(D4RT、VGGT-Ω)到數據集(3DReflecNet),再到通用分割(SAM 3D),3D 視覺已經占據了 CVPR 2026 最受關注的位置。Gaussian Splatting、前饋重建、4D 動態場景成為三條同時在奔跑的技術路線。
Diffusion 無處不在。生成模型的影響力早已溢出圖像生成的狹義定義,它滲透進了散景渲染(MagicBokeh)、圖像編輯(ChordEdit)、推理加速(SeaCache),乃至 3D 生成(TRELLIS.2)。本屆 15 篇候選中,至少有 6 篇與 Diffusion 相關。
小團隊仍有機會。Lord Sen 的 Mapping Networks 來自 NIT Rourkela——一所印度國家理工學院,作者只有兩人,其中第一作者還是本科生。Liangsi Lu 的 ChordEdit 來自廣東工業大學。這提醒我們 CVPR 的評審機制并未完全向資源優勢機構傾斜,足夠新穎且嚴謹的學術貢獻依然可以脫穎而出。
D4RT 摘得 Best Paper:華人研究者在 3D/4D 視覺賽道集體爆
Best Paper D4RT 來自 Google Deepmind,DeepMind 官方博客將其定性為"讓 AI 以四維方式認知世界的突破"。D4RT 的 一作 Chuhan Zhang 是 Google DeepMind 研究科學家,團隊來自 Google DeepMind、UCL、牛津大學,華人作者還包括 Shuyang Sun、Junyu Xie(牛津實習生)、Junlin Zhang。
D4RT(Dynamic 4D Reconstruction and Tracking)的核心方法,是用一個統一的前饋 Transformer 模型,同時解決動態場景的深度估計、相機參數恢復與時空對應關系。三個過去被拆開處理的子任務,被整合進了一套端到端系統。
其關鍵創新在于 Independent Querying Mechanism:不同于傳統的逐幀稠密解碼方式,D4RT 讓模型以任意時空點為 Query,靈活指出 3D 位置,從而規避了繁重的逐幀計算。相比此前最優方法,D4RT 推理速度快出 18 至 300 倍,在 TAPVid-3D 等多項基準上刷新紀錄。
![]()
兩篇 Honorable Mention 分別來自 Meta Superintelligence Labs 和 NVIDIA。
SAM 3D 來自 Meta Superintelligence Labs,由 Piotr Dollár、Georgia Gkioxari 和 Jitendra Malik 三位大牛領銜,AuthorList 讀起來幾乎就是 Meta AI 華人研究者的點名冊:Xingyu Chen、Hao Tang、Weiyao Wang、Xiang Li、Aohan Lin、Jiawei Liu、Ziqi Ma、Bowen Song、Xiaodong Wang、Jianing Yang、Bowen Zhang、Fu-Jen Chu,12 人中大部分是華人,含多名來自中國頂校的實習生。人工在環的數據標注流水線 + 合成預訓練與真實場景對齊的多階段訓練框架,讓 SAM 3D 在真實世界物體 3D 重建的人類偏好測試中,以至少 5:1 的勝率超越近期工作。
NitroGen 的 Motivations 簡單粗暴:互聯網上堆積著數十億小時的游戲錄像,這些數據幾乎沒有被系統性利用。能不能像 GPT 學語言一樣,讓模型從游戲視頻中學會玩游戲?NVIDIA 聯合 Stanford、Caltech 給出了回答:40,000 小時的跨 1000+ 款游戲訓練數據,一個統一的視覺—動作基礎模型(Vision-Action Foundation Model),以及 52% 的遷移學習提升率。三位共同一作分別來自:NVIDIA 研究院的 Linxi Jim Fan(Caltech/NVIDIA)、斯坦福的 Anas Awadalla,以及來自 Caltech 的博士生 Guanzhi Wang——他同時也是 Voyager 和 MineDojo 的作者,是具身領域少有的、在多項代表性工作上持續貢獻的年輕研究者。
![]()
![]()
02 華人研究者版圖:海外科技公司與國內高校并行
以機構為統計口徑,Meta AI 以 12+ 位華人作者高居榜首,SAM 3D 幾乎是一個華人研究者的聚集工作。NVIDIA 以 8-9 人位列第二,橫跨 PixelDiT(生成模型)和 NitroGen(具身智能)兩個賽道。Google DeepMind 的 4 位華人作者貢獻了今年的 Best Paper。Microsoft Research Asia 則通過 TRELLIS.2,展示了 MSRA 在 3D 生成方向持續深耕的成果。
在國內高校中,清華大學以約 9 名華人作者的參與體量高居首位,涉及 ViT3、TRELLIS.2 和 MIA 三篇工作,是貢獻最多的單一中國高校。BUPT(北京郵電大學)以 7 人參與 MIA 一文,體現出其在 AI 安全方向的深厚積累。CUHK-Shenzhen(香港中文大學深圳校區)的 7 位華人作者全部集中在 3DReflecNet 這一工作上。
純學術路徑產出的作品往往有更扎實的理論基礎:ViT3(清華)、TRELLIS.2(清華+MSRA)、3DReflecNet(CUHK-SZ)、MIA(BUPT+清華)均屬此類。公司內研則更善于整合大規模計算資源和數據,三篇獲獎作品(D4RT、SAM 3D、NitroGen)全部出自美國頂級科技公司內研團隊。產學聯合實習路徑已成為重要的第三極:PixelDiT(UR 博士實習 NVIDIA)、TRELLIS.2(清華博士實習 MSRA)、MagicBokeh(SIAT 實習 vivo)均是在實習期間產出的頂會成果。
![]()
從三維世界建模到視覺智能體
![]()
Best Paper Finalists 現場公布圖
每年 CVPR 的 Best Paper Finalists 都像是一張切片。它未必完整覆蓋計算機視覺領域最熱門的方向,卻往往能夠揭示研究界正在重新思考哪些基礎問題。觀察 CVPR 2026 的 15 篇 Best Paper Finalist,可以看到一個明顯變化:視覺研究的關注點正在從單一任務的精度提升,轉向更加完整的系統問題。這 15 篇論文大致可以歸入四條主線:三維視覺與空間智能、生成模型的架構重構與推理加速、高效學習與評測反思,以及多模態 Agent。它們共同回答了一個更大的問題:當視覺模型已經擁有較強的感知與生成能力,下一步究竟應該向哪里演化。
![]()
3D 更易摘獎:視覺模型開始真正進入空間
15 篇候選論文中,有 5 篇直接圍繞 3D 展開。無論從論文數量還是獲獎結果來看,三維視覺都是今年最清晰的一條主線。這并不只是一次熱點輪動,而是視覺模型能力邊界的一次系統性擴展。過去的 3D 視覺更多被視為計算機視覺中的專門分支,研究者圍繞深度估計、點云生成、多視角匹配和相機位姿展開工作。如今,3D 表示正在從任務輸出變成基礎能力。
![]()
D4RT Moedel Overview
D4RT 和 VGGT-Ω 所代表的前饋式重建路線,正在壓縮傳統三維視覺中冗長的處理鏈路。相機參數、深度、空間對應關系和動態軌跡,不再依賴多個模塊逐步優化,而是可以在統一模型中直接預測。D4RT 進一步將問題推進到動態場景:模型不僅要恢復幾何結構,還要理解物體如何隨時間運動。靜態重建回答的是物體在哪里,動態重建回答的是世界正在如何變化。對于機器人、自動駕駛、增強現實和世界模型而言,后一個問題顯然更加接近真實需求。
![]()
TRELLIS.2項目介紹視頻
SAM 3D 和 TRELLIS.2 則分別代表了三維視覺向通用化和生成式建模擴展的兩種路徑。SAM 3D 關注自然圖像中的真實物體,需要處理遮擋、背景干擾、不可見表面和復雜布局。模型不僅要恢復可見幾何,還要依賴大規模數據中學習到的先驗補全缺失結構。TRELLIS.2 則將問題推進到更底層的表示空間:如果三維對象無法被穩定壓縮、編輯和導出,再強的生成模型也難以真正落地。網格、體素、點云、隱式場和高斯基元各有優勢,結構化潛空間的設計因此成為三維生成能否繼續擴展的關鍵。
3DReflecNet 則把視線重新拉回真實世界。透明、反射和低紋理物體長期以來都是三維重建的薄弱環節。玻璃、鏡面和金屬表面會破壞光度一致性,純色表面又缺少穩定特征。這些問題很難通過單純擴大模型規模解決,必須依賴更具針對性的數據和評測體系。把這些論文放在一起,可以看到一條逐漸成形的技術棧:上游是復雜場景和真實數據,中間是結構化表示與規模擴展,下游是動態重建和可交互應用。三維視覺的終點已經不再是生成一張更加精細的點云,而是建立能夠被智能體理解、預測和操作的空間表征。
Diffusion 無處不在:生成模型正在變成視覺基礎設施
Diffusion 仍然是 CVPR 2026 最重要的技術關鍵詞之一。但它的影響力已經溢出傳統圖像生成,開始進入三維資產建模、單步圖像編輯、移動端散景渲染和推理鏈路優化。Diffusion 正在從一種特定模型,逐漸變成視覺系統中的通用計算框架。
![]()
PixelDiT生成圖像示例
PixelDiT 重新打開了像素空間生成這條路線。當前主流生成模型通常依賴 VAE,先將圖像壓縮到潛空間,再完成去噪和解碼。這樣做可以降低計算成本,但也會引入細節損失和誤差積累。PixelDiT 直接在像素空間建模,試圖擺脫傳統兩階段鏈路對圖像質量的約束。SeaCache 則關注擴散模型的另一個核心問題:為什么推理仍然如此緩慢。逐步去噪意味著大量重復計算,不同時間步之間并非所有特征都需要重新生成。通過識別可以安全復用的中間表示,SeaCache 將注意力從重新訓練模型轉向更精細地優化現有推理鏈路。
![]()
ChordEdit編輯圖像示例
ChordEdit 和 MagicBokeh 則展示了 Diffusion 在具體視覺任務中的外溢能力。ChordEdit 將圖像編輯重新組織為低能量傳輸問題,希望在單步推理中同時保留原始結構和編輯效果。MagicBokeh面向移動計算攝影,將超分辨率、深度估計和散景渲染整合進統一框架。TRELLIS.2 進一步將這種影響延伸到三維生成,使擴散模型能夠在更加緊湊的結構化潛空間中生成可用的三維資產。
這一組論文說明,生成模型研究已經進入更加成熟的階段。下一步競爭的重點不再只是生成質量,而是整個系統是否足夠直接、穩定、高效,并且能夠嵌入真實應用。Diffusion 已經不再是一個獨立賽道,而正在成為視覺基礎設施。
高效學習:真正需要減少的是無效計算
除了 3D 和 Diffusion,今年還有一組候選論文值得單獨討論。它們沒有共同使用某一種模型,卻在回答同一個問題:視覺系統中究竟有多少計算是可以被省略的。
傳統模型壓縮通常圍繞剪枝、量化、蒸餾和低秩分解展開。完整模型先被訓練出來,再通過工程手段逐步縮小。NuWa、ViT3、Mapping Networks 和 Rethinking Dataset Distillation 則將問題向前推進了一步:模型從一開始是否就應該針對具體任務設計,推理過程中是否能夠動態適應輸入,權重空間能否被重新參數化,數據壓縮的評測方式是否可靠。
![]()
NuWa模型結構圖
NuWa的出發點非常現實。很多邊緣設備并不需要識別所有類別。工業相機、無人機和車載模塊往往只服務于有限任務。既然設備需求本身具有明確邊界,就沒有必要保留完整模型中的全部知識。ViT3 重新劃分了訓練與推理的邊界。傳統視覺模型完成訓練后,參數基本固定,而 Test-Time Training 允許模型根據當前輸入進行輕量級適應。對于長序列和復雜上下文而言,這意味著模型不必提前存儲所有可能用到的信息,而可以在現場更新內部狀態。
Mapping Networks 從參數空間本身入手。它假設大型神經網絡的有效參數空間可能位于低維流形附近。與其直接優化海量權重,不如訓練一個更加緊湊的潛變量,再通過映射關系生成目標參數。Rethinking Dataset Distillation 則把矛頭對準評測體系本身。數據集蒸餾希望使用極少量樣本替代完整訓練集,但如果軟標簽已經攜帶了大量監督信息,那么性能提升究竟來自數據選擇,還是來自額外注入的知識,就必須重新拆解。
這組論文重新定義了效率。效率不只是讓模型變小,也不只是讓推理更快。它還包括移除與任務無關的知識、減少重復計算、壓縮權重表達空間,以及檢查評測協議中是否存在被忽略的信息泄漏。真正需要被壓縮的,不只是參數,而是整個系統中的無效部分。
從感知到行動:視覺模型也需要接受審計
NitroGen 和 Black-box Membership Inference Attacks on the Pre-training Data of Image-generation Models 看起來屬于完全不同的領域。一篇討論通用游戲智能體,另一篇討論生成模型的訓練數據審計。但它們其實指向同一個變化:視覺模型正在從單一工具變成開放環境中的系統。
![]()
NitroGen模型結構
NitroGen 的邏輯并不復雜。互聯網上已經積累了大量游戲視頻,其中包含豐富的視覺信息和動作序列。這些數據過去主要服務于娛樂內容傳播,很少被系統性用于訓練通用智能體。當模型開始從跨游戲視頻中學習視覺到動作的映射,游戲環境就不再只是 benchmark,而是智能體訓練場。不同游戲具有不同畫面風格、物理規則、動作空間和任務目標。一個能夠在多種游戲之間遷移的模型,本質上是在學習更加通用的行為先驗。這種路徑對具身智能同樣具有啟發:真實機器人數據昂貴、稀缺,并且伴隨設備成本和安全風險。虛擬環境無法替代真實世界,卻可以為感知、控制和跨任務遷移提供規模更大的訓練基礎。
模型能力越強,審計問題就越重要。圖像生成模型通常依賴大規模互聯網數據訓練。對于閉源平臺而言,外部用戶無法查看訓練集,也無法訪問內部參數。Black-box Membership Inference Attacks 研究的是一個非常現實的問題:在僅有黑盒調用權限的條件下,能否判斷某張圖像是否進入過模型預訓練數據。這類研究不只是為了發現漏洞,也關系到版權保護、隱私治理和訓練數據追蹤。
未來的視覺基礎模型需要同時接受兩類評價。一類評價模型是否足夠強,包括生成質量、三維理解、推理效率和動作能力;另一類評價模型是否足夠可信,包括數據來源、版權邊界、隱私風險和外部可驗證性。視覺模型正在走向行動,也正在走向審計。回看今年的三篇獲獎工作,D4RT、SAM 3D 和 NitroGen 分別落在動態空間建模、真實世界三維重建和通用視覺動作模型上。它們并不是孤立的例外,而是恰好對應了同一條演進路徑。計算機視覺正在從完成單一任務的算法,逐漸演變為能夠感知、生成、行動和接受審計的系統。
![]()
Best Paper Finalists 研究方向
CVPR 2026 的獎臺上,沒有一篇工作是靠堆參數或刷榜取勝的。Best Paper D4RT 贏在了對問題本質的重新定義;SAM 3D 贏在了數據規模與訓練范式的雙重突破;NitroGen 贏在了將具身智能與互聯網規模數據結合的正確時機。而貫穿這一切的,是華人研究者在計算機視覺領域無處不在的身影。
本報告基于 15 篇 Best paper list、CVPR 2026 官網、OpenReview、Google Scholar 及全網公開信息整理,部分數據為估算,如有出入歡迎指正。
加入ZF討論群,請先添加小助手微信
我們相信認知能夠跨越階層,
致力于為年輕人提供高質量的科技和財經內容。
稿件經采用可獲邀進入Z Finance內部社群,優秀者將成為簽約作者,00后更有機會成為Z Finance的早期共創成員。
我們正在招募新一期的實習生
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.