![]()
在多模態大模型(MLLM)時代,讓模型看懂一張圖早已不是難事,但要讓它真正想清楚一張圖,做多步的空間感知、幾何分析與邏輯推斷,卻依然存在困難。
為了解決這種「看得到卻想不對」的現象,研究界給推理鏈里塞進了視覺信息:一種是顯式生成中間圖像(如 Anole、ThinkMorph),效果理想,但算力開銷高;另一種是隱式隱空間推理(如 Mirage、LVR),試圖直接在特征空間里「一步」定位出目標區域,結果常常精度崩塌、注意力關注在無關的背景上。
針對這一挑戰,騰訊內容服務部 BAC 提出了一個名為ProLaViT(Progressive Latent Visual Thought)的全新框架。它的核心思想是:別急著下結論,先在連續隱空間里像人一樣「步步推導」。 即讓模型遵循「定位 → 聚焦 → 分離」(Locate → Focus → Isolate)的因果鏈,逐步收緊視覺注意力,最終精準鎖定目標。
該論文已被 ECCV 2026 接收。
![]()
- 論文地址:https://arxiv.org/abs/2607.02907
- Github 地址:https://github.com/TencentBAC/ProLaViT
- 項目主頁:https://tencentbac.github.io/ProLaViT/
- Huggingface 地址:https://huggingface.co/collections/TencentBAC/prolavit
現有路線的問題:
顯式生成太貴、隱式推理太飄
如下圖所示,把視覺信息引入推理鏈的現有路線各有硬傷:
1. 純文本 CoT:模態鴻溝。 讓模型把推理一步步寫成文字。問題在于,文本本質上是抽象的,天然丟失細粒度的空間關系。于是模型把「電視下方的家具」腦補成了「木地板」,邏輯通順,結果卻是錯的。
2. 一步隱空間預測:精度崩塌。 想跳過文本,直接在隱空間里一次性指出目標區域。但單步預測往往超出了模型的表征容量,結果就是注意力跑偏,脆弱的表征最終導致錯誤答案。
ProLaViT 的答卷很干脆:既不畫像素,也不瞎猜,而是在「結構化隱空間」里做漸進式推導。 把一道復雜的視覺題拆成一條隱式思維鏈,讓每一步只往前走一小步。
![]()
不請「外援」:
模型自己的眼睛,就是最好的老師
訓練多步隱空間模型有個繞不開的難題:中間步驟沒有現成的「標準答案」圖像。 以往的方法只能去請外援,例如 SAM、DINO、DepthAnything 這些外部視覺專家來當老師。然而,這樣做往往帶來域偏移和工程復雜度的問題。
ProLaViT 的做法是:內生自蒸餾(Endogenous Self-Distillation)。 不請外人,直接拿 MLLM 預訓練視覺編碼器當老師。
![]()
上述方案具體怎么做?關鍵在于一條可編程合成流水線(Programmatic Synthesis Pipeline)
![]()
![]()
- 再用一次跨模態注意力,把 LLM 生成的隱式思維對齊到教師特征上,最小化蒸餾損失:
![]()
這么一來,模型在訓練時就把漸進式視覺證據內化進了自己的隱空間,推理時完全不需要任何外部工具。
兩套「思維套路」:
空間題靠定位,邏輯題靠思辨
ProLaViT 把推理拆成一條隱式思維鏈,并針對不同任務設計了兩種范式。
![]()
套路一:由粗到細因果鏈(Coarse-to-Fine Causal Chain)。 面向視覺搜索、目標定位等空間任務,走 「定位 → 聚焦 → 分離」 的路子,注意力一步步聚焦:
![]()
套路二:辯證推理鏈(Dialectical Reasoning Chain)。 面向拼圖復原這類邏輯任務,走 「假設 → 批判 → 驗證」(Hypothesize → Critique → Verify) 的反事實思辨路線:
![]()
每一步都由 LLM 嵌入空間里的一組可學習 token 表示。
防止「思路打結」:
距離加權多樣性損失
多步隱空間推理有個常見問題,即隱空間坍縮(Latent Collapse):后續步驟的表征越來越相似,隱式思維鏈發生退化。
作者借鑒度量學習,提出距離加權多樣性損失(Distance-Weighted Diversity Loss)。先用一個帶間隔的形式,允許隱式思維鏈的 hidden state 合理相似、只懲罰過度坍縮:
![]()
除此之外,更關鍵的洞見是:因果距離越遠的兩步,越應該彼此不同。 于是給每對步驟加上一個距離權重:
![]()
![]()
這樣既尊重了推理鏈的層級結構,相鄰步保留適度相似以延續語境,遠端步被強制拉開,又有效防住了表征坍縮。
![]()
跑分見真章:
準、穩,還看得見「想法」
作者基于 Qwen2.5-VL-7B-Instruct 實現 ProLaViT,在 MMVP、VisPuzzle、VStar、ChartQA、BLINK、CV-Bench 等一系列的視覺推理基準上做了廣泛測試。
![]()
1. 準。 ProLaViT(完整版,帶距離加權多樣性損失)拿下了75.11% 的最高平均準確率,全面超越基線。相比「一步隱空間預測」,在 VisPuzzle(+2.25%)和 BLINK-Jigsaw(+10.00%)這類復雜任務上提升尤為顯著。
2. 穩。 ProLaViT 靠內生自蒸餾保持域一致性,在 ChartQA 上穩穩拿下78.99%。在最考驗邏輯驗證的 BLINK-Jigsaw 上,更是相比基座模型暴漲 +16.67%,驗證了「假設 → 批判 → 驗證」辯證范式的有效性。
3. 可解釋。 作者把各推理步 token 表征的余弦相似度畫成熱力圖:
![]()
![]()
消融實驗
漸進式分解不可或缺。 把所有視覺線索壓進單個隱狀態的「一步預測」存在明顯瓶頸;換成 ProLaViT 的多步推導后,ChartQA +15.97%、BLINK-Jigsaw +10.00%,平均 +7.45%。復雜視覺推理確實會壓垮單一隱狀態,而結構化鏈能把認知負擔分攤開。
![]()
內生 vs. 外生蒸餾。 把原生視覺編碼器換成外部專家:DINOv2(判別式)尚能打,但在 VStar 等細粒度感知上落后;SDXL-VAE(生成式)在 VisPuzzle 上災難性失敗。作者推測原因是 VAE 隱空間為像素重建而生,幾何與空間邏輯被壓成了噪聲。原生編碼器提供的才是天然對齊的監督信號。
![]()
推理步順序至關重要。 把四步順序隨機打亂后,平均 下降 6.24%,VisPuzzle(-6.25%)和 CV-Bench(-8.52%)。沒先建立全局上下文就直接做細粒度分割,違背了信息的自然流向,即漸進式因果結構是有效視覺推理的根本前提。
![]()
展望
ProLaViT 提出了一種「結構化隱空間漸進推導」的視覺推理新范式。它打破了「顯式生成太貴、隱式推理太飄」的兩難,用內生自蒸餾讓模型從可編程合成數據中內化算法級精度、擺脫對外部視覺專家的依賴,再用距離加權多樣性損失緩解隱空間坍縮,讓每一步思維都獨特而遞進。
這項工作不僅在視覺搜索、拼圖復原等重感知基準上取得了有競爭力的結果,更重要的是,它把推理從離散的文本空間搬進了連續的結構化隱空間,為彌合困擾傳統思維鏈的模態鴻溝提供了一條兼顧準確率、可解釋性與效率的可行路徑。面向未來,把這種結構化隱式推導拓展到視頻時序推理、引入更復雜的幾何變換,將為更通用、更可解釋的多模態智能鋪平道路。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.