![]()
作者團隊來自 Beihang University、Zhongguancun Academy、Communication University of China 和 KAUST,研究方向涵蓋紅外目標檢測、多模態感知與復雜環境視覺。豐子超、朱昊東為共同第一作者,徐昇為通訊作者。
在討論 RGB-IR 目標檢測時,「兩種模態互補」幾乎是默認前提。RGB 擅長保留紋理和顏色,紅外圖像在弱光條件下更穩定,于是最直接的路線是搭建雙分支網絡,讓它們在中間層不斷交換信息。
InfraNet 的出發點卻來自一個不太符合這一直覺的現象。
作者在 M3FD 夜間樣例上查看了不同網絡的中間特征。純 IR 分支仍能把響應集中在車輛和行人附近;RGB 分支已經出現大面積背景噪聲。更值得注意的是,一些融合模型得到的特征并沒有比 IR 更干凈,反而帶入了額外激活。
![]()
夜間條件下 RGB、IR 與多種融合特征的可視化。RGB 退化后,融合結果可能引入額外噪聲。
這組觀察把問題從「怎樣融合更多信息」改成了另一個問題:當輔助模態開始失真,網絡有沒有必要繼續把它當作可靠輸入
論文提出的 InfraNet,不是為兩條分支設計一次更充分的對稱融合,而是把 RGB-IR 檢測中的訓練和部署重新拆開討論。
![]()
- 論文標題:InfraNet: Quality-Aware RGB Guidance for Efficient Infrared Object Detection
- 論文鏈接:https://arxiv.org/abs/2607.03795
- 作者:Zichao Feng, Haodong Zhu, Jingying Yang, Sheng Xu, Yangyang Ren, Yuguang Yang, Xuhui Liu, Juan Zhang, Tian Wang, Linlin Yang, Baochang Zhang
- 單位:Beihang University; Zhongguancun Academy; Communication University of China; King Abdullah University of Science and Technology (KAUST)
兩個經常被綁在一起的假設
常規雙模態檢測通常同時接受兩項設定:
- RGB 與 IR 在每個樣本上都能互補;
- 兩種傳感器在部署時始終可用。
第一項會在夜間、霧天或強眩光條件下動搖,第二項則直接限制了模型的部署方式。即使 RGB 已經模糊、過曝,或者某些場景只提供紅外圖像,雙流檢測器仍要求兩路輸入共同完成推理。
InfraNet 將這兩個假設分離:RGB 可以在訓練階段提供額外結構線索,但是否保留到推理階段,應由具體部署條件決定。紅外分支因此被固定為主路徑,RGB 分支則承擔受控輔助的角色。
基于這一思路,論文分別訓練了兩個網絡,而不是讓同一個模型臨時切換模式:
- InfraNet-IR在訓練時讀取成對的 RGB 與 IR 圖像,推理時刪除 RGB 分支和全部融合模塊,最終是一個純紅外檢測器;
- InfraNet-RGB-IR保留兩條路徑,面向 RGB 與 IR 均可穩定提供的場景。
![]()
InfraNet-IR 的訓練與推理路徑。訓練階段引入 RGB 輔助分支,部署時僅保留 IR 主路徑和檢測頭。
這樣的區別并非簡單的「完整版」和「裁剪版」。InfraNet-IR 從訓練目標開始就要求最終預測能力落在 IR 路徑上,RGB 只負責幫助這條主路徑形成更好的表示。
QualGate 不估計畫質,而是控制干預
如果 RGB 只是訓練期輔助信號,接下來的問題是:它應該以多大強度進入紅外分支?
InfraNet 的核心模塊 QualGate 為每個融合位置預測一個標量控制信號 q。這個量由檢測任務端到端學習,不需要額外的圖像質量標簽,也不被解釋為通用的清晰度分數。它只回答一件事:當前 RGB 特征對檢測訓練到底有多大幫助。
QualGate 的控制分成兩個同步方向:
- 當 q 較低時,RGB contribution 被壓低,減少退化特征向主路徑傳播;
- 同時提高 IR 注入強度,在輔助信息變弱時補足紅外表示。
![]()
QualGate 結構。標量控制信號同時作用于 RGB suppression 和 IR amplification。
這兩個方向看起來簡單,但論文的消融結果顯示,它們并不能彼此替代。在 LLVIP 的 YOLOv8 InfraNet-IR 設置下,完整 QualGate 的 mAP 為 68.8;移除 IR amplification 后降至 67.2,取消 RGB suppression 后為 68.4,而把控制量固定為 1 的樸素版本為 67.7。
換言之,收益并不只是來自「給特征乘一個權重」,而是來自一組配套動作:減少不可信輔助信號,同時保證主模態不會跟著變弱。
人為破壞 RGB 后,網絡是否真的更穩?
為了排除模型只是在正常數據上碰巧獲得收益,論文固定 IR 輸入,單獨對 RGB 施加霧化和亮度擾動。
在最強霧化等級下,帶可靠性控制的模型仍保持 97.1 AP50 / 67.8 mAP;將 q 固定為 1 的樸素融合版本下降到 92.6 AP50 / 61.8 mAP。隨著霧化增強,學習得到的控制值也從 0.441 緩慢降到 0.434。
這個結果需要謹慎理解。q 不是一把「RGB 質量尺」,它在亮度擾動下并不一定單調變化;但作為檢測任務內部的控制量,它確實限制了嚴重退化 RGB 對訓練過程的干擾。
IR-only 的價值,要看部署賬本
論文在 LLVIP、FLIR-Aligned、M3FD 和 DroneVehicle 四個數據集上評估了兩種 InfraNet。除了最終精度,M3FD 上的一組對照更能說明 IR-only 設置的目的。
![]()
InfraNet-IR 相比同結構 IR baseline 提升 1.4 AP50 和 1.8 mAP,而參數量、推理時間沒有變化。額外的 RGB 分支只存在于訓練階段,并未轉化為部署負擔。若現場能夠穩定獲得雙模態輸入,則可選擇精度更高的 InfraNet-RGB-IR。
在其他數據集上,論文報告的代表性結果包括:LLVIP 上 YOLOv8 的 RGB-IR 與 IR-only 版本分別達到 70.5 和 68.8 mAP;FLIR-Aligned 上 YOLOv5 兩個版本分別達到 89.5 和 88.1 mAP50;DroneVehicle 上 YOLOv12 InfraNet-IR 達到 84.7 AP50 / 63.9 mAP。
從檢測框回到特征響應
M3FD 的定性結果提供了另一層證據。與 SuperFusion、TarDAL、CFT 和 FusionMamba 相比,InfraNet-IR 在多種照明條件下減少了部分重復框和背景誤檢,定位更接近標注結果。
![]()
M3FD 上不同方法的檢測結果。InfraNet-IR 在夜間與復雜照明條件下保持較穩定的定位。
在中間特征中,InfraNet-IR 的高響應區域也更集中于目標本身,而不是道路、燈光或遠處建筑。需要強調的是,這些響應來自已經完成 RGB 輔助訓練的 IR 模型;真正部署時,輸入仍然只有紅外圖像。
![]()
M3FD 夜間樣例的特征診斷。InfraNet-IR 的目標響應更加集中,背景激活相對較少。
這項工作的邊界在哪里?
InfraNet 并沒有否定 RGB 的價值。白天或成像條件良好時,RGB 仍能補充紅外圖像缺少的紋理與顏色信息;這也是 InfraNet-RGB-IR 被保留的原因。
它所質疑的是另一種默認做法:只要有兩種模態,就在訓練和部署中始終對稱地依賴它們。對于輸入質量會隨環境劇烈變化的系統,更現實的設計也許不是追求永久融合,而是先明確主模態,再決定輔助信息何時進入、以多大強度進入,以及它是否需要留到部署階段。
從這個角度看,InfraNet 的主要貢獻并不只是一個門控模塊。它給 RGB-IR 檢測增加了一條新的設計軸:模態之間不僅有信息互補關系,也有可靠性和部署責任的差異
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.